প্রথম পরীক্ষা সুপারইন্টেলিজেন্সের পথে: ASI-Bench বেঞ্চমার্ক কী দেখাল

26 আগস্ট 2026৩০ প্রদর্শন

নতুন একটি বেঞ্চমার্ক পরীক্ষা করেছে আধুনিক AI কতটা স্বাধীনভাবে বৈজ্ঞানিক প্রকল্প পরিচালনা করতে পারে, এবং ফলাফলটি অপ্রত্যাশিত ছিল: মানুষের স্পষ্ট নির্দেশনা ছাড়া মডেলগুলোর কার্যকারিতা লক্ষণীয়ভাবে কমে যায়।

প্রথম পরীক্ষা সুপারইন্টেলিজেন্সের পথে: ASI-Bench বেঞ্চমার্ক কী দেখাল

আধুনিক বড় ভাষার মডেলগুলো এমন কাজে দারুণ পারদর্শী যেখানে বিদ্যমান মানব জ্ঞান মনে করা এবং প্রয়োগ করা প্রয়োজন। কিন্তু সত্যিকারের বুদ্ধিমান সিস্টেমকে শেখার সীমানা ছাড়িয়ে যেতে সক্ষম হতে হবে: এমন প্রশ্ন তুলতে হবে যা কেউ আগে জিজ্ঞাসা করেনি, এবং অনুমানকে যাচাইযোগ্য বৈজ্ঞানিক ফলাফলে রূপান্তর করতে হবে। এই ক্ষমতাটিই — আরও স্পষ্ট করে বললে, বর্তমান AI-তে এর অনুপস্থিতি — পরিমাপ করার সিদ্ধান্ত নিয়েছে ASI-Bench নামের নতুন একটি বেঞ্চমার্ক।

জ্ঞান পুনরুৎপাদন থেকে নতুন জ্ঞান সৃষ্টি

গবেষকরা অনেক আগেই লক্ষ্য করেছেন যে আধুনিক মডেলগুলো মানুষের তৈরি বিশাল ডেটা ভান্ডার থেকে তথ্য সংকুচিত ও সংযুক্ত করতে প্রশিক্ষিত। তবে লেখকদের ধারণায় সুপারইন্টেলিজেন্স কেবল আরও শক্তিশালী "পুনর্ব্যাখ্যাকারী" নয়, বরং এমন একটি সিস্টেম যা স্বাধীনভাবে অজানা বিষয় অনুসন্ধান করতে এবং নতুন জ্ঞান উৎপাদন করতে সক্ষম। ঐতিহ্যবাহী পরীক্ষাগুলো প্রায় সবসময়ই যাচাই করে যে মডেলটি শেখা তথ্য কতটা নির্ভুলভাবে পুনরুৎপাদন করে এবং সে মানুষের বিস্তারিত নির্দেশনা অনুসরণ করতে সক্ষম কিনা। তারা মূল প্রশ্নের উত্তর দেয় না: AI কি স্বাধীন বিজ্ঞানীর মতো কাজ করতে পারে?

এই পরিস্থিতিতে একটি মৌলিকভাবে ভিন্ন হাতিয়ারের প্রয়োজন ছিল যা মূলত বৈজ্ঞানিক সৃজনশীলতা এবং স্বায়ত্তশাসন যাচাই করবে — এবং এই দিকে প্রথম পদক্ষেপ নিয়েছে ASI-Bench

বেঞ্চমার্কের কাঠামো

নতুন পরীক্ষাটি তৈরি করতে ৪০ জনেরও বেশি বিশেষজ্ঞের যৌথ প্রচেষ্টায় ৩১,০০০-এর বেশি মানব-ঘণ্টা লেগেছে। ফলস্বরূপ, বেঞ্চমার্কে ১১টি বৈজ্ঞানিক ক্ষেত্র থেকে ৬০টি প্রকল্প-ভিত্তিক গবেষণা কাজ অন্তর্ভুক্ত হয়েছে — প্রাকৃতিক বিজ্ঞান থেকে প্রকৌশল শাখা পর্যন্ত। প্রতিটি কাজ একটি ছোট গবেষণা প্রকল্পের মতো সাজানো, যেখানে প্রাথমিক অনুমান থেকে যাচাইযোগ্য ফলাফল পর্যন্ত কাজ করতে হয়।

ASI-Bench-এর মূল বৈশিষ্ট্য হলো পদ্ধতিগত সহায়তার ধাপে ধাপে হ্রাস। প্রতিটি কাজের জন্য লেখকরা নির্দেশনার বেশ কয়েকটি স্তর প্রস্তুত করেছেন: সর্বাধিক বিস্তারিত নির্দেশনা থেকে, যেখানে প্রতিটি ধাপ বর্ণিত, এমন একটি সেটআপ পর্যন্ত যেখানে এজেন্টকে নিজেই পদ্ধতি বেছে নিতে হবে এবং এমনকি গবেষণার দিকনির্দেশনা নির্ধারণ করতে হবে। এইভাবে, পরীক্ষাটি দেখতে দেয় যে AI মানুষের ইঙ্গিত ছাড়া কতদূর যেতে প্রস্তুত।

ত্রুটি এবং উত্তর "মুখস্থ করা" বাদ দিতে, সমস্ত কাজ বহু-স্তরের যাচাইয়ের মধ্য দিয়ে যায়: বিশেষজ্ঞ পর্যালোচনা, অন্য AI সিস্টেমের মাধ্যমে অডিট, বিচ্ছিন্ন স্যান্ডবক্সে নির্বাহ এবং স্কোর গণনার ফলাফলের পৃথক বৈধতা। এটি ফলাফলগুলিকে সাধারণ পরীক্ষার তুলনায় আরও নির্ভরযোগ্য করে তোলে।

প্রথম ফলাফল: মানুষের উপর নির্ভরতা

লেখকরা state-of-the-art স্তরের ১৮টি "এজেন্ট-মডেল" কনফিগারেশন কাজের সব স্তরে চালিয়েছেন। ফলাফলগুলো নির্দেশক। সম্পূর্ণ পদ্ধতিগত নির্দেশনার সময় গড় স্কোর ছিল ৫০.৯১, কিন্তু এজেন্টকে কেবল পদ্ধতি দেওয়া হলে — ইতিমধ্যে ২৯.১০। যখন মডেলটিকে নিজেই পদ্ধতি নির্ধারণ করতে হতো, স্কোর ২৬.৬২-এ নেমে আসে।

এই তীব্র পতন ইঙ্গিত দেয় যে এমনকি সবচেয়ে আধুনিক সিস্টেমগুলোও মানুষের বিস্তারিত নির্দেশনা ছাড়া সম্পূর্ণ বৈজ্ঞানিক গবেষণা পরিচালনার জন্য এখনও প্রস্তুত নয়। তারা স্পষ্টভাবে নির্ধারিত ধাপগুলো সম্পাদনে শক্তিশালী, কিন্তু উদ্যোগ নেওয়ার প্রয়োজন হলে লক্ষণীয়ভাবে বিভ্রান্ত হয়ে পড়ে। এটি তাদের জন্য একটি গুরুত্বপূর্ণ সংকেত যারা সুপারইন্টেলিজেন্সের দ্রুত আবির্ভাব আশা করেন: জ্ঞান পুনরুৎপাদনের ক্ষেত্রে অগ্রগতি স্বায়ত্তশাসিত বৈজ্ঞানিক অনুসন্ধানের অগ্রগতির সমান নয়।

উন্মুক্ত প্ল্যাটফর্ম এবং পরবর্তী পদক্ষেপ

বিকাশকারীরা ASI-Bench-কে বৈজ্ঞানিক সম্প্রদায়ের জন্য উন্মুক্ত করেছেন এবং বিশ্বজুড়ে গবেষকদের নতুন কাজ যোগ করার আমন্ত্রণ জানিয়েছেন। এটি ক্ষেত্র ও পরিস্থিতির সেট প্রসারিত করতে দেবে, বেঞ্চমার্ককে আরও সম্পূর্ণ করে তুলবে। উপরন্তু, পরীক্ষার উন্মুক্ততা AI সিস্টেমের অগ্রগতি গতিশীলভাবে ট্র্যাক করার সুযোগ দেয়: আজকের ফলাফল সম্ভবত ভবিষ্যতের মডেলগুলির সাথে তুলনার সূচনা বিন্দু হয়ে উঠবে।

এখনও কম স্কোর থাকা সত্ত্বেও, এই গবেষণার প্রধান ফলাফল হতাশা নয়, বরং এমন একটি হাতিয়ারের আবির্ভাব যা প্রথমবারের মতো AI-এর সেই "গবেষণামূলক" গুণ পরিমাপ করতে দেয়। এরপরের কাজ হলো — নতুন মডেল এবং এজেন্ট আর্কিটেকচারগুলো নির্দেশনাধীন নির্বাহ এবং স্বাধীন বৈজ্ঞানিক কাজের মধ্যে ব্যবধান কমাতে সক্ষম কিনা তা দেখা।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
প্রথম পরীক্ষা সুপারইন্টেলিজেন্সের পথে: ASI-Bench বেঞ্চমার্ক কী দেখাল