দীর্ঘ গবেষণা: সমস্যা একটি একক প্রশ্নে নয়
একটি স্বায়ত্তশাসিত গবেষক সাধারণ চ্যাট-এজেন্টের চেয়ে ভিন্ন বাস্তবতায় বাস করে। তাকে হাইপোথিসিস তৈরি করতে হয়, তা যাচাই করতে হয়, ভুল খুঁজে বের করতে হয়, স্ক্রিপ্ট আবার লিখতে হয়, পরীক্ষা চালাতে হয় এবং কখনও কখনও মডেলের আগের সংস্করণে ফিরে যেতে হয়। এই চক্রটি ঘন্টার পর ঘন্টা ধরে চলতে পারে, এবং প্রতিটি ধাপের মূল্য শুধুমাত্র শেষে স্পষ্ট হয়।
বেশিরভাগ অটোরিসার্চ-এজেন্টের ক্ষেত্রে এটি কঠিন। ধারাবাহিকতার প্রক্রিয়া প্রায় নেই: যদি একটি পরীক্ষা অচলাবস্থায় পৌঁছায়, এজেন্ট জানে না কীভাবে হারানো সুতোটি পুনরুদ্ধার করতে হয়। বর্তমান ফলাফল কতটা কার্যকর তার উপর ভিত্তি করে গণনা পুনর্বণ্টনের কোনো ফাংশনও নেই। ফলস্বরূপ, অনুসন্ধানটি ঢিলেঢালা হয়ে যায়, গণনামূলক সম্পদ নষ্ট হয় এবং কাজটি শেষ পর্যন্ত পৌঁছে দেওয়ার সম্ভাবনা কমে যায়।
নতুন পদ্ধতিটি কীভাবে কাজ করে
এই সমস্যাগুলিই সমাধান করে ScienceFlow ফ্রেমওয়ার্ক। এর লেখক — ১৯ জন গবেষকের একটি দল — স্বায়ত্তশাসিত বৈজ্ঞানিক পরীক্ষার জন্য একটি এন্ড-টু-এন্ড আর্কিটেকচার উপস্থাপন করেছেন। এজেন্ট "একটি প্রম্পটে" কাজ করে না: এটি একটি দীর্ঘ গবেষণা ট্র্যাজেক্টোরি তৈরি করে।
ভিতরে, কাজটি গবেষণা সেগমেন্টে বিভক্ত। প্রতিটি সেগমেন্ট একটি এক্সিকিউটেবল ওয়ার্কস্পেসের সাথে সংযুক্ত: সেখানে স্ক্রিপ্ট, ডেটা এবং পরিবেশ থাকে। গবেষণার অগ্রগতি হল বিক্ষিপ্ত টেক্সট নোট নয়, বরং একটি পুনরুদ্ধারযোগ্য এক্সিকিউটেবল অবস্থা। এই অবস্থাটি ডিস্ক থেকে "উঠিয়ে আনা" যায়, পুনরায় গবেষণা করা যায়, পুনরায় একত্রিত করা যায় এবং আবার চালানো যায়। এর ফলে, এজেন্ট সহজেই আগের বিন্দুতে ফিরে আসতে পারে এবং অন্য একটি শাখা চেষ্টা করতে পারে, শুরু থেকে সবকিছু না করে।

ESTRA: কীভাবে পরবর্তী মোড় নির্বাচন করবেন
মূল বিবরণ হল ESTRA (Executable-State Transition through Re-Anchoring) প্রক্রিয়ার মাধ্যমে অবস্থার মধ্যে রূপান্তর। প্রতিটি ধাপে, এজেন্ট দুই ধরনের অবস্থা দেখে: সক্রিয়, যেখানে এখনই চালিয়ে যাওয়া যায়, এবং সংরক্ষণাগারভুক্ত, যা ইতিমধ্যে কিছু ফলাফলের দিকে নিয়ে গেছে। কিন্তু এটি কেবল একটি নতুন বিন্দু নয়, বরং আরও অগ্রগতির জন্য একটি নোঙর বেছে নেয়। তারপর এটি একটি পরিস্থিতি নির্ধারণ করে: এই অবস্থা থেকে চলতে থাকবে নাকি গবেষণাকে অন্য দিকে পরিচালিত করবে।
এই পদ্ধতিটি দীর্ঘ পরীক্ষার প্রধান সমস্যা দূর করে — "আটকে যাওয়া" এজেন্টের প্রভাব, যা কীভাবে ফিরে যেতে হয় তা না জানার কারণে একটি প্রতিশ্রুতিহীন শাখায় গভীরভাবে ডুবে থাকতে থাকে।
ফলাফল-সচেতন এক্সিকিউশন কন্ট্রোলার
ফ্রেমওয়ার্কের আরেকটি স্তর হল নিশ্চিত ফলাফল-সচেতন কন্ট্রোলার। এটি তিনটি বিষয়ের উপর ভিত্তি করে পৃথক গণনামূলক কাজের মধ্যে সম্পদ বণ্টন করে: ক্ষমতার প্রাপ্যতা, অবশিষ্ট বাজেট এবং ইতিমধ্যে নিশ্চিত অগ্রগতি। যদি কোনো দিক পরিমাপযোগ্য ফলাফল দেওয়া বন্ধ করে দেয়, কন্ট্রোলার তার অংশ কমাতে পারে এবং সম্পদ সেখানে পুনঃনির্দেশিত করতে পারে যেখানে প্রকৃত অগ্রগতি দৃশ্যমান। এটি একটি "লোভী" টাস্ক শিডিউলার নয়, বরং লক্ষ্যের মধ্যে সামগ্রিক কৌশল ধরে রাখার একটি উপায়।
পরীক্ষাগুলি কী দেখিয়েছে
পরীক্ষায়, ফ্রেমওয়ার্কটি শুধুমাত্র ক্লাসিক্যাল মেশিন লার্নিংই নয়, বৈজ্ঞানিক মডেলিং এবং গাণিতিক অপ্টিমাইজেশনও কভার করেছে। প্রাপ্ত ফলাফলগুলি ইঙ্গিত দেয় যে সিস্টেমটি দীর্ঘ গবেষণা সেশনগুলি উত্পাদনশীলভাবে পরিচালনা করতে সক্ষম, সেগুলিকে সম্পর্কহীন ধাপের অসীম ক্রমে পরিণত না করে।
সবচেয়ে উল্লেখযোগ্য ফলাফল — ২৪-ঘন্টার বাজেটের মধ্যে সম্পূর্ণ MLE-bench-এ: Any-Medal মেট্রিকে ৭০.২২%। এটি পূর্বে প্রকাশিত সূচকগুলির চেয়ে ৪.৯২ শতাংশ পয়েন্ট বেশি। যেহেতু MLE-bench বাস্তব মেশিন লার্নিং পরিস্থিতি পরীক্ষা করে, এটি একটি শক্তিশালী সংকেত: প্রক্রিয়ার স্থিতিস্থাপকতা কখনও কখনও মডেলের প্রাথমিক বুদ্ধিমত্তার চেয়ে বেশি গুরুত্বপূর্ণ।

স্বায়ত্তশাসিত বিজ্ঞানের জন্য এর অর্থ কী
নিবন্ধের লেখকরা একটি গুরুত্বপূর্ণ সিদ্ধান্তে পৌঁছেছেন: স্বায়ত্তশাসিত গবেষণা স্কেল করার জন্য, অবস্থা ব্যবস্থাপনা, অভিযোজিত অনুসন্ধান এবং লক্ষ্যের সাথে সামঞ্জস্যপূর্ণ সম্পাদন অত্যন্ত গুরুত্বপূর্ণ। শুধুমাত্র সুন্দরভাবে যুক্তি করার ক্ষমতা যথেষ্ট নয় — এমন একটি পরিকাঠামো প্রয়োজন যা এজেন্টকে আগের অর্জন হারাতে না দেয় এবং সময়মতো ঘুরে দাঁড়াতে সাহায্য করে।
দেখে মনে হচ্ছে, এটি LLM-সহায়ক থেকে প্রকৃত স্বায়ত্তশাসিত গবেষণা ব্যবস্থার দিকে পরবর্তী পদক্ষেপ। দীর্ঘ দিগন্তে কাজ করা "মডেলের সাথে সংক্ষিপ্ত সংলাপ" হওয়া বন্ধ করে একটি প্রকৌশলগত চ্যালেঞ্জে পরিণত হয়: কীভাবে এমন একটি প্রক্রিয়া তৈরি করা যায় যেখানে পরীক্ষার প্রতিটি সংস্করণ অ্যাক্সেসযোগ্য থাকে, প্রতিটি ফলাফল যাচাই করা হয় এবং প্রতিটি পরবর্তী পদক্ষেপ নিশ্চিত অগ্রগতি থেকে উদ্ভূত হয়।



