প্রশ্ন থেকে কাজে
বিদ্যমান ToM-বেঞ্চমার্কগুলো মূর্ত এজেন্টদের জন্য প্রায়শই একই কাঠামোতে তৈরি: এজেন্টকে একটি দৃশ্য দেখানো হয়, তারপর মানুষের বিশ্বাস ও উদ্দেশ্য সম্পর্কে প্রশ্ন করা হয় অথবা দৃশ্যকল্পের স্তরে পরবর্তী পদক্ষেপ ভবিষ্যদ্বাণী করতে বলা হয়। এই ধরনের পরীক্ষাগুলো মূলত ঘটনার পরে যুক্তি যাচাই করে, বাস্তব সময়ে পরিবর্তনশীল পরিবেশের সাথে মিথস্ক্রিয়া করার ক্ষমতা নয়। অন্যদিকে, নিরবচ্ছিন্ন উপলব্ধি এবং সময়োপযোগী প্রতিক্রিয়াই একজন সহায়ক সহকারীকে "পরীক্ষায় সঠিক উত্তর দেওয়া" অ্যালগরিদম থেকে আলাদা করে।
নির্ভুল হস্তক্ষেপের ক্লোজড-লুপ
নতুন MindHelper চ্যালেঞ্জ এই কাজটিকে একটি ক্লোজড-লুপে রূপান্তরিত করে। এজেন্টকে অবশ্যই ক্রমাগত পরিবেশ পর্যবেক্ষণ করতে হবে, দৃশ্যের প্রতিটি ব্যক্তি সম্পর্কে পৃথক বিশ্বাস বজায় রাখতে হবে, বুঝতে হবে কখন একজন ব্যক্তি সত্যিই সমস্যায় পড়েছেন, এবং শুধুমাত্র সেই মুহূর্তে একটি নির্দিষ্ট কাজ সম্পাদন করতে হবে। এর বিপরীত দিকটিও সমান গুরুত্বপূর্ণ: যদি হস্তক্ষেপের প্রয়োজন না হয়, তবে এজেন্টকে অবশ্যই নীরব থাকতে হবে এবং কিছুই করতে হবে না।
ভিত্তি হিসেবে নেওয়া হয়েছে পূর্ববর্তী রোবটকেন্দ্রিক MindPower পদ্ধতি, যেখানে যুক্তি "উপলব্ধি থেকে কর্ম" নীতিতে চলে। তবে নতুন দৃশ্যকল্পে এটি যথেষ্ট নয়: শুধু কী করতে হবে তা সঠিকভাবে সিদ্ধান্ত নেওয়াই নয়, আদৌ করা উচিত কিনা তাও সঠিকভাবে সিদ্ধান্ত নিতে হবে। এই নকশা বেঞ্চমার্কটিকে বাস্তব মিথস্ক্রিয়ার কাছাকাছি নিয়ে আসে, যেখানে অতিরিক্ত সাহায্য তার অনুপস্থিতির মতোই বিরক্তিকর হতে পারে।

MindClaw কীভাবে কাজ করে
এই চ্যালেঞ্জ সমাধানের জন্য, লেখকরা MindClaw ফ্রেমওয়ার্ক প্রস্তাব করেন, যেখানে তিনটি উপাদান যুক্ত হয়:
- অভিনেতার বিশ্বাস সারণি — একটি কাঠামো যেখানে নির্দিষ্ট ব্যক্তির লক্ষ্য ও জ্ঞান সম্পর্কে বর্তমান মুহূর্তের অনুমান সংরক্ষিত থাকে।
- মূর্ত জ্ঞানীয় দক্ষতা — ক্ষমতার একটি সেট যা এজেন্টকে কেবল যুক্তি করতে নয়, পরিবেশে শারীরিক কাজ সম্পাদন করতেও সক্ষম করে।
- ট্রিগার-ভিত্তিক জ্ঞানীয় ব্যবস্থাপক — একটি প্রক্রিয়া যা মূল প্রশ্নের উত্তর দেয়: হস্তক্ষেপের কারণ সক্রিয় হয়েছে কিনা। ব্যবস্থাপক হয় কর্ম শুরু করে, অথবা এজেন্টকে পর্যবেক্ষণ মোডে রাখে।
স্থাপত্যটি একটি "জ্ঞানীয় নখর"-এর মতো: এটি তথ্য ধারণ করে, বিশ্বাসের আকারে ধরে রাখে এবং কেবল তখনই ছেড়ে দেয় যখন কাছাকাছি রোবটের জন্য একটি বাস্তব কাজ থাকে।
পরীক্ষাগুলো কী দেখিয়েছে
ফলাফলগুলো স্পষ্টভাবে নির্দেশক। MindClaw ফ্রেমওয়ার্ক ৩৬.৬৩% নির্ভুল হস্তক্ষেপ এবং ১৪.৩৬% কাজ সমাধানের নির্ভুলতা অর্জন করে। তুলনার জন্য, সরাসরি VLM-বেসলাইনগুলো, যেগুলো প্রস্তাবিত স্থাপত্য ব্যবহার করে না, মাত্র ১২.০৫% এবং ৩.৮০% দেখায়। অন্য কথায়, হস্তক্ষেপের মানের ক্ষেত্রে প্রায় তিনগুণ এবং কাজের সাফল্যে প্রায় চারগুণ ব্যবধান।
এটি নিশ্চিত করে যে বিশ্বাসের স্পষ্ট মডেল এবং কর্মের জন্য আলাদা ট্রিগার থাকা এজেন্টকে ভিজ্যুয়াল-ভাষা মডেলের "কাঁচা" ব্যবহারের তুলনায় উল্লেখযোগ্য সুবিধা দেয়। বিশেষভাবে মূল্যবান হল, সাফল্য উত্তরের নির্ভুলতা দিয়ে নয়, বরং ক্লোজড-লুপে সঠিক আচরণ দিয়ে পরিমাপ করা হয়: রোবটকে তখনই সঠিক হতে হবে যখন এটি সাহায্য করে, এবং যখন এটি দূরে থাকে তখনও।

কাজের অবস্থা
নতুন বেঞ্চমার্কের বর্ণনা সহ প্রিপ্রিন্টটি arXiv-এ 2606.01063 শনাক্তকারীর অধীনে প্রকাশিত হয়েছে। লেখকদের মতে, নিবন্ধটি CVPR 2026-এ উপস্থাপিত পূর্ববর্তী MindPower কাজের একটি বর্ধিত সংস্করণ এবং অতিরিক্ত পরীক্ষার একটি সেট সহ আসে। v3 হিসাবে চিহ্নিত বর্তমান সংস্করণটি ২৪ আগস্ট ২০২৬ তারিখে আপডেট করা হয়েছিল, এবং প্রকল্পটি এখনও বিকাশের প্রক্রিয়ায় রয়েছে। তাই, সম্ভবত, অদূর ভবিষ্যতে এই দিকে স্পষ্টীকরণ এবং নতুন ফলাফল আশা করা উচিত।



