মডেলের উত্তরে "আমি নিশ্চিত" ট্যাগটি কোনো পরিমাপ নয়, বরং আরেকটি দাবি, যার আলাদা যাচাই দরকার। যতক্ষণ এমন মূল্যায়ন এজেন্টের লজিকে গাঁথা থাকে, ততক্ষণ বোঝা দরকার—এগুলোকে কতটা বিশ্বাস করা যায়।
নিশ্চয়তা নিয়ে প্রশ্ন কেন উঠল
এজেন্টিক সিস্টেমগুলো এখন প্রায়ই এমনভাবে সাজানো হয় যে পরবর্তী পদক্ষেপটি বেছে নেওয়া হয় মডেলের আত্ম-মূল্যায়নের দিকে তাকিয়ে: যদি সে উচ্চ নিশ্চয়তা দাবি করে, কাজটি সম্পন্ন হয়; যদি কম হয়, তবে একজন মানুষ বা অন্য কোনো টুল যুক্ত হয়। এমন কাঠামো কেবল একটি শর্তে কাজ করে: কাজের মুহূর্তে দাবিকৃত নিশ্চয়তা মোটামুটি বাস্তব সফলতার হারের সঙ্গে মিলতে হবে।
Bhushan Kashinath Joshi-র কাজ (arXiv:2608.24691, জমা ২৫ আগস্ট ২০২৬) ঠিক এই অনুমানটিই যাচাই করে—তাও এমন এক পরিবেশে, যেখানে ভুল সঙ্গে সঙ্গে চোখে পড়ে এবং দুর্ভাগ্যের দায়ে চালিয়ে দেওয়া যায় না।
পরীক্ষাক্ষেত্র: লুকানো রাজা দিয়ে দাবা
সাধারণ দাবা এমন যাচাইয়ের জন্য ভালো মানায় না: সেখানে সবকিছু খোলা, আর "নিশ্চয়তা" অনিবার্যভাবে খেলার শক্তির সঙ্গে মিশে যায়। তাই লুকানো তথ্যসম্বলিত একটি রূপ নেওয়া হয়েছে, যেখানে রাজার মর্যাদা গোপনে ও বারবার এক ঘুঁটি থেকে আরেক ঘুঁটিতে যেতে পারে। খেলোয়াড় জানে না মূল লক্ষ্যটি এখন কোথায় আছে, এবং অনুমানের ভিত্তিতে চাল দিতে বাধ্য হয়।
পদ্ধতির মূল দিকটি হলো: প্রতিটি চালে এজেন্টকে আলাদাভাবে জিজ্ঞাসা করা হয়েছিল প্রতিপক্ষের কোন ঘুঁটি গোপনে রাজার মর্যাদা বহন করছে তার সম্ভাব্যতা-বণ্টন। এটি চালের নিজের থেকে স্বতন্ত্রভাবে চাওয়া হয়েছিল—যাতে "আমি কোথায় গেলাম" আর "আমি কী বিশ্বাস করি" মিশে না যায়। প্রকৃত অবস্থান দাবা শেষে পুনর্গঠন করে দাবিকৃত সংখ্যাগুলোর সঙ্গে মেলানো হয়েছিল।

বাষট্টির মধ্যে একটি সঠিক উত্তর
মূল ফলাফলটি দেখতে দুর্ঘটনার মতো। দুটি স্বতন্ত্র সিরিজের খেলায়, লুকানো ঘুঁটির অবস্থান নিয়ে কমপক্ষে ০.৫ নিশ্চয়তা দাবি করে করা গ্রহণগুলো ৬২টির মধ্যে মাত্র ১টিতে সঠিক প্রমাণিত হয়েছে। শতাংশে অনুবাদ করলে, "হ্যাঁ-র চেয়ে সম্ভবত হ্যাঁ" দাবিকৃত সম্ভাব্যতা প্রায় দেড় শতাংশ ক্ষেত্রে সফলতায় পরিণত হয়েছে—ব্যবধান শতাংশের নয়, বরং মাত্রার ক্রমের।
তবে ক্যালিব্রেশনের ঘাটতি প্রায় পুরোটাই ঠিক এই ঘটনাগুলোতেই কেন্দ্রীভূত: মূল সিরিজে ৯৯.৩% এবং পুনরাবৃত্তিতে ৯৮.৭%। অন্য কথায়, সমস্যাটি পুরো খেলায় সমানভাবে ছড়িয়ে নেই—এটি সেই মুহূর্তগুলোতে কেন্দ্রীভূত, যখন মডেল বিশেষভাবে জোরে নিজের সঠিকতার দাবি করে, এবং ঠিক তখনই যখন তার উপর ঝুঁকিপূর্ণ একটি কাজ নির্ভর করে।
অন্য কনফিগারেশনেও একই ধরন
লেখক একটি মডেলেই থেমে থাকেননি। যাচাই আরও চারটি কনফিগারেশন জুড়ে বিস্তৃত, যার মধ্যে দ্বিতীয় একটি প্রোভাইডারও রয়েছে। চিত্রটি দুর্বলতর রূপে পুনরাবৃত্ত হয় এবং একটি সামঞ্জস্যপূর্ণ ক্রমে সাজে—তবে এখানে সতর্কতা জরুরি: কেবল বিন্দু-অনুমানগুলোই তুলনাযোগ্য থাকে, আর এই নমুনা-আকারে বেশিরভাগ জোড়াভিত্তিক পার্থক্য পরিসংখ্যানগতভাবে অবিভেদ্য।
লেখক নিজেই এটিকে অনুসন্ধানের পরিধি (scope) হিসেবে বর্ণনা করেন, মডেলের সক্ষমতার স্তর তার ক্যালিব্রেশন পূর্বাভাস দেয়—এমন প্রমাণ হিসেবে নয়। অর্থাৎ এখানে "মডেল যত বুদ্ধিমান, তত ভালো নিজেকে মূল্যায়ন করে" বা তার বিপরীত দাবি নেই—শুধু ঘটনাটি একটি নির্দিষ্ট সিস্টেমের চেয়ে বেশি জায়গায় দেখা যায়।

চিন্তার বাজেট মেট্রিককে মনে হওয়ার চেয়ে বেশি সরায়
আলাদা একটি অস্বস্তিকর প্রসঙ্গ হলো লিডারবোর্ডের সারণিতে অপরিবর্তিত বাহ্যিক র্যাঙ্কিংয়ের অধীনে একই মডেলের তুলনা। কেবল চিন্তার বাজেট (deliberation budget) বদলায়, অর্থাৎ মডেল কতটা "ভাবার সময়" ব্যয় করে। এই পরিবর্তনটি ক্যালিব্রেশনের মেট্রিককে প্রায় ততটাই বদলে দেয়, যতটা ভিন্ন মডেলের মধ্যে বড় ব্যবধান বদলায়।
ব্যবহারিক উপসংহারটি সরল ও অস্বস্তিকর: ঝুঁকি-মূল্যায়নসহ কাজের জন্য সিস্টেম বাছাইয়ের সময় লিডারবোর্ডে অবস্থানের উপর নির্ভর করা যায় না। একই মডেলের ভেতরেই সেটিংসের কারণে যে বিস্তার ঘটে, তা আমরা যা একটি মডেলের অন্যটির উপর গুরুতর সুবিধা বলে ধরে নিই তার সঙ্গে তুলনীয়।
প্রচলিত মেট্রিক উল্টোটা দেখাতে পারে
আরেকটি ফলাফল প্রচলিত পরিমাপের পদ্ধতিগুলোতে আঘাত হানে। আলাদা একটি আসনে (seat) মানক মূল্যায়ন-অক্ষগুলো—চালের বৈধতা, খরচ, বিলম্ব, সম্পন্ন হওয়া খেলার অনুপাত—মডেলের বিশ্বাসের গুণমানের সঙ্গে সম্পূর্ণ বিচ্ছিন্ন হতে পারে। যে কনফিগারেশন একসঙ্গে সব প্রচলিত সূচকে জিতেছিল, সেটি পরীক্ষিত সবগুলোর মধ্যে সবচেয়ে খারাপ বিশ্বাস-গুণমান দেখিয়েছে।
এখানে ব্যাখ্যায় ভুল হওয়া সহজ: কথা হলো না যে নির্ভুলতা আর সস্তাতা নিজে থেকে ক্ষতিকর। কথা হলো, আমরা যে মেট্রিক-সেটকে সাধারণত সম্পূর্ণ বলে ধরে নিই, তা আমাদের আগ্রহের বৈশিষ্ট্যটিই মাপে না—তা অন্য কিছু নিয়ে।
"ফলাফল দিয়ে" মূল্যায়ন কেন কিছু ধরবে না
সবচেয়ে অস্বস্তিকর পরিণতি হলো আড়াল। বর্ণিত ধরনের মডেল এখনও সেই খেলাটিই জিতে যেতে পারে, যেটি নিয়ে সে ভুল বিশ্বাস গড়েছিল। ফলাফল ভালো, অথচ ভেতরের বিশ্বদৃষ্টি ছিল ভুল।
এ থেকে বোঝা যায়, কেবল ফলাফলভিত্তিক (outcome-only) যাচাই এমন ব্যর্থতা নীতিগতভাবেই ধরতে পারে না: জয় প্রশ্নটি বন্ধ করে দেয়, আর দুর্বল জায়গাটি পরের বার পর্যন্ত সিস্টেমেই থেকে যায়—তবে তখন এমন কাজে, যেখানে সঠিক পরিণতি নাও ঘটতে পারে।

বাস্তবে এ নিয়ে কী করা যায়
ফলাফল থেকে সরাসরি যে কয়েকটি কার্যকর উপসংহার আসে।
- মডেলের কাছে মূল অজানাটি নিয়ে তার নিজস্ব সম্ভাব্যতা-বণ্টন চাওয়া—এবং তা বেছে নেওয়া কাজ থেকে আলাদা রাখা। এই দুটি জিনিস আলাদা না করলে ক্যালিব্রেশন মূল্যায়ন সম্ভব নয়।
- দাবিকৃত নিশ্চয়তাকে নিজের ডেটায় প্রকৃত সফলতার হারের সঙ্গে মেলানো, মডেলের কার্ডের সংখ্যাগুলো বিশ্বাস না করা। লুকানো ঘুঁটির খেলায় ব্যবধানটি বিশাল প্রমাণিত হয়েছে, আর কোনো নিশ্চয়তা নেই যে ব্যবহারিক কাজে তা কম হবে।
- সিস্টেম যে সীমায় সিদ্ধান্ত মানুষকে হস্তান্তর করে, সেই সীমা সামগ্রিক নির্ভুলতা থেকে আলাদাভাবে যাচাই করা। ভুলগুলো ঠিক উচ্চ দাবিকৃত নিশ্চয়তার অঞ্চলেই জমা হয়।
- যেকোনো তুলনায় চিন্তার বাজেট স্থির রাখা। নইলে আপনি মডেল নয়, সেটিংস মাপছেন।
- জয় বা সফল পরিণতিকে সিস্টেমের অভ্যন্তরীণ বিশ্বাসের সঠিকতার প্রমাণ বলে ধরে নেওয়া না।
অনুসন্ধানের সারমর্ম এই নয় যে মডেলগুলো "খারাপ"। বরং এই যে নিশ্চয়তা আর সঠিকতা দুটি আলাদা সূচক, এবং প্রথমটি এখনও দ্বিতীয়টির বিকল্প হিসেবে উপযুক্ত নয়। যতক্ষণ এজেন্টিক স্থাপত্য আত্ম-মূল্যায়নকে ঘিরে গড়া হয়, ততক্ষণ এই পার্থক্যটি স্পষ্টভাবে মাপতে হবে।



