আত্মবিশ্বাস মানেই সঠিকতা নয়: লুকানো আকৃতির খেলায় কীভাবে LLM-গুলো ক্যালিব্রেশনে ব্যর্থ হয়

18 সেপ্টেম্বর 2026১১ প্রদর্শন

arXiv-এর একটি নতুন প্রিপ্রিন্ট যাচাই করছে, চাল নির্বাচনের মুহূর্তে একটি ভাষা মডেলের আত্ম-মূল্যায়নের উপর ভরসা করা যায় কি না। লুকানো "রাজকীয়" মর্যাদাসম্পন্ন দাবাবোর্ডের একটি রূপভেদে ঘোষিত সম্ভাবনা ≥০.৫ কেবল ৬২টি প্রচেষ্টার মধ্যে একবারই গুটির প্রকৃত অবস্থানের সঙ্গে মিলেছিল, এবং ক্রমাঙ্কনের প্রায় পুরো ঘাটতিই এসেছিল ঠিক এই পর্বগুলোর উপর।

আত্মবিশ্বাস মানেই সঠিকতা নয়: লুকানো আকৃতির খেলায় কীভাবে LLM-গুলো ক্যালিব্রেশনে ব্যর্থ হয়

মডেলের উত্তরে "আমি নিশ্চিত" ট্যাগটি কোনো পরিমাপ নয়, বরং আরেকটি দাবি, যার আলাদা যাচাই দরকার। যতক্ষণ এমন মূল্যায়ন এজেন্টের লজিকে গাঁথা থাকে, ততক্ষণ বোঝা দরকার—এগুলোকে কতটা বিশ্বাস করা যায়।

নিশ্চয়তা নিয়ে প্রশ্ন কেন উঠল

এজেন্টিক সিস্টেমগুলো এখন প্রায়ই এমনভাবে সাজানো হয় যে পরবর্তী পদক্ষেপটি বেছে নেওয়া হয় মডেলের আত্ম-মূল্যায়নের দিকে তাকিয়ে: যদি সে উচ্চ নিশ্চয়তা দাবি করে, কাজটি সম্পন্ন হয়; যদি কম হয়, তবে একজন মানুষ বা অন্য কোনো টুল যুক্ত হয়। এমন কাঠামো কেবল একটি শর্তে কাজ করে: কাজের মুহূর্তে দাবিকৃত নিশ্চয়তা মোটামুটি বাস্তব সফলতার হারের সঙ্গে মিলতে হবে।

Bhushan Kashinath Joshi-র কাজ (arXiv:2608.24691, জমা ২৫ আগস্ট ২০২৬) ঠিক এই অনুমানটিই যাচাই করে—তাও এমন এক পরিবেশে, যেখানে ভুল সঙ্গে সঙ্গে চোখে পড়ে এবং দুর্ভাগ্যের দায়ে চালিয়ে দেওয়া যায় না।

পরীক্ষাক্ষেত্র: লুকানো রাজা দিয়ে দাবা

সাধারণ দাবা এমন যাচাইয়ের জন্য ভালো মানায় না: সেখানে সবকিছু খোলা, আর "নিশ্চয়তা" অনিবার্যভাবে খেলার শক্তির সঙ্গে মিশে যায়। তাই লুকানো তথ্যসম্বলিত একটি রূপ নেওয়া হয়েছে, যেখানে রাজার মর্যাদা গোপনে ও বারবার এক ঘুঁটি থেকে আরেক ঘুঁটিতে যেতে পারে। খেলোয়াড় জানে না মূল লক্ষ্যটি এখন কোথায় আছে, এবং অনুমানের ভিত্তিতে চাল দিতে বাধ্য হয়।

পদ্ধতির মূল দিকটি হলো: প্রতিটি চালে এজেন্টকে আলাদাভাবে জিজ্ঞাসা করা হয়েছিল প্রতিপক্ষের কোন ঘুঁটি গোপনে রাজার মর্যাদা বহন করছে তার সম্ভাব্যতা-বণ্টন। এটি চালের নিজের থেকে স্বতন্ত্রভাবে চাওয়া হয়েছিল—যাতে "আমি কোথায় গেলাম" আর "আমি কী বিশ্বাস করি" মিশে না যায়। প্রকৃত অবস্থান দাবা শেষে পুনর্গঠন করে দাবিকৃত সংখ্যাগুলোর সঙ্গে মেলানো হয়েছিল।

বাষট্টির মধ্যে একটি সঠিক উত্তর

মূল ফলাফলটি দেখতে দুর্ঘটনার মতো। দুটি স্বতন্ত্র সিরিজের খেলায়, লুকানো ঘুঁটির অবস্থান নিয়ে কমপক্ষে ০.৫ নিশ্চয়তা দাবি করে করা গ্রহণগুলো ৬২টির মধ্যে মাত্র ১টিতে সঠিক প্রমাণিত হয়েছে। শতাংশে অনুবাদ করলে, "হ্যাঁ-র চেয়ে সম্ভবত হ্যাঁ" দাবিকৃত সম্ভাব্যতা প্রায় দেড় শতাংশ ক্ষেত্রে সফলতায় পরিণত হয়েছে—ব্যবধান শতাংশের নয়, বরং মাত্রার ক্রমের।

তবে ক্যালিব্রেশনের ঘাটতি প্রায় পুরোটাই ঠিক এই ঘটনাগুলোতেই কেন্দ্রীভূত: মূল সিরিজে ৯৯.৩% এবং পুনরাবৃত্তিতে ৯৮.৭%। অন্য কথায়, সমস্যাটি পুরো খেলায় সমানভাবে ছড়িয়ে নেই—এটি সেই মুহূর্তগুলোতে কেন্দ্রীভূত, যখন মডেল বিশেষভাবে জোরে নিজের সঠিকতার দাবি করে, এবং ঠিক তখনই যখন তার উপর ঝুঁকিপূর্ণ একটি কাজ নির্ভর করে।

অন্য কনফিগারেশনেও একই ধরন

লেখক একটি মডেলেই থেমে থাকেননি। যাচাই আরও চারটি কনফিগারেশন জুড়ে বিস্তৃত, যার মধ্যে দ্বিতীয় একটি প্রোভাইডারও রয়েছে। চিত্রটি দুর্বলতর রূপে পুনরাবৃত্ত হয় এবং একটি সামঞ্জস্যপূর্ণ ক্রমে সাজে—তবে এখানে সতর্কতা জরুরি: কেবল বিন্দু-অনুমানগুলোই তুলনাযোগ্য থাকে, আর এই নমুনা-আকারে বেশিরভাগ জোড়াভিত্তিক পার্থক্য পরিসংখ্যানগতভাবে অবিভেদ্য।

লেখক নিজেই এটিকে অনুসন্ধানের পরিধি (scope) হিসেবে বর্ণনা করেন, মডেলের সক্ষমতার স্তর তার ক্যালিব্রেশন পূর্বাভাস দেয়—এমন প্রমাণ হিসেবে নয়। অর্থাৎ এখানে "মডেল যত বুদ্ধিমান, তত ভালো নিজেকে মূল্যায়ন করে" বা তার বিপরীত দাবি নেই—শুধু ঘটনাটি একটি নির্দিষ্ট সিস্টেমের চেয়ে বেশি জায়গায় দেখা যায়।

চিন্তার বাজেট মেট্রিককে মনে হওয়ার চেয়ে বেশি সরায়

আলাদা একটি অস্বস্তিকর প্রসঙ্গ হলো লিডারবোর্ডের সারণিতে অপরিবর্তিত বাহ্যিক র‍্যাঙ্কিংয়ের অধীনে একই মডেলের তুলনা। কেবল চিন্তার বাজেট (deliberation budget) বদলায়, অর্থাৎ মডেল কতটা "ভাবার সময়" ব্যয় করে। এই পরিবর্তনটি ক্যালিব্রেশনের মেট্রিককে প্রায় ততটাই বদলে দেয়, যতটা ভিন্ন মডেলের মধ্যে বড় ব্যবধান বদলায়।

ব্যবহারিক উপসংহারটি সরল ও অস্বস্তিকর: ঝুঁকি-মূল্যায়নসহ কাজের জন্য সিস্টেম বাছাইয়ের সময় লিডারবোর্ডে অবস্থানের উপর নির্ভর করা যায় না। একই মডেলের ভেতরেই সেটিংসের কারণে যে বিস্তার ঘটে, তা আমরা যা একটি মডেলের অন্যটির উপর গুরুতর সুবিধা বলে ধরে নিই তার সঙ্গে তুলনীয়।

প্রচলিত মেট্রিক উল্টোটা দেখাতে পারে

আরেকটি ফলাফল প্রচলিত পরিমাপের পদ্ধতিগুলোতে আঘাত হানে। আলাদা একটি আসনে (seat) মানক মূল্যায়ন-অক্ষগুলো—চালের বৈধতা, খরচ, বিলম্ব, সম্পন্ন হওয়া খেলার অনুপাত—মডেলের বিশ্বাসের গুণমানের সঙ্গে সম্পূর্ণ বিচ্ছিন্ন হতে পারে। যে কনফিগারেশন একসঙ্গে সব প্রচলিত সূচকে জিতেছিল, সেটি পরীক্ষিত সবগুলোর মধ্যে সবচেয়ে খারাপ বিশ্বাস-গুণমান দেখিয়েছে।

এখানে ব্যাখ্যায় ভুল হওয়া সহজ: কথা হলো না যে নির্ভুলতা আর সস্তাতা নিজে থেকে ক্ষতিকর। কথা হলো, আমরা যে মেট্রিক-সেটকে সাধারণত সম্পূর্ণ বলে ধরে নিই, তা আমাদের আগ্রহের বৈশিষ্ট্যটিই মাপে না—তা অন্য কিছু নিয়ে।

"ফলাফল দিয়ে" মূল্যায়ন কেন কিছু ধরবে না

সবচেয়ে অস্বস্তিকর পরিণতি হলো আড়াল। বর্ণিত ধরনের মডেল এখনও সেই খেলাটিই জিতে যেতে পারে, যেটি নিয়ে সে ভুল বিশ্বাস গড়েছিল। ফলাফল ভালো, অথচ ভেতরের বিশ্বদৃষ্টি ছিল ভুল।

এ থেকে বোঝা যায়, কেবল ফলাফলভিত্তিক (outcome-only) যাচাই এমন ব্যর্থতা নীতিগতভাবেই ধরতে পারে না: জয় প্রশ্নটি বন্ধ করে দেয়, আর দুর্বল জায়গাটি পরের বার পর্যন্ত সিস্টেমেই থেকে যায়—তবে তখন এমন কাজে, যেখানে সঠিক পরিণতি নাও ঘটতে পারে।

বাস্তবে এ নিয়ে কী করা যায়

ফলাফল থেকে সরাসরি যে কয়েকটি কার্যকর উপসংহার আসে।

  • মডেলের কাছে মূল অজানাটি নিয়ে তার নিজস্ব সম্ভাব্যতা-বণ্টন চাওয়া—এবং তা বেছে নেওয়া কাজ থেকে আলাদা রাখা। এই দুটি জিনিস আলাদা না করলে ক্যালিব্রেশন মূল্যায়ন সম্ভব নয়।
  • দাবিকৃত নিশ্চয়তাকে নিজের ডেটায় প্রকৃত সফলতার হারের সঙ্গে মেলানো, মডেলের কার্ডের সংখ্যাগুলো বিশ্বাস না করা। লুকানো ঘুঁটির খেলায় ব্যবধানটি বিশাল প্রমাণিত হয়েছে, আর কোনো নিশ্চয়তা নেই যে ব্যবহারিক কাজে তা কম হবে।
  • সিস্টেম যে সীমায় সিদ্ধান্ত মানুষকে হস্তান্তর করে, সেই সীমা সামগ্রিক নির্ভুলতা থেকে আলাদাভাবে যাচাই করা। ভুলগুলো ঠিক উচ্চ দাবিকৃত নিশ্চয়তার অঞ্চলেই জমা হয়।
  • যেকোনো তুলনায় চিন্তার বাজেট স্থির রাখা। নইলে আপনি মডেল নয়, সেটিংস মাপছেন।
  • জয় বা সফল পরিণতিকে সিস্টেমের অভ্যন্তরীণ বিশ্বাসের সঠিকতার প্রমাণ বলে ধরে নেওয়া না।

অনুসন্ধানের সারমর্ম এই নয় যে মডেলগুলো "খারাপ"। বরং এই যে নিশ্চয়তা আর সঠিকতা দুটি আলাদা সূচক, এবং প্রথমটি এখনও দ্বিতীয়টির বিকল্প হিসেবে উপযুক্ত নয়। যতক্ষণ এজেন্টিক স্থাপত্য আত্ম-মূল্যায়নকে ঘিরে গড়া হয়, ততক্ষণ এই পার্থক্যটি স্পষ্টভাবে মাপতে হবে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
আত্মবিশ্বাস মানেই সঠিকতা নয়: লুকানো আকৃতির খেলায় কীভাবে LLM-গুলো ক্যালিব্রেশনে ব্যর্থ হয়