GIM বেঞ্চমার্ক: বিভিন্ন জ্ঞানীয় দক্ষতার সংযোগস্থলে LLM পরীক্ষা

10 সেপ্টেম্বর 2026৭ প্রদর্শন

গবেষকরা একটি পদ্ধতি প্রস্তাব করেছেন যা মডেলগুলিকে জ্ঞানের পরিমাণ বা বাস্তবতা থেকে বিচ্ছিন্নভাবে নয়, বরং এমন কাজের মাধ্যমে মূল্যায়ন করে যার জন্য একই সাথে যুক্তি, প্রসঙ্গ নিয়ন্ত্রণ এবং সীমাবদ্ধতার সাথে কাজ করা প্রয়োজন। বেঞ্চমার্কে ৮২০টি মৌলিক কাজ অন্তর্ভুক্ত ছিল এবং এর লেখকরা "চিন্তাভাবনা" সেটিংস এবং মডেলের অন্যান্য প্যারামিটার ফলাফলকে কীভাবে প্রভাবিত করে তাও অধ্যয়ন করেছেন।

GIM বেঞ্চমার্ক: বিভিন্ন জ্ঞানীয় দক্ষতার সংযোগস্থলে LLM পরীক্ষা

এলএলএম-বেঞ্চমার্কগুলো কোথায় যাচ্ছে

আধুনিক বড় ভাষার মডেলগুলোর জন্য তৈরি পরীক্ষাগুলো ধীরে ধীরে অর্থ হারাচ্ছে: মডেলগুলো উচ্চ স্কোর অর্জন করছে, কিন্তু তাদের মধ্যে পার্থক্য ক্রমশ কম তাৎপর্যপূর্ণ হয়ে উঠছে। নতুন গবেষণার লেখকরা এর কারণ দেখছেন বেঞ্চমার্কগুলোর জটিলতা বৃদ্ধির কাঠামোতে। বর্তমানে দুটি কৌশল জনপ্রিয়: হয় GPQA বা HLE-এর মতো অত্যন্ত বিশেষায়িত জ্ঞানের পরিধি বাড়ানো, অথবা ARC-AGI-এর ধাঁচে বিমূর্ত যুক্তিতে যাওয়া। প্রথম পদ্ধতির একটি সমস্যা আছে: উচ্চ ফলাফল বাস্তব বোঝাপড়ার পরিবর্তে তথ্য মুখস্থ করার ফল হতে পারে। দ্বিতীয় পদ্ধতি, বিপরীতে, যুক্তিকে ব্যবহারিক প্রেক্ষাপট থেকে বিচ্ছিন্ন করে দেয় — এই ধরনের কাজগুলো বাস্তব জীবনে মডেল যা সম্মুখীন হবে তার সাথে খুব কমই মিল রাখে।

নতুন বেঞ্চমার্ক GIM (গ্রাউন্ডেড ইন্টিগ্রেশন মেজার) একটি তৃতীয় পথ প্রস্তাব করে। এর লেখকরা মনে করেন, জটিলতা তৈরি হওয়া উচিত পাণ্ডিত্য বা ধাঁধাঁ থেকে নয়, বরং সর্বজনীন জ্ঞানের উপাদানের উপর ভিত্তি করে একই সাথে একাধিক ভিন্ন জ্ঞানীয় দক্ষতা প্রয়োগ করার প্রয়োজনীয়তা থেকে।

GIM কীভাবে কাজ করে

সেটটিতে ৮২০টি মৌলিক কাজ রয়েছে: ৬১৫টি সবার জন্য উন্মুক্ত এবং ২০৫টি ব্যক্তিগত, যা প্রশিক্ষণ রোধ করার জন্য লুকানো থাকে। গুরুত্বপূর্ণ বিষয় হল, প্রতিটি কাজ একটি মূল রচনা, ইতিমধ্যে বিদ্যমান প্রশ্নের পুনর্নির্মাণ নয়।

জটিলতা অর্জিত হয় বিরল তথ্যের মাধ্যমে নয়, বরং ক্রিয়াকলাপের সমন্বয়ের মাধ্যমে। উদাহরণস্বরূপ, একটি কাজে মডেলের একই সাথে প্রয়োজন হতে পারে:

  • একাধিক সীমাবদ্ধতা পূরণ করা;
  • প্রক্রিয়ার পরিবর্তনশীল অবস্থা পর্যবেক্ষণ করা;
  • জ্ঞানগত সতর্কতা প্রদর্শন করা, অর্থাৎ কোন উৎস এবং দাবির উপর আস্থা রাখা যায় তা বোঝা;
  • নির্দিষ্ট শ্রোতার জন্য উত্তর তৈরি করা।

এছাড়াও, সমস্ত কাজ সর্বজনীন জ্ঞানের উপর ভিত্তি করে — মডেলকে সংকীর্ণ ক্ষেত্রে বিশেষজ্ঞ হতে হবে না। ফলে এটি স্মৃতির পরীক্ষা নয়, বরং বিভিন্ন দক্ষতাকে একত্রিত করে বাস্তবসম্মত পরিস্থিতিতে প্রয়োগ করার ক্ষমতার পরীক্ষা।

উত্তরগুলো মূলত রুব্রিকের মাধ্যমে মূল্যায়ন করা হয়: ফলাফলকে পৃথক উপাদানে বিভক্ত করা হয় এবং প্রতিটি উপাদান স্বাধীনভাবে যাচাই করা হয়। এটি আংশিকভাবে সঠিক উত্তরের জন্য মডেলের পূর্ণ স্কোর পাওয়ার সম্ভাবনা হ্রাস করে।

মডেলগুলো কীভাবে মূল্যায়ন করা হয়েছিল

লেখকরা শুধুমাত্র সঠিক উত্তরের অনুপাতের উপর নির্ভর করেননি। পরিবর্তে, তারা একটি অবিচ্ছিন্ন দ্বি-প্যারামিটার IRT মডেল ব্যবহার করেছেন — মনোবিজ্ঞানের একটি পদ্ধতি যা মডেলের ক্ষমতা এবং কাজের জটিলতা উভয়ই বিবেচনা করে। মডেলটি ৫৩টি টেস্ট-কনফিগারেশনে ক্রমাঙ্কিত হয়েছিল — "মডেল × চিন্তার স্তর" এর অনন্য জোড়া। এর জন্য পাঁচজন বিশেষভাবে ক্রমাঙ্কিত বিচারক নিয়োগ করা হয়েছিল।

মোট এক মিলিয়নেরও বেশি কাঁচা বিচারক পর্যবেক্ষণ পাওয়া গেছে, যা পরে ২০৩,৮০০ কোষে গড় করা হয়েছে। এই পদ্ধতিটি ক্ষমতার স্থিতিশীল অনুমান দেয় যা কাঁচা-নির্ভুলতার সাধারণ বিকৃতির কারণে ভেঙে পড়ে না: বিচারকদের কঠোরতা বা নম্রতা, হারানো ডেটা, বিভিন্ন মডেলের অসম ত্রুটি। চূড়ান্ত স্কোর এই ধরনের শব্দের মধ্যেও টেস্ট-কনফিগারেশনগুলোকে সঠিকভাবে ক্রমবিন্যাস করে।

এই গণনার ভিত্তিতে, লেখকরা একটি লিডারবোর্ড তৈরি করেছেন যাতে ২২টি মডেল এবং ৪৭টি অফিসিয়াল রিপোর্টিং-কনফিগারেশন অন্তর্ভুক্ত রয়েছে।

চিন্তার সময়ের ভূমিকা

আলাদাভাবে, গবেষকরা অন্বেষণ করেছেন কীভাবে ইনফারেন্সের সময় গণনাগত বাজেট — টেস্ট-টাইম কম্পিউট — প্রভাব ফেলে। এটি একটি নির্দিষ্ট বেঞ্চমার্কে এই ধরনের সবচেয়ে বড় প্রকাশিত গবেষণা: এতে ১১টি মডেল এবং ৩৫টি টেস্ট-কনফিগারেশন অন্তর্ভুক্ত ছিল।

পরীক্ষার নকশার কারণে ফলাফলগুলো অনেকাংশে অপ্রত্যাশিত ছিল। আন্তঃ-পরিবার সেটিংস — যেমন থিংকিং-টোকেন বাজেট বা কোয়ান্টাইজেশন — মডেল নির্বাচনের চেয়ে কম নয় ফলাফলকে প্রভাবিত করে। অর্থাৎ, একই মডেল নেওয়া, চিন্তার পরামিতি পরিবর্তন করা — এবং আরও শক্তিশালী মডেলে স্যুইচ করার সাথে তুলনীয় পার্থক্য পাওয়া সম্ভব।

তবে, একটি গুরুত্বপূর্ণ সীমাবদ্ধতা রয়েছে: রিজনিং-টোকেনের সংখ্যা বৃদ্ধি হ্রাসমান প্রান্তিক রিটার্ন দেয়। একটি নির্দিষ্ট সীমার পরে, আরও গণনা উত্তর প্রায় উন্নত করে না। এর অর্থ হল, "চিন্তা করার সময়" অসীমভাবে বাড়ানো অদক্ষ — বাজেট এবং মানের মধ্যে ভারসাম্য খুঁজে বের করা প্রয়োজন।

উপসংহার

GIM বর্ণনাকারী নিবন্ধটি ২০২৬ সালে arXiv-এ প্রকাশিত হয়েছিল এবং সম্প্রদায়ের জন্য একটি উল্লেখযোগ্য ঘটনা হয়ে উঠেছে: ৬১ পৃষ্ঠা, ২৭টি চিত্র, ৪টি টেবিল। বেঞ্চমার্কের কোড এবং ডেটা উন্মুক্ত, তাই যেকোনো গবেষক নিজস্ব মডেল চালাতে এবং প্রকাশিত ফলাফলের সাথে তুলনা করতে সক্ষম হবেন।

GIM-এর মূল ধারণা — তথ্য বা বিমূর্ততার মাধ্যমে পরীক্ষাকে আরও কঠিন করা নয়, বরং কাজগুলোকে বাস্তবতার কাছাকাছি আনা, যেখানে বিভিন্ন জ্ঞানীয় দক্ষতা একসাথে কাজ করে। সম্ভবত, এই ধরনের বেঞ্চমার্কগুলো কেবল "মুখস্থ করার ক্ষমতা" বা "শূন্যে যুক্তিযুক্তভাবে চিন্তা করার ক্ষমতা" নয়, বরং জটিল পরিস্থিতিতে মডেলগুলোর ব্যবহারিক উপযোগিতা মূল্যায়নের অনুমতি দেবে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
GIM বেঞ্চমার্ক: বিভিন্ন জ্ঞানীয় দক্ষতার সংযোগস্থলে LLM পরীক্ষা