ওমানিক: LLM-এর লজিক ঠিক কোথায় ভেঙে পড়ে তার ধাপে ধাপে বিশ্লেষণ

20 সেপ্টেম্বর 2026১৪ প্রদর্শন

নতুন ওপেন বেঞ্চমার্ক Omanic মডেলের reasoning-সক্ষমতা কেবল চূড়ান্ত উত্তরের ভিত্তিতে নয়, বরং প্রতিটি মধ্যবর্তী সিদ্ধান্তের ভিত্তিতেও বিচার করার প্রস্তাব দেয়। এর ভিত্তি হলো প্রায় ১০.৩ হাজার সিন্থেটিক প্রশিক্ষণ উদাহরণ এবং বিশেষজ্ঞদের দ্বারা হাতে লেবেল করা ৯৬৭টি পরীক্ষামূলক প্রশ্ন।

ওমানিক: LLM-এর লজিক ঠিক কোথায় ভেঙে পড়ে তার ধাপে ধাপে বিশ্লেষণ

চূড়ান্ত উত্তর একমাত্র মেট্রিক হিসেবে — এবং এটি কী লুকিয়ে রাখে

ভাষা মডেলের জন্য বেশিরভাগ বেঞ্চমার্ক স্কুলের পরীক্ষার মতো সাজানো: একটি প্রশ্ন আছে, একটি আদর্শ উত্তর আছে, আর মিল যাচাই আছে। এমন মেট্রিক হিসাব করা সুবিধাজনক, মডেল তুলনাও সুবিধাজনক। কিন্তু এই কাঠামোর একটি অন্তর্নিহিত ত্রুটি আছে: এটি ফলাফল মূল্যায়ন করে, সেখানে পৌঁছানোর পথ নয়।

এমন একটি কাজের কথা ভাবুন যেখানে চারটি তথ্য সংযুক্ত করতে হবে। মডেল দ্বিতীয়টিতে গুলিয়ে ফেলে, চতুর্থটিতে আকস্মিকভাবে অনুমান করে সঠিক বলে ফেলে — আর নম্বর পেয়ে যায়। কিংবা উল্টোটা: তিনটি ধাপ নিখুঁতভাবে সাজানো, কিন্তু শেষ উত্তরটি একটি শব্দচয়নে আলাদা — আর নম্বর নেই। দুই ক্ষেত্রেই চূড়ান্ত সংখ্যাটি ভেতরে আসলে কী ঘটেছে সে সম্পর্কে মিথ্যা বলে। বহু-ধাপের প্রশ্নের ক্ষেত্রে এটি বিশেষভাবে যন্ত্রণাদায়ক: সেখানে একটি দক্ষতা নয়, দক্ষতাগুলোর একটি ক্রম পরীক্ষা করা হয় — তথ্য খুঁজে বের করা, তা ধরে রাখা, পরবর্তীগুলোর সঙ্গে সংযুক্ত করা, পথে হারিয়ে না ফেলা।

"ঠিক কোথায় ভেঙেছে" সেই নির্ণয় — এটি কোনো একাডেমিক খুঁতখুঁতে নয়। এর উপর নির্ভর করে কী ঠিক করতে হবে: ডেটা কর্পাস, প্রশিক্ষণ কৌশল, নাকি প্রম্পটের শব্দচয়ন। চূড়ান্ত নির্ভুলতা এই প্রশ্নের উত্তর দিতে পারে না, সংজ্ঞা অনুযায়ীই পারে না।

Omanic কী

ঠিক এই অন্ধ অঞ্চলটিই পূরণ করে "Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models" কাজটি (arXiv:2603.16654, cs.CL বিভাগে চলে, cs.AI এবং cs.LG-তেও অন্তর্ভুক্ত, EMNLP 2026 Findings-এ গৃহীত)। লেখকদল বিস্তৃত ও আন্তর্জাতিক: Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li। প্রথম সংস্করণ প্রকাশিত হয় ১৭ মার্চ ২০২৬-এ, এরপর দুটি সংশোধনী আসে — মে ও আগস্টে।

Omanic হলো চার ধাপের যুক্তির একটি open-domain বেঞ্চমার্ক। "open-domain" শব্দটি এখানে মূল বিষয়: মডেল কোনো তৈরি তালিকা থেকে বিকল্প বেছে নেয় না, আর একটিমাত্র আগে থেকে প্রস্তুত নথিতে খোঁজও করে না। তথ্য নিজে খুঁজে বের করতে হয়, তারপরই তা থেকে একটি শৃঙ্খল গড়তে হয়। এমন উপস্থাপনা বাস্তব পরিস্থিতির কাছাকাছি, যেখানে উত্তর প্রায় কখনোই একটিমাত্র অনুচ্ছেদে থাকে না।

একটি নয়, দুটি কর্পাস

Omanic-এর ভেতরে দুটি ভিন্ন ডেটাসেট আছে, আর এদের গুলিয়ে ফেলা উচিত নয়।

প্রথমটি — OmanicSynth, ১০,২৯৬টি মেশিন-উৎপন্ন উদাহরণ। এটি প্রশিক্ষণ উপাদান: এটিকে সুপারভিশন হিসেবে ব্যবহার করা যায়, আর ঠিক এটিতেই লেখকেরা পরীক্ষা করেছিলেন ধাপে ধাপে যুক্তি করার ক্ষমতা স্থানান্তরিত হয় কি না।

দ্বিতীয়টি — OmanicBench, ৯৬৭টি উদাহরণ, যা বিশেষজ্ঞ যাচাইয়ের মধ্য দিয়ে গেছে এবং হাতে অ্যানোটেশন করা। এটি মূল্যায়নের অংশ, আর এটি যথেষ্ট ছোট — যা যুক্তিসঙ্গত, কারণ ধাপ-স্তরের মানবিক চিহ্নিতকরণ ব্যয়বহুল।

এমন বিভাজন কোনো আনুষ্ঠানিকতা নয়। এটি "মডেলকে প্রশিক্ষণ দেওয়া হয়েছে" এবং "মডেল সত্যিই পারে" — এই দুটিকে আলাদা করতে দেয়: প্রশিক্ষণ কর্পাস বড় ও মেশিন-নির্মিত, যাচাইয়ের কর্পাস সংক্ষিপ্ত ও নিখুঁতভাবে যাচাই করা।

ধাপে ধাপে অ্যানোটেশন কীভাবে সাজানো

সাধারণ QA-সেট থেকে Omanic-এর মূল পার্থক্য হলো প্রতিটি প্রশ্ন উপাদানে বিশ্লেষণ করা হয়েছে। এক-ধাপের উপপ্রশ্ন, মধ্যবর্তী উত্তর, কাঠামোবদ্ধ গ্রাফ টপোলজি — অর্থাৎ তথ্যগুলো ঠিক কীভাবে একে অপরের সঙ্গে সম্পর্কিত তার একটি ছক।

এটি মূল্যায়নকে একটি বিন্দু থেকে নিয়ন্ত্রণ-বিন্দুর একটি সেটে পরিণত করে। এখন শুধু "মডেল সঠিক উত্তর দিয়েছে কি না" নয়, "ঠিক কোন переходে সে হোঁচট খেয়েছে" তাও দেখা যায়। গ্রাফ কাঠামো এখানে আরও গুরুত্বপূর্ণ কারণ বিভিন্ন ধরনের সম্পর্ক মডেলের জন্য বিভিন্ন সহজতার: একটি জিনিস হলো বস্তুর বৈশিষ্ট্য বের করা, সম্পূর্ণ ভিন্ন একটি জিনিস হলো চারটি ধারাবাহিক নির্ভরতার শৃঙ্খল অনুসরণ করা।

তিনটি রোগনির্ণয় যা কেবল ধাপে ধাপেই দেখা যায়

বন্ধ ও খোলা মডেল নিয়ে পরীক্ষা তিনটি পর্যবেক্ষণ দিয়েছে, যা চূড়ান্ত মেট্রিক কেবল দেখাতেই অক্ষম।

শেষের ধাপে সংকীর্ণ স্থান

প্রথম সিদ্ধান্তটিকে লেখকেরা বলেন later-hop bottleneck। কথা হলো, মূল ক্ষতি শুরুতে নয়, শৃঙ্খলের শেষের দিকে জমা হয়। প্রথম-দ্বিতীয় переход মডেল তুলনামূলক আত্মবিশ্বাসের সঙ্গে পার করে, কিন্তু তৃতীয় ও চতুর্থে ভাঙতে শুরু করে।

ব্যাখ্যা নিজেই এসে পড়ে: শৃঙ্খল যত দীর্ঘ, তত বেশি মধ্যবর্তী সত্তাকে একসঙ্গে সক্রিয় অবস্থায় ধরে রাখতে হয়। শেষের ধাপে মডেলকে আর মূল প্রশ্ন নিয়ে কাজ করতে হয় না, বরং নিজের পূর্ববর্তী সিদ্ধান্তের ফলাফল নিয়ে — আর সেখানে যেকোনো অসূক্ষ্মতা বহুগুণ হয়ে যায়। ব্যবহারিক সিদ্ধান্তটি তাদের জন্য অপ্রীতিকর যারা দীর্ঘ বহু-পর্যায়ের পাইপলাইন গড়তে ভালোবাসেন: পঞ্চম ও ষষ্ঠ ধাপ যোগ করা যা মনে হয় তার চেয়ে বেশি ব্যয়বহুল হতে পারে।

প্রামাণ্য জ্ঞানের "মেঝে"

দ্বিতীয় ঘটনা — factual knowledge floor, প্রামাণ্য জ্ঞানের "মেঝে"। কিছু ভুলের সঙ্গে যুক্তির কোনো সম্পর্কই নেই: মডেলের কাছে প্রয়োজনীয় তথ্যটি নেই, আর সৎভাবে থেমে যাওয়ার বদলে শূন্যের উপর দাঁড়িয়ে যুক্তি গড়তে থাকে।

এটি একটি গুরুত্বপূর্ণ পার্থক্য। মডেল যখন সিদ্ধান্তে ভুল করে — প্রশ্ন যুক্তির উপর। মডেল যখন মূল তথ্যটি জানে না — প্রশ্ন ডেটার উপর এবং সে অজ্ঞতা স্বীকার করতে পারে কি না তার উপর। দ্বিতীয়টি ভালোভাবে সারানো যায় না: ধাপে ধাপে যুক্তি বা আরও বুদ্ধিমান প্রম্পট কোনোটিই সাহায্য করবে না, যদি প্রথম звено-র নিচে ভিত্তিই না থাকে।

শৃঙ্খল ধরে এগিয়ে চলা ভুল

তৃতীয় রোগনির্ণয় — শৃঙ্খল বরাবর ভুলের বিস্তার। প্রাথমিক অসূক্ষ্মতা স্থানীয় থাকে না: পরবর্তী ধাপগুলো তা তুলে নেয় এবং তা আত্মবিশ্বাসী, মসৃণভাবে প্রণীত, কিন্তু ভুল চূড়ান্ত উত্তরে পরিণত হয়।

এখানেই মূল্যায়নের একটি ফাঁদ লুকিয়ে আছে। যে মডেল একবার ভুল করেছে এবং তারপর ধারাবাহিকভাবে যুক্তি করেছে, আর যে মডেল প্রতিটি ধাপে ভেঙে পড়েছে, চূড়ান্ত মেট্রিকে দুটোই একই রকম দেখায় — দুটোই অনুমান করতে পারেনি। ধাপে ধাপে বিশ্লেষণ এদের আলাদা করে, আর এটি ঠিক সেই ক্ষেত্র যেখানে রোগনির্ণয় চূড়ান্ত নম্বরের চেয়ে মূল্যবান।

শিক্ষণ স্থানান্তর: ছয়টি বেঞ্চমার্কে ৭.৪১ পয়েন্ট

আলাদা একটি প্রশ্ন — এই অ্যানোটেশন কেবল পরিমাপের জন্য নয়, প্রশিক্ষণের জন্যও ব্যবহার করা যায় কি না। লেখকেরা পরীক্ষা করেছেন: OmanicSynth-এ ফাইন-টিউনিং যুক্তি ও গণিত-সংক্রান্ত ছয়টি বাইরের বেঞ্চমার্কে উন্নতি দিয়েছে, গড়ে ৭.৪১ পয়েন্ট বৃদ্ধি।

সংখ্যাটি সঠিকভাবে পড়া উচিত। এটি "মডেল সব বিষয়ে আরও বুদ্ধিমান হয়েছে" নয় — এটি "বিশ্লেষিত শৃঙ্খলে অনুশীলিত দক্ষতা একই ধরনের অন্য কাজে স্থানান্তরিত হয়"। যা নিজেই বেঞ্চমার্কের প্রকৃতি সম্পর্কে বলে: এটি নির্দিষ্ট প্রশ্ন মুখস্থ করা নিয়ে নয়, বরং পদ্ধতির প্রশিক্ষণ নিয়ে — কীভাবে একটি কাজকে ধাপে ভাগ করতে হয় এবং তাদের মধ্যে সংযোগ ধরে রাখতে হয়।

অনুশীলনের জন্য এর অর্থ কী

বর্ণিত বিষয় থেকে কয়েকটি সিদ্ধান্ত নিজেই এসে পড়ে।

ফলাফল নয়, ধাপে ধাপে মূল্যায়ন করুন। যদি আপনার সিস্টেম বহু-ধাপের উত্তর তৈরি করে, একটি চূড়ান্ত মেট্রিকই যথেষ্ট নয় — এটি প্রকৃতিতে ভিন্ন ভিন্ন ব্যর্থতাকে একটি অস্পষ্ট সংখ্যায় গড় করে ফেলবে।

"জানি না" এবং "ভুলভাবে অনুমান করেছি" আলাদা করুন। এরা দুটি ভিন্ন ত্রুটি, ভিন্ন চিকিৎসা পদ্ধতিসহ, কিন্তু সাধারণ রিপোর্টিংয়ে এরা মিলে যায়।

দীর্ঘ শৃঙ্খলে সতর্ক থাকুন। শেষের ধাপগুলোই সবচেয়ে দুর্বল জায়গা। কখনো একটি দীর্ঘ শৃঙ্খল শেষ পর্যন্ত চালানোর চেয়ে কাজটিকে কয়েকটি স্বাধীন উপকাজে ভাগ করা বুদ্ধিমানের।

বিশ্লেষণ নিজেই একটি প্রশিক্ষণ সংকেত। ছয়টি বাইরের সেটে স্থানান্তরের ফলাফল দেখায় যে ধাপে ধাপে অ্যানোটেশন কেবল একটি মাপকাঠি হিসেবে নয়, প্রশিক্ষণের উপাদান হিসেবেও কাজ করে।

Omanic যা নয়

সীমানা চিহ্নিত করা উপকারী। Omanic কোনো মডেলের বুদ্ধির সার্বজনীন মূল্যায়ন নয়, আর একসঙ্গে সবকিছুর পরীক্ষাও নয়। এটি একটি নির্দিষ্ট কাজের জন্য একটি হাতিয়ার: খোলা ডোমেনের বহু-ধাপের প্রশ্নে যুক্তির কোন звено-তে ব্যর্থতা ঘটে তা দেখানো।

মূল্যায়নের অংশের আকার — ৯৬৭টি উদাহরণ — সেটিও মনে রাখা উচিত: সেটটি নিখুঁতভাবে যাচাই করা, কিন্তু বিশাল নয়। প্রশিক্ষণের অংশটি তার চেয়ে অনেক বড় এবং মেশিন-নির্মিত, যা পরিসর দেয়, কিন্তু হাতে যাচাইয়ের বিকল্প নয়।

আর মূল কথা: রোগনির্ণয় নিজে থেকে কিছু সারায় না। মডেল শেষের ধাপে হোঁচট খায় — এই জ্ঞান একটি সূচনা বিন্দু, সমাধান নয়। এরপর শুরু হয় সাধারণ কাজ: কোথায় ডেটা যোগ করতে হবে, কোথায় শৃঙ্খল সরল করতে হবে, কোথায় মডেলকে থেমে "আমি এটি জানি না" বলতে শেখাতে হবে।

ডেটা ও কোড লেখকেরা উন্মুক্তভাবে প্রকাশ করেছেন; কাজটি DOI 10.48550/arXiv.2603.16654-এ পাওয়া যায়।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
ওমানিক: LLM-এর লজিক ঠিক কোথায় ভেঙে পড়ে তার ধাপে ধাপে বিশ্লেষণ