BEAR-Bench: দ্বিভাষিক পরীক্ষা ব্যবসা ও বিজ্ঞানের নথিতে AI মডেলের যুক্তি মূল্যায়নের জন্য

4 সেপ্টেম্বর 2026৯ প্রদর্শন

গবেষকরা BEAR-Bench বেঞ্চমার্ক উপস্থাপন করেছেন, যা পরীক্ষা করে যে মাল্টিমোডাল মডেলগুলো রুশ এবং ইংরেজিতে টেক্সট-সমৃদ্ধ পেশাদার নথির উপর কতটা ভালোভাবে যুক্তি করতে পারে। সেটে ১০০০টি মানব-চিহ্নিত প্রশ্ন অন্তর্ভুক্ত ছিল, এবং ১৬টি মডেলের পরীক্ষায় দেখা গেছে যে এমনকি সবচেয়ে শক্তিশালী সিস্টেমগুলোও আদর্শ থেকে অনেক দূরে।

BEAR-Bench: দ্বিভাষিক পরীক্ষা ব্যবসা ও বিজ্ঞানের নথিতে AI মডেলের যুক্তি মূল্যায়নের জন্য

BEAR-Bench কেন প্রয়োজন

আধুনিক মাল্টিমোডাল মডেলগুলো ছবির বস্তু চিনতে এবং ছবি সম্পর্কিত প্রশ্নের উত্তর দিতে পারদর্শী, কিন্তু ঘন টেক্সট-সমৃদ্ধ নথি — বিশেষ করে পেশাদার নথি — নিয়ে কাজ করার দক্ষতা প্রায়ই অলক্ষিত থেকে যায়। বিদ্যমান বেঞ্চমার্কগুলো মূলত তথ্য আহরণ পরীক্ষা করে, সংকীর্ণ বিষয়ভিত্তিক জ্ঞান দাবি করে, অথবা ব্যবসায়িক নথিগুলোকে শুধুমাত্র একটি গৌণ পরিস্থিতি হিসেবে বিবেচনা করে। তাছাড়া, বেশিরভাগ পরীক্ষা ইংরেজি এবং চীনা ভাষার উপর কেন্দ্রীভূত: রুশ ভাষার কন্টেন্ট সেখানে প্রায় অনুপস্থিত।

BEAR-Bench এই শূন্যতা পূরণ করে। এটি একটি নতুন দ্বিভাষিক বেঞ্চমার্ক যা ব্যবসা এবং বিজ্ঞানের টেক্সট-সমৃদ্ধ নথি সম্পর্কে AI-এর যুক্তি করার ক্ষমতা মূল্যায়ন করে। কাজটি arXiv-এ একটি নিবন্ধে উপস্থাপিত হয়েছে (নম্বর 2608.17895), যা লিউবো চুবারোভা, আলেকজান্দ্রা কুলেশোভা, দানিল ভলকভ, কিরিল সুলতানভ এবং আলেক্সি জাইতসেভ প্রস্তুত করেছেন।

পরীক্ষাটি কীভাবে কাজ করে

BEAR-Bench-এর প্রধান বৈশিষ্ট্য হল স্বয়ংসম্পূর্ণতা। মডেলটিকে অতিরিক্ত উৎস খুঁজতে হয় না: সমস্ত প্রয়োজনীয় ডেটা নথির ভিতরেই থাকে। পরীক্ষায় ১০০০টি প্রশ্ন রয়েছে, যা ম্যানুয়ালি চিহ্নিত, ইংরেজি এবং রুশ ভাষায়। প্রশ্নগুলো বাস্তব ব্যবসায়িক এবং একাডেমিক উপকরণের উপর ভিত্তি করে তৈরি, যেখানে শুধু সঠিক লাইন খুঁজে বের করাই গুরুত্বপূর্ণ নয়, বরং যৌক্তিক সিদ্ধান্ত নেওয়া, সংখ্যা তুলনা করা বা নথির অবস্থান ব্যাখ্যা করাও জরুরি।

এটি বেঞ্চমার্কটিকে সাধারণ তথ্য-অনুসন্ধান পরীক্ষা থেকে মৌলিকভাবে আলাদা করে: মডেলটিকে দ্রুত টেক্সট স্ক্যান করার ক্ষমতা নয়, বরং প্রকৃত যুক্তি প্রদর্শন করতে হবে। দ্বিভাষিকতার কারণে ডেভেলপাররা পরীক্ষা করতে পারেন যে মডেলটি পেশাদার শব্দভাণ্ডার এবং বিভিন্ন ভাষাগত কাঠামোর সাথে কতটা স্থিতিশীলভাবে মোকাবিলা করে।

ফলাফল: শক্তিশালী মডেলগুলিও ভুল করে

মূল্যায়নে ১৬টি মডেল অংশ নিয়েছে — মালিকানাধীন এবং ওপেন-ওয়েট উভয় ধরনের। তাদের মধ্যে Gemini 3.1 Pro এবং Qwen3.5-397B-এর মতো বড় সিস্টেম ছিল। এমনকি শীর্ষস্থানীয়রাও বর্তমান স্তর এবং আদর্শ ফলাফলের মধ্যে একটি লক্ষণীয় ব্যবধান দেখিয়েছে।

মজার বিষয় হল, লেখকরা শুধুমাত্র সাধারণ র্যাঙ্কিংয়ের মধ্যে সীমাবদ্ধ থাকেননি। তারা হ্যালুসিনেশন সনাক্তকরণের জনপ্রিয় পদ্ধতিগুলির তুলনা করার জন্য BEAR-Bench-এ মডেলগুলির ফলাফল ব্যবহার করেছেন। অর্থাৎ, তারা শুধু মূল্যায়ন করেনি যে মডেলটি কত ঘন ঘন ভুল করে, বরং বিদ্যমান পদ্ধতিগুলির মাধ্যমে এই ভুলগুলি কতটা নির্ভরযোগ্যভাবে সনাক্ত করা যায় তাও দেখেছে। এটি একটি গুরুত্বপূর্ণ ব্যবহারিক দিক: নথি নিয়ে কাজ করবে এমন যেকোনো সিস্টেমকে শুধু প্রশিক্ষণ দেওয়াই নয়, তার উত্তর নিয়ন্ত্রণ করতেও সক্ষম হতে হবে।

ডেভেলপারদের জন্য উপসংহার

BEAR-Bench পেশাদার টেক্সট কাজের জন্য AI গুণমান যাচাইয়ের একটি নতুন মান নির্ধারণ করে। দ্বিভাষিক কর্পাস এবং তথ্য অনুসন্ধানের পরিবর্তে যুক্তির উপর ফোকাস এটিকে মডেল তুলনার জন্য একটি সুবিধাজনক হাতিয়ার করে তোলে। রুশ-ভাষার অংশের উপস্থিতি স্থানীয় বাজারের জন্য পরীক্ষার সুযোগ বাড়ায়, এবং সামগ্রিক মূল্যায়ন চিত্রে হ্যালুসিনেশন সনাক্তকরণ পদ্ধতি অন্তর্ভুক্ত করা অনুশীলনকারীদের আরও নিরাপদ সমাধান বেছে নিতে সাহায্য করে।

এখনও পর্যন্ত কোনো মডেলই বেঞ্চমার্কের সর্বোচ্চ সীমার কাছাকাছি পৌঁছায়নি — অর্থাৎ, এই ক্ষেত্রে উন্নতির সুযোগ রয়েছে। নথি নিয়ে কাজ করার জন্য সহায়ক সরঞ্জাম তৈরি করছে এমন দলগুলির জন্য, BEAR-Bench কোন দক্ষতাগুলো প্রথমে উন্নত করতে হবে তার একটি নির্দেশিকা হয়ে উঠবে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
BEAR-Bench: দ্বিভাষিক পরীক্ষা ব্যবসা ও বিজ্ঞানের নথিতে AI মডেলের যুক্তি মূল্যায়নের জন্য