BEAR-Bench: व्यावसायिक और वैज्ञानिक दस्तावेज़ों पर AI मॉडल के तर्क का मूल्यांकन करने के लिए द्विभाषी परीक्षण

4 सितम्बर 20269 बार देखा गया

शोधकर्ताओं ने BEAR-Bench बेंचमार्क प्रस्तुत किया है, जो जाँचता है कि मल्टीमॉडल मॉडल रूसी और अंग्रेजी में पाठ-समृद्ध पेशेवर दस्तावेज़ों पर कितनी अच्छी तरह तर्क करते हैं। सेट में मानव-चिह्नित 1000 प्रश्न शामिल हैं, और 16 मॉडलों के परीक्षणों से पता चला कि सबसे मजबूत सिस्टम भी आदर्श से दूर हैं।

BEAR-Bench: व्यावसायिक और वैज्ञानिक दस्तावेज़ों पर AI मॉडल के तर्क का मूल्यांकन करने के लिए द्विभाषी परीक्षण

BEAR-Bench क्यों आवश्यक है

आधुनिक मल्टीमॉडल मॉडल तस्वीरों में वस्तुओं को आत्मविश्वास से पहचानते हैं और छवियों पर आधारित सवालों के जवाब देते हैं, लेकिन घने टेक्स्ट वाले दस्तावेज़ों — विशेष रूप से पेशेवर दस्तावेज़ों — के साथ काम करने की उनकी क्षमताएँ अक्सर अनदेखी रह जाती हैं। मौजूदा बेंचमार्क मुख्य रूप से तथ्य निष्कर्षण की जाँच करते हैं, विशेष विषय ज्ञान की माँग करते हैं, या व्यावसायिक दस्तावेज़ों को केवल एक गौण परिदृश्य के रूप में देखते हैं। इसके अलावा, अधिकांश परीक्षण अंग्रेज़ी और चीनी भाषाओं पर केंद्रित हैं: रूसी भाषा की सामग्री उनमें लगभग अनुपस्थित है।

BEAR-Bench इस अंतर को भरता है। यह एक नया द्विभाषी बेंचमार्क है जो व्यवसाय और विज्ञान के टेक्स्ट-समृद्ध दस्तावेज़ों के बारे में तर्क करने की AI की क्षमता का मूल्यांकन करता है। यह कार्य arXiv पर एक लेख (नंबर 2608.17895) में प्रस्तुत किया गया है, जिसे ल्यूबो चुबारोवा, एलेक्ज़ेंड्रा कुलेशोवा, डेनियल वोल्कोव, किरिल सुल्तानोव और एलेक्सी ज़ैतसेव ने तैयार किया है।

परीक्षण कैसे काम करता है

BEAR-Bench की मुख्य विशेषता इसकी आत्मनिर्भरता है। मॉडल को अतिरिक्त स्रोत खोजने की आवश्यकता नहीं होती: सभी आवश्यक डेटा दस्तावेज़ों के भीतर ही मौजूद होता है। परीक्षण में अंग्रेज़ी और रूसी में मैन्युअल रूप से एनोटेट किए गए 1000 प्रश्न शामिल हैं। प्रश्न वास्तविक व्यावसायिक और शैक्षणिक सामग्रियों के इर्द-गिर्द बनाए गए हैं, जहाँ केवल सही पंक्ति ढूँढना ही नहीं, बल्कि तार्किक निष्कर्ष निकालना, आँकड़ों की तुलना करना या दस्तावेज़ के प्रावधान की व्याख्या करना महत्वपूर्ण है।

यह बेंचमार्क को सूचना खोज के सरल परीक्षणों से मौलिक रूप से अलग करता है: मॉडल को तेज़ी से टेक्स्ट स्कैन करने की क्षमता नहीं, बल्कि वास्तविक तर्क प्रदर्शित करनी चाहिए। द्विभाषी होने के कारण, डेवलपर्स यह जाँच सकते हैं कि मॉडल पेशेवर शब्दावली और विभिन्न भाषाई संरचनाओं से कितनी मज़बूती से निपटता है।

परिणाम: मज़बूत मॉडल भी गलतियाँ करते हैं

मूल्यांकन में 16 मॉडलों ने भाग लिया — दोनों मालिकाना और खुले वज़न वाले। इनमें Gemini 3.1 Pro और Qwen3.5-397B जैसी बड़ी प्रणालियाँ शामिल थीं। यहाँ तक कि अग्रणी मॉडलों ने भी वर्तमान स्तर और आदर्श परिणाम के बीच उल्लेखनीय अंतर दिखाया।

दिलचस्प बात यह है कि लेखकों ने खुद को सरल रैंकिंग तक सीमित नहीं रखा। उन्होंने लोकप्रिय भ्रम-पहचान (हैलुसिनेशन डिटेक्शन) विधियों की तुलना करने के लिए BEAR-Bench पर मॉडलों के परिणामों का उपयोग किया। यानी, उन्होंने न केवल यह आकलन किया कि मॉडल कितनी बार गलती करता है, बल्कि यह भी कि मौजूदा दृष्टिकोणों से इन गलतियों का पता लगाना कितना विश्वसनीय है। यह एक महत्वपूर्ण व्यावहारिक पहलू है: दस्तावेज़ों के साथ काम करने वाली किसी भी प्रणाली को न केवल प्रशिक्षित करने की आवश्यकता है, बल्कि उसके उत्तरों को नियंत्रित करने में भी सक्षम होना चाहिए।

डेवलपर्स के लिए निष्कर्ष

BEAR-Bench पेशेवर टेक्स्ट कार्य के लिए AI गुणवत्ता जाँच का एक नया मानक स्थापित करता है। द्विभाषी कॉर्पस और सूचना खोज के बजाय तर्क पर ध्यान केंद्रित करना इसे मॉडलों की तुलना के लिए एक सुविधाजनक उपकरण बनाता है। रूसी भाषा के भाग की उपस्थिति स्थानीय बाज़ारों के लिए परीक्षण के अवसरों का विस्तार करती है, और मूल्यांकन की समग्र तस्वीर में भ्रम-पहचान विधियों को शामिल करना व्यवसायियों को अधिक सुरक्षित समाधान चुनने में मदद करता है।

अभी तक कोई भी मॉडल बेंचमार्क की ऊपरी सीमा के करीब नहीं पहुँचा है — इसका मतलब है कि इस क्षेत्र में विकास की गुंजाइश है। दस्तावेज़ों के साथ काम करने के लिए सहायक विकसित करने वाली टीमों के लिए, BEAR-Bench एक दिशानिर्देश बन जाएगा कि किन कौशलों को सबसे पहले बेहतर बनाने की आवश्यकता है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
BEAR-Bench: व्यावसायिक और वैज्ञानिक दस्तावेज़ों पर AI मॉडल के तर्क का मूल्यांकन करने के लिए द्विभाषी परीक्षण