معيار BEAR-Bench: اختبار ثنائي اللغة لتقييم منطق نماذج الذكاء الاصطناعي على المستندات التجارية والعلمية

4 سبتمبر 20269 الآراء

قدّم الباحثون معيارًا مرجعيًا باسم BEAR-Bench لاختبار مدى جودة تفكير النماذج متعددة الوسائط في المستندات المهنية الغنية بالنصوص باللغتين الروسية والإنجليزية. تضمّنت المجموعة 1000 سؤال مُعلَّم يدويًا، وأظهرت اختبارات 16 نموذجًا أن حتى أقوى الأنظمة لا تزال بعيدة عن المثالية.

معيار BEAR-Bench: اختبار ثنائي اللغة لتقييم منطق نماذج الذكاء الاصطناعي على المستندات التجارية والعلمية

لماذا نحتاج إلى BEAR-Bench

النماذج متعددة الوسائط الحديثة تتعرّف بثقة على الأشياء في الصور وتجيب عن الأسئلة المتعلقة بالصور، لكن مهاراتها في التعامل مع المستندات النصية الكثيفة — خاصة المهنية منها — غالبًا ما تبقى خارج نطاق الاهتمام. المعايير الحالية تختبر في الغالب استخراج الحقائق، أو تتطلب معرفة تخصصية ضيقة، أو تتعامل مع الأوراق التجارية فقط كأحد السيناريوهات الثانوية. وفي الوقت نفسه، معظم هذه الاختبارات موجّهة للغتين الإنجليزية والصينية: المحتوى الناطق بالروسية غير ممثَّل فيها عمليًا.

يسدّ BEAR-Bench هذه الفجوة. إنه معيار جديد ثنائي اللغة يقيّم قدرة الذكاء الاصطناعي على التفكير في المستندات الغنية بالنصوص من مجالي الأعمال والعلوم. العمل معروض في مقال على arXiv (الرقم 2608.17895)، وقد أعدّه ليوبو تشوباروفا، وألكسندرا كوليشوفا، ودانييل فولكوف، وكيريل سلطانوف، وأليكسي زايتسيف.

كيف يعمل الاختبار

أبرز ميزة في BEAR-Bench هي الاكتفاء الذاتي. لا تحتاج النماذج إلى البحث عن مصادر إضافية: فجميع البيانات اللازمة موجودة داخل المستندات نفسها. يتضمن الاختبار 1000 سؤال مُعلَّم يدويًا، باللغتين الإنجليزية والروسية. صِيغت الأسئلة حول مواد تجارية وأكاديمية حقيقية، حيث المهم ليس مجرد العثور على السطر الصحيح، بل الوصول إلى استنتاج منطقي، أو مقارنة الأرقام، أو تفسير موضع في المستند.

هذا ما يميّز المعيار جوهريًا عن الاختبارات البسيطة للبحث عن المعلومات: يجب على النموذج أن يُظهر تفكيرًا فعليًا، لا مجرد قدرة على مسح النص بسرعة. وبفضل ثنائية اللغة، يمكن للمطوّرين التحقق من مدى متانة تعامل النموذج مع المصطلحات المهنية والتراكيب اللغوية المختلفة.

النتائج: النماذج القوية تخطئ أيضًا

شارك في التقييم 16 نموذجًا — سواء كانت مملوكة أو مفتوحة الأوزان. ومن بينها أنظمة كبيرة مثل Gemini 3.1 Pro وQwen3.5-397B. حتى النماذج الرائدة أظهرت فجوة ملحوظة بين مستواها الحالي والنتيجة المثالية.

من المثير للاهتمام أن المؤلفين لم يكتفوا بترتيب بسيط. فقد استخدموا نتائج النماذج على BEAR-Bench لمقارنة الطرق الشائعة لكشف الهلوسات. أي أنهم لم يقيّموا فقط عدد مرات خطأ النموذج، بل أيضًا مدى موثوقية اكتشاف هذه الأخطاء بالأساليب الحالية. هذا جانب عملي مهم: أي نظام يُفترض أن يعمل مع المستندات لا يحتاج فقط إلى التدريب، بل أيضًا إلى القدرة على مراقبة إجاباته.

استنتاجات للمطوّرين

يضع BEAR-Bench معيارًا جديدًا لفحص جودة الذكاء الاصطناعي في العمل المهني مع النصوص. فالمجموعة ثنائية اللغة والتركيز على المنطق بدلًا من البحث عن المعلومات يجعلانه أداة ملائمة لمقارنة النماذج. ووجود الجزء الروسي يوسّع إمكانيات الاختبار للأسواق المحلية، وإدراج طرق كشف الهلوسات في الصورة العامة للتقييم يساعد الممارسين على اختيار حلول أكثر أمانًا.

حتى الآن لم يقترب أي نموذج من سقف المعيار — وهذا يعني أن هناك مجالًا للنمو في هذا المجال. بالنسبة للفرق التي تطوّر مساعدين للعمل مع المستندات، سيكون BEAR-Bench مرجعًا للمهارات التي يجب تطويرها أولًا.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
معيار BEAR-Bench: اختبار ثنائي اللغة لتقييم منطق نماذج الذكاء الاصطناعي على المستندات التجارية والعلمية