الثقة ليست صوابًا: كيف تفشل النماذج اللغوية الكبيرة في المعايرة في لعبة الشكل المخفي

18 سبتمبر 202611 الآراء

ورقة بحثية أولية جديدة من arXiv تتحقق مما إذا كان يمكن الاعتماد على التقييم الذاتي لنموذج لغوي في لحظة اختيار النقلة. في نسخة شطرنجية بحالة "ملكية" مخفية، تطابقت الاحتمالية المُعلنة ≥0.5 مع الوضع الفعلي للقطعة مرة واحدة فقط من أصل 62 محاولة، وقد وقع تقريبًا كل العجز في المعايرة تحديدًا في هذه الحالات.

الثقة ليست صوابًا: كيف تفشل النماذج اللغوية الكبيرة في المعايرة في لعبة الشكل المخفي

علامة «أنا واثق» في إجابة النموذج ليست قياسًا، بل ادّعاء آخر يستلزم تحققًا منفصلًا. وما دامت هذه التقديرات تُدمج في منطق الوكلاء، يجدر بنا أن نفهم إلى أي حد يمكن الوثوق بها.

لماذا أثيرت أسئلة حول الثقة

تتزايد الأنظمة الوكيلية التي تُبنى بحيث تُختار الخطوة التالية بالنظر إلى التقييم الذاتي للنموذج: فإن أعلن ثقة عالية نُفّذ الإجراء، وإن أعلن ثقة منخفضة تدخّل إنسان أو أداة أخرى. ولا يعمل هذا المخطط إلا بشرط واحد: أن تتقارب الثقة المُعلنة في لحظة التنفيذ مع معدل الإصابة الفعلي.

ويتحقق عمل Bhushan Kashinath Joshi (arXiv:2608.24691، المقدَّم في 25 أغسطس 2026) من هذا الافتراض تحديدًا — وذلك في بيئة يظهر فيها الخطأ فورًا ولا يمكن إحالته إلى سوء الحظ.

الميدان: شطرنج بملك مخفي

لا تصلح الشطرنج الكلاسيكية لمثل هذا التحقق: فكل شيء فيها مكشوف، و«الثقة» فيها تتشوش حتمًا بقوة اللعب. لذلك اختيرت صيغة ذات معلومات مخفية، حيث يمكن أن تنتقل صفة الملكية سرًّا ومرارًا من قطعة إلى أخرى. ولا يعرف اللاعب أين توجد الهدف الرئيسي الآن، ويُضطر إلى التصرف بناءً على التخمين.

تفصيل منهجي جوهري: كان يُسأل الوكيل عند كل نقلة، بشكل منفصل، عن توزيع الاحتمالات حول أي قطعة خصم تحمل صفة الملكية سرًّا. وكان ذلك يُطلب بمعزل عن النقلة نفسها — حتى لا يختلط «إلى أين ذهبت» بـ«بماذا أعتقد». وكان الموضع الحقيقي يُستعاد بعد المباراة ويُقارن بالأرقام المُعلنة.

إجابة صحيحة واحدة من اثنتين وستين

تبدو النتيجة الرئيسية كحادث. ففي سلسلتين مستقلتين من المباريات، تبيّن أن عمليات الأخذ التي جُرّت بثقة مُعلنة لا تقل عن 0.5 في موضع القطعة المخفية كانت صحيحة في حالة واحدة من 62. وإذا حُوّل ذلك إلى نسب مئوية، فقد انتهى الاحتمال المُعلن «الأرجح نعم» إلى إصابة في نحو واحد ونصف بالمئة من الحالات — وهو تباين بمقدار رتب كاملة، لا بنسب مئوية.

وفي الوقت نفسه، يتركّز عجز المعايرة بأكمله تقريبًا في هذه الأحداث تحديدًا: 99.3% في السلسلة الأصلية و98.7% في السلسلة المكررة. وبعبارة أخرى، المشكلة ليست موزعة بطبقة متساوية على المباراة كلها — بل تتركّز في اللحظات التي يعلن فيها النموذج صوابه بأعلى صوت، وتحديدًا حين يتوقف على ذلك إجراء محفوف بالمخاطر.

النمط نفسه في تهيئات أخرى

لم يقتصر المؤلف على نموذج واحد. فقد شمل التحقق أربع تهيئات أخرى، بما في ذلك مزوّد ثانٍ. وتتكرر الصورة بصيغة أضعف وتنتظم في ترتيب متسق — لكن الدقة مهمة هنا: فالتقديرات النقطية وحدها تبقى قابلة للمقارنة، أما معظم الفروق الثنائية فهي غير مميزة إحصائيًا عند هذا الحجم من العينة.

ويصف المؤلف ذلك بنفسه بأنه نطاق الاكتشاف (scope)، لا كدليل على أن مستوى قدرات النموذج يتنبأ بمعايرته. أي أننا لسنا أمام «كلما كان النموذج أذكى كان تقييمه لنفسه أفضل» ولا أمام عكس ذلك — بل ببساطة إن الظاهرة تظهر على نطاق أوسع من نظام واحد بعينه.

ميزانية الاستدلال تحرّك المقياس أكثر مما يبدو

ثمة قصة مزعجة منفصلة — مقارنة النموذج نفسه عند تصنيف خارجي ثابت في لوحة الصدارة. لا يتغير سوى ميزانية الاستدلال (deliberation budget)، أي مقدار «الوقت للتفكير» الذي يستهلكه النموذج. وهذا التحول يغيّر مقياس المعايرة تقريبًا بالقدر نفسه الذي تغيّره فجوة كبيرة بين نماذج مختلفة.

والاستنتاج العملي بسيط ومزعج: لا يمكن الاعتماد على الموقع في لوحة الصدارة عند اختيار نظام لمهام تتضمن تقييم مخاطر. فداخل النموذج نفسه، يكون التشتت الناتج عن الإعداد مماثلًا لما اعتدنا اعتباره ميزة جدية لنموذج على آخر.

المقاييس التقليدية قد تُظهر العكس

ثمة نتيجة أخرى تضرب طرق القياس المعتادة. فعلى مقعد منفصل (seat)، قد تتباين محاور التقييم المعيارية — قانونية النقلات، والتكلفة، وزمن الاستجابة، ونسبة المباريات المُكملة — تباينًا تامًّا مع جودة معتقدات النموذج. والتهيئة التي تفوّقت في جميع المؤشرات التقليدية دفعة واحدة أظهرت أدنى جودة للمعتقدات بين كل ما خضع للاختبار.

ومن السهل هنا الخطأ في التفسير: فالمسألة ليست أن الدقة ورخص التكلفة ضارتان بحد ذاتهما. بل أن مجموعة المقاييس التي نعتبرها عادة شاملة لا تقيس ببساطة الخصيصة التي تهمنا — إنها تقيس شيئًا آخر.

لماذا لن يلتقط التقييم «بالنتيجة» شيئًا

أكثر ما يزعج في الأثر هو التمويه. فالنموذج ذو النمط الموصوف قد يفوز مع ذلك بتلك المباراة نفسها التي بنى فيها معتقدات خاطئة. فالنتيجة جيدة، بينما كانت الصورة الداخلية للعالم غير صحيحة.

ويترتب على ذلك أن التحقق بالنتيجة وحدها (outcome-only) لا يكشف مثل هذه الإخفاقات من حيث المبدأ: فالفوز يُغلق المسألة، ويبقى موضع الضعف في النظام حتى المرة التالية — لكن في مهمة قد لا تأتي فيها النتيجة الصحيحة أبدًا.

ما العمل بهذا عمليًا

عدة استنتاجات عملية تنبع من النتائج مباشرة.

  • أن تطلب من النموذج توزيعه الاحتمالي الخاص حول المجهول الرئيسي — وأن تحفظه منفصلًا عن الإجراء المختار. فبدون الفصل بين هذين الأمرين لا يمكن تقييم المعايرة.
  • أن تقارن الثقة المُعلنة بمعدل الإصابة الفعلي على بياناتك الخاصة، لا أن تثق بالأرقام الواردة في بطاقة النموذج. فقد كان التباين هائلًا في لعبة القطعة المخفية، ولا شيء يضمن أن يكون أصغر في مهمة تطبيقية.
  • أن تتحقق من العتبة التي يحوّل عندها النظام القرار إلى إنسان، بمعزل عن الدقة العامة. فالزلات تتكدّس تحديدًا في منطقة الثقة المُعلنة العالية.
  • أن تثبّت ميزانية الاستدلال في أي مقارنة. وإلا فأنت تقيس الإعداد، لا النموذج.
  • ألّا تعتبر الفوز أو النتيجة الناجحة دليلًا على صحة المعتقدات الداخلية للنظام.

المعنى العام للاكتشاف ليس أن النماذج «سيئة». بل بالأحرى أن الثقة والصواب مؤشران مختلفان، وأن الأول لا يصلح بعد بديلًا عن الثاني. وما دامت المعماريات الوكيلية تُبنى حول التقييم الذاتي، فسيتعيّن قياس هذا الفرق صراحةً.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
الثقة ليست صوابًا: كيف تفشل النماذج اللغوية الكبيرة في المعايرة في لعبة الشكل المخفي