حكمة الجماهير تصطدم بالتشابه
عندما نحتاج إلى التنبؤ بشيء ما عن المستقبل — سلوك السوق، نتيجة حدث ما، مصير تقنية ما — تخطر فكرة بسيطة: كلما سألنا نماذج أكثر، كان الجواب أكثر موثوقية. المنطق يبدو محكمًا: الأنظمة المختلفة تخطئ بطرق مختلفة، إذن فإن حساب المتوسط سيلطّف الأخطاء العشوائية.
لكن في هذه المخطط مكيدة. إذا كانت جميع أفراد «الجماهير» تفكر بطريقة متشابهة، فإن أصواتها ليست شهادات مستقلة، بل رأي واحد مُضاعَف بالنسخ. عشرة أجوبة متشابهة تقريبًا لا تضيف معلومات مقارنة بجواب واحد؛ إنها فقط تخلق شعورًا بالثقة وتزيد فاتورة الاستدلال.
حول هذه المشكلة تحديدًا بُني العمل «Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction» — أعدّه نيروبام تشيتلابالي، إيمينغ لياو، مين-تشون تشين، وكيكي تشين. ظهرت المسودة الأولية arXiv:2608.24001 في 25 أغسطس 2026، وفي اليوم التالي صدرت نسخة منقّحة، كما قُدّمت الورقة نفسها إلى IEEE BigData 2026.
مجرد «المزيد من النماذج» لا يحل المسألة
الملاحظة الأساسية للمؤلفين: قد تتصرف نماذج لغوية كبيرة مختلفة بطرق متشابهة بشكل مفرط. فهي مدرَّبة على بيانات متقاربة، وتميل إلى صياغات متشابهة وأساليب استدلال نمطية. ونتيجة لذلك، فإن التوسّع الميكانيكي في قائمة المشاركين لا يوفّر ذلك التنوع الذي من أجله بدأ كل شيء.
من المهم هنا التمييز بين مفهومين. الكمية هي عدد النماذج التي نسألها. التنوع هو مدى اختلافها في الوصول إلى الاستنتاجات. الثاني لا ينتج عن الأول تلقائيًا: يمكن جمع عشرين مشاركًا والحصول على عشرين تنويعًا للفكرة نفسها.

المنهج: النماذج تُختار حسب أسلوب الاستدلال، لا حسب الأجوبة
كيف يبدو الانتقاء السلوكي
يقترح المؤلفون إطارًا يسمّونه سلوكي التوجّه. الجوهر ليس في مقارنة النماذج حسب صحة الأجوبة النهائية، بل في فهم كيف تفكّر.
المخطط كالتالي:
- يُشغَّل كل نموذج على مجموعة من المهام المستقلة غير المرتبطة بالتنبؤ بالمستقبل. ويُجمَع ليس الأجوبة بقدر ما تُجمَع سلاسل الاستدلال — تلك الآثار الاستدلالية نفسها.
- على أساس هذه الآثار يُبنى ملف سلوكي: ما الخطوات التي يتخذها النموذج، وكيف يقسّم المهمة، وأين يخطئ، وما الحجج التي يلجأ إليها.
- تُجمَّع النماذج في عناقيد حسب تشابه السلوك. ولهذا تُستخدم خوارزمية K-means++.
- يُؤخذ من كل عنقود ممثل واحد — وهو الميدويد، أي النموذج الأكثر نمطية في مجموعته.
- وهذه «الجماهير» المدمجة من الميدويدات هي التي تُصدر التنبؤ الجماعي.
الفكرة، إن تأمّلناها، ليست جديدة — هكذا يُعمل في الإحصاء عندما يُترك من السمات المترابطة ممثل واحد لكل مجموعة لتجنّب تكرار المعلومة نفسها. والجديد هنا أن «السمة» تصبح أسلوب استدلال النموذج اللغوي، لا خاصية عددية.
على ماذا اختُبر
التجربة مبنية على 25 نموذجًا. استُخدمت سبعة معايير تطوير لوصف النماذج وتمييزها سلوكيًا، ومعياران منفصلان — خاصان بالتنبؤ بالمستقبل — لتقييم جودة «الجماهير» الناتجة. هذا الفصل جوهري: فالمهام التي يُبنى عليها الملف لا تتطابق مع المهام التي تُحسب عليها النتيجة. وإلا لكان الأمر تدريبًا مع اطلاع مسبق، ولما كانت الأرقام تعني شيئًا يُذكر.

النتيجة: ثلاثة نماذج تتفوق على خمسة وعشرين
الأبرز في العمل هو حصيلة المقارنة. «جماهير» من ثلاثة نماذج ميدويد فقط، جُمعت عبر التجميع السلوكي، أظهرت أداءً أفضل من التصويت العادي على جميع النماذج الـ25 دفعة واحدة. وهذا صحيح بالنسبة لكلا معياري التنبؤ.
وفي الوقت نفسه كان التوفير هائلًا: انخفض عدد الاستدعاءات للنماذج بنسبة 88%، وتكاليف الاستدلال بنحو 80%. وهذا عمليًا قد يكون أهم من زيادة الدقة نفسها. فأنظمة التنبؤ غالبًا ما تصطدم ليس بجودة الجواب، بل بثمنه: إذا كان على كل سؤال أن يستدعي عشرين نموذجًا، يصبح الحل غير مربح قبل أن يصبح غير دقيق بوقت طويل.
ومن هنا ينتج استنتاج غير بديهي: تشكيلة «الجماهير» تزن أكثر من حجمها. خمسة وعشرون نموذجًا ليست ميزة تلقائية أمام ثلاثة، إذا كانت هذه الخمسة والعشرون تكرّر بعضها بعضًا في جوهرها.
ليس كل تنوع مفيدًا بالقدر نفسه
يقدّم المؤلفون استنتاجًا دقيقًا آخر يسهل إغفاله. اتضح أن المهم ليس تعظيم التنوع في حد ذاته، بل التمثيلية — أي مدى عكس المشاركين المختارين للأقطاب السلوكية المختلفة الموجودة بين النماذج.
والفرق جوهري. يمكن جمع ثلاثة نماذج تختلف عن بعضها عشوائيًا وفي تفاصيل صغيرة — والحصول على ضجيج بدل إشارة. ويمكن اختيار نموذج واحد من كل مجموعة سلوكية مختلفة فعلًا — والحصول على مجموعة مدمجة تغطي فضاء الحلول. الأول تشكيلة متباينة، والثاني تنوّع حقيقي. والنافع هو الثاني.
وهنا تفرض نفسها موازاة مع الخبرة العادية. اللجنة الجيدة ليست التي فيها عدد أكبر من الناس، بل التي تُمثَّل فيها مقاربات ووجهات نظر مختلفة. خمسة متخصصين من مجالات مختلفة أنفع عادة من خمسة عشر خريجًا من القسم نفسه.
ماذا يعني هذا عمليًا
لمن يبني خدمات تنبؤ على النماذج اللغوية، تقدّم استنتاجات المقال وصفة محددة إلى حد كبير:
- عدم السعي وراء طول قائمة النماذج. توسيع المجموعة دون تحليل السلوك يعني الدفع مقابل أجوبة مكرّرة.
- قياس السلوك أولًا، ثم اختيار التشكيلة. التشغيل على مهام جانبية والتجميع يعطيان صورة واضحة عمّن يختلف فعلًا في المجموعة.
- التوفير بوعي. تقليص عدد الاستدعاءات بمرتبة كاملة مع الحفاظ على الدقة أو تحسينها يغيّر اقتصاد المنتج، لا خصائصه التقنية فقط.
- تذكّر القيود. كل هذا مُختبر على مجموعة محددة من 25 نموذجًا ومعياري تنبؤ؛ ولا ينبغي نقل الأرقام كما هي إلى مجالات أخرى ونماذج أخرى.
الفكرة الرئيسية للعمل تبدو إنسانية تقريبًا: قيمة الرأي الجماعي لا تقوم على عدد الأصوات، بل على كون هذه الأصوات مختلفة فعلًا. وبالنسبة للنماذج اللغوية، هذا يعني أن ما يجب قياسه ليس قائمة الأسماء، بل أسلوب التفكير — وعليه تُبنى الفريق.



