محاكاة لاختبار الاستدلالات السببية بشأن إخفاقات الإعلانات

29 سبتمبر 202612 الآراء

في TRACE، تتيح التدخلات الخفية في محاكي الإعلانات الرقمية تقييمًا تلقائيًا لمدى نجاح الوكيل في تحديد مصدر الخلل والشريحة المتأثرة، رغم اضطراره إلى تحليل بيانات مشوشة باستخدام Python وSQL. بعد التدريب المعزز على إشارات اصطناعية، حقق نموذج Qwen3.5-35B-A3B نتيجة 0.757 على مقياس FullAttr@1 ضمن 235 حلقة اختبار، متفوقًا على جميع الخيارات المختبرة باستخدام التلقين، وبعدد استدعاءات للأدوات أقل من النموذج الأساسي.

محاكاة لاختبار الاستدلالات السببية بشأن إخفاقات الإعلانات

ما الذي تختبره المحاكاة

TRACE بيئة تشخيصية للإعلانات الرقمية. وهي تغطي 12 سببًا جذريًا وإسنادًا تفصيليًا للشرائح. في كل حلقة، يستكشف الوكيل البيانات باستخدام Python وSQL. ثم يحدد السبب الجذري، والشريحة المتأثرة إن أمكن.

وُصفت TRACE في بحث أعدّه Rui Sun وZhan Shi وBing He، وقد قُدّم إلى arXiv في 9 سبتمبر 2026. معرّف البحث هو arXiv:2609.10315.

كيفية بناء الاختبار

يُبنى الاختبار حول تدخل والملاحظات التي يسببها:

  • يُختار تدخل ويُدخَل في محاكي مضبوط.
  • يولّد المحاكي الملاحظات ذات الصلة.
  • يستكشف الوكيل البيانات ويبحث عن سبب الإخفاق.
  • يشكّل التدخل المخفي وسمًا مرجعيًا، ويتيح حساب مكافأة موضوعية.

لا يحصل الوكيل على تفسير جاهز. بل عليه الربط بين الأدلة المشوشة والمختلطة والموزعة عبر البيانات. وهكذا تختبر المحاكاة الاستدلال السببي، لا مجرد التعرّف على إجابة محددة مسبقًا.

كيفية قراءة النتائج

قيّم المؤلفون النماذج على مجموعة اختبار محجوبة تضم 235 حلقة. وكان أقوى خط أساس قائم على التلقين هو Claude Opus 5، بنتيجة 0.686 على FullAttr@1.

النموذج أو المرحلةالنتيجة
Qwen3.5-35B-A3B بعد الضبط الدقيق الخاضع للإشراف0.159 → 0.637
النموذج نفسه بعد التعلم المعزز بمكافآت اصطناعية0.757
Qwen3.5-122B-A10B في خط الأساس القائم على التلقينأقل من نتيجة 0.757

تجاوزت نتيجة 0.757 جميع خطوط الأساس القائمة على التلقين التي جرى تقييمها، بما فيها النماذج المتقدمة ذات المصدر المغلق. ويذكر المؤلفون أيضًا أن السياسة الناتجة استخدمت عددًا أقل بكثير من استدعاءات الأدوات مقارنةً بإصدار التلقين من النموذج الأساسي ذي 35B.

ما الذي تُظهره النتائج بشأن تدريب الوكلاء

يرى المؤلفون أن إمكانية الوصول إلى إشارة تدريب موضوعية قابلة للتوسّع قد تكون عائقًا أكبر أهميةً من حجم النموذج وحده. وهذا استنتاج مستمد من نتائج المهمة الموصوفة، وليس قاعدة عامة تنطبق على جميع أنظمة الذكاء الاصطناعي.

يمكن للاختبار بالمحاكاة أن يجعل مهام الاستدلال التشخيصي الملتبسة ملائمةً للتدريب المعزز القابل للتوسّع. والشرط الأساسي هو إمكانية مقارنة استنتاج الوكيل بالتدخل المخفي وحساب مكافأة موضوعية.

متى يكون هذا النهج مناسبًا

تلائم المحاكاة اختبار الاستدلالات السببية إذا كان إعداد المهمة يسمح بما يلي:

  • تحديد تدخل وإدخاله في بيئة مضبوطة؛
  • توليد ملاحظات مرتبطة به؛
  • الاحتفاظ بالتدخل كوسم مرجعي مخفي؛
  • تقييم السبب الجذري والشريحة المتأثرة معًا، متى كان ذلك منطبقًا.

إذا كانت المهمة لا تتيح هذه المقارنة بوسم مرجعي، فلن تكون آلية المكافأة الموضوعية الموصوفة متاحة. والمعيار العملي للاختيار هو ما إذا كان بالإمكان التحقق من استنتاج الوكيل استنادًا إلى السبب المخفي، دون كشفه أثناء التحليل.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
محاكاة لاختبار الاستدلالات السببية بشأن إخفاقات الإعلانات