Telco-GAIA: كيفية اختبار وكيل الذكاء الاصطناعي على بيانات مشغل اتصالات حقيقي

10 سبتمبر 20263 الآراء

معيار جديد يقترح 100 سيناريو للأسئلة والأجوبة باللغتين الإنجليزية والعربية، مبنية حول بيانات حقيقية للمشغل: الموقع الإلكتروني، وقاعدة بيانات SQL، وأرشيف الويب. أظهر الاختبار على 12 نموذجًا أن حتى أفضل نموذج يحل 71% فقط من المهام، بينما تنخفض النتائج في الفئات البصرية إلى أقل من 30%.

Telco-GAIA: كيفية اختبار وكيل الذكاء الاصطناعي على بيانات مشغل اتصالات حقيقي

تتعامل وكلاء الذكاء الاصطناعي الحديثون بشكل جيد مع المهام المكتبية النمطية، ولكن كيف يمكن التحقق من جاهزيتهم للعمل في بيئة مؤسسية معقدة — مثل قطاع الاتصالات؟ هنا لا تكفي الاختبارات العامة: نحتاج إلى سيناريوهات واقعية تحتوي على مستندات حقيقية وقواعد بيانات وأسئلة مستخدمين غير نمطية. ولهذا الغرض تحديدًا أُنشئ Telco-GAIA — معيار تقييم ثنائي اللغة ومتعدد الوسائط، مبني على بيانات مشغّل اتصالات حقيقي. يتيح هذا المعيار تقييم مدى قدرة وكيل الذكاء الاصطناعي على الاستدلال واستخدام الأدوات واستخراج المعلومات من مصادر مختلفة.

لماذا نحتاج إلى مثل هذا المعيار

معظم الاختبارات المفتوحة لوكلاء الذكاء الاصطناعي تشبه الألغاز: فهي إما اصطناعية للغاية، أو لا تتطلب عملًا حقيقيًا مع بيانات المؤسسات. يسد Telco-GAIA هذه الفجوة. صُممت أسئلته بحيث يواجه الوكيل مهامًا مألوفة لدى موظفي مشغّلي الاتصالات: العثور على معلومات على موقع ويب، ومطابقتها مع السجلات في قاعدة بيانات، والتحقق من التفاصيل في المستندات الأرشيفية. هذا ليس اختبارًا لذاكرة النموذج، بل اختبارًا للقدرة على العمل مع مصادر متعددة واستخلاص النتائج.

المعيار ثنائي اللغة: جميع المهام صيغت باللغتين الإنجليزية والعربية. وهذا الاختيار ليس اعتباطيًا — فهو يعكس الاحتياجات الفعلية للمشغّلين في المنطقة التي تُستخدم فيها اللغة العربية كلغة عمل، بينما يبقى جزء كبير من الوثائق الداخلية باللغة الإنجليزية.

ماذا يوجد داخل Telco-GAIA

يتضمن المعيار 100 مهمة سؤال وجواب، تم التحقق من كل منها بواسطة إنسان. من المهم أن المهام لا تتطلب إجابة من كلمة واحدة، بل سلسلة من الخطوات المنطقية — بمتوسط 4.2 خطوة. جميع الأسئلة مصنفة حسب أنواع الوسائط: نص، جداول، ورسومات. هذا يعني أن النموذج يجب أن يتعامل بثقة متساوية مع مستند PDF ومع صورة أو بنية استعلام SQL.

لحل المهمة، يحتاج الوكيل إلى الوصول إلى ثلاثة مصادر غير متجانسة:

  • لقطة ثابتة لموقع المشغّل على الويب — صفحات HTML وصور وملفات PDF ذات صلة.
  • قاعدة بيانات علائقية اصطناعية — تحاكي بنيتها النظام الداخلي للمشغّل، لكن البيانات فيها آمنة للنشر.
  • أرشيفات ويب خارجية — مواد إضافية قد تكون ضرورية للتحقق من الحقائق أو توضيح السياق.

كيف تتم عملية التقييم

أحد المبادئ الرئيسية لـ Telco-GAIA هو الموضوعية. تخلى المؤلفون عن مُقيّمات LLM الرائجة، حيث يقوم نموذج بتقييم إجابات نموذج آخر. بدلاً من ذلك، يُستخدم مقارنة سلاسل نصية دقيقة ومعيارية، والمعيار بأكمله مُغلّف في بيئة Docker معزولة. هذا يعني أن النتيجة لا تعتمد على جهاز معين أو إصدار مكتبات: شغّل الحاوية — وستحصل على نفس الأرقام. يجعل هذا النهج التقييم حتميًا وقابلًا لإعادة الإنتاج، وهو أمر بالغ الأهمية للبحث ومقارنة النماذج المختلفة.

ماذا أظهرت الاختبارات

أجرى المطورون اختبارًا لوكيل مرجعي عبر المعيار باستخدام اثني عشر نموذجًا مختلفًا — تجاريًا ومفتوح المصدر. كانت النتائج متواضعة: حتى أقوى نموذج نجح في 71% فقط من المهام. وإذا تم تقليص ميزانية استدعاءات الأدوات إلى حد معتدل، تنخفض النتيجة إلى حوالي 40%. بعبارة أخرى، يبدأ الوكيل في "اختصار الطريق" بشكل ملحوظ: لا يتخذ خطوات إضافية، ولا يتحقق من التفاصيل، ويخطئ في كثير من الأحيان في الحالات غير النمطية.

بشكل خاص، تتعامل النماذج بشكل ضعيف مع الفئات التي تتطلب استخدام المعلومات المرئية — الصور والرسومات. متوسط النتيجة هناك أقل من 30%. يُظهر هذا أن فهم المستندات التي تحتوي على صور لا يزال يمثل نقطة نمو كبيرة لوكلاء الذكاء الاصطناعي. بشكل عام، يوثق Telco-GAIA فجوة كبيرة بين التوقعات من وكيل مؤسسي والقدرات الفعلية لنماذج اللغات الكبيرة الحديثة.

الاستنتاجات

Telco-GAIA ليس مجرد معيار تقييم آخر للأبحاث. إنه أداة عملية للشركات التي تبني وكلاء ذكاء اصطناعي خاصين بها وتريد فهم قيودهم مسبقًا. بفضل البيئة القابلة لإعادة الإنتاج والمهام المُتحقق منها، يمكن استخدامه كمعيار جودة داخلي.

علاوة على ذلك، يمكن تكييف النهج المتبع في Telco-GAIA بسهولة مع مجالات مغلقة أخرى — من البنوك إلى الخدمات اللوجستية. يوفر التنسيق قالبًا جاهزًا: أخذ بيانات حقيقية، وإخفاء هويتها بعناية، وتقسيمها إلى مصادر مستقلة، وبناء بيئة يجب أن يُظهر فيها الوكيل مهاراته في الاستدلال. هذا هو التحول الذي يحتاجه السوق: من اختبارات المعرفة العامة إلى التحقق من الكفاءات العملية على بيانات مؤسسية واقعية.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
Telco-GAIA: كيفية اختبار وكيل الذكاء الاصطناعي على بيانات مشغل اتصالات حقيقي