وكيل متصفح Wuying-Browser: ذكاء اصطناعي للمتصفح يتعامل مع السيناريوهات الطويلة على الويب الحقيقي

27 أغسطس 202615 الآراء

قدّم الباحثون إطار عمل مفتوح المصدر يجمع بين بيئة متصفح مستقرة، والتعلّم من استرداد الأخطاء، وتعلّم التعزيز المخصص. يحقق النموذج نتائج قياسية على WebVoyager وOnline-Mind2Web ومعيار BrowserBench الجديد، ويمتد النهج ليشمل مهام خارج المتصفح أيضًا.

وكيل متصفح Wuying-Browser: ذكاء اصطناعي للمتصفح يتعامل مع السيناريوهات الطويلة على الويب الحقيقي

من العروض المثالية إلى المواقع الحية

المساعدون المتصفحيون القائمون على الذكاء الاصطناعي يتعاملون بثقة مع السيناريوهات القصيرة والنظيفة: العثور على منتج، إتمام طلب، ملء نموذج. ولكن بمجرد أن يجد هذا الوكيل نفسه على موقع حقيقي — مع تحميل بطيء، ونوافذ منبثقة غير متوقعة، وتخطيط متغير، وعشرات النقرات الوسيطة — تتغير الصورة. في الواقع، يجب على الذكاء الاصطناعي أن يحافظ على الهدف عبر سلسلة طويلة من الإجراءات، وأن يلاحظ أخطاءه ويصححها، وأن يتعامل مع واجهات مزدحمة.

ما هو «السيناريو الطويل» عمليًا؟ إنه ليس نقرة واحدة ولا حتى عشر نقرات: يمكن للوكيل تنفيذ 30–40 خطوة أو أكثر قبل الوصول إلى النتيجة المطلوبة. كل خطوة تعتمد على الخطوة السابقة، ويمكن لخطأ واحد أن يبطل كل الجهود. علاوة على ذلك، تتغير صفحات الويب الحقيقية باستمرار: التخطيط «يطفو»، وتظهر عناصر جديدة، ويتم تحميل البيانات بشكل غير متزامن. النموذج المُدرَّب على عروض ثابتة يضيع في مثل هذه الظروف.

المشكلة أن معظم الأساليب الحالية تُدرَّب على عروض مبسطة وغير مصممة لمثل هذا المستوى من التعقيد. مجرد توسيع النموذج لا يساعد هنا: الفجوة بين الظروف المختبرية والويب الحقيقي تتطلب إعادة النظر في خط الأنابيب بأكمله — من تنفيذ الإجراءات إلى التقييم النهائي.

إطار موحد للآفاق الطويلة

هذه هي المهمة التي وضعها فريق AIMAE أمام نفسه، حيث قدّم Wuying-Browser-Agent — إطار عمل مفتوح المصدر يغطي جميع مستويات عمل الوكيل المتصفحي. بدلاً من التركيز على جزء واحد فقط، قام المؤلفون بمواءمة التنفيذ والتحكم والتحسين والتقييم.

لننظر إلى كل مستوى بمزيد من التفصيل. التنفيذ — هو كيفية تفاعل الوكيل مع الصفحة: النقر، إدخال النص، تبديل التبويبات. التحكم — مراقبة الإجراءات والتدخل في الوقت المناسب إذا حدث خطأ ما. التحسين — عملية التعلم التي تضبط النموذج على المسارات الناجحة. وأخيرًا، التقييم — طريقة لقياس مدى جودة أداء الوكيل للمهام في الويب الحقيقي. يجب أن تعمل جميع هذه المستويات بشكل متناسق، وإلا ينهار النظام على المسافات الطويلة.

ثلاثة مكونات رئيسية تضمن عمل النظام:

  • هيكل المتصفح المنظم — مجموعة من البدائيات المستقرة لتنفيذ الإجراءات. يمنح الوكيل بيئة قابلة للتنبؤ ويساعد في إدارة السياق، مع التركيز على اتخاذ القرارات. بدلاً من الاعتماد على محددات غير موثوقة أو توقيتات عشوائية، يحصل الوكيل على أوامر واضحة يتم تنفيذها بشكل موحد.
  • RUIC-SFT — طريقة ضبط خاضعة للإشراف على مسارات التعافي من الأخطاء والتفاعلات مع عناصر الواجهة المعقدة. يتعلم النموذج ليس فقط من السلاسل الناجحة، ولكن أيضًا من كيفية الخروج من المأزق.
  • DAO-GRPO — خوارزمية تحسين تعمل على تحسين توزيع «الائتمان» على الآفاق الطويلة من خلال تشكيل المكافأة المحتمل ووزن الخطوات حسب التباعد. يتم تقييم كل إجراء مع مراعاة مساهمته في النتيجة الإجمالية، وليس بشكل منعزل.

هذا النهج يسمح للنموذج ليس فقط بتنفيذ خطوات مثالية، بل بالاستجابة للتداخلات الحقيقية وفهم الإجراءات التي تدفعه فعلاً نحو هدفه. يُظهر الإطار بالفعل أن مواءمة خط الأنابيب تعطي تأثيرًا أكبر من مجرد زيادة حجم النموذج.

BrowserBench: اختبار للطول الحقيقي

كيف تتحقق من أن الوكيل جاهز فعلاً للويب الحقيقي؟ المعايير الحالية غالبًا ما تكون قصيرة جدًا ولا تكشف الأعطال المميزة على المسافات الطويلة. قد يتكون الاختبار النموذجي من 5–10 خطوات، بينما في الحياة الواقعية يتعين على الوكيل العمل لفترة أطول بكثير. لذلك أنشأ الفريق معياره الخاص — BrowserBench. وهي مجموعة ثنائية اللغة من 350 مهمة مأخوذة من مواقع حقيقية، بمتوسط طول سيناريو يقارب 38 خطوة.

هذا الطول — هو اختلاف جوهري. في المهام القصيرة، يمكن للوكيل التصرف بشكل شبه عشوائي ومع ذلك الحصول على نتيجة عالية. أما في المهام الطويلة، فكل خطأ يتراكم، وبدون توزيع صحيح للـ«ائتمان» يخرج النظام بسرعة عن مساره. يتيح BrowserBench رؤية هذه الأعطال وفهم الآليات التي تحتاج إلى تحسين تحديدًا.

النتائج تتحدث عن نفسها. يحقق Wuying-Browser-Agent مع 27 مليار معامل 80.6% على WebVoyager، و66.7% على Online-Mind2Web، و65.1% على BrowserBench — وهذا رقم قياسي مفتوح جديد على معايير استخدام المتصفح. نفس خط الأنابيب ينتقل بنجاح إلى مجالات أخرى: متوسط درجة 73.8 على مجموعات Tau2-Bench وClaw-Eval وBFCL-v4.

من الدلالي أن النجاح لا يتحقق في مهمة واحدة محددة، بل في عدة اختبارات مستقلة في وقت واحد. هذا يعني أن الإطار يستوعب المبادئ العامة للعمل مع واجهات الويب، ولا يتكيف مع معيار معين. قابلية التعميم الجيدة — هي علامة على أن الوكيل يفهم حقًا ما يفعله، وليس مجرد حفظ الأنماط.

ماذا يعني هذا لتطوير وكلاء الذكاء الاصطناعي

الاستنتاج الرئيسي — ليس في الأرقام المحددة، رغم أنها مثيرة للإعجاب. الأهم هو النهج: لكي يعمل الوكيل في العالم الحقيقي، يجب التوقف عن مطاردة أرقام قياسية فردية على عروض نظيفة، وبدلاً من ذلك بناء النظام بأكمله حول سيناريوهات طويلة ومعقدة. يُظهر Wuying-Browser-Agent أن هذا قابل للتحقيق، وبشكل مفتوح — يمكن للباحثين إعادة إنتاج نتائجه وتطويرها أكثر.

ولهذا النهج أيضًا قيمة عملية. تخيل أنك بحاجة إلى مقارنة الشروط على عشرات المواقع، أو حجز تذاكر، أو ملء نموذج طويل. حاليًا يجب القيام بذلك يدويًا، لأنه لا يوجد مساعد يمكنه الحفاظ على السياق لفترة طويلة. مع إطار مثل Wuying-Browser-Agent، يمكن أتمتة هذه المهام في المستقبل القريب.

تتوقف الوكلاء المتصفحيون عن كونهم تجربة مختبرية ويتحولون إلى أداة عملية. يبقى فقط انتظار ظهور مثل هذه الأنظمة في المتصفحات العادية وتوليها للروتين — من التسوق إلى ملء المستندات. وبالنظر إلى هذا الإطار، يبدو أن الانتظار لن يطول.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
وكيل متصفح Wuying-Browser: ذكاء اصطناعي للمتصفح يتعامل مع السيناريوهات الطويلة على الويب الحقيقي