EXPO-FT: ضبط سياسات الروبوتات دون بيانات إضافية — 30 من 30 مثالية في المهام المعقدة

7 سبتمبر 202619 الآراء

طريقة جديدة تُظهر كيفية تكييف النماذج المُدرّبة مسبقًا «الرؤية-اللغة-الفعل» بفعالية مع مهام محددة باستخدام التعلم المعزز. في المهام المعقدة، يحقق النظام نتائج مثالية في المتوسط خلال 19 دقيقة من البيانات الحقيقية للروبوت، والكود مفتوح بالفعل.

EXPO-FT: ضبط سياسات الروبوتات دون بيانات إضافية — 30 من 30 مثالية في المهام المعقدة

لماذا إعادة تدريب السياسات الروبوتية؟

النماذج الحديثة من نوع الرؤية-اللغة-الفعل (VLA) تعمّم ما تراه على سيناريوهات معالجة جديدة بشكل جيد. لكن مهاراتها المدربة مسبقًا غالبًا ما تكون غير كافية للعمل المستقر في العالم الحقيقي: نفس الإجراء قد لا ينجح عند أدنى إزاحة للجسم، أو تغيّر في الإضاءة، أو اختلاف في شكل القطعة. الأساليب التقليدية هنا لا تنقذ أيضًا: التدريب من الصفر يتجاهل تلك الأولويات المفيدة التي حصلت عليها النموذج بالفعل من مجموعة بيانات كبيرة، بينما يتطلب إعادة التدريب النموذجي عددًا كبيرًا جدًا من المحاولات والحسابات. هذه الفجوة بالتحديد هي ما تسدّه التطوير الجديد — نظام EXPO-FT، الذي يقدم إعادة تدريب RL مستقرة واقتصادية للسياسات الروبوتية الجاهزة.

كيف يعمل النهج

الفكرة الأساسية للمؤلفين هي عدم إعادة تدريب النموذج من الصفر وعدم إهدار الموارد على محاولات غير مفيدة للمهام ذات الأولوية. بدلاً من ذلك، يقوم EXPO-FT بضبط نموذج VLA الذي يفهم المهام بالفعل بحيث يتكيف بسرعة مع المتطلبات الجديدة. هذا النهج يسمح بالحفاظ على المعرفة العامة حول المعالجة وفي نفس الوقت صقل الإجراءات المحددة اللازمة للتطبيق المعين.

بالإضافة إلى ذلك، اهتم المطورون باستقرار عملية التدريب. بناءً على الوصف، يحل النظام مهامًا تُعتبر تقليديًا صعبة: هنا التمديد الدقيق لسلسلة الأضواء مع تركيب القابس في المقبس لاحقًا، والضربة الديناميكية على كرة البلياردو لإدخالها في الجيب، والتركيب الدقيق لزهرة في عنق زجاجة نبيذ ضيق. في كل هذه السيناريوهات، تعد دقة التموضع والاستجابة في الوقت المناسب لتباينات الترتيب الأولي للأجسام أمرًا مهمًا.

ما الذي تم اختباره وما هي النتائج

اختبر المؤلفون الطريقة على عدة سيناريوهات من هذا القبيل وكانوا راضين عن النتيجة. حقق التطوير توازنًا مثاليًا: في جميع المهام التي تم تقييمها، نجح النظام في إكمال المهمة في 30 حالة من أصل 30. وفي الوقت نفسه، تطلب في المتوسط حوالي 19 دقيقة فقط من التفاعلات الحقيقية للروبوت مع الأجسام. من الواضح أن هذا ليس وقت حلقة واحدة، بل هو الحجم الإجمالي للبيانات عبر الإنترنت اللازمة لإعادة التدريب، وهو أقل بشكل ملحوظ من المخططات التقليدية. عند المقارنة مع طرق التدريب من الصفر والخيارات الكلاسيكية لإعادة تدريب RL لسياسات VLA، أظهر EXPO-FT نتائج أفضل من حيث النجاح، وبالتالي من حيث التطبيق العملي: بيانات أقل، ومزيد من عمليات التنفيذ الناجحة.

الكود المفتوح والخطوات التالية

تجدر الإشارة بشكل منفصل إلى أن الباحثين لم يتركوا النظام مغلقًا. يُنشر مشروع EXPO-FT برمز مفتوح المصدر — وهذا يسمح للفرق الأخرى بإعادة إنتاج النتائج، وتكييف الطريقة مع منصاتها الروبوتية الخاصة، ومقارنتها بأساليبها الخاصة. في وقت النشر، تم الإعلان عن نسختين من المقالة: الأولى ظهرت في مايو 2026، والثانية في منتصف أغسطس من نفس العام، ومن المحتمل أنها تأخذ في الاعتبار بالفعل ملاحظات المجتمع. يبدو أن EXPO-FT ليس مجرد أسلوب معملي آخر، بل خطوة نحو استخدام أكثر عملية للنماذج الكبيرة المدربة مسبقًا في الروبوتات الحقيقية، حيث تكون الميزانيات الحسابية المحدودة وعدد التجارب الفيزيائية المتاحة أمرًا بالغ الأهمية.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
EXPO-FT: ضبط سياسات الروبوتات دون بيانات إضافية — 30 من 30 مثالية في المهام المعقدة