كيفية تدريب الذكاء الاصطناعي على تخطيط التغييرات الحضرية من خلال سيناريوهات قابلة للتحقق

28 سبتمبر 202610 الآراء

تقدّم المقالة بيئةً للملفات يدرس فيها الوكيل شروط المهمة، ويضع خطةً ويعدّلها بناءً على نتائج التقييم الآلي. كما يقسّم المؤلفون التدريب إلى مرحلتين: صياغة الخطة وتحسينها؛ وقد حقق النهج أفضل النتائج على معيار اختبار واقعي مقارنةً بالأساليب الاستدلالية والتدريب المتخصص بالتعلّم المعزّز والوكلاء الأساسيين المستندين إلى نماذج لغوية كبيرة.

كيفية تدريب الذكاء الاصطناعي على تخطيط التغييرات الحضرية من خلال سيناريوهات قابلة للتحقق

ما الذي ينبغي للذكاء الاصطناعي أن يخطط له تحديدًا

التخطيط الحضري هنا هو مسألة تحسين مكاني: إذ يتعين اختيار إجراءات مسموح بها من بين مجموعة كبيرة من الخيارات.
تشمل الأهداف العملية التكلفة وجودة الخدمة.
يصف عمل CityPlanner وكيلًا في بيئة sandbox للتخطيط الحضري القابل للتنفيذ.

يربط سيناريو قابل للتحقق الخطة بالتقييم: يشغّل النظام أداة تقييم ويحصل على ملاحظات قابلة للتنفيذ.
في هذا الإطار، تكتسب الإجراءات المسموح بها والهدف العملي وإمكانية تقييم النتيجة أهمية.
معيار قابلية التحقق هو قدرة البيئة على تقييم الخطة التي أُنشئت.

كيف تعمل بيئة التنفيذ

يعمل الوكيل في UrbanSandbox ضمن بيئة ملفات موحدة.
يفحص ملفات المهمة، وينشئ خطة، ويشغّل أدوات التقييم، ويراجع الحل استنادًا إلى الملاحظات.
تجمع هذه الدورة بين التعامل مع بيانات المهمة والتحقق من الخطة.

الإجراءات الأساسية للوكيل:

  • فحص ملفات المهمة؛
  • إنشاء خطة؛
  • تشغيل أداة تقييم؛
  • مراجعة الحل استنادًا إلى الملاحظات القابلة للتنفيذ.

تكون البيئة مناسبة لهذا السيناريو إذا استطاع الوكيل إكمال الدورة بأكملها فيها — من دراسة المهمة إلى مراجعة الخطة.

كيفية تقسيم التدريب

يقترح المؤلفون التعلّم المعزز للمهام الذرية: إذ تُقسّم المسارات الطويلة في بيئة sandbox إلى مهمتين.
يُسهّل هذا التقسيم التدريب عبر الفصل بين إعداد الخطة الأولي وتحسينها.
تتولى كل مهمة مرحلة منفصلة من العمل على الخطة.

  • BuildPlan — إعداد الخطة الأولية.
  • ImprovePlan — تحسين الخطة استنادًا إلى الملاحظات.

يكون هذا التقسيم مناسبًا عندما يجمع التدريب بين إنشاء الخطة ومراجعتها لاحقًا وفقًا لنتائج التقييم.

ما الذي تُظهره التجارب

في معيار أداء واقعي، تفوّق CityPlanner باستمرار على ثلاث مجموعات للمقارنة:

ما جرت المقارنة بهالنتيجة
الأساليب الاستدلاليةحقق الوكيل أفضل نتيجة
التعلّم المعزز الخاص بالمهمةحقق الوكيل أفضل نتيجة
النماذج الأساسية لوكلاء LLM عامة الغرضحقق الوكيل أفضل نتيجة

أكدت دراسات الاستئصال مساهمة UrbanSandbox والتعلّم المعزز للمهام الذرية والنشر التكراري.
ويفيد المؤلفون بإتاحة الشفرة ومجموعة البيانات.
قُدّم العمل في 9 سبتمبر 2026، وهو قيد المراجعة في EMNLP.

تقتصر الخلاصة العملية على نتائج معيار الأداء هذا: فهي تدعم النهج المقترح، لكنها لا تثبت تفوقه في كل مهمة حضرية.
المصدر: arXiv:2609.09578.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
كيفية تدريب الذكاء الاصطناعي على تخطيط التغييرات الحضرية من خلال سيناريوهات قابلة للتحقق