सत्यापन योग्य परिदृश्यों के माध्यम से शहरी बदलावों की योजना बनाने के लिए AI को कैसे प्रशिक्षित करें

28 सितम्बर 202610 बार देखा गया

इस लेख में एक फ़ाइल-आधारित परिवेश प्रस्तुत किया गया है, जिसमें एजेंट कार्य की परिस्थितियों का अध्ययन करता है, एक योजना बनाता है और स्वचालित मूल्यांकन के परिणामों के आधार पर उसे संशोधित करता है। लेखक योजना बनाने और उसे बेहतर बनाने के प्रशिक्षण को अलग-अलग चरणों में बाँटते हैं; वास्तविक बेंचमार्क पर इस दृष्टिकोण ने अनुमानी विधियों, विशिष्ट सुदृढीकरण अधिगम और बड़े भाषा मॉडल पर आधारित बुनियादी एजेंटों से बेहतर परिणाम दिए।

सत्यापन योग्य परिदृश्यों के माध्यम से शहरी बदलावों की योजना बनाने के लिए AI को कैसे प्रशिक्षित करें

ИИ должен планировать именно что

Городское планирование здесь — задача пространственной оптимизации: нужно выбирать допустимые действия из большого множества вариантов.
Практические цели включают стоимость и качество обслуживания.
В работе CityPlanner описан sandbox-агент для исполняемого городского планирования.

Проверяемый сценарий связывает план с оценкой: система запускает оценщик и получает исполняемую обратную связь.
В такой постановке важны допустимые действия, практическая цель и возможность оценить результат.
Критерий проверяемости — среда может оценить созданный план.

Как устроена среда выполнения

В UrbanSandbox агент работает в единой файловой среде.
Он изучает файлы задачи, создаёт план, запускает оценщики и пересматривает решение с учётом обратной связи.
Цикл объединяет работу с данными задачи и проверку плана.

Основные действия агента:

  • изучить файлы задачи;
  • создать план;
  • запустить оценщик;
  • пересмотреть решение на основе исполняемой обратной связи.

Среда подходит для сценария, если агент может пройти в ней весь цикл — от изучения задачи до пересмотра плана.

Как разделить обучение

Авторы предлагают обучение с подкреплением для атомарных задач: длинные траектории в sandbox делятся на две задачи.
Такое разделение упрощает обучение, отделяя первоначальное построение плана от его доработки.
Каждая задача отвечает за отдельный этап работы с планом.

  • BuildPlan — первоначально построить план.
  • ImprovePlan — доработать план на основе обратной связи.

Такое разделение уместно, когда обучение объединяет создание плана и его последующую корректировку по результатам оценки.

Что показывают эксперименты

На реальном бенчмарке CityPlanner стабильно превзошёл три группы сравнения:

С чем сравнивалиРезультат
Эвристические методыАгент показал лучший результат
Обучение с подкреплением для конкретной задачиАгент показал лучший результат
Базовые модели LLM-агентов общего назначенияАгент показал лучший результат

Абляционные исследования подтвердили вклад UrbanSandbox, обучения с подкреплением для атомарных задач и итеративного развёртывания.
Авторы сообщают о выпуске кода и набора данных.
Работа подана 9 сентября 2026 года и находится на рассмотрении EMNLP.

Практический вывод ограничен результатами этого бенчмарка: они подтверждают предложенную схему, но не устанавливают её преимущество для любой городской задачи.
Источник: arXiv:2609.09578.

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
सत्यापन योग्य परिदृश्यों के माध्यम से शहरी बदलावों की योजना बनाने के लिए AI को कैसे प्रशिक्षित करें