Как обучать ИИ планировать городские изменения через проверяемые сценарии

28 сентября 202610 просмотров

В статье представлена файловая среда, в которой агент изучает условия задачи, формирует план и корректирует его по результатам автоматической оценки. Авторы также разделяют обучение на этапы составления и улучшения плана; на реальном бенчмарке подход показал лучшие результаты, чем эвристики, специализированное обучение с подкреплением и базовые агенты на основе больших языковых моделей.

Как обучать ИИ планировать городские изменения через проверяемые сценарии

Что именно должен планировать ИИ

Городское планирование здесь — задача пространственной оптимизации: нужно выбирать допустимые действия из большого пространства кандидатов.
Практические цели включают стоимость и качество обслуживания.
Работа CityPlanner описывает sandbox-агента для исполняемого городского планирования.

Проверяемый сценарий связывает план с оценкой: система запускает оценщик и получает исполняемую обратную связь.
В такой постановке важны допустимые действия, практическая цель и возможность оценить результат.
Критерий проверяемости — среда может оценить созданный план.

Как устроена среда выполнения

В UrbanSandbox агент работает в единой файловой среде.
Он изучает файлы задачи, создаёт план, запускает оценщики и пересматривает решение по обратной связи.
Цикл объединяет работу с данными задачи и проверку плана.

Основные действия агента:

  • изучить файлы задачи;
  • создать план;
  • запустить оценщик;
  • пересмотреть решение на основе исполняемой обратной связи.

Среда подходит для сценария, если агент может пройти в ней весь цикл — от изучения задачи до пересмотра плана.

Как разделить обучение

Авторы предлагают atomic-task reinforcement learning: длинные траектории в sandbox делятся на две задачи.
Такое разделение упрощает обучение, отделяя первоначальное построение плана от его доработки.
Каждая задача отвечает за отдельный этап работы с планом.

  • BuildPlan — первоначально построить план.
  • ImprovePlan — доработать план на основе обратной связи.

Такое разделение уместно, когда обучение объединяет создание плана и его последующую корректировку по результатам оценки.

Что показывают эксперименты

На реальном бенчмарке CityPlanner стабильно превзошёл три группы сравнения:

С чем сравнивалиРезультат
Эвристические методыАгент показал лучший результат
Task-specific RLАгент показал лучший результат
Базовые модели LLM-агентов общего назначенияАгент показал лучший результат

Абляционные исследования подтвердили вклад UrbanSandbox, atomic-task RL и iterative deployment.
Авторы сообщают о выпуске кода и набора данных.
Работа подана 9 сентября 2026 года и находится на рассмотрении EMNLP.

Практический вывод ограничен результатами этого бенчмарка: они поддерживают предложенную схему, но не устанавливают её преимущество для любой городской задачи.
Источник: arXiv:2609.09578.

Часто задаваемые вопросы

Похожие материалы

Все материалы
CityPlanner: как обучать ИИ городскому планированию