ИИ должен планировать именно что
Городское планирование здесь — задача пространственной оптимизации: нужно выбирать допустимые действия из большого множества вариантов.
Практические цели включают стоимость и качество обслуживания.
В работе CityPlanner описан sandbox-агент для исполняемого городского планирования.

Проверяемый сценарий связывает план с оценкой: система запускает оценщик и получает исполняемую обратную связь.
В такой постановке важны допустимые действия, практическая цель и возможность оценить результат.
Критерий проверяемости — среда может оценить созданный план.
Как устроена среда выполнения
В UrbanSandbox агент работает в единой файловой среде.
Он изучает файлы задачи, создаёт план, запускает оценщики и пересматривает решение с учётом обратной связи.
Цикл объединяет работу с данными задачи и проверку плана.
Основные действия агента:
- изучить файлы задачи;
- создать план;
- запустить оценщик;
- пересмотреть решение на основе исполняемой обратной связи.
Среда подходит для сценария, если агент может пройти в ней весь цикл — от изучения задачи до пересмотра плана.
Как разделить обучение
Авторы предлагают обучение с подкреплением для атомарных задач: длинные траектории в sandbox делятся на две задачи.
Такое разделение упрощает обучение, отделяя первоначальное построение плана от его доработки.
Каждая задача отвечает за отдельный этап работы с планом.
- BuildPlan — первоначально построить план.
- ImprovePlan — доработать план на основе обратной связи.
Такое разделение уместно, когда обучение объединяет создание плана и его последующую корректировку по результатам оценки.
Что показывают эксперименты
На реальном бенчмарке CityPlanner стабильно превзошёл три группы сравнения:
| С чем сравнивали | Результат |
|---|---|
| Эвристические методы | Агент показал лучший результат |
| Обучение с подкреплением для конкретной задачи | Агент показал лучший результат |
| Базовые модели LLM-агентов общего назначения | Агент показал лучший результат |
Абляционные исследования подтвердили вклад UrbanSandbox, обучения с подкреплением для атомарных задач и итеративного развёртывания.
Авторы сообщают о выпуске кода и набора данных.
Работа подана 9 сентября 2026 года и находится на рассмотрении EMNLP.
Практический вывод ограничен результатами этого бенчмарка: они подтверждают предложенную схему, но не устанавливают её преимущество для любой городской задачи.
Источник: arXiv:2609.09578.



