যাচাইযোগ্য পরিস্থিতির মাধ্যমে নগর পরিবর্তনের পরিকল্পনা করতে AI-কে কীভাবে প্রশিক্ষণ দেবেন

28 সেপ্টেম্বর 2026১০ প্রদর্শন

এই নিবন্ধে একটি ফাইলভিত্তিক পরিবেশ উপস্থাপন করা হয়েছে, যেখানে এজেন্ট কাজের শর্তাবলি বিশ্লেষণ করে, একটি পরিকল্পনা তৈরি করে এবং স্বয়ংক্রিয় মূল্যায়নের ফলাফলের ভিত্তিতে সেটি সংশোধন করে। লেখকেরা পরিকল্পনা তৈরি ও উন্নত করার ধাপেও প্রশিক্ষণকে ভাগ করেছেন; বাস্তব বেঞ্চমার্কে এই পদ্ধতি হিউরিস্টিক, বিশেষায়িত রিইনফোর্সমেন্ট লার্নিং এবং বড় ভাষা মডেলভিত্তিক বেসলাইন এজেন্টগুলোর চেয়ে ভালো ফল দেখিয়েছে।

যাচাইযোগ্য পরিস্থিতির মাধ্যমে নগর পরিবর্তনের পরিকল্পনা করতে AI-কে কীভাবে প্রশিক্ষণ দেবেন

ИИ-কে что именно планировать

Городское планирование здесь — задача пространственной оптимизации: нужно выбирать допустимые действия из большого пространства кандидатов.
Практические цели включают стоимость и качество обслуживания.
Работа CityPlanner описывает sandbox-агента для исполняемого городского планирования.

Проверяемый сценарий связывает план с оценкой: система запускает оценщик и получает исполняемую обратную связь.
В такой постановке важны допустимые действия, практическая цель и возможность оценить результат.
Критерий проверяемости — среда может оценить созданный план.

Как устроена среда выполнения

В UrbanSandbox агент работает в единой файловой среде.
Он изучает файлы задачи, создаёт план, запускает оценщики и пересматривает решение по обратной связи.
Цикл объединяет работу с данными задачи и проверку плана.

Основные действия агента:

  • изучить файлы задачи;
  • создать план;
  • запустить оценщик;
  • пересмотреть решение на основе исполняемой обратной связи.

Среда подходит для сценария, если агент может пройти в ней весь цикл — от изучения задачи до пересмотра плана.

Как разделить обучение

Авторы предлагают atomic-task reinforcement learning: длинные траектории в sandbox делятся на две задачи.
Такое разделение упрощает обучение, отделяя первоначальное построение плана от его доработки.
Каждая задача отвечает за отдельный этап работы с планом.

  • BuildPlan — первоначально построить план.
  • ImprovePlan — доработать план на основе обратной связи.

Такое разделение уместно, когда обучение объединяет создание плана и его последующую корректировку по результатам оценки.

Что показывают эксперименты

На реальном бенчмарке CityPlanner стабильно превзошёл три группы сравнения:

С чем сравнивалиРезультат
Эвристические методыАгент показал лучший результат
Task-specific RLАгент показал лучший результат
Базовые модели LLM-агентов общего назначенияАгент показал лучший результат

Абляционные исследования подтвердили вклад UrbanSandbox, atomic-task RL и iterative deployment.
Авторы сообщают о выпуске кода и набора данных.
Работа подана 9 сентября 2026 года и находится на рассмотрении EMNLP.

Практический вывод ограничен результатами этого бенчмарка: они поддерживают предложенную схему, но не устанавливают её преимущество для любой городской задачи.
Источник: arXiv:2609.09578.

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
যাচাইযোগ্য পরিস্থিতির মাধ্যমে নগর পরিবর্তনের পরিকল্পনা করতে AI-কে কীভাবে প্রশিক্ষণ দেবেন