Como treinar a IA para planear mudanças urbanas através de cenários verificáveis

28 setembro 202610 visualizações

O artigo apresenta um ambiente baseado em ficheiros no qual o agente analisa as condições da tarefa, elabora um plano e ajusta-o com base nos resultados da avaliação automática. Os autores também dividem o treino em etapas de elaboração e aperfeiçoamento do plano; num benchmark real, a abordagem apresentou melhores resultados do que as heurísticas, o treino por reforço especializado e os agentes de baseados em grandes modelos de linguagem.

Como treinar a IA para planear mudanças urbanas através de cenários verificáveis

O que exatamente a IA deve planear

O planeamento urbano é aqui uma tarefa de otimização espacial: é necessário escolher ações admissíveis num grande espaço de candidatos.
Os objetivos práticos incluem o custo e a qualidade do serviço.
O trabalho CityPlanner descreve um agente sandbox para o planeamento urbano executável.

Um cenário verificável associa o plano à avaliação: o sistema executa um avaliador e recebe feedback executável.
Nesta formulação, são importantes as ações admissíveis, o objetivo prático e a possibilidade de avaliar o resultado.
O critério de verificabilidade é a capacidade do ambiente para avaliar o plano criado.

Como funciona o ambiente de execução

No UrbanSandbox, o agente trabalha num ambiente de ficheiros unificado.
Analisa os ficheiros da tarefa, cria um plano, executa avaliadores e revê a solução com base no feedback.
O ciclo combina o trabalho com os dados da tarefa e a verificação do plano.

Ações principais do agente:

  • analisar os ficheiros da tarefa;
  • criar um plano;
  • executar um avaliador;
  • rever a solução com base no feedback executável.

O ambiente é adequado para um cenário se o agente conseguir percorrer nele todo o ciclo — desde a análise da tarefa até à revisão do plano.

Como dividir o treino

Os autores propõem a aprendizagem por reforço de tarefas atómicas (atomic-task reinforcement learning): as trajetórias longas no sandbox são divididas em duas tarefas.
Esta divisão simplifica o treino, separando a criação inicial do plano do seu aperfeiçoamento.
Cada tarefa corresponde a uma etapa distinta do trabalho com o plano.

  • BuildPlan — criar o plano inicial.
  • ImprovePlan — aperfeiçoar o plano com base no feedback.

Esta divisão é adequada quando o treino combina a criação do plano com a sua posterior correção com base nos resultados da avaliação.

O que mostram as experiências

Num benchmark real, o CityPlanner superou consistentemente três grupos de comparação:

ComparaçãoResultado
Métodos heurísticosO agente obteve o melhor resultado
RL específico da tarefaO agente obteve o melhor resultado
Modelos de base de agentes LLM de uso geralO agente obteve o melhor resultado

Os estudos de ablação confirmaram o contributo do UrbanSandbox, da aprendizagem por reforço de tarefas atómicas e da implementação iterativa.
Os autores informam que disponibilizaram o código e o conjunto de dados.
O trabalho foi submetido em 9 de setembro de 2026 e está a ser avaliado pela EMNLP.

A conclusão prática limita-se aos resultados deste benchmark: estes sustentam a abordagem proposta, mas não demonstram a sua superioridade para qualquer tarefa urbana.
Fonte: arXiv:2609.09578.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Como treinar a IA para planear mudanças urbanas através de cenários verificáveis