Cara melatih AI untuk merencanakan perubahan kota melalui skenario yang dapat diverifikasi

28 September 202610 tampilan

Artikel ini menyajikan lingkungan berbasis berkas tempat agen mempelajari kondisi tugas, menyusun rencana, dan menyesuaikannya berdasarkan hasil evaluasi otomatis. Para penulis juga membagi pelatihan menjadi tahap penyusunan dan penyempurnaan rencana; pada benchmark nyata, pendekatan ini menunjukkan hasil yang lebih baik daripada heuristik, pembelajaran penguatan khusus, dan agen dasar berbasis model bahasa besar.

Cara melatih AI untuk merencanakan perubahan kota melalui skenario yang dapat diverifikasi

Apa yang sebenarnya harus direncanakan oleh AI

Perencanaan kota di sini merupakan tugas optimasi spasial: memilih tindakan yang layak dari ruang kandidat yang besar.
Tujuan praktisnya mencakup biaya dan kualitas layanan.
Makalah CityPlanner menjelaskan agen sandbox untuk perencanaan kota yang dapat dieksekusi.

Skenario yang dapat diverifikasi menghubungkan rencana dengan evaluasi: sistem menjalankan evaluator dan menerima umpan balik yang dapat dieksekusi.
Dalam perumusan ini, tindakan yang layak, tujuan praktis, dan kemampuan untuk mengevaluasi hasil menjadi hal penting.
Kriteria verifikasinya adalah lingkungan dapat mengevaluasi rencana yang dibuat.

Cara kerja lingkungan eksekusi

Di UrbanSandbox, agen bekerja dalam lingkungan file terpadu.
Agen mempelajari file tugas, membuat rencana, menjalankan evaluator, dan merevisi solusi berdasarkan umpan balik.
Siklus ini menggabungkan penanganan data tugas dan pemeriksaan rencana.

Tindakan utama agen:

  • mempelajari file tugas;
  • membuat rencana;
  • menjalankan evaluator;
  • merevisi solusi berdasarkan umpan balik yang dapat dieksekusi.

Lingkungan ini cocok untuk suatu skenario jika agen dapat menjalani seluruh siklus di dalamnya — mulai dari mempelajari tugas hingga merevisi rencana.

Cara membagi pelatihan

Para penulis mengusulkan pembelajaran penguatan tugas atomik: trajektori panjang di sandbox dibagi menjadi dua tugas.
Pembagian ini menyederhanakan pelatihan dengan memisahkan penyusunan rencana awal dari penyempurnaannya.
Setiap tugas menangani tahap kerja yang berbeda dalam proses penyusunan rencana.

  • BuildPlan — menyusun rencana awal.
  • ImprovePlan — menyempurnakan rencana berdasarkan umpan balik.

Pembagian ini sesuai ketika pelatihan menggabungkan penyusunan rencana dan penyesuaian selanjutnya berdasarkan hasil evaluasi.

Hasil eksperimen

Pada benchmark nyata, CityPlanner secara konsisten mengungguli tiga kelompok pembanding:

Dibandingkan denganHasil
Metode heuristikAgen menunjukkan hasil yang lebih baik
RL spesifik tugasAgen menunjukkan hasil yang lebih baik
Model dasar agen LLM serbagunaAgen menunjukkan hasil yang lebih baik

Studi ablasi mengonfirmasi kontribusi UrbanSandbox, RL tugas atomik, dan deployment iteratif.
Para penulis melaporkan bahwa kode dan kumpulan data telah dirilis.
Makalah ini diajukan pada 9 September 2026 dan sedang ditinjau oleh EMNLP.

Kesimpulan praktisnya terbatas pada hasil benchmark ini: hasil tersebut mendukung pendekatan yang diusulkan, tetapi tidak membuktikan keunggulannya untuk setiap tugas perkotaan.
Sumber: arXiv:2609.09578.

Pertanyaan yang sering ditanyakan

Cara melatih AI untuk merencanakan perubahan kota melalui skenario yang dapat diverifikasi