Apa yang sebenarnya harus direncanakan oleh AI
Perencanaan kota di sini merupakan tugas optimasi spasial: memilih tindakan yang layak dari ruang kandidat yang besar.
Tujuan praktisnya mencakup biaya dan kualitas layanan.
Makalah CityPlanner menjelaskan agen sandbox untuk perencanaan kota yang dapat dieksekusi.

Skenario yang dapat diverifikasi menghubungkan rencana dengan evaluasi: sistem menjalankan evaluator dan menerima umpan balik yang dapat dieksekusi.
Dalam perumusan ini, tindakan yang layak, tujuan praktis, dan kemampuan untuk mengevaluasi hasil menjadi hal penting.
Kriteria verifikasinya adalah lingkungan dapat mengevaluasi rencana yang dibuat.
Cara kerja lingkungan eksekusi
Di UrbanSandbox, agen bekerja dalam lingkungan file terpadu.
Agen mempelajari file tugas, membuat rencana, menjalankan evaluator, dan merevisi solusi berdasarkan umpan balik.
Siklus ini menggabungkan penanganan data tugas dan pemeriksaan rencana.
Tindakan utama agen:
- mempelajari file tugas;
- membuat rencana;
- menjalankan evaluator;
- merevisi solusi berdasarkan umpan balik yang dapat dieksekusi.
Lingkungan ini cocok untuk suatu skenario jika agen dapat menjalani seluruh siklus di dalamnya — mulai dari mempelajari tugas hingga merevisi rencana.
Cara membagi pelatihan
Para penulis mengusulkan pembelajaran penguatan tugas atomik: trajektori panjang di sandbox dibagi menjadi dua tugas.
Pembagian ini menyederhanakan pelatihan dengan memisahkan penyusunan rencana awal dari penyempurnaannya.
Setiap tugas menangani tahap kerja yang berbeda dalam proses penyusunan rencana.
- BuildPlan — menyusun rencana awal.
- ImprovePlan — menyempurnakan rencana berdasarkan umpan balik.
Pembagian ini sesuai ketika pelatihan menggabungkan penyusunan rencana dan penyesuaian selanjutnya berdasarkan hasil evaluasi.
Hasil eksperimen
Pada benchmark nyata, CityPlanner secara konsisten mengungguli tiga kelompok pembanding:
| Dibandingkan dengan | Hasil |
|---|---|
| Metode heuristik | Agen menunjukkan hasil yang lebih baik |
| RL spesifik tugas | Agen menunjukkan hasil yang lebih baik |
| Model dasar agen LLM serbaguna | Agen menunjukkan hasil yang lebih baik |
Studi ablasi mengonfirmasi kontribusi UrbanSandbox, RL tugas atomik, dan deployment iteratif.
Para penulis melaporkan bahwa kode dan kumpulan data telah dirilis.
Makalah ini diajukan pada 9 September 2026 dan sedang ditinjau oleh EMNLP.
Kesimpulan praktisnya terbatas pada hasil benchmark ini: hasil tersebut mendukung pendekatan yang diusulkan, tetapi tidak membuktikan keunggulannya untuk setiap tugas perkotaan.
Sumber: arXiv:2609.09578.



