Apa yang sebenarnya dikendalikan RobustSGPO
RobustSGPO mengembangkan SGPO — optimasi prompt berbasis gradien semantik — dengan menggunakan umpan balik dari eksekusi. Aturan lokal SGPO tidak menentukan skala penyuntingan maupun operasi spesifik.
Kontrol mencakup instruksi penyuntingan, pemeriksaan patch yang dibuat, dan pemilihan titik awal untuk langkah berikutnya. Ini memisahkan kendali atas pencarian varian dari sinyal umpan balik itu sendiri.
Kriteria praktis: pendekatan ini cocok untuk penyesuaian yang memerlukan operasi penyuntingan tertentu dan pemeriksaan patch, bukan sekadar umpan balik.
Cara kerja pencarian varian
Prosesnya mencakup tiga tindakan:
- Menentukan penyuntingan yang diminta.
- Membuat patch dan memeriksanya.
- Melanjutkan pencarian dari varian terbaik saat ini atau snapshot yang disimpan.

| Titik awal | Dari mana pencarian dilanjutkan |
|---|---|
| Varian terbaik saat ini (incumbent) | Dari varian terbaik saat ini |
| Snapshot yang disimpan (retained snapshots) | Dari versi yang disimpan |
Pilihan ini menentukan versi mana yang menjadi titik awal pencarian berikutnya. Kriterianya adalah apakah yang dibutuhkan versi terbaik saat ini atau titik awal alternatif yang disimpan.
Cara merencanakan resolusi penyuntingan
Dalam penelitian tersebut, jadwal periodik $1\to2\to3$ dibandingkan dengan resolusi maksimum tetap. Jadwal periodik mengungguli resolusi tetap sebesar 0,28 poin pada skor pengujian.
Para penulis mengevaluasi penjadwalan resolusi, batasan kumulatif, dan transfer antar keluarga tugas. Hasil ini berlaku untuk evaluasi tersebut dan tidak menetapkan keunggulan jadwal secara universal.
Kriteria perbandingannya adalah skor pengujian dengan jadwal yang dipilih. Dalam penelitian yang disajikan, perubahan resolusi secara periodik memberikan hasil yang lebih baik.
Hasil evaluasi kualitas
Dalam alur kerja brainstorming AgentX, dilakukan 95 proses pada 120 tugas dan dihasilkan 7.350 percobaan kandidat.
Pada 30 tugas yang ditahan untuk pengujian, tingkat penyelesaian naik dari 60,0% menjadi 80,0%. Kualitas pengujian naik dari 3,77 menjadi 4,14 dengan anggaran 20 juta token.
Angka-angka ini menggambarkan hasil evaluasi tertentu. Saat membandingkan sistem, penting untuk mempertimbangkan tugas dan anggarannya, bukan menerapkan angka-angka tersebut pada kondisi lain.
Cara memilih strategi penyimpanan varian
Penyimpanan varian menimbulkan biaya tambahan yang dapat diukur. Namun, kendali atas ruang pencarian meningkatkan kualitas melalui penyuntingan yang dapat dieksekusi dan titik awal alternatif.
| Strategi | Hasil setelah pergeseran tugas |
|---|---|
| Penyimpanan berdasarkan kategori | Mengurangi penurunan kinerja pada tugas awal |
| Penyimpanan acak | Memberikan hasil lebih tinggi pada set target |
Pilihan bergantung pada prioritas: mempertahankan hasil pada tugas awal atau mencapai hasil yang lebih tinggi pada set target. Biaya penyimpanan varian tetap menjadi bagian dari evaluasi.



