Simulasi untuk menguji inferensi kausal tentang kegagalan iklan

29 September 202612 tampilan

Di TRACE, intervensi tersembunyi dalam simulator iklan digital memungkinkan penilaian otomatis terhadap apakah agen berhasil mengidentifikasi sumber gangguan dan segmen yang terdampak, meskipun agen harus menganalisis data yang bising menggunakan Python dan SQL. Setelah menjalani pembelajaran penguatan dengan sinyal sintetis, model Qwen3.5-35B-A3B memperoleh skor 0,757 pada FullAttr@1 dalam 235 episode pengujian—lebih tinggi daripada semua varian yang diuji dengan prompt, sekaligus dengan jumlah pemanggilan alat yang lebih sedikit dibandingkan model dasar.

Simulasi untuk menguji inferensi kausal tentang kegagalan iklan

Apa yang diuji oleh simulasi

TRACE adalah lingkungan diagnostik untuk periklanan digital. TRACE mencakup 12 penyebab utama dan atribusi segmen yang terperinci. Dalam setiap episode, agen menyelidiki data menggunakan Python dan SQL. Kemudian, agen menentukan penyebab utama dan, jika relevan, segmen yang terdampak.

TRACE dijelaskan dalam makalah karya Rui Sun, Zhan Shi, dan Bing He, yang diajukan ke arXiv pada 9 September 2026. ID makalahnya adalah arXiv:2609.10315.

Cara evaluasi dilakukan

Evaluasi dibangun berdasarkan intervensi dan pengamatan yang ditimbulkannya:

  • Intervensi dipilih dan dimasukkan ke dalam simulator terkontrol.
  • Simulator menghasilkan pengamatan yang sesuai.
  • Agen menyelidiki data dan mencari penyebab kegagalan.
  • Intervensi tersembunyi berfungsi sebagai label acuan dan memungkinkan penghitungan imbalan objektif.

Agen tidak menerima penjelasan yang sudah jadi. Agen harus mencocokkan bukti yang berisik, bercampur, dan tersebar di antara data. Dengan demikian, simulasi ini menguji inferensi kausal, bukan sekadar pengenalan jawaban yang telah ditentukan sebelumnya.

Cara membaca hasil

Para penulis mengevaluasi model pada set pengujian tertahan yang terdiri atas 235 episode. Baseline prompting terkuat adalah Claude Opus 5 dengan skor 0.686 FullAttr@1.

Model atau tahapHasil
Qwen3.5-35B-A3B setelah supervised fine-tuning0.159 → 0.637
Model yang sama setelah RL dengan imbalan tersintesis0.757
Qwen3.5-122B-A10B dalam baseline promptingDi bawah hasil 0.757

Hasil 0.757 melampaui semua baseline prompting yang dievaluasi, termasuk model frontier dengan kode sumber tertutup. Para penulis juga melaporkan bahwa policy yang dihasilkan menggunakan panggilan alat jauh lebih sedikit daripada versi prompting dari model dasar 35B.

Implikasi hasil bagi pelatihan agen

Para penulis berpendapat bahwa akses ke sinyal pelatihan objektif yang dapat diskalakan berpotensi menjadi kendala yang lebih penting daripada ukuran model semata. Kesimpulan ini berlaku untuk tugas yang dijelaskan, bukan aturan universal untuk semua sistem AI.

Evaluasi simulasi dapat membuat tugas penalaran diagnostik yang ambigu cocok untuk pelatihan penguatan berskala besar. Syarat utamanya adalah kesimpulan agen dapat dicocokkan dengan intervensi tersembunyi dan imbalan objektif dapat dihitung.

Kapan pendekatan ini sesuai

Simulasi cocok untuk menguji inferensi kausal jika rumusan tugas memungkinkan:

  • menetapkan intervensi dan memasukkannya ke dalam lingkungan terkontrol;
  • menghasilkan pengamatan yang terkait dengannya;
  • menyimpan intervensi sebagai label acuan tersembunyi;
  • mengevaluasi penyebab utama dan segmen yang terdampak, jika relevan.

Jika tugas tidak memungkinkan pencocokan dengan label acuan seperti itu, mekanisme imbalan objektif yang dijelaskan tidak dapat diterapkan. Kriteria praktis untuk memilih pendekatan ini adalah apakah kesimpulan agen dapat diverifikasi berdasarkan penyebab tersembunyi tanpa mengungkapkannya selama analisis.

Pertanyaan yang sering ditanyakan

Simulasi untuk menguji inferensi kausal tentang kegagalan iklan