Kesegaran versus kegunaan: CausalCache meninjau ulang aturan pemilihan tangkapan layar dalam memori agen GUI

14 September 202611 tampilan

Alih-alih mengalokasikan semua slot visual ke tindakan terbaru, metode ini mengevaluasi seluruh riwayat dan mengembalikan frame arsip ke peristiwa yang akan memberikan hasil lebih besar. Pada OSWorld-Verified, mengaktifkan screenshot lama menambah sekitar 13 poin persentase terhadap tingkat keberhasilan dibandingkan memori dari ringkasan saja, dan transfer zero-shot ke MobileWorld menaikkan hasil dari 30,2% menjadi 36,8%.

Kesegaran versus kegunaan: CausalCache meninjau ulang aturan pemilihan tangkapan layar dalam memori agen GUI

Anggaran yang selalu habis untuk frame terbaru

Agen GUI berumur panjang bekerja seperti makhluk dengan ingatan buruk terhadap gambar. Riwayat tindakan tekstual bisa ia bawa hampir tanpa batas — ringkasannya ringan. Namun tangkapan layar mahal: hanya segelintir gambar yang muat di jendela aktif model. Dari sinilah muncul masalah yang oleh para penulis disebut budgeted fidelity restoration. Setiap peristiwa tetap tersimpan sebagai deskripsi terkompresi, tetapi anggaran tetap B menentukan peristiwa mana yang akan mendapatkan kembali piksel arsipnya.

Varian dasar Recent-B menjawab pertanyaan ini dengan cara paling sederhana: semua slot visual diberikan kepada peristiwa terbaru. Logika "semakin baru, semakin berguna" tampak wajar, tetapi ia punya titik buta — ia sama sekali tidak memeriksa apakah layar terbaru benar-benar lebih penting daripada yang ada dua puluh langkah sebelumnya. Kadang pengguna berpindah ke jendela lain, mengubah sesuatu di sana, lalu kembali — dan hal yang paling dibutuhkan untuk tindakan berikutnya tertinggal jauh dalam riwayat.

Prinsip seleksi yang lain

CausalCache — metode yang dijelaskan dalam makalah arXiv:2608.22577 (Jiaxuan Luo, Zhanfeng Liao, Jiayao Teng, Yuan Wang; v1 tanggal 23 Agustus 2026, pembaruan v2 tanggal 25 Agustus, sembilan halaman dan empat gambar). Alih-alih aturan "yang terbaru mendapat semuanya", ia menilai seluruh riwayat dan menyisipkan peristiwa yang lebih lama tepat ketika utilitas prediksinya melebihi utilitas kandidat terbaru. Pertanyaannya bukan "apa yang baru saja terjadi", melainkan "apa yang akan berguna pada langkah berikutnya".

Adaptor yang tahu tempatnya

Paruh kedua konstruksi ini adalah adaptor key/value yang digerbangi riwayat (history-gated). Ia hanya menyentuh token dari gambar historis yang dipulihkan dan sepenuhnya nonaktif ketika tidak ada gambar semacam itu dalam konteks. Ini detail penting: pemrosesan layar saat ini tidak menurun hanya karena sistem pada prinsipnya mampu mengambil frame lama.

Selektor dan adaptor dilatih dengan intervensi pada anggaran yang diselaraskan — matched-budget interventions — pada trajektori desktop, lalu diuji secara zero-shot pada perangkat seluler, yakni tanpa penyesuaian apa pun untuk platform baru.

Apa yang ditunjukkan pengukuran

Desktop: ada keuntungan, tapi tidak langsung

Pada OSWorld-Verified, pengaktifan tangkapan layar historis menaikkan tingkat keberhasilan sekitar 13 poin persentase dibandingkan memori yang hanya berisi ringkasan tekstual. Terdengar mengesankan, tetapi selanjutnya muncul nuansa.

Pada batas resmi 15 langkah, CausalCache dan Recent-4 sederhana secara statistik tidak dapat dibedakan. Artinya, pada episode pendek seluruh upaya ini tidak sepadan: riwayatnya memang belum sempat mengumpulkan sesuatu yang berharga, dan seleksi yang rakus terhadap kebaruan bekerja tidak lebih buruk. Namun pada diagnostik 30 langkah, muncul selisih — 46,7% versus 42,4%, kenaikan 4,3 poin.

Seluler: transfer tanpa pelatihan ulang

Zero-shot pada 117 tugas MobileWorld menghasilkan 36,8% versus 30,2% pada Recent-4. Metode yang dilatih pada trajektori desktop juga menang di ponsel — inilah hasil yang menunjukkan bahwa ini bukan soal penyesuaian terhadap antarmuka tertentu.

Yang lebih menarik adalah di mana tepatnya keuntungan itu menetap. Ia terkonsentrasi pada split cross-app memory-candidate yang telah ditentukan sebelumnya: 30,6% versus 19,4%, yakni +11,2 poin. Pada kontrol single-app tidak ditemukan perbedaan sama sekali — 43,6% versus 42,4%. Gambarannya konsisten: keunggulan muncul di tempat tugas menuntut mengingat keadaan satu aplikasi sambil bertindak di aplikasi lain.

Apa implikasinya

Rumusan para penulis berbunyi demikian: memilih peristiwa masa lalu mana yang pikselnya dipulihkan lebih efektif daripada menghabiskan seluruh anggaran visual tetap untuk kebaruan. Sulit dibantah setelah keuntungannya ternyata terkonsentrasi justru pada tugas dengan perpindahan antar aplikasi.

Namun interpretasi yang jujur menuntut dua catatan. Pertama: pada horizon pendek tidak ada perbedaan, yang berarti metode ini bukan peningkatan gratis, melainkan taruhan pada episode panjang, di mana riwayat yang terakumulasi memang bermakna. Kedua: dari tidak adanya perbedaan pada kontrol single-app dapat disimpulkan bahwa seleksi berdasarkan utilitas tidak universal — ia menyelesaikan kelas masalah tertentu, di mana agen perlu mengembalikan layar yang sudah lama berlalu ke dalam konteks.

Kesimpulan praktis bagi mereka yang membangun agen: kebaruan adalah kriteria yang nyaman, tetapi bukan satu-satunya. Begitu anggaran gambar menjadi hambatan, masuk akal untuk bertanya apa sebenarnya yang Anda masukkan ke dalamnya — frame terbaru karena inersia, atau frame yang benar-benar akan berguna pada langkah berikutnya.

Pertanyaan yang sering ditanyakan

Bahan terkait

Semua bahan
Kesegaran versus kegunaan: CausalCache meninjau ulang aturan pemilihan tangkapan layar dalam memori agen GUI