Pembagian alih-alih pengurangan: normalisasi rekuren menjaga besaran kontinu tetap berada dalam subruang "lambat" berdimensi rendah

14 September 20269 tampilan

Penulis arXiv:2608.01947 mengusulkan RDNN — jaringan rekuren yang sangat sederhana, yang dinamikanya dibangun di atas operasi pembagian. Mekanisme semacam ini memaksa model untuk memadat ke dalam manifold lambat berdimensi rendah yang sempit dan memungkinkan penahanan sinyal yang berubah secara halus dengan tepat di tempat di mana GRU dan LSTM terurai menjadi keadaan titik yang terpisah.

Pembagian alih-alih pengurangan: normalisasi rekuren menjaga besaran kontinu tetap berada dalam subruang "lambat" berdimensi rendah

Memori kerja di mana yang penting bukan angka, melainkan besaran

Menyimpan variabel kontinu dalam pikiran — sudut rotasi, kecepatan, posisi kursor, kekuatan tekanan — dan menyesuaikannya secara halus: ini mungkin ujian paling jujur untuk memori kerja. Mengingat "angka tujuh" tidaklah sulit, tetapi mempertahankan besaran tanpa batas alami, yang mampu bergeser sebesar pecahan sekecil apa pun, adalah persoalan dengan kelas yang sama sekali berbeda.

Hubungan jaringan artifisial dengannya secara historis memang tegang. Model dengan atraktor kontinu — yakni keadaan stabil yang membentuk bukan sekumpulan kecil titik terisolasi, melainkan permukaan yang mulus — bertahan hanya dengan harapan kosong: geser sedikit parameternya, dan perilakunya pun runtuh.

Mengapa arsitektur rekuren konvensional "mengkuantisasi" keadaan

Solusi rekuren standar, termasuk GRU dan LSTM, biasanya memang tidak pernah mempelajari manifold kontinu. Alih-alih kontinum, mereka memecah ruang keadaan menjadi atraktor titik diskret: jaringan seolah membulatkan input ke "rak" terdekat. Untuk klasifikasi ini praktis, untuk estimasi kuantitatif ini adalah vonis.

Tim peneliti (Zhaotian Gu, Jie Su, Weiwei Wang, Chang Liu, Tianyi Qian, Dahui Wang) mengusulkan untuk mengobatinya bukan dengan memperumit arsitektur, melainkan dengan satu trik komputasional yang spesifik. Karya ini diterbitkan di Transactions on Machine Learning Research (Agustus 2026), prapraannya tersedia sebagai arXiv:2608.01947 di bagian q-bio.NC, cs.AI, dan cs.NE.

Pembagian alih-alih pengurangan: model minimal

Idenya datang dari neurobiologi. Pembagian (divisive normalization) adalah operasi kanonis yang diamati di sirkuit kortikal secara luas, dan para penulis membangun di sekitarnya sebuah jaringan rekuren minimal yang terisolasi secara aljabar — Recurrent Divisive Normalization Network, disingkat RDNN. Di dalamnya tidak ada yang berlebihan: hanya dinamika pembagian dan apa pun yang menyertainya.

Selanjutnya — langkah yang standar untuk neurobiologi komputasional: analisis sistem dinamis pada tugas-tugas klasik memori kerja. Dan di sini batasan biofisik tiba-tiba berbalik menjadi keunggulan. Jaringan konvergen ke manifold lambat yang stabil, dengan presisi tinggi: lintasannya tidak menyebar, melainkan menempel pada permukaan yang sempit dan bergerak dengan tenang di atasnya.

Apa yang terjadi pada gradien

Alur tersendiri dari karya ini — pembedahan pembelajaran melalui backpropagation through time (BPTT). Pembagian menghadirkan penskalaan gradien lokal yang bergantung pada aktivitas saat itu: semakin kuat blok tereksitasi, semakin sederhana pembaruan parameter yang diterimanya. Hasilnya adalah rem bawaan yang aktif tepat di tempat yang dibutuhkan.

Efeknya teramati: peringkat efektif jaringan menyusut dengan sendirinya secara signifikan, dan dinamika rekurennya ternyata terkurung dalam subruang berdimensi rendah yang sempit. Pada saat yang sama para penulis menekankan perbedaannya dengan faktorisasi peringkat rendah yang eksplisit — di sana batasan semacam itu sering kali menyebabkan patologi optimisasi, sedangkan di sini ia muncul sendiri, sebagai efek samping dari aktivitas.

Ablasi: tanpa pembagian manifold pun runtuh

Bagian yang paling berbicara — perbandingan dengan inhibisi subtraktif. Penggantian semacam itu mampu mempertahankan ingatan statis: mempertahankan titik tetap bukanlah masalah. Tetapi begitu sinyal input mulai berubah seiring waktu, manifold pun "pecah" (manifold shattering) — kontinuitas menghilang tepat di tempat yang paling membutuhkannya.

Dari sini muncul kesimpulan yang layak diingat: pembagian bukanlah keanehan biologis yang diwarisi dari korteks, melainkan mekanisme komputasional yang berfungsi. Ia diperlukan agar jaringan mempelajari representasi kontinu berpresisi tinggi, bukan sekadar diskretisasi yang rapi.

Apa yang harus dilakukan dengan ini dalam praktik

Makna praktisnya bukanlah untuk segera menulis ulang semua model rekuren. Lebih tepatnya ini adalah pengingat: normalisasi bukan hanya soal stabilitas pembelajaran dan bukan hanya soal regularisasi. Ini adalah cara untuk menetapkan geometri ruang keadaan internal, dan pembagian di sini memiliki keunggulan yang jelas dibandingkan pengurangan.

Jika tugas menuntut untuk mempertahankan besaran kontinu dan memperbaruinya secara halus — dalam pengendalian, pelacakan, dalam sistem apa pun dengan "seberapa banyak" alih-alih "yang mana dari" — masuk akal untuk mencermati skema dengan normalisasi multiplikatif. Harganya minimal, dan sebagai gantinya jaringan berhenti membulatkan apa yang seharusnya tidak dibulatkan.

Pertanyaan yang sering ditanyakan

Bahan terkait

Semua bahan
Pembagian alih-alih pengurangan: normalisasi rekuren menjaga besaran kontinu tetap berada dalam subruang "lambat" berdimensi rendah