SymbolicLight V1: model bahasa dengan spike yang jarang dan jalur residual kontinu

26 September 202616 tampilan

Artikel ini menyajikan arsitektur dua alur, yang memadukan dinamika spiking LIF dengan pemrosesan konteks kontinu dan perhatian lokal; empat model dilatih dari awal menggunakan data berbahasa Mandarin dan Inggris. Pengujian encoder menunjukkan sekitar 90% spike bernilai nol, tetapi rata-rata perplexity 7,7% lebih buruk daripada GPT‑2 dengan ukuran sebanding, sementara kecepatan generasi yang diukur jauh lebih lambat—hasil ini menggambarkan kompromi antara sparsitas, kualitas, dan efisiensi komputasi.

SymbolicLight V1: model bahasa dengan spike yang jarang dan jalur residual kontinu

Cara kerja arsitektur

SymbolicLight V1 adalah model bahasa dengan dua jalur: dinamika biner Leaky Integrate-and-Fire (LIF) dan aliran residual kontinu.

  • Mixer Dual-Path SparseTCAM menggabungkan state dengan peluruhan eksponensial orde pertama dan perhatian jendela lokal.
  • Kedua komponen bekerja dalam aliran residual kontinu.
  • Setelah mixer, model menggunakan kepala dekoder yang dikondisikan oleh konteks.

Kriteria praktis: arsitektur ini menarik untuk mempelajari kombinasi dinamika spike yang jarang dan aliran kontinu. Arsitektur itu sendiri tidak membuktikan keunggulan dalam kecepatan atau akurasi.

Data yang digunakan untuk melatih dan mengevaluasi model

Empat model SymbolicLight V1 dilatih dari nol. Masing-masing memiliki 194M parameter.

  • Korpus pelatihan mencakup 3B token dalam bahasa Mandarin dan Inggris.
  • Korpus mencakup 10 domain.
  • Pada set evaluasi tetap berbobot token, PPL berada di kisaran 8.88–8.93. Rata-ratanya adalah 8.904, dengan simpangan baku sampel sebesar 0.019.
  • Pemisahan set evaluasi dari aliran pelatihan belum diperiksa.

Token kode mencakup 43.7% dari set evaluasi. Rata-rata PPL tanpa pembobotan untuk sepuluh domain adalah 29.38. Dalam uji coba pelatihan encoder, rata-rata proporsi spike nol adalah 89.96%; angka ini bukan estimasi sparsitas seluruh model.

Kriteria praktis: hasil PPL sebaiknya dipertimbangkan bersama komposisi set evaluasi dan pemisahan data yang belum diverifikasi. Proporsi spike nol tidak dapat digeneralisasi ke seluruh model.

Perbandingan model dengan GPT-2

Dengan korpus, tokenizer, anggaran token, dan perangkat keras yang sama, rata-rata PPL berbobot token SymbolicLight V1 tercatat 7.7% lebih tinggi daripada GPT-2 201M.

KriteriaHasil
PPLSymbolicLight: rata-rata 8.904; GPT-2 201M: 8.27
Zero-shotPada lima benchmark, dua model berskala 200M tidak menunjukkan perbedaan akurasi yang jelas
Pengulangan 4-gramPada temperature 0.7 dan top-k 50, SymbolicLight menghasilkan lebih sedikit pengulangan
Modulasi entropiAturan ini membalikkan urutan model berdasarkan pengulangan

Kriteria praktis: pilihan bergantung pada metrik yang dievaluasi. GPT-2 unggul dalam PPL, sedangkan hasil pengulangan bergantung pada aturan generasi.

Hasil pengukuran kecepatan dan konsumsi energi

Kecepatan generasi SymbolicLight V1 dan GPT-2 diukur pada RTX 2080 Ti. Estimasi konsumsi energi diperoleh dari pembacaan daya setelah generasi, tanpa mengintegrasikan daya selama proses generasi.

ModelKecepatan generasiEstimasi konsumsi energi
SymbolicLight V122.8 token/detiksekitar 2,848 mJ/token
GPT-291.5 token/detiksekitar 905 mJ/token

Dalam pengukuran ini, GPT-2 menghasilkan teks lebih cepat dan estimasi konsumsi energinya lebih rendah. Estimasi energi tersebut tidak didasarkan pada integrasi daya selama proses generasi.

Kriteria praktis: untuk membandingkan kecepatan dan konsumsi energi, hasil yang tersedia hanya dari pengukuran ini pada RTX 2080 Ti.

Pertanyaan yang sering ditanyakan

Bahan terkait

Semua bahan
SymbolicLight V1: model bahasa dengan spike yang jarang dan jalur residual kontinu