MAPLE: transfer anggaran pakar yang dirutekan antar lapisan model MoE tanpa mengubah bobot

20 September 202618 tampilan

Penelitian ini menunjukkan bahwa jumlah pakar yang dirutekan secara seragam untuk semua lapisan secara sistematis kalah dibandingkan tata letak yang tidak merata, dan mengusulkan mekanisme pluggable yang bertumpu pada penilaian sensitivitas lapisan. Pada empat model MoE, pendekatan ini dengan anggaran pakar 75% mengungguli baik skema seragam maupun pemangkasan pakar, dan pada SGLang menurunkan latensi layanan sebesar 32,2% serta meningkatkan throughput sebesar 47,4%.

MAPLE: transfer anggaran pakar yang dirutekan antar lapisan model MoE tanpa mengubah bobot

Masalah anggaran ahli yang seragam

Transformer MoE dengan aktivasi sparse menetapkan jumlah ahli yang dirutekan yang sama di semua lapisan. Ini mengabaikan heterogenitas redundansi antar lapisan yang telah terdokumentasi.

MAPLE adalah framework plug-and-play. Ia mendistribusikan ulang anggaran ahli yang dirutekan antar lapisan pada MoE LLM yang telah dilatih sebelumnya. Metode ini tidak mengubah bobot dan tidak memerlukan pelatihan ulang.

Properti utama:

  • Distribusi anggaran yang heterogen per lapisan.
  • Tidak ada perubahan bobot model.
  • Tidak ada pelatihan ulang.
  • Dapat diterapkan pada MoE LLM yang telah dilatih sebelumnya.

Kriteria praktis: pendekatan ini diperlukan ketika ingin mengubah distribusi ahli tanpa mengubah bobot dan tanpa pelatihan ulang.

Sensitivitas lapisan dan formula tertutup

MAPLE menyelidiki setiap lapisan. Metode ini memeriksa respons lapisan terhadap perubahan jumlah ahli. Sensitivitas diukur secara kuantitatif dengan tiga ukuran.

Tahapan pemindahan anggaran:

  • Penyelidikan setiap lapisan.
  • Evaluasi respons terhadap perubahan jumlah ahli.
  • Pengukuran sensitivitas secara kuantitatif dengan tiga ukuran.
  • Penurunan distribusi anggaran yang optimal secara analitis.
  • Penyempurnaan dengan pencarian genetika yang dibatasi oleh sensitivitas.

Distribusi analitis mengarahkan kapasitas ke lapisan yang sensitif. Pada lapisan yang redundan, pengurangan anggaran dapat diserap. Pencarian genetika menggunakan sensitivitas per lapisan sebagai prior. Ini menghasilkan konvergensi yang lebih cepat dan kualitas distribusi yang lebih baik.

Kesimpulan: pemindahan anggaran bertumpu pada sensitivitas yang terukur, bukan pada aturan yang seragam.

Perbandingan dengan pendekatan seragam dan pruning

MAPLE mengungguli baseline seragam dan berbasis pruning pada empat model MoE dengan skala dan arsitektur yang berbeda. Perbandingan dilakukan pada anggaran ahli yang dirutekan sebesar 75%.

VarianAnggaran ahli yang dirutekanHasil
Baseline seragam75%Kalah dari MAPLE
Baseline berbasis pruning75%Kalah dari MAPLE
MAPLE75%Mengungguli kedua baseline
Baseline seragam100%Kalah dari MAPLE dengan 75% pada DeepSeek-MoE-16B untuk ARC-E, ARC-C, dan BoolQ

Pada DeepSeek-MoE-16B, MAPLE hanya menggunakan 75% ahli. Meskipun demikian, ia mengungguli baseline seragam 100% pada ARC-E, ARC-C, dan BoolQ.

Peningkatan akurasi:

  • ARC-E: dari 65,09 menjadi 71,40.
  • ARC-C: dari 48,49 menjadi 51,50.
  • BoolQ: dari 80,03 menjadi 82,38.

Kesimpulan: distribusi yang heterogen dapat lebih efektif daripada sekadar mengaktifkan lebih banyak ahli.

Efisiensi pada penyajian di SGLang

Implementasi MAPLE di SGLang menurunkan latensi penyajian end-to-end pada satu GPU sebesar 32,2%. Throughput meningkat sebesar 47,4%.

Metode ini tidak mengubah bobot. Karena itu, ia dapat diintegrasikan ke dalam stack penyajian MoE yang ada. Ini menjadikan pemindahan anggaran sebagai tuas praktis untuk inferensi.

Kriteria praktis: untuk penyajian single-GPU melalui SGLang, metode ini memberikan penurunan latensi dan peningkatan throughput.

Kriteria pemilihan

MAPLE layak dipertimbangkan dalam beberapa kasus:

  • Perlu mengurangi anggaran ahli yang dirutekan tanpa pelatihan ulang.
  • Modelnya adalah MoE LLM yang telah dilatih sebelumnya.
  • Perlu memperhitungkan ketidakhomogenan per lapisan, bukan aturan yang seragam.
  • Perlu meningkatkan efisiensi inferensi MoE.

Kesimpulan: distribusi ahli yang heterogen menjadi poros yang fundamental dan praktis untuk meningkatkan efisiensi MoE.

Pertanyaan yang sering ditanyakan

MAPLE: transfer anggaran pakar yang dirutekan antar lapisan model MoE tanpa mengubah bobot