Masalah anggaran ahli yang seragam
Transformer MoE dengan aktivasi sparse menetapkan jumlah ahli yang dirutekan yang sama di semua lapisan. Ini mengabaikan heterogenitas redundansi antar lapisan yang telah terdokumentasi.
MAPLE adalah framework plug-and-play. Ia mendistribusikan ulang anggaran ahli yang dirutekan antar lapisan pada MoE LLM yang telah dilatih sebelumnya. Metode ini tidak mengubah bobot dan tidak memerlukan pelatihan ulang.
Properti utama:
- Distribusi anggaran yang heterogen per lapisan.
- Tidak ada perubahan bobot model.
- Tidak ada pelatihan ulang.
- Dapat diterapkan pada MoE LLM yang telah dilatih sebelumnya.
Kriteria praktis: pendekatan ini diperlukan ketika ingin mengubah distribusi ahli tanpa mengubah bobot dan tanpa pelatihan ulang.

Sensitivitas lapisan dan formula tertutup
MAPLE menyelidiki setiap lapisan. Metode ini memeriksa respons lapisan terhadap perubahan jumlah ahli. Sensitivitas diukur secara kuantitatif dengan tiga ukuran.
Tahapan pemindahan anggaran:
- Penyelidikan setiap lapisan.
- Evaluasi respons terhadap perubahan jumlah ahli.
- Pengukuran sensitivitas secara kuantitatif dengan tiga ukuran.
- Penurunan distribusi anggaran yang optimal secara analitis.
- Penyempurnaan dengan pencarian genetika yang dibatasi oleh sensitivitas.
Distribusi analitis mengarahkan kapasitas ke lapisan yang sensitif. Pada lapisan yang redundan, pengurangan anggaran dapat diserap. Pencarian genetika menggunakan sensitivitas per lapisan sebagai prior. Ini menghasilkan konvergensi yang lebih cepat dan kualitas distribusi yang lebih baik.
Kesimpulan: pemindahan anggaran bertumpu pada sensitivitas yang terukur, bukan pada aturan yang seragam.

Perbandingan dengan pendekatan seragam dan pruning
MAPLE mengungguli baseline seragam dan berbasis pruning pada empat model MoE dengan skala dan arsitektur yang berbeda. Perbandingan dilakukan pada anggaran ahli yang dirutekan sebesar 75%.
| Varian | Anggaran ahli yang dirutekan | Hasil |
|---|---|---|
| Baseline seragam | 75% | Kalah dari MAPLE |
| Baseline berbasis pruning | 75% | Kalah dari MAPLE |
| MAPLE | 75% | Mengungguli kedua baseline |
| Baseline seragam | 100% | Kalah dari MAPLE dengan 75% pada DeepSeek-MoE-16B untuk ARC-E, ARC-C, dan BoolQ |
Pada DeepSeek-MoE-16B, MAPLE hanya menggunakan 75% ahli. Meskipun demikian, ia mengungguli baseline seragam 100% pada ARC-E, ARC-C, dan BoolQ.
Peningkatan akurasi:
- ARC-E: dari 65,09 menjadi 71,40.
- ARC-C: dari 48,49 menjadi 51,50.
- BoolQ: dari 80,03 menjadi 82,38.
Kesimpulan: distribusi yang heterogen dapat lebih efektif daripada sekadar mengaktifkan lebih banyak ahli.

Efisiensi pada penyajian di SGLang
Implementasi MAPLE di SGLang menurunkan latensi penyajian end-to-end pada satu GPU sebesar 32,2%. Throughput meningkat sebesar 47,4%.
Metode ini tidak mengubah bobot. Karena itu, ia dapat diintegrasikan ke dalam stack penyajian MoE yang ada. Ini menjadikan pemindahan anggaran sebagai tuas praktis untuk inferensi.
Kriteria praktis: untuk penyajian single-GPU melalui SGLang, metode ini memberikan penurunan latensi dan peningkatan throughput.
Kriteria pemilihan
MAPLE layak dipertimbangkan dalam beberapa kasus:
- Perlu mengurangi anggaran ahli yang dirutekan tanpa pelatihan ulang.
- Modelnya adalah MoE LLM yang telah dilatih sebelumnya.
- Perlu memperhitungkan ketidakhomogenan per lapisan, bukan aturan yang seragam.
- Perlu meningkatkan efisiensi inferensi MoE.
Kesimpulan: distribusi ahli yang heterogen menjadi poros yang fundamental dan praktis untuk meningkatkan efisiensi MoE.



