MAPLE : transfert du budget des experts routés entre les couches d'un modèle MoE sans modifier les poids

20 septembre 202618 vues

Le travail montre qu'un nombre unique d'experts routés pour toutes les couches est systématiquement inférieur à une répartition inégale, et propose un mécanisme enfichable reposant sur l'évaluation de la sensibilité des couches. Sur quatre modèles MoE, l'approche, avec 75 % du budget d'experts, surpasse à la fois le schéma uniforme et la réduction du nombre d'experts, et dans SGLang, elle réduit la latence de service de 32,2 % et augmente le débit de 47,4 %.

MAPLE : transfert du budget des experts routés entre les couches d'un modèle MoE sans modifier les poids

Le problème du budget uniforme des experts

Les transformeurs MoE à activation parcimonieuse fixent un nombre identique d'experts routés dans toutes les couches. Cela ignore l'hétérogénéité documentée de la redondance entre les couches.

MAPLE est un framework plug-and-play. Il redistribue le budget d'experts routés entre les couches de n'importe quel LLM MoE préentraîné. La méthode ne modifie pas les poids et ne nécessite pas de réentraînement.

Propriétés clés :

  • Distribution hétérogène du budget par couche.
  • Aucune modification des poids du modèle.
  • Aucun réentraînement.
  • Applicabilité à un LLM MoE préentraîné.

Critère pratique : l'approche est nécessaire lorsqu'il faut modifier la répartition des experts sans modifier les poids ni réentraîner.

Sensibilité des couches et formule fermée

MAPLE sonde chaque couche. La méthode vérifie la réaction de la couche au changement du nombre d'experts. La sensibilité est quantifiée par trois mesures.

Étapes du transfert de budget :

  • Sondage de chaque couche.
  • Évaluation de la réaction au changement du nombre d'experts.
  • Quantification de la sensibilité par trois mesures.
  • Déduction d'une répartition analytiquement optimale du budget.
  • Affinage par recherche génétique avec contrainte de sensibilité.

La répartition analytique dirige la capacité vers les couches sensibles. Dans les couches redondantes, la réduction du budget est absorbée. La recherche génétique utilise la sensibilité par couche comme a priori. Cela donne une convergence plus rapide et une meilleure qualité de répartition.

Conclusion : le transfert de budget s'appuie sur une sensibilité mesurable, et non sur une règle uniforme.

Comparaison avec les approches uniformes et de pruning

MAPLE surpasse les baselines uniformes et basées sur le pruning sur quatre modèles MoE d'échelle et d'architecture différentes. La comparaison se fait à 75 % de budget d'experts routés.

VarianteBudget d'experts routésRésultat
Baseline uniforme75 %Inférieur à MAPLE
Baseline basée sur le pruning75 %Inférieur à MAPLE
MAPLE75 %Surpasse les deux baselines
Baseline uniforme100 %Inférieur à MAPLE à 75 % sur DeepSeek-MoE-16B pour ARC-E, ARC-C et BoolQ

Sur DeepSeek-MoE-16B, MAPLE n'utilise que 75 % des experts. Il dépasse néanmoins la baseline uniforme à 100 % sur ARC-E, ARC-C et BoolQ.

Gain de précision :

  • ARC-E : de 65,09 à 71,40.
  • ARC-C : de 48,49 à 51,50.
  • BoolQ : de 80,03 à 82,38.

Conclusion : une répartition hétérogène peut être plus efficace que la simple activation d'un plus grand nombre d'experts.

Efficacité du service dans SGLang

L'implémentation de MAPLE dans SGLang réduit la latence de service de bout en bout sur une seule GPU de 32,2 %. Le débit augmente de 47,4 %.

La méthode ne modifie pas les poids. Elle peut donc être intégrée à la pile de service MoE existante. Cela fait du transfert de budget un levier pratique pour l'inférence.

Critère pratique : pour le service sur une seule GPU via SGLang, la méthode apporte une réduction de la latence et une augmentation du débit.

Critères de choix

MAPLE mérite d'être envisagé dans plusieurs cas :

  • Il faut réduire le budget d'experts routés sans réentraînement.
  • Le modèle est un LLM MoE préentraîné.
  • Il faut tenir compte de l'hétérogénéité par couche plutôt que d'une règle uniforme.
  • Il faut améliorer l'efficacité de l'inférence MoE.

Conclusion : la répartition hétérogène des experts devient un axe fondamental et pratique d'amélioration de l'efficacité des MoE.

Foire aux questions

Matériaux connexes

Tous matériaux
MAPLE : transfert du budget des experts routés entre les couches d'un modèle MoE sans modifier les poids