Problema del presupuesto uniforme de expertos
Los transformadores MoE con activación dispersa fijan el mismo número de expertos enrutados en todas las capas. Esto ignora la heterogeneidad documentada de redundancia entre capas.
MAPLE es un framework plug-and-play. Redistribuye el presupuesto de expertos enrutados entre las capas de cualquier MoE LLM preentrenada. El método no modifica los pesos ni requiere reentrenamiento.
Propiedades clave:
- Distribución heterogénea del presupuesto por capas.
- Sin modificación de los pesos del modelo.
- Sin reentrenamiento.
- Aplicabilidad a una MoE LLM preentrenada.
Criterio práctico: el enfoque es necesario cuando se requiere cambiar la distribución de expertos sin modificar los pesos ni reentrenar.

Sensibilidad de las capas y fórmula cerrada
MAPLE sondea cada capa. El método verifica la reacción de la capa al cambio en el número de expertos. La sensibilidad se cuantifica con tres medidas.
Etapas de la transferencia de presupuesto:
- Sondeo de cada capa.
- Evaluación de la reacción al cambio en el número de expertos.
- Cuantificación de la sensibilidad con tres medidas.
- Derivación de la distribución de presupuesto analíticamente óptima.
- Refinamiento mediante búsqueda genética con restricción por sensibilidad.
La distribución analítica dirige la capacidad hacia las capas sensibles. En las capas redundantes, la reducción del presupuesto se absorbe. La búsqueda genética utiliza la sensibilidad por capa como prior. Esto da una convergencia más rápida y una mejor calidad de distribución.
Conclusión: la transferencia de presupuesto se basa en la sensibilidad medible, no en una regla uniforme.

Comparación con enfoques uniformes y basados en pruning
MAPLE supera a los baselines uniformes y basados en pruning en cuatro modelos MoE de diferente escala y arquitectura. La comparación se realiza con un presupuesto del 75% de expertos enrutados.
| Variante | Presupuesto de expertos enrutados | Resultado |
|---|---|---|
| Baseline uniforme | 75% | Inferior a MAPLE |
| Baseline basado en pruning | 75% | Inferior a MAPLE |
| MAPLE | 75% | Superior a ambos baselines |
| Baseline uniforme | 100% | Inferior a MAPLE con 75% en DeepSeek-MoE-16B en ARC-E, ARC-C y BoolQ |
En DeepSeek-MoE-16B, MAPLE utiliza solo el 75% de los expertos. Aun así, supera al baseline uniforme original del 100% en ARC-E, ARC-C y BoolQ.
Aumento de precisión:
- ARC-E: de 65,09 a 71,40.
- ARC-C: de 48,49 a 51,50.
- BoolQ: de 80,03 a 82,38.
Conclusión: la distribución heterogénea puede ser más eficaz que simplemente activar un mayor número de expertos.

Eficiencia en el servicio con SGLang
La implementación de MAPLE en SGLang reduce la latencia end-to-end del servicio en una sola GPU en un 32,2%. El rendimiento aumenta un 47,4%.
El método no modifica los pesos. Por lo tanto, puede integrarse en el stack de servicio MoE existente. Esto convierte la transferencia de presupuesto en una palanca práctica para la inferencia.
Criterio práctico: para el servicio en una sola GPU a través de SGLang, el método ofrece reducción de latencia y aumento del rendimiento.
Criterios de selección
MAPLE vale la pena considerarlo en varios casos:
- Se necesita reducir el presupuesto de expertos enrutados sin reentrenamiento.
- El modelo es una MoE LLM preentrenada.
- Se requiere tener en cuenta la heterogeneidad por capa, en lugar de una regla uniforme.
- Se necesita aumentar la eficiencia de inferencia de MoE.
Conclusión: la distribución heterogénea de expertos se convierte en un eje tanto teórico como práctico para aumentar la eficiencia de MoE.



