La trace ne révèle pas tout : lecture à deux niveaux de l'état interne du raisonnement dans les modèles MoE

29 août 20269 vues

Les chercheurs compressent les états internes de raisonnement dans un cadre sémantique compact J64 à 64 axes, qui peut être reconstruit à partir des statistiques de routage des experts. Cela permet d'évaluer plus précisément le déroulement de la résolution, d'améliorer la sélection des réponses et de contrôler l'arrêt de la génération : le gain d'AUC atteint 0,135, et celui de la précision jusqu'à 5,9 points de pourcentage.

La trace ne révèle pas tout : lecture à deux niveaux de l'état interne du raisonnement dans les modèles MoE

Pourquoi se fier à la trace de routage est risqué

Dans les modèles basés sur une architecture de mélange d'experts (MoE), chaque jeton passe par un petit sous-ensemble de « spécialistes ». Après le traitement, il reste une trace formelle — quels experts ont été appelés et avec quels poids. Une telle trace est pratique à utiliser comme explication, mais elle ressemble à un enregistrement d'appels téléphoniques sans le contenu de la conversation : on voit qui a appelé qui, mais pas ce qui a été convenu.

Un récent préprint (Chen et al., arXiv:2608.17638) montre que l'interprétation basée sur la trace omet une couche d'information importante. Les auteurs proposent de lire non seulement le chemin visible, mais aussi l'état interne du raisonnement du modèle. L'idée clé est une lecture à deux niveaux : d'abord un espace sémantique compact, puis un proxy économique, reconstruit à partir des statistiques ordinaires de routage.

Lecteur d'état à deux niveaux

J64 : 64 axes au lieu du vocabulaire complet

Le premier niveau est construit à partir de l'espace J, dont la taille est comparable au vocabulaire du modèle. Cet espace est distillé en un cadre sémantique compact J64 — seulement 64 axes. Le résultat n'est pas une projection thématique arbitraire, mais un ensemble d'invariants appris sur les états de raisonnement propres au modèle.

Le principal avantage de J64 est qu'il voit des états absents de la trace visible. Deux traces de routage identiques peuvent cacher des processus internes différents, et J64 aide à les distinguer. De plus, il sépare deux charges distinctes : l'effort que le modèle investit dans le raisonnement et la difficulté intrinsèque de l'exemple pour lui.

Les tests sur des données retenues montrent que le gain d'aire sous la courbe ROC est de 0,096–0,135 par rapport à l'approche de base, qui lit le même rollout comme un remplissage de jetons et utilise la même agrégation. Autrement dit, l'amélioration vient précisément de la méthode de lecture de l'état, et non d'un changement du modèle ou du format des données.

R64 : la même image avec des statistiques économiques

J64 a un inconvénient pratique : il nécessite un accès aux représentations internes du modèle. Pour rendre l'approche applicable en production, les auteurs reconstruisent J64 à partir des statistiques natives du routage des experts. Ce proxy est appelé R64 et n'entraîne pas de surcoût significatif pendant l'inférence.

La corrélation médiane par axe entre R64 et J64 sur trois modèles et deux familles d'architectures atteint 0,69–0,86. Sur le modèle gpt-oss-20b, R64 conserve 95–100 % du gain prédictif du J64 original. En d'autres termes, pour de nombreuses tâches, il n'est pas nécessaire de calculer l'espace sémantique complet : il suffit de relever les statistiques du mécanisme de routage déjà existant.

Deux résolutions temporelles pour les décisions au moment du test

La lecture de l'état fonctionne non seulement comme une explication a posteriori, mais aussi comme un outil d'aide à la décision. Les auteurs examinent deux scénarios : l'analyse de candidats terminés et le pilotage de la génération en temps réel.

Sélection parmi des variantes prêtes

Lorsque le modèle a déjà généré plusieurs variantes de réponse, J64 et R64 améliorent le choix d'une branche parmi les candidats. Le vote pondéré est également testé séparément : si, au lieu d'une simple majorité, on utilise des poids issus de R64, le résultat est meilleur que le vote majoritaire classique dans sept des huit configurations. Cela signifie que l'état caché peut servir de signal plus précis pour l'agrégation des réponses.

Arrêt et rééchantillonnage pendant la génération

Le deuxième scénario est la génération, où la décision doit être prise au fur et à mesure de l'apparition des jetons. Des fenêtres glissantes de lecture sont injectées dans une politique cumulative « stop et rééchantillonne » : à un moment donné, le modèle arrête la branche en cours et recommence à générer. Le point de fonctionnement de cette politique est fixé uniquement sur les questions d'entraînement, de sorte que la méthode ne s'adapte pas aux réponses connues lors du test.

J64 apporte un gain de précision de 1,1 à 5,9 points par rapport à l'expérience de contrôle, qui utilisait des frères et sœurs mélangés. R64, construit uniquement sur le routage, conserve 0,9 à 3,2 points de ce gain. Même le proxy économique s'avère suffisamment utile pour piloter la génération.

Peut-on modifier le raisonnement via le routeur

La dernière partie du travail va au-delà de l'interprétation passive. Les chercheurs modifient le routeur de manière à affecter le mécanisme correspondant à J64. Après cela, le comportement du modèle change de manière prévisible — conformément à l'interprétation de J64. Le « blocage » diagnostiqué du modèle se déplace alors d'une devinette numérique vers une exécution symbolique précise.

C'est un signal important : les axes de J64 capturent non seulement une corrélation, mais un rôle causal dans le raisonnement. Si la modification du routeur produit les changements attendus, cela signifie que l'état lu participe réellement à la prise de décision, et n'est pas un artefact secondaire.

La trace MoE reste une interface pratique, mais trop grossière, avec le modèle. La lecture à deux niveaux — d'abord une projection sémantique économique, puis un proxy basé sur le routage — permet de voir ce qui se passe avant et au-delà des appels visibles aux experts. Ces « tableaux de bord » internes pourraient devenir le prochain outil standard pour le débogage et le pilotage des grands modèles.

Foire aux questions

Matériaux connexes

Tous matériaux
La trace ne révèle pas tout : lecture à deux niveaux de l'état interne du raisonnement dans les modèles MoE