La traza no lo revela todo: lectura de dos niveles del estado interno de razonamiento en modelos MoE

29 agosto 20269 vistas

Los investigadores comprimen los estados internos de razonamiento en un marco semántico compacto de 64 ejes, J64, que puede reconstruirse a partir de las estadísticas de enrutamiento de expertos. Esto ayuda a evaluar con mayor precisión el proceso de resolución, mejorar la selección de respuestas y controlar la detención de la generación: el incremento del AUC alcanza 0,135 y el de la precisión, hasta 5,9 puntos porcentuales.

La traza no lo revela todo: lectura de dos niveles del estado interno de razonamiento en modelos MoE

¿Por qué es peligroso depender del rastreo

En los modelos basados en arquitectura de mezcla de expertos (MoE), cada token pasa por un pequeño subconjunto de «especialistas». Tras el procesamiento queda un rastro formal: qué expertos fueron invocados y con qué pesos. Esta traza es cómoda de usar como explicación, pero se parece a un registro de llamadas telefónicas sin el contenido de la conversación: se ve quién llamó a quién, pero no de qué se habló.

Un preprint reciente (Chen et al., arXiv:2608.17638) muestra que la interpretación basada en la traza pierde una capa importante de información. Los autores proponen leer no solo la ruta visible, sino también el estado interno del razonamiento del modelo. La idea clave es una lectura de dos niveles: primero un espacio semántico compacto, luego un proxy barato reconstruido a partir de la estadística habitual de enrutamiento.

Lector de estado de dos niveles

J64: 64 ejes en lugar del diccionario completo

El primer nivel se construye a partir del espacio J, cuyo tamaño es comparable al vocabulario del modelo. Este espacio se destila en un marco semántico compacto, J64, con solo 64 ejes. El resultado no es una proyección temática arbitraria, sino un conjunto de invariantes entrenados sobre los propios estados de razonamiento del modelo.

El principal beneficio de J64 es que ve estados que no están en la traza visible. Dos huellas de enrutamiento idénticas pueden ocultar procesos internos diferentes, y J64 ayuda a distinguirlos. Además, separa dos cargas distintas: cuánto esfuerzo invierte el modelo en el razonamiento y cuán difícil es el ejemplo para él.

La validación sobre datos retenidos muestra que el incremento en el área bajo la curva ROC es de 0,096–0,135 en comparación con el enfoque base, que lee el mismo rollout como ocupación de tokens y usa la misma agregación. Es decir, la mejora proviene precisamente del método de lectura del estado, no de un cambio en el modelo ni en el formato de los datos.

R64: la misma imagen con estadística barata

J64 tiene un inconveniente práctico: requiere acceso a las representaciones internas del modelo. Para que el enfoque sea aplicable en producción, los autores reconstruyen J64 a partir de la estadística nativa del enrutamiento de expertos. Este proxy se llama R64 y no genera una sobrecarga significativa durante la inferencia.

La correlación mediana por eje entre R64 y J64 en tres modelos y dos familias de arquitecturas alcanza 0,69–0,86. En el modelo gpt-oss-20b, R64 conserva el 95–100% de la ganancia predictiva del J64 original. En otras palabras, para muchas tareas no es necesario calcular el espacio semántico completo: basta con extraer la estadística del mecanismo de enrutamiento ya existente.

Dos resoluciones temporales para decisiones en tiempo de prueba

La lectura del estado no funciona solo como explicación a posteriori, sino también como herramienta para la toma de decisiones. Los autores consideran dos escenarios: el análisis de candidatos ya completados y la gestión de la generación en tiempo real.

Selección entre opciones ya generadas

Cuando el modelo ya ha generado varias variantes de respuesta, J64 y R64 mejoran la elección de una rama entre los candidatos. Se probó por separado la votación ponderada: si en lugar de la mayoría simple se usan los pesos de R64, el resultado es mejor que el majority voting habitual en siete de ocho configuraciones. Esto significa que el estado oculto puede usarse como una señal más precisa para la agregación de respuestas.

Detención y remuestreo durante la generación

El segundo escenario es la generación, donde la decisión debe tomarse a medida que aparecen los tokens. Las ventanas deslizantes de lectura se alimentan a una política acumulativa de «detener y remuestrear»: en un momento determinado, el modelo detiene la rama actual y comienza a generar de nuevo. El punto de operación de esta política se fija solo con preguntas de entrenamiento, por lo que en el test el método no se ajusta a respuestas conocidas.

J64 aporta una mejora de precisión de 1,1–5,9 puntos en comparación con el experimento de control, en el que se usaron hermanos mezclados. R64, construido solo a partir del enrutamiento, conserva 0,9–3,2 puntos de esa ganancia. Incluso el proxy barato resulta suficientemente útil para gestionar la generación.

¿Se puede modificar el razonamiento a través del router?

La última parte del trabajo va más allá de la interpretación pasiva. Los investigadores editan el router para afectar el mecanismo correspondiente a J64. Tras ello, el comportamiento del modelo cambia de forma predecible, de un modo que se sigue de la interpretación de J64. El «atasco» diagnosticable del modelo se desplaza de la adivinación numérica a la ejecución simbólica exacta.

Esta es una señal importante: los ejes de J64 capturan no solo una correlación, sino un papel causal en el razonamiento. Si la edición del router produce los cambios esperados, entonces el estado leído realmente participa en la toma de decisiones y no es un artefacto secundario.

El rastreo de MoE sigue siendo una interfaz cómoda, pero demasiado gruesa, hacia el modelo. La lectura de dos niveles —primero una proyección semántica económica, luego un proxy basado en el enrutamiento— permite ver lo que ocurre antes y más allá de las llamadas visibles a los expertos. Estos «paneles de instrumentos» internos podrían convertirse en la próxima herramienta estándar para depurar y controlar modelos grandes.

Preguntas frecuentes

Material similar

Todos los materiales
La traza no lo revela todo: lectura de dos niveles del estado interno de razonamiento en modelos MoE