SymbolicLight V1: modelo de lenguaje con impulsos dispersos y una vía residual continua

26 septiembre 202616 vistas

El artículo presenta una arquitectura de dos flujos en la que la dinámica de disparo LIF se combina con el procesamiento continuo del contexto y la atención local; cuatro modelos se entrenan desde cero con datos en chino e inglés. Las pruebas del codificador muestran aproximadamente un 90 % de disparos nulos, pero la perplejidad media es un 7,7 % peor que la de GPT‑2 de tamaño comparable, y la generación medida es notablemente más lenta: los resultados delimitan el equilibrio entre la dispersión, la calidad y la eficiencia computacional.

SymbolicLight V1: modelo de lenguaje con impulsos dispersos y una vía residual continua

Cómo está diseñada la arquitectura

SymbolicLight V1 es un modelo de lenguaje con dos vías: una dinámica binaria Leaky Integrate-and-Fire (LIF) y un flujo residual continuo.

  • El mezclador Dual-Path SparseTCAM combina un estado con decaimiento exponencial de primer orden y atención local por ventanas.
  • Ambos componentes funcionan en un flujo residual continuo.
  • Después del mezclador, el modelo utiliza una cabeza de decodificación condicionada por el contexto.

Criterio práctico: la arquitectura resulta interesante para estudiar la combinación de dinámica dispersa de impulsos y flujo continuo. Por sí sola, no demuestra ninguna ventaja en velocidad o precisión.

Con qué datos se entrenó y evaluó el modelo

Se entrenaron desde cero cuatro modelos SymbolicLight V1. Cada uno contiene 194M de parámetros.

  • El corpus de entrenamiento incluye 3B de tokens en chino e inglés.
  • El corpus abarca 10 dominios.
  • En un conjunto de evaluación fijo ponderado por tokens, el PPL fue de 8,88–8,93. La media fue de 8,904 y la desviación estándar muestral, de 0,019.
  • No se verificó la separación entre el conjunto de evaluación y los flujos de entrenamiento.

Los tokens de código representan el 43,7 % del conjunto de evaluación. El PPL medio no ponderado de los diez dominios es de 29,38. En las pruebas de entrenamiento del codificador, la proporción media de impulsos nulos fue del 89,96 %; esto no es una estimación de la dispersión de todo el modelo.

Criterio práctico: los resultados de PPL deben considerarse junto con la composición del conjunto de evaluación y la separación de datos, que no se verificó. La proporción de impulsos nulos no puede extrapolarse a todo el modelo.

Cómo se comparó el modelo con GPT-2

Con el mismo corpus, tokenizador, presupuesto de tokens y hardware, la media del PPL ponderada por tokens de SymbolicLight V1 fue un 7,7 % más alta que la de GPT-2 201M.

CriterioResultado
PPLSymbolicLight: media de 8,904; GPT-2 201M: 8,27
Zero-shotEn cinco benchmarks, dos modelos de escala 200M no mostraron una diferencia clara en precisión
Repeticiones de 4-gramasCon temperature 0.7 y top-k 50, SymbolicLight genera menos repeticiones
Modulación por entropíaLa regla invierte el orden de los modelos en cuanto a repeticiones

Criterio práctico: la elección depende de la métrica que se evalúe. GPT-2 tuvo ventaja en PPL, mientras que el resultado en cuanto a repeticiones dependía de la regla de generación.

Qué mostraron las mediciones de velocidad y consumo energético

Se midió la velocidad de generación de SymbolicLight V1 y GPT-2 en una RTX 2080 Ti. Las estimaciones de consumo energético se obtuvieron a partir de las lecturas de potencia posteriores a la generación, sin integrar la potencia durante esta.

ModeloVelocidad de generaciónEstimación de consumo energético
SymbolicLight V122,8 tokens/saproximadamente 2.848 mJ/token
GPT-291,5 tokens/saproximadamente 905 mJ/token

En estas mediciones, GPT-2 generó más rápido y su estimación de consumo energético fue menor. Las estimaciones de consumo energético no se basan en la integración de la potencia durante la generación.

Criterio práctico: para comparar la velocidad y el consumo energético, solo se dispone de los resultados de esta medición en una RTX 2080 Ti.

Preguntas frecuentes

Material similar

Todos los materiales
SymbolicLight V1: modelo de lenguaje con impulsos dispersos y una vía residual continua