Cómo está diseñada la arquitectura
SymbolicLight V1 es un modelo de lenguaje con dos vías: una dinámica binaria Leaky Integrate-and-Fire (LIF) y un flujo residual continuo.

- El mezclador Dual-Path SparseTCAM combina un estado con decaimiento exponencial de primer orden y atención local por ventanas.
- Ambos componentes funcionan en un flujo residual continuo.
- Después del mezclador, el modelo utiliza una cabeza de decodificación condicionada por el contexto.
Criterio práctico: la arquitectura resulta interesante para estudiar la combinación de dinámica dispersa de impulsos y flujo continuo. Por sí sola, no demuestra ninguna ventaja en velocidad o precisión.
Con qué datos se entrenó y evaluó el modelo
Se entrenaron desde cero cuatro modelos SymbolicLight V1. Cada uno contiene 194M de parámetros.
- El corpus de entrenamiento incluye 3B de tokens en chino e inglés.
- El corpus abarca 10 dominios.
- En un conjunto de evaluación fijo ponderado por tokens, el PPL fue de 8,88–8,93. La media fue de 8,904 y la desviación estándar muestral, de 0,019.
- No se verificó la separación entre el conjunto de evaluación y los flujos de entrenamiento.
Los tokens de código representan el 43,7 % del conjunto de evaluación. El PPL medio no ponderado de los diez dominios es de 29,38. En las pruebas de entrenamiento del codificador, la proporción media de impulsos nulos fue del 89,96 %; esto no es una estimación de la dispersión de todo el modelo.
Criterio práctico: los resultados de PPL deben considerarse junto con la composición del conjunto de evaluación y la separación de datos, que no se verificó. La proporción de impulsos nulos no puede extrapolarse a todo el modelo.
Cómo se comparó el modelo con GPT-2
Con el mismo corpus, tokenizador, presupuesto de tokens y hardware, la media del PPL ponderada por tokens de SymbolicLight V1 fue un 7,7 % más alta que la de GPT-2 201M.
| Criterio | Resultado |
|---|---|
| PPL | SymbolicLight: media de 8,904; GPT-2 201M: 8,27 |
| Zero-shot | En cinco benchmarks, dos modelos de escala 200M no mostraron una diferencia clara en precisión |
| Repeticiones de 4-gramas | Con temperature 0.7 y top-k 50, SymbolicLight genera menos repeticiones |
| Modulación por entropía | La regla invierte el orden de los modelos en cuanto a repeticiones |
Criterio práctico: la elección depende de la métrica que se evalúe. GPT-2 tuvo ventaja en PPL, mientras que el resultado en cuanto a repeticiones dependía de la regla de generación.
Qué mostraron las mediciones de velocidad y consumo energético
Se midió la velocidad de generación de SymbolicLight V1 y GPT-2 en una RTX 2080 Ti. Las estimaciones de consumo energético se obtuvieron a partir de las lecturas de potencia posteriores a la generación, sin integrar la potencia durante esta.
| Modelo | Velocidad de generación | Estimación de consumo energético |
|---|---|---|
| SymbolicLight V1 | 22,8 tokens/s | aproximadamente 2.848 mJ/token |
| GPT-2 | 91,5 tokens/s | aproximadamente 905 mJ/token |
En estas mediciones, GPT-2 generó más rápido y su estimación de consumo energético fue menor. Las estimaciones de consumo energético no se basan en la integración de la potencia durante la generación.
Criterio práctico: para comparar la velocidad y el consumo energético, solo se dispone de los resultados de esta medición en una RTX 2080 Ti.



