Como funciona a arquitetura
SymbolicLight V1 é um modelo de linguagem com dois percursos: dinâmica binária Leaky Integrate-and-Fire (LIF) e um fluxo residual contínuo.

- O misturador Dual-Path SparseTCAM combina um estado com decaimento exponencial de primeira ordem e atenção de janela local.
- Ambos os componentes funcionam num fluxo residual contínuo.
- Depois do misturador, o modelo usa uma cabeça de descodificação condicionada pelo contexto.
Critério prático: a arquitetura é interessante para estudar a combinação de dinâmica esparsa de disparos e fluxo contínuo. Por si só, não comprova uma vantagem em velocidade ou precisão.
Com que dados o modelo foi treinado e avaliado
Quatro modelos SymbolicLight V1 foram treinados de raiz. Cada um contém 194M parâmetros.
- O corpus de treino inclui 3B tokens em chinês e inglês.
- O corpus abrange 10 domínios.
- Num conjunto de avaliação fixo e ponderado por tokens, o PPL foi de 8,88–8,93. A média foi de 8,904, com um desvio-padrão amostral de 0,019.
- A separação do conjunto de avaliação em relação aos fluxos de treino não foi verificada.
Os tokens de código representam 43,7% do conjunto de avaliação. A média não ponderada do PPL nos dez domínios é 29,38. Nas sondagens de treino do codificador, a proporção média de disparos zero foi de 89,96%; esta não é uma estimativa da esparsidade de todo o modelo.
Critério prático: os resultados de PPL devem ser considerados em conjunto com a composição do conjunto de avaliação e com a separação dos dados, que não foi verificada. A proporção de disparos zero não deve ser extrapolada para todo o modelo.
Como o modelo foi comparado com o GPT-2
Com o mesmo corpus, tokenizador, orçamento de tokens e equipamento, a média do PPL ponderada por tokens do SymbolicLight V1 foi 7,7% superior à do GPT-2 201M.
| Critério | Resultado |
|---|---|
| PPL | SymbolicLight: média de 8,904; GPT-2 201M: 8,27 |
| Zero-shot | Em cinco benchmarks, os dois modelos da escala dos 200M não apresentaram diferenças claras de precisão |
| Repetições de 4-gramas | Com temperature 0.7 e top-k 50, o SymbolicLight gera menos repetições |
| Modulação por entropia | A regra inverte a classificação dos modelos quanto às repetições |
Critério prático: a escolha depende da métrica avaliada. O GPT-2 teve vantagem em PPL, enquanto o resultado relativo às repetições dependeu da regra de geração.
O que revelaram as medições de velocidade e consumo de energia
A velocidade de geração do SymbolicLight V1 e do GPT-2 foi medida numa RTX 2080 Ti. As estimativas de consumo de energia foram obtidas a partir das leituras de potência após a geração, sem integração da potência durante a geração.
| Modelo | Velocidade de geração | Estimativa de consumo de energia |
|---|---|---|
| SymbolicLight V1 | 22,8 tokens/s | aproximadamente 2 848 mJ/token |
| GPT-2 | 91,5 tokens/s | aproximadamente 905 mJ/token |
Nestas medições, o GPT-2 gerou mais rapidamente e a sua estimativa de consumo de energia foi inferior. As estimativas de consumo de energia não se baseiam na integração da potência durante a geração.
Critério prático: para comparar a velocidade e o consumo de energia, só estão disponíveis os resultados desta medição na RTX 2080 Ti.



