SymbolicLight V1: modelo de linguagem com picos esparsos e via residual contínua

26 setembro 202616 visualizações

O artigo apresenta uma arquitetura de duas vias, na qual a dinâmica de spikes LIF se combina com o processamento contínuo do contexto e a atenção local; quatro modelos foram treinados do zero com dados em chinês e inglês. As sondagens do codificador mostram cerca de 90% de spikes nulos; no entanto, a perplexidade média fica 7,7% atrás da do GPT‑2 de tamanho comparável, e a geração medida é consideravelmente mais lenta — os resultados delineiam um compromisso entre esparsidade, qualidade e eficiência computacional.

SymbolicLight V1: modelo de linguagem com picos esparsos e via residual contínua

Como funciona a arquitetura

SymbolicLight V1 é um modelo de linguagem com dois percursos: dinâmica binária Leaky Integrate-and-Fire (LIF) e um fluxo residual contínuo.

  • O misturador Dual-Path SparseTCAM combina um estado com decaimento exponencial de primeira ordem e atenção de janela local.
  • Ambos os componentes funcionam num fluxo residual contínuo.
  • Depois do misturador, o modelo usa uma cabeça de descodificação condicionada pelo contexto.

Critério prático: a arquitetura é interessante para estudar a combinação de dinâmica esparsa de disparos e fluxo contínuo. Por si só, não comprova uma vantagem em velocidade ou precisão.

Com que dados o modelo foi treinado e avaliado

Quatro modelos SymbolicLight V1 foram treinados de raiz. Cada um contém 194M parâmetros.

  • O corpus de treino inclui 3B tokens em chinês e inglês.
  • O corpus abrange 10 domínios.
  • Num conjunto de avaliação fixo e ponderado por tokens, o PPL foi de 8,88–8,93. A média foi de 8,904, com um desvio-padrão amostral de 0,019.
  • A separação do conjunto de avaliação em relação aos fluxos de treino não foi verificada.

Os tokens de código representam 43,7% do conjunto de avaliação. A média não ponderada do PPL nos dez domínios é 29,38. Nas sondagens de treino do codificador, a proporção média de disparos zero foi de 89,96%; esta não é uma estimativa da esparsidade de todo o modelo.

Critério prático: os resultados de PPL devem ser considerados em conjunto com a composição do conjunto de avaliação e com a separação dos dados, que não foi verificada. A proporção de disparos zero não deve ser extrapolada para todo o modelo.

Como o modelo foi comparado com o GPT-2

Com o mesmo corpus, tokenizador, orçamento de tokens e equipamento, a média do PPL ponderada por tokens do SymbolicLight V1 foi 7,7% superior à do GPT-2 201M.

CritérioResultado
PPLSymbolicLight: média de 8,904; GPT-2 201M: 8,27
Zero-shotEm cinco benchmarks, os dois modelos da escala dos 200M não apresentaram diferenças claras de precisão
Repetições de 4-gramasCom temperature 0.7 e top-k 50, o SymbolicLight gera menos repetições
Modulação por entropiaA regra inverte a classificação dos modelos quanto às repetições

Critério prático: a escolha depende da métrica avaliada. O GPT-2 teve vantagem em PPL, enquanto o resultado relativo às repetições dependeu da regra de geração.

O que revelaram as medições de velocidade e consumo de energia

A velocidade de geração do SymbolicLight V1 e do GPT-2 foi medida numa RTX 2080 Ti. As estimativas de consumo de energia foram obtidas a partir das leituras de potência após a geração, sem integração da potência durante a geração.

ModeloVelocidade de geraçãoEstimativa de consumo de energia
SymbolicLight V122,8 tokens/saproximadamente 2 848 mJ/token
GPT-291,5 tokens/saproximadamente 905 mJ/token

Nestas medições, o GPT-2 gerou mais rapidamente e a sua estimativa de consumo de energia foi inferior. As estimativas de consumo de energia não se baseiam na integração da potência durante a geração.

Critério prático: para comparar a velocidade e o consumo de energia, só estão disponíveis os resultados desta medição na RTX 2080 Ti.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
SymbolicLight V1: modelo de linguagem com picos esparsos e via residual contínua