SymbolicLight V1 : modèle de langage à impulsions clairsemées et voie résiduelle continue

26 septembre 202616 vues

L’article présente une architecture à deux flux, où la dynamique à spikes LIF se combine au traitement continu du contexte et à l’attention locale ; quatre modèles sont entraînés de zéro sur des données chinoises et anglaises. Les sondes de l’encodeur révèlent environ 90 % de spikes nuls, mais la perplexité moyenne est supérieure de 7,7 % à celle de GPT‑2 de taille comparable, et la génération mesurée est nettement plus lente — ces résultats mettent en évidence le compromis entre parcimonie, qualité et efficacité computationnelle.

SymbolicLight V1 : modèle de langage à impulsions clairsemées et voie résiduelle continue

Comment fonctionne l’architecture

SymbolicLight V1 est un modèle de langage à deux voies : une dynamique binaire Leaky Integrate-and-Fire (LIF) et un flux résiduel continu.

  • Le mélangeur Dual-Path SparseTCAM combine un état à décroissance exponentielle de premier ordre et une attention locale par fenêtres.
  • Les deux composants fonctionnent dans un flux résiduel continu.
  • Après le mélangeur, le modèle utilise une tête de décodage conditionnée par le contexte.

Critère pratique : cette architecture est intéressante pour étudier la combinaison d’une dynamique parcimonieuse à pics et d’un flux continu. À elle seule, elle ne confirme pas d’avantage en vitesse ou en précision.

Sur quelles données le modèle a-t-il été entraîné et évalué ?

Quatre modèles SymbolicLight V1 ont été entraînés à partir de zéro. Chacun compte 194M paramètres.

  • Le corpus d’entraînement comprend 3B tokens en chinois et en anglais.
  • Le corpus couvre 10 domaines.
  • Sur un ensemble d’évaluation fixe pondéré par les tokens, la PPL s’est établie entre 8.88 et 8.93. La moyenne est de 8.904, avec un écart-type d’échantillon de 0.019.
  • Le recoupement de l’ensemble d’évaluation avec les flux d’entraînement n’a pas été vérifié.

Les tokens de code représentent 43.7% de l’ensemble d’évaluation. La PPL moyenne non pondérée sur les dix domaines est de 29.38. Dans les essais d’entraînement de l’encodeur, la proportion moyenne de pics nuls était de 89.96% ; il ne s’agit pas d’une estimation de la parcimonie de l’ensemble du modèle.

Critère pratique : les résultats de PPL doivent être considérés conjointement avec la composition de l’ensemble d’évaluation et le recoupement des données, qui n’a pas été vérifié. La proportion de pics nuls ne peut pas être extrapolée à l’ensemble du modèle.

Comment le modèle a-t-il été comparé à GPT-2 ?

À corpus, tokenizer, budget de tokens et matériel identiques, la PPL moyenne pondérée par les tokens de SymbolicLight V1 s’est révélée supérieure de 7.7% à celle de GPT-2 201M.

CritèreRésultat
PPLSymbolicLight : moyenne de 8.904 ; GPT-2 201M : 8.27
Zero-shotSur cinq benchmarks, les deux modèles de l’échelle 200M n’ont pas montré de différence manifeste de précision
Répétitions de 4-grammesAvec une temperature de 0.7 et un top-k de 50, SymbolicLight génère moins de répétitions
Modulation par l’entropieLa règle inverse le classement des modèles en matière de répétitions

Critère pratique : le choix dépend de l’indicateur évalué. GPT-2 était avantagé en PPL, tandis que le résultat en matière de répétitions dépendait de la règle de génération.

Que montrent les mesures de vitesse et de consommation énergétique ?

La vitesse de génération de SymbolicLight V1 et de GPT-2 a été mesurée sur une RTX 2080 Ti. Les estimations de consommation énergétique ont été obtenues à partir des relevés de puissance après la génération, sans intégration de la puissance pendant celle-ci.

ModèleVitesse de générationEstimation de la consommation énergétique
SymbolicLight V122.8 tokens/senviron 2,848 mJ/token
GPT-291.5 tokens/senviron 905 mJ/token

Dans ces mesures, GPT-2 générait plus rapidement et son estimation de consommation énergétique était plus faible. Les estimations énergétiques ne reposent pas sur l’intégration de la puissance pendant la génération.

Critère pratique : pour comparer la vitesse et la consommation énergétique, seuls les résultats de cette mesure sur RTX 2080 Ti sont disponibles.

Foire aux questions

Matériaux connexes

Tous matériaux
SymbolicLight V1 : modèle de langage à impulsions clairsemées et voie résiduelle continue