Как устроена архитектура
SymbolicLight V1 — языковая модель с двумя путями: бинарной динамикой Leaky Integrate-and-Fire (LIF) и непрерывным остаточным потоком.

- Микшер Dual-Path SparseTCAM объединяет состояние с экспоненциальным затуханием первого порядка и локальное оконное внимание.
- Оба компонента работают в непрерывном остаточном потоке.
- После микшера модель использует контекстно-обусловленную декодирующую голову.
Практический критерий: архитектура интересна для изучения сочетания разреженной спайковой динамики и непрерывного потока. Сама по себе она не подтверждает преимущество в скорости или точности.
На каких данных обучали и оценивали модель
Четыре модели SymbolicLight V1 обучили с нуля. Каждая содержит 194M параметров.
- Обучающий корпус включает 3B токенов на китайском и английском языках.
- Корпус охватывает 10 доменов.
- На фиксированном токен-взвешенном наборе оценки PPL составил 8.88–8.93. Среднее — 8.904, выборочное стандартное отклонение — 0.019.
- Разделение набора оценки с обучающими потоками не проверяли.
Кодовые токены составляют 43.7% набора оценки. Невзвешенное среднее PPL по десяти доменам — 29.38. В обучающих пробах энкодера средняя доля нулевых спайков составила 89.96%; это не оценка разреженности всей модели.
Практический критерий: результаты PPL следует рассматривать вместе с составом набора оценки и непроверенным разделением данных. Долю нулевых спайков нельзя переносить на всю модель.
Как модель сравнили с GPT-2
При одинаковых корпусе, токенизаторе, бюджете токенов и оборудовании токен-взвешенное среднее PPL у SymbolicLight V1 оказалось на 7.7% выше, чем у GPT-2 201M.
| Критерий | Результат |
|---|---|
| PPL | SymbolicLight: 8.904 в среднем; GPT-2 201M: 8.27 |
| Zero-shot | На пяти бенчмарках две модели масштаба 200M не показали явного различия в точности |
| Повторы 4-грамм | При temperature 0.7 и top-k 50 SymbolicLight выдаёт меньше повторений |
| Модуляция энтропией | Правило меняет ранжирование моделей по повторам на противоположное |
Практический критерий: выбор зависит от оцениваемого показателя. По PPL преимущество было у GPT-2, а результат по повторам зависел от правила генерации.
Что показали измерения скорости и энергопотребления
На RTX 2080 Ti измерили скорость генерации SymbolicLight V1 и GPT-2. Оценки энергопотребления получили по показаниям мощности после генерации, без интегрирования мощности во время неё.
| Модель | Скорость генерации | Оценка энергопотребления |
|---|---|---|
| SymbolicLight V1 | 22.8 токена/с | приблизительно 2,848 мДж/токен |
| GPT-2 | 91.5 токена/с | приблизительно 905 мДж/токен |
В этих измерениях GPT-2 генерировал быстрее, а его оценка энергопотребления была ниже. Оценки энергозатрат не основаны на интегрировании мощности во время генерации.
Практический критерий: для сравнения скорости и энергопотребления доступны результаты только этого измерения на RTX 2080 Ti.



