SymbolicLight V1: языковая модель с разреженными спайками и непрерывным остаточным трактом

26 сентября 202616 просмотров

В статье представлена двухпоточная архитектура, где спайковая динамика LIF сочетается с непрерывной обработкой контекста и локальным вниманием; четыре модели обучены с нуля на китайских и английских данных. Энкодерные пробы показывают около 90% нулевых спайков, однако средняя perplexity уступает GPT‑2 сопоставимого размера на 7,7%, а измеренная генерация заметно медленнее — результаты очерчивают компромисс между разреженностью, качеством и вычислительной эффективностью.

SymbolicLight V1: языковая модель с разреженными спайками и непрерывным остаточным трактом

Как устроена архитектура

SymbolicLight V1 — языковая модель с двумя путями: бинарной динамикой Leaky Integrate-and-Fire (LIF) и непрерывным остаточным потоком.

  • Микшер Dual-Path SparseTCAM объединяет состояние с экспоненциальным затуханием первого порядка и локальное оконное внимание.
  • Оба компонента работают в непрерывном остаточном потоке.
  • После микшера модель использует контекстно-обусловленную декодирующую голову.

Практический критерий: архитектура интересна для изучения сочетания разреженной спайковой динамики и непрерывного потока. Сама по себе она не подтверждает преимущество в скорости или точности.

На каких данных обучали и оценивали модель

Четыре модели SymbolicLight V1 обучили с нуля. Каждая содержит 194M параметров.

  • Обучающий корпус включает 3B токенов на китайском и английском языках.
  • Корпус охватывает 10 доменов.
  • На фиксированном токен-взвешенном наборе оценки PPL составил 8.88–8.93. Среднее — 8.904, выборочное стандартное отклонение — 0.019.
  • Разделение набора оценки с обучающими потоками не проверяли.

Кодовые токены составляют 43.7% набора оценки. Невзвешенное среднее PPL по десяти доменам — 29.38. В обучающих пробах энкодера средняя доля нулевых спайков составила 89.96%; это не оценка разреженности всей модели.

Практический критерий: результаты PPL следует рассматривать вместе с составом набора оценки и непроверенным разделением данных. Долю нулевых спайков нельзя переносить на всю модель.

Как модель сравнили с GPT-2

При одинаковых корпусе, токенизаторе, бюджете токенов и оборудовании токен-взвешенное среднее PPL у SymbolicLight V1 оказалось на 7.7% выше, чем у GPT-2 201M.

КритерийРезультат
PPLSymbolicLight: 8.904 в среднем; GPT-2 201M: 8.27
Zero-shotНа пяти бенчмарках две модели масштаба 200M не показали явного различия в точности
Повторы 4-граммПри temperature 0.7 и top-k 50 SymbolicLight выдаёт меньше повторений
Модуляция энтропиейПравило меняет ранжирование моделей по повторам на противоположное

Практический критерий: выбор зависит от оцениваемого показателя. По PPL преимущество было у GPT-2, а результат по повторам зависел от правила генерации.

Что показали измерения скорости и энергопотребления

На RTX 2080 Ti измерили скорость генерации SymbolicLight V1 и GPT-2. Оценки энергопотребления получили по показаниям мощности после генерации, без интегрирования мощности во время неё.

МодельСкорость генерацииОценка энергопотребления
SymbolicLight V122.8 токена/сприблизительно 2,848 мДж/токен
GPT-291.5 токена/сприблизительно 905 мДж/токен

В этих измерениях GPT-2 генерировал быстрее, а его оценка энергопотребления была ниже. Оценки энергозатрат не основаны на интегрировании мощности во время генерации.

Практический критерий: для сравнения скорости и энергопотребления доступны результаты только этого измерения на RTX 2080 Ti.

Часто задаваемые вопросы

Похожие материалы

Все материалы