Почему GPT-подход спотыкается о символическую музыку: сжатие работает лишь в верной системе координат

5 сентября 202623 просмотров

Успех языковых моделей связан не только с переиспользованием токенов, но и с тем, как устроено сжатие. Для музыки попытка заранее зафиксировать отношения, например через квинтовый круг, ухудшает предсказания — важнее оставить контекст модели и правильно задать время.

Почему GPT-подход спотыкается о символическую музыку: сжатие работает лишь в верной системе координат

Почему GPT-подход спотыкается о символическую музыку: сжатие работает лишь в верной системе координат

Кажется, что символическая музыка создана для токенизации: ноты дискретны, аккорды повторяются, мотивы образуют узнаваемые структуры. GPT‑модели отлично работают с переиспользуемыми токенами, поэтому возникает соблазн напрямую перенести языковой подход на нотный стан. Но практика показывает: токенизация музыки — это не просто нарезка последовательности, а выбор системы координат, в которой модель вообще способна увидеть закономерности.

Токены — не универсальный интерфейс

Успех языковых моделей строится на конечном словаре токенов, которые можно переиспользовать в разных контекстах. Этот интерфейс настолько удобен, что его начали примерять к другим областям — от кода до биологических последовательностей. Однако при переносе за пределы языка возникает проблема: не существует единого критерия, что должна представлять собой токенизация и где её следует остановить. То, что хорошо для текста, может оказаться бесполезным или даже вредным для музыки.

Исследование Ии Вана (arXiv:2608.18025) предлагает общий критерий — предсказательную длину кода (predictive codelength). Это мера того, насколько удачно модель сжимает информацию при предсказании следующего элемента. Если токенизация помогает уменьшать эту длину — значит, она улавливает реальную структуру данных; если нет — она лишь создаёт видимость порядка.

Музыка требует координат, а не просто словаря

Символьная музыка обманчиво похожа на язык: те же ноты, те же аккорды. Но за этой дискретностью скрываются непрерывные параметры времени и тональности. Когда мы режем музыку на токены по аналогии со словами, мы неявно фиксируем систему отсчёта. Например, можно закодировать высоту ноты как абсолютное значение — но тогда модель должна сама догадаться о тональности. Можно задать время как целочисленный счётчик — но тогда сдвиги и темп становятся неразличимыми.

Автор рамки Effectiveness–Losslessness Framework разводит две границы. Fact–Token Boundary определяет, где наблюдаемая структура должна войти в токенный интерфейс — например, через явное конструирование координат. Token–State Boundary указывает, где токенизация должна остановиться: остальные зависимости модель должна вычислять сама, в своём внутреннем состоянии, а не получать их в готовом виде от токенизатора. Если сжать слишком много, модель лишается возможности использовать контекст; если сжать слишком мало — тонет в несущественных деталях.

Эксперимент: время и тональность решают

В контролируемых multi-seed экспериментах на символической музыке оказалось, что явное задание музыкального времени последовательно сокращает предсказательный код. То есть вместо того чтобы прятать временные метки внутри токенов, лучше сделать их отдельной координатой — так модель начинает точнее предсказывать и высоту, и длительность нот. Дополнительный выигрыш даёт канонизация тонального контекста: приведение всех фраз к единому тональному центру. А факторизация высоты — разделение на ступень и октаву — тоже помогает.

Но важно и то, что не работает. Фиксированные координаты высоты по квинтовому кругу — красивая музыкальная теория, навязанная без учёта контекста — увеличивают предсказательный код. Заранее зафиксированное отношение высот мешает модели адаптироваться к конкретной гармонии. Токенизатор решил за модель, как устроены связи между нотами, а модель осталась без работы.

Сжатие ради сжатия не помогает

Отдельный сюрприз — обратимая BPE. Она позволяет заметно укорачивать носитель (carrier) — то есть саму последовательность токенов — но предсказательная длина кода при этом растёт на каждом seed. С точки зрения хранения данных это отличный компрессор, а с точки зрения обучения — плохой помощник. Всё потому, что BPE схлопывает повторяющиеся фрагменты, но теряет контекстуальные отношения: модель экономит на длине, зато тратит усилия на выучивание искусственных аббревиатур.

Вывод

GPT‑подход спотыкается о символическую музыку не из‑за недостатка мощности, а из‑за неверного выбора системы координат. Сжатие работает только тогда, когда интерфейс токенов согласован с реальной структурой данных: время должно быть временем, тональность — тональностью, а всё остальное — предметом работы самой модели. Критерий предсказательной длины кода позволяет отделить полезную токенизацию от украшательства и понять, где действительно стоит провести границу между фактом и вычислением.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Почему GPT-подход спотыкается о символическую музыку