Транскрипция аудио в ноты и место популярной музыки
Audio-to-score (A2S) превращает аудиозапись в нотный текст. Действующие A2S-системы в первую очередь рассчитаны на классическую музыку. Применение к популярной музыке остаётся малоизученным. Партитуры в таких системах представляют в символьных энкодингах, в том числе в формате **kern.
Над этим направлением работали Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo и Yaolong Ju. Препринт v1 вышел 6 августа 2026 года, версия v3 — 25 августа 2026 года. Работу приняли на 34-ю конференцию ACM International Conference on Multimedia (MM '26).
Критерий выбора: репертуар, под который заявлен инструмент. Классика и популярная музыка опираются на разные коллекции и разные базовые результаты.
Корпус SheetSage-A2S: состав и назначение
Набор создали для A2S на популярной музыке. Его состав:
- 61 час аудио;
- 9 468 клипов;
- 6 066 уникальных песен;
- партитуры в **kern-энкодингах.
Авторы называют корпус первым в своём роде для A2S популярной музыки. Данные, модель и код открыты публично. Результат на этом наборе задаёт ориентир для будущих работ.

Практический критерий: набор подходит как точка отсчёта при сравнении A2S-моделей на популярной музыке. Для классического репертуара используют другие коллекции, например Quartets.
Аугментация: что она меняет в обучении
Аугментация расширяет обучающую выборку преобразованиями уже имеющихся примеров. Авторы применяют её вместе с предобученными признаками MuQ. Цель — повысить способность модели к обобщению.
Аннотация не перечисляет конкретные виды преобразований и их параметры. Известно, что сочетание аугментации и предобученных признаков авторы связывают с улучшением обобщения. Оба приёма работают в одной схеме обучения.
Критерий: при разборе чужого пайплайна полезно фиксировать, входит ли аугментация в обучение. Авторы связывают её с обобщением модели.
Предобученные признаки MuQ
MuQ — предобученная модель извлечения признаков для музыкального аудио. Она уже обучена на музыке, поэтому A2S-модель получает готовое представление звука. Авторы используют такие признаки для извлечения значимых характеристик аудио.
Что это даёт A2S-системе:
- признаки извлекает отдельная предобученная модель;
- A2S-модель работает с готовым представлением аудио.

Практический критерий: предобученные музыкальные признаки подходят там, где нет смысла обучать извлечение признаков внутри A2S-пайплайна. Авторы показывают улучшение результатов при таком подходе.
Метрика SER и результаты модели
SER (symbol error rate) — доля ошибок в символах партитуры. Оценку провели на двух коллекциях: Quartets для классической музыки и SheetSage-A2S для популярной.
| Коллекция | Музыка | SER предложенной модели | Для сравнения |
|---|---|---|---|
| Quartets | классическая | 4,98 % | 15,3 % SER у прежнего state-of-the-art (Alfaro-Contreras et al., 2024) |
| SheetSage-A2S | популярная | 20,92 % | набор новый, результат служит ориентиром для будущих работ |
На классике модель снижает SER с 15,3 % до 4,98 % относительно прежнего state-of-the-art. Для популярной музыки авторы фиксируют 20,92 % SER. Значения получены на разных наборах, поэтому прямое сравнение между строками некорректно.

Критерий: сравнивать SER только внутри одной коллекции и одного жанра.
Что это значит при выборе инструмента
Работа закрывает два пробела: даёт открытый корпус для популярной музыки и показывает схему обучения с аугментацией и признаками MuQ. Для классики результат заметно точнее, чем у прежнего state-of-the-art.
Практические ориентиры:
- учитывать, на каком материале обучена и проверена модель;
- проверять доступность данных и кода — в этой работе они открыты;
- читать SER вместе с названием коллекции, а не отдельно.
Материалы: препринт arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Версия для конференции: DOI 10.1145/3767308.3835653.



