Транскрипция аудио в ноты для популярной музыки: корпус SheetSage-A2S, аугментация и признаки MuQ

20 сентября 202625 просмотров

Авторы представили SheetSage-A2S — 61 час аудиозаписей с **kern-разметкой по 9 468 фрагментам из 6 066 песен, ориентированный на популярный репертуар. Сочетание аугментации данных и предобученной модели извлечения музыкальных признаков MuQ снижает частоту символьных ошибок до 4,98% на классическом собрании Quartets и даёт 20,92% на новом корпусе, задавая базовый уровень для последующих исследований.

Транскрипция аудио в ноты для популярной музыки: корпус SheetSage-A2S, аугментация и признаки MuQ

Транскрипция аудио в ноты и место популярной музыки

Audio-to-score (A2S) превращает аудиозапись в нотный текст. Действующие A2S-системы в первую очередь рассчитаны на классическую музыку. Применение к популярной музыке остаётся малоизученным. Партитуры в таких системах представляют в символьных энкодингах, в том числе в формате **kern.

Над этим направлением работали Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo и Yaolong Ju. Препринт v1 вышел 6 августа 2026 года, версия v3 — 25 августа 2026 года. Работу приняли на 34-ю конференцию ACM International Conference on Multimedia (MM '26).

Критерий выбора: репертуар, под который заявлен инструмент. Классика и популярная музыка опираются на разные коллекции и разные базовые результаты.

Корпус SheetSage-A2S: состав и назначение

Набор создали для A2S на популярной музыке. Его состав:

  • 61 час аудио;
  • 9 468 клипов;
  • 6 066 уникальных песен;
  • партитуры в **kern-энкодингах.

Авторы называют корпус первым в своём роде для A2S популярной музыки. Данные, модель и код открыты публично. Результат на этом наборе задаёт ориентир для будущих работ.

Практический критерий: набор подходит как точка отсчёта при сравнении A2S-моделей на популярной музыке. Для классического репертуара используют другие коллекции, например Quartets.

Аугментация: что она меняет в обучении

Аугментация расширяет обучающую выборку преобразованиями уже имеющихся примеров. Авторы применяют её вместе с предобученными признаками MuQ. Цель — повысить способность модели к обобщению.

Аннотация не перечисляет конкретные виды преобразований и их параметры. Известно, что сочетание аугментации и предобученных признаков авторы связывают с улучшением обобщения. Оба приёма работают в одной схеме обучения.

Критерий: при разборе чужого пайплайна полезно фиксировать, входит ли аугментация в обучение. Авторы связывают её с обобщением модели.

Предобученные признаки MuQ

MuQ — предобученная модель извлечения признаков для музыкального аудио. Она уже обучена на музыке, поэтому A2S-модель получает готовое представление звука. Авторы используют такие признаки для извлечения значимых характеристик аудио.

Что это даёт A2S-системе:

  • признаки извлекает отдельная предобученная модель;
  • A2S-модель работает с готовым представлением аудио.

Практический критерий: предобученные музыкальные признаки подходят там, где нет смысла обучать извлечение признаков внутри A2S-пайплайна. Авторы показывают улучшение результатов при таком подходе.

Метрика SER и результаты модели

SER (symbol error rate) — доля ошибок в символах партитуры. Оценку провели на двух коллекциях: Quartets для классической музыки и SheetSage-A2S для популярной.

КоллекцияМузыкаSER предложенной моделиДля сравнения
Quartetsклассическая4,98 %15,3 % SER у прежнего state-of-the-art (Alfaro-Contreras et al., 2024)
SheetSage-A2Sпопулярная20,92 %набор новый, результат служит ориентиром для будущих работ

На классике модель снижает SER с 15,3 % до 4,98 % относительно прежнего state-of-the-art. Для популярной музыки авторы фиксируют 20,92 % SER. Значения получены на разных наборах, поэтому прямое сравнение между строками некорректно.

Критерий: сравнивать SER только внутри одной коллекции и одного жанра.

Что это значит при выборе инструмента

Работа закрывает два пробела: даёт открытый корпус для популярной музыки и показывает схему обучения с аугментацией и признаками MuQ. Для классики результат заметно точнее, чем у прежнего state-of-the-art.

Практические ориентиры:

  • учитывать, на каком материале обучена и проверена модель;
  • проверять доступность данных и кода — в этой работе они открыты;
  • читать SER вместе с названием коллекции, а не отдельно.

Материалы: препринт arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Версия для конференции: DOI 10.1145/3767308.3835653.

Часто задаваемые вопросы

Похожие материалы

Все материалы
SheetSage-A2S: транскрипция популярной музыки в ноты