Transcripción de audio a partituras para música popular: corpus SheetSage-A2S, aumento de datos y características MuQ

20 septiembre 202625 vistas

Los autores presentaron SheetSage-A2S — 61 horas de grabaciones de audio con **anotación **kern en 9 468 fragmentos de 6 066 canciones, orientado al repertorio popular. La combinación de aumento de datos y el modelo preentrenado de extracción de características musicales MuQ reduce la tasa de errores simbólicos hasta un 4,98% en la colección clásica Quartets y alcanza un 20,92% en el nuevo corpus, estableciendo una línea base para investigaciones posteriores.

Transcripción de audio a partituras para música popular: corpus SheetSage-A2S, aumento de datos y características MuQ

Transcripción de audio a partituras y el lugar de la música popular

Audio-to-score (A2S) convierte una grabación de audio en texto musical. Los sistemas A2S actuales están diseñados principalmente para música clásica. Su aplicación a la música popular sigue siendo poco estudiada. Las partituras en estos sistemas se representan en codificaciones simbólicas, incluido el formato **kern.

En esta línea trabajaron Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo y Yaolong Ju. El preprint v1 se publicó el 6 de agosto de 2026, y la versión v3, el 25 de agosto de 2026. El trabajo fue aceptado en la 34.ª conferencia ACM International Conference on Multimedia (MM '26).

Criterio de elección: el repertorio para el que se declara la herramienta. La música clásica y la popular se apoyan en colecciones distintas y en resultados de referencia distintos.

Corpus SheetSage-A2S: composición y finalidad

El conjunto se creó para A2S en música popular. Su composición:

  • 61 horas de audio;
  • 9 468 clips;
  • 6 066 canciones únicas;
  • partituras en codificaciones **kern.

Los autores describen el corpus como el primero de su tipo para A2S de música popular. Los datos, el modelo y el código están abiertos al público. El resultado en este conjunto marca la referencia para trabajos futuros.

Criterio práctico: el conjunto sirve como punto de partida al comparar modelos A2S en música popular. Para el repertorio clásico se usan otras colecciones, por ejemplo Quartets.

Aumentación: qué cambia en el entrenamiento

La aumentación amplía el conjunto de entrenamiento con transformaciones de ejemplos ya existentes. Los autores la aplican junto con características preentrenadas MuQ. El objetivo es aumentar la capacidad de generalización del modelo.

El resumen no enumera los tipos concretos de transformaciones ni sus parámetros. Se sabe que los autores vinculan la combinación de aumentación y características preentrenadas con una mejor generalización. Ambas técnicas funcionan en un mismo esquema de entrenamiento.

Criterio: al analizar el pipeline de otro, conviene fijar si la aumentación forma parte del entrenamiento. Los autores la vinculan con la generalización del modelo.

Características preentrenadas MuQ

MuQ es un modelo preentrenado de extracción de características para audio musical. Ya está entrenado con música, por lo que el modelo A2S recibe una representación lista del sonido. Los autores usan estas características para extraer rasgos significativos del audio.

Qué aporta esto al sistema A2S:

  • las características las extrae un modelo preentrenado aparte;
  • el modelo A2S trabaja con una representación lista del audio.

Criterio práctico: las características musicales preentrenadas son adecuadas cuando no tiene sentido entrenar la extracción de características dentro del pipeline A2S. Los autores muestran una mejora de los resultados con este enfoque.

Métrica SER y resultados del modelo

SER (symbol error rate) es la proporción de errores en los símbolos de la partitura. La evaluación se realizó en dos colecciones: Quartets para música clásica y SheetSage-A2S para música popular.

ColecciónMúsicaSER del modelo propuestoPara comparar
Quartetsclásica4,98 %15,3 % SER del anterior state-of-the-art (Alfaro-Contreras et al., 2024)
SheetSage-A2Spopular20,92 %el conjunto es nuevo, el resultado sirve de referencia para trabajos futuros

En clásica, el modelo reduce el SER del 15,3 % al 4,98 % respecto al anterior state-of-the-art. Para música popular, los autores registran un 20,92 % de SER. Los valores se obtuvieron en conjuntos distintos, por lo que la comparación directa entre filas no es correcta.

Criterio: comparar el SER solo dentro de una misma colección y un mismo género.

Qué significa esto al elegir una herramienta

El trabajo cubre dos vacíos: ofrece un corpus abierto para música popular y muestra un esquema de entrenamiento con aumentación y características MuQ. En clásica, el resultado es notablemente más preciso que el del anterior state-of-the-art.

Pautas prácticas:

  • tener en cuenta con qué material se entrenó y se validó el modelo;
  • comprobar la disponibilidad de datos y código: en este trabajo están abiertos;
  • leer el SER junto con el nombre de la colección, no por separado.

Materiales: preprint arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Versión para la conferencia: DOI 10.1145/3767308.3835653.

Preguntas frecuentes

Material similar

Todos los materiales
Transcripción de audio a partituras para música popular: corpus SheetSage-A2S, aumento de datos y características MuQ