Transcrição de áudio em partituras para música popular: corpus SheetSage-A2S, aumento de dados e características MuQ

20 setembro 202625 visualizações

Os autores apresentaram o SheetSage-A2S — 61 hora de gravações de áudio com **anotação kern** em 9.468 fragmentos de 6.066 músicas, voltado para o repertório popular. A combinação de aumento de dados e do modelo pré-treinado de extração de características musicais MuQ reduz a taxa de erros de símbolos para 4,98% no conjunto clássico Quartets e alcança 20,92% no novo corpus, estabelecendo um nível de referência para pesquisas futuras.

Transcrição de áudio em partituras para música popular: corpus SheetSage-A2S, aumento de dados e características MuQ

Transcrição de áudio para partituras e o lugar da música popular

O audio-to-score (A2S) converte uma gravação de áudio em texto de partitura. Os sistemas A2S atuais são voltados principalmente para música clássica. A aplicação à música popular permanece pouco estudada. As partituras nesses sistemas são representadas em codificações simbólicas, incluindo o formato **kern.

Trabalharam nessa direção Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo e Yaolong Ju. O preprint v1 saiu em 6 de agosto de 2026, a versão v3 — em 25 de agosto de 2026. O trabalho foi aceito na 34ª conferência ACM International Conference on Multimedia (MM '26).

Critério de escolha: o repertório para o qual a ferramenta é declarada. A música clássica e a música popular se apoiam em coleções diferentes e em resultados de base diferentes.

Corpus SheetSage-A2S: composição e finalidade

O conjunto foi criado para A2S em música popular. Sua composição:

  • 61 horas de áudio;
  • 9 468 clipes;
  • 6 066 músicas únicas;
  • partituras em codificações **kern.

Os autores chamam o corpus de primeiro do tipo para A2S de música popular. Os dados, o modelo e o código são abertos ao público. O resultado nesse conjunto estabelece um referencial para trabalhos futuros.

Critério prático: o conjunto serve como ponto de partida na comparação de modelos A2S em música popular. Para o repertório clássico usam-se outras coleções, por exemplo Quartets.

Aumentação: o que ela muda no treinamento

A aumentação amplia a amostra de treinamento com transformações de exemplos já existentes. Os autores a aplicam junto com os recursos pré-treinados MuQ. O objetivo é aumentar a capacidade de generalização do modelo.

A anotação não lista os tipos concretos de transformações e seus parâmetros. Sabe-se que os autores associam a combinação de aumentação e recursos pré-treinados à melhoria da generalização. Ambas as técnicas funcionam em um mesmo esquema de treinamento.

Critério: ao analisar o pipeline de terceiros, é útil registrar se a aumentação faz parte do treinamento. Os autores a associam à generalização do modelo.

Recursos pré-treinados MuQ

MuQ é um modelo pré-treinado de extração de recursos para áudio musical. Ele já foi treinado em música, portanto o modelo A2S recebe uma representação pronta do som. Os autores usam esses recursos para extrair características significativas do áudio.

O que isso proporciona ao sistema A2S:

  • os recursos são extraídos por um modelo pré-treinado separado;
  • o modelo A2S trabalha com uma representação pronta do áudio.

Critério prático: recursos musicais pré-treinados são adequados onde não faz sentido treinar a extração de recursos dentro do pipeline A2S. Os autores mostram melhoria dos resultados com essa abordagem.

Métrica SER e resultados do modelo

SER (symbol error rate) — a proporção de erros nos símbolos da partitura. A avaliação foi feita em duas coleções: Quartets para música clássica e SheetSage-A2S para música popular.

ColeçãoMúsicaSER do modelo propostoPara comparação
Quartetsclássica4,98 %15,3 % de SER do antigo state-of-the-art (Alfaro-Contreras et al., 2024)
SheetSage-A2Spopular20,92 %conjunto novo, o resultado serve de referencial para trabalhos futuros

Na música clássica, o modelo reduz o SER de 15,3 % para 4,98 % em relação ao antigo state-of-the-art. Para a música popular, os autores registram 20,92 % de SER. Os valores foram obtidos em conjuntos diferentes, portanto a comparação direta entre as linhas é incorreta.

Critério: comparar o SER apenas dentro de uma mesma coleção e de um mesmo gênero.

O que isso significa na escolha da ferramenta

O trabalho preenche duas lacunas: fornece um corpus aberto para música popular e mostra um esquema de treinamento com aumentação e recursos MuQ. Para a música clássica, o resultado é sensivelmente mais preciso do que o do antigo state-of-the-art.

Orientações práticas:

  • levar em conta com que material o modelo foi treinado e verificado;
  • verificar a disponibilidade dos dados e do código — neste trabalho eles são abertos;
  • ler o SER junto com o nome da coleção, e não isoladamente.

Materiais: preprint arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Versão para a conferência: DOI 10.1145/3767308.3835653.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Transcrição de áudio em partituras para música popular: corpus SheetSage-A2S, aumento de dados e características MuQ