Transcrição de áudio para partituras e o lugar da música popular
O audio-to-score (A2S) converte uma gravação de áudio em texto de partitura. Os sistemas A2S atuais são voltados principalmente para música clássica. A aplicação à música popular permanece pouco estudada. As partituras nesses sistemas são representadas em codificações simbólicas, incluindo o formato **kern.
Trabalharam nessa direção Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo e Yaolong Ju. O preprint v1 saiu em 6 de agosto de 2026, a versão v3 — em 25 de agosto de 2026. O trabalho foi aceito na 34ª conferência ACM International Conference on Multimedia (MM '26).
Critério de escolha: o repertório para o qual a ferramenta é declarada. A música clássica e a música popular se apoiam em coleções diferentes e em resultados de base diferentes.
Corpus SheetSage-A2S: composição e finalidade
O conjunto foi criado para A2S em música popular. Sua composição:
- 61 horas de áudio;
- 9 468 clipes;
- 6 066 músicas únicas;
- partituras em codificações **kern.
Os autores chamam o corpus de primeiro do tipo para A2S de música popular. Os dados, o modelo e o código são abertos ao público. O resultado nesse conjunto estabelece um referencial para trabalhos futuros.

Critério prático: o conjunto serve como ponto de partida na comparação de modelos A2S em música popular. Para o repertório clássico usam-se outras coleções, por exemplo Quartets.
Aumentação: o que ela muda no treinamento
A aumentação amplia a amostra de treinamento com transformações de exemplos já existentes. Os autores a aplicam junto com os recursos pré-treinados MuQ. O objetivo é aumentar a capacidade de generalização do modelo.
A anotação não lista os tipos concretos de transformações e seus parâmetros. Sabe-se que os autores associam a combinação de aumentação e recursos pré-treinados à melhoria da generalização. Ambas as técnicas funcionam em um mesmo esquema de treinamento.
Critério: ao analisar o pipeline de terceiros, é útil registrar se a aumentação faz parte do treinamento. Os autores a associam à generalização do modelo.
Recursos pré-treinados MuQ
MuQ é um modelo pré-treinado de extração de recursos para áudio musical. Ele já foi treinado em música, portanto o modelo A2S recebe uma representação pronta do som. Os autores usam esses recursos para extrair características significativas do áudio.
O que isso proporciona ao sistema A2S:
- os recursos são extraídos por um modelo pré-treinado separado;
- o modelo A2S trabalha com uma representação pronta do áudio.

Critério prático: recursos musicais pré-treinados são adequados onde não faz sentido treinar a extração de recursos dentro do pipeline A2S. Os autores mostram melhoria dos resultados com essa abordagem.
Métrica SER e resultados do modelo
SER (symbol error rate) — a proporção de erros nos símbolos da partitura. A avaliação foi feita em duas coleções: Quartets para música clássica e SheetSage-A2S para música popular.
| Coleção | Música | SER do modelo proposto | Para comparação |
|---|---|---|---|
| Quartets | clássica | 4,98 % | 15,3 % de SER do antigo state-of-the-art (Alfaro-Contreras et al., 2024) |
| SheetSage-A2S | popular | 20,92 % | conjunto novo, o resultado serve de referencial para trabalhos futuros |
Na música clássica, o modelo reduz o SER de 15,3 % para 4,98 % em relação ao antigo state-of-the-art. Para a música popular, os autores registram 20,92 % de SER. Os valores foram obtidos em conjuntos diferentes, portanto a comparação direta entre as linhas é incorreta.

Critério: comparar o SER apenas dentro de uma mesma coleção e de um mesmo gênero.
O que isso significa na escolha da ferramenta
O trabalho preenche duas lacunas: fornece um corpus aberto para música popular e mostra um esquema de treinamento com aumentação e recursos MuQ. Para a música clássica, o resultado é sensivelmente mais preciso do que o do antigo state-of-the-art.
Orientações práticas:
- levar em conta com que material o modelo foi treinado e verificado;
- verificar a disponibilidade dos dados e do código — neste trabalho eles são abertos;
- ler o SER junto com o nome da coleção, e não isoladamente.
Materiais: preprint arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Versão para a conferência: DOI 10.1145/3767308.3835653.



