Transcription audio en partitions et place de la musique populaire
L'audio-to-score (A2S) transforme un enregistrement audio en texte musical. Les systèmes A2S actuels sont avant tout conçus pour la musique classique. Leur application à la musique populaire reste peu étudiée. Dans ces systèmes, les partitions sont représentées dans des encodages symboliques, notamment au format **kern.
Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo et Yaolong Ju ont travaillé sur cette direction. La prépublication v1 est parue le 6 août 2026, la version v3 le 25 août 2026. Le travail a été accepté à la 34e conférence ACM International Conference on Multimedia (MM '26).
Critère de choix : le répertoire pour lequel l'outil est annoncé. La musique classique et la musique populaire s'appuient sur des collections différentes et sur des résultats de référence différents.
Corpus SheetSage-A2S : composition et finalité
L'ensemble a été créé pour l'A2S sur la musique populaire. Sa composition :
- 61 heures d'audio ;
- 9 468 clips ;
- 6 066 chansons uniques ;
- des partitions en encodages **kern.
Les auteurs qualifient ce corpus du premier du genre pour l'A2S sur la musique populaire. Les données, le modèle et le code sont ouverts publiquement. Le résultat sur cet ensemble sert de repère pour les travaux futurs.

Critère pratique : l'ensemble convient comme point de référence pour comparer des modèles A2S sur la musique populaire. Pour le répertoire classique, on utilise d'autres collections, par exemple Quartets.
Augmentation : ce qu'elle change dans l'entraînement
L'augmentation élargit l'échantillon d'entraînement par des transformations d'exemples existants. Les auteurs l'appliquent avec les caractéristiques pré-entraînées MuQ. L'objectif est d'améliorer la capacité de généralisation du modèle.
Le résumé ne liste pas les types concrets de transformations ni leurs paramètres. On sait que les auteurs associent la combinaison de l'augmentation et des caractéristiques pré-entraînées à une meilleure généralisation. Les deux procédés opèrent dans un même schéma d'entraînement.
Critère : lors de l'analyse d'un pipeline tiers, il est utile de noter si l'augmentation fait partie de l'entraînement. Les auteurs la relient à la généralisation du modèle.
Caractéristiques pré-entraînées MuQ
MuQ est un modèle pré-entraîné d'extraction de caractéristiques pour l'audio musical. Il est déjà entraîné sur de la musique, de sorte que le modèle A2S reçoit une représentation prête de l'audio. Les auteurs utilisent ces caractéristiques pour extraire les attributs significatifs de l'audio.
Ce que cela apporte au système A2S :
- les caractéristiques sont extraites par un modèle pré-entraîné distinct ;
- le modèle A2S travaille avec une représentation prête de l'audio.

Critère pratique : les caractéristiques musicales pré-entraînées conviennent là où il n'est pas pertinent d'entraîner l'extraction de caractéristiques au sein du pipeline A2S. Les auteurs montrent une amélioration des résultats avec cette approche.
Métrique SER et résultats du modèle
SER (symbol error rate) — la proportion d'erreurs dans les symboles de la partition. L'évaluation a été menée sur deux collections : Quartets pour la musique classique et SheetSage-A2S pour la musique populaire.
| Collection | Musique | SER du modèle proposé | Pour comparaison |
|---|---|---|---|
| Quartets | classique | 4,98 % | 15,3 % de SER pour l'ancien state-of-the-art (Alfaro-Contreras et al., 2024) |
| SheetSage-A2S | populaire | 20,92 % | ensemble nouveau, le résultat sert de repère pour les travaux futurs |
Sur la musique classique, le modèle réduit le SER de 15,3 % à 4,98 % par rapport à l'ancien state-of-the-art. Pour la musique populaire, les auteurs enregistrent 20,92 % de SER. Les valeurs sont obtenues sur des ensembles différents, une comparaison directe entre les lignes n'est donc pas pertinente.

Critère : comparer le SER uniquement au sein d'une même collection et d'un même genre.
Ce que cela signifie lors du choix d'un outil
Le travail comble deux lacunes : il fournit un corpus ouvert pour la musique populaire et présente un schéma d'entraînement avec augmentation et caractéristiques MuQ. Pour la musique classique, le résultat est nettement plus précis que celui de l'ancien state-of-the-art.
Repères pratiques :
- tenir compte du matériel sur lequel le modèle a été entraîné et vérifié ;
- vérifier la disponibilité des données et du code — dans ce travail, ils sont ouverts ;
- lire le SER avec le nom de la collection, et non isolément.
Ressources : prépublication arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Version pour la conférence : DOI 10.1145/3767308.3835653.



