Transkripsi audio ke not dan tempat musik populer
Audio-to-score (A2S) mengubah rekaman audio menjadi teks not. Sistem A2S yang ada saat ini terutama dirancang untuk musik klasik. Penerapannya pada musik populer masih kurang diteliti. Partitur dalam sistem semacam itu direpresentasikan dalam encoding simbolik, termasuk format **kern.
Arah ini dikerjakan oleh Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, dan Yaolong Ju. Preprint v1 terbit pada 6 Agustus 2026, versi v3 pada 25 Agustus 2026. Karya ini diterima pada konferensi ke-34 ACM International Conference on Multimedia (MM '26).
Kriteria pemilihan: repertoar yang menjadi sasaran klaim alat. Musik klasik dan musik populer bersandar pada koleksi yang berbeda dan hasil dasar yang berbeda.
Korpus SheetSage-A2S: komposisi dan tujuan
Himpunan data ini dibuat untuk A2S pada musik populer. Komposisinya:
- 61 jam audio;
- 9.468 klip;
- 6.066 lagu unik;
- partitur dalam encoding **kern.
Penulis menyebut korpus ini yang pertama sejenis untuk A2S musik populer. Data, model, dan kode terbuka untuk publik. Hasil pada himpunan data ini menjadi acuan bagi karya-karya mendatang.

Kriteria praktis: himpunan data ini cocok sebagai titik acuan saat membandingkan model A2S pada musik populer. Untuk repertoar klasik digunakan koleksi lain, misalnya Quartets.
Augmentasi: apa yang diubahnya dalam pelatihan
Augmentasi memperluas sampel pelatihan melalui transformasi terhadap contoh yang sudah ada. Penulis menerapkannya bersama fitur pra-latih MuQ. Tujuannya adalah meningkatkan kemampuan generalisasi model.
Abstrak tidak merinci jenis transformasi tertentu dan parameternya. Diketahui bahwa kombinasi augmentasi dan fitur pra-latih dikaitkan penulis dengan peningkatan generalisasi. Kedua teknik bekerja dalam satu skema pelatihan.
Kriteria: saat menelaah pipeline orang lain, penting untuk mencatat apakah augmentasi termasuk dalam pelatihan. Penulis mengaitkannya dengan generalisasi model.
Fitur pra-latih MuQ
MuQ adalah model pra-latih untuk ekstraksi fitur audio musik. Model ini sudah dilatih pada musik, sehingga model A2S memperoleh representasi suara yang siap pakai. Penulis menggunakan fitur tersebut untuk mengekstraksi karakteristik audio yang signifikan.
Apa manfaatnya bagi sistem A2S:
- fitur diekstraksi oleh model pra-latih terpisah;
- model A2S bekerja dengan representasi audio yang siap pakai.

Kriteria praktis: fitur musik pra-latih cocok digunakan ketika tidak ada gunanya melatih ekstraksi fitur di dalam pipeline A2S. Penulis menunjukkan peningkatan hasil dengan pendekatan ini.
Metrik SER dan hasil model
SER (symbol error rate) adalah proporsi kesalahan pada simbol partitur. Evaluasi dilakukan pada dua koleksi: Quartets untuk musik klasik dan SheetSage-A2S untuk musik populer.
| Koleksi | Musik | SER model yang diusulkan | Sebagai pembanding |
|---|---|---|---|
| Quartets | klasik | 4,98 % | 15,3 % SER pada state-of-the-art sebelumnya (Alfaro-Contreras et al., 2024) |
| SheetSage-A2S | populer | 20,92 % | himpunan data baru, hasilnya menjadi acuan bagi karya mendatang |
Pada musik klasik, model menurunkan SER dari 15,3 % menjadi 4,98 % dibandingkan state-of-the-art sebelumnya. Untuk musik populer, penulis mencatat 20,92 % SER. Nilai-nilai ini diperoleh pada himpunan data yang berbeda, sehingga perbandingan langsung antar baris tidak tepat.

Kriteria: bandingkan SER hanya dalam satu koleksi dan satu genre yang sama.
Apa artinya saat memilih alat
Karya ini menutup dua celah: menyediakan korpus terbuka untuk musik populer dan menunjukkan skema pelatihan dengan augmentasi serta fitur MuQ. Untuk musik klasik, hasilnya jauh lebih akurat dibandingkan state-of-the-art sebelumnya.
Acuan praktis:
- pertimbangkan pada materi apa model dilatih dan diuji;
- periksa ketersediaan data dan kode — dalam karya ini keduanya terbuka;
- baca SER bersama nama koleksinya, bukan secara terpisah.
Materi: preprint arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Versi untuk konferensi: DOI 10.1145/3767308.3835653.



