Transkripsi audio ke notasi untuk musik populer: korpus SheetSage-A2S, augmentasi, dan fitur MuQ

20 September 202625 tampilan

Penulis memperkenalkan SheetSage-A2S — 61 jam rekaman audio dengan anotasi **kern pada 9.468 fragmen dari 6.066 lagu, yang berfokus pada repertoar populer. Kombinasi augmentasi data dan model pra-latih ekstraksi fitur musik MuQ menurunkan tingkat kesalahan simbol menjadi 4,98% pada koleksi klasik Quartets dan menghasilkan 20,92% pada korpus baru, menetapkan tolok ukur untuk penelitian selanjutnya.

Transkripsi audio ke notasi untuk musik populer: korpus SheetSage-A2S, augmentasi, dan fitur MuQ

Transkripsi audio ke not dan tempat musik populer

Audio-to-score (A2S) mengubah rekaman audio menjadi teks not. Sistem A2S yang ada saat ini terutama dirancang untuk musik klasik. Penerapannya pada musik populer masih kurang diteliti. Partitur dalam sistem semacam itu direpresentasikan dalam encoding simbolik, termasuk format **kern.

Arah ini dikerjakan oleh Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, dan Yaolong Ju. Preprint v1 terbit pada 6 Agustus 2026, versi v3 pada 25 Agustus 2026. Karya ini diterima pada konferensi ke-34 ACM International Conference on Multimedia (MM '26).

Kriteria pemilihan: repertoar yang menjadi sasaran klaim alat. Musik klasik dan musik populer bersandar pada koleksi yang berbeda dan hasil dasar yang berbeda.

Korpus SheetSage-A2S: komposisi dan tujuan

Himpunan data ini dibuat untuk A2S pada musik populer. Komposisinya:

  • 61 jam audio;
  • 9.468 klip;
  • 6.066 lagu unik;
  • partitur dalam encoding **kern.

Penulis menyebut korpus ini yang pertama sejenis untuk A2S musik populer. Data, model, dan kode terbuka untuk publik. Hasil pada himpunan data ini menjadi acuan bagi karya-karya mendatang.

Kriteria praktis: himpunan data ini cocok sebagai titik acuan saat membandingkan model A2S pada musik populer. Untuk repertoar klasik digunakan koleksi lain, misalnya Quartets.

Augmentasi: apa yang diubahnya dalam pelatihan

Augmentasi memperluas sampel pelatihan melalui transformasi terhadap contoh yang sudah ada. Penulis menerapkannya bersama fitur pra-latih MuQ. Tujuannya adalah meningkatkan kemampuan generalisasi model.

Abstrak tidak merinci jenis transformasi tertentu dan parameternya. Diketahui bahwa kombinasi augmentasi dan fitur pra-latih dikaitkan penulis dengan peningkatan generalisasi. Kedua teknik bekerja dalam satu skema pelatihan.

Kriteria: saat menelaah pipeline orang lain, penting untuk mencatat apakah augmentasi termasuk dalam pelatihan. Penulis mengaitkannya dengan generalisasi model.

Fitur pra-latih MuQ

MuQ adalah model pra-latih untuk ekstraksi fitur audio musik. Model ini sudah dilatih pada musik, sehingga model A2S memperoleh representasi suara yang siap pakai. Penulis menggunakan fitur tersebut untuk mengekstraksi karakteristik audio yang signifikan.

Apa manfaatnya bagi sistem A2S:

  • fitur diekstraksi oleh model pra-latih terpisah;
  • model A2S bekerja dengan representasi audio yang siap pakai.

Kriteria praktis: fitur musik pra-latih cocok digunakan ketika tidak ada gunanya melatih ekstraksi fitur di dalam pipeline A2S. Penulis menunjukkan peningkatan hasil dengan pendekatan ini.

Metrik SER dan hasil model

SER (symbol error rate) adalah proporsi kesalahan pada simbol partitur. Evaluasi dilakukan pada dua koleksi: Quartets untuk musik klasik dan SheetSage-A2S untuk musik populer.

KoleksiMusikSER model yang diusulkanSebagai pembanding
Quartetsklasik4,98 %15,3 % SER pada state-of-the-art sebelumnya (Alfaro-Contreras et al., 2024)
SheetSage-A2Spopuler20,92 %himpunan data baru, hasilnya menjadi acuan bagi karya mendatang

Pada musik klasik, model menurunkan SER dari 15,3 % menjadi 4,98 % dibandingkan state-of-the-art sebelumnya. Untuk musik populer, penulis mencatat 20,92 % SER. Nilai-nilai ini diperoleh pada himpunan data yang berbeda, sehingga perbandingan langsung antar baris tidak tepat.

Kriteria: bandingkan SER hanya dalam satu koleksi dan satu genre yang sama.

Apa artinya saat memilih alat

Karya ini menutup dua celah: menyediakan korpus terbuka untuk musik populer dan menunjukkan skema pelatihan dengan augmentasi serta fitur MuQ. Untuk musik klasik, hasilnya jauh lebih akurat dibandingkan state-of-the-art sebelumnya.

Acuan praktis:

  • pertimbangkan pada materi apa model dilatih dan diuji;
  • periksa ketersediaan data dan kode — dalam karya ini keduanya terbuka;
  • baca SER bersama nama koleksinya, bukan secara terpisah.

Materi: preprint arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165. Versi untuk konferensi: DOI 10.1145/3767308.3835653.

Pertanyaan yang sering ditanyakan

Transkripsi audio ke notasi untuk musik populer: korpus SheetSage-A2S, augmentasi, dan fitur MuQ