ऑडियो से नोट्स में ट्रांसक्रिप्शन और लोकप्रिय संगीत का स्थान
Audio-to-score (A2S) ऑडियो रिकॉर्डिंग को नोटेशन टेक्स्ट में बदलता है। मौजूदा A2S-सिस्टम मुख्य रूप से शास्त्रीय संगीत के लिए बनाए गए हैं। लोकप्रिय संगीत पर इसका उपयोग कम शोधित है। ऐसे सिस्टम में स्कोर को सांकेतिक एन्कोडिंग में दर्शाया जाता है, जिनमें **kern फ़ॉर्मैट भी शामिल है।
इस दिशा पर Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo और Yaolong Ju ने काम किया। प्रीप्रिंट v1 6 अगस्त 2026 को आया, संस्करण v3 — 25 अगस्त 2026 को। यह काम 34वें ACM International Conference on Multimedia (MM '26) में स्वीकार किया गया।
चयन का मानदंड: वह रेपर्टॉयर जिसके लिए टूल दावा करता है। शास्त्रीय और लोकप्रिय संगीत अलग-अलग संग्रहों और अलग-अलग आधारभूत परिणामों पर निर्भर करते हैं।
SheetSage-A2S कॉर्पस: संरचना और उद्देश्य
यह सेट लोकप्रिय संगीत पर A2S के लिए बनाया गया था। इसकी संरचना:
- 61 घंटे का ऑडियो;
- 9 468 क्लिप;
- 6 066 अद्वितीय गाने;
- **kern-एन्कोडिंग में स्कोर।
लेखक इस कॉर्पस को लोकप्रिय संगीत के A2S के लिए अपनी तरह का पहला बताते हैं। डेटा, मॉडल और कोड सार्वजनिक रूप से खुले हैं। इस सेट पर परिणाम भविष्य के कामों के लिए मानक तय करता है।

व्यावहारिक मानदंड: लोकप्रिय संगीत पर A2S-मॉडलों की तुलना करते समय यह सेट आधार बिंदु के रूप में उपयुक्त है। शास्त्रीय रेपर्टॉयर के लिए अन्य संग्रह इस्तेमाल होते हैं, जैसे Quartets।
ऑगमेंटेशन: प्रशिक्षण में यह क्या बदलता है
ऑगमेंटेशन मौजूद उदाहरणों के रूपांतरणों से प्रशिक्षण नमूने का विस्तार करता है। लेखक इसे पूर्व-प्रशिक्षित MuQ विशेषताओं के साथ लागू करते हैं। उद्देश्य — मॉडल की सामान्यीकरण क्षमता बढ़ाना।
सारांश में रूपांतरणों के विशिष्ट प्रकार और उनके पैरामीटर सूचीबद्ध नहीं हैं। ज्ञात है कि लेखक ऑगमेंटेशन और पूर्व-प्रशिक्षित विशेषताओं के संयोजन को बेहतर सामान्यीकरण से जोड़ते हैं। दोनों तकनीकें एक ही प्रशिक्षण योजना में काम करती हैं।
मानदंड: किसी और के पाइपलाइन की समीक्षा करते समय यह दर्ज करना उपयोगी है कि प्रशिक्षण में ऑगमेंटेशन शामिल है या नहीं। लेखक इसे मॉडल के सामान्यीकरण से जोड़ते हैं।
पूर्व-प्रशिक्षित MuQ विशेषताएँ
MuQ संगीत ऑडियो के लिए विशेषता निष्कर्षण का पूर्व-प्रशिक्षित मॉडल है। यह पहले से संगीत पर प्रशिक्षित है, इसलिए A2S-मॉडल को ध्वनि का तैयार प्रतिनिधित्व मिलता है। लेखक ऑडियो की महत्वपूर्ण विशेषताओं को निकालने के लिए ऐसी विशेषताओं का उपयोग करते हैं।
इससे A2S-सिस्टम को क्या मिलता है:
- विशेषताएँ एक अलग पूर्व-प्रशिक्षित मॉडल निकालता है;
- A2S-मॉडल ऑडियो के तैयार प्रतिनिधित्व के साथ काम करता है।

व्यावहारिक मानदंड: पूर्व-प्रशिक्षित संगीत विशेषताएँ वहाँ उपयुक्त हैं जहाँ A2S-पाइपलाइन के भीतर विशेषता निष्कर्षण को प्रशिक्षित करने का कोई अर्थ नहीं है। लेखक इस दृष्टिकोण से बेहतर परिणाम दिखाते हैं।
SER मीट्रिक और मॉडल के परिणाम
SER (symbol error rate) — स्कोर के प्रतीकों में त्रुटियों का अनुपात। मूल्यांकन दो संग्रहों पर किया गया: शास्त्रीय संगीत के लिए Quartets और लोकप्रिय संगीत के लिए SheetSage-A2S।
| संग्रह | संगीत | प्रस्तावित मॉडल का SER | तुलना के लिए |
|---|---|---|---|
| Quartets | शास्त्रीय | 4,98 % | पिछले state-of-the-art (Alfaro-Contreras et al., 2024) का 15,3 % SER |
| SheetSage-A2S | लोकप्रिय | 20,92 % | सेट नया है, परिणाम भविष्य के कामों के लिए मानक है |
शास्त्रीय संगीत पर मॉडल पिछले state-of-the-art की तुलना में SER को 15,3 % से घटाकर 4,98 % कर देता है। लोकप्रिय संगीत के लिए लेखक 20,92 % SER दर्ज करते हैं। मान अलग-अलग सेटों पर प्राप्त हैं, इसलिए पंक्तियों के बीच सीधी तुलना गलत है।

मानदंड: SER की तुलना केवल एक ही संग्रह और एक ही शैली के भीतर करें।
टूल चुनते समय इसका क्या अर्थ है
यह काम दो कमियाँ पूरी करता है: लोकप्रिय संगीत के लिए खुला कॉर्पस देता है और ऑगमेंटेशन तथा MuQ विशेषताओं के साथ प्रशिक्षण योजना दिखाता है। शास्त्रीय संगीत के लिए परिणाम पिछले state-of-the-art से काफ़ी अधिक सटीक है।
व्यावहारिक दिशानिर्देश:
- यह ध्यान रखें कि मॉडल किस सामग्री पर प्रशिक्षित और परीक्षण किया गया है;
- डेटा और कोड की उपलब्धता जाँचें — इस काम में वे खुले हैं;
- SER को संग्रह के नाम के साथ पढ़ें, अलग से नहीं।
सामग्री: प्रीप्रिंट arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165। सम्मेलन संस्करण: DOI 10.1145/3767308.3835653।



