تحويل الصوت إلى نوتة موسيقية ومكان الموسيقى الشائعة
يحوّل تحويل الصوت إلى نوتة (A2S) تسجيلاً صوتياً إلى نص نوتي. صُمّمت أنظمة A2S الحالية في المقام الأول للموسيقى الكلاسيكية. أما تطبيقها على الموسيقى الشائعة فيبقى قليل الدراسة. وتُمثَّل النوتات في هذه الأنظمة بترميزات رمزية، من بينها صيغة **kern.
عمل على هذا الاتجاه Eoin Cummins وZhongyi Huang وAlexandre D'Hooge وZhuoru Mo وYaolong Ju. صدرت المسودة الأولية v1 في 6 أغسطس 2026، والنسخة v3 في 25 أغسطس 2026. وقُبل العمل في المؤتمر الرابع والثلاثين ACM International Conference on Multimedia (MM '26).
معيار الاختيار: المرجع الموسيقي الذي أُعلنت الأداة من أجله. تستند الموسيقى الكلاسيكية والموسيقى الشائعة إلى مجموعتين مختلفتين وإلى نتائج أساسية مختلفة.
مجموعة SheetSage-A2S: التكوين والغرض
أُنشئت المجموعة من أجل A2S على الموسيقى الشائعة. وتكوينها:
- 61 ساعة من الصوت؛
- 9 468 مقطعاً؛
- 6 066 أغنية فريدة؛
- نوتات بترميزات **kern.
ويصف المؤلفون المجموعة بأنها الأولى من نوعها في A2S للموسيقى الشائعة. البيانات والنموذج والشيفرة متاحة علناً. والنتيجة على هذه المجموعة تحدد مرجعاً للأعمال المستقبلية.

معيار عملي: تصلح المجموعة كنقطة انطلاق عند مقارنة نماذج A2S على الموسيقى الشائعة. أما للمرجع الكلاسيكي فتُستخدم مجموعات أخرى، مثل Quartets.
التحسين بالزيادة: ما الذي يغيّره في التدريب
يوسّع التحسين بالزيادة عيّنة التدريب بتحويلات تُجرى على الأمثلة الموجودة. ويطبّقه المؤلفون مع السمات المُدرَّبة مسبقاً MuQ. والهدف هو رفع قدرة النموذج على التعميم.
لا يسرد الملخص أنواع التحويلات المحددة ولا معاملاتها. والمعروف أن المؤلفين يربطون الجمع بين التحسين بالزيادة والسمات المُدرَّبة مسبقاً بتحسّن التعميم. وتعمل كلتا التقنيتين في مخطط تدريب واحد.
المعيار: عند تحليل مسار عمل غيرك، من المفيد تحديد ما إذا كان التحسين بالزيادة داخل التدريب. فالمؤلفون يربطونه بتعميم النموذج.
السمات المُدرَّبة مسبقاً MuQ
MuQ نموذج مُدرَّب مسبقاً لاستخراج السمات من الصوت الموسيقي. وقد دُرِّب بالفعل على الموسيقى، لذا يحصل نموذج A2S على تمثيل جاهز للصوت. ويستخدم المؤلفون هذه السمات لاستخراج الخصائص الدلالية للصوت.
ما الذي يمنحه ذلك لنظام A2S:
- تستخرج السمات نموذج منفصل مُدرَّب مسبقاً؛
- يعمل نموذج A2S على تمثيل جاهز للصوت.

معيار عملي: تصلح السمات الموسيقية المُدرَّبة مسبقاً حيث لا معنى لتدريب استخراج السمات داخل مسار عمل A2S. ويُظهر المؤلفون تحسّناً في النتائج بهذا النهج.
مقياس SER ونتائج النموذج
SER (معدل خطأ الرموز) هو نسبة الأخطاء في رموز النوتة. وأُجري التقييم على مجموعتين: Quartets للموسيقى الكلاسيكية وSheetSage-A2S للموسيقى الشائعة.
| المجموعة | الموسيقى | SER للنموذج المقترح | للمقارنة |
|---|---|---|---|
| Quartets | كلاسيكية | 4,98 % | 15,3 % SER لدى أحدث ما وصلت إليه الحالة السابقة (Alfaro-Contreras et al., 2024) |
| SheetSage-A2S | شائعة | 20,92 % | المجموعة جديدة، والنتيجة مرجع للأعمال المستقبلية |
في الموسيقى الكلاسيكية يخفض النموذج SER من 15,3 % إلى 4,98 % مقارنةً بأحدث ما وصلت إليه الحالة السابقة. أما للموسيقى الشائعة فيسجّل المؤلفون 20,92 % SER. وقد حُصل على القيم من مجموعتين مختلفتين، لذا فالمقارنة المباشرة بين السطرين غير صحيحة.

المعيار: لا تُقارن SER إلا داخل المجموعة الواحدة والنوع الموسيقي الواحد.
ماذا يعني ذلك عند اختيار أداة
يسدّ العمل ثغرتين: فهو يوفّر مجموعة مفتوحة للموسيقى الشائعة، ويعرض مخطط تدريب بالتحسين بالزيادة وسمات MuQ. وفي الموسيقى الكلاسيكية تكون النتيجة أدقّ بوضوح من أحدث ما وصلت إليه الحالة السابقة.
معايير عملية:
- مراعاة المادة التي دُرِّب النموذج واختُبر عليها؛
- التحقق من إتاحة البيانات والشيفرة — وهي متاحة علناً في هذا العمل؛
- قراءة SER مقترناً باسم المجموعة، لا منفرداً.
المواد: المسودة الأولية arXiv:2608.06165، وDOI 10.48550/arXiv.2608.06165. نسخة المؤتمر: DOI 10.1145/3767308.3835653.



