অডিও থেকে স্কোর ট্রান্সক্রিপশন এবং জনপ্রিয় সংগীতের জায়গা
Audio-to-score (A2S) একটি অডিও রেকর্ডিংকে নোটেশন টেক্সটে রূপান্তর করে। বর্তমান A2S-সিস্টেমগুলো মূলত শাস্ত্রীয় সংগীতের জন্য তৈরি। জনপ্রিয় সংগীতে এর প্রয়োগ এখনো কম-অনুসন্ধিত। এসব সিস্টেমে স্কোর সিম্বলিক এনকোডিংয়ে উপস্থাপন করা হয়, যার মধ্যে **kern ফরম্যাটও রয়েছে।
এই ক্ষেত্রে কাজ করেছেন Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo এবং Yaolong Ju। প্রিপ্রিন্ট v1 প্রকাশিত হয় ৬ আগস্ট ২০২৬, সংস্করণ v3 — ২৫ আগস্ট ২০২৬। কাজটি ৩৪তম ACM International Conference on Multimedia (MM '26)-এ গৃহীত হয়েছে।
নির্বাচনের মানদণ্ড: যে রেপার্টোয়ারের জন্য টুলটি দাবি করা হয়েছে। শাস্ত্রীয় ও জনপ্রিয় সংগীত ভিন্ন ভিন্ন কালেকশন এবং ভিন্ন ভিন্ন বেসলাইন ফলাফলের উপর নির্ভর করে।
SheetSage-A2S কর্পাস: গঠন ও উদ্দেশ্য
এই সেটটি জনপ্রিয় সংগীতে A2S-এর জন্য তৈরি করা হয়েছে। এর গঠন:
- ৬১ ঘণ্টা অডিও;
- ৯,৪৬৮টি ক্লিপ;
- ৬,০৬৬টি অনন্য গান;
- **kern-এনকোডিংয়ে স্কোর।
লেখকেরা এই কর্পাসকে জনপ্রিয় সংগীতে A2S-এর জন্য প্রথম ধরনের বলে উল্লেখ করেছেন। ডেটা, মডেল এবং কোড প্রকাশ্যে উন্মুক্ত। এই সেটে ফলাফল ভবিষ্যৎ কাজের জন্য একটি মাপকাঠি নির্ধারণ করে।

ব্যবহারিক মানদণ্ড: জনপ্রিয় সংগীতে A2S-মডেল তুলনার সময় এই সেটটি সূচনা বিন্দু হিসেবে উপযুক্ত। শাস্ত্রীয় রেপার্টোয়ারের জন্য অন্য কালেকশন ব্যবহার করা হয়, যেমন Quartets।
অগমেন্টেশন: প্রশিক্ষণে এটি কী বদলায়
অগমেন্টেশন বিদ্যমান উদাহরণগুলোর রূপান্তরের মাধ্যমে প্রশিক্ষণ নমুনা বাড়ায়। লেখকেরা এটি প্রি-ট্রেইনড MuQ ফিচারের সাথে ব্যবহার করেন। লক্ষ্য — মডেলের সাধারণীকরণ ক্ষমতা বাড়ানো।
অ্যানোটেশনে নির্দিষ্ট রূপান্তরের ধরন ও তাদের প্যারামিটার উল্লেখ নেই। জানা যায়, অগমেন্টেশন ও প্রি-ট্রেইনড ফিচারের সমন্বয়কে লেখকেরা সাধারণীকরণের উন্নতির সাথে সম্পর্কিত করেন। উভয় পদ্ধতি একই প্রশিক্ষণ স্কিমে কাজ করে।
মানদণ্ড: অন্যের পাইপলাইন বিশ্লেষণের সময় প্রশিক্ষণে অগমেন্টেশন আছে কি না তা নথিভুক্ত করা উপকারী। লেখকেরা এটি মডেলের সাধারণীকরণের সাথে সম্পর্কিত করেন।
প্রি-ট্রেইনড MuQ ফিচার
MuQ হলো সংগীত অডিওর জন্য একটি প্রি-ট্রেইনড ফিচার এক্সট্রাকশন মডেল। এটি ইতিমধ্যে সংগীতে প্রশিক্ষিত, তাই A2S-মডেল শব্দের একটি প্রস্তুত উপস্থাপনা পায়। লেখকেরা অডিওর তাৎপর্যপূর্ণ বৈশিষ্ট্য বের করতে এসব ফিচার ব্যবহার করেন।
এটি A2S-সিস্টেমকে যা দেয়:
- ফিচার একটি আলাদা প্রি-ট্রেইনড মডেল বের করে;
- A2S-মডেল অডিওর প্রস্তুত উপস্থাপনা নিয়ে কাজ করে।

ব্যবহারিক মানদণ্ড: যেখানে A2S-পাইপলাইনের ভেতরে ফিচার এক্সট্রাকশন প্রশিক্ষণের প্রয়োজন নেই, সেখানে প্রি-ট্রেইনড সংগীত ফিচার উপযুক্ত। লেখকেরা এই পদ্ধতিতে ফলাফলের উন্নতি দেখান।
SER মেট্রিক এবং মডেলের ফলাফল
SER (symbol error rate) — স্কোরের সিম্বলে ত্রুটির অনুপাত। মূল্যায়ন দুটি কালেকশনে করা হয়েছে: শাস্ত্রীয় সংগীতের জন্য Quartets এবং জনপ্রিয় সংগীতের জন্য SheetSage-A2S।
| কালেকশন | সংগীত | প্রস্তাবিত মডেলের SER | তুলনার জন্য |
|---|---|---|---|
| Quartets | শাস্ত্রীয় | ৪.৯৮ % | পূর্ববর্তী state-of-the-art-এর ১৫.৩ % SER (Alfaro-Contreras et al., 2024) |
| SheetSage-A2S | জনপ্রিয় | ২০.৯২ % | সেটটি নতুন, ফলাফল ভবিষ্যৎ কাজের জন্য মাপকাঠি হিসেবে কাজ করে |
শাস্ত্রীয় সংগীতে মডেলটি পূর্ববর্তী state-of-the-art-এর তুলনায় SER ১৫.৩ % থেকে ৪.৯৮ %-এ নামায়। জনপ্রিয় সংগীতের জন্য লেখকেরা ২০.৯২ % SER নথিভুক্ত করেন। মানগুলো ভিন্ন ভিন্ন সেটে পাওয়া, তাই সারিগুলোর মধ্যে সরাসরি তুলনা করা অনুচিত।

মানদণ্ড: SER শুধু একই কালেকশন ও একই ঘরানার মধ্যে তুলনা করা উচিত।
টুল নির্বাচনের সময় এর অর্থ কী
এই কাজ দুটি শূন্যতা পূরণ করে: জনপ্রিয় সংগীতের জন্য একটি উন্মুক্ত কর্পাস দেয় এবং অগমেন্টেশন ও MuQ ফিচারসহ একটি প্রশিক্ষণ স্কিম দেখায়। শাস্ত্রীয় সংগীতে ফলাফল পূর্ববর্তী state-of-the-art-এর চেয়ে লক্ষণীয়ভাবে বেশি নির্ভুল।
ব্যবহারিক দিশা:
- মডেল কোন উপাদানে প্রশিক্ষিত ও যাচাই করা হয়েছে তা বিবেচনা করা;
- ডেটা ও কোডের প্রাপ্যতা যাচাই করা — এই কাজে সেগুলো উন্মুক্ত;
- SER আলাদাভাবে নয়, কালেকশনের নামের সাথে পড়া।
উপকরণ: প্রিপ্রিন্ট arXiv:2608.06165, DOI 10.48550/arXiv.2608.06165। সম্মেলনের সংস্করণ: DOI 10.1145/3767308.3835653।



