কেন "নন-ভার্বাল" স্পিচ সিন্থেসিসের জন্য আলাদা মাথাব্যথার বিষয়
ভয়েস করা টেক্সট এখনও জীবন্ত কথার সমান নয়। মানুষ ক্লান্ত হলে দীর্ঘশ্বাস ফেলে, অস্বস্তিকর মুহূর্তে হেসে ফেলে, বিরতি ভরাতে কাশি দেয় — আর এই ছোঁয়াগুলো ছাড়া নিখুঁত উচ্চারণও অটো-রেসপন্ডারের মতো শোনায়। ঠিক এই কারণেই নন-ভার্বাল ভোকালাইজেশন — NV, non-verbal vocalizations — তৈরি করাকে "অভিব্যক্তিপূর্ণ" স্পিচ সিন্থেসিসের অন্যতম মাপকাঠি হিসেবে বিবেচনা করা হয়: এটি কাগজ পড়ে শোনানো রোবট আর বিশ্বাসযোগ্য কণ্ঠস্বরের মধ্যে পার্থক্য গড়ে দেয়।
জটিলতা হলো, হাসি যোগ করা কারিগরি দিক থেকে কঠিন নয়, কিন্তু সেটি যথাযথ জায়গায় যোগ করা সম্পূর্ণ ভিন্ন মাত্রার কাজ। আভিধানিক নির্ভুলতা অক্ষর ও শব্দ গুনে মাপা যায়, কিন্তু নির্দিষ্ট বাক্যে দীর্ঘশ্বাস বা হাসির প্রাসঙ্গিকতা একটি অস্পষ্ট, দুর্বলভাবে প্রাতিষ্ঠানিক রূপ দেওয়া এবং প্রায় স্বয়ংক্রিয়ভাবে যাচাই-অযোগ্য বিষয়। প্রচলিত মেট্রিক এখানে অকেজো: তারা "বাড়তি" শব্দের জন্য মডেলকে শাস্তি দেবে, যদিও সেই শব্দই কথাটিকে মানুষের মতো করে তুলছিল।
লেখকেরা কী প্রস্তাব করছেন: নির্দেশনার বদলে পছন্দ
Preference Optimization for Non-Verbal Vocalization Synthesis নামের কাজটি (arXiv:2608.24163, eess.AS সংকলন, ২৫ আগস্ট ২০২৬-এ জমা দেওয়া) বিষয়টির কাছে পছন্দ-ভিত্তিক শেখার (preference learning) দিক থেকে পৌঁছেছে। লেখক দলের সদস্যরা হলেন Haoyang Li, Chenglin Xu, Junchuan Zhao, Yuang Cao, Liumeng Xue, Yiwen Guo এবং Eng Siong Chng।
মূল ভাবনা সহজ: "এখানে হাসি মানানসই, এখানে নয়" — এমন নিয়ম হাতে লিখে দেওয়ার বদলে মডেলকে ভয়েসিংয়ের কয়েকটি বিকল্প জোড়া দেখিয়ে সংকেত দেওয়া যায় কোনটি ভালো। কিন্তু গবেষকদের মতে, নন-ভার্বাল ভোকালাইজেশনে ঠিক এই পদ্ধতির প্রযোজ্যতা এখনও কম অধ্যয়ন করা হয়েছে — কোন পছন্দের সংকেত সংগ্রহ করতে হবে, জোড়া কীভাবে তৈরি করতে হবে এবং কী অপ্টিমাইজেশন লক্ষ্য নির্ধারণ করতে হবে, তা স্পষ্ট নয়।

লেখকেরা একসঙ্গে তিনটি অক্ষে পদ্ধতিগত গবেষণা চালিয়েছেন: পছন্দের সংকেতের উৎস, জোড়া তৈরির পদ্ধতি এবং DPO (Direct Preference Optimization)-ভিত্তিক অপ্টিমাইজেশন লক্ষ্য। মূলত এটি নতুন অ্যালগরিদম উদ্ভাবন নয়, বরং একটি মানচিত্র — পাইপলাইনের কোন সিদ্ধান্ত সত্যিই ফলাফল বদলায় আর কোনটি প্রায় কিছুই দেয় না, তা বোঝার চেষ্টা।
NV-CER: যে মেট্রিক শব্দ আর হাসি দুটোই গুনে
কাজটির আলাদা একটি আবিষ্কার হলো NV-aware character error rate, বা NV-CER মেট্রিক। ভাবনাটি হলো, নন-ভার্বাল সন্নিবেশকে আর শব্দ (noise) হিসেবে না দেখে সাধারণ শব্দের সমান অধিকার দিয়ে বিবেচনা করা: NV-ট্যাগও একই রকম আউটপুট চিহ্ন হয়ে ওঠে, আর পিনয়িন-ভিত্তিক ওয়েটেড CER গণনা করা হয় সম্মিলিত বিষয়বস্তুর উপর — ভার্বাল ও নন-ভার্বাল উভয়ের।
এমন মেট্রিকের ব্যবহারিক তাৎপর্য নিয়ন্ত্রণযোগ্যতায়। যেহেতু নন-ভার্বাল অংশ এখন আলাদাভাবে মাপা যায়, তাই অপ্টিমাইজেশন অ্যালগরিদম নিজে না বদলেই এটিকে ইচ্ছেমতো কাঙ্ক্ষিত দিকে সরানো সম্ভব। এটি গুরুত্বপূর্ণ দিক: দলটি সচেতনভাবে নতুন আর্কিটেকচার উদ্ভাবন করছে না, বরং সমস্যাটি সঠিকভাবে উপস্থাপনের মাধ্যমে বিদ্যমান সরঞ্জাম থেকে আরও বেশি বের করে আনার পথ দেখাচ্ছে।
কীভাবে যাচাই করা হয়েছিল
পরীক্ষাগুলো চালানো হয়েছিল Emilia-NV ডেটাসেটে, পাশাপাশি NV-Bench-এর সম্প্রসারিত সংস্করণে — যা ১৮ ধরনের নন-ভার্বাল ভোকালাইজেশন কভার করে। এমন বৈচিত্র্য গুরুত্বপূর্ণ: হাসি, কাশি আর দীর্ঘশ্বাস একই ধরনের ঘটনা নয়, আর যে পদ্ধতি এক ধরনের জন্য কাজ করে, তা অন্য ধরনে গিয়ে ভেঙে পড়তে পারে।

মূল্যায়ন চালানো হয়েছিল একসঙ্গে তিনটি পথে: বস্তুনিষ্ঠ মেট্রিক, বড় ভাষা মডেলের মাধ্যমে বিচার এবং মানুষের মূল্যায়ন। তিনটি প্রমাণ-ধারার মিল একটি শক্তিশালী যুক্তি, কারণ স্বয়ংক্রিয় মেট্রিক আর মানুষের উপলব্ধির মধ্যে অমিলই সাধারণত এ ধরনের গবেষণা ভেস্তে দেয়।
ফলাফল কী দেখাল
প্রধান সিদ্ধান্ত: কনফিগারেশন গুরুত্বপূর্ণ, তবে সব নয়। বিভিন্ন ডিজাইন-বিকল্প একইসঙ্গে দুটি বিষয়ে ভিন্নভাবে প্রভাব ফেলে — মডেল কত ঘন ঘন ও কত স্বাভাবিকভাবে ভোকালাইজেশন বাস্তবায়ন করে, এবং সেই সঙ্গে আভিধানিক বিষয়বস্তু কতটা নির্ভুলভাবে সংরক্ষণ করে। এটি চিরচেনা সমঝোতা: অতিরিক্ত আক্রমণাত্মক অভিব্যক্তিমুখী সেটিং স্পষ্টতা নষ্ট করতে শুরু করে।
তবুও গবেষকেরা স্ট্যান্ডার্ড DPO-ভিত্তিক একটি কার্যকর কনফিগারেশন বেছে নিতে পেরেছেন — কোনো বিদেশি সংযোজন ছাড়াই। শুনতে বিনয়ী ফলাফল মনে হলেও বাস্তবে এটি চমকপ্রদ ফলের চেয়ে বেশি মূল্যবান: অর্থাৎ পদ্ধতিটি পুনরুৎপাদনযোগ্য এবং বিরল সম্পদের প্রয়োজন হয় না।
এর থেকে বাস্তব কাজে কী পাওয়া যায়
কাজটি অভিব্যক্তিপূর্ণ সিন্থেসিসের জন্য NV-aware পোস্ট-ট্রেনিংয়ের ব্যবহারিক সুপারিশের সংকলন হিসেবে উপস্থাপিত। এর থেকে যুক্তিসঙ্গতভাবে যে কয়েকটি সিদ্ধান্তে পৌঁছানো যায়:
- মেট্রিকই আচরণ নির্ধারণ করে। যতক্ষণ নন-ভার্বাল সন্নিবেশকে আলাদা মাপযোগ্য সত্তা হিসেবে চিহ্নিত না করা হয়, ততক্ষণ এই দিকে পদ্ধতিগতভাবে মডেলের উন্নতি করার উপায় থাকে না।
- অ্যালগরিদমের চেয়ে সংকেত বেশি গুরুত্বপূর্ণ। মূল বৈচিত্র্য হলো পছন্দ কোথা থেকে আসে আর জোড়া কীভাবে তৈরি হয় — অপ্টিমাইজার নির্বাচনে নয়।
- বিভিন্ন ধরনের NV — বিভিন্ন কাজ। হাসি আর দীর্ঘশ্বাস ভিন্ন নিয়মে চলে, আর গড় সূচকে মূল্যায়ন সম্ভবত কিছু লুকিয়ে রাখে।
- তিন স্তরের যাচাই বাধ্যতামূলক। বস্তুনিষ্ঠ, LLM- ও মানুষের মূল্যায়নের সম্মতি — ফলাফলের উপর আস্থার ন্যূনতম শর্ত।

বড় পরিসরে দেখলে, এই গল্পটি স্পিচ সিন্থেসিসে দৃষ্টিভঙ্গির পরিবর্তনের কথা বলে। আগে গুণমান মানে ছিল "সঠিকভাবে উচ্চারিত শব্দ"। এখন ক্রমশ প্রশ্ন হলো, সিস্টেমটি কি মানুষের মতো আচরণ করতে পারে: সঠিক মুহূর্তে চুপ থাকা, যেখানে собеседник হাসত সেখানে হেসে ফেলা। আর এমন আচরণের জন্য, গবেষণা যেমন দেখাচ্ছে, নতুন অ্যালগরিদমের চেয়ে সৎ মেট্রিক আর সঠিকভাবে সংগৃহীত পছন্দের সংকেত অনেক বেশি কাজে দেয়।



