لماذا تُعدّ "اللغة غير اللفظية" صداعًا منفصلًا لتخليق الكلام
النص المُنطوق لا يساوي الكلام الحيّ بعد. فالإنسان يتنهد عندما يتعب، ويضحك ضحكة مكتومة في لحظة محرجة، ويسعل ليملأ فراغًا في الحديث، وبدون هذه الشوائب يبدو حتى الإلقاء المتقن تمامًا وكأنه رسالة ردّ آلي. ولهذا السبب تحديدًا، يُعتبر توليد التلفظات غير اللفظية — NV، non-verbal vocalizations — منذ زمن طويل أحد مؤشرات التخليق "التعبيري" للكلام: فهو يفصل بين روبوت يقرأ من ورقة وبين صوت يستحق أن تُصدّقه.
تكمن الصعوبة في أن إدراج الضحك أمر غير معقّد تقنيًا، أما إدراجه في موضعه الصحيح فمسألة من رتبة أخرى. فالدقة المعجمية يمكن حسابها بالحروف والكلمات، أما ملاءمة تنهيدة أو ضحكة مكتومة في عبارة معينة فهي فئة ضبابية، يصعب تقنينها، وتكاد لا تخضع للتحقق الآلي. والمقاييس الكلاسيكية عديمة الفائدة هنا: فهي ستعاقب النموذج على صوت "زائد"، مع أن هذا الصوت تحديدًا هو ما جعل الجملة تبدو بشرية.
ما الذي يقترحه المؤلفون: تفضيلات بدلًا من تعليمات
يتناول العمل المعنون Preference Optimization for Non-Verbal Vocalization Synthesis (arXiv:2608.24163، مجموعة eess.AS، قُدّم في 25 أغسطس 2026) المسألة من زاوية التعلّم القائم على التفضيلات. فريق المؤلفين هو Haoyang Li وChenglin Xu وJunchuan Zhao وYuang Cao وLiumeng Xue وYiwen Guo وEng Siong Chng.
الفكرة الجوهرية بسيطة: بدلًا من كتابة قواعد يدوية تقول "الضحك مناسب هنا وغير مناسب هناك"، يمكن عرض أزواج من خيارات الأداء الصوتي على النموذج وإعطائه إشارة عن أيّها أفضل. لكن، كما يلاحظ الباحثون، لا تزال قابلية تطبيق هذا النهج على التلفظات غير اللفظية تحديدًا مدروسة بشكل ضعيف — فمن غير الواضح أي إشارات تفضيل ينبغي جمعها، وكيف تُبنى الأزواج، وما هدف التحسين الذي ينبغي وضعه.

أجرى المؤلفون دراسة منهجية على ثلاثة محاور في آن واحد: مصادر إشارات التفضيل، وطرق بناء الأزواج، وأهداف التحسين القائمة على DPO (Direct Preference Optimization). في جوهره، هذا ليس اختراعًا لخوارزمية جديدة، بل خريطة للمجال — محاولة لفهم أي القرارات في خط المعالجة تُغيّر النتيجة فعلًا، وأيّها لا تكاد تقدّم شيئًا.
NV-CER: مقياس يحسب الكلمات والضحك معًا
من الاكتشافات المنفصلة في العمل مقياس NV-aware character error rate، أو NV-CER. الفكرة هي التوقف عن اعتبار الإدراجات غير اللفظية ضوضاء والتعامل معها على قدم المساواة مع الكلمات العادية: فوسوم NV تصبح رموز خرج كأي رمز آخر، ويُحسب مقياس CER المرجّح القائم على البينيين على المحتوى الموحّد — اللفظي وغير اللفظي معًا.
المعنى العملي لهذا المقياس يكمن في قابلية التحكم. فبما أن الجزء غير اللفظي أصبح قابلًا للقياس بشكل منفصل، يمكن تحريكه بشكل موجّه في الاتجاه المطلوب دون إعادة كتابة خوارزمية التحسين نفسها. وهذه نقطة مهمة: فالفريق يتجنب عن قصد اختراع بنية جديدة، ويكتفي بإظهار كيفية استخراج المزيد من الأدوات الموجودة عبر صياغة المسألة بشكل صحيح.
كيف جرى التحقق من ذلك
أُجريت التجارب على مجموعة بيانات Emilia-NV، وكذلك على نسخة موسّعة من NV-Bench — وهي مجموعة تغطي 18 نوعًا مختلفًا من التلفظات غير اللفظية. هذا التنوع مهم: فالضحك والسعال والتنهيدة ليست ظاهرة واحدة، والطريقة التي تنجح مع نوع واحد قد تنهار تمامًا مع نوع آخر.

تم التقييم عبر ثلاث قنوات في آن واحد: مقاييس موضوعية، وتحكيم بمساعدة نموذج لغوي كبير، وتقييم بشري. وتوافق هذه الخطوط الثلاثة من الأدلة حجة قوية، لأن التناقضات بين المقاييس الآلية والإدراك البشري هي تحديدًا ما يُقوّض أبحاثًا كهذه عادةً.
ما الذي أظهرته النتائج
الاستنتاج الرئيسي: الإعداد مهم، لكن ليس أي إعداد. فخيارات التصميم المختلفة تؤثر بطرق متفاوتة على أمرين في آن واحد — على مدى تكرار النموذج لتلفظاته ومدى طبيعيتها، وعلى مدى دقته في الحفاظ على المحتوى المعجمي في الوقت نفسه. وهذه مقايضة كلاسيكية: فالضبط المفرط في التعبيرية يبدأ في إفساد الوضوح.
ومع ذلك، تمكّن الباحثون من اختيار إعداد فعّال قائم على DPO قياسي — دون إضافات غريبة. يبدو هذا نتيجة متواضعة، لكنه عمليًا أثمن من نتيجة مبهرة: فهو يعني أن الطريقة قابلة للتكرار ولا تتطلب موارد نادرة.
ما الذي يترتب على ذلك عمليًا
صيغ العمل كمجموعة توصيات عملية للتدريب اللاحق المراعي لـ NV في التخليق التعبيري للكلام. وفيما يلي بعض الاستنتاجات التي تنسجم منطقيًا معه:
- المقياس يحدد السلوك. فما لم تُفصل الإدراجات غير اللفظية ككيان قابل للقياس بذاته، لا يملك النموذج ما يحسّنه بشكل منهجي في هذا الاتجاه.
- الإشارة أهم من الخوارزمية. فالتباين الأساسي يكمن في مصدر التفضيلات وكيفية بناء الأزواج، لا في اختيار المُحسِّن.
- أنواع NV المختلفة مهام مختلفة. فالضحك والتنهيدة يخضعان لقواعد غير متشابهة، والتقييم بمؤشر متوسط يُرجّح أنه يخفي شيئًا ما.
- التحقق الثلاثي ضروري. فتوافق التقييمات الموضوعية وتقييمات النموذج اللغوي الكبير والتقييمات البشرية هو الحد الأدنى للثقة بالنتيجة.

وإذا نظرنا على نطاق أوسع، فهذه القصة تتعلق بتغيّر المنظور في تخليق الكلام. فسابقًا كان الجودة تعني "كلمات مُنطوقة بشكل صحيح". أما الآن فالحديث يتجه أكثر فأكثر إلى ما إذا كانت المنظومة قادرة على التصرف كإنسان: أن تصمت في اللحظة المناسبة، وأن تضحك ضحكة مكتومة حيث كان سيفعل ذلك محدّثها. ولهذا السلوك، كما تُظهر الدراسة، ليس خوارزمية جديدة هي الأنفع بكثير، بل مقياس صادق وإشارة تفضيل مجموعة بشكل صحيح.



