Pourquoi les « non-verbaux » sont un casse-tête à part entière pour la synthèse vocale
Un texte lu à voix haute n'est pas encore de la parole vivante. Une personne soupire quand elle est fatiguée, pouffe de rire dans un moment gênant, toussote pour combler un silence, et sans ces interjections, même une diction impeccable sonne comme un répondeur. C'est précisément pourquoi la génération de vocalisations non verbales — NV, non-verbal vocalizations — est depuis longtemps considérée comme l'un des marqueurs d'une synthèse vocale « expressive » : elle sépare le robot qui lit sur un papier de la voix à laquelle on a envie de croire.
La difficulté, c'est qu'insérer un rire est techniquement simple, mais l'insérer au bon endroit relève d'un tout autre ordre. La précision lexicale se mesure en caractères et en mots, tandis que la pertinence d'un soupir ou d'un ricanement dans une phrase donnée est une catégorie floue, difficilement formalisable et presque impossible à vérifier automatiquement. Les métriques classiques sont ici inutiles : elles pénaliseront le modèle pour un son « superflu », alors que c'est justement ce son qui rendait la réplique humaine.
Ce que proposent les auteurs : des préférences plutôt que des instructions
Le travail intitulé Preference Optimization for Non-Verbal Vocalization Synthesis (arXiv:2608.24163, rubrique eess.AS, soumis le 25 août 2026) aborde la question sous l'angle de l'apprentissage par préférences. Le collectif d'auteurs réunit Haoyang Li, Chenglin Xu, Junchuan Zhao, Yuang Cao, Liumeng Xue, Yiwen Guo et Eng Siong Chng.
L'idée clé est simple : au lieu de définir manuellement des règles du type « un rire est approprié ici, mais pas là », on peut montrer au modèle des paires de variantes de lecture et lui donner un signal indiquant laquelle est la meilleure. Mais, comme le notent les chercheurs, l'applicabilité de cette approche précisément aux vocalisations non verbales reste peu étudiée — on ne sait pas quels signaux de préférence collecter, comment former les paires ni quel objectif d'optimisation fixer.

Les auteurs ont mené une étude systématique selon trois axes à la fois : les sources de signaux de préférence, les méthodes de construction des paires et les objectifs d'optimisation fondés sur DPO (Direct Preference Optimization). En substance, il ne s'agit pas d'inventer un nouvel algorithme, mais de dresser une carte du terrain — tenter de comprendre quelles décisions dans le pipeline changent réellement le résultat et lesquelles n'apportent presque rien.
NV-CER : une métrique qui compte à la fois les mots et le rire
Une trouvaille à part entière de ce travail est la métrique NV-aware character error rate, ou NV-CER. L'idée est de cesser de considérer les insertions non verbales comme du bruit et de les traiter à égalité avec les mots ordinaires : les balises NV deviennent des symboles de sortie comme les autres, et un CER pondéré fondé sur le pinyin est calculé sur le contenu combiné — à la fois verbal et non verbal.
L'intérêt pratique d'une telle métrique réside dans la contrôlabilité. Comme la partie non verbale est désormais mesurable séparément, on peut la faire évoluer délibérément dans la direction souhaitée sans réécrire l'algorithme d'optimisation lui-même. C'est un point important : l'équipe n'invente délibérément pas une nouvelle architecture, mais montre comment tirer davantage des outils existants grâce à une bonne formulation du problème.
Comment cela a été vérifié
Les expériences ont été menées sur le jeu de données Emilia-NV, ainsi que sur une version étendue de NV-Bench — un ensemble couvrant 18 types différents de vocalisations non verbales. Cette diversité est importante : le rire, la toux et le soupir ne sont pas un même phénomène, et une méthode qui fonctionne pour un type peut très bien s'effondrer sur un autre.

L'évaluation s'est faite selon trois canaux à la fois : des métriques objectives, un jugement à l'aide d'un grand modèle de langage et une évaluation humaine. La convergence de ces trois lignes de preuves est un argument solide, car ce sont justement les divergences entre métriques automatiques et perception humaine qui ruinent habituellement ce genre d'études.
Ce qu'ont montré les résultats
Conclusion principale : la configuration compte, mais pas n'importe laquelle. Les différentes variantes de conception influent différemment sur deux choses à la fois — la fréquence et le naturel avec lesquels le modèle réalise les vocalisations, et la précision avec laquelle il préserve le contenu lexical. C'est un compromis classique : un réglage trop agressif sur l'expressivité finit par nuire à l'intelligibilité.
Les chercheurs ont néanmoins réussi à identifier une configuration efficace fondée sur un DPO standard — sans surcouches exotiques. Cela peut sembler un résultat modeste, mais en pratique il est plus précieux qu'un résultat spectaculaire : cela signifie que la méthode est reproductible et ne nécessite pas de ressources rares.
Ce qu'il en découle pour la pratique
Le travail se présente comme un ensemble de recommandations pratiques pour un post-apprentissage NV-aware destiné à la synthèse expressive. Quelques conclusions qui en découlent logiquement :
- La métrique détermine le comportement. Tant que les insertions non verbales ne sont pas isolées en une entité mesurable distincte, le modèle n'a rien pour s'améliorer systématiquement dans cette direction.
- Le signal importe plus que l'algorithme. La variabilité principale réside dans l'origine des préférences et la construction des paires, non dans le choix de l'optimiseur.
- Différents types de NV, différents problèmes. Le rire et le soupir obéissent à des règles dissemblables, et une évaluation sur un indicateur moyenné dissimule probablement quelque chose.
- La triple vérification est indispensable. La concordance des évaluations objectives, LLM et humaines est la condition minimale de confiance dans le résultat.

Vu plus largement, cette histoire illustre un changement d'optique dans la synthèse vocale. Auparavant, la qualité signifiait « des mots correctement prononcés ». Aujourd'hui, il s'agit de plus en plus de savoir si le système sait se comporter comme un humain : se taire au bon moment, esquisser un sourire là où l'interlocuteur l'aurait fait. Et pour un tel comportement, comme le montre cette étude, un nouvel algorithme est bien moins utile qu'une métrique honnête et un signal de préférence correctement collecté.



