语音合成中的笑声与叹息:偏好调优如何让TTS在恰当之处发出声音

19 九月 202616 视图

新研究剖析了偏好优化流程中究竟是什么决定了TTS非语言发声的质量:从反馈信号的收集到DPO配对与目标的构建。作者提出了NV-CER指标,将发声标签视为独立字符,并在Emilia-NV以及涵盖18种声音类型的扩展版NV-Bench上验证了各种配置。

语音合成中的笑声与叹息:偏好调优如何让TTS在恰当之处发出声音

为什么“非语言声音”是语音合成中一个单独的难题

朗读出来的文本并不等于鲜活的言语。人累了会叹气,在尴尬的时刻会噗嗤一笑,会轻咳一声来填补停顿,而如果没有这些点缀,即使无可挑剔的咬字听起来也像自动答录机。正因如此,非语言发声的生成——NV,即 non-verbal vocalizations——长期以来被视为“富有表现力”的语音合成的标志之一:它把照本宣科的机器人,与一个让人愿意相信的声音区分开来。

难点在于,插入笑声在技术上并不难,但要把它插到恰当的位置——则是另一个量级的问题。词汇层面的准确性可以按字符和词来统计,而一声叹息或一声轻笑在具体语句中是否恰当,却是一个模糊、难以形式化、几乎无法自动检验的范畴。经典指标在这里毫无用处:它们会因为一个“多余”的声音而惩罚模型,尽管正是这个声音让这句话变得像人说的。

作者提出了什么:用偏好代替指令

这篇名为 Preference Optimization for Non-Verbal Vocalization Synthesis 的研究(arXiv:2608.24163,eess.AS 分类,2026 年 8 月 25 日提交)从偏好学习的角度切入这一问题。作者团队包括 Haoyang Li、Chenglin Xu、Junchuan Zhao、Yuang Cao、Liumeng Xue、Yiwen Guo 和 Eng Siong Chng。

核心思路很简单:与其手动规定“这里适合笑,那里不适合”的规则,不如给模型展示成对的配音方案,并告诉它哪一个更好。但正如研究者所指出的,这种方法在非语言发声上的适用性至今研究甚少——不清楚该收集哪些偏好信号、如何构建配对,以及该设定什么样的优化目标。

作者围绕三条轴线展开了系统性研究:偏好信号的来源、配对构建的方式,以及基于 DPO(Direct Preference Optimization)的优化目标。本质上,这不是发明新算法,而是一张地形图——试图弄清流程中哪些决策真正改变了结果,哪些几乎毫无作用。

NV-CER:一个既统计词、也统计笑声的指标

这项工作的另一个发现是 NV-aware character error rate,即 NV-CER 指标。其思路是不再把非语言插入当作噪声,而是让它们与普通词享有同等地位:NV 标签成为同样的输出符号,而基于拼音的加权 CER 则按合并后的内容——包括语言内容和非语言内容——来计算。

这种指标的实践意义在于可控性。由于非语言部分现在可以被单独度量,就可以有针对性地把它推向想要的方向,而无需重写优化算法本身。这一点很重要:团队有意不去发明新架构,而是展示如何通过正确地设定任务,从现有工具中榨取更多价值。

如何验证

实验在 Emilia-NV 数据集以及扩展版 NV-Bench 上进行——后者覆盖了 18 种不同类型的非语言发声。这种多样性很重要:笑声、咳嗽和叹息并不是同一种现象,对某一类型有效的方法,很可能在另一类型上彻底失效。

评估同时通过三条渠道进行:客观指标、大语言模型评判以及人工评估。三条证据线的一致是有力论据,因为正是自动指标与人类感知之间的分歧,通常会让这类研究功亏一篑。

结果说明了什么

主要结论是:配置很重要,但不是随便什么配置都重要。不同的设计选择会同时以不同方式影响两件事——模型实现发声的频率与自然程度,以及它在此过程中保留词汇内容的准确程度。这是一个经典的权衡:过于激进地追求表现力,就会开始损害清晰度。

与此同时,研究者成功找到了一种基于标准 DPO 的有效配置——没有任何奇特的附加组件。听起来像是个不起眼的成果,但在实践中它比炫目的成果更有价值:这意味着该方法可复现,且不需要稀缺资源。

这对实践意味着什么

这项工作被表述为一套面向富有表现力语音合成的 NV-aware 后训练实践建议。由此可以顺理成章地得出几点结论:

  • 指标决定行为。 只要非语言插入没有被划为单独可度量的实体,模型在这个方向上就没有可系统性改进的依据。
  • 信号比算法更重要。 主要的变异性在于偏好从何而来、配对如何构建,而不在于优化器的选择。
  • 不同类型的 NV 是不同的任务。 笑声和叹息遵循着并不相似的规则,而按平均指标来评估,很可能掩盖了一些东西。
  • 三重检验必不可少。 客观评估、LLM 评估与人工评估的一致,是信任结果的最低条件。

从更宏观的角度看,这件事关乎语音合成视角的转变。过去,质量意味着“把词念对”。如今,人们越来越多地谈论的是系统能否像人一样行事:在恰当的时刻沉默,在对话者会轻笑的地方轻笑。而正如这项研究所表明的,对于这样的行为,比起新算法,一个诚实的指标和一份正确收集的偏好信号要有用得多。

常问问题

语音合成中的笑声与叹息:偏好调优如何让TTS在恰当之处发出声音