Почему «невербалка» — отдельная головная боль для синтеза речи
Озвученный текст ещё не равен живой речи. Человек вздыхает, когда устал, прыскает смехом в неловкий момент, покашливает, чтобы заполнить паузу, и без этих вкраплений даже безупречная дикция звучит как автоответчик. Именно поэтому генерация невербальных вокализаций — NV, non-verbal vocalizations — давно считается одним из маркеров «выразительного» синтеза речи: она отделяет робота, читающего по бумажке, от голоса, которому хочется верить.
Сложность в том, что вставить смех технически несложно, а вот вставить его к месту — задача другого порядка. Лексическую точность можно посчитать по символам и словам, а уместность вздоха или усмешки в конкретной фразе — категория размытая, плохо формализуемая и почти не поддающаяся автоматической проверке. Классические метрики тут бесполезны: они накажут модель за «лишний» звук, хотя именно этот звук и делал реплику человеческой.
Что предлагают авторы: предпочтения вместо инструкций
Работа под названием Preference Optimization for Non-Verbal Vocalization Synthesis (arXiv:2608.24163, подборка eess.AS, подана 25 августа 2026 года) подходит к вопросу со стороны обучения на предпочтениях. Авторский коллектив — Haoyang Li, Chenglin Xu, Junchuan Zhao, Yuang Cao, Liumeng Xue, Yiwen Guo и Eng Siong Chng.
Ключевая мысль проста: вместо того чтобы вручную прописывать правила «смех здесь уместен, а здесь нет», можно показать модели пары вариантов озвучки и дать ей сигнал, какой из них лучше. Но, как отмечают исследователи, применимость такого подхода именно к невербальным вокализациям до сих пор изучена слабо — непонятно, какие сигналы предпочтений собирать, как формировать пары и какую цель оптимизации ставить.

Авторы провели систематическое исследование сразу по трём осям: источники сигналов предпочтений, способы построения пар и цели оптимизации на базе DPO (Direct Preference Optimization). По сути, это не изобретение нового алгоритма, а карта местности — попытка понять, какие решения в пайплайне действительно меняют результат, а какие почти ничего не дают.
NV-CER: метрика, которая считает и слова, и смех
Отдельная находка работы — метрика NV-aware character error rate, или NV-CER. Идея в том, чтобы перестать рассматривать невербальные вставки как шум и обращаться с ними на равных правах с обычными словами: NV-теги становятся такими же выходными символами, а взвешенная CER на основе пиньиня считается по объединённому содержимому — и вербальному, и невербальному.
Практический смысл такой метрики в управляемости. Поскольку невербальная часть теперь измерима отдельно, её можно целенаправленно двигать в нужную сторону, не переписывая сам алгоритм оптимизации. Это важный момент: команда сознательно не изобретает новую архитектуру, а показывает, как выжать больше из уже существующих инструментов за счёт правильной постановки задачи.
Как это проверяли
Эксперименты ставились на датасете Emilia-NV, а также на расширенной версии NV-Bench — наборе, который покрывает 18 различных типов невербальных вокализаций. Такой разброс важен: смех, кашель и вздох — это не одно и то же явление, и метод, который работает для одного типа, вполне может развалиться на другом.

Оценка велась сразу по трём каналам: объективные метрики, судейство с помощью большой языковой модели и оценка людьми. Совпадение всех трёх линий доказательств — сильный аргумент, потому что именно расхождения между автоматическими метриками и человеческим восприятием обычно и разрушают подобные исследования.
Что показали результаты
Главный вывод: конфигурация имеет значение, но не любая. Разные варианты дизайна по-разному влияют на две вещи одновременно — на то, как часто и насколько естественно модель реализует вокализации, и на то, насколько точно она при этом сохраняет лексическое содержание. Это классический компромисс: слишком агрессивная настройка на выразительность начинает портить разборчивость.
При этом исследователям удалось подобрать эффективную конфигурацию на базе стандартного DPO — без экзотических надстроек. Звучит как скромный результат, но на практике он ценнее эффектного: значит, метод воспроизводим и не требует редких ресурсов.
Что из этого следует для практики
Работа формулируется как набор практических рекомендаций по NV-aware пост-обучению для выразительного синтеза. Несколько выводов, которые из неё логично вытекают:
- Метрика определяет поведение. Пока невербальные вставки не выделены в отдельную измеримую сущность, модель нечем системно улучшать в этом направлении.
- Сигнал важнее алгоритма. Основная вариативность — в том, откуда берутся предпочтения и как строятся пары, а не в выборе оптимизатора.
- Разные типы NV — разные задачи. Смех и вздох живут по несхожим правилам, и оценка по усреднённому показателю, скорее всего, что-то скрывает.
- Тройная проверка обязательна. Согласие объективных, LLM- и человеческих оценок — минимальное условие доверия к результату.

Если смотреть шире, эта история — про смену оптики в синтезе речи. Раньше качество означало «правильно произнесённые слова». Теперь всё чаще речь идёт о том, умеет ли система вести себя как человек: молчать в нужный момент, усмехнуться там, где усмехнулся бы собеседник. И для такого поведения, как показывает исследование, гораздо полезнее не новый алгоритм, а честная метрика и правильно собранный сигнал предпочтений.



