NVIDIA Magpie TTS:开源多语种语音代理,具有超低潜伏性

21 八月 202611 视图

NVIDIA的一个新的开放量子模型支持12种语言,并允许您在自己的硬件上部署语音合成. 由于优化推论,第一个音频在B200加速器上仅以32ms出现,使得自然实时对话成为可能.

NVIDIA Magpie TTS:开源多语种语音代理,具有超低潜伏性

在语音代理世界中,潜伏是主要货币. 用户等待回复时,助理执行三项任务:识别语音,思考答案,合成语音回复. 如果每个阶段消耗几十毫秒,对话就不再有活力. 2026年8月宣布的近期NVIDIA发布显示,语音合成不再是瓶颈:NVIDIA Magpie TTS模型在顶级加速器上以32毫秒的速度提供第一个音频帧,并说12种语言.

模式是什么,为什么重要

NVIDIA Magpie TTS是一个开放的文本对语音系统,有3.64亿个参数. 这不仅仅是一个研究检查点:为了生产,NVIDIA提供NVIDIA NIM服务堆,这可以让你在自己的服务器上部署多语种合成——你公司的数据生活的地方.

目前版本支持12种语言:英语,西班牙语,法语,德语,意大利语,越南语,普通话,印地语,日语,外加3种新增语言——阿拉伯语,韩语,巴西葡萄牙语. 现有语言也进行了升级:更新了培训数据并完善了模型,因此语音质量在不改变结构的情况下得到了提高.

一个有趣的细节: 声音的结构不是每个语言作为单独的实体,而是 作为发言者的共同多语种代表。 一个"演说者"可以说所有支持的语言,每种语言都有男女的变体. 这对于多个区域需要单一品牌声音的产品来说是方便的.

代码转换——当一个发言者在一个短语内在语言之间交换时——值得特别提及。 对印地语和日语来说,这种支持得到了扩大:使用了基于IPA的石墨对手机转换器和可自定义的发音词典.

短暂性:是什么原因

出版的材料包括使用NVIDIA NIM对NVIDIA自己的GPU进行性能测量. 关键度量衡是TTFA(从请求到第一音频的时间)和RTFX(模型生成速度比实时快多少倍). 数据平均为3次运行.

加速器专题信托基金,1组RTFX, 1 组专题信托基金,64个流RTFX, 64 个流流
NVIDIA B200 (英语).32分钟12.1× (中文(简体) ).239分钟319.81× (法语).
NVIDIA H100 (英语).47分钟14.7× (中文(简体) ).275分钟290.79x (英语).
DGX 闪光53分钟9.8× (韩语).962分钟75.88× (中文(简体) ).
NVIDIA A100 (英语).79分钟12.2× (中文(简体) ).395分钟197x (英语).

这些数字在实践中意味着什么。

  • 一次谈话。 在单流上,根据GPU的不同,第一批音频会以32–79 ms的速度到达. 就自然对话而言,建议的端到端长期预算约为200毫秒。 语音识别和语言模型也需要时间,但当TTS在32 ms(如B200)内合用时,合成几乎不会影响总体情况——其余的预算可以分配给ASR和LLM.
  • 许多平行的对话。 B200上有64条并行流,第一次音频的时间会增长到239ms,但吞吐量会达到约320×实时. 换句话说,模型合成一分钟的语音比它演奏的速度快数百倍——一个单一的服务器可以处理整个呼叫中心.

一个重要的细微差别:有一个重量相同的检查站。 Hugging Face ——意在研究和细化. 然而,测量指的是通过NVIDIA NIM的部署,即优化生产堆栈. 如果你需要可预测的耐久 负载,NIM是 你应该依赖。

模型怎么这么快

速度是两个建筑变化的结果.

  • 框架堆叠。 解码器现在预测每个步骤有两个音频帧而不是一个. 解码器迭代数减半,这意味着每个语音段的计算工作的一半.
  • 本地变压器. 关注机制与地方环境而不是整个序列同时发挥作用。 这降低了长音频的计算复杂性,加快了推论. 尽管如此,作者对这部分建筑的细节描述相当细微.

这些变化加在一起使数十毫秒的耐久性甚至保持在相对负担得起的硬件上.

叠加而不是黑匣子

语音产品的开发者经常得到综合语音模型:一个API呼叫,你得到识别,合成,甚至模型的反应. 它看起来很简单,但是这个方法有一个缺点: 你不能将一个组件换成另一个组件, 微调一个单层, 满足数据存储要求, 或者甚至知道哪里有延迟。

级联结构——语音识别(ASR)、语言模型(LLM)和合成(TTS) )作为单独的服务工作——解决这些问题. 每个层可以独立配置,更新和缩放. NVIDIA Magpie TTS的开放权重及其作为NVIDIA NIM容器的可用性使得这种方法变得现实:您在您的数据旁边部署合成器,并在不拨打外部API的情况下获得可预测的耐久性.

在何处适用

快速多语种、有当地部署选择的TTS可带来实际价值的几种情况:

  • 客户支持语音代理 - 特别是在多个国家开展业务的国家;
  • 医疗助理数据隐私至关重要;
  • 企业副驾驶 纳入公司工作流程;
  • 翻译系统 需要语音输出而不是文本;
  • 对话AI 应用程序 耐久性直接影响到用户体验。

所有这些使用案例的共同标准是部署要求:数据绝不能离开组织的周边,发音和声音必须适应产品,负载下的行为必须始终是可预测的。 这正是新的NVIDIA Magpie TTS发布地址:一个开放模式,先进的多语种支持,最小的耐久性,以及不依赖管理下的云服务.

常问问题

NVIDIA Magpie TTS:多语种神经网络概况