Qwen3.8-LiveTranslate 处理语音的平均延迟为 2.3 秒

30 九月 202610 视图

基于 Interleave 架构的模型可识别 60 种语言、以 29 种语言进行语音合成,并支持对话中的实时翻译。本文介绍如何降低平均延迟、按说话者区分语句、双语输出,以及通过 Alibaba Cloud 和 QwenCloud API 进行访问。

Qwen3.8-LiveTranslate 处理语音的平均延迟为 2.3 秒

语音流中的翻译延迟

Qwen3.8-LiveTranslate 会聆听对话者说话,并在对方讲话时以文本和语音形式输出翻译。平均延迟通过 LAAL 指标评估:该指标显示翻译比原始语音滞后多少。

LAAL 指标数值
之前2.8 秒
现在2.3 秒
变化减少约 18%

据 Qwen 称,新的 Interleave 架构还能提高语义传达的准确性、流畅度和简洁性。实际选择标准是:是否需要在对话者说完之前就获得翻译。

输入与输出

Qwen3.8-LiveTranslate 接受音频和可选图像。视频帧可以与语音一同传入。

模型会输出文本和音频。因此,它适用于同时需要书面翻译和语音播报的场景。

语言与对话功能

Qwen3.8-LiveTranslate 能理解 60 种语言,并能以其中 29 种语言进行语音播报。其余 31 种语言仅支持文本翻译。

模型能够识别多方对话中的不同说话者,并保留他们的声音。它还会同步显示原文和译文,并利用对话历史确保姓名和术语的翻译一致。

选择标准是:所需的语言对是否支持语音播报,以及是否需要处理多位说话者。

接入方式

Qwen3.8-LiveTranslate 可通过 Alibaba Cloud Model Studio 和 QwenCloud 上的 WebSocket Realtime API 使用。模型 ID 为 qwen3.8-livetranslate-flash-realtime。

如果集成需要使用 WebSocket Realtime API 和上述服务之一,可以考虑该模型。来源资料未说明在这些平台之外的接入能力。

常问问题

Qwen3.8-LiveTranslate 处理语音的平均延迟为 2.3 秒