语音流中的翻译延迟
Qwen3.8-LiveTranslate 会聆听对话者说话,并在对方讲话时以文本和语音形式输出翻译。平均延迟通过 LAAL 指标评估:该指标显示翻译比原始语音滞后多少。
| LAAL 指标 | 数值 |
|---|---|
| 之前 | 2.8 秒 |
| 现在 | 2.3 秒 |
| 变化 | 减少约 18% |
据 Qwen 称,新的 Interleave 架构还能提高语义传达的准确性、流畅度和简洁性。实际选择标准是:是否需要在对话者说完之前就获得翻译。
输入与输出
Qwen3.8-LiveTranslate 接受音频和可选图像。视频帧可以与语音一同传入。

模型会输出文本和音频。因此,它适用于同时需要书面翻译和语音播报的场景。
语言与对话功能
Qwen3.8-LiveTranslate 能理解 60 种语言,并能以其中 29 种语言进行语音播报。其余 31 种语言仅支持文本翻译。
模型能够识别多方对话中的不同说话者,并保留他们的声音。它还会同步显示原文和译文,并利用对话历史确保姓名和术语的翻译一致。
选择标准是:所需的语言对是否支持语音播报,以及是否需要处理多位说话者。
接入方式
Qwen3.8-LiveTranslate 可通过 Alibaba Cloud Model Studio 和 QwenCloud 上的 WebSocket Realtime API 使用。模型 ID 为 qwen3.8-livetranslate-flash-realtime。
如果集成需要使用 WebSocket Realtime API 和上述服务之一,可以考虑该模型。来源资料未说明在这些平台之外的接入能力。



