Qwen3.8-LiveTranslate traite la parole avec une latence moyenne de 2,3 secondes

30 septembre 202610 vues

Le modèle basé sur l’architecture Interleave reconnaît 60 langues, en prononce 29 et prend en charge la traduction en temps réel pendant une conversation. L’article aborde la réduction du décalage moyen, la séparation des répliques selon les voix, la sortie bilingue et l’accès via les API d’Alibaba Cloud et de QwenCloud.

Qwen3.8-LiveTranslate traite la parole avec une latence moyenne de 2,3 secondes

Latence de traduction en flux de parole

Qwen3.8-LiveTranslate écoute l’interlocuteur et fournit une traduction écrite et orale pendant qu’il parle. Le délai moyen est évalué à l’aide de la métrique LAAL, qui indique le retard de la traduction par rapport à la parole source.

Indicateur LAALValeur
Auparavant2,8 secondes
Maintenant2,3 secondes
Évolutionenviron 18 % de moins

Selon Qwen, la nouvelle architecture Interleave améliore également la fidélité du sens, la fluidité et la concision de la traduction. Un critère pratique de choix consiste à déterminer s’il est important de recevoir la traduction avant que l’interlocuteur ait fini de parler.

Entrées et résultats

Qwen3.8-LiveTranslate accepte de l’audio et des images facultatives. Des images vidéo peuvent être transmises en même temps que la parole.

En sortie, le modèle génère du texte et de l’audio. Son format convient donc aux scénarios qui nécessitent à la fois une traduction écrite et une version parlée.

Langues et fonctionnalités de conversation

Qwen3.8-LiveTranslate comprend 60 langues et peut en restituer 29 à l’oral. Pour les 31 autres, seule la traduction écrite est disponible.

Le modèle reconnaît les différents locuteurs dans les conversations à plusieurs et préserve leurs voix. Il affiche également le texte source et la traduction de manière synchronisée, et s’appuie sur l’historique de la conversation pour traduire les noms et les termes de façon cohérente.

Le critère de choix consiste à vérifier si la paire de langues souhaitée prend en charge la restitution orale et si la gestion de plusieurs locuteurs est nécessaire.

Connexion

Qwen3.8-LiveTranslate est disponible via l’API WebSocket Realtime sur Alibaba Cloud Model Studio et QwenCloud. L’identifiant du modèle est qwen3.8-livetranslate-flash-realtime.

Ce modèle est à envisager si l’intégration doit utiliser l’API WebSocket Realtime et l’un de ces services. Les sources ne décrivent pas les possibilités de connexion en dehors des plateformes indiquées.

Foire aux questions

Matériaux connexes

Tous matériaux
Qwen3.8-LiveTranslate traite la parole avec une latence moyenne de 2,3 secondes