Qwen3.8-LiveTranslate processa a fala com um atraso médio de 2,3 segundos

30 setembro 202610 visualizações

O modelo baseado na arquitetura Interleave reconhece 60 idiomas, gera fala em 29 e oferece tradução durante a conversa. O artigo aborda a redução do atraso médio, a separação das falas por voz, a saída bilingue e o acesso através das APIs da Alibaba Cloud e da QwenCloud.

Qwen3.8-LiveTranslate processa a fala com um atraso médio de 2,3 segundos

Atraso da tradução durante a fala

Qwen3.8-LiveTranslate ouve o interlocutor e apresenta a tradução em texto e em voz enquanto ele fala. O atraso médio é avaliado pela métrica LAAL, que indica quanto a tradução fica atrás da fala original.

Indicador LAALValor
Antes2,8 segundos
Agora2,3 segundos
Variaçãocerca de 18% menos

Segundo a Qwen, a nova arquitetura Interleave também melhora a precisão na transmissão do sentido, a fluência e a concisão da tradução. Um critério prático de escolha é saber se é importante obter a tradução antes de o interlocutor terminar de falar.

Dados de entrada e resultados

Qwen3.8-LiveTranslate aceita áudio e imagens opcionais. É possível transmitir fotogramas de vídeo juntamente com a fala.

Como resultado, o modelo gera texto e áudio. Por isso, o seu formato é adequado a cenários que exigem simultaneamente uma tradução escrita e fala sintetizada.

Idiomas e funcionalidades de conversação

Qwen3.8-LiveTranslate compreende 60 idiomas e pode reproduzir em voz 29 deles. Para os outros 31, está disponível apenas a tradução em texto.

O modelo reconhece diferentes interlocutores em conversas com vários participantes e preserva as respetivas vozes. Também apresenta o texto original e a tradução de forma sincronizada e utiliza o histórico da conversa para traduzir nomes e termos de forma consistente.

Um critério de escolha é saber se o par de idiomas pretendido suporta a reprodução em voz e se é necessário trabalhar com vários interlocutores.

Ligação

Qwen3.8-LiveTranslate está disponível através da WebSocket Realtime API no Alibaba Cloud Model Studio e no QwenCloud. O identificador do modelo é qwen3.8-livetranslate-flash-realtime.

Vale a pena considerar o modelo se a integração tiver de utilizar a WebSocket Realtime API e um destes serviços. As fontes não descrevem opções de ligação fora das plataformas indicadas.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Qwen3.8-LiveTranslate processa a fala com um atraso médio de 2,3 segundos