Granite Speech 5.0 Turbo CTC: transcrição ultrarrápida com precisão de até 4,85% WER

10 setembro 20262 visualizações

A IBM lançou dois modelos Granite Speech 5.0 Turbo CTC (com 470 milhões de parâmetros cada). No acelerador H200, eles transcrevem mais de 210 minutos de áudio por segundo e alcançam WER de 4,85–5,00% em testes abertos em inglês; o design encoder-only é voltado para operação em dispositivos de borda.

Granite Speech 5.0 Turbo CTC: transcrição ultrarrápida com precisão de até 4,85% WER

Modelos compactos para transcrição rápida

No final de agosto de 2026, a IBM apresentou dois novos modelos de reconhecimento de fala com 470 milhões de parâmetros cada — granite-speech-5.0-470m-turboctc e granite-speech-5.0-470m-turboctc-nc. Ambas as variantes são compactas e voltadas para speech-to-text local. A versão -nc, treinada em um conjunto de dados expandido, é distribuída sob a licença CC-BY-NC-SA-4.0, enquanto a versão padrão é distribuída sob Apache 2.0. A escolha da licença está diretamente relacionada aos dados: a versão livre usa menos fontes, por isso é mais fácil integrá-la em produtos comerciais.

Velocidade: mais de 3,5 horas por segundo

No acelerador NVIDIA H200, os modelos apresentam desempenho superior a 12.600 RTFx. Com processamento em lote, isso é suficiente para converter em texto mais de três horas e meia de fala em um segundo. Esse resultado é garantido pela nova arquitetura e pela redução da taxa de saída. Para avaliar rapidamente o funcionamento do modelo, a IBM preparou uma demonstração em streaming via WebGPU: ela roda diretamente no navegador, mas apenas Chrome e Edge são suportados. A demo mostra como o sistema reconhece a fala conforme o áudio chega.

O que dizem os leaderboards

De acordo com os dados do OpenASR Leaderboard, o erro WER agregado do modelo não comercial granite-speech-5.0-470m-turboctc-nc é de 4,85%, enquanto o da versão Apache granite-speech-5.0-470m-turboctc é de 5,00%. Na maioria dos testes, o -nc é mais preciso, especialmente no conjunto SPGI Speech. No entanto, no segmentado Earnings22, ele fica visivelmente atrás da versão livre. No ranking FFASR Leaderboard, atualizado em 25 de agosto de 2026, o -nc ocupa a quinta posição, e a versão Apache, a nona. Além disso, ambos os modelos foram classificados como os mais rápidos entre os participantes.

Arquitetura encoder-only

Ao contrário das versões anteriores desta linha, os novos modelos são mais simples: não possuem um módulo de linguagem separado. A base é composta por 16 blocos Conformer, e na saída do oitavo bloco é aplicado self-conditioning. A atenção por chunks (chunkwise attention) evita o crescimento quadrático dos cálculos, e o treinamento minimiza a perda CTC. O fluxo de saída é reduzido para 12,5 tokens por segundo, em vez dos 50 caracteres dos encoders anteriores. Os tokenizadores dos modelos são diferentes: o granite-speech-5.0-470m-turboctc usa BPE, e o granite-speech-5.0-470m-turboctc-nc usa SentencePiece.

Para reduzir a frequência do espectrograma log Mel original, de 100 quadros por segundo para os 12,5 tokens desejados, são aplicados três estágios de subamostragem com passo 2. Primeiro, as características são empacotadas por uma operação de reshape; em seguida, nos dois primeiros blocos Conformer, há convoluções com stride=2. As conexões residuais nesses blocos também reduzem a resolução — pela média das posições vizinhas.

Compromissos e aplicações

A eliminação do modelo de linguagem proporcionou um aumento de mais de 20 vezes na capacidade de processamento em comparação com modelos anteriores, mantendo um tamanho modesto — 470M de parâmetros. No entanto, isso exigiu abrir mão de funções que o LM oferece: os novos modelos não suportam tradução de fala nem keyword biasing. Portanto, seu principal objetivo é a transcrição de alta velocidade "na borda" (edge), onde a baixa latência é importante e amplos recursos de linguagem não são necessários. Para o treinamento, foram usados dados naturais e sintéticos; entre as fontes abertas, foi utilizado o conjunto de dados MLS com 44.600 horas — aplicado a ambas as versões.

Essa combinação de velocidade e precisão torna os modelos adequados para trabalho em tempo real: eles são ideais para legendas, gravação de reuniões e qualquer cenário em que o texto precise ser gerado localmente, sem atrasos.

Perguntas mais frequentes

Granite Speech 5.0 Turbo CTC: transcrição ultrarrápida com precisão de até 4,85% WER