Granite Speech 5.0 Turbo CTC: transcripción ultrarrápida con precisión de hasta 4,85% WER

10 septiembre 20261 vistas

IBM ha lanzado dos modelos Granite Speech 5.0 Turbo CTC (470 millones de parámetros cada uno). En el acelerador H200, transcriben más de 210 minutos de audio por segundo y alcanzan un WER del 4,85–5,00 % en pruebas abiertas en inglés; el diseño encoder-only está pensado para funcionar en dispositivos periféricos.

Granite Speech 5.0 Turbo CTC: transcripción ultrarrápida con precisión de hasta 4,85% WER

Modelos compactos para transcripción rápida

A finales de agosto de 2026, IBM presentó dos nuevos modelos de reconocimiento de voz con 470 millones de parámetros cada uno: granite-speech-5.0-470m-turboctc y granite-speech-5.0-470m-turboctc-nc. Ambas variantes son compactas y están orientadas a la conversión local de voz a texto. La versión -nc, entrenada con un conjunto de datos ampliado, se distribuye bajo la licencia CC-BY-NC-SA-4.0, mientras que la versión estándar se publica bajo Apache 2.0. La elección de la licencia está directamente relacionada con los datos: la versión libre utiliza menos fuentes, por lo que es más fácil integrarla en productos comerciales.

Velocidad: más de 3,5 horas por segundo

En el acelerador NVIDIA H200, los modelos alcanzan un rendimiento superior a 12 600 RTFx. Con procesamiento por lotes, esto es suficiente para convertir en texto más de tres horas y media de habla en un segundo. Este resultado se logra gracias a la nueva arquitectura y a la reducción de la tasa de salida. Para evaluar rápidamente el funcionamiento del modelo, IBM ha preparado una demostración en streaming con WebGPU: se ejecuta directamente en el navegador, pero solo son compatibles Chrome y Edge. La demo muestra cómo el sistema reconoce el habla a medida que llega el audio.

Qué dicen los rankings

Según los datos del OpenASR Leaderboard, el error WER agregado del modelo no comercial granite-speech-5.0-470m-turboctc-nc es del 4,85%, y el de la versión Apache granite-speech-5.0-470m-turboctc, del 5,00%. En la mayoría de las pruebas, la versión -nc resulta más precisa, especialmente en el conjunto SPGI Speech. Sin embargo, en el segmentado Earnings22 pierde notablemente frente a la versión libre. En el ranking FFASR Leaderboard, actualizado el 25 de agosto de 2026, la versión -nc ocupa la quinta posición y la versión Apache, la novena. Además, ambos modelos están considerados los más rápidos entre los participantes.

Arquitectura solo-encoder

A diferencia de las versiones anteriores de esta línea, los nuevos modelos son más simples: no tienen un módulo de lenguaje independiente. La base son 16 bloques Conformer, y a la salida del octavo bloque se aplica self-conditioning. La atención por fragmentos (chunkwise attention) evita el crecimiento cuadrático de los cálculos, y el entrenamiento minimiza la pérdida CTC. El flujo de salida se ha reducido a 12,5 tokens por segundo, en lugar de los 50 caracteres de los encoders anteriores. Los tokenizadores son diferentes en cada modelo: granite-speech-5.0-470m-turboctc usa BPE, mientras que granite-speech-5.0-470m-turboctc-nc usa SentencePiece.

Para reducir la frecuencia del espectrograma log-Mel original de 100 fotogramas por segundo a los 12,5 tokens objetivo, se aplican tres etapas de submuestreo con paso 2. Primero, las características se empaquetan mediante una operación reshape; luego, en los dos primeros bloques Conformer hay convoluciones con stride=2. Las conexiones residuales en estos bloques también reducen la resolución, promediando las posiciones adyacentes.

Compromisos y aplicaciones

La eliminación del modelo de lenguaje ha supuesto un aumento de más de 20 veces en el rendimiento en comparación con modelos anteriores, manteniendo un tamaño modesto de 470M de parámetros. Sin embargo, esto ha obligado a sacrificar funciones que ofrece el LM: los nuevos modelos no admiten traducción de voz ni keyword biasing. Por lo tanto, su propósito principal es la transcripción de alta velocidad «en el borde», donde la baja latencia es importante y no se requieren amplias capacidades lingüísticas. Para el entrenamiento se utilizaron datos tanto naturales como sintéticos; de las fuentes abiertas se empleó el conjunto de datos MLS con 44 600 horas, que se usó para ambas versiones.

Esta combinación de velocidad y precisión hace que los modelos sean adecuados para trabajar en tiempo real: son ideales para subtítulos, grabación de reuniones y cualquier escenario en el que el texto deba obtenerse localmente sin demoras.

Preguntas frecuentes

Granite Speech 5.0 Turbo CTC: transcripción ultrarrápida con precisión de hasta 4,85% WER