Granite Speech 5.0 Turbo CTC : transcription ultra-rapide avec une précision de 4,85 % WER

10 septembre 20262 vues

IBM a publié deux modèles Granite Speech 5.0 Turbo CTC (470 millions de paramètres chacun). Sur l'accélérateur H200, ils transcrivent plus de 210 minutes d'audio par seconde et atteignent un WER de 4,85–5,00 % sur les tests ouverts en anglais ; la conception encoder-only est conçue pour fonctionner sur des appareils périphériques.

Granite Speech 5.0 Turbo CTC : transcription ultra-rapide avec une précision de 4,85 % WER

Des modèles compacts pour une transcription rapide

Fin août 2026, IBM a présenté deux nouveaux modèles de reconnaissance vocale avec 470 millions de paramètres chacun — granite-speech-5.0-470m-turboctc et granite-speech-5.0-470m-turboctc-nc. Les deux variantes sont compactes et conçues pour la transcription vocale locale. La version -nc, entraînée sur un ensemble de données étendu, est distribuée sous licence CC-BY-NC-SA-4.0, tandis que la version standard est sous Apache 2.0. Le choix de la licence est directement lié aux données : la version libre utilise moins de sources, ce qui la rend plus facile à intégrer dans des produits commerciaux.

Vitesse : plus de 3,5 heures par seconde

Sur un accélérateur NVIDIA H200, les modèles affichent des performances supérieures à 12 600 RTFx. En traitement par lots, cela suffit pour convertir en texte plus de trois heures et demie de parole en une seconde. Ce résultat est rendu possible par la nouvelle architecture et la réduction du débit de sortie. Pour évaluer rapidement le fonctionnement du modèle, IBM a préparé une démonstration en streaming sur WebGPU : elle s'exécute directement dans le navigateur, mais seuls Chrome et Edge sont pris en charge. La démo montre comment le système reconnaît la parole au fur et à mesure que le son arrive.

Ce que disent les classements

Selon les données de l'OpenASR Leaderboard, l'erreur WER agrégée du modèle non commercial granite-speech-5.0-470m-turboctc-nc est de 4,85 %, et celle de la version Apache granite-speech-5.0-470m-turboctc est de 5,00 %. Sur la plupart des tests, la version -nc s'avère plus précise, notamment sur l'ensemble SPGI Speech. Cependant, sur Earnings22 segmenté, elle est nettement moins performante que la version libre. Dans le classement FFASR Leaderboard, mis à jour le 25 août 2026, la version -nc occupe la cinquième position, et la version Apache la neuvième. Les deux modèles sont par ailleurs désignés comme les plus rapides parmi les participants.

Architecture encoder-only

Contrairement aux versions précédentes de cette gamme, les nouveaux modèles sont plus simples : ils n'ont pas de module linguistique séparé. Ils reposent sur 16 blocs Conformer, et un self-conditioning est appliqué à la sortie du huitième bloc. L'attention par segments (chunkwise attention) évite la croissance quadratique des calculs, et l'entraînement minimise la perte CTC. Le flux de sortie est réduit à 12,5 tokens par seconde au lieu de 50 caractères pour les encodeurs précédents. Les tokeniseurs diffèrent selon les modèles : granite-speech-5.0-470m-turboctc utilise BPE, tandis que granite-speech-5.0-470m-turboctc-nc utilise SentencePiece.

Pour réduire la fréquence du spectrogramme log Mel d'origine, de 100 trames par seconde à 12,5 tokens cibles, trois étapes de sous-échantillonnage avec un pas de 2 sont appliquées. D'abord, les caractéristiques sont regroupées par une opération reshape, puis des convolutions avec stride=2 sont placées dans les deux premiers blocs Conformer. Les connexions résiduelles dans ces blocs réduisent également la résolution — en faisant la moyenne des positions voisines.

Compromis et applications

L'abandon du modèle de langue a permis d'augmenter le débit de plus de 20 fois par rapport aux modèles plus anciens, tout en conservant une taille modeste — 470M paramètres. Mais cela s'est fait au prix de certaines fonctions offertes par le LM : les nouveautés ne prennent pas en charge la traduction vocale ni le keyword biasing. Leur objectif principal est donc la transcription à haute vitesse « en périphérie », où une faible latence est cruciale et où de larges capacités linguistiques ne sont pas nécessaires. Pour l'entraînement, des données à la fois naturelles et synthétiques ont été utilisées ; parmi les sources ouvertes, l'ensemble de données MLS de 44 600 heures a été employé — il a servi pour les deux versions.

Cette combinaison de vitesse et de précision rend les modèles adaptés au travail en temps réel : ils conviennent aux sous-titres, à l'enregistrement de réunions et à tout scénario où le texte doit être obtenu localement sans délai.

Foire aux questions

Matériaux connexes

Tous matériaux
Granite Speech 5.0 Turbo CTC : transcription ultra-rapide avec une précision de 4,85 % WER