Granite Speech 5.0 Turbo CTC: сверхбыстрая транскрипция с точностью до 4,85% WER

10 сентября 20262 просмотров

IBM выпустила две модели Granite Speech 5.0 Turbo CTC (по 470 млн параметров). На ускорителе H200 они переводят в текст свыше 210 минут аудио за секунду и достигают WER 4,85–5,00% на открытых англоязычных тестах; encoder-only дизайн рассчитан на работу на периферийных устройствах.

Granite Speech 5.0 Turbo CTC: сверхбыстрая транскрипция с точностью до 4,85% WER

Компактные модели для быстрой транскрипции

В конце августа 2026 года IBM представила две новые модели распознавания речи с 470 миллионами параметров каждая — granite-speech-5.0-470m-turboctc и granite-speech-5.0-470m-turboctc-nc. Оба варианта компактны и ориентированы на локальный speech-to-text. Версия -nc, обученная на расширенном наборе данных, распространяется по лицензии CC-BY-NC-SA-4.0, а обычная версия — под Apache 2.0. Выбор лицензии напрямую связан с данными: свободная версия использует меньше исходников, поэтому её проще встраивать в коммерческие продукты.

Скорость: больше 3,5 часов за секунду

На ускорителе NVIDIA H200 модели показывают производительность свыше 12 600 RTFx. При пакетной обработке этого достаточно, чтобы превращать в текст более трёх с половиной часов речи за одну секунду. Такой результат обеспечивает новая архитектура и снижение выходного темпа. Чтобы быстро оценить работу модели, IBM подготовила потоковую демонстрацию на WebGPU: она запускается прямо в браузере, но поддерживаются только Chrome и Edge. Демо показывает, как система распознаёт речь по мере поступления звука.

Что говорят лидерборды

Судя по данным OpenASR Leaderboard, агрегированная ошибка WER у некоммерческой модели granite-speech-5.0-470m-turboctc-nc составляет 4,85%, а у Apache-версии granite-speech-5.0-470m-turboctc — 5,00%. На большинстве тестов -nc оказывается точнее, особенно на наборе SPGI Speech. Однако на сегментированном Earnings22 она заметно уступает свободной версии. В рейтинге FFASR Leaderboard, обновлённом 25 августа 2026 года, -nc занимает пятую позицию, Apache-версия — девятую. При этом обе модели названы самыми быстрыми среди участников.

Архитектура encoder-only

В отличие от прошлых версий этой линейки, новые модели устроены проще: у них нет отдельного языкового модуля. В основе — 16 блоков Conformer, а на выходе восьмого блока применяется self-conditioning. Chunkwise attention предотвращает квадратичный рост вычислений, а обучение минимизирует CTC-лосс. Выходной поток сокращён до 12,5 токенов в секунду вместо 50 символов у прежних энкодеров. Токенизаторы у моделей разные: granite-speech-5.0-470m-turboctc использует BPE, а granite-speech-5.0-470m-turboctc-nc — SentencePiece.

Чтобы снизить частоту исходной log Mel-спектрограммы со 100 кадров в секунду до целевых 12,5 токенов, применяются три этапа субдискретизации с шагом 2. Сначала признаки упаковываются операцией reshape, затем в первых двух Conformer-блоках стоят свёртки со stride=2. Остаточные соединения в таких блоках тоже уменьшают разрешение — усреднением соседних позиций.

Компромиссы и применение

Отказ от языковой модели дал более чем 20-кратный прирост пропускной способности по сравнению с более ранними моделями, при этом размер остался скромным — 470M параметров. Но за это пришлось пожертвовать функциями, которые даёт LM: новинки не поддерживают перевод речи и keyword biasing. Поэтому их основное назначение — высокоскоростная транскрипция «на периферии», где важна низкая задержка, а широкие языковые возможности не требуются. Для обучения использовались как натуральные, так и синтетические данные; из открытых источников задействован датасет MLS объёмом 44 600 часов — он применялся для обеих версий.

Такое сочетание скорости и точности делает модели удобными для работы в реальном времени: они подходят для субтитров, записи совещаний и любых сценариев, где текст нужно получать локально без задержек.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Granite Speech 5.0 Turbo CTC — обзор сверхбыстрой транскрипции