紧凑型模型,实现快速转录
2026年8月底,IBM发布了两个新的语音识别模型,每个模型拥有4.7亿参数——granite-speech-5.0-470m-turboctc和granite-speech-5.0-470m-turboctc-nc。两个版本都很紧凑,专注于本地语音转文字。基于扩展数据集训练的-nc版本以CC-BY-NC-SA-4.0许可证分发,而普通版本则采用Apache 2.0许可证。许可证的选择与数据直接相关:自由版本使用的源数据较少,因此更容易集成到商业产品中。

速度:每秒处理超过3.5小时音频
在NVIDIA H200加速器上,这些模型的性能超过12,600 RTFx。在批处理模式下,这足以在一秒内将超过三个半小时的语音转换为文本。这一结果得益于新的架构和输出速率的降低。为了快速评估模型性能,IBM准备了基于WebGPU的流式演示:它直接在浏览器中运行,但仅支持Chrome和Edge。该演示展示了系统如何随着音频的输入实时识别语音。
排行榜表现
根据OpenASR Leaderboard的数据,非商业模型granite-speech-5.0-470m-turboctc-nc的聚合WER错误率为4.85%,而Apache版本的granite-speech-5.0-470m-turboctc为5.00%。在大多数测试中,-nc版本更准确,尤其是在SPGI Speech数据集上。然而,在分段处理的Earnings22上,它明显逊于自由版本。在2026年8月25日更新的FFASR Leaderboard中,-nc版本排名第五,Apache版本排名第九。同时,两个模型都被评为参与者中速度最快的。
仅编码器架构
与这一系列之前的版本不同,新模型结构更简单:它们没有单独的语言模块。其核心是16个Conformer块,并在第八个块的输出处应用自条件化。分块注意力防止了计算量的二次方增长,而训练则最小化CTC损失。输出流被缩减到每秒12.5个token,而之前的编码器是每秒50个字符。两个模型的tokenizer不同:granite-speech-5.0-470m-turboctc使用BPE,而granite-speech-5.0-470m-turboctc-nc使用SentencePiece。
为了将原始log Mel频谱图的频率从每秒100帧降低到目标的每秒12.5个token,应用了三个步长为2的子采样阶段。首先,特征通过reshape操作进行打包,然后在前两个Conformer块中使用stride=2的卷积。这些块中的残差连接也通过相邻位置的平均来降低分辨率。

权衡与应用
放弃语言模型使得吞吐量相比早期模型提升了20倍以上,同时模型大小保持精简——4.7亿参数。但为此牺牲了LM提供的功能:新产品不支持语音翻译和关键词偏置。因此,它们的主要用途是在“边缘”进行高速转录,此时低延迟很重要,而广泛的语音功能则非必需。训练中使用了自然数据和合成数据;来自开放来源的MLS数据集(44,600小时)被用于两个版本的训练。
这种速度与精度的结合使模型非常适合实时工作:它们适用于字幕生成、会议记录以及任何需要在本地无延迟获取文本的场景。



