AI 模型与平台
IBM 表示 Granite Speech 5.0 能在一秒钟内转录 3.5 小时的语音

IBM 于 2026 年 8 月 25 日发布了两款紧凑型英文语音识别模型,声称转录吞吐量是此前任何开源模型未曾达到的:在一秒内处理超过 3.5 小时的语音。这两款模型分别是 Granite Speech 5.0 TurboCTC 和其非商业版,每个模型仅拥有 4.7 亿参数,公司报告在单块 NVIDIA H200 GPU 上的整体吞吐量超过 12,600 RTFx,意味着音频通过模型的速度是实时的一万二千倍以上。
这种速度伴随着竞争力的准确率,至少在 IBM 的数据上是如此。根据 IBM 的公告,在 OpenASR Leaderboard 的公开英文短文本测试集上,非商业版的整体词错误率为 4.85%,开放授权版为 5.00%。这两个数值均为厂商报告:IBM 标记为非官方,尽管推理是通过 Hugging Face 自己的作业基础设施完成,并使用排行榜工具进行评分,因此公司预计在官方表格更新后,这些数值将与之一致。
这两款模型在规模和架构上完全相同,区别在于训练数据和许可证。Apache 2.0 版在约 60,000 小时的英文音频上进行训练,且已获准用于商业用途。非商业版则额外加入了 GigaSpeech 和 SPGI Speech,大约再增加 15,000 小时,使其语料库接近 75,000 小时,采用 CC-BY-NC-SA-4.0 许可证。IBM 表示,额外的数据在大多数测试集上带来了适度的准确率提升,在 SPGI Speech 本身上优势更为明显,而在排行榜的新分块 Earnings22 测试上则出现了显著的劣势。
没有语言模型的编码器
速度宣称的依据在于 IBM 所省略的部分。早期的 Granite Speech 发行版(3.3 和 4.x 系列,详见 IBM 的 Granite Speech 论文)通过投影层和 LoRA 适配器将 Conformer 声学编码器与 Granite 语言模型相连接,以类似聊天模型的方式自回归生成文本。5.0 版本则完全去除了语言模型。剩下的是一个 16 层的 Conformer 编码器,使用连接时序分类(CTC)进行训练,其解码方案在一次非自回归的贪婪解码过程中,将音频帧直接映射到输出标记。
另外还有两项改动完成了大部分工作。此前的 Granite 编码器每秒输出 50 个字符,而新模型每秒输出 12.5 个标记,这通过对每秒 100 帧的 log-Mel 前端进行三轮 2 倍时间子采样实现。输出词汇表也从字符转变为 16,384 个训练得到的子词单元,非商业版使用 SentencePiece,Apache 版使用 BPE。更少且更长的标记以及四分之一的帧率,使得吞吐量比早期 Granite Speech 模型提升了超过 20 倍,依据 IBM 的说法。
这种取舍是以转录专注换取能力广度。没有语言模型后,这些模型失去了早期版本支持的语音翻译和关键词偏置功能。它们获得的则是适用于笔记本和边缘硬件的体积:IBM 将这两款模型定位于企业级语音转文本场景,在该场景中延迟和吞吐量比能够对听到的内容进行推理的模型更为重要。
评估能显示什么,不能显示什么
迄今为止最有力的独立信号来自远场音频。在 FFASR Leaderboard(衡量嘈杂、混响语音识别的排行榜)上,IBM 报告截至 2026 年 8 月 25 日的官方结果显示,非商业版在准确率上排名第五,Apache 版排名第九——同时两者在榜单上是速度最快的两项,吞吐量在单块 NVIDIA L4 上测得。FFASR 根据排行榜自己的说明,在多种信噪比下对嘈杂、混响以及移动声源的音频进行评估,这些条件下远场识别会出现衰减。
不过,这个 12,600 RTFx 的 headline 数据需要放在上下文中理解。它是基于最速数据中心 GPU 之一的批量推理数值,并非在运行 WebGPU 流媒体演示的笔记本上能够看到的数值。整体的词错误率仅覆盖英文短文本,而 OpenASR Leaderboard 的官方排名(包括私有测试集)在发布时尚未纳入这些新模型。IBM 对此的表述是诚实的:这些是强有力的厂商报告结果,仍在等待排行榜的确认。
训练方案同样值得关注,因为它体现了数据开放性。两款模型语料库中的每个数据集均可公开获取,另外 2,740 小时的合成数据包括 2,500 小时的多说话人音频(由单说话人片段拼接而成)以及 240 小时由 OpenAI 的开源权重 gpt-oss 模型生成并使用 StyleTTS2 合成的语句,专注于让识别器容易出错的数字、货币和地址。根据模型卡片,训练在 IBM 的 Blue Vela 集群上使用 8 块 NVIDIA H100 GPU,耗时 10 天。
两款模型目前已在 Hugging Face 上上线,并在 transformers 库中获得原生支持——在下一个版本发布前需从源码安装——归属 Granite Speech 系列,同时有基于浏览器的流媒体演示可在 Chrome 和 Edge 中运行。想了解专用转录模型相对于商业服务的定位,请参阅我们的 AI 转录软件 汇总。












