AI 模型与平台

xAI 发布 Grok Voice Transcribe 2.0 语音转文字模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

xAI 于 2026 年 9 月 18 日发布了 Grok Voice Transcribe 2.0,这款最新的语音转文字模型,批量定价为每小时音频 0.10 美元,并称该模型的准确率是 Grok Voice Transcribe 1.0 的两倍。

Grok Voice Transcribe 2.0 基于 Grok Voice 背后的音频基础模型构建。根据 xAI 的说法,Grok Voice 已经每天支持数万通客户支持电话,转录数百万小时的视频旁白,并在实体产品中运行语音代理,包括特斯拉车辆中的 Grok 助手。公司表示,新模型在各种环境中录制的现场、嘈杂、多语言音频上进行训练,并通过后训练进行优化,称其结果是面向真实场景的最准确的转录模型之一。

准确性评估

xAI 表示,Grok Voice Transcribe 2.0 在公开的 Artificial Analysis 排行榜上 32 种流式模型中以准确率排名第一。除公开基准外,公司还在四个来源于生产流量的内部评估集上测量词错误率:来自客户支持电话的电话音频、与 Grok 的对话、口述凭证(如账户代码和电子邮件地址)以及简短的多语言语音指令。公司报告称,新模型在所有四个评估集上均优于 Grok Voice Transcribe 1.0,并在电话集(包含 8 kHz 英文客户支持通话)中领先于所有测试模型。xAI 发布的图表将该模型与 Gemini 3.5 Transcribe、MAI-Transcribe-2、ElevenLabs Scribe v2、Deepgram Nova-3 和 Whisper Large v3 在这些内部集上的表现进行比较。

根据 xAI 的说法,多语言转录是相较于 1.0 版本获得的最大准确率提升。公司称该模型能够转录数十种语言,自动检测语言,并在单次处理时跟随录音中的语言切换。短语(例如车内指令)提供的上下文很少,难以识别语言;在 xAI 的覆盖 19 种语言的短语语音助理语料集上,词错误率从 20.6% 降至 6.8%,公司报告称。

功能与 API 访问

通过 Speech-to-Text API,Grok Voice Transcribe 2.0 支持对录制文件和 URL 进行批量转录以及实时流式转录。文档中列出的功能包括带置信度分数的词级时间戳、免费提供的说话人分离、多达八个声道的多声道转录、每次请求最多 100 个领域关键词的偏置、以书写形式返回数字、日期、货币、电话号码和电子邮件地址的文本格式化、去除填充词以及智能回合检测,可识别语音代理说话者回合的结束。xAI 表示,现有的 Speech-to-Text API 集成可在无需代码更改的情况下获得准确率提升。

官方语音转文字文档列出了 12 种支持的音频格式,最大文件大小为 500 MB,采样率为 8000、16000、22050、24000、44100 和 48000 Hz。语言参数可在 25 种语言中启用书写形式的格式化,其中包括英语、西班牙语、法语、德语、印地语、日语和韩语。

批量请求使用 multipart 表单数据,必须提供上传的文件或供服务器下载并转录的 URL;响应返回完整的转录文本、以 BCP‑47 代码表示的检测语言、音频时长(秒)以及带有起止时间的词级片段。对于流式转录,客户端将原始音频以二进制帧发送至 WebSocket 端点 wss://api.x.ai/v1/stt,并在音频处理过程中接收 JSON 转录事件,可选的中间结果大约每 500 毫秒发出一次。

Loom 部署、定价与淘汰计划

xAI 表示,Atlassian 对 Grok Voice Transcribe 2.0 与其现有转录解决方案进行了评估,发现其更为准确,并已使用该模型转录 Loom(其屏幕录制产品)的每个视频。xAI 的公告 引用了 Atlassian 团队协作部门高级副总裁 Sanchan Saxena 对将 Loom 转录稿导入 Cursor 编码工具的工作流程的评论:“有了 Grok 为 Loom 的语音转文字提供动力,且 Cursor 将其转化为代码,我们实现了从上下文到代码的闭环:记录你的意图,工作即可完成。”

定价与 Grok Voice Transcribe 1.0 相同:批量转录每小时音频 0.10 美元,流式转录每小时 0.20 美元,且包含说话人分离、时间戳和关键词。xAI 表示,Grok Voice Transcribe 2.0 将很快成为 Speech-to-Text API 的默认模型,且 1.0 版本将在未来几周内被淘汰;在过渡期间希望继续使用旧模型的客户可以在请求中固定 grok-voice-transcribe-1.0。文档目前在未指定模型参数时将 grok-voice-transcribe-1.0 列为默认,同时在 REST 和 WebSocket 端点均可选择 grok-voice-transcribe-2.0。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。