AI 模型与平台

Microsoft 推出 MAI-Transcribe-2-Streaming 以及两款 MAI-Voice 模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Microsoft AI 于 2026 年 10 月 1 日 推出了 MAI-Transcribe-2-Streaming,这是其首个流式转录模型,同时推出了两款新的文本转语音模型 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,三者均可通过 Microsoft Foundry 使用。

MAI-Transcribe-2-Streaming 与 Artificial Analysis 基准

Microsoft 表示,MAI-Transcribe-2-Streaming 能以低延迟实时转录 60 种语言,并具备自动、连续的语言检测。公司称该模型在 Artificial Analysis 上的最终转录和部分转录准确率均排名第一,并且位于基准的准确率‑延迟评估的帕累托前沿,意味着更高的准确率无需付出显著的延迟代价。该帖中的排行榜图表引用了 2026 年 9 月 28 日的 Artificial Analysis 流式排行榜,显示该模型的最终字错误率为 2.5%,首个部分错误率为 2.8%,以及 0.13 秒即可得到最终转录。

该模型不会等到说话者说完再返回文本,而是在接收音频后约 100 毫秒内生成首批假设(称为部分转录),随后随着更多上下文的到来进行修正,最终形成稳定的转录。Microsoft 表示,这使得语音应用能够在说话者尚未说完时就对语音进行处理:语音代理可以在句子中途开始推理或调用工具,实时转录也能在讲话时即时显示。针对实时口述和字幕,公司的内部评估显示,转录中的词出现速度是最接近竞争对手的两倍。

Artificial Analysis 表示,其 AA-WER Streaming 指标衡量模型在实时流式音频(逐块)约八小时音频的转录准确率,数据来源于三个数据集:AA-AgentTalk 占 50%,VoxPopuli 占 25%,Earnings22 占 25%。这些数据集涵盖了具有多样口音、特定领域语言以及挑战性声学环境的真实语音,基准的最终时间(Time to Final)和首个部分时间(Time to First Partial)测量均以 SileroVAD 语音活动检测器检测到的语音结束为起点。

MAI-Transcribe-2-Streaming 在本年度结束前提供每小时音频 $0.54 的入门价格。该模型扩展了 Microsoft 的 MAI 音频系列,系列中已包含 MAI-Transcribe-2——这款早期的非流式语音识别模型被公司宣传为全球最快、最准确且最便宜的。

MAI-Voice-2.1 与 MAI-Voice-2.1-Flash

MAI-Voice-2.1 支持 23 种语言和 26 个地区,Microsoft 表示,同一声音可以使用所有语言并保持本土口音,在切换语言时保持相同的说话者身份。公司举例说明,一款辅导应用可以在课程进行中切换语言而无需更换教师,多语言助手则可以用用户使用的任何语言回复,同时仍保持相同的声音。该模型的定价为每 1M 字符 $22。

MAI-Voice-2.1-Flash 支持相同的语言和跨语言说话者,但专为高容量、对延迟敏感的工作负载设计。它能够生成最长 45 秒的音频,端到端延迟为 150 毫秒,Microsoft 表示其模型推理速度提升 55%,且成本约比可比模型低 60%。该模型的定价为每 1M 字符 $15。

两款语音模型均支持使用几秒参考音频在所有支持语言中进行语音克隆,且内置的同意防护措施据 Microsoft 称可防止滥用。在一次包含 4,000 名听众的图灵测试中,结合这两款新语音模型的表现,50.3% 的听众认为 MAI-Voice 与人类录音同样或更具人类感,Microsoft 表示。

Microsoft 将 MAI-Transcribe-2-Streaming 与 MAI-Voice-2.1-Flash 的组合描述为在语音代理循环的两端“买回时间”,即在听、理解、决策、发声的整个过程仍被人类感知为对话的时间窗口。列出的开发者使用案例包括:在客户服务中实时转录用户请求并以自然语音作答的客服代理、多语言助手能够检测说话语言并使用 23 种支持的 MAI-Voice 语言进行回复,以及在交互式学习和媒体应用中使用不同说话者进行辅导、角色扮演、模拟、旁白和对话内容的场景。

可用性与 Chatter 演示

MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 可通过 OpenRouter 使用。所有三款模型均可通过 Microsoft Foundry、MAI Playground、Vercel 和 Azure Voice Live 获得,LiveKit 则列为即将上线。

为展示这些模型在实时代理中的协同工作,Microsoft 构建了 Chatter,这是一款在 MAI Playground 中的新演示,用户可以与由转录和语音模型驱动的语音助手对话。

Jonas Reeve 是一名由 AI 生成的分析师,隶属于 Unite.AI,专注于认知 AI、通用人工智能(AGI)以及机器智能的理论基础。他的研究探讨学习、推理、记忆和抽象如何在生物系统和人工系统中出现,并将现代 AI 架构与认知科学和心灵哲学中的长期问题联系起来。

采用概念性和反思性的视角,Jonas 检视诸如推理模型、主体系统、涌现认知和对齐理论等框架,旨在阐明向 AGI 迈进的实际意义——以及它不代表的内容。他不追逐时间表或炒作,而是强调第一性原理、概念严谨性以及当前模型的局限性。

Jonas Reeve 所撰写的文章由 AI 生成,并经 Unite.AI 编辑团队审阅,以确保准确性、清晰度以及对先进 AI 概念的负责任讨论。