AI 模型与平台
ElevenLabs 推出 Eleven V4 及低延迟 Turbo 变体

ElevenLabs 于 2026年9月28日 推出 Eleven v4,该公司称其为迄今为止情感最丰富的文本转语音模型,以及 Eleven v4 Turbo,一种为语音代理和实时使用而设计的低延迟变体。两款模型现已在 ElevenAgents、ElevenCreative 以及 ElevenAPI 中立即可用,免费账户层级亦可获得访问权限。
该发布文章由 Mati Staniszewski 和 Piotr Dabkowski 撰写,并归入公司 Research(研究)类别。
面向表现力的新架构
ElevenLabs 表示,Eleven v4 基于全新架构构建,旨在从文本中解读语调、节奏、情感、角色和上下文,生成可呈现戏剧性、温柔、紧迫、喜剧或对话风格的语音,同时保持说话者的身份。公司称其底层音频保真度整体上高于以往模型。
公司称,一种用于捕获说话者身份的新方法旨在让每个声音在代理对话、有声书和广告中保持一致,而场景级别的上下文使说话者能够对对话中刚刚说过的话作出回应,产生的对话被公司描述为比拼接孤立句子更自然。
内联音频标签取代 SSML 控制
用户可以使用自然语言指示输出并嵌入内联音频标签;公司示例包括笑声、以法语口音愤怒地说、细雨声和电话振动。ElevenLabs 表示,该模型比之前的模型更准确地遵循这些音频标签和指令提示。对国际音标音素的支持显著提升,使自定义发音更可靠,且 ElevenLabs 开发者文档涵盖了 API 使用的完整标签语法。根据产品页面 FAQ,SSML 标签例如 <break> 在 Eleven v4 中已被禁用,取而代之的是自然语言标签作为控制机制。
Turbo 变体与延迟测量
针对实时使用,ElevenLabs 表示,其研究与工程团队将 Eleven v4 Turbo 与 ElevenAgents 对话平台一起优化为一体化系统。Turbo 支持双向流式传输,音频可在句子尚未结束时即返回。
公告的脚注方法论指出,在 2026年9月的测试中,Eleven v4 Turbo 在通过 WebSocket 流式传输、使用相同脚本和默认设置,对比 Cartesia Sonic 3.6、xAI TTS、Google Gemini Flash‑Lite TTS 和 OpenAI GPT‑4o mini TTS 时,其首次语音的中位时间约为 150 毫秒,且已测量并剔除所有系统的网络延迟。公司产品页面的对比图将 150 ms 作为参考数值,对比 Cartesia Sonic 3.6 的 262 ms 以及 OpenAI GPT‑4o mini TTS 的 814 ms。公告另称 Turbo 的中位推理延迟约为 100 ms,公司表示该数值快于两人对话之间的平均停顿。
语言、语音克隆与长音频
两款模型支持超过 90 种语言。公司表示,使用一种语言录制的声音现在可以流利地说其他语言,并采用本土说话者的口音,且在生成过程中口音保持度不再回漂回原始口音。
公司称,Instant Voice Clones 现在可以仅用 10 秒音频高保真地捕获声音,并且其表现优于 Multilingual v2 模型的 Professional Voice Clones。Professional Voice Clones 在 Eleven v3 中不可用,现已重新支持,并能发挥模型的完整情感范围。每个克隆,无论是即时的还是专业的,都需要获得声音所有者的已验证同意,生成的音频受 ElevenLabs 的 AI Speech Classifier 技术保护,公司表示该技术能够检测出其为 AI 生成。
公司表示,Eleven v4 中的请求拼接(将多次生成串联以生成更长内容)显著更可靠,提升了在 ElevenLabs Studio 和 ElevenLabs Reader App 中的使用体验。单次生成支持最高 10,000 字符,上下文拼接可在更长脚本中保持节奏和呈现的一致性。
公司报告的基准结果
ElevenLabs 报告称,Eleven v4 在 2026年9月的 Artificial Analysis Provider Voice Arena 排行榜上位列第一,并在盲测对决中约有 75% 的听众更倾向于其表现。脚注方法论指出,这些 2026年9月的测试将该模型与 Cartesia Sonic 3.6、Inworld TTS‑2、Google Gemini 3.8 Flash‑Lite TTS 和 Google Gemini 3.8 Flash TTS 进行对比,评审在盲测中听到来自 Eleven v4 与竞争对手的同一句话,判断哪一方更具表现力、哪一方更自然,平局计为半场。公告中的图表显示,Eleven v4 在这些对决中获胜率为 65%–81%。
API 访问、定价与合规
两个模型均可通过 REST 和流式端点以及 TypeScript 和 Python SDK 访问,开发者只需使用单一的 model_id 即可在模型之间切换。输出格式与 ElevenLabs 其他所有模型保持一致:MP3、用于工作室和后期制作的未压缩 WAV/PCM,以及用于电话和呼叫中心集成的 µ-law,采样率和比特率可通过 API 设置。
定价遵循与公司其他文本转语音模型相同的积分结构:每月 10,000 积分的免费层,约相当于 10 分钟音频;起价为每月 6 美元并包含专业语音克隆的付费计划;以及定制企业定价。公司库中超过 17,500 种声音均可在 Eleven v4 上使用,但在发布前创建的即时和专业克隆需重新训练才能在新模型中有效工作。
ElevenLabs 表示,Eleven v4 运行在通过 SOC 2 Type II、ISO 27001 和 PCI DSS Level 1 认证的基础设施上,符合 GDPR 并具备符合 HIPAA 要求的医疗工作流,不会在未经同意的情况下对脚本或音频标签进行训练,并为符合条件的企业服务提供零保留模式。
该 Eleven v4 产品页面 包含来自已命名客户的声明,其中包括 Salesforce 的 Agentforce Voice 产品副总裁 Ryan Peterson,他表示:“这正是我们看到 Eleven v4 Turbo 提升标准的地方,提供更快、更自然的响应,符合客户的期望。” BeyondWords 联合创始人 Patrick O’Flaherty、Spring Financial 信用建设产品负责人 Oscar Daniels,以及 Accenture Accelerate 音乐与音频负责人 Kyle Gudmundson 也对新模型发表了声明。
ElevenLabs 引导开发者查阅其文档,以获取完整的 audio-tag 语法和 API 集成细节。












