语音生成器

ElevenLabs 评测:这些 AI 语音听起来几乎太真实

mm
将 Unite.AI 添加到您在 Google 上的首选来源
披露:

当您使用我们评测产品的链接时,Unite.AI可能获得报酬。这不会影响我们的编辑评价。 请阅读我们的 联盟披露。

A woman with a bun speaking into a microphone, using an AI tool that generates realistic voices.

如果你曾经录制过配音,你就知道那种感觉。你会拍十五遍,每次都卡在同一个词上,还要与背景里嗡嗡作响的冰箱斗争。

然后你回放时会讨厌自己的声音。雇佣配音演员可以解决这个问题,但如果你只需要为 YouTube 视频或培训模块配两分钟的旁白,这既慢又贵。

这正是 AI 语音生成器 承诺要解决的问题。ElevenLabs 是大多数人首先提到的名字。

ElevenLabs 已经远远超出它最初作为 文本转语音工具 的范围。Eleven v3 现在支持超过 70 种语言,同时平台还包括语音克隆、配音、转录、音乐、音效以及完整的音频编辑器。

于是,我对 ElevenLabs 进行了六项实测,以了解其输出到底有多好、需要多少编辑,以及是否值得消耗积分。以下是我的发现。

结论

ElevenLabs 是目前最强大的 AI 音频平台之一,融合了高度逼真的语音、配音、转录、语音克隆、音乐、音效以及成熟的开发者平台。主要缺点是其共享积分系统、性能标签不一致、配音费用高昂,以及功能日益增多,若只想要一个简单的配音,可能会感到不知所措。

优缺点

  • 被广泛视为最自然 AI 语音的基准。
  • Eleven v3 支持内联音频标签,例如 [whispers], [laughs],并且 [sarcastically],因此您可以控制交付方式,而不仅仅是文字。
  • 文本转语音在 v3 中支持 70 多种语言。
  • 拥有 5,000 多条语音库,并提供 Voice Design,可根据文本描述创建新语音。
  • Starter 计划缺少 Professional 语音克隆功能。
  • 一个订阅即可覆盖文本转语音、变声、配音、转录、音效、音乐,以及用于长篇音视频项目的 Studio。
  • Scribe v2 转录支持 90 多种语言,并提供实时版本用于现场使用。
  • 免费计划(每月 10,000 积分,约 10 分钟语音),无需信用卡。
  • 对于开发者而言,这是最易上手的语音引擎之一,拥有成熟的 API、SDK、CLI,以及低延迟模型(Flash v2.5 约 75 毫秒)。
  • 强大的安全措施,包括语音验证和授权的名人声音。
  • 积分在所有功能间共享,因此难以预测一个月实际工作需要花费多少积分。
  • 免费计划不包含商业授权,若不升级则无法在盈利内容中使用音频。
  • 平台发展迅速,若只想要配音,可能会感到功能过于繁杂。
  • 表达性的输出在不同生成之间可能有差异,您可能需要多次重新生成同一句,以获得满意的朗读,这会消耗积分。
  • Voice Library 中的社区语音质量差异很大,寻找合适的语音可能需要时间。
  • 对于只需要额外席位的小团队而言,从 Pro 计划升级到 Scale 的跨度相当大。
  • 其图像和视频生成功能依赖 Veo、Kling 等第三方模型,因此更像是便利功能,而非选择 ElevenLabs 的主要理由。
  • AI 对性能标签的遵循不够一致,这意味着您可能需要花费更多积分进行重新生成。
  • 配音会非常快速地消耗积分。

ElevenLabs 是什么?

ElevenLabs 是一家于 2022 年由 Mati Staniszewski(首席执行官)和 Piotr Dąbkowski(首席技术官)创立的 AI 音频公司。他们在波兰长大,观看过配音糟糕的好莱坞电影。该公司于 2023 年 1 月推出其测试版平台,主要作为 文本转语音生成器,这也是大多数人仍然对其的认知。

如今,ElevenLabs 已远超当初规模。它在 2026 年实现了 $11 billion 估值和约 $500 million 的年度经常性收入。ElevenLabs 现已分为三个业务板块。

1. ElevenCreative:大多数人会使用的功能

ElevenCreative 是面向创作者的网络应用。您粘贴脚本,选择语音,即可获得音频文件。

同一工作区还支持以下功能:

  • Voice Changer:录制自己朗读的句子,它会在保持语速和表情的同时改变您的声音。
  • Dubbing:上传视频,可在保持语调、表达和情感的前提下,将其转换为另一种语言。
  • Speech to Text:使用 Scribe v2 对音频进行转录。
  • 音乐与音效:根据文本提示生成背景音乐和音效。
  • Studio:一款面向有声书、播客和视频的编辑器,支持多位说话人、时间轴、字幕、音乐和音效,一站式完成。
  • 图像与视频:使用第三方模型(如 Veo、Kling 和 Sora)生成视觉内容,并为其添加 AI 配音或口型同步。

2. ElevenAgents:会说话的语音 AI

ElevenAgents 用于构建可接听电话、聊天、电子邮件和 WhatsApp 消息的对话语音代理,面向需要替代或支持 呼叫中心工作流程 的企业。

3. ElevenAPI:其他产品背后的引擎

开发者可以通过 API 使用相同的语音、转录、音乐和配音模型,构建应用程序和游戏等产品。

ElevenLabs 的最佳受众是谁?

以下是 ElevenLabs 最适合的用户群体:

  • YouTuber 和无面孔频道创作者可以在几分钟内将脚本转化为旁白。借助 v3 音频标签,他们可以在不重新录音的情况下控制语音的停顿、笑声或低语。
  • 有声书作者和配音员可以使用 Studio 将手稿转化为分章节的有声书,并可使用多种声音。无需重新录制整章,只需修正单句即可。
  • 游戏开发者 可以使用 Voice Design 和 v3 的对话模式快速原型或发布角色对白,然后通过 API 使用相同的声音。
  • 课程创作者 与培训团队可以将培训视频配音成 数十种语言,同时保持主持人的声音特征。
  • 播客主持人和视频编辑者可以转录节目,使用 Voice Isolator 清除噪音,并通过自行克隆的声音重新生成错误词句。
  • 应用和产品开发者可以为应用、阅读工具或助手添加语音功能。
  • 客户支持 与运营团队可以使用 ElevenAgent 构建电话和聊天语音代理。
  • 营销团队 与代理机构可以制作广告,为不同语言和受众创建版本,并通过 Iconic Marketplace 许可知名声音,而无需为每个版本雇佣配音演员。

ElevenLabs 关键功能

以下是我认为最突出的关键功能:

  • Eleven v3:最具表现力的模型,支持 70 多种语言,内置情感与表达音频标签,并支持多说话人对话。
  • Eleven Multilingual v2:较早的模型,仍然非常稳定(支持 29 种语言),在需要一致的长篇旁白时仍然实用。
  • Flash v2.5 与 v3 Conversational:低延迟模型(约 75ms 与 280ms),适用于对速度要求极高的应用和语音代理。
  • Voice Library:拥有 10,000 多种声音,可按口音、年龄、性别和使用场景进行筛选。
  • Instant & Professional Voice Cloning:即时克隆仅需短样本,专业克隆则需大量音频并进行声音验证。
  • Voice Design:通过文字描述(年龄、口音、语调、角色)从零生成全新声音。
  • Voice Changer:语音到语音转换,保留原始表演的同时更换声音。
  • 配音:在翻译视频和音频时保持说话者的声音。
  • Scribe v2 Speech to Text:支持 90 多种语言的转录,最多可标记 32 位说话人,并可通过关键词提示人名和专业术语。
  • Studio:基于时间轴的有声书、播客和视频配音编辑器,支持多说话人配音、32+ 语言字幕、音乐和音效。
  • Eleven Music:根据提示生成完整的带人声的曲目,可选择任意段落单独重新生成,付费计划下可用于商业用途。
  • Sound Effects:根据文字描述生成音效和环境声。
  • Voice Isolator:去除录音中的背景噪音和混响。
  • Iconic Marketplace:获得授权的 AI 版名人声音,拥有版权方的许可。

实测:ElevenLabs 的产出表现

以下是我对 ElevenLabs 进行的六项测试。每项测试我都关注最终输出的自然度、准确性以及在发布前需要修正的程度。

测试 1:YouTube 配音(Eleven Multilingual v2 与 Eleven v3 对比)

我让 ElevenLabs 完成的任务:

用相同的声音两次朗读同一段 YouTube 开场脚本:一次使用 Eleven Multilingual v2,另一次使用 Eleven v3。脚本需包含品牌名称、数字、缩写以及一个问题,以测试发音和语调。

在两次测试中,我选择了相同的 AI 语音(Roger——轻松、随意且富有共鸣)。两代模型生成所需时间相同,且各消耗 449 积分。

Eleven Multilingual v2

总体而言,v2 模型中 Roger 的声音听起来真实自然,但他的语调始终带有悲伤感。

Eleven v3

v3 版本拥有更好的停顿,能够制造张力,且在语调和发音上明显优于 v2。其声音在恰当的部分也更具活力。

在这两款模型之间,我会选择 v3 而非 v2。我并未感到需要编辑或重新生成任何内容。不过,尽管听起来逼真,我仍认为人们可能会注意到这声音是 AI 生成的。

测试 2:使用音频标签指挥表演

我的需求如下:

使用 v3 的对话模式生成一个简短的两角色场景(约 8 行)。包括如下标签: [whispers], [laughs], [sighs],以及 [angrily],再加上一行角色之间的打断。生成耗费 581 积分。

它的输出如下:

我的评价:

大多数标签都得到了遵循,但我注意到 Maya 对 Will 的回应未遵循 whisper(低声)标签。我还添加了一个让 Sam 听起来紧张的标签,结果他听起来相当正常,甚至相当自信。还有一个在 Will 告诉 Maya 回床上之前的笑声标签,ElevenLabs 完全忽略了。

总体而言,ElevenLabs 能遵循部分标签,但相当一部分被完全遗漏。不过大体上,它确实让两位角色的对话产生了真实的互动感。

尽管存在错误,我仍认为该对话足以用于播客短剧、游戏配音或音频剧本。

测试 3:克隆我的声音

我的需求如下:

使用 1–2 分钟的干净录音创建即时语音克隆。随后生成一段我从未录制过的段落,并将其与我朗读同一段落的真实录音进行对比。

真实声音(此录音比克隆录音要安静得多):

使用 ElevenLabs 克隆的我的 AI 语音版本:

我的评价:

克隆后的声音在音调、口音、节奏和呼吸方面基本与我的真实声音相符。我唯一能听出的区别是克隆版本略显更为轻快。克隆版本已足够真实,可用于旁白或修正录音中的错误。

测试 4:为视频配音至另一语言

我的需求如下:

将一段 60–90 秒的英文讲述视频配音为西班牙语(或法语),使用配音功能。

以下是我用英文讲话的视频:

AI 将英文视频配音为西班牙语的版本(耗费 16,138 积分):

我的评价:

总体而言,我认为 AI 配音后的视频听起来像是我本人。翻译相当准确,且基本匹配我的说话节奏。我可以直接将其发布给西班牙语受众,无需进一步编辑。

测试 5:使用 Scribe 转录杂音录音

我的需求如下:

转录一段 2 分钟的录音,包含背景噪音,并至少包含三个专有名词或技术术语。

它的输出如下:

使用 ElevenLabs 生成的转录片段。

我的评价:

查看它生成的转录稿,我感到相当惊讶。即使有背景噪音,它也全部正确。唯一出错的地方是一些人名,例如原稿中的 Piotr Dąbkowski 在转录中被拼写为 “Peter Depkowski”,这并不让我感到意外。

测试 6:在 Studio 中完成完整音频套餐(配音 + 音乐 + 音效)

我的需求如下:

在 Studio 中制作一个 60 秒的播客开场:包括旁白脚本、生成的背景音乐以及两个音效,然后导出。生成音乐耗费 900 积分/分钟。每个音效生成耗费 17 积分。

它的输出如下:

我的评价:

我对 ElevenLabs 的产出印象深刻。音乐听起来很棒,适合项目需求,AI 语音清晰,音效也符合提示。我很容易想象它可以取代小型创作者使用的素材库音乐和音效库。

结果与输出质量

以下是我在六次测试中对结果和输出质量的具体观察:

  • 真实感:ElevenLabs 的语音整体上非常逼真,这并不令人惊讶,因为 ElevenLabs 以提供最真实的 AI 语音而闻名。v3 的语调和能量比 v2 更自然,我的克隆语音与真实声音高度吻合。对话和 Studio 音频也相当可信,尽管仍有轻微的 AI 质感,部分人可能会察觉。
  • 准确性:在所有测试中准确性表现良好。主要问题是 v3 中遗漏了部分表现标签,以及 Scribe 在处理某些专有名词时出错。
  • 一致性:语音在段落和代之间保持一致。主要的不一致在于 v3 对表现指令和情感标签的遵循程度不够稳定。
  • 速度:生成速度在所有测试中都很快,速度并不是明显的短板。
  • 编辑需求:整体上几乎不需要编辑。配音、语音克隆和配音(dubbing)可以直接使用,而对话在标签遗漏时可能需要重新生成部分内容。
  • 信用消耗与产出对比:标准配音每段约 449 积分,配音(dubbing)则高达 16,138 积分。Studio 音乐每分钟 900 积分,外加每个音效 17 积分。
  • 不足之处:最大弱点是对表现标签的遵循不够一致。Scribe 也在处理部分人名时出现困难,且配音(dubbing)会快速消耗积分。

如何在 ElevenLabs 获得良好结果

在 ElevenLabs 进行各种测试后,我发现以下做法能帮助你获得更好的结果:

  1. 为任务选择合适的模型。需要富有表现力、指向明确的演绎时使用 Eleven v3(YouTube、广告、对话、音频剧)。需要长篇、平稳叙述且一致性重于情感时使用 Multilingual v2。仅在实时场景下才使用 Flash v2.5。
  2. 挑选或创建合适的声音。可按使用场景在语音库中筛选,或在语音设计中描述你想要的声音。
  3. 为听觉而写。标点仍会影响节奏。使用 v3 时,在方括号中加入音频标签以指示特定情感或反应,并将标签放在对应的台词附近。
  4. 生成、聆听,仅修复出现问题的部分。使用 Studio 时,重新生成单行或单词,而不是整段脚本,因为每次生成都会消耗积分。
  5. 按需导出格式。对大多数创作者而言 MP3 已足够,但付费计划可解锁更高质量的输出。Pro 版通过 API 提供 44.1kHz PCM。

ElevenLabs 的三大替代方案

以下是我尝试过并推荐的最佳 ElevenLabs 替代方案。

Murf

Murf 是我向商务用户推荐的 ElevenLabs 替代方案。它专注于专业配音,适用于演示文稿、培训、产品演示和解释视频,并且还能控制音调、速度和停顿。

它最大的优势在于能够轻松融入现有工作流。借助 Murf 的 Canva 和 Google Slides 插件,你可以直接在幻灯片中添加旁白,无需先导出音频。而 ElevenLabs 在幻灯片配音方面并未提供同等便利。

ElevenLabs 的优势在于表现力。Murf 的语音更偏专业,适合企业内容,但在故事叙述、角色塑造或情感朗读方面无法匹配 v3 的广度。

如果你需要用于演示或培训内容的 AI 语音,请选择 Murf;若更看重真实感和表现力,请选择 ElevenLabs。

阅读我的Murf 评测或访问Murf!

Speechify

Speechify 是一款文字转语音阅读器,可帮助你更快阅读文档、电子邮件和文章。它支持 iPhone、Android、Mac、Chrome 和 Edge,具备出色的可访问性,是学生以及阅读障碍或 ADHD 人群的理想工具。

Speechify Studio 是与 ElevenLabs 竞争的产品,提供配音、配音(dubbing)、编辑器和 AI 虚拟形象。而 ElevenLabs 则在交付控制上更深入,并拥有名为ElevenReader的阅读器应用,但 Speechify 的阅读体验更为成熟。

如果你的主要需求是聆听内容,则选择 Speechify,配音功能则是额外加分。若你的重点是创建音频,则选择 ElevenLabs。

阅读我的Speechify 评测或访问Speechify!

WellSaid

WellSaid 采用与 ElevenLabs 完全相反的语音来源方式。其库中的每个语音均由专业配音演员录制,因此没有克隆工具,也没有社区上传的语音。

WellSaid 还提供 280 多个由演员录制的语音(大多数为英语,除非您使用企业版),并具备叙述或对话式阅读的风格控制。它还支持单点登录以保障数据隐私。与此同时,ElevenLabs 提供克隆、配音、转录、音乐以及 70 多种语言。

如果您在制作企业培训、在线学习或客户项目时,语音版权和合规性比语音种类更重要,请选择 WellSaid。否则,可选择 ElevenLabs,以获得更丰富的表现力、克隆功能和更多语言支持。

阅读我的 WellSaid Labs 评测或访问 WellSaid。

ElevenLabs 评测:它是适合你的工具吗?

我最喜欢 ElevenLabs 的地方是语音质量。在我的测试中,语音听起来非常逼真。显而易见,v3 为我带来了更好的语调和能量,而语音克隆、配音以及 Studio 工具都在几乎不需要编辑的情况下产生了令人印象深刻的效果。

我不太满意的是积分系统。配音的费用相对合理,但在我的测试中,配音使用了 16,138 积分。此外,AI 有时会漏掉表现标签,这不仅令人恼火且不便,还可能导致需要为额外生成付费。

让我惊讶的是 ElevenLabs 的功能远超文本转语音。您可以克隆语音、为视频配音、转录录音、生成音乐和音效,并在 Studio 中构建完整的音频项目。

我会向任何寻求最逼真、最具表现力 AI 语音的人推荐 ElevenLabs。它特别适用于 YouTube 视频、播客、语音克隆、配音以及其他对语音质量要求极高的项目。但如果 ElevenLabs 的声音不符合您的需求,可考虑以下替代方案:

  • WellSaid 最适合企业培训、在线学习和对语音版权及专业录制语音要求最高的客户项目。
  • Murf 最适合商务演示和培训内容,尤其是当您在 Canva 或 Google Slides 中工作时。
  • Speechify 最适合主要希望 AI 为其朗读内容的用户,配音功能则是额外加分项。

感谢阅读我的 ElevenLabs 评测!如果您想亲自尝试,可以 免费注册,看看它在您的项目中表现如何。

常见问题

ElevenLabs 免费吗?

是的。免费计划每月提供 10,000 积分,无需信用卡。但它不包括商业许可证或语音克隆功能。

我可以商业使用 ElevenLabs 的语音吗?

可以,在任何付费计划下均可。免费计划不包含商业许可证。

ElevenLabs 仍然是最逼真的 AI 语音生成器吗?

是的,ElevenLabs 仍是最逼真的 AI 语音生成器。Eleven v3 引入了情感控制水平,远超大多数竞争对手。

Eleven v3、Multilingual v2 与 Flash v2.5 有何区别?

Eleven v3 是最具表现力的模型,支持音频标签、对话以及 70 多种语言。Multilingual v2 更加稳定,适合 29 种语言的长篇叙述。Flash v2.5 为应用和语音代理而设计,具备约 75 毫秒的低延迟。完整对比请参阅 ElevenLabs 的模型文档。

ElevenLabs 支持多少种语言?

Eleven v3 的文本转语音支持 70 多种语言,Scribe v2 转录支持 90 多种语言,Dubbing v2 API 同样支持 90 多种语言。

ElevenLabs 能翻译并配音视频吗?

可以,ElevenLabs 能将视频翻译并配音成其他语言,同时保留原始说话者的声音。配音工作室允许您单独修正每一句台词。

ElevenLabs 能转录音频吗?

可以,ElevenLabs 能以 90 多种语言进行音频转录,并提供说话者标签。

ElevenLabs 能创作音乐吗?

可以,Eleven Music 能根据文本提示生成包括人声在内的完整曲目。

ElevenLabs 有 API 吗?

有,ElevenLabs 提供覆盖文本转语音、语音转文本、配音、音乐和音效的 API,并配有 SDK、命令行工具以及托管的 MCP 服务器。

ElevenLabs 的所有者是谁?

ElevenLabs 由 Mati Staniszewski(首席执行官)和 Piotr Dąbkowski(首席技术官)于 2022 年共同创立。

ElevenLabs 安全么?

是的,ElevenLabs 是安全的。创建专业语音克隆前需要进行验证,并且会阻止对某些高知名度语音的克隆,同时通过其 Iconic Marketplace 为名人语音提供授权。

Janine Heinrichs 是一位 AI 软件评测专家,在过去三年中测试并评审了 250 多款 AI 工具。