访谈

Deepdub 首席执行官兼联合创始人 Ofir Krakowski – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Ofir Krakowski 是 Deepdub 的联合创始人兼首席执行官。拥有 30 年的计算机科学和机器学习经验,他在以色列空军的机器学习和创新部门担任领导职务长达 25 年。

Deepdub 是一家利用深度学习和语音克隆技术的 AI 驱动的配音公司,提供高质量、可扩展的本地化解决方案,适用于电影、电视和数字内容。成立于 2019 年,Deepdub 可以在保持原有表演的同时无缝地将对话翻译成多种语言。通过将 AI 驱动的语音合成与人类语言监督相结合,Deepdub 提高了全球内容的可访问性,减少了传统配音的时间和成本。该公司因其创新获得了行业认可,获得了主要合作伙伴关系、认证和资金,以扩大其 AI 本地化技术在娱乐行业的应用。

是什么激发了您在 2019 年创立 Deepdub 的灵感?是否有一个特别的时刻或挑战导致了其创立?

传统的配音长期以来一直是行业标准,但它是一个昂贵、耗时且资源密集的过程。虽然 AI 生成的语音解决方案已经存在,但它们缺乏捕捉演员表演的感情深度,无法满足高质量、复杂内容的需求。

我们发现了一个机会,通过开发一种 AI 驱动的本地化解决方案来弥补这一差距,该解决方案保持了原有表演的感情真实性,同时大大提高了效率。我们开发了自己的专有 eTTS ™(情感文本转语音)技术,确保 AI 生成的语音具有与人类演员相同的感情重量、语调和细微差别。

我们设想一个世界,在那里语言和文化障碍不再是全球内容可访问性的障碍。在创建我们的平台时,我们认识到娱乐、电子学习、FAST 和其他行业中语言限制的挑战,并着手革新内容本地化。

为了确保 Deepdub 的解决方案为复杂内容提供了最高质量的本地化和配音,我们决定采用混合方法,将语言和语音专家纳入流程中,结合我们的 eTTS ™技术。

我们的愿景是民主化语音制作,使其大规模可扩展、普遍可访问、包容和文化相关。

您在启动 Deepdub 时面临的最大技术和商业挑战是什么?您如何克服它们?

在启动 Deepdub 时,获得娱乐行业的信任是一个主要障碍。好莱坞几十年来一直依赖传统的配音,转向 AI 驱动的解决方案需要我们展示能够在一个经常对 AI 持怀疑态度的行业中提供高质量的结果。

为了解决这种怀疑,我们首先通过创建一个完全许可的语音库来增强我们 AI 生成的语音的真实性。该库包含真实的人类语音样本,显著提高了我们的输出的自然性和表达性,这对于在好莱坞获得认可至关重要。

接下来,我们开发了专有技术,例如 eTTS ™,以及区域真实性所需的口音控制等功能。这些技术确保 AI 生成的语音不仅捕捉到情感深度和细微差别,还符合高质量配音所需的区域真实性。

我们还建立了一个专门的内部后期制作团队,与我们的技术密切合作。该团队微调 AI 输出,确保每个内容都是精致的,并符合行业的高标准。

此外,我们扩大了我们的方法,包括来自世界各地的全球专家网络——语音演员、语言学家和导演。这些专业人士带来了无价的文化洞察力和创造性专业知识,增强了我们的配音内容的文化准确性和情感共鸣。

我们的语言学团队与我们的技术和全球专家密切合作,确保语言用于目标受众的文化背景,进一步确保真实性和遵守当地规范。

通过这些策略,结合先进的技术、全球专家网络和内部后期制作团队,Deepdub 已经成功地向好莱坞和其他全球顶级制作公司展示了 AI 可以显著增强传统配音工作流程。这一集成不仅简化了生产,还扩大了市场扩张的可能性。

Deepdub 的 AI 驱动的配音技术与传统配音方法有什么不同?

传统配音是劳动密集型的过程,可能需要数月的时间来完成一个项目,因为它需要语音演员、音频工程师和后期制作团队手动重新创作不同语言的对话。我们的解决方案通过提供一个混合的端到端解决方案——将技术和人类专业知识结合起来——直接集成到后期制作工作流程中,减少本地化成本多达 70%,缩短交付时间多达 50%。

与其他 AI 生成的语音解决方案不同,我们的专有 eTTS ™技术允许达到传统方法难以实现的感情深度、文化真实性和语音一致性。

您能否带我们了解 Deepdub 使用的混合方法——AI 和人类专业知识如何在配音过程中协同工作?

Deepdub 的混合模型将 AI 的精度和可扩展性与人类专业知识的创造力和文化敏感性相结合。我们的方法将传统配音的艺术性与先进的 AI 技术相结合,确保本地化内容保留了原作的感情真实性和影响力。

我们的解决方案利用 AI 自动化本地化的基础工作,同时人类专业人士微调情感细微差别、口音和文化细节。我们结合我们的专有 eTTs ™和语音转语音(V2V)技术来增强 AI 生成的语音的自然表达性,确保它们捕捉到人类表演的深度和真实性。这样,我们确保每个内容在本地化形式中感觉与原作一样真实和有影响力。

语言学家和语音专业人士在此过程中发挥着关键作用,因为他们增强了 AI 生成内容的文化准确性。随着全球化继续塑造娱乐业的未来,AI 与人类艺术性的集成将成为内容本地化的金标准。

此外,我们的语音艺术家版税计划在 AI 辅助配音中使用其声音时,会向专业语音演员支付报酬,确保 AI 语音技术的伦理使用。

Deepdub 的专有 eTTS ™(情感文本转语音)技术如何提高配音内容中的语音真实性和情感深度?

传统的 AI 生成的语音通常缺乏使表演引人入胜的微妙情感线索。为了解决这一缺陷,Deepdub 开发了其专有的 eTTS ™技术,利用 AI 和深度学习模型生成不仅保留原演员表演的全部情感深度,还将人类情感智慧融入自动化过程中的语音。这种先进的功能允许 AI 微调合成语音以反映预期的情感,例如喜悦、愤怒或悲伤,与观众产生共鸣。此外,eTTS ™在产生高保真度的语音复制方面表现出色,模仿人类语音中的自然细微差别,例如音调、语调和节奏,对于传递真实和引人入胜的台词至关重要。该技术还通过灵活地适应输出以控制口音来增强文化敏感性,确保配音内容尊重和符合文化细微差别,从而增强其全球吸引力和有效性。

AI 生成的配音面临的一项常见批评是,它们可能听起来很机械。Deepdub 如何确保 AI 生成的语音保留自然性和情感细微差别?

我们的专有技术利用深度学习和机器学习算法提供可扩展、高质量的配音解决方案,保留原意、风格、幽默和文化细微差别。

除了我们的 eTTS ™技术,Deepdub 的创新套件还包括语音转语音(V2V)、语音克隆、口音控制和我们的语音情感库等功能,允许制作团队微调表演以匹配他们的创意愿景。这些功能确保每个语音都具有必要的感情深度和细微差别,以实现引人入胜的故事讲述和有影响力的用户体验。

过去几年中,我们在媒体和娱乐行业中看到我们解决方案的成功率不断提高,因此我们最近决定向开发人员、企业和内容创作者开放我们在好莱坞认证的配音 AI 音频 API。由我们的 eTTS ™技术驱动,该 API 允许实时语音生成,具有先进的自定义参数,包括口音、情感基调、节奏和语音风格。

我们的 API 的旗舰功能是音频预设,基于我们多年的行业经验,针对最常见的配音需求进行了设计。这些预配置设置使用户能够快速适应不同类型的内容,而无需进行大量的手动配置或探索。可用的预设包括音频描述和有声读物、纪录片或真人秀旁白、戏剧和娱乐、新闻播报、体育评论、动漫或卡通配音、交互式语音应答(IVR),以及宣传和商业内容。

AI 配音涉及文化和语言适应——Deepdub 如何确保其配音解决方案在文化上是适当和准确的?

本地化不仅仅是翻译文字——它是关于翻译意义、意图和文化背景。Deepdub 的混合方法将 AI 驱动的自动化与人类语言专业知识相结合,确保翻译的对话反映目标受众的文化和情感细微差别。我们的本地化专家与 AI 共同工作,以确保配音内容符合区域方言、表达和文化敏感性。

您目前正在努力将 AI 配音提升到下一个水平的最令人兴奋的创新是什么?

我们最大的即将推出的创新之一是实时配音,它将使直播广播(如体育赛事和新闻媒体)能够实时配音,使全球事件瞬间可访问。通过将其与我们另一个令人兴奋的创新——我们的 eTTs ™功能相结合,该功能允许从文本中以大规模和全面的情感支持和商业权利创建出人类听起来的语音,我们将能够提供与市场上任何其他产品都不一样的高质量、真实和情感丰富的实时配音。

例如,奥运会开幕式或任何直播活动,虽然当地广播商通常以其区域语言和方言提供评论,但该技术将使来自世界各地的观众能够在事件发生时以其母语体验整个事件。

实时配音将重新定义我们体验直播事件的方式,确保语言永远不会成为障碍。

AI 生成的配音在某些项目中面临批评。您认为哪些关键因素驱动了这些批评?

主要批评来自对真实性、伦理和质量的担忧。一些 AI 生成的语音缺乏必要的感情共鸣和细微差别,以实现沉浸式的故事讲述。在 Deepdub,我们通过开发情感丰富的 AI 语音来解决这个问题,确保它们保留了原表演的灵魂。Deepdub 在所有维度上实现了 70% 的卓越的观众满意度,包括精彩的选角、清晰的对话、无缝的同步和完美的节奏。

另一个问题是 AI 语音的伦理使用。Deepdub 是负责任的 AI 配音的领导者,开创了行业首个为 AI 生成的表演向语音演员支付版税的计划。我们相信 AI 应该增强人类的创造力,而不是取代它,这种承诺反映在我们构建的一切中。

您如何看待 AI 配音在未来 5-10 年内改变全球娱乐行业?

在接下来的十年里,AI 驱动的配音将使内容变得前所未有的民主化,使电影、电视节目和直播广播能够瞬间以观众的母语呈现给每个观众,无论他们在哪里。

我们设想一个世界,流媒体平台和广播商将实时多语言配音集成到他们的服务中,消除语言障碍,允许故事比传统的本地化方法更快、更远地传播。

超越语言可访问性,AI 配音还可以增强视障和视力障碍人士的媒体可访问性。许多人依赖音频描述来跟随视觉内容,AI 配音允许他们在字幕不可用时以其他语言参与外语内容。通过打破语言和感官障碍,AI 驱动的配音将有助于为所有人创造一个更加包容的娱乐体验,这在媒体可访问性方面的新法规即将实施的背景下尤为重要。

AI 配音成为主流之前,仍需要解决哪些最大的挑战?

最大的挑战是保持超高质量的规模化、确保文化和语言精度以及为 AI 生成的语音建立伦理准则。然而,超越技术障碍,AI 配音的公众接受取决于信任。观众需要感到 AI 生成的语音保留了表演的真实性和情感深度,而不是听起来人工或脱节。

为了让 AI 配音被完全接受,它必须在规模上结合人类的艺术性和技术,并且要尊重创作的完整性、语言细微差别和文化背景。这意味着确保声音保持原演员的意图,避免可能疏远观众的不准确性,并解决围绕深度伪造风险和语音所有权的伦理问题。

随着 AI 配音变得更加普遍,技术提供商必须实施语音真实性、安全性和知识产权保护的严格标准。Deepdub 正在积极领导这些领域的发展,确保 AI 语音技术增强全球故事讲述,同时尊重人类人才的艺术和专业贡献。只有这样,观众、内容创作者和行业利益相关者才会完全接受 AI 配音作为可信赖和有价值的工具。

感谢这次精彩的采访,希望了解更多的读者可以访问 Deepdub

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。