访谈

WellSaid Labs联合创始人Matt Hocking – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Matt Hocking是WellSaid Labs的联合创始人,WellSaid Labs是一家领先的企业级AI语音生成公司。他拥有超过15年的经验,领导团队并在规模上交付技术解决方案。

您的背景相当具有创业精神,您最初如何涉足AI领域的?

我一直认为自己是具有创业精神的人。我大学毕业后就创办了我的第一家公司,拥有产品设计背景,我发现自己被吸引到帮助人们早期创业的想法。整个职业生涯中,我有幸与许多后来取得了令人难以置信的成功的初创公司合作。在这些经历中,我亲眼目睹了许多伟大的创始人的工作,反过来激励我追求自己的创业想法。AI对我来说是相对新的,当我加入AI2时;然而,这段经历给我提供了机会,将我的产品和创业视角应用于一些真正令人惊叹的研究,并想象这些新进步将如何在未来几年帮助很多人。从一开始,我的目标就是开发真正的业务,为真正的人们服务,我相信AI有潜力在我们的未来创造许多令人兴奋的机会和效率,如果应用得当的话。

您能分享一下WellSaid Labs的想法是如何在您担任The Allen Institute for AI的企业家驻地时诞生的故事吗?

我于2018年加入The Allen Institute for Artificial Intelligence(AI2)作为企业家驻地。可以说,AI2是世界上最具创新性的孵化器,汇集了AI领域最优秀的头脑,他们将今天可能的边缘解决方案应用于解决全球问题的有形产品。我的设计和技术背景培养了我长期以来对创意领域的兴趣,随着我们今天所见到的AI浪潮,我想探索一种方法,将创意领域与AI连接起来。我在开发一个交互式医疗应用程序时认识了Michael Petrochuk(WellSaid Labs的联合创始人和CTO),该应用程序指导患者完成各种敏感场景。在开发内容的过程中,我的团队与配音人才合作,预先录制了成千上万行的配音用于角色。当我接触到Michael在研究中取得的突破时,我们很快看到了将人工智能语音合成(TTS)技术应用于我正在开发的产品以及其他应用和行业的价值。技术和工具难以跟上使用语音作为媒介的制作人的需求。我们看到了将这一技术置于所有创作者手中的道路,允许语音成为所有故事的不可或缺的一部分。

WellSaid Labs是少数为配音人才提供进入AI语音领域机会的公司之一。为什么您认为将真正的语音融入产品中很重要?

我们的答案是双重的:首先,我们希望创建能够补充专业配音人才能力的解决方案,扩展语音机会。其次,我们努力在产品中实现最高水平的人类质量。我们的配音人才是长期的合作伙伴,他们因其语音数据和随后使用其语音制作的内容而获得报酬和收入分成。我们雇佣的每位配音人才都因其语音在我们的平台上的使用情况而获得报酬。我们鼓励人才与我们合作;对他们的贡献给予公平的报酬对我们来说非常重要。

为了提供市场上最高质量的人类级产品,我们必须严格控制数据来源。这个过程使我们能够控制质量,因为我们训练我们的深度学习模型既能达到人类水平,又能符合特定的上下文风格。我们不仅仅创建一个能朗读输入内容的语音。我们的模型提供了多种语音风格,可以表演页面上的内容。无论用户是使用我们库中的角色还是为其品牌创建自定义语音,他们都使用真实的语音数据来确保无缝的过程和易于使用的平台。如果我们的客户需要在后期制作中操纵和编辑我们的语音,获取所需输出的过程将会很笨拙且耗时。我们的语音考虑到书面内容的上下文,并提供上下文准确的朗读。我们为所有类型的用例提供语音,无论是朗读新闻、制作音频广告还是自动呼叫中心支持,我们都与专业配音人才合作,以确保我们为每种用例提供高质量的语音数据和上下文。

我们定期更新和添加新的风格和口音到我们的角色库,以确保我们代表客户的声音。WellSaid Labs的工作室允许客户和品牌根据地区、风格和用例试听不同的语音,从而实现更无缝的音频内容生产,满足创作者的需求。一旦用户录制了初始录音,他们就可以提示特定的单词、拼写和发音,以确保AI始终按照他们的需求准确发音。

WellSaid Labs正在成为第一个具有道德的AI语音平台。为什么AI道德对您来说很重要?

随着AI的采用率增加并变得更加主流,人们对有害用例和不良行为者的恐惧正成为每次对话的中心——这些担忧不幸地被现实事件所证实。AI语音并非例外;几乎每天都会有关于名人、公众人物或政治家被深度伪造用于广告或政治目的的报道。虽然联邦法规对于这项技术仍在不断演变,但检测和打击恶意行为者和合成语音的滥用将变得越来越困难,因为这项技术会继续进步。

来自AI2,AI道德是核心原则,Michael和我从第一天开始就讨论了这些问题。开发AI语音技术带来了关于同意、隐私和整体安全的重大责任。我们知道,作为开发者,我们必须安全地构建我们的技术,解决道德问题,并为合成语音的未来发展奠定基础。我们认识到AI语音技术的滥用潜力,并致力于减少我们产品的潜在滥用。我们需要从第一天开始就打下这个基础,而不是快速发展并沿途犯错。这不会为我们的企业客户和配音人才做对,他们依赖我们构建一个高质量、值得信赖的产品。

我们完全支持这一领域的立法呼吁;然而,我们不会等待联邦法规的颁布。我们一直优先考虑并将继续优先考虑支持隐私、安全、透明和问责的做法。

我们严格遵守公司的道德意图准则,该准则基于在每个决策中进行负责任的创新。这是为了我们全球客户——企业品牌的最佳利益。

如何开发一个具有道德的AI语音平台?

WellSaid Labs从开始就致力于道德创新。我们通过使用内部数据模型、明确的同意要求、内容审查计划和对品牌保护的承诺来集中信任和透明度。WellSaid,我们依靠负责任的AI原则来指导我们的决策和设计,这些原则也适用于我们语音的使用。我们的道德准则代表了这些原则:问责、透明、隐私和安全、公平。

问责:我们维护严格的标准,禁止使用我们的语音进行有害、仇恨、欺诈或煽动暴力的内容。我们的信任和安全团队维护这些标准,通过严格的内容审查计划,阻止和删除试图违反我们的服务条款的用户。

透明:我们在使用某人的语音数据构建合成语音之前需要明确的同意。用户无法上传政治家、名人或其他人的语音数据来创建他们的声音克隆,除非我们获得该人的明确、书面同意。

隐私和安全:我们通过使用库存图像和别名来代表合成语音来保护我们的配音人才的身份。我们还鼓励他们在与他人分享与WellSaid Labs或其他合成语音公司的关联时谨慎,以减少他们的声音被滥用的机会。

公平:我们为提供语音数据的所有配音人才提供报酬,并为使用我们使用他们数据构建的合成语音提供持续的收入分成。

除了这些原则之外,我们还严格尊重知识产权。我们不声称拥有用户或配音人才提供的内容的所有权。我们在一切事情中优先考虑诚信、公平和透明度,以确保我们的合成语音技术被负责任和道德地使用。我们积极寻求与来自不同背景、组织和经验的配音人才合作,以确保WellSaid Labs的语音库反映其创作者和受众。

我们致力于负责任的创新和以道德为重点的AI语音技术开发使我们与其他公司区别开来,其他公司试图通过任何手段在这个新兴的、未受监管的行业中获利。我们早期在道德、安全和隐私方面的投资为我们赢得了配音人才和客户的信任,他们越来越多地寻求来自创新公司的道德产品和服务。

WellSaid Labs创建了自己的内部AI模型,使其AI语音达到人类水平,并通过将人类对话中的缺陷引入对话中实现了这一点。这些缺陷的哪些方面使AI更好,以及这些缺陷如何实现?

WellSaid Labs不仅仅是一个TTS生成器。在早期TTS技术无法识别人类语音质量,如音调、语调和方言,这些语音质量传达了话语背后的情境和情感时,WellSaid语音已经达到人类水平,带来了独特的人类缺陷到AI生成的语音中。

我们的主要语音质量衡量标准始终是人类的自然性。这一指导原则在每个阶段都塑造了我们的技术,从我们构建的脚本库到我们给人才的指示,最近,我们如何迭代我们的核心TTS算法。

我们训练真实的人类语音。我们的配音人才以真实和吸引人的方式为我们朗读他们的脚本。另一方面,完美的语音是一个机械概念,导致输出不自然、机器人般的完美。当专业的配音人才表演时,他们的语速会波动。他们的响度会随着他们正在朗读的内容而变化。他们的语音音调可能会在需要激动的朗读时上升,在更严肃的行中下降。这些动态变化构成了一个引人入胜的人类语音表演。

通过构建与我们专业人才的动态表演相协调的AI过程,我们构建了真正自然的TTS平台。我们开发了第一个具有整个创作过程中的预测控制的长篇TTS系统。我们的音素库包含多样化的音频数据,允许用户在生产阶段将特定的语音提示、发音指南或可控性纳入模型。WellSaid用户可以在一个平台上录制、编辑和样式化他们的语音,无需导入外部数据。

您能讨论一下构建一个基于文本到语音(TTS)的AI公司的一些挑战吗?

AI语音技术的发展为其生产者和消费者带来了一个全新的障碍。主要挑战之一是不要被AI领域的噪音和炒作所左右。作为一项新兴的、热门的技术,许多组织都试图在短期内从AI语音开发中获利。我们希望为每个人提供语音,遵循核心的道德原则和真实性。这一对真实性的坚持可能会延迟我们技术的开发和部署,但巩固了WellSaid语音和数据的安全性和安全性。

开发我们的TTS平台面临的另一个挑战是制定特定的同意指南,以确保组织或个人不会滥用我们的技术。为了应对这一挑战,我们寻求长期的合作伙伴关系,并完全参与语音开发,以增加问责制、透明度和用户安全性。我们积极寻求与来自不同背景、组织和经验的配音人才合作,以确保WellSaid Labs的语音库反映其创作者和受众。这些过程是故意的、注重细节的,以确保我们的技术被使用得尽可能安全和道德,这可能会减慢开发和发布的时间表。

您对生成性AI语音的未来有什么展望?

长期以来,AI语音技术还没有达到足够高的质量,以使公司能够大规模创建有意义的内容。现在,音频技术不再需要昂贵的设备和硬件,所有书面内容都可以以音频格式生产和发布,以创建吸引人、多模式的体验。

今天,AI语音可以产生类似人类的音频,并捕捉到使数字故事更易访问和自然所需的细微差别。生成性AI语音的未来将是包罗万象的可听体验,影响我们生活的各个方面。随着技术的进步,我们将看到越来越自然和富有表现力的合成语音模糊人类和机器生成语音之间的界限——为业务、沟通、可访问性以及我们与周围世界的交互方式开启新的机会。

企业将在AI语音界面中找到增强的个性化,并使用它们使与虚拟助手的交互更加身临其境和用户友好。这些增强功能已经在发生,从智能呼叫中心代理到快速服务驱动。内容创作,包括广告、产品营销、新闻旁白、播客、有声书和其他多媒体,将通过使用开发吸引人内容的工具而变得更加高效——最终增加组织的提升和收入,尤其是现在多语言模型可以将公司的影响范围从单一点扩展到全球。制作团队将在使用合成语音创建品牌需求的语音或为听众定制语音方面找到巨大的好处。

在AI出现之前,TTS技术缺乏传达完整故事所需的人类情感、语调和发音能力。现在,AI驱动的TTS提供了更身临其境和更易访问的体验,包括实时语音能力和交互式对话代理。

实现类似人类的语音能力是一段旅程,但现在它是可以实现的,我们正在见证AI语音的全部范围,为组织创造真正的业务价值。

感谢这次精彩的采访,希望了解更多的读者可以访问WellSaid Labs。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。