访谈

AssemblyAI 的 Dylan Fox 首席执行官兼创始人 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Dylan Fox 是 AssemblyAI 的首席执行官兼创始人,AssemblyAI 是一个可以自动将音频和视频文件以及实时音频流转换为文本的平台,使用 AssemblyAI 的语音转文本 API。

是什么最初吸引你进入机器学习领域?

我最初通过学习编程并参加华盛顿特区的 Python 会议开始了我的职业生涯。在大学课程中,我发现自己更倾向于算法类型的编程问题,这自然让我进入了机器学习和 NLP 领域。

在创立 AssemblyAI 之前,您曾是 Cisco 的高级软件工程师,您在那里工作的内容是什么?

在 Cisco,我是一名高级软件工程师,专注于他们的协作产品的机器学习。

您在 Cisco 的工作和语音识别技术的来源问题如何激发您创立 AssemblyAI 的想法?

在我之前的工作中,我有机会参与了许多 AI 项目,包括几个需要语音识别的项目。但所有提供语音识别服务的公司都非常过时,很难从他们那里购买任何东西,而且他们使用的 AI 技术已经过时。

随着我对 AI 研究的兴趣越来越大,我注意到语音识别领域的研究进展非常迅速。所以,这是一个综合因素让我想到,“如果你可以建立一个类似 Twilio 的 API 公司,使用最新的 AI 研究,使开发人员更容易访问最先进的 AI 模型用于语音识别,拥有更好的开发者体验。”

正是从那里,AssemblyAI 的想法诞生了。

构建准确可靠的语音识别技术面临的最大挑战是什么?

成本和人才是任何公司在构建准确可靠的语音识别技术时面临的最大挑战。

数据的获取成本很高,通常需要数十万小时的数据来构建一个强大的语音识别系统。另外,训练这些模型需要巨大的计算资源,并且在生产环境中提供这些模型也很昂贵,需要专门的人才来优化和使其变得经济。

构建这些技术还需要专门的技能,这种技能很难找到。这也是为什么客户来到我们这里,使用我们研究、训练和部署的强大 AI 模型的原因。他们可以通过一个简单的 API 访问到多年的 AI 研究成果,包括语音识别和 NLP 任务的最先进 AI 模型。

除了纯粹的音频和视频内容转录,AssemblyAI 还提供其他模型,可以讨论这些模型吗?

我们的 AI 模型套件超出了实时和异步转录。我们将这些额外的模型称为音频智能模型,因为它们帮助客户分析和更好地理解音频数据。

我们的总结模型提供了一个总体的摘要,以及时间码的摘要,自动分段和生成每个“章节”的摘要(类似于 YouTube 章节)。

我们的情感分析模型检测音频文件中每个句子的情感。每个句子可以被标记为正面、负面或中立。

我们的实体检测模型识别音频文件中提到的广泛的实体,例如人名、公司名、电子邮件地址、日期和位置。

我们的主题检测模型标记音频和视频文件中讨论的主题。预测的主题标签遵循标准化的 IAB 分类法,这使得它们适合上下文目标。

我们的内容审核模型检测音频和视频文件中的敏感内容,例如仇恨言论、暴力、敏感的社会问题、酒精、毒品等。

使用 AssemblyAI 的公司的最大用例是什么?

使用 AssemblyAI 的公司的最大用例跨越四个类别:电话、视频、虚拟会议和媒体。

CallRail 是一个很好的例子,他们是我们的客户,属于电话类别,利用 AssemblyAI 的 AI 模型——核心转录、自动转录亮点和 PII 红action——为其客户提供强大的对话智能解决方案。

基本上,CallRail 现在可以自动在其电话中为其客户提供关键内容的表面和定义——关键内容,例如特定的客户请求、常见问题和频繁使用的关键词和短语。我们的 PII 红action 模型帮助他们自动检测和删除转录文本中发现的敏感数据(例如社会安全号码、信用卡号码、个人地址等)。

视频 用例范围从视频流媒体平台到视频编辑器,如 Veed,它使用 AssemblyAI 的核心转录模型来简化用户的视频编辑过程。Veed 允许其用户转录其视频并使用字幕直接编辑它们。

虚拟会议 中,会议转录软件公司,如 Fathom,使用 AssemblyAI 来构建智能功能,以帮助其用户转录和突出其 Zoom 通话的关键时刻,促进更好的会议参与度和消除会议期间和之后的繁琐任务(例如记笔记)。

媒体 中,我们看到播客托管平台,例如,使用我们的内容审核和主题检测模型,以便他们可以为品牌安全用例提供更好的广告工具,并使用动态广告来货币化用户生成的内容。

AssemblyAI最近完成了3000万美元的B轮融资。这将如何加速AssemblyAI的使命?

AI 领域的进展非常令人兴奋。我们的目标是通过一个简单的 API 将这种进展暴露给互联网上的每个开发人员和产品团队。随着我们继续研究和训练最先进的 AI 模型用于语音识别和 NLP 任务(如语音识别、总结、语言识别和许多其他任务),我们将继续通过简单的 API 将这些 AI 模型暴露给开发人员和产品团队——免费提供。

AssemblyAI 是一个开发人员和产品团队可以来这里轻松获取他们需要的先进 AI 模型的地方,以便他们可以构建令人兴奋的新产品、服务和整个公司。

在过去的 6 个月里,我们已经推出了对 15 种新语言的语音识别支持——包括西班牙语、德语、法语、意大利语、印地语和日语,发布了我们总结模型、实时语音识别模型、内容审核模型和无数其他产品更新

我们几乎没有使用我们的 A 轮资金,但这笔新资金将使我们能够大幅加快我们的努力——而不妥协我们的跑道。

有了这笔新资金,我们将能够加速我们的产品路线图,构建更好的 AI 基础设施来加速我们的 AI 研究和推理引擎,并扩大我们的 AI 研究团队——今天包括来自 DeepMind、Google (GOOGL ) Brain、Meta AI、BMW 和 Cisco 的研究人员。

您是否还有其他关于 AssemblyAI 的内容想要分享?

我们的使命是通过一个简单的 API 将最先进的 AI 模型暴露给开发人员和产品团队,以极大的规模使其可访问。

感谢这次伟大的采访,希望了解更多的读者可以访问 AssemblyAI

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。