访谈

戴尔帕德首席战略官丹·奥康奈尔 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

丹是戴尔帕德的首席收入官。在此之前,他是TalkIQ的首席执行官,TalkIQ是一家实时语音识别和自然语言处理的初创公司,于2018年5月被戴尔帕德收购。在TalkIQ之前,他曾在AdRoll和谷歌担任过各种销售领导职位。

(GOOGL )

戴尔帕德是一款基于AI的云通信平台,使得与团队连接和协作变得更加容易和高效

您之前是TalkIQ的首席执行官,TalkIQ是一家实时语音识别和自然语言处理的初创公司,于2018年5月被戴尔帕德收购。是什么让这家初创公司在语音识别技术方面如此成功?

这是多种因素的结合:时机、人员和专注。自动语音识别(ASR)技术并不是新鲜事物,它已经存在了几十年——比人们想象的要长。近几年,ASR技术得益于计算能力的增加、云计算、数据集的可用性以及消费者市场中智能扬声器的广泛采用。所有这些因素都导致了转录的准确性提高。

除了这些趋势,我们还很幸运地将专家(如语言学家)与黑客结合起来。黑客是指能够快速将产品推向市场的工程师——他们推动创新并快速解决问题。虽然他们的解决方案可能并不总是最优雅的,但它们通常是最快的,并且可以让你被视为一个创新者,这在营销和销售方面是一个优势。

我们拥有该领域的专家,市场上的自然趋势,企业中应用该技术的巨大蓝海,以及一个拥有将创新技术推向市场的可复制的GTM动作的团队。

最后,我们采取了不同的方法来解决这个问题。传统的转录引擎的工作方式类似于录音带。你录制一个电话;你保存音频文件;你将其放入转录引擎中;然后,过一段时间,你就会得到输出。最初,30分钟的电话需要30分钟来转录,所以在大规模情况下,你会遇到真正的延迟。

我们想解决这个问题,构建一个流式或实时转录引擎,该引擎不需要音频文件。今天,这听起来可能有点新颖,但几年前,没有流式引擎可以处理实时长音频(8khz,即我所说的音质较差的音频——不是立体声质量的44khz)。我们不想构建一个录音机。

我们想构建一个实时引擎来理解和分析对话。如果我们能做到这一点,那么机会将是无穷的,因为你可以开始自动化工作流程并做出以前无法做到的事情。对于吉姆·帕尔默、埃蒂安·曼德施海德、凯文·詹姆斯、诺亚·加斯帕等人来说,他们是第一个构建此类实时引擎的人,这是一个巨大的成就。

您能否讨论一下戴尔帕德在2018年5月收购TalkIQ后的过渡期?

收购过程实际上非常顺利。戴尔帕德是TalkIQ的合作伙伴,我们的产品团队已经在戴尔帕德的现场工作了一周。我之前曾在谷歌与戴尔帕德的联合创始人克雷格·沃克和布莱恩·彼得森合作过,我很高兴能够与他们合作。

我们都认为这些技术(ASR/NLP)融入通信/协作平台中可以颠覆市场并改变企业的未来。这也是为什么在收购完成后不久,我们就获得了由ICONIQ领投的5000万美元融资。投资者看到了这些技术的未来应用和团队的工作机会。

在TalkIQ,我们基本上是一个试图同时成为三个不同的初创公司的初创公司:我们正在构建自己的电话堆栈、语音识别引擎和内部NLP技术。这些都是很难解决的问题。戴尔帕德已经成功地解决了电话方面的问题,所以当收购要约到来时,这是一个容易的决定。我们认为戴尔帕德是该领域最具创新性的商业通信平台,我们对未来的愿景非常吻合。

戴尔帕德使用了哪些不同的机器学习技术?

我们的原生语音智能(Vi)引擎利用AI和ML帮助组织推动销售、获得竞争优势、提高客户服务和更高效地举行在线会议。

TalkIQ的ASR和NLP技术用于实时接收语音和视频通话。同时,我们的专有技术允许我们处理传入的对话数据,并以行业领先的准确性将其准确捕获和转录为易于阅读的格式。

内置的ML帮助Vi随着时间的推移而改进。您使用Vi的次数越多,它就会学习得越好,并且在处理对话时变得越来越准确。随着时间的推移,电话记录的准确性将会提高,Vi将能够处理对话中更微妙的细节。

戴尔帕德最近在分析了超过10亿分钟的语音后,实现了一个重要的AI里程碑,基准测试显示戴尔帕德的转录模型超过了主要竞争对手,包括谷歌的增强电话模型。为了量化这些结果,进行了哪些测试?

我们有一组测试集,包含音频和相应的转录文本,这被认为是音频中所说内容的真实值。我们将相同的音频发送给每个竞争对手,并接收转录文本,然后将其与真实值进行比较。我们计算错误数量以确定准确性百分比。自2018年4月TalkIQ被收购以来,我们一直将自己与谷歌进行比较,直到现在,我们的准确性一直较低。

戴尔帕德的原生语音智能(Vi)引擎与竞争对手的引擎之间的主要区别是什么?

最大的区别之一是,我们做这件事的时间比竞争对手长,这意味着我们分析了更多的数据以确保我们的技术是最准确的。我们分析了超过10亿分钟的语音通信,并且每月使用我们的Vi引擎处理大约9,000万分钟的语音。从这个方面来说,我们比竞争对手领先了几年。

另一个区别是,我们的语言模型具有可定制性和可扩展性。对于每个客户,我们都会构建一个公司特有的关键词数据库,以便我们可以执行关键词提升来提高准确性。例如,对于一个名叫凯瑟琳的用户,她在一家名叫Skribbl的公司工作,我们的系统会正确拼写这些名字,而其他模型可能会将它们拼写为“凯瑟琳”和“涂鸦”。

您对自然语言处理的未来有何看法?多久才能达到近100%或100%的准确性?

完美的准确性几乎无法实现。也许有一天我会感到惊讶(我希望如此!)。我认为我们会非常接近,但不会达到100%。原因是自动语音识别(以及随后的NLP)有无限多的问题需要解决:口音、距离麦克风的距离、背景噪音、连接问题、不同类型的麦克风、说话速度、发音、上下文(萨拉与萨拉与塞拉)、首字母缩写、俚语等。虽然我希望能说我们会达到100%,但我认为我们会非常接近,但最后1-2%的准确性将会很困难。

话虽如此,我认为可读性方面会有一些有趣的发展。今天,当您查看对话转录时,它可能看起来像一串意识流。我们自然地以流畅的方式说话,使用连续的句子,重复单词,重新开始句子——我们做了很多我们在书面形式中不会做的事情。有机会使转录更易读——去掉冗余,预测或改进标点,优化转录以使其更容易阅读。

在我的脑海中,有两种版本:逐字的版本,它尽可能接近100%的对话记录(包括连续的句子等),然后还有一个增强的版本,它更容易消化,因为它有标点和优化。

这就引出了我们是否可以将对话浓缩成其最有意义的部分的问题。你需要完整的转录还是需要一个准确的摘要,格式化为易读的形式?

这当然取决于您的用例,但这就是这个领域的吸引人和令人兴奋之处。我们可能才刚刚开始探索可能性的第三个阶段,我们还没有涉及NLP将变得更加“上下文感知”的工作流程创新,在那里我们将使用以前的对话来提高准确性。

模型有多少具体的上下文可供学习,准确性就会提高多少。想象一下,在多次对话中共享相同的上下文,并不断适应上下文以使ML变得更智能。上下文感知技术对于提高准确性也很重要,考虑到我们沟通方式的巨大差异。对人类来说似乎很微妙的语言差异,对于训练ML模型来说却非常困难。

戴尔帕德目前为客户提供哪些服务?

戴尔帕德是一种更智能的工作方式。我们为当今的现代混合型工作队伍构建了该平台——赋予人们和团队更高效、更有效、更投入的能力,无论他们在世界的哪个地方。我们提供无与伦比的质量、安全性和可靠性的无缝商业通信体验——电话、聊天、视频会议和呼叫中心。戴尔帕德以统一的云平台的形式提供这种体验,该平台具有经济高效、易于部署和管理的特点。

您还想分享关于戴尔帕德的其他信息吗?

2020年对公司来说是一个里程碑式的年份,考虑到世界正在经历(并继续经历)的事情,这真的很令人惊讶。我们将员工人数增加了一倍,获得了1亿美元的资金,收购了一家公司,并且客户群体呈指数级增长。

随着远程工作的到来,我们预计这种增长将继续下去,我们对即将到来的年份感到兴奋。我们相信“在任何地方工作”的趋势将增强对帮助员工更聪明地工作(而不是更辛苦地工作)的创新技术的需求。公司将转向AI,以提高效率、消除重复性任务,并使员工能够专注于更大的优先事项。戴尔帕德非常适合满足这些需求。

感谢这次精彩的采访,希望了解更多的读者可以访问戴尔帕德

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。