访谈
尼古拉·默克希奇,PolyAI联合创始人兼首席执行官 – 采访系列

尼古拉·默克希奇是PolyAI的联合创始人兼首席执行官,PolyAI是一家领先的企业级语音助手供应商,专门为自动化客户服务提供解决方案。
是什么最初吸引你进入人工智能领域?
我从很小的时候就对数学和计算机科学感兴趣。在剑桥大学学习期间,我有机会与几位领先的机器学习研究人员合作,包括Steve Young和Zoubin Ghahramani。Steve说服我加入他的创业公司VocalIQ,共同开发语音对话系统。后来,我又与Steve一起完成了博士学位,研究数据驱动的语言理解模型,以适应不同的用例和语言。对话式人工智能是一个非常具有挑战性和复杂性的领域,仍然有很多科学和工程上的突破等待我们去实现,所以我一直在这个领域工作。
2017年,你创立了PolyAI,一家对话式人工智能公司,可以谈谈PolyAI的创立故事吗?
我的联合创始人Shawn Wen、Eddy Su和我在剑桥大学一起读博士。我们多年来一直在研究对话系统,但很快意识到我们所熟悉的复杂系统在商业应用中非常少见。所以,我们一起创立了一家公司,旨在开发出能够在现实世界中发挥作用的对话式人工智能解决方案。我们看到了真正的对话式、多轮、事务性对话系统的机会,这些系统可以与现实生活中的人们进行交互。
我们专注于客户服务,因为我们认为当前的技术能力和客户需求非常匹配。
可以谈谈你们使用的机器学习和自然语言处理技术吗?
我们的主要核心技术是我们的一套专有编码器模型。我们已经在数十亿个自然对话中预训练了这些模型,所以它们可以提取意图,即使输入语音使用了俚语或成语。这种能力在电话交互中非常重要。客户不会使用关键词说话;他们讲故事,打断,提问,想要控制整个对话。
我们最近宣布了我们的ConVEx模型,这是一个极其数据高效的实体提取器,允许我们从对话中准确提取值。
我们的语音识别编排过程涉及使用语音识别平台来消除不同口音和语境噪音,并根据不同的语境进行微调。
我们还开发了一个相当强大的对话策略库,包含预设计的常见客户服务事务,我们可以非常快速地为客户启动一个新的语音助手。
在你的看法中,什么区别了一个好的对话式人工智能产品和一个差的对话式人工智能产品?
一个好的产品始终能够理解用户的意图,并且永远不会让用户重复自己。电话交互通常发生在嘈杂的环境中,所以产品需要能够抵御杂乱的输入。随着品牌接触到更大的市场,产品需要能够理解各种口音和表达意图的方式。这些都需要产品能够保证强大的语音识别能力、坚固的意图分类和实体提取。
一个伟大的产品将会积极地吸引用户。它将跟随用户的思维流程,并能够处理复杂的日常情况,用户可能会同时分享多个意图和信息,并且可能在不同的上下文之间跳转。这些需要强大的多标签分类和上下文管理。
一个吸引人的产品将会表现出人类的特征,而不会变得过于生硬或机器人般。它需要快速的交互、真实的声音、持续的反馈提示和一定的随机性和不完美性。
最后,一个伟大的对话式人工智能产品将会在任何地方与用户交互,并提供无缝的、特定于平台的体验,这可能会跨越语音、短信、聊天或社交消息平台。交互范式应该拥抱每个通信平台的特异性。
公司使用对话式人工智能而不是尝试将询问引导到聊天机器人有什么优势?
客户体验至关重要,已经成为客户留存的关键驱动力。首要任务应该是让客户轻松地做他们需要做的事情。
电话仍然是大多数客户首选的联系公司的渠道。高达65%的所有客户交互仍然发生在电话上。在COVID-19大流行期间,联系中心被推到了极限,更多的客户 than 以前打电话寻求支持。
当然,一个伟大的体验允许客户以他们喜欢的方式进行交流,所以对于任何喜欢异步通信的人,我们都让品牌能够提供相同水平的体验,跨越文本渠道。
检测客户试图说什么的意图有多大挑战?
通过语音渠道理解客户有几个挑战。准确、持续地理解用户的意思需要多个组件协同工作。
首先,语音识别很困难,特别是当人们在嘈杂的环境中打电话时,例如当他们使用扬声器或在交通或隧道中驾驶时。语音识别在不同口音和方言的地区也可能很困难。我们已经开发了一种有效的方法来偏置语音识别模型,以优化语音识别。
因为我们的ConveRT模型已经在如此大量的对话数据中预训练,所以它能够在弱信号上检测意图,就像人类一样,即使我们错过一个或两个词,我们也可以理解别人在说什么。
另一个考虑因素是理解用户何时想要同时执行多个操作。例如,某人可能会说,“我丢了我的卡。可以告诉我它是否被使用过并且阻止它吗?”在这种情况下,模型需要识别两个意图并以有意义的顺序执行它们。
模型还需要能够提取和理解客户提供的实体。例如,“星期六午餐时有没有给我、我的妻子和两个孩子的桌子?”表面上的意图是检查桌子可用性,但模型需要提取日期(星期六)和人数(4),以及可能相关的任何其他潜在信息(例如,儿童可能只允许在餐厅区域就座,而不能在酒吧就座)。
最后,交谈并不总是线性的。客户可能会打断并提出与语音助手提示无关的问题,所以助手需要能够“倾听”一种类型的输入,同时对不同的触发器(如FAQ或之前由用户提供的信息更改)保持开放。
一家公司想要使用PolyAI启动一个对话式人工智能机器人需要什么样的流程和时间表?
我们在这里提供具有切实商业影响的语音助手。因此,我们的每个参与都从发现开始,我们帮助客户识别和阐明他们的客户体验目标、关键指标和支持流程。这就是我们规划语音助手将引导客户通过的旅程的地方。由于我们预训练的ConveRT模型,我们不需要大量的对话数据来自客户。
从那里开始,我们可以开发一个语音助手,需要客户的输入非常少,所以这对客户的内部IT团队来说不是很大的负担。
根据复杂程度的不同,我们可以在短短2周内启动一个价值证明,并在2个月内实现全面部署。
感谢这次精彩的采访,希望读者能够通过访问PolyAI了解更多信息。












