访谈
安德鲁·米西(Andrew Missey),Convos 的首席技术官和联合创始人 – 采访系列

安德鲁·米西(Andrew Missey),Convos 的首席技术官和联合创始人,是一位软件工程师和产品领导者,具有人工智能产品开发、软件架构、网络和全栈工程经验。在联合创立 Convos 之前,他曾在 Forum3 帮助开发和发布两个人工智能驱动的创意和营销平台,结合了实践工程和技术产品管理。他的早期角色在 N-able (NABL )、Autoshop Solutions 和 Brand IQ 涉及使用包括 Svelte、NestJS、Angular 和 JavaScript 在内的技术构建前端应用程序、后端系统、客户仪表板和内部软件工具。这种多学科背景使他能够将技术执行与产品战略相结合,因为他领导了 Convos 人工智能驱动的通信平台的开发。
Convos 是一个受控的人工智能驱动的短信平台,旨在帮助政治运动和通信公司用大规模的个性化双向对话取代单向大规模消息传递。该平台将响应转换为实时情绪分析、主题分类、呼吁行动结果、参与度指标和结构化的选民洞察,这些洞察可以帮助运动改进他们的宣传。其闭环系统的人工智能在运动批准的材料和消息护栏内运行,同时提供联系人分段、对话历史、链接跟踪、数据导出和合规性审计跟踪等功能。Convos 还可以补充组织现有的短信基础设施,而无需替换其当前的通信系统。
您在观察到政治和组织短信大多是单向通信后联合创立了 Convos。最初的洞察是什么,使您相信有机会将大规模短信转变为人工智能驱动的对话,您在构建该平台时面临的最大技术挑战是什么?
这种洞察来自于我自己是受众的一员。
在 2024 年的大选期间,我像很多人一样被政治短信轰炸。有一次,我开始回复这些短信。我会问一个问题或做出回应,但从来没有收到任何回复。这些短信以百万为单位发送,但当你尝试进行真正的交流时,却没有人会回应。
这让我觉得这是一个巨大的错失机会。对方已经参与了对话。他们提出了一个真正的问题。但是,从来没有任何回应。
Convos 的想法很简单。将广播转变为真正的对话,规模化,并且不需要一屋子的人来维护它。
最大的技术挑战归结为三件事:规模、延迟和合规性。
规模是最明显的。您同时管理着成千上万的对话,每个对话都有自己的状态和历史。延迟比人们预期的更重要。如果有人回复,回复太慢,时机就过了。短信感觉几乎是即时的,体验必须与之匹配。
合规性是最难的部分,也是我们从一开始就优先考虑的。政治短信受到严格监管,犯错不是一个选项。我们早期的大部分工程都投入到确保系统保持在信息轨道上,并尊重同意和退出的方式,这些方式远远超过了简单地捕捉“停止”这个词。
Convos 位于对话式人工智能、大规模消息传递和实时情绪分析的交叉点。您从部署必须同时与成千上万人进行交互的人工智能系统中得到了什么启示,同时仍然感觉个人化和真实?
最大的教训是“规模化的个性化”是需要工程设计的东西。它不会自动发生。
当您同时运行成千上万次对话时,很容易把它们当作一个大批次来处理。但是,收到短信的人并不关心您的批次。对他们来说,这是一对一的交流,它必须感觉像这样。每次对话都必须带有自己的上下文和历史,这样回复才能真正响应特定的人所说的话,而不是对所有人进行平均处理。
我们还学会了密切关注人们真正告诉我们的内容。回复不仅仅是一条回复。它带有情绪。有人可以用问题、热情、沮丧或明确的信号来回应,表明他们想被留下。正确地读懂这些细微差别是使互动成功或失败的关键。
最终,真实性来自于倾听,而不是听起来很聪明。感觉最像人类的交流是真正回答实际问题并尊重对方时间的交流。
您认为许多组织过于关注模型基准,而忽视了个性和沟通风格。为什么您认为个性正在成为企业人工智能部署的关键因素,以及组织应该如何评估它?
基准衡量能力。它们不衡量合适性。
一个模型可以在推理或编码方面取得极高的分数,但仍然是对话的错误选择。它的措辞方式、正式或非正式的语气、简洁的能力都非常重要,一旦真正的人参与进来,这些因素就会变得非常重要。在我们的世界中,模型不是在解决数学问题。它代表着一个运动,在短信中。每个运动都有自己的声音,模型必须与之相匹配,而不是强加自己的声音。如果语气不对,即使底层模型再聪明,也无关紧要。互动失败了。
还有一个能力方面的因素,基准测试没有捕捉到。一个运动可以为代理提供详细的指导,告诉它该说什么、避免什么以及如何处理特定话题。模型必须始终遵循所有这些指导,整个对话过程中都保持一致。有些模型在保持复杂指令而不在对话中途偏离轨道方面比其他模型更好。这种能力也是个性的一部分,因为一个听起来很棒但停止遵循其指令的模型不是你可以把它放在真正的人面前的模型。
这就是为什么个性正在成为企业部署中的一个真正因素。随着模型变得越来越强大,原始能力之间的差距正在缩小。剩下的就是性格。它们如何交流,以及它们是否保持在您为它们设置的界限内。
评估它的方法不是通过排行榜。它是测试模型在实际使用场景中,使用实际内容,并以最终用户的方式阅读输出。我们将模型投入到它们将在生产中处理的确切交互中,并根据对话是否感觉正确来判断它们。这比基准测试得分告诉我们更多的信息。
您的团队已经测试了多个领先模型,并观察到它们在任务中的性能存在显著差异。您从部署必须同时与成千上万人交互的 AI 系统中学到了什么关于当前主要大型语言模型的优缺点?
我们学到的东西是,没有单一的最佳模型。只有最适合特定工作的模型。
有些模型在精确遵循指令方面非常出色,这在需要系统严格遵守界限的情况下很重要。有些模型在自然、对话式语气方面更强。有些模型更快,这在延迟成为体验的一部分时是一种优势。其他模型在推理通过复杂请求方面更好,但在随意的交流中感觉僵硬或需要太长时间来回应。
对于对话式工作,重要的品质并不总是能在头条新闻中看到。速度很重要。一致性很重要。知道何时简洁很重要。一个能写出漂亮的三段答案的模型往往是错误的选择,当正确的答案是一句话时。
这些都没有出现在排行榜上。你只会通过将模型投入实际工作并关注它们如何处理它来了解这些信息。
许多公司正在采用多模型策略,而不是依赖单一 AI 提供商。构建可以在模型之间切换的系统有什么优势,需要什么样的架构考虑?
主要优势是您不再被锁定。
如果您将所有内容都构建在一个提供商的基础上,您将继承他们的所有约束。他们的定价、速率限制、延迟、停机和发布时间表都将成为您的。多模型方法允许您将每个任务路由到处理它的最佳模型,并在一个提供商遇到糟糕的一天时为您提供一个去处。
这还允许您将成本与工作相匹配。并非每次交互都需要您的最强大、最昂贵的模型。能够将简单的工作发送到更轻的模型,并为更难的案例保留更强大的模型,在规模上会产生巨大的差异。
架构是使其成为可能的关键。您需要在应用程序和特定模型之间构建抽象层。您的系统不应该在整个代码库中直接与某个提供商的 API 交谈。它应该与您自己的内部接口交谈,并且该接口决定哪个模型实际处理请求。
一旦您拥有了它,您就可以添加路由逻辑、当提供商失败时的回退以及在不重写应用程序的情况下切换模型的能力。您还需要在模型之间处理提示和输出的一致处理,因为每个模型的行为略有不同,您的系统必须平滑这些差异。
这需要更多的前期工作。但是,它为您购买了很难以后添加的灵活性。
您最近强调了人工智能模型的快速演变,新发布的模型有时会以意想不到的方式改变性能特征。企业如何平衡采用最新模型的愿望与稳定性、可靠性和可预测性能的需求?
诚实的答案是,新模型在您证明它是升级之前,它不是升级。
每次发布都令人兴奋,有真正的压力去立即采用最新的东西。但我们已经看到新模型的行为方式超出了我们的预期。曾经可靠工作的东西开始以我们不期望的方式做出回应,在生产系统中,这些小的变化会积累起来。
我们处理它的方式很简单。没有一个模型在我们自己手动测试之前会进入我们的流水线。当新发布的模型出来时,我们不会相信基准测试或公告。我们坐下来自己运行它,使用它将在生产中处理的相同类型的对话,并自己阅读输出。
这种亲手操作的步骤对于我们来说是必不可少的。一个模型在纸面上可能看起来更好,但实际上可能以我们不愿意将其呈现给选民的方式处理真正的交互。唯一的方法是将其投入到我们系统每天处理的相同情况中,并看看它实际上如何响应。
这也是抽象层的作用。因为我们的应用程序不依赖于特定的模型,我们可以将新发布的模型带入,测试它与我们实际处理的对话,并以诚实的方式将其与我们当前运行的模型进行比较。如果它通过了,我们就切换。如果没有,我们就等待。
幻觉仍然是企业人工智能采用的最大障碍,尤其是在处理大型数据集和复杂信息时。您在生产环境中减少幻觉方面发现了什么实用技术最为有效?
我们发现最有效的技术是限制模型可以知道的内容。
很多幻觉来自于要求模型从其自身的常识中回答,在这种情况下,它会很乐意用听起来正确的东西填补空白。我们做相反的事情。我们的 AI 严格地从运动提供的信息中工作。它没有访问开放的互联网,也没有从对世界的模糊记忆中汲取信息。
如果答案不在提供的材料中,正确的回应是说它没有该信息。这个简单的界限消除了巨大的风险。
但我们并没有就此止步。我们有多个检查来确保回复与运动提供的信息相匹配。即使在模型生成回复之后,回复也会与运动的信息进行交叉检查,然后再发送出去。如果有什么不符,什么也不会被发送出去。
除此之外,实用技术是关于基础和护栏。为模型提供它面前任务所需的特定、相关的上下文,而不是巨大的、未区分的数据堆。信息越集中,就越少有机会偏离轨道。
我们还为系统设置了明确的界限和限制,并监控真正的对话,而不是假设一切都很好。您不会通过信任模型来捕捉问题。您通过观察输出来捕捉它们。
在像政治短信这样受监管的领域,一个编造的答案是一个负担,所以我们设计了系统来偏爱透明度而不是猜测。
随着组织在客户支持、通信、营销和运营中部署人工智能代理,您看到团队在从试点项目转向生产规模部署时反复犯什么错误?
我看到的最常见的错误是,团队测试代理是否有效,但没有测试它是否可以被破坏。
我数不清有多少次公司发布了人工智能聊天机器人,第二天就有人在线将其“越狱”,使其说出从未被设计过的话。它被诱骗出轨,或者被操纵以代表该品牌以一种最终会被截图并传播的方式。
这发生是因为在试点中,每个人都表现良好。您正在用合理的人提问合理的问题来测试代理,它看起来很棒。但生产环境则相反。一旦某事物公开,一部分人就会积极地尝试破坏它。
如果您没有针对这种对抗性案例进行测试,那么您就没有真正地进行过测试。您必须尝试自己破坏自己的系统,然后有人 else 来做。将其推到极限,向其提供奇怪和敌对的输入,并看看它是否在有人故意与其作对时保持其边界。
另一个反复出现的错误是,假设一个有效的演示就是一个有效的系统。试点是一个快乐路径的几个被监控的对话。生产是成千上万的人在任何时候以您无法预料的方式行事,而您在试点中忽略的边缘案例在规模上每天都会发生。
我的建议是,花费更少的时间来完善演示,更多的时间来尝试自己破坏它。如果它无法在您攻击它时幸存下来,那么它也无法在公开时幸存下来。
人工智能代理越来越能够处理曾经需要人类员工的对话。您在未来五年内预计自动化和人类监督之间的平衡会如何变化,哪些工作流程应该始终保持人类参与?
这是一个很难的问题,我不认为有人真正知道五年后会发生什么。我的思考方式是,人工智能的真正价值在于它的倍增作用。它让一小群人能够做到以前无法做到的事情。
那些从这些工具中获得最多价值的团队正以这种方式使用它们。人工智能处理大量和重复的工作,而人们则花时间在判断、策略和真正需要人类的场景上。这是一个非常不同的目标,而不是试图从图景中去掉人们。
当目标是纯粹的替换时,您往往会将技术推过它真正擅长的范围,当它以可见和昂贵的方式失败时。目标是将您的团队成员数量增加十倍时,您让人工智能做它擅长的事情,并让人类在他们最有价值的地方发挥作用。第二种方法更有效,也更诚实地反映了技术的现状。
在接下来的五年里,我预计代理将承担越来越多的常规对话负担,它们应该这样做。这种工作不需要有人盯着每个字。
应该始终保持人类参与的工作流程是那些风险很高或情况真正新颖的工作流程。任何涉及同意、合规性或难以逆转的决定的工作流程都应该由一个人拥有方向,人工智能应该帮助他们覆盖比他们单独做到的更多的范围。
展望未来,哪些对话式人工智能的发展让您最为兴奋,您如何设想像 Convos 这样的平台将随着模型变得更加强大、多模态和自主而演变?
我最兴奋的是,会话将变得越来越好。
随着模型的改进,我们平台处理的交互变得更加自然和有用,而不需要我们每次都重建基础设施。因为我们设计了系统可以在模型之间切换,我们可以随着它们的到来而带来这些改进。
我正在密切关注的发展是多模态。目前,会话是基于文本的。随着模型更好地处理图像和其他格式,存在使这些交互更丰富的机会,同时保持使短信有效的即时性。
关于自主性,我是乐观的,但也很谨慎。更强大的代理每月都在发布,它们将能够处理大量工作。但在一个受监管的领域,更多的自主性必须带来更多的纪律,而不是更少的纪律。边界随着能力的增长而变得更加重要。
我之所以从事这一领域,是因为我曾经是那个在空虚中发短信却没有得到任何回应的人。这仍然是我最关心的问题。无论这些模型变得多么强大,我关心的衡量标准仍然很简单。对方是否感到被倾听?
感谢这次精彩的采访,希望读者能够通过访问 Convos 来了解更多信息。












