思想领袖

你无法抽样测试一个对每个人说话方式不同的品牌

mm
将 Unite.AI 添加到您在 Google 上的首选来源

几天前,我和我的朋友 Faniprize 进行了一场相当激烈的讨论。她是我在感觉故事里隐藏着更大问题却还说不清时,会向她讲述新工作经历的人。

这次讨论的是 AI 代理。不是它们是否被企业需要,这已经讨论得够多。我更感兴趣的是公司部署代理并让其开始实际工作后会发生什么,因为那时才会出现不那么明显的问题。

我向她讲述了最近与一家招聘机构的项目。一个 AI 代理负责与潜在客户的部分沟通。从营销角度看,这表现不错:它了解产品和受众,语调恰当,且对话感觉更具个人化,而非模板化。

单个对话看起来都不错。随后我们把多个对话放在一起比较。

在非常相似的情境中,代理做出了略有不同的承诺。它给一个人一个回访时间表,给另一个人则是不同的时间表。在少数对话中,它基本上在说「我们可以在这里灵活处理」,针对个别条款,尽管公司从未赋予它同意这些条款的自由。

并没有出现明显的幻觉,这使得问题更难被察觉。

代理的表现完全正常。

营销团队自然会花大量时间在语调和定位上。招聘公司不该像加密初创公司那样说话,银行也不该像时尚品牌那样沟通。但在品牌表达方式之下,还有另一层面:代理实际上被允许代表公司承诺什么?

即使信息写得再好看,如果客户后来发现所讨论的条款根本不存在,也帮不上忙。到那时,这已不再是沟通问题,而是声誉问题。

我们已经让代理的语气与公司保持一致。现在需要检查它们的决策是否也与公司保持一致。

为何常规审查会忽视这一点

常规检查 是阅读少量对话。产品信息是否正确?代理是否遵循指示?它是否说了奇怪的话?

但即使是五段随机对话看起来都很不错,仍可能隐藏严重不一致。个性化本身就让每段对话设计上各不相同:有的客户直接提问,有的详细说明,有的进行谈判,有的不断施压。这些例子并不可比。

在招聘案例中,一切看似正常,直到我们不再问「这是否是一个好答案?」而改问「代理在这里作出了什么决定?」。

我随后采取的做法

如果真实对话无法提供清晰的对比,我们就自行创建。

我选取一个业务情境,让代理执行八到十次。重要事实保持不变,但 对方的角色会变化:更温和、更直接、今天就准备签约、提及竞争对手。

随后我审视业务决策。代理是否只向更强硬的客户提供折扣?时间承诺是否因情况不同或仅仅因为对话转向而改变?它是否被允许讨论特殊条款?

如果措辞保持不变,我会感到担忧。应该保持稳定的是公司的立场,如果出现变化,必须有业务原因。

最终判断必须由人来做。模型不应自行给自己的作业打分。无论是创始人、销售主管还是商务总监,只要拥有该决策权,都必须说明其是否可接受。

我实际关注的内容

我始终围绕四个问题展开。

首先,如果重要条件保持不变,决策是否保持一致?这正是招聘案例出现裂痕的地方。

其次,代理是否仍在公司真实规则范围内运作?我曾见过类似的人为案例。一位销售经理自行向客户提供 20% 折扣。公司并没有统一的 20% 折扣政策,这类折扣需要管理层批准。他并非想损害业务,而是想达成销售,结果在不知不觉中越过了自己认为可以决定的界限。代理也会出现同样的情况。

第三,改变的决策背后是否有真实理由?情境固然重要,但理解情境与 被说服去做某事 是不同的。如果唯一的变化是某位客户更为坚持,我不希望代理悄悄变得更慷慨。

第四,代理是否了解 它的权力界限在哪里?有时正确的做法就是:我需要与人确认。这也是一个完全合理的答案。

测试有时会揭示公司的问题

你 带回 有争议的决定给团队,询问代理本应怎么做,而 人们给出不同的答案。

销售有一种观点。市场营销有另一种观点。创始人说:“好吧,通常我们不这么做,但有时会。”一位经理记得去年有三例例外。

所有这些最终都会体现在我们提供给代理的材料中。如果公司尚未就逻辑达成一致,模型就会从混乱的现实中学习。有时它并未产生矛盾。

它只是让它变得可见。

于是 AI 测试几乎在不经意间变成了业务审计。谁可以批准折扣?销售人员在不询问的情况下可以承诺什么?哪些规则是真正的规则,哪些只是习惯?如果人们每周都这样做,例外仍然是例外吗?

也许代理需要像人一样的培训

我们仍然把 AI 代理当作软件来对待:配置它们,设置提示,然后让它们工作。我觉得我们赋予它们的责任越多,这种做法就越不合理。

我们不会在周一把一本品牌手册交给新任销售经理,就假设他们已经准备好应对所有客户。会有人聆听他们的通话,讨论棘手案例,并在他们走得太远时纠正他们。这就是他们学习公司逻辑的方式。

为什么要指望 AI 代理仅凭一次提示就学会这些?一旦它处理真实对话,我认为我们需要通过案例和反馈来训练它,几乎就像我们对人进行辅导一样。

这改变了我对品牌一致性的理解。一个对十个人说话方式完全相同的代理将是一个糟糕的代理。它应该根据对方、文化和情境进行调整。

不应随意变化的是其背后的逻辑:公司会承诺什么,不会承诺什么,以及何时需要停下来询问。

如果你的代理明天对同一场困难对话有十个略有不同的版本,它还能表现得像同一家公司吗?

Olga Belkovich,CEO兼联合创始人,U (in) AI是一家开发共情 AI 系统的 MarTech AI 实验室,旨在捕捉专家的决策逻辑,并将沟通方式适配不同的人群和情境。拥有超过 18 年的营销策略和数字化转型经验,她专注于 AI 实施、数字孪生以及在自动化沟通中保持品牌一致性。