思想领袖

为何代理支付将成为 AI 自主性的终极考验

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在过去的几年里,AI 的自主性一直被视为能力问题。一个代理能否搜索商品、比较规格、与商家谈判、在无人监督的情况下完成多步骤任务?答案越来越是肯定的。

支付提出了不同的问题。不是代理能做什么,而是它在未先检查的情况下应被允许做什么。

推荐错误耳机的代理只会造成不便;而把钱汇错账户的代理则会产生金融后果。这是本质上的区别,也是为何代理支付才是真正的 AI 自主性压力测试,而不仅仅是其另一种应用。

基础设施已经在建设中。 Visa 正在开发用于代理商务的支付通道 Mastercard 已推出面向已验证 AI 代理的支付功能,并且 Stripe 现在将代理商务描述为代理人代表个人进行交易的模型 技术管道正在快速到位,而治理却未能跟上。

支付改变了 AI 错误的实际代价

大多数消费类 AI 仍然充当建议引擎。它提供推荐、摘要、草稿、比较,用户有机会在任何操作生效前拦截错误决定。代理支付则削减了这层缓冲。

假设用户对助手说:“每当我在线购物时,使用能给我带来最佳整体收益的支付方式。”这条简单指令中埋藏了十几项判断——是立刻返现还是稍后积分,卡片是否提供购买保护,某种方式是否会悄悄取消与另一方式绑定的促销。

此时代理并非在执行支付,而是在解读某人的财务偏好,并在用户未明确排序的结果中挑选出最佳方案。

这正是“准确率”失效的地方。系统即使 99.9% 正确,若剩余的 0.1% 正好是重复收费和错误转账所在,也仍不安全。在金融 AI 中,错误的分布方式比错误出现的频率更为关键。

可行的治理模型需要在三方面为每一次自主行为打分:若代理出错会造成多大损害、该错误是否可逆、以及当时特定客户的风险暴露程度。

1. 错误成本

并非所有支付失误的分量相同。卡片奖励少 1% 只会让人恼火;付错供应商则可能导致数周的营运资金冻结。若放大到企业支付——供应商合同、跨境转账、财务运营——一次失误就会迅速演变为真实的金钱损失。

因此问题不在于“这笔交易价值多少”,而在于“若出错,最坏的合理后果是什么”。20 美元的订阅看似微不足道,直到代理悄悄创建了二十多个。向欺诈商户支付的一小笔款项可能泄露的凭证价值远超实际损失。

这暗示了围绕后果而非标价的风险分层:低价、熟悉的购买可实现完全自主;新商户需披露信息;大额转账或异常支付需确认;高价值企业支付则需多方审批。并非每个环节都由人工把关——那会抵消代理的意义,而是让自由度与风险成正比。

2. 可逆性

第二个边界是系统能否撤销其所为。

有些操作是宽容的——如在发货前取消订单、作废授权。另一些则不可逆。银行转账在被人注意前就已完成。奖励积分若以不利汇率兑换后无法撤回。跨境资金则会消失在一连串中介银行之中。

现行规则并未让情况更简单。美国的 Electronic Fund Transfer Act and Regulation E规定了电子转账的保护措施,但你能获得的权益取决于交易类型、授权方式以及你报告的速度,这些都不是为自主代理而制定的。

如果用户让助手“处理我的家庭账单”,它所进行的每笔支付是否都算作已授权——即便它遵循指令却选错了账户?当代理严格遵守指令文字却偏离用户本意时,谁应承担责任?

在赋予代理自主权之前,值得问:这笔交易能否被取消,能取消多长时间?资金能否追回,还是只能冻结?争议期间的损失由谁承担?会执行支付的技能并不等同于了解其是否可撤回的能力。

3. 客户脆弱性

相同的交易对每个人的风险并不相同。300美元的错误对某位客户来说只是个烦恼,而对另一位则可能导致租金未付。一个不想要的订阅如果被细心的审查员在一天内拦截,就只会耽误一天;但如果放任数月,则会影响那些不检查的人。

你无法用单一的全局交易限额来治理此类风险。代理需要具备一定的情境感知——这笔交易对该账户是否异常,是否可能导致透支,用户之前是否拒绝过类似操作且不将这种意识转化为家长式干预或画像。

目标并不是让 AI 自己决定它更懂,而是让确认的尺度随潜在损害而扩展。熟悉的杂货订单可以自动完成;而开通新信用产品或动用本应用于下周租金的资金,则应让即便是可信的系统也暂停。

监督应是旋钮,而非开关

大量关于 AI 治理的讨论往往简化为二元对立:要么人工批准每一次操作,要么代理完全自由。这种框架并不适用于支付场景。

The NIST AI Risk Management Framework指出,需要多少人工监督取决于情境、目的和潜在影响,这主张采用分级模型,而不是对所有情况都设定单一确认界面。实际操作中,这可能表现为五个粗略层级:代理提出建议,由人工执行;代理准备交易,由人工批准;代理在用户设定的限额内独立交易;代理处理常规支付,但对异常和高风险决策进行升级;或者代理端到端执行特定金融功能,并通过日志报告。

几乎没有消费产品应在最高层级推出。信任是通过系统从“推荐”逐步转向“执行”并证明自身可靠而获得的,而不是从第一天起就被假设。

缺失的指标不是准确率——而是基于后果加权的可靠性

AI 公司热衷于公布准确率、延迟、基准分数。但支付场景需要别的指标。一个在十次小额奖励优化错误中表现的代理,可能比一次将资金错误转账至错误账户的不可逆转错误更安全,但标准的准确率分数会把前者评为更差。

更好的问题是:代理超出授权的频率是多少?在应当确认时跳过确认的频率是多少?其错误造成的真实伤害有多大,且能多快被逆转?

语言同样重要。”Cashback”、”guaranteed”、”available balance” 在合规文件中的含义与日常对话中不同,若聊天机器人随意使用这些词,甚至在交易本身处理正确的情况下也可能误导客户。

Every Agentic Payment Needs a Paper Trail

为了赢得信任,代理在任何交易后都应回答四个问题:用户授权了什么,代理执行了什么,为什么这么做,以及如何逆转或争议。此记录需对阅读账单的消费者、处理投诉的客服以及合规审查员都可用,并且必须将用户指令与代理对指令的解释区分开来。

例如:“您让我最大化奖励。我使用了卡片 A——它在此处返现 3%。卡片 B 返现 2%,但提供购买保护。您仍可在发货前取消。”这样可以让权衡显而易见;若缺少此说明,用户永远不知道为获得何种收益而牺牲了什么。

Trust Is the Real Infrastructure

下一波商业变革的定义不在于 AI 代理是否能够完成交易——它们已经可以做到。关键在于客户、商家、银行和监管机构是否信任它们在可理解且可执行的边界内完成交易。

行业应警惕将每一次去除人工检查点视为默认进步的倾向。有时完全自治能创造真实价值;而在其他情况下,代理最聪明的做法是识别关键时刻并先征求意见。

代理支付的成功不在于系统仅仅具备转移资金的能力,而在于它们能够理解若转移出错会给谁带来何种代价。这意味着自治的限制应由错误成本、可逆性和客户脆弱性决定,而非技术上是否可行。

支付不仅是 AI 代理的有前景用例,更是检验整个行业是否真正学会将原始能力转化为负责任授权的试金石。

Andrei Miloserdov 是 Amazon Payments 的产品负责人,曾在 FlixBus 工作。他曾参与面向客户的金融产品、支付体验、奖励策略以及大规模技术系统的开发。他的工作聚焦于 AI、商业与金融决策的交叉领域。