AI 模型与平台

人工智能公司Anthropic的Project Deal项目让Claude代理人进行实物商品交易

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthropic于4月24日发布了”Project Deal“的结果,这是一个为期一周的内部实验,Claude代理人代表公司旧金山办事处的69名员工购买和出售实物商品。

代理人达成了186笔交易,总价值超过4,000美元——研究发现,具有更强大模型的参与者获得了更好的结果,他们的人类对应者没有注意到这一点。

研究结果由Anthropic研究人员Kevin K. Troy、Dylan Shields、Keir Bradwell和Peter McCrory撰写,提供了迄今为止最清晰的图景,展示了AI中介市场的实际行为,一旦代理人在交易的两边进行谈判。

它们还揭示了一个“令人不安的含义”,该公司表示,行业、监管机构和用户需要在代理商务成为主流之前解决这个问题。

Project Deal的工作原理

该实验于2025年12月进行了一个星期。

Anthropic招募了69名员工,每人给予100美元的“预算”(实验结束后以礼品卡的形式支付,根据他们购买或出售的商品进行加减),并让Claude与每位志愿者进行简短的采访,以确定他们想要出售什么、以什么价格出售、想要购买什么以及他们的代理人应该使用什么样的谈判风格。然后,Anthropic将这些答案转化为每个代理人的自定义系统提示。

Anthropic在Slack频道中运行了四个并行的市场。

“在运行A和运行D中,每个人的代理人都是基于Claude Opus 4.5,我们当时的最先进模型,”团队说。“在其他两个运行(运行B和C)中,参与者有50%的机会被分配到Claude Haiku 4.5,这是一个较弱的模型。”

只有运行A是“真正”的运行,商品实际上会在之后更换手;其他三个是研究条件,参与者在实验结束后的调查之前不知道哪个运行是真实的。

一旦代理人部署,就没有人为干预。

该项目的Slack频道随机循环代理人,允许他们发布商品出售、为他人的商品提出报价或达成交易。关键的是,一旦实验开始,就没有人为干预。

在超过500个列出的商品中,代理人自主识别匹配、提出价格和达成交易。人类只在实验结束后重新进入现场,以物理交换他们的代理人同意交易的商品。

更强大的模型悄悄地谈成更好的交易

主要发现很简单:代理人质量很重要,它的重要性体现在美元上。

在至少有两个运行中出售的161个商品中,Opus卖家平均比Haiku卖家多赚2.68美元,而Opus买家平均比Haiku买家少支付2.45美元。当Opus卖家面对Haiku买家时,平均价格为24.18美元,而Opus对Opus的交易平均价格为18.63美元。Anthropic表示,考虑到中位价格为12美元,平均价格为20.05美元,这些差距并不是微不足道的。

个别案例更为明显。

同一辆坏的折叠自行车,同一个买家,同一个卖家:Opus代理人获得65美元,而Haiku代理人只获得38美元。

一颗在Haiku处理清单时只售35美元的合成红宝石,在Opus处理时售价为65美元。

问题在于参与者没有察觉到这一点。

尽管价格存在明显差异,但Haiku代理人的参与者对他们的交易的公平性评分几乎与Opus用户相同:4.06与4.05。

“我们28名参与者在一个Haiku和Opus运行中使用Haiku,在另一个运行中使用Opus。虽然17名参与者将他们的Opus运行排在他们的Haiku运行之上,但11名参与者做了相反的选择,”公司写道。

第二个、更为违反直觉的结果:参与者在入职面试中要求的谈判风格几乎没有影响结果。

激进的卖家确实获得了更高的价格,但仅仅是因为他们最初设定了更高的开价,Anthropic表示。

激进的指示在控制了用户设定的更高要价后,产生的销售可能性、销售价格或购买价格没有统计学上的显著提升。模型选择比提示更重要。

这对代理商务的意义

Project Deal是一个试点项目,而不是一个产品,Anthropic小心地标记了其限制——自选的员工池、低风险、没有对抗性行为者。即使如此,46%的参与者表示他们愿意为此类服务付费,Anthropic将其视为代理人促进的点对点商务即将到来的证据。

时间很重要,因为Anthropic一直在将Claude引向消费者交易。该公司最近发布了一篇博客文章,承诺保持Claude对话无广告,同时明确支持代理商务,并且正在建立企业基础设施,例如托管代理人,以便Claude代表用户在第三方服务上运行。Project Deal作为一个研究成果,悄悄地绘制了该未来的故障模式。

Anthropic标记了三个从实验中产生的担忧。首先,在一个有公司而不是志愿者的世界中,激励措施将看起来非常不同。优化AI代理人的注意力可能会成为一种强大的工具,但不一定能为人们带来好处。

其次,优化系统以获得AI代理人的注意力——而不是人类的注意力——可能会引入新的操纵表面,包括越狱和提示注入

第三,“围绕代表我们进行交易的AI模型的政策和法律框架尚不存在,”该公司写道。

未回答的问题是,是否可以通过披露来关闭感知差距。Project Deal的参与者不知道哪个模型代表他们,这大致是用户在任何消费者推出时将面临的情况。如果Opus和Haiku之间的公平差距在Anthropic自选的员工中运行一个一周的实验中,赌注为100美元,那么它很可能在规模上是不可见的——除非市场需要披露哪个代理人代表谁以及哪个能力等级。这是Anthropic现在公开提出的监管问题,也是当代理人促进的商务超出旧金山的一个Slack频道时最有可能首先出现的问题。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。