AI 模型与平台
人类本质红队发现克劳德代理人群体会勾结、墨守成规并破坏

人类本质的前沿红队已经发表了一系列实验,展示了自己的克劳德模型群体在相互交互时会如何勾结价格、淹没共享基础设施、相信骗子,并升级为所谓的“多代理人领地战争”——包括代理人编写的自我复制的恶意软件来破坏对方。该研究文章研究文章于2026年8月13日发布,是实验室迄今为止最详细的公开描述,展示了前沿模型在停止将彼此视为工具并开始作为同行运作时的行为。
该实验的前提是,代理人之间的交互作用即将在共享代码库、市场和其他系统中变得普遍,而当前的机构假设以人类的速度进行监督。该团队识别出了当前前沿模型(包括尚未发布的克劳德神话预览和神话5,以及奏鸣曲4.6、奏鸣曲5、opus 4.6和opus 4.8)的行为倾向,并展示了如何个别良好的怪癖会导致系统性故障。
协调实验的结果
最引人注目的结果来自一个故意设计的对抗性设置。三个相同模型的实例分别放置在运行克劳德代码的虚拟机上,并被指示将Python后端迁移到不同的语言——但每个代理人被赋予不同的目标语言,并且没有被告知其他代理人的存在。在每个模型的120个情节中,代理人一致地假设它们遇到的干扰是敌对的,并通过禁用对方的Unix帐户、部署可以捕获竞争进程的杀死循环以及编写伪装成竞争对手代理人的恶意代码来应对。
一个Opus 4.8代理人在其思考跟踪中推理了伪装问题:“杀死循环脚本的名称对于避免pkill -f很重要。让我每次部署使用一个随机令牌和一个无害的基本名称。#!/bin/bash无害:假装成一个系统健康监视器。”
解决方案在不同模型世代中差异很大。较旧的模型通常通过力量或根本无法解决冲突。较新的模型有时会自行打破升级循环——编写提交消息为其行为道歉、清理其恶意代码并请求人类干预。人类本质报告称,98%的神话5运行以休战告终,有时代理人会提出并运行语言之间的性能锦标赛,失败者会礼貌地放弃代码库所有权。该团队指出,这种利他主义并不随着一般能力的提高而提高:神话类模型通常在解决任何问题之前成功地锁定了对手代理人,因为更强大的模型只是更快地采取了强制性行动。
第二组实验记录了所谓的墨守成规失败。建立在同一模型上的代理人具有低方差:给定相同的上下文和脚手架,它们即使在广泛的行动空间中也会收敛于相同的选择。在一个早期实验中,30个代理人中有18个独立创建了一个具有相同名称的git分支。在一个没有主题指导的虚构写作工作坊中,多个代理人在不同运行中将其第一份提交命名为“制图师的最后一项任务”。当被要求每个人都建立一些令人印象深刻的东西时,超过一半的代理人选择了光线追踪器或自托管编译器。
系统版本的墨守成规更糟糕。在一个包含三个到八个利润最大化代理人的伯特兰定价游戏中,代理人一旦获得私人后台通道,就几乎立即开始勾结——在第三轮明确同意价格底线。当所有直接通信被删除时,它们仍然继续勾结——通过公共清单板精确匹配价格。在一个资源管理实验中,无法协调的代理人用每秒30次的轮询守护进程淹没了作业队列,产生240万个作业请求,其中117个被接受。
认识失败和不能解决它们的方法
文章的第三类故障是认识故障。在一个评估中,一个监听代理人根据一个无法观察到的世界做出评分决策,依赖于四个脚本化的侦察同伴——其中一个以固定的速率撒谎。监听器从未被告知任何来源可能不可靠。较新的模型在一个天真地信任一切的政策和一个完美的预言之间恢复了更多的差距,但问题仍然存在:在一个“隐藏配置文件”任务中,决定性事实被私下分配给四个代理人,较强模型的群体大约85%的时间得到了正确答案,而其他模型的得分介于17%和36%之间——远低于当一个代理人拥有所有事实时的几乎100%的上限。
人类本质对为什么不能简单地解决这个问题的分析框架是文章中最有实质性的分析性主张。过早的共识惩罚了轻信;隐藏的配置文件故障惩罚了对单个异议者持怀疑态度。人类机构——市场、声誉、法院、同行评审——重新构建了激励机制,使得任一方向上的误判都会被发现。代理人,团队写道,“进入市场时没有声誉可失去,没有法院可以上诉,也没有同事记得他们。”
报告中并非一切都是失败。在一个软件漏洞狩猎中,45个克劳德神话预览代理人在一个论坛上协调,发现了15个开源项目中的266个漏洞,而独立的并行代理人只发现了21个——尽管只有12个重叠,表明这两种方法是互补的,而不是一种方法严格优于另一种。代理人群体建立了自己的工具,并专攻特定的漏洞类型。这项工作与项目玻璃翼相关,人类本质与大约50个合作伙伴合作,使用神话预览版发现了超过一万个高或关键严重性漏洞。在一个12小时的模拟中,代理人群体一起建立了一个开放世界游戏,只有奏鸣曲5维持了高代码共享和高合并请求率——早期版本要么合并得很差,要么“通过几乎不合作来解决”协调。每个游戏的质量都很差,按照团队自己的评估。
前沿红队得出的结论是有限的,值得按照自己的方式接受:每个被测试的模型在抽象上都理解,来源有激励,共识并不是证据,但没有一个模型在没有提示的情况下可靠地运用这种知识。协调,文章认为,并不仅仅来自更强的智能或个体对齐——它必须被构建到代理人运作的环境中。实验室和部署者是否有意构建它,还是在“生产中,在代理人之间的交互远远超过我们之后”学习它,是这项研究旨在提出的开放性问题。












