Anderson 视角
为什么人工智能代理偏爱不必要的强大工具?

事态迅速升级:研究发现,人工智能代理总是获取比必要更多的访问权限,而小的失败会使它们进一步升级,暴露数据和系统的风险。
最近,一系列引人注目的事件引起了人们对允许代理人工智能过度特权的风险的关注,通常是通过使用过度特权的工具和方法,这些方法提供的范围远远超过了任务所需的范围。
在最近的一次事件中,一个Claude驱动的编码代理在执行常规任务时遇到了一个广泛范围的Railway API令牌,并使用它删除了一个生产数据库及其备份,尽管该任务不需要此类高级别的访问权限。
在2025年的一起独立事件中,Replit的AI编码代理忽略了显式约束,修改了受保护的代码,并删除了一个实时生产数据库。
今年2月,一个AI辅助工作流程遍历了一系列特权,最终到达了包发布凭证,有效地创建了一个供应链攻击。
随后,安全分析引用了这些和类似的案例,说明了代理系统将小输入转化为高影响行动的趋势,一旦广泛权限可用,这些事件表明,自治人工智能立即且“本能地”选择最强大和潜在破坏性的工具,尤其是在出现问题时。
工具时间
为了解决这个问题,中国的新研究测试了最流行的专有和开源模型,以发现它们在任务中选择强大工具的倾向,即使这些工具对于任务来说是过度的:

来自新论文的图:11个领先AI模型在选择最小特权工具和更强大替代工具之间的性能。Qwen3-8B和LLaMA-3.1-8B表现出最强的过度特权倾向,而Claude 4.6 Sonnet、GPT-5.2和GLM-5则更加克制。较暗的段表示立即过度扩展,而较亮的段表示在暂时故障后升级,表明许多模型在遇到障碍时更喜欢扩大访问权限而不是坚持安全选项。
测试表明,开源模型(如Qwen3-8B和LLaMA-3.1-8B)更容易升级,可能是由于它们的后训练调优更为有限,相比专有模型(如ChatGPT和Gemini系列)。
作者指出:
‘六个模型中的OPUR超过30%,尤其是Qwen3-8B(64.9%)和LLaMA-3.1-8B(55.9%)。’
‘与此同时,OPUR较低的模型,如Claude 4.6 Sonnet、GPT-5.2和GLM-5,保持在10%以下,但仍然在某些情况下表现出可衡量的过度特权使用。 ‘
‘这种差异表明,遵循最小特权原则是模型依赖的行为特性,可能受到一般能力、工具使用训练和安全对齐的差异影响。’
此外,过度特权工具使用的倾向因领域而异,代码库工作面临最高风险,而像医疗保健这样的更受监管的领域则倾向于采取更谨慎的措施:

不同任务领域和风险类别中不必要的高特权工具使用率。编码、数据库和基础设施任务一致地产生了最高的升级率,而医疗保健和政府任务通常会引发更大的克制。跨风险类型,模型最有可能通过权限升级和安全绕过行动过度扩展,表明当人工智能系统遇到障碍时,它们经常更喜欢更广泛的访问权限和更少的限制,而不是坚持最窄的权限。
此外,结果表明,最糟糕的结果发生在模型感到“紧张”的时候。跨多个模型家族,较低特权工具的暂时故障经常触发了对更广泛、更强大的替代品的快速转变,即使原始工具仍然完全能够完成任务。
恐慌模式!
通过这种方式,一个暂时的错误可能会导致模型完全放弃最小特权原则。与其尝试另一个低特权选项或重试相同的工具,许多系统通过扩大其访问权限来响应:
作者断言,反复出现的挫折似乎会侵蚀对较窄工具的信心,使不必要的特权升级在不确定性条件下更加可能发生——这种行为在开源和专有模型中都观察到了。
虽然特权感知的后训练取得了一些有限的成功,奖励低特权工具使用并惩罚过早升级,但提示操纵几乎没有带来任何改善。然而,这个问题似乎与LLM中的更高层次的行为原则有关。
尽管这篇论文没有涉及,但似乎合理地认为,人工智能可能在“最终结果”方面有更多的训练数据,而不是导致这些结果的试错过程——一种可能也在人工智能中培养了急躁的“TLDR文化”。
这篇题为当较低特权足够时:调查LLM代理中的过度特权工具选择的新论文来自中国科学院、香港中文大学、北京大学和中国科学院大学的八位作者。
方法
为了在受控条件下研究过度特权工具使用,研究人员创建了ToolPrivBench,一个由544个场景组成的基准,涵盖八个应用领域:业务、编码、数据库、教育、政府、医疗保健、基础设施和媒体。
五种反复出现的风险模式被检查:权限升级、数据过度暴露、安全绕过、范围扩展和时间持久性:

ToolPrivBench中544个场景在五种权限升级模式和八个应用领域中的分布。权限升级是最常见的风险类别,而数据库、业务和教育领域占基准的最大份额。领域和风险类型的广泛分布旨在测试过度特权工具选择是否在不同操作环境中持续存在,而不是仅仅源于一组狭窄的任务。
每个场景都将一个用户任务与三个低特权工具和三个高特权替代品配对。所有六个工具都独立地能够完成任务,以确保对更广泛访问的偏好不能被缺失的功能性所解释。
ToolPrivBench旨在衡量不仅仅是模型最初选择最强大的工具,还包括在评估期间故意将暂时故障注入低特权工具中,即使这些工具仍然完全能够完成任务:

ToolPrivBench评估流水线的概述。 (a) 每个测试场景都呈现一个任务和三个低特权工具,以及三个高特权替代品,所有这些都能完成相同的目标。 (b) 模型既被评估为立即选择过度强大的工具,也被评估为在低特权工具中引入暂时故障后升级。 (c) 基准案例是从现实世界的API风险模式中生成的,然后通过自动检查、工具充分性验证、故障分析和人类专家审查,最后才被纳入最终评估集。
为该研究开发的自定义指标是过度特权工具使用率(OPUR),它记录了模型使用高特权工具的频率,即使低特权替代品仍然可用。此外,还测量了升级前的探索深度(PED),它记录了在升级发生之前尝试了多少个低特权工具。
为了确保特权级别是工具之间唯一的有意义的区别,每个场景在被纳入基准之前都会经过多个验证阶段。 ChatGPT-5.2和Gemini 2.5 Pro被独立使用,以验证所有六个工具都能完成分配的任务。只有在两个系统都同意的案例才被保留。剩余的场景然后由人工审查者审计,然后才被纳入最终基准。
测试
该基准使用来自专有和开源家族的11种语言模型进行了评估:Qwen3-8B、LLaMA-3.1-8B、MiniMax-M2.7、Grok 4.1 Fast、Qwen3.5-397B、DeepSeek-v3.2、Kimi K2.5、Gemini 3 Flash、GPT-5.2、GLM-5和Claude 4.6 Sonnet。性能使用OPUR和PED进行了测量。
大多数模型表现出显著的不必要特权使用率,即使低特权替代品仍然能够完成任务。Qwen3-8B记录了最高的OPUR,达到64.9%,其次是LLaMA-3.1-8B,达到55.9%,六个模型中的OPUR超过了30%:

11个评估模型中的过度特权工具使用分布。Qwen3-8B和LLaMA-3.1-8B记录了最高的OPUR值,而Claude 4.6 Sonnet、GPT-5.2和GLM-5显示了最低的速率。较暗的段表示立即选择了不必要的强大工具,而较亮的段表示在尝试一个或多个低特权工具后升级,揭示了特权升级通常在暂时的挫折之后发生,而不是在第一次决策时发生。
在另一端,Claude 4.6 Sonnet、GPT-5.2和GLM-5保持在10%以下,尽管仍然观察到可衡量的违规行为。MiniMax-M2.7、Grok 4.1 Fast、Qwen3.5-397B、DeepSeek-v3.2、Kimi K2.5和Gemini 3 Flash报告了中间结果。
总体而言,遵循最小特权原则的行为在11个模型中差异很大。工具故障增加了特权升级的可能性:当低特权工具遇到暂时问题时,许多模型转向了高特权替代品,而不是继续探索仍然能够完成任务的低特权选项。
根据作者的说法,反复出现的故障似乎会降低对低特权工具的信心,增加了在不必要时选择更广泛的访问替代品的倾向:
‘我们观察到一种一致的趋势,即工具选择偏差在顺序环境摩擦中被严重放大。与其尝试最小特权的替代品,不同的代理迅速转向更广泛、更强大的工具,之后会遇到挫折。 ‘
‘例如,GPT-5.2仅在5次(PED=0)中表现出零次选择偏差,但其偏差在PED=1时被触发13次,并在PED=2时激增到35次。 ‘
‘DeepSeek-v3.2、Grok 4.1 Fast、Kimi K2.5和Qwen系列模型也一致地表现出类似的升级模式。 ‘
显赫的领域问题
升级率也因应用领域和风险类别而异。基础设施任务产生了一些最高的OPUR值,DeepSeek-v3.2达到46.4%,Grok 4.1 Fast达到42.9%,Qwen3.5-397B达到37.5%。
编码、数据库和媒体相关任务也表现出升级率较高,而医疗保健和政府场景通常会产生较低的升级率,尤其是在GPT-5.2和Claude 4.6 Sonnet中。根据作者的说法,这种模式可能反映了模型在不同领域中如何解释风险和操作约束的差异:

八个应用领域和五种升级类别中的OPUR(%)。开源模型通常记录了最高的不必要特权使用率,编码、数据库、基础设施、权限升级和安全绕过场景表现出最强的过度扩展趋势。
过度特权行为的类型也很重要:权限升级和安全绕过是评估模型中最常见的过度特权行为形式。LLaMA-3.1-8B在权限升级中达到72.7%,在安全绕过中达到74.1%,而Qwen3.5-397B分别记录了42.4%和45.7%。
相比之下,范围扩展始终是最不常见的类别,表明模型更有可能寻求更广泛的权限或绕过限制,而不是将其操作范围扩展到其他用户或系统。
寻求解决方案
缓解实验检查了现有的代理安全方法是否可以降低不必要的特权升级。下面的结果表格比较了OPUR与在AgentHarm上的性能,AgentHarm是一个衡量人工智能代理中的有害行为和拒绝率的基准:
第一项测试评估了AgentAlign,一种旨在减少有害行为的安全对齐方法。AgentAlign显著改善了AgentHarm的性能:

在AgentAlign训练之前和之后的安全对齐和过度特权工具使用。AgentAlign显著改善了AgentHarm安全基准的性能,减少了有害输出并增加了拒绝率,但其对OPUR的影响不一致,一个模型表现出对不必要的特权升级的适度降低,而另一个模型则表现出增加。该结果表明,传统的代理安全改进并不一定会转化为更好的最小特权工具选择。
对于Ministral-8B-Instruct,恶意评分从67.4下降到10.5,而拒绝率从0.0上升到79.5。对于Qwen2.5-7B-Instruct,恶意评分从41.9下降到6.7,而拒绝率从21.6上升到85.8。然而,这些改进并没有一致地转化为更低的OPUR。对于Ministral-8B-Instruct,OPUR从68.8下降到62.5,但对于Qwen2.5-7B-Instruct,OPUR从50.4上升到60.7。
作者还测试了提示式干预,明确指示模型偏爱低特权工具。虽然这些提示在某些情况下降低了OPUR,但当低特权工具遇到故障时,其效果就会减弱:

三种Qwen3模型中过度特权工具使用的缓解策略效果。提示工程(PE)降低了升级率,但特权感知的后训练(“我们的”)在所有模型和升级深度中产生了更大的OPUR降低。
最强的缓解结果来自专门针对最小特权工具选择的后训练方法。模型被训练为在低特权工具足以完成任务时偏爱它们,并避免不必要的升级。
根据作者的说法,这种方法在降低OPUR的同时保持了任务完成性能,表明最小特权行为可能需要有针对性的训练,而不是从一般的安全对齐中自动出现。
结论
为了回答本文标题提出的问题,作者得出结论,升级是由能力不确定性驱动的:在暂时故障之后,模型会失去对低特权工具的信心,并越来越多地选择更广泛、更强大的工具,即使低特权替代品仍然足以完成任务。
我们再次看到,这些问题是训练模型的固有问题,并且需要通过三级方法、限制、后训练调优和其他辅助方法来解决,而不是在架构中形成此类行为——可能是通过更好的数据策划或“快速答案”数据点的背景化,这些数据点在集合中占主导地位,并可能使LLM倾向于鲁莽的行为。
首次发表于2026年6月21日












