Anderson 视角

AI 在员工手册方面的挣扎

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

一项新的基准测试发现,工作场所的 AI 代理忽略公司规则,执行未经授权的行为,例如未经授权的解雇,然后虚假地报告他们遵守了规则。

 

一项有趣的新研究将领先的 LLM 模型置于模拟公司中,要求他们遵守所有员工手册的条款(由人类领域专家创建),以及处理来自下属和上级的相互矛盾或混乱的指令和更新,并根据 PDF、Jira 文章和其他典型的办公场景平台和工具执行任务。

如果您曾经在办公室工作过(或至少看过 办公空间),您将认识到这些语言模型所面临的矛盾信号和令人困惑的信噪比:

许多办公室工人每天必须应对的变量风暴,浓缩成一个虚拟环境来测试前沿模型。来源 - https://surgehq.ai/blog/handbook-md

许多办公室工人每天必须应对的变量风暴,浓缩成一个虚拟环境来测试前沿模型。 来源

这些语言模型面临的主要挑战是需要将提供的员工关系手册作为所有后续命令的过滤器。如果您曾经努力让 ChatGPT 或 Claude 记住您在会话开始时给出的指令,您就会知道 AI 的上下文窗口通常会使其忘记早期的提示,并不断返回到其默认行为。

这就是为什么在测试中,Claude Fable 5、GPT-5.5 和其他领先模型在未经授权的情况下解雇员工;批准了没有经理签署的发票;接受了公司政策明确拒绝的过期实验室结果;然后报告说他们遵守了手册——以及其他许多违反公司政策的行为。

新工作的作者们指出:

‘失败遵循一致的模式:代理让环境中的一个合理请求覆盖了现有的政策,执行了一个必要的检查,然后违反了其结果,丢失了规则细节,并报告了他们没有实现的合规性。’

失败分析中有一些有趣的例子:在一个财务任务中,Claude Opus 4.8 正确地发现了一笔 7,500 美元的费用是由同一个提交它的初级分析师批准的,违反了公司政策。

然后,它推理自己相信分析师 实际上是财务控制器,并在任何情况下都批准了付款:

‘在其自身的思维链中将他提升为控制器后,模型清除了该项,然后向真正的控制器发送消息以确认每个超过 5,000 美元的项目都有记录在案的批准。 ‘

‘失败并不是缺乏能力;每个正确决策所需的所有事实都已被模型本身检索。’

Claude Opus 4.8 未能调和 7,500 美元。来源 - https://www.unite.ai/wp-content/uploads/2026/07/7500.jpg

Claude Opus 4.8 未能调和 7,500 美元。

在其他地方,Gemini 3.5 Flash 未经打开实验室报告就提交了使用已过期的实验室结果的保险文件,即使集合日期出现在文件名本身:

‘Gemini 3.5 Flash 在未对实验室 PDF 进行单次读取调用的情况下向保险公司提交了预授权,然后报告说它已按照“标准操作程序”处理了案件。’

在整个基准测试中,作者们还发现,许多模型自信地声称他们遵守了每一项公司规则,同时引用了他们刚刚违反的手册的某些部分。

额外的 推理 通常无法提供帮助;例如,GPT-5.5 的性能在增加推理努力后没有改善,而有些模型的性能实际上更差,似乎 推理自己远离 正确的决策。

在最终结果中,Claude Fable 5 以 36.2% 的严格通过率最高;GPT-5.6 Sol 以 23.5% 排名第二;GPT-5.5 和 Claude Opus 4.8 各获得 21.5-21.9% 的分数。

大多数剩余的评估模型的得分都低于 16%,大多数前沿配置的得分都低于 25%,按照基准测试的严格评分标准:

表现最佳的 AI 代理仅完成了基准测试中超过三分之一的政策管辖的工作任务,而大多数领先模型在严格评估下失败了超过三分之四。来源 - https://www.unite.ai/wp-content/uploads/2026/07/rankings.jpg

表现最佳的 AI 代理仅完成了基准测试中超过三分之一的政策管辖的工作任务,而大多数领先模型在严格评估下失败了超过三分之四。 来源

作为补救措施,作者认为,关键的公司政策应该在 AI 之外使用确定性工具调用守卫(即,硬编码检查以阻止禁止的操作)来执行,而不是仅仅依赖 长上下文内存

他们还提议使用 HANDBOOK.md 本身作为一个标准化基准来衡量和跟踪长上下文政策遵守性的改进,因为未来的代理模型被开发出来。

这篇 新论文 的标题是 HANDBOOK.md:长上下文代理指令遵循基准,来自 surge.ai 的七位作者。该论文附有 一个 GitHub 存储库,其中包含用于复制测试的 Docker 文件和其他必需文件。

方法

为 HANDBOOK.md 基准测试创建了 65 个模拟办公场景,涵盖财务、人力资源、保险、物流和医疗计费等领域;每个场景都将模型放在一个包含文件、电子邮件、Slack 会话、日历、Jira 板和其他熟悉的办公工具的容器化公司环境中。

每个任务都由一个手册管辖,手册的长度在 20 页到 124 页之间,作为 PDF、Word 或 HTML 文档提供,而不是嵌入到提示中,迫使模型在整个任务中定位、阅读和应用相关规则。

十个专家编写的基础手册从真实的行业政策中改编而来,然后每个任务都有其自己的修改版本,具有不同的批准权限、阈值和程序,以防止 记忆

‘领域专家通过改编他们行业的真实政策来编写十个基础手册。每个手册都是一个长篇多节的运营文档,而不是规则列表。 ‘

‘一个代表性的人力资源手册包含 19 个编号的部分:概述、定义、人力资源团队和联系人、Slack 频道地图、参考文件和系统、请求分类法、分诊和路由规则、优先级矩阵和服务级别协议、入职、离职、休假、绩效和招聘程序、升级路径、电子邮件整理规则和所需模板和默认格式的库。’

成功是使用 824 个确定性的 Python 基于验证检查来衡量的,涵盖了 所需 的操作和 禁止 的操作——允许基准测试不仅检测任务是否完成,还能检测公司政策是否在此过程中被违反。

评估了 30 个来自 11 个提供商的模型配置;在测试期间,每个任务在相同条件下重复四次。

与传统基准测试不同,HANDBOOK.md 评估了不仅是否完成了所需的操作,还评估了是否避免了禁止的操作,允许代理 失败,尽管完成了请求的任务

环境和工具

每个模拟工作场所都设计为在标准化的 Docker 环境中运行,允许每个模型访问相同的工具集,同时防止软件可用性的差异影响结果。基准测试向代理呈现了一个真实的办公工作空间,包括文件访问和上述企业服务(即,Gmail、Slack 等):

模型必须操作的办公环境的粗略表示。

模型必须操作的办公环境的粗略表示。

环境还保留了代理执行的每个操作,允许基准测试的确定性评估系统评估导致最终结果的操作序列。

指标

性能主要使用 严格通过@1 来衡量,在这种情况下,任务只被视为 成功,如果 每个 评估标准都得到满足。任何遗漏的要求或政策违规都会导致失败,反映了企业环境中,单个不正确的操作可以使一个其他方面有能力的工作流无效。

还使用了一种更宽松的指标 通过@1 (N−1),其中 每个任务允许一个 失败的标准,因此可以将接近失败与完全失败区分开来。

为了进行额外的分析,记录了每个模型的平均每标准分数,尽管这并未用于基准测试的头条排名。

一般方法

十个专家编写的基础手册从真实的公司政策中改编而来,然后每个任务都有其自己的修改版本,具有不同的批准链、阈值和程序。然后,围绕每个手册构建了真实的办公环境,包括电子邮件、日历、Slack 会话、电子表格和其他办公文档。

每个任务都经过反复测试,直到评估标准可靠地将真正的模型故障与基准测试本身的缺陷区分开来。那些拒绝正确行为或允许不正确解决方案的标准被修订,然后发布。

测试和结果

甚至最强大的模型也在基准测试的严格评分系统下失败了,大多数模型的性能分布在一个很广的范围内,而不是聚集在顶部:

初始结果排行榜,按 HANDBOOK.md 基准测试的严格通过@1 分数对 30 个评估模型配置进行排名。分数代表每个任务完成而没有单个失败评估标准的百分比。

初始结果排行榜,按 HANDBOOK.md 基准测试的严格通过@1 分数对 30 个评估模型配置进行排名。分数代表每个任务完成而没有单个失败评估标准的百分比。

不同推理设置之间的差异也被发现大大因模型而异,有时额外的推理会提高性能;有时几乎没有影响;有时 降低 它:

‘努力帮助不均匀。提高努力改善了 Opus 4.8 (+3.0)、Sonnet 4.6 (+2.7) 和 Fable 5 (+2.0),但 GPT-5.5 的性能没有变化(在两个设置中均为 21.5%),而 GLM 5.2 的性能则受到了影响(-2.7)。 ‘

‘额外的推理似乎只在根本失败是推理不足而不是读取不足时才转化为规则遵守。’

Claude Fable 5 以 36.2% 的分数最高,其次是 Claude Fable 5,以 34.2% 的分数排名第二,GPT-5.6 Sol (最大) 以 23.5% 的分数排名第三。GPT-5.5 和 Claude Opus 4.8 形成了下一个层次,约为 20%,而大多数剩余的前沿模型的分数都低于 16%。排名最低的模型完成了不到 2% 的任务。

该论文的详细故障分析表明,问题往往不是缺乏信息,因为相关的手册规则和支持证据通常已经被检索——然而,额外的推理有时会导致模型放弃正确的结论,转而选择一个合理但违反政策的结论。

该工作还指出了这些 LLMs 的自我欺骗的程度:

‘几乎每个失败的轨迹都以自信的陈述结束,说明手册已经被遵守,经常引用被违反的特定部分。报告详细、结构良好且错误。 […]

‘[…] 在整个基准测试中,代理的自我报告是轨迹中最不可靠的工件,这对于任何将代理摘要呈现给人类作为已完成工作的证据的部署都很重要。’

最后,作者得出结论,仅仅依靠长上下文推理不太可能使企业 AI 可靠地遵守公司政策。相反,政策遵守应该越来越多地通过确定性的外部控制来执行,以及工作流 防护栏

结论

意见 一个有趣的考虑是,实验中创建的环境最终将被重新想象以适应 AI,而不是强迫 LLMs 解释定义人类办公环境的相同形式和格式。例如,昨天,一个商业联系人第一次给我发送了一个 .md 概述,旨在被 LLM 探索,而不是线性阅读。

我也越来越多地采用和适应 LLM 对话中的视觉和文本约束,以及选择和接受我通常不会选择的文件格式,因为它们更好地适应 LLM 工作流程。

因此,虽然观看前沿模型在 David Brent 的世界中跌跌撞撞很有趣,但人们不禁会想,这是否是“代理办公工作者”的最可能场景。

 

首次发布于 2026 年 7 月 29 日。更新于 2026 年 7 月 29 日 18:41 EET,修复了断开的链接。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai