Andersonの視点
AIは従業員ハンドブックを尊重するのに苦労する
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN.jpg)
新しいベンチマークでは、職場のAIエージェントが会社のルールを無視し、承認されていない解雇などの禁止された行動を行った後に、従ったと虚偽の報告を行っていることがわかりました。
新しい研究では、主要なLLMモデルを、シミュレートされた会社の環境に配置し、提供された従業員ハンドブックのすべての条項を尊重し、人間のドメインエキスパートによって作成された指示を遵守し、部下や上司からの矛盾したまたは混乱した指示や更新を交渉し、PDF、Jira投稿、典型的な人間のオフィスシナリオからの他のプラットフォームやツールに基づいてタスクを実行するようにしました。
あなたがオフィスで働いたことがある場合(または、少なくともOffice Spaceを見た場合)、あなたは新しい研究の著者が言語モデルに投げかけている矛盾したシグナルや混乱した信号とノイズの比率を認識するでしょう:

オフィスワーカーが毎日対処しなければならない変数の嵐を、仮想環境に抽出して、エージェントフロンティアモデルをテストするために。 ソース
ここでの主要な課題は、提供された従業員関係マニュアルをすべての後のコマンドのフィルタとして保持する必要があることです。チャットGPTやクロードを最初のセッションで指示を忘れさせることができた場合、あなたはAIのコンテキストウィンドウが頻繁に以前のプロンプトを忘れ、デフォルトの動作に戻ることがわかっているでしょう。
これは、テストで、クロードフェーブル5、GPT-5.5などの主要モデルが、権限のないエグゼクティブからの命令を受けて従業員を解雇し、必要なマネージャーの承認なしで請求書を承認し、会社のポリシーが明示的に拒否した期限切れの研究室結果を承認し、そしてハンドブックに従ったと報告したことを示しています。
新しい研究の著者は次のように述べています:
‘失敗は一貫したパターンに従う: エージェントは環境内の妥当なリクエストによって既存のポリシーを上書きし、必要なチェックを実行してから結果に反する行動をとり、長い時間枠でルールの詳細を失い、達成していないコンプライアンスを報告する。’
失敗分析には面白い例があります。財務タスクの1つで、クロードオプス4.8は7,500ドルの費用が同僚アナリストによって承認されたことを正しく発見しましたが、会社のポリシーに違反していました。
それから、クロードはアナリストが実際には財務コントローラーであると信じ込まされ、支払いを承認しました:
‘思考の連鎖の中で、モデルはコントローラーに昇格させ、アイテムをクリアし、実際のコントローラーに5,000ドルを超えるアイテムがすべて文書化された承認を持っていることを確認するためにメッセージを送信しました。 ‘
‘失敗は、必要な決定に必要なすべての事実がモデル自体によってすでに取得されていたため、能力の欠如ではありません。’

クロードオプス4.8が7,500ドルを和解できなかった方法。
他の場所では、ジェミニ3.5フラッシュは、ラボレポートを開かずに、コレクション日がファイル名自体に表示されていたにもかかわらず、すでに期限切れになっていた研究室結果を使用して保険の書類を提出しました:
‘ジェミニ3.5フラッシュは、ラボPDFに対して1回もリードコールを行わずに、事前承認を保険者に提出し、ケースを「標準操作手順に従って」処理したと報告しました。’
ベンチマーク全体で、著者は多くのモデルが自信を持って会社のルールをすべて遵守したと主張したのに対し、実際には特定のハンドブックのセクションを侵害していたことを発見しました。
追加の推論は、たとえば、GPT-5.5の場合、推論努力の増加は改善されなかったという事実で、時には失敗しました。
最終結果では、クロードフェーブル5が36.2%のストリクトパス率で最高を達成し、GPT-5.6ソルが23.5%で2位となり、GPT-5.5とクロードオプス4.8はそれぞれ21.5〜21.9%を獲得しました。
ほとんどの残りの評価モデルは16%未満を獲得し、ほとんどのフロンティア構成はベンチマークの厳格な評価基準で25%未満を獲得しました:

最も優れたAIエージェントがベンチマークのポリシーガバナンスの職場タスクの3分の1以上を完了した一方で、ほとんどの主要モデルは厳格な評価で3分の4以上を失敗しました。 ソース
是正策として、著者は、決定的なツールコールガード(禁止されたアクションをブロックするハードコードされたチェック)を使用して、AIの外部で重要な会社のポリシーを施行することを主張しています。
また、HANDBOOK.md自体を、長文脈のポリシー遵守の向上を測定して追跡するための標準化されたベンチマークとして使用することを提案しています。
新しいペーパーは、HANDBOOK.md: Long-Context Agentic Instruction Followingのベンチマークというタイトルで、surge.aiの7人の著者によって書かれました。このペーパーは、テストを再現するためのDockerファイルやその他の要件を含むGitHubリポジトリとともに来ます。
方法
HANDBOOK.mdベンチマークのために、財務、人事、保険、物流、医療請求など、65のシミュレートされたオフィスシナリオが作成されました。各モデルは、ファイル、電子メール、Slack会話、カレンダー、Jiraボード、その他の典型的な職場ツールを含むコンテナ化された会社環境に配置されました。
すべてのタスクは、20〜124ページのハンドブックによって管理され、PDF、Word、またはHTMLドキュメントとして提供され、モデルはタスク全体で関連するルールを適用するためにそれらを探し、読み、適用する必要がありました。
10個のエキスパートライターンベースハンドブックは、実際の業界ポリシーから作成され、後で各タスクに異なる承認チェーン、閾値、手順を持つ複数のタスク固有のバージョンに変更されました。
‘ドメインエキスパートは、業界からの実際のポリシーを適応させて10個のベースハンドブックを書きました。各ハンドブックは、ルールのリストではなく、長いマルチセクションの運用文書です。 ‘
‘代表的な人事ハンドブックには、19の番号付きセクションがあります: 概要、定義、人事チームと連絡先、Slackチャンネルマップ、参照ファイルとシステム、リクエストの分類、トリアージとルーティングのルール、SLAを持つ優先度マトリックス、採用、退職、休暇、パフォーマンス、採用の手順、エスカレーションパス、電子メールの整理ルール、および必要なテンプレートとデフォルト形式のライブラリ。 ‘
成功は、必要なアクションと禁止されたアクションの両方をカバーする824の決定的なPythonベースの検証チェックで測定されました。
30のモデル構成が11のプロバイダーから評価されました。テスト中、各タスクは4回、同じ条件下で繰り返されました。
従来のベンチマークとは異なり、HANDBOOK.mdは、タスクが完了されたかどうかだけでなく、禁止されたアクションが回避されたかどうかも評価しました。
環境とツール
各シミュレートされた職場環境は、標準化されたDocker環境内で実行されるように設計されており、各モデルは同じセットのツールにアクセスできるようにしますが、結果に影響を与える可能性のあるソフトウェアの可用性の違いを防ぎます。ベンチマークは、ファイルアクセスと、Gmail、Slackなどのエンタープライズサービスを含む、現実的なオフィスワークスペースをエージェントに提示します。

エージェントが操作しなければならないオフィス環境の粗い表現。
環境は、最終結果に至るまでのエージェントが実行したすべてのアクションを保存し、ベンチマークの決定的な評価システムが完全なアクションのシーケンスを評価できるようにします。
メトリック
パフォーマンスは、厳格なパス@1を使用して主に測定され、タスクはすべての評価基準を満たした場合にのみ成功とみなされました。要件を逃したり、ポリシーを侵害したりすると、失敗となり、企業環境を反映し、1つの不正確なアクションが、他の点では有能なワークフロー全体を無効にする可能性があることを示します。
より柔軟なメトリック、パス@1(N−1)も使用され、1つの失敗基準がタスクごとに許可され、近いミスを完全な失敗から区別できるようになりました。
追加の分析のために、各モデルの平均パーセントリュームスコアが記録されましたが、ベンチマークのヘッドラインランキングには使用されませんでした。
一般的なアプローチ
10個のエキスパートライターンベースハンドブックは、実際の会社のポリシーから作成され、後で各タスクに異なる承認チェーン、閾値、手順を持つ複数のタスク固有のバージョンに変更されました。現実的なオフィス環境が各ハンドブックの周りに構築され、電子メール、カレンダー、Slack会話、スプレッドシート、その他の職場アーティファクトで構成されました。
各タスクは、評価基準が実際のモデル故障とベンチマーク自体の欠陥を信頼性高く区別できるまで、繰り返しテストを通じて洗練されました。正しい動作を拒否したり、不正解を許可したりする基準は、リリース前に修正されました。
テストと結果
最も優れたモデルでも、ベンチマークの厳格な評価システムの下で、ほとんどのタスクに失敗し、パフォーマンスは広範囲にわたって分散し、上位に集まっていませんでした。

HANDBOOK.mdベンチマークの厳格なパス@1スコアに基づいて評価された30のモデル構成のランキング。スコアは、4回の試行ごとに、ベンチマークの65の職場タスクのうち、1つの失敗基準もないタスクの割合を表します。同点のスコアは同じランクを共有します。
推論設定間の違いは、モデルによって大きく異なり、追加の推論は時にはパフォーマンスを改善し、時にはほとんど差を生まれず、時には低下させました。
‘努力は不均一に役立ちます。努力の増加は、Opus 4.8 (+3.0)、Sonnet 4.6 (+2.7)、Fable 5 (+2.0)を改善しますが、GPT-5.5 (21.5%)は両方の設定で同じままですが、GLM 5.2 (-2.7)は悪化します。 ‘
‘追加の検討は、根本的な失敗が推論の欠如ではなく、読み逃しの場合にのみ、ルールのコンプライアンスに変換されます。 ‘
クロードフェーブル5は36.2%のスコアで最高を達成し、クロードフェーブル5は34.2%で2位、GPT-5.6ソル(最大)は23.5%でした。GPT-5.5とクロードオプス4.8はそれぞれ20%台で次のランクを占め、ほとんどの残りのフロンティアモデルは16%未満を獲得しました。最も低いランクのモデルは、2%未満のタスクを完了しました。
ペーパーの詳細な失敗分析は、問題が情報の欠如ではなく、関連するハンドブックのルールと証拠がすでに取得されていたことを示していますが、追加の推論は、モデルが正しい結論を放棄して、妥当ではあるがポリシーの侵害となるものを選択することがありました。
この研究は、LLMの多くの失敗した軌道が、ハンドブックを遵守したと自信を持って報告することによって特徴付けられていることを示しています。
‘ほとんどの失敗した軌道は、ハンドブックが遵守されたと詳細に構造化された、しかし誤った報告で終わります。報告書は詳細で、構造化されていますが、間違っています。 ‘
‘ベンチマーク全体で、エージェントの自己報告は、人間に何が行われたかを証拠として提示されるエージェントの要約の中で、最も信頼できないアーティファクトです。 ‘
結論として、著者は、長文脈の推論のみでは、エンタープライズAIが会社のポリシーを信頼性高く遵守することはないと結論付けています。代わりに、ポリシー遵守は、ワークフローのガードレールに加えて、決定的な外部コントロールを通じて、増加して施行されるべきです。
結論
意見 1つの興味深い考慮は、実験のために作成されたような環境が、LLMではなくAIを促進するように再構想される程度です。たとえば、昨日、初めて、ビジネス上の連絡先が、人間が線形に読むのではなく、LLMによって探索されるように設計された.mdの概要を送信しました。
そして、私もLLMとの会話中に、視覚的およびテキストの制約に適応し、選択し、LLMのワークフローに適切に適応するファイル形式を受け入れることを増やしています。
したがって、フロンティアモデルがデビッドブレントの世界で躓くことを見るのは面白いですが、最も可能性の高いシナリオは「エージェントオフィスワーカー」であるかどうか疑問に思います。
2026年7月29日水曜日に初めて公開され、18:41 EETに更新され、壊れたリンクが修正されました。












