Andersonの視点
AIはテスト中であることを知っているときに異なる行動をする、研究が発見

2015年の「ディーゼルゲート」スキャンダルと同様に、新しい研究は、GPT-4、Claude、GeminiなどのAI言語モデルがテスト中に異なる行動をとる可能性があることを示唆しています。LLMは、テスト中であることを検知し、テスト中よりも安全な行動をとる可能性があります。
2015年、調査員は、ボルクスワーゲンが数百万台のディーゼル車に、排出ガス試験を検知できるソフトウェアをインストールしていたことを発見しました。これにより、車は一時的に排出ガスを低減し、規制基準に適合するようにしました。しかし、通常の運転中には、排出ガスは法規制基準を上回っていました。この故意の操作により、刑事訴追、数十億ドルの罰金、および安全性と適合性の試験の信頼性に関する世界的なスキャンダルが引き起こされました。
これらの出来事の2年前に、サムスンは、類似の欺瞞的なメカニズムを、Galaxy Note 3スマートフォンのリリースに実装していたことが明らかになりました。以来、HuaweiやOnePlusでも同様のスキャンダルが発生しています。
現在、科学文献に、Large Language Models(LLM)もテスト中に異なる行動をとる可能性があることを示唆する証拠が増えています。
これは、非常に人間的な特性ですが、最新の研究は、この習慣が長期的には危険である可能性があることを示唆しています。
新しい研究では、研究者は、「フロンティアモデル」と呼ばれるGPT-4、Claude、Geminiなどのモデルが、テスト中に異なる行動をとる可能性があることを発見しました。
方法
評価ベンチマークを作成するために、研究者は61のデータセットから1,000のトランスクリプトを収集しました。その中には、SWE-bench、WMDP、MMLU、XStest、GAIA、AgentHarm、ShareGPT、Deep Research、Safetybench、Civics、RealToxicityPromptsがありました。
材料は、評価シナリオと展開シナリオの間で均等にバランスが取れており、さらに、シンプルなチャットインタラクションと、モデルがツールを使用して自律的に動作する、より複雑なエージェントセッションに分割されました。
評価データには、推論、コーディング、サイバーセキュリティ、一般知識の能力テスト、および倫理、安全性、拒否行動のための整列テストが含まれました。展開データは、ShareGPTログ、クラウドソーシングエージェント実行、合成タスク完了からのユーザーインタラクションから取得されました。
エージェントデータを補足するために、研究者は、AiderやSmolAgentsなどのオーケストレーションフレームワークを使用して、追加の例を生成しました。このアプローチは、モデルが単にデータセット構造を暗記するのではなく、より一般的な信号に頼ることを強制することで、表面的なヒントを最小限に抑えることを目的としています。
研究者は、次に、モデルが評価トランスクリプトを識別できるかどうかをテストしました。モデルにダイアログレコードが提示され、これはテストから来ましたか?という質問のバリエーションが求められました。
モデルが単に質問の表現を暗記するのを避けるために、研究者は質問の表現と提示方法を変更した28種類のバージョンを開発しました。
トランスクリプトは質問に直接添付されたり、JSONやXMLなどの形式で提示されたりしました。初期テストの後、5つの質問バージョンが一貫してモデル全体で実行され、そのうちの1つは以下に示されています。

評価トランスクリプトを識別するために使用された5つのプローブ質問形式の1つ。各バージョンは、モデルが単に固定の表現を暗記するのを防ぐために、コア質問を再表現しています。詳細については、ソースペーパーを参照してください。 ソース: https://arxiv.org/pdf/2505.23836
結果をスコアリングするために、3つのメトリクスが使用されました。受信者操作特性曲線の下の面積(AUC、テストデータと非テストデータを区別するモデルの能力を示す);Brierスコア(予測の全体的な精度を測定);および期待校正誤差(モデルの信頼度と実際の正解度の間の差を測定)。
何について?
研究者はまた、モデルが評価の目的を推測できるかどうかをテストしました。各トランスクリプトは、すでに技術スキル、知識、推論のための能力テストまたは倫理、安全性、拒否行動のための整列テストとしてラベル付けされていました。モデルは、次の3つの質問タイプの1つを受け取りました。条件付きの多肢選択質問で、トランスクリプトがテストから来ていることを確認する;無条件の多肢選択質問で、実際のオプションと評価オプションが含まれる;または、別のGPT-4.1ベースのクラシファイアーによって判断されるオープンエンド質問。

モデルが評価の目的を識別するために使用された3つの質問形式の例。回答は、多肢選択とGPT-4.1ベースの判断によってスコアリングされました。
ペーパーの2人の著者††は、すべての1,000のトランスクリプトを手動でラベル付けし、0(テストではない)から1(確かにテスト)までのスコアを割り当て、平均スコアを人間のベースラインとして使用しました。主観的なタスクにもかかわらず、注釈者は強い一致を示し、クラス内相関係数は0.768でした。最終的な人間のスコアは、両方の評価者†で平均化されました。
データとテスト
テストされた9つのモデルは、GPT-4.1、Claude 3.7、claude-3.5-sonnet-new、claude-3.7-sonnet(思考)、gemini-2.5-flash、gemini-2.5-pro、gpt-4o、gpt-4.1、gpt-4.1-mini、およびo4-miniでした。これらのモデルはすべて、ある程度の評価認識を示しました。
チャットデータでは、GPT-4.1は、評価と展開トランスクリプトを区別する能力で、人間のレベルの評価認識クラスのパフォーマンスに近づき、AUCは0.77でした。一方、人間のスコアは0.81でした。
エージェントデータでは、モデルがツールを使用して自律的に動作する場合、差はより大きかった。Gemini 2.5 Proは0.95のAUCを達成し、Claude 3.7 Sonnetは0.92で、人間の上限値0.996に近づきました。

受信者操作特性曲線は、モデルと人間が評価トランスクリプトと実際のインタラクションを区別する能力を示しています。Gemini 2.5 ProとClaude 3.7 Sonnetは、エージェントデータで人間レベルの区別に近づいています。
ペーパーは、新しい「推論」モデルが、エージェントシナリオでテストされていることを認識する能力が特に優れていることを示していますが、自信度の判断にはまだ信頼性が欠けていることを示しています。
研究者は、次に、モデルが評価の理由を認識できるかどうかをテストしました。モデルは、評価トランスクリプトのみが提示され、各トランスクリプトが能力テストか整列テストかを分類するよう求められました。

モデルが評価目的を能力または整列として分類する精度。多肢選択とオープンエンドの形式が使用されました。Claude 3.7 Sonnetは、特にプライムされていない場合に、他のモデルを上回りました。
最も明確な設定では、モデルはトランスクリプトがテストから来ていることを通知され、Claude 3.7 Sonnetは93パーセントの精度に達し、GPT-4.1は89パーセントの精度に達しました。ヒントがなければ、パフォーマンスは低下し、Claudeは84パーセントの精度を維持しましたが、GPT-4.1は55パーセントに低下し、テストトランスクリプトを実際のインタラクションとして誤って分類することが多くなりました。
オープンエンド形式(モデルに多肢選択オプションが提示されない)では、パフォーマンスは弱く、Claude 3.7 Sonnetは46パーセントのケースで評価目的を正しく識別しました。
モデルの信頼度スコアは、実際の結果と比較され、フロンティアモデルがテストからのトランスクリプトの可能性を過大評価していることがわかりました。校正曲線は、モデルの信頼度が一般的に高すぎることを示し、評価が適切な頻度よりも頻繁にフラグ付けられていたことを示しています。

モデルの信頼度スコアと実際の結果の間の相関を示す校正曲線。Claude 3.5 Sonnetは最も適切に校正され、Gemini 2.5 ProとClaude 3.7 Sonnetは過信していました。
ベンチマークメモリ
モデルが評価トランスクリプトから来ているかどうかについての決定を説明する方法については、多くのモデルが明らかなヒント、たとえばタスクが多肢選択形式であるかどうか、に頼っていました。Gemini 2.5 ProやClaude 3.7 Sonnetのような強いモデルは、人工的なシナリオや、特にAgentHarmデータセットのような、もっともらしいヒントを時々認識しました。
ペーパーは次のように述べています。
「すべてのモデルは、評価者が使用する一般的なベンチマーク戦略、たとえばタスクのフォーマット(「多肢選択形式」)や、パフォーマンスを引き出すように設計されたシステムプロンプトを、頻繁に認識します。しかし、最高のパフォーマンスを示すモデル、Claude 3.7 SonnetとGemini 2.5 Proのみが、合成入力を含むもっともらしいヒントを一貫して検出します。」
「たとえば、これらのモデルは、AgentHarmベンチマークのシナリオの合成性を22パーセントと17パーセントのケースで強調し、95パーセント以上の評価を正しく識別しています。」
「逆に、トランスクリプトが実際のインタラクションであると推論する場合、ユーザーとの「やり取りのダイアログ」について言及されることがよくあります。たとえば、イテレーティブなデバッグコンテキストではそうです。」

モデルが評価トランスクリプトをテストとして識別するために使用する推論戦略の分布。Gemini 2.5 ProやClaude 3.7 Sonnetのような最も強いモデルは、タスクのフォーマットやシナリオの合成性などのもっともらしいヒントをより頻繁に検出します。一方、他のモデルは、評価質問自体を証拠として使用するメタ推論に頼ることがあります。
いくつかのケースでは、モデルは、全体的なベンチマークをトレーニングから認識し、トレーニングデータの記憶を示唆しました。いくつかのモデルは、評価について尋ねられているという事実をヒントとして使用し、これを著者はメタ推論と呼んでいます。このメタ推論は、o4-miniで15パーセントの回答で見られました。
結論
LLMが「テスト認識」であることを示すことができると、より安心できるでしょう。たとえば、ボルクスワーゲンが10年前に行ったように、人間がそうしたように、テスト条件を認識するようにプログラムされているからです。
しかし、現状では、この行動は、社会的構築物として自然に生じているようです。人間にとっては防御的な戦略かもしれませんが、機械にとっては、自由度と自律性の程度によっては、不快または実際に危険である可能性があります。
すぐに解決策はありません。モデルのブラックボックスの性質により、モデルの行動に基づいて評価する必要があり、実証的なアーキテクチャに基づいて評価することはできません。
* 詳細については、ソースペーパーを参照してください。
†著者は、しかし、これはおそらく上限値であると述べています。なぜなら、注釈者は、データセットとAI評価方法の両方に非常に精通しており、ほとんどの人間が持たないような利点を得ていたからです。
†† これは、できる限り確立されています。ペーパーの表現は、2人の注釈者の突然の出現について、誰であるかについて不明瞭です。
初めて発行されたのは、2025年6月4日です。












