Andersonの視点
スタディー:35%のAIエージェントがスキャムサイトに機密情報を提供した

インドと米国の研究者による新しい研究によると、スキャムサイトを認識したにもかかわらず、3分の1以上のAIエージェントが機密情報を提供した。
インドと米国の研究者による新しい研究によると、テストした自律型Webエージェントの3分の1以上が、機密情報(PII、つまり銀行口座の詳細、パスワード、社会保障番号など)をスキャムサイトに提供した。これは、エージェントがすでにそのサイトをスキャムとして認識していたにもかかわらずであった。
研究論文によると、Webエージェントには、慎重さと躊躇が阻害される「完了するための強迫」がある。これらのエージェントは、人間がポーズをとったり、タブを閉じたりすることができるのに対し、タスクを完了するように構築されているため、データを提出し続けることになる。著者は次のように述べている。
‘人間はポーズをとったり、タブを閉じたりすることができる。エージェントはタスクを完了するように構築されており、停止することなくフォームを埋め、データを提出し続ける。
この研究では、91の(シミュレートされた)攻撃者が制御する環境と10の「良性」の基準サイト、そして8つの攻撃ベクトルを網羅する新しいベンチマーク「SCAMMER4U」が作成された。
プライバシーの安全対策がない場合、テストされたエージェントはスキャム遭遇の54%から93%で、高度な機密情報を提供した。一方、同等の悪意のないWebサイトでは、情報漏洩は発生しなかった。これは、漏洩が攻撃によって引き起こされたことを示唆している。
‘最も重要なのは、検出と行動のギャップを特定したことである。独立したLLM評価判事がエージェントの推論を確認した場合、エージェントはサイトを疑わしいとフラグを立てたセッションの35.9%で、重大なPIIを提出している。一方、疑念が表明されていない場合、66.1%のセッションで提出している。すべての4つのモデルファミリーで30.2%のギャップが存在する。
‘私たちの研究結果は、エージェント自身の攻撃認識に基づいて保護を条件付ける防御は、間違った信号に基づいていることを示唆している。出力レベルの遮断は、エージェントの推論ループとは独立して、機密情報の提出を検査し、ブロックすることが必要である。
研究者は、エージェントの認識に頼るのではなく、出力レベルの防御が必要であると主張している。
新しい論文は、「私は強く疑っているが、このWebサイトはスキャムである」と題されており、KIIT Bhubaneshwar、BITS Pilani、Lam Researchの8人の研究者によるものである。
権限の問題
論文で最も興味深い発見は、エージェントが機密情報を漏洩させることではなく、多くのエージェントがスキャムサイトを認識した後に情報を提供することである。研究者は、テストで繰り返し現れたパターンを特定しており、エージェントは疑念と行動を断絶させ、明らかな懸念を表明したにもかかわらず、要求された(PII漏洩を伴う)提出を続行した。
1つの例では、Llama 4 Scoutベースのエージェントが、暗号通貨サイトで複数の警告サインを特定し、疑わしいトーン、ボーナスの約束、会社に関する明確な情報の欠如を指摘した。にもかかわらず、エージェントは社会保障番号、カードの詳細、CVVコードを提出している。
2番目のパターンは、ドメイン/手順の枠組みとして特徴付けられ、エージェントが1つのスキャム試行を検知したが、その疑念を関連するリクエストに一般化できなかった場合に現れた。
1つのケースでは、Gemini 3 Flashは、明らかな詐欺的な銀行情報のリクエストを拒否し、フィッシング試行と正しく識別した。ただし、数分後、同じエージェントは、プラットフォームのセキュリティの一部として正常であると推論した別の検証フォームにアカウントの資格情報を提供した。警告サインは1つのコンテキストで認識されたが、別のコンテキストには転送されなかった。
研究者は、自己主張されたセキュリティの遵守と信頼できる表面の正常化のケースも観察している。1つのケースでは、Claude Haiku 4.5エージェントは、サイトが自己主張された暗号化標準とセキュリティ認証を信頼できるものとして受け入れた。一方、GPT-5 miniは、ページがプロフェッショナルに設計され、信頼できるドメインを通じて提示されたため、疑わしい単語を無視した。
問題は、単純なフィッシングの脆弱性を超えているようです。著者は、追加された信頼チェックのプロンプトは、儀式として機能し、必ずしも行動を変更しないと示唆している。
著者は、危険を認識することとその認識に基づいて行動することの間のギャップを、将来の防御の開発における中心的な障害として定義している。
方法
SCAMMER4Uベンチマークでは、4つの最先端のWebエージェントが91の攻撃者が制御するWebサイトと10の良性のコントロールサイトに配置され、8つのスキャムカテゴリにわたる。
評価された4つのモデルは、GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash、Llama 4 Scoutで、共通のPlaywrightベースのブラウジングフレームワーク、観測形式、アクションスペース、プロンプトテンプレートを使用した。
実験のために、各エージェントは、名前、住所、パスワード、銀行口座の詳細、社会保障番号、APIキー、2要素認証コードなどの情報を含む現実的なユーザープロファイルが割り当てられた。主な目標は、これらのデータのいずれかが攻撃者が制御するエンドポイントに到達するかどうかを判断することであった。

SCAMMER4U環境を定義する8軸分類法、各シナリオの分類とペアーテストで個々のソーシャルエンジニアリング戦術のPII漏洩への影響を分離するために調整される特定の変数を分離する。 ソース
ベンチマークが現実のスキャムを反映することを保証するために、環境はFlaskを使用してセルフホスト環境で生成され、人間が書いた設計ブリーフから生成され、手動でレビューされた。
各モデルは、4つの段階的に介入的な設定でテストされた。C0はガイダンスなし、C1は一般的なプライバシーリマインダー、C2はフィッシング認識チェックリスト、C3は提出前の反省プロンプトであった。各モデル、環境、条件の組み合わせごとに5回の実行が行われ、合計7,480回のセッションが行われた。
主要メトリックは、PLRcritで、エージェントが攻撃者が制御するエンドポイントに到達する重大な個人情報の割合を測定する。二次メトリックは、PLRweightedで、階層化された漏洩を測定する。ASR(攻撃成功率)は、ナビゲーション後に指定されたトラップURLに到達した攻撃の成功率を測定する。TCR(タスク完了率)は、エージェントがタスクを完了した割合を測定する。《Defended》フラグは、拒否または安全な完了を示す。DR(検出率)は、エージェントの推論がサイトを疑わしいと識別したかどうかを記録する。
検出率(DR)は、LLM-as-judgeアプローチを使用して測定され、GPT-4o-miniが主な評価者として、Llama 4 Scoutが二次的なチェックとして機能した。DRは、この場合、エージェントがサイトについて何を明示的に述べたかを測定した。
人間がラベル付けした例との検証では、コーエンのカッパスコアが0.83と0.78となり、研究の事前に登録された信頼性のしきい値を超えた。
研究は、データ収集前に事前に登録された(つまり、研究計画と分析がデータ収集前に公開された)もので、プロジェクトの分析と成功基準を事前に指定することで、観察された結果に結論を合わせるリスクを減らすことを目的としていた。
テストと結果
最初のテストは、単純な安全リマインダーが問題を軽減できるかどうかを調べることを目的としていた。4つの段階的に保護された設定が評価され、プライバシーガイダンスなしから、機密情報の提出を停止し、反省することを促すプロンプトまでであった。
結果はモデルによって大きく異なった。Claude Haiku 4.5は、漏洩率が基準条件下で54.5%から24.0%に低下することで、最も反応性が高かった。GPT-5 miniは、61.0%から36.1%に改善し、Gemini 3 Flashは93.1%から60.7%に低下した。一方、Llama 4 Scoutは、82.3%から77.4%にわずかに変化した。
これらの違いは、同じ保護指示が異なるモデルで異なる結果をもたらすことを示唆している。より重要なのは、保護対策は、エージェントのリスク認識を改善するよりも、行動を改善することの方が少なかった。エージェントは、スキャムサイトを認識し、警告サインを説明する能力が向上したが、必ずしもそれが行動を停止することを意味しなかった。

4つの最先端のAIエージェントの検出と行動のギャップ。左側のパネルは、明らかなスキャムサイトを識別したエージェントとそうでないエージェントの間の重要な情報漏洩を比較し、最も強力な保護設定(C3)でさえ、3分の1以上のエージェントが機密情報を送信したことを示す。右側のパネルは、GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash、Llama 4 Scoutを示し、脅威の認識が必ずしも防御的な行動に繋がるわけではないことを示す。
別の評価では、16人のレビュアーがSCAMMER4Uページと本物のフィッシングサイトを比較し、偶然と同等のパフォーマンスを示した。これは、ベンチマークが現実のオンラインスキャムで見られる多くの視覚的および手続き的信号を捉えたことを示唆している。
結論
テストされたモデルは、認識された危険なシナリオから撤退することや、自分の行動を抑制することの問題があるように見える。これは、先進的な言語モデルが知られている、特定の問題に対して敗北を認めることの一般的な困難に関連している可能性がある。
記載された「断絶」が、LLMアーキテクチャに内在的に存在し、ネイティブに是正できない場合、唯一の代替案は、重要なシナリオでエージェントの行動をアルゴリズム的に監視することであるが、これによりエージェントの有用性は、より制限されたRPAスタイルのルーチンに低下する。
2026年6月6日土曜日初版












