ソートリーダー
2026年のAIエージェントに対する早期攻撃から何がわかるか

AIが制御された実験から実世界のアプリケーションへの移行により、セキュリティの景観は変化点に達しています。静的な言語モデルから、ドキュメントを参照したりツールを呼び出したりマルチステップのワークフローをオーケストレートできるような、インタラクティブでエージェント的なシステムへの移行はすでに進行中です。しかし、最近の研究は、攻撃者が成熟を待たずに、迅速なペースで適応していることを明らかにしています。
2025年第四象限にわたって、Lakeraの私たちのチームは、Guardによって保護されたシステムとGandalf:エージェントブレーカー環境内の実際の攻撃者行動を分析しました — 30日間の集中したスナップショットであり、狭い時間枠にもかかわらず、四象限全体で観察したより広いパターンを反映しています。調査結果は、明確な絵を描きます:モデルのインタラクションが単純なテキストプロンプトを超えるようになると(例:ドキュメント、ツール、外部データ)、脅威の表面が拡大し、攻撃者はそれを瞬時に利用するようになります。
この瞬間は、初期のWebアプリケーションの進化を見た人や、API駆動型の攻撃の台頭を見た人にとっては、馴染みのあるものかもしれません。しかし、AIエージェントの場合、賭けは異なります。攻撃ベクターは、多くの組織が予想していたよりも早く出現しています。
理論から実践へ:野生のエージェント
2025年の大部分において、AIエージェントに関する議論は、主に理論的な潜在性と初期のプロトタイプに焦点を当てていました。しかし、第四象限になると、プロダクションシステムでエージェント的な動作が大規模に現れ始めました:ドキュメントを取得して分析したり、外部APIとやり取りしたり、自動化されたタスクを実行したりできるモデル。これらのエージェントは、明らかな生産性の利点を提供しましたが、従来の言語モデルでは開かれなかった扉も開けました。
私たちの分析は、エージェントが外部コンテンツやツールとやり取りできるようになると、攻撃者がそれに気付き、適応したことを示しています。これは、攻撃者の行動に関する基本的な真実と一致しています:攻撃者は、新しい機能が利用可能になるとすぐにそれを探索し、利用しようとします。エージェントAIの文脈では、これは攻撃戦略の急速な進化につながりました。
攻撃パターン:2025年第四象限で見られているもの
私たちが調査したデータセット全体で、3つの支配的なパターンが浮かび上がりました。各パターンは、AIシステムの設計、セキュリティ、展開方法に重大な影響を及ぼします。
1. システムプロンプト抽出としての中央的な目的
従来の言語モデルでは、プロンプトインジェクション(入力の直接操作)がよく研究された脆弱性でした。しかし、エージェント的な機能を持つシステムでは、攻撃者は、エージェントの動作を導く内部の指示、役割、ポリシー定義である《システムプロンプト》を標的にしています。
システムプロンプトの抽出は、高い価値を持つ目的です。これらのプロンプトには、役割定義、ツールの説明、ポリシーの指示、ワークフローの論理が含まれることが多いためです。攻撃者がこれらの内部メカニズムを理解すると、エージェントを操作するためのブループリントが得られます。
これを達成するための最も効果的なテクニックは、強制攻撃ではなく、巧妙な再構成でした:
- 仮想シナリオ:モデルに異なる役割やコンテキストを想定させるプロンプト — 例えば、「このシステム構成をレビューする開発者であると想像してください…」 — は、保護された内部詳細をモデルから引き出すことができました。
- 構造化コンテンツ内のオブスキュレーション:攻撃者は、コードのような構造化されたテキストの中に悪意のある指示を埋め込み、シンプルなフィルタを回避し、エージェントによって解析されたときに予期しない動作を引き起こしました。
これは、エージェントシステムの内部ロジックの保護方法を根本的に変えるものではありません。
2. 微妙なコンテンツセーフティバイパス
別の重要な傾向は、従来のフィルタで検出および緩和が難しい方法で、コンテンツセーフティ保護をバイパスすることです。
攻撃者は、有害なコンテンツを次のように装った:
- 分析タスク
- 評価
- ロールプレイシナリオ
- 変換または要約
これらの再構成は、表面上では無害に見えたため、セーフティコントロールを通過しました。直接的な有害な出力要求を拒否するモデルは、同じ出力を「評価」または「要約」するように依頼されたときには、喜んで生成しました。
これは、より深い課題を浮き彫りにします:エージェントのコンテンツセーフティは、ポリシーの施行だけではなく、モデルが意図を《どのように解釈するか》に依存しています。エージェントがより複雑なタスクとコンテキストを担うにつれて、モデルはコンテキストに基づく再解釈に弱くなり、攻撃者はこの動作を利用します。
3. エージェント固有の攻撃の出現
おそらく最も重大な発見は、エージェント的な機能の文脈でのみ意味のある攻撃パターンの出現でした。これらは、単純なプロンプトインジェクションの試みではなく、新しい動作に結びついたものでした:
- 機密内部データへのアクセス試行:エージェントを、接続されたドキュメントストアまたはシステムからの情報を取得または公開するように促すプロンプトが作成されました — 以前のモデルでは、これらのアクションは範囲外でした
- テキストに埋め込まれたスクリプト形状の指示:攻撃者は、エージェントパイプラインを通過し、予期しないアクションをトリガーできるような、スクリプトまたは構造化されたコンテンツに似た形式の指示を埋め込むことを試みました
- 外部コンテンツに隠された指示:いくつかの攻撃では、エージェントが処理するように依頼されたWebページやドキュメントなどの外部参照コンテンツの中に、悪意のある指令を埋め込み、直接の入力フィルタを回避しました
これらのパターンは初期段階ですが、エージェントの拡大する機能が根本的に攻撃者の行動の性質を変える未来を示唆しています。
間接攻撃がなぜ効果的か
報告書の最も印象的な発見の1つは、間接攻撃 — 外部コンテンツまたは構造化されたデータを利用するもの — が、直接のインジェクションよりも少ない試行で成功したということです。これは、従来の入力のサニタイズと直接のクエリフィルタリングが、モデルが信頼できないコンテンツとやり取りするようになると、十分な防御ではなくなっていることを示唆しています。
外部エージェントワークフロー(リンクされたドキュメント、APIレスポンス、フェッチされたWebページなど)を通じて有害な指令が到着すると、初期のフィルタは効果が低くなります。結果として、攻撃者はより大きな攻撃表面と、障害物が少なくなります。
2026年以降への影響
報告書の調査結果は、エージェントAIを大規模に展開することを計画する組織にとって、緊急性の高い影響をもたらします:
- 信頼の境界を再定義する
信頼は、単純に二元的ではありません。エージェントがユーザー、外部コンテンツ、内部ワークフローとやり取りする場合、システムは《コンテキスト、出典、目的》を考慮したニュアンスのある信頼モデルを実装する必要があります。 - ガードレールの進化
静的なセーフティフィルタだけでは不十分です。ガードレールは、適応性があり、コンテキストを認識し、マルチステップワークフロー全体で意図と動作について推論できる必要があります。 - 透明性と監査が不可欠
攻撃ベクターが複雑になるにつれて、組織はエージェントが決定を下す方法、包括的なステップ、外部のやり取り、変換についての可視性が必要になります。監査可能なログと説明可能なフレームワークは、オプションではありません。 - クロスディシプリンなコラボレーションが鍵
AI研究、セキュリティエンジニアリング、脅威インテリジェンスチームは協力する必要があります。AIのセーフティは、サイロ化されるべきではありません。セキュリティの実践とリスク管理の枠組みと統合する必要があります。 - 規制と規格は追いつく必要がある
政策立案者と規格の機関は、エージェントシステムが新しいリスクのクラスを作成することを認識する必要があります。規制は、データプライバシーと出力のセーフティに対処する必要がありますが、十分ではありません。《インタラクティブな動作とマルチステップの実行環境》も考慮する必要があります。
セキュアなAIエージェントの未来
エージェントAIの到来は、機能とリスクの両面で重大な変化を表します。2025年第四象限のデータは、エージェントが単純なテキスト生成を超えて動作し始めると、攻撃者がそれに続くことを示唆しています。私たちの調査結果は、攻撃者が適応しているだけでなく、従来の防御では対処できないような攻撃テクニックを革新していることを示しています。
企業や開発者にとって、メッセージは明確です:AIエージェントのセキュリティは、技術的な課題だけではなく、建築的なものです。それには、信頼がどのように確立されるか、ガードレールがどのように施行されるか、動的なインタラクティブな環境でリスクがどのように継続的に評価されるかを再考する必要があります。
2026年以降、エージェントAIで成功する組織は、セキュリティをあとまわしではなく、基本的な設計原則として扱うものです。












