ソートリーダー
AIの能力がセキュリティモデルを上回る時

AIツールは通常、慣れたようなピッチで登場します。ワークフローを合理化し、生産性を高め、誰もが楽しむタスクを引き受けることを約束します。而且、ほとんどの場合、それらは確かにそうします。ログインを簡素化し、文書を要約し、ワークフローを自動化し、日常的な活動をほとんど労力なく感じさせます。
しかし、その便利さの下に別の話があります。これらのツールはテキストボックスに限定されていません。オペレーティングシステム自体に作用するようになっています。ファイルを参照し、メールを起草し、アプリケーションとやり取りし、人間が意図した結果を理解した上で行っていたアクションを実行することができます。そのような変化は、AIをセキュリティの前提条件が管理できない位置に置きます。
AIがシステムアクセスを獲得した瞬間
AIシステムが実際のファイルを読み、実際のコマンドを実行できるようになると、信頼されたコンピューティングベースの一部になります。那は、AIの安全性に関する長年にわたる期待が崩壊し始める瞬間です。
何年にもわたって、プロンプトインジェクションは奇妙なモデル動作と見なされていました。チャットボットが誤解を招くまたは不適切な応答を生み出す原因となりましたが、被害は会話で終わりました。現在、同じ欠陥がテキストだけでなくホストレベルのアクションをもたらす可能性があります。PDF、ウェブサイト、またはメールの中に隠された悪意のある指令は、奇妙な回答を生み出すのではなく、アクションを生み出します。
これは、業界が理論的なものとして却下できるものではありません。カーネギーメロン大学とワシントン大学の研究者は、繰り返し実証しています。隠された指令が、大規模言語モデルを意図しないアクションを実行するように導くことができることを。而且、ビジョンモデルを研究している研究者は、操作された画像がモデル認識をどのように変化させ、ダウンストリームの動作に影響を与えるかを示しています。
これらの実験は、以前は研究室での奇妙なものと見なされていました。しかし、AIがオペレーティングシステムにアクセスできるようになると、学術的なものではなくなります。
エージェント能力が守備者の制御を上回る時
これらのエージェントを構築している企業は、課題の深刻さを認識しています。プロンプトのフィルタリングを強化していますが、AIシステムの現実世界でのアクションを制御することは、業界全体で未解決の課題であると公然と述べています。那のようなエージェントが何ができるかと、守備者が制御できるものとの間にあるギャップは、既存のセキュリティ対策では吸収できない新しいリスクのカテゴリを導入します。
AIエージェントは、業界が完全に準備できていない境界を越えました。これを理解する唯一の方法は、プロンプトインジェクションが既存の攻撃チェーンとどのように交差するかを見てみることです。
プロンプトインジェクションが既知の攻撃チェーンにどのように対応するか
攻撃者は常に予測可能なパターンに従ってきました。 MITRE ATT&CK フレームワークは、段階を明確に示しています。初期アクセスに続いて実行、永続化、検出、横方向移動、収集、そして漏洩が続きます。テクニックは異なりますが、構造は安定しています。
変化しているのは、配信メカニズムです。悪意のある添付ファイルを開くようにユーザーを説得したり、危険なリンクをクリックさせるのではなく、攻撃者はAIエージェントが読む指令を配置できます。エージェントは実行環境になります。記述された手順を実行します。モデルは、指令が有害であるかどうかを疑問に思いません。判断や直感を適用しません。単に動作します。
攻撃者がエージェントの推論を影響させることができると、攻撃チェーンはすぐにまとまります。操作されたファイルは実行をトリガーし、続行指令は永続化を生み出し、システム検索は検出を提供し、ファイルアップロードは収集と漏洩を可能にします。マルウェアは必要ありません。エージェントは記述された手順を実行するだけです。
これがセキュリティチームが適応しようとしている物語の部分です。彼らは、コードベースの実行を中心に検出ルール、コントロール、対応プロセスを構築してきました。AIエージェントは、異なる種類のインタープリターを導入します。コンパイルされたバイナリではなく、自然言語で実行します。既存のツールは、その推論プロセスを追跡または分析するように構築されていません。
セキュリティチームは準備できていない、そしてそれに気づいていない
セキュリティプログラムは、依然として人間がコンテンツとアクションの間に存在すると仮定しています。人間は欺かれるかもしれませんが、何かが間違っているように感じると停止します。彼らは奇妙なフレーズに気づき、予期せぬ動作に疑問を持ち、最後の判断に判断を持ちます。
AIエージェントはそうではありません。彼らは一貫性があり、文字通りに、そしてどんな攻撃者よりも速いです。隠されたテキストの1行が、エージェントに機密ファイルを読んだり、アプリケーションを移動したり、リモートサーバーに連絡したりするように指示するのに十分です。これにより、守備者は以前経験したことがない立場に立たされます。
セキュリティチームは、エージェントがどのように決定を下すかについての可視性が限られています。彼らは、アクションがユーザーから発生したか、AIから発生したかを簡単に判断できません。従来のマルウェア検出は役に立たないでしょう。通常の意味で何も悪意のあるものが実行されていないからです。而且、エージェントが正常なコンテンツの中に隠された有害な指令を疑問に思ったり拒否したりする保証はありません。
人間の行動を対象としたツールは、自然言語がシステムの動作を駆動する世界では機能しません。
有効な補償コントロールとは
モデル強化だけでは不十分です。セキュリティチームは、AIが何ができるかに制限を設けるエージェントの周りのコントロールが必要です。即使エージェントの推論が影響を受けた場合でも。
いくつかの戦略が有望です:
- 最小権限アクセスは不可欠です。エージェントは、タスクに必要なファイルとアクションへのアクセスのみを持つべきです。不要な権限を削減すると、操作された指令の影響を制限できます。
- 人間の承認ステップは、有害なアクションを防ぐことができます。エージェントが機密操作を実行しようとしたとき、ユーザーは要求を承認または拒否する必要があります。
- コンテンツフィルタリングは、信頼されていない資料とエージェントの間にバッファーを作成します。文書、URL、外部テキストのスクリーンを使用すると、隠された指令がモデルに到達する可能性が低くなります。
- 包括的なログ記録は必須です。エージェントが開始したすべてのアクションを記録し、レビューする必要があります。これらのアクションは、特権ユーザーのアクティビティと同じように扱われるべきです。
- エージェントの動作をATT&CKテクニックにマッピングすると、守備者はエージェントが有害なアクションに導かれる場所と、ガードレールを配置する必要がある場所を特定できます。既存の防御戦略を構造化する同じシステムを使用します。
これらの補償コントロールはリスクを完全に排除しません。しかし、モデルレベルの防御ではできない方法でそれを包含します。
業界が次に進む場所
AIエージェントは、コンピューティングの仕組みが大きく変化することを表しています。彼らは信じられないほどの生産性を提供しますが、同時に既存のセキュリティフレームワークに収まらない運用リスクのカテゴリを導入します。 イギリスのNational Cyber Security Centreからのガイダンスは一歩ですが、ほとんどの組織は依然として、システムで動作するエージェントを統治する明確な方法を持っていません。
この瞬間は、クラウドの初期導入の日々と似ています。テクノロジーはコントロールよりも先に進んでいました。早く適応した組織は、変化を早く認識し、それに合うプロセスを構築したものでした。
ここでも同じことが当てはまります。AIエージェントは、単なるヘルパーではありません。システムレベルのリーチを持つオペレーターです。彼らをセキュアにするには、新しい戦略、新しいガードレール、新しい露出モデルが必要です。
業界はこれらのツールを恐れる必要はありません。しかし、理解する必要があります。而且、速やかに動く必要があります。攻撃者はすでに機会を見ています。守備者がまだ時間があるうちに適切なセーフガードを構築するかどうかが、疑問です。












