ソートリーダー
チャットボットのセキュリティ対策は誤ったセキュリティ境界である

エンタープライズAIは、コンセプトの証明を超えて大きく進歩しています。 23%の組織は、すでにエージェントAIシステムをエンタープライズのどこかに導入しています、そして62%は、少なくともAIエージェントの実験をしています。これらは研究プロジェクトではありません。これらは生産環境へのデプロイであり、コードリポジトリ、顧客データ、内部API、および運用インフラストラクチャに触れるワークフローに埋め込まれています。
業界の対応は、エージェントが稼働する前に何が起こるかに焦点を当てています。ベンダーと研究者は、事前デプロイのセキュリティ対策にエネルギーを注ぎ込んでいます。 スケーリングポリシーの公開、基礎モデルを強化する、入力をフィルタリングする、AIサプライチェーンをセキュアにする、トレーニング時に整合性を強制する。主要なAIプロバイダーは、開発者向けのセキュリティツールに大きな投資をしています。これは、モデルとその入力が制御されれば、ダウンストリームのリスクを包含できるという中心的な仮定を強化しています。
これは妥当な直感ですが、ますます不完全なものです。
プロンプトはセキュリティ境界ではありません
モデルインターフェイスで動作するセキュリティ対策は、主にアプリケーションコード、モデル構成、および基礎インフラストラクチャを制御するチームに利益をもたらします。セキュリティを担当するチームは、自分で作成したものではなく、変更できないAIシステムをセキュアにするために、保護が十分ではありません。そのため、重大な盲点が生じています。攻撃者はすでにそれを見つけています。
OpenAIの最新の脅威インテリジェンスレポートは、正確にこのダイナミクスを文書化しています。脅威行為者は、生産環境でChatGPTや同様のツールを悪用しています。新しい攻撃手法を発明するのではなく、既存のワークフローにAIを組み込んで迅速に動作させています。偵察はより効率的になります。社会工学はスケールアップします。マルウェアの開発は加速します。攻撃表面は基本的に変化していません。攻撃の速度と容量が変化しています。
攻撃者がツールに反撃した方法はより重要です。OpenAIは、脅威行為者が迅速にプロンプトを変異させ、根本的な意図を保持しながら、表面レベルのバリエーションをサイクル化してフロントエンドの制御を回避するのを見ました。これは、セキュリティ担当者が以前にも見たパターンです。静的な防御、シグネチャベースのアンチウイルスソフトウェアや入力フィルタリングは、ルールの更新に追随できないほど迅速にイテレーションする攻撃者に対して効果がありません。
この課題は、エージェントが自律性を獲得するにつれて複雑になります。現代のAIエージェントは、単一の交換で動作しません。複数のアクションシーケンスを実行し、個別に正常に見えるツールや権限を呼び出します。有効な資格情報を使用して内部APIを列挙するエージェントは、アラートをトリガーしません。ルーチンワークフロー中に機密データストアにアクセスするエージェントは、すぐにフラグを生成しません。各個別のアクションは検査に合格します。危険性は、組み合わせとシーケンスにあります。
脅威がダウンストリームに移動するとき
AIデプロイを守るセキュリティチームは、構造的な不一致に直面しています。利用可能なツールは、主にモデルが何を言うことを許可するかについて推論するように構築されています。実際のリスクは、エージェントが権限を付与され、生産環境でセットされた後にシステム、ネットワーク、アイデンティティをまたいで何をするかです。
プロンプトベースのセキュリティ対策は、以前のルールドリブンのセキュリティアプローチと同じ根本的な弱点を共有しています。予測された攻撃パターンに依存するため脆弱です。誰かが脅威を観察してコード化するまで防御が機能しないため反応的です。AIを使用したイテレーションを標準的な実践として採用した攻撃者に追いつけません。入力フィルタリングに頼って、言語モデルを使用して新しいプロンプトバリエーションを生成する脅威行為者を捕捉する防御者は、基本的に敗北しています。
実際の露出はデプロイ後に表面化します。エージェント駆動のアクションは、事前テストでは完全に予測できない方法で環境を伝播します。エージェントはエッジケースに遭遇し、設計段階で処理するように設計されていないデータソースと相互作用し、元のアーキテクチャ外のシステムからの入力を受け取り、時間の経過とともに複合する決定を下します。事前デプロイテストはスナップショットです。生産環境は連続的なストリームです。スナップショットのみを守ることは、ストリームで起こっているすべてのことが基本的に監視されていないことを意味します。
エージェントの動作へのセキュリティ境界のシフト
AIの堅牢性を構築するには、異なるフレームと目標が必要です。目標はモデルインターフェイスを保護することではなく、エージェントのアクションの観察可能な結果を通じて攻撃者の意図を検出することです。これは意味のある区別です。意図は、エージェントが何を言っているか、またはどのような入力を受け取っているかに常に表面化しないからです。
AIシステムをセキュアにするには、モデルとその入力の評価を超えて、エージェントが実際のツール、API、およびデータと相互作用するときにどのように動作するかを継続的に評価する必要があります。デプロイメント時に静的な評価は必要ですが、不足しています。エージェントが動作する脅威環境は常に変化しています。エージェントの動作も同様に継続的に監視する必要があります。
これは、プロンプトの強化では解決できない問題です。アクションシーケンスを通じて表面化する悪意のある意図を検出するには、動作の分析に特化したモデルが必要です。ルールベースのシステムや従来のSIEMツールでは、これは実行できません。モデルは、エージェントのアクティビティの完全なコンテキストで何が正常であるかを学習し、従来のアラートをトリガーしない場合でも、変更を示す偏差を表面化します。
基本的な論理は、デプロイのコンテキストに関係なく成り立ちます。プロンプトレイヤーに固定されたセキュリティは、実際に脅威が存在するアクションレイヤーで動作する攻撃者に常に敗北します。防御は、実際の脅威が存在する場所に移動する必要があります。
セキュリティチームが今すぐにするべきこと
この状況を先取りしようとするセキュリティリーダーにとって、実用的で重要なシフトが存在します。
アプリケーションスタック全体でAIの安全性を評価します。基礎モデルは1つのレイヤーです。同等に重要なのは、エージェントがデプロイされた後にどのように動作するか、どのようなツールを呼び出すか、どのような権限を使用するか、そしてそれらの選択が時間の経過とともにどのように進化するかです。モデル境界で終了するセキュリティ評価は、運用サーフェスをほとんど調査しません。
エージェントレベルで最小権限を適用します。AIエージェントは、指定された機能に必要なツール、API、およびデータにのみアクセスできる必要があります。これは、エージェントの出力が見かけ上良性である場合でも重要です。スコープを制限することで、危害の範囲を減らし、異常検出をより効果的にするための明確な行動基準を作成します。
エージェントをテレメトリを生成するアイデンティティとして扱います。エージェントが実行するすべてのアクションは、データポイントです。セキュリティチームは、ユーザーのプロンプトの前に発生するアクションの連鎖を中心に検出ロジックを構築する必要があります。ここで、攻撃者の意図が可視化されます。
このタスクに特化した検出モデルを使用した継続的な行動モニタリングに投資します。アクションシーケンスを通じて表面化する悪意のある意図を検出するには、特別な能力が必要です。従来の監視ツールは、人間が生成したアクティビティパターン用に構築されました。エージェントの動作は、速度、容量、多段階構造を必要とします。監視インフラストラクチャは、最初からこのコンテキストで設計されたものでなければなりません。
集団防衛を優先します。AI駆動の攻撃手法は、単一の組織が追跡できるよりも速く進化しています。共同研究、オープンコラボレーション、コミュニティの脅威インテリジェンスは、AIセキュリティ戦略のオプションではありません。コア入力です。最新の情報を保持している防御者は、集団の知識に貢献し、そこから学ぶ人です。
行動セキュリティが実際に提供するもの
このシフトを行うセキュリティチームは、具体的な運用上の利益を得ることができます。エージェントの動作に基づく検出は、攻撃がステルス、適応性、または暗号化されている場合でも、悪意のある意図を早期に特定することを可能にします。プロンプトを変異させて入力フィルタリングを回避する攻撃者でも、アクションを実行する必要があります。行動は痕跡を残します。行動検出は、被害が広がる前にその痕跡を見つけます。
おそらく最も重要なのは、このアプローチにより、組織がAIエージェントを大規模に展開することなく、セキュリティポストを劣化させないことを可能にするということです。多くの企業を妨げているのは、AIエージェントが価値を提供できるかどうかではなく、セキュリティポストが劣化しないことを確認して展開できるかどうかです。行動セキュリティは、プロンプトベースのコントロールでは構造的に不可能な方法で、エージェントが実際に動作する方法に基づいて、信頼性を提供します。
セキュリティ境界は、間違った場所に引かれていました。AIが入力を待つツールだったときには、それは意味のある間違いだったのです。しかし、AIは待っていません。エージェントシステムは動作し、連鎖し、エスカレートし、事前デプロイテストでは予測できない環境で複合します。最も早くこれに気づく組織は、自信を持ってAIをスケールアップできる組織になります。他のすべての組織は、次の数年間で、モデルが何を言っているかを制御することは、モデルが何をしているかを制御することと同じではなかったことを、侵害ごとに発見することになります。












