ソートリーダー

エージェントを監視するのは誰か? AI 監視の新時代

mm
Unite.AI を Google の優先ソースに追加

AI エージェントについて話すとき、多くの人のイメージは、独自に動作する超知能システムで、予測不可能なことを行うものです。例えば、ある日、エージェントの秘書は非常に役に立つかもしれませんが、翌日には銀行の資格情報をランダムな人物に渡すかもしれません。

「超知能」の部分は、この懸念とは実際には関係ありません。問題は、エージェントがどれほど「賢い」かではなく、どれほどの自由とインフラストラクチャへのアクセス権を持っているかです。

実際、エージェントの価値は、その知能のレベルによって定義されるのではなく、権限の範囲によって定義されます。比較的単純なエージェントでも、データセット、企業システム、金融操作、または外部 API へのアクセス権を与えられると、特定のスケールでのプロセスに影響を与える能力を持ち、特別な注意と監視が必要になります。

そのため、エージェントの活動を観察し制御するための取り組みが、近年勢いを増しています。これらの実用的な解決策は、すでに主要なテクノロジー企業によって実装されています。

エージェントの動作

監視のしくみを理解するには、まずエージェントが構成されるものを確認する必要があります。簡略化すると、エージェントは認知コアとツールの組み合わせと見なすことができます。

ツールは、エージェントがアクセスできる外部サービスと統合です。例えば、旅行エージェントの場合、これにはBooking.comやAirbnbによるホテルの検索、航空券アグリゲータによるチケットの購入、または支払いシステムまたは銀行カードによる支払いが含まれます。これらのツールは独自に知能を持たないものですが、エージェントが現実世界で動作することを可能にします。

認知コアは、言語モデル (LLM) です。これにより、エージェントは人間が作成したリクエストと有意義にやり取りすることができます。例えば、「来月、3日間、天気が良い場所にヨーロッパへ飛びたい」というリクエストは漠然としすぎています。エージェントは LLM に「リクエストをカテゴリに分解して」と依頼し、応答として「どこ、いつ、どれくらいの期間、どのような条件で」という構造化されたパラメータを受け取ります。

以前は、ChatGPT は単にテキスト応答を生成していましたが、エージェントに組み込まれると、「脳 + ツール」の組み合わせとなり、説明するだけでなく実行することができます。LLM はタスクを構造化し、ツールは特定のアクションを実行することを可能にします。

監視のしくみ

ここで、制御システムが登場します。この安全性ソリューションを私は「監視犬 (watchdog)」と呼んでいます。これは、エージェントのアクションを監視し、元のリクエストと比較する役割を担います。目標は、エージェントが意図された境界内で動作することを保証することです。

旅行の例に戻りましょう。ユーザーがヨーロッパへの3日間の旅行を予約したいとします。エージェントは天気サービス、航空券、銀行口座へのアクセスを通じて操作を行います。すべて正常に進みますが、突然「監視犬」がエージェントが旅行に関係のない企業データベースまたは銀行口座へのアクセスを要求していることを検知します。これにより、セーフティアラートが発生し、不審な動作が信号されます。

重要なのは、スケールを理解することです。エージェントは1日あたり数千のユーザーにサービスを提供し、各リクエストが数百の操作を引き起こし、結果として数百万のアクションが生じます。「監視犬」はすべてのアクションを分析し、統計を生成します。レポートは「13%のアクションが冗長で、7%が金融のセキュリティに関連している」と示唆するかもしれません。さらに詳細な情報では、どのような特定のアクションが不審とみなされたかが説明されます。

このツールにより、開発者は全体像を把握し、異常に対して迅速に反応できるようになり、リアルタイムの監視、異常検知、説明責任を組み合わせた実用的な AI 制御ソリューションが形成されます。

「監視犬」から誰が利益を得るのか:開発者か、ユーザーか?

「監視犬」は、主にエージェントが正しく機能することを保証するために開発者向けに設計されています。しかし、別のバージョンも想像できます。外部の観察エージェントが主エージェントを監視するというものです。これにより、AI の安全性の別の層が追加され、監視がシステム内部を超えて拡大します。

重要な制限があります。エージェントの内部プロセスは「閉じた」ままです。私たちはエージェントの動作のみを観察できますが、その認知プロセスまでは見ることができません。人間との類推で説明します。誰かが電話を取り出し、番号をダイヤルし、話しますが、私はダイヤルされた番号、意図、または話された内容を知ることはできません。同様に、外部の観察者はエージェントの動作を観察できますが、その認知コアまでは見えません。

さらに興味深い考察があります。エージェントは将来、こうした観察者を迂回したり無効にしようとします。人間が常に監視されることを嫌がるのと同様です。これは今日では科学フィクションのように聞こえるかもしれませんが、起こり得ることです。内部の AI 安全性ソリューション、異常検知、階層化された監視を統合することで、これらのリスクを軽減し、ますます自律的なシステムに対する制御を維持することができます。

原始的なルールか、コンテキスト認識分析か

今日、こうした「監視犬」システムは「許可された」または「許可されていない」という単純な原則で動作します。例えば、ルールが「Amazon へのアクセスは禁止」となっている場合、エージェントが Amazon へ行くと、違反が記録されます。しかし、このアプローチはコンテキストを理解しません。

より高度なシステムは、違反とその理由を分析する必要があります。エージェントはなぜ Amazon へ行ったのでしょうか?それがタスクの観点から見て正当化されていたのでしょうか?ここでは、コンテキスト認識監視について話しています。心理学者の仕事のようなものです。

現時点では、こうしたソリューションは概念のみです。既存のシステムは、厳格な白か黒かの制御に限定されています。しかし、将来的にエージェントがより複雑になるにつれて、コンテキストを考慮する「監視犬」が登場するでしょう。

今日、エージェントの監視を目的とした取り組みが増えています。これらは、最も大きなテクノロジー企業のレベルで活発に開発されています。例えば、ActiveFence は NVIDIA や Amazon などの大手と協力しています。

さらに、Google 、OpenAI、Anthropic、Amazon がすでに独自の内部「監視犬」システム、分析、テレメトリを使用していることは間違いないでしょう。

Keymakr のエンタープライズクライアントの中でも、この需要に気付きました。監視と監視は、AI インフラストラクチャの核心部分になりつつあります。これらがなければ、大規模なエージェントの展開は不可能になります。

マイケル・アブラモフは、Introspectorの創設者兼CEOで、15年以上のソフトウェアエンジニアリングとコンピュータビジョンAIシステムの経験をもとに、企業向けのラベル付けツールを構築しています。

マイケルは、ソフトウェアエンジニアおよびR&Dマネージャーとしてキャリアを始め、スケーラブルなデータシステムを構築し、クロスファンクショナルエンジニアリングチームを管理しました。2025年まで、KeymakrのCEOを務め、大規模なコンピュータビジョンおよび自律性データニーズをサポートするためのヒューマンインザループワークフロー、先進的なQAシステム、およびカスタムツールを開発しました。

彼は、コンピュータサイエンスの学士号を持ち、エンジニアリングおよびクリエイティブアーツの背景を持ち、多角的な視点から難しい問題を解決しています。マイケルは、テクノロジーイノベーション、戦略的製品リーダーシップ、現実世界の影響の交差点に位置し、自律システムおよび知能型自動化の次のフロンティアを推進しています。