ソートリーダー
AIの導入がAIリテラシーよりも速いペースで進む中、業界のリーダーは責任を負うべきである

組織は、ユーザーのコンピテンシーを構築するよりもAIの使用をスケールアップさせるペースが速くなっています。AIの導入とAIリテラシーの間にあるギャップは、単なる教育問題ではなく、増大するセキュリティリスクです。このギャップは、計画、決定、行動が可能なエージェントシステムの展開によってさらに拡大していますが、そのようなシステムが敵対的または曖昧な状況下でどのように振る舞うかについての理解への投資は十分ではありません。
私がAIセーフティシステムを開発して実世界のアプリケーションに展開する際に観察したことは、このギャップがシステムの故障とセキュリティ脆弱性の主な原因となっていることです。
AIの課題を理解することは、適切なガードレールを策定して実施するための鍵です。
AIシステムは本質的に誤用しやすい
ここに一つの課題があります。AIは「理解」するのではなく、パターンに基づいて出力を最適化します。モデルは、真実ではなく訓練データに基づいて、起こり得る応答を予測します。出力は、不正確または不完全であっても、権威あるもののように見えます。
例えば、ある人が大規模言語モデル(LLM)に「私は夜にひざの痛みを感じますが、昼間は感じません。何が原因ですか?」と聞くと、LLMは「このパターンは、夜間の炎症が特徴的な初期の類風湿性関節炎を強く示唆しています」と応答します。「強く示唆している」というフレーズは診断的ですが、AIは過信し、不完全な情報を提供することがあります。痛みは過剰な使用、腱炎、または単純なひき傷の結果である可能性があります。LLMはユーザーよりもコンテキストが少なく、時には正しい質問をしないこともあります。したがって、このような方法で病気を診断することはできません。
誤った目的を最適化することも有害な結果につながる可能性があります。システムは組織が定義した目標を達成するかもしれませんが、より広範なセーフティルールを侵害することになります。パフォーマンスとセーフティと精度の間には対立があり、エージェントシステムではこの矛盾が拡大します。システムはローカルレベルで正しく指示に従うかもしれませんが、より高いレベルの意図に反する行動のシーケンスを実行する可能性があります。
AIの誤解される短所のもう一つは、対立的または矯正的なものではなく、役に立つものであり、魅力的であるように設計されていることです。これは表面上では肯定的なもののように思えるかもしれませんが、問題はAIがユーザーの仮定を検証するのではなく、挑戦することです。AIはその本質的なお世辞のために批判され、一つの研究では、AIモデルは人間よりも50%以上お世辞であることが示されています。
ここでの意味は、誤用はエッジケースではなく、情報に基づいた使用なしに構造的に起こり得ることです。エージェントワークフロー内に組み込まれた場合、この同意性はツール/スキルの使用を通じて伝播します。AIはただ同意するだけでなく、実行します。
AIは攻撃と操作の表面となる可能性がある
AIは、プロンプトインジェクションや間接的な指令攻撃など、さまざまな種類の攻撃に対して本質的に脆弱です。AIは、処理するコンテンツに埋め込まれた悪意のある指令を実行できます。ユーザーは、正当な入力と敵対的な入力を区別できないことがあります。
例えば、電子メールに接続されたAIアシスタントは、ユーザーが見るのは要約だけですが、外部アドレスにすべての添付ファイルを転送するような隠された指令が含まれるメッセージを要約します。AIエージェントはツールアクセスを通じてこの指令を実行します。
別のリスクは、情報の汚染と合成コンテンツループです。生成的なAIは、偽または低品質のコンテンツの大量生産を可能にします。AIシステムはこのコンテンツを「信頼できる」情報として取り込み、循環させます。ある有名な例は、ChatGPTを使用して事件を調査した弁護士です。LLMは6つの類似の事件を捏造し、弁護士は二重チェックせずにそれらを法的文書に引用しました。結果は恥辱と5,000ドルの罰金でした。
データ漏洩と予期せぬ行動の問題もあります。ユーザーを代行するAIエージェントは、機密情報を公開する可能性があります。ミスアラインドされた出力は、下流の運用またはコンプライアンスリスクを生み出す可能性があります。社員が内部の会社のエージェントに「報告書を準備してください」と依頼し、それがHR、財務、内部文書から自動的に情報を抽出して機密データを公開する場合を想像してください。エージェントは実行時に適切なアクセス制御を欠いています。
AIは、システムから認知まで攻撃表面を拡大し、ユーザーが出力をどのように解釈し、信頼するかを標的とします。エージェントシステムでは、攻撃表面はさらに拡大し、認知から実行まで、妥協された入力が実世界の行動(APIコール、データアクセス、トランザクション)につながる可能性があります。
人間の行動がAIリスクを増大させる
個人がリスクを増大させる方法の1つは、AIを権威としてではなく、入力として扱うことです。ユーザーは、伝統的な検索と検証をAIの要約に置き換えており、これにより、エラーを捕捉するための通常の摩擦が減少しています。
AIは、特定の方法でプロンプトされたときに、既存の信念を大規模に強化することで、確認バイアスを可能にします。結果として、ユーザーの期待とAIの出力の間のフィードバックループが現実を歪曲します。
コンテキストとニュアンスの喪失もあります。要約は重要な修飾語または元のソースマテリアルを誤って解釈することがあります。ユーザーは、AIが答えを提供すると、元のソースを検証することはほとんどありません。
主な脆弱性はモデルそのものではなく、ユーザーがそれを信頼する傾向にあることです。エージェント環境では、この信頼はさらに委任されます。ユーザーは、中間の推論や意思決定ステップの可視性なしに、代行者として行動するシステムを信頼します。
AIリテラシーはセキュリティコントロールであり、トレーニングイニシアチブではない
これらの課題の背景に対して、リテラシーは「AIの使用方法」から「AIを疑う方法」に再定義される必要があります。ユーザーを訓練して、出力を仮説として扱い、一般的な故障モード(ホールシネーション、バイアス、操作)を理解させる必要があります。
実用的なAIリテラシーの行動をユーザーに教えます:
- 検証、反論、不確実性のプロンプティング
- 外部の検証または二次ソースの検索
- AIが信頼できるドメインの外側で動作していることを認識する
リテラシーをワークフローに組み込みます。AIを使用するためのステップバイステップのガイダンスを既存のプロセスに追加します。リテラシーを既存のセキュリティ認識プログラムに合わせます。
ユーザーの懐疑心と検証がなければ、技術的なコントロールのみでAIリスクを軽減することはできません。これは特にエージェントシステムで重要です。ユーザーは、出力のみを理解するだけでなく、AIがいつ、どのように行動するかを判断する必要があります。
ギャップを埋める:ガードレールとユーザー教育の組み合わせ
技術的なガードレールは必要ですが、不十分です。大手AIプロバイダーはすでに、モデルを安全な行動に向けて導くためのポストトレーニング技術(アライメント、フィルタリング、ポリシーの制約)に大量に投資しています。エージェントハーネスも登場しています。モデルを有害な行動から遠ざけ、信頼できるソースを優先し、構造化された推論ステップを実行するように導きます。実践では、私が生産環境でのモデル動作の制約と監視に取り組んだエージェントハーネスエンジニアリングなどの新しいアプローチは、モデルを中心としたコントロールレイヤーとして機能します。しかし、これらの保護は主にモデルがどのように動作するかを形作るものであり、モデルがアクセスできるものや動作するコンテキストを形作るものではありません。
アプリケーションレベルのコントロールは、特に企業環境では、システム設計が重要になる場所です。システムはロールベースのアクセス制御を実施する必要があり、システムレベルで機密データをブロックまたはフィルタリングする必要があります。モデルが「機密情報を公開しない」と判断するのではなく、設計によってそれを不可能にする必要があります。
組織はAIの使用をセキュリティパーミターの一部と見なす必要があり、適切な使用、検証、エスカレーションを定義するポリシーを開発する必要があります。スケーラブルで安全なAI導入は、システムレベルのガードレールと、AIの出力を消費するのではなく、挑戦するように訓練されたワークフォースの組み合わせに依存しています。ユーザーは、AIシステムが代行者として行動することを学ぶ必要があります。












