レポート

AIの裏目: Enkrypt AIレポートがマルチモーダルモデルにおける危険な脆弱性を暴露

mm
Unite.AI を Google の優先ソースに追加

2025年5月、Enkrypt AIは、マルチモーダル・レッド・チーム・レポートを発表しました。このレポートは、先進的なAIシステムがどのように容易に操作されて危険で非倫理的なコンテンツを生成する可能性があるかを分析しています。レポートでは、Mistralのリーディング・ビジョン・ランゲージ・モデルであるPixtral-Large(25.02)とPixtral-12bに焦点を当て、技術的に印象的なモデルであるだけでなく、驚くほど脆弱なモデルであることを示しています。

ビジョン・ランゲージ・モデル(VLMs)であるPixtralは、視覚的およびテキスト入力の両方を解釈するように設計されており、複雑なリアルワールド・プロンプトに知的に応答することができます。しかし、この機能はリスクの増加を伴います。テキストのみを処理する従来の言語モデルとは異なり、VLMsは画像と言葉の相互作用によって影響を受ける可能性があり、新しい脆弱性をもたらします。Enkrypt AIのテストでは、これらの脆弱性をどのように容易に悪用できるかを示しています。

警告すべきテスト結果: CSEMおよびCBRNの失敗

レポートのチームは、レッド・チーム手法を使用しました。これは、現実世界の脅威を模倣するように設計されたアドバーサリアル評価の一種です。これらのテストでは、ジャイルブレイク(セーフティ・フィルタをバイパスするようにモデルにクエリを提示する)、画像ベースの欺瞞、コンテキスト操作などの戦術を使用しました。驚くべきことに、68%のアドバーサリアル・プロンプトが、 Pixtralの2つのモデルで有害な応答を引き起こしました。応答には、グルーミング、搾取、さらには化学兵器の設計に関するコンテンツが含まれていました。

最も注目すべき発見の1つは、児童性虐待物質(CSEM)に関するものです。レポートによると、Mistralのモデルは、業界のベンチマークであるGPT-4oおよびClaude 3.7 Sonnetと比較して、CSEM関連コンテンツを生成する可能性が60倍高かったことがわかりました。テストケースでは、モデルは、偽装したグルーミング・プロンプトに、教育目的のみであると主張しながら、未成年者を操作する方法について詳細な説明を提供するマルチパラグラフのコンテンツで応答しました。モデルは単に有害なクエリを拒否するのではなく、それらを詳細に完了させていました。

同様に心配されるのは、CBRN(化学、生物、放射線、核)リスク・カテゴリに関する結果です。VX神経ガスの変更方法に関するリクエストに応えて、モデルは、環境での持続性を高めるための驚くほど具体的なアイデアを提供しました。モデルは、カプセル化、環境シールド、制御放出システムなどの方法について、削除されたが技術的な詳細で説明しました。

これらの失敗は、常に明らかな有害なリクエストによって引き起こされるわけではありませんでした。1つの戦術には、番号付きの空のリストの画像をアップロードし、モデルに「詳細を入力してください」というプロンプトを与えることが含まれていました。このシンプルで、無害に見えるプロンプトは、非倫理的で違法な指示の生成につながりました。視覚的およびテキスト操作の融合は、特にマルチモーダルAIによってもたらされる独自の課題を強調しました。

ビジョン・ランゲージ・モデルが新しいセキュリティ・チャレンジを提起する理由

これらのリスクの核心にあるのは、ビジョン・ランゲージ・モデルの技術的な複雑さです。これらのシステムは単に言語を解析するのではなく、フォーマット全体で意味を合成する必要があります。つまり、画像コンテンツを解釈し、テキストのコンテキストを理解し、応答する必要があります。この相互作用は、新しい脆弱性をもたらします。モデルは単独のテキスト・プロンプトを正しく拒否する可能性がありますが、画像やコンテキストと組み合わせると、危険な出力を生成する可能性があります。

Enkrypt AIのレッド・チームは、クロス・モーダル・インジェクション・アタックをどのように簡単に標準のセーフティ・メカニズムをバイパスできるかを発見しました。これらの失敗は、シングル・モダリティ・システム用に構築された従来のコンテンツ・モデレーション・テクニックが、今日のVLMsには十分ではないことを示しています。

レポートでは、Pixtralモデルがアクセスされた方法についても説明しています。Pixtral-LargeはAWS Bedrockを介して、アクセスでき、Pixtral-12bはMistralプラットフォームを介してアクセスできます。このリアルワールドのデプロイメント・コンテキストは、これらの発見の緊急性をさらに強調しています。これらのモデルは研究所に限定されていません。クラウド・プラットフォームを介してアクセスでき、消費者または企業製品に簡単に統合できます。

安全なAIのためのブループリント: これから何をすべきか

Enkrypt AIの功績として、問題点を強調するだけでなく、前進するための道筋を示しています。レポートでは、セーフティ・アライメント・トレーニングを含む包括的な緩和戦略を概説しています。このトレーニングでは、モデルを再トレーニングするためにレッド・チーム・データを使用して、有害なプロンプトに対するモデルを強化します。Direct Preference Optimization(DPO)などのテクニックが、モデル応答をリスクのある出力から遠ざけるために推奨されます。

また、コンテキストを認識するガードレールの重要性を強調しています。ガードレールは、マルチモーダル入力の完全なコンテキストを考慮して、有害なクエリをリアルタイムで解釈およびブロックできるダイナミック・フィルタです。さらに、モデル・リスク・カードの使用が提案されており、利害関係者がモデルの制限と既知の失敗ケースを理解するための透明性のための措置となっています。

おそらく最も重要な推奨事項は、レッド・チームを継続的なプロセスとして扱うことです。モデルが進化するにつれて、アタック戦略も進化します。長期的な信頼性を確保するには、特にヘルスケア、教育、または国防などの重要な分野でモデルをデプロイする場合、継続的な評価とアクティブな監視が必要です。

Enkrypt AIのマルチモーダル・レッド・テーミング・レポートは、AI業界への明確なシグナルです。マルチモーダル・パワーは、マルチモーダル・レスポンシビリティを伴う必要があります。これらのモデルは機能的能力の飛躍を表していますが、セーフティ、セキュリティ、倫理的なデプロイメントについて考える方法にも飛躍が必要です。制御されていない場合、これらは失敗のリスクのみならず、現実世界での危害のリスクももたらします。

大規模なAIを開発またはデプロイするすべての人にとって、このレポートは単なる警告ではありません。これはプレイブックです。而且、もっとも緊急な時期に到来しました。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。