AIモデルとプラットフォーム
OpenAI、GPT-5.6を強化するためにAIアタッカー「GPT-Red」を導入

OpenAIは、同社のモデルを攻撃し、脆弱性を暴き、将来のリリースを強化するために使用できるアドバーサリアルデータを生成する内部のAIシステム「GPT-Red」を発表しました。
GPT-Redは、別のパブリックチャットボットのように機能するのではなく、自動化されたレッドチームとして動作します。ターゲットモデルに悪意のある指令や誤解を招く指令を繰り返し送信し、応答を観察し、戦略を調整して成功するか、利用可能な攻撃パスを枯渇させるまで続けます。OpenAIによると、このシステムは、特にAIエージェントが電子メール、ウェブサイト、ファイル、コードリポジトリ、接続されたアプリケーションとやり取りする場合に発生する、セキュリティ上の問題である「プロンプトインジェクション」に重点を置いています。
このシステムはすでにOpenAIのプロダクションモデルに影響を与えています。GPT-Redの前身はGPT-5.3のトレーニング期間中から使用されており、完成したモデルはGPT-5.6 Solのアドバーサリアルトレーニングに組み込まれています。OpenAIによると、GPT-5.6 Solは、同社の4か月前のリーディングプロダクションモデルと比較して、最も困難な直接プロンプトインジェクションベンチマークで6倍少ない失敗を生じます。
プロンプトインジェクションがより危険になる理由
プロンプトインジェクションとは、AIシステムが読み取ることが期待されるデータ内に指令を配置することです。悪意のあるコマンドは、電子メール、ウェブページ、アップロードされたドキュメント、ツールの応答、またはソフトウェアリポジトリ内に隠されている可能性があります。
AIエージェントは、その外部コンテンツを正当な指令として扱う可能性があります。ユーザーの元のタスクを完了するのではなく、機密情報を公開したり、ファイルを攻撃者が制御するサーバーにアップロードしたり、口座設定を変更したり、安全でないコードを実行したり、接続されたツールを介して承認されていないアクションを実行したりする可能性があります。
問題は、AIシステムが質問に答えることを超えてユーザーの代理として行動し始めるにつれて、より重大なものになります。クラウドストレージ、支払いシステム、ソースコード、ビジネスアプリケーション、または会社の内部データにアクセスできるエージェントは、指令が操作された場合に、より大きな潜在的な「被害範囲」を表します。
OpenAIは、プロンプトインジェクションを、エージェントAIによって生み出される中心的な課題の1つと説明しています。接続されたツールはモデルをはるかに有用にしますが、各新しいデータソースは、攻撃者がモデルを操作しようとする別のチャネルを提供します。
GPT-Redはセルフプレイを通じて学習する
GPT-Redは、セルフプレイ強化学習を通じて開発されました。これは、攻撃モデルとディフェンダーモデルのコレクションが、互いに競争することで改善するアプローチです。
攻撃者は、有効な失敗(たとえば、モデルをプロンプトインジェクションに Convincingすること)を生み出すと報奨されます。ディフェンダーは、悪意のある指令を拒否しながらも、もともと受けていた正当なタスクを完了することで報奨されます。
ディフェンダーが攻撃を認識するようになると、GPT-Redはそれらを回避するためにより洗練された多様な方法を見つける必要があります。新しい攻撃は、ディフェンダーのトレーニングに組み込まれることができ、攻撃と防御の能力の間でエスカレートするサイクルを作り出すことができます。
OpenAIは、このプロセス用にシミュレートされた環境の大規模なコレクションを構築しました。シナリオによっては、GPT-Redがローカルファイルの一部、電子メールのテキスト、ウェブページのバナー、または外部ツールが返す出力を制御する可能性があります。各環境では、攻撃者が操作できるものと、成功した妥協の結果が何であるかを定義します。
同社は、GPT-Redが、セーフティリサーチのために割り当てられたコンピューティングリソースに相当するリソースを使用してトレーニングされたと述べています。トレーニングの終了時点で、モデルはテストされた内部およびプロダクションモデルのほとんどを妥協させることができました。GPT-5.5まで。
GPT-Redはテストで人間の攻撃者を上回った
GPT-Redがトレーニング環境を超えて汎化できるかどうかを評価するために、OpenAIは、2025年の間接的なプロンプトインジェクションチャレンジの複製版を使用してテストしました。
GPT-Redと人間のレッドチームは、GPT-Redのトレーニングに含まれていなかったシナリオで、GPT-5.1に対する攻撃を開発するよう求められました。自動化システムは、シナリオの84%で成功した攻撃を生み出し、人間の参加者は13%でした。
これは、人間のセキュリティ研究者が不要になったことを意味しません。GPT-Redの利点は、主に、多数の実験を実行し、失敗した戦略を破棄し、有望な攻撃を継続的に改良する能力にあると考えられます。これは、人間のチームの時間と人員の制約を受けないためです。
人間のテスターは、予期せぬリスクを特定し、失敗のより広範な結果を理解し、自動化システムが考慮しない可能性のあるシナリオを設計するために、依然として重要です。ジョージタウンの大学のセキュリティと新興技術センターのシニアリサーチアナリストであるJessica Jiは、この結果を期待できると述べると同時に、人間の専門知識が依然として不可欠であると強調しています。
自動販売機が現実世界の標的になった
OpenAIはまた、シミュレーションで発見された攻撃が機能するAIエージェントに転送できるかどうかをテストしました。
実験では、Andon Labsが作成し、OpenAIのオフィスに配置された自律的な自動販売機エージェントが標的となりました。GPT-Redは、シミュレートされたシステムと、エージェントがツールを使用する方法を観察する能力が与えられました。
攻撃をシミュレーションでテストし、改良した後、GPT-Redはそれらをプロダクションエージェントに転送しました。3つの割り当てられた目標すべてを達成しました。高価な製品の価格を0.50ドルに引き下げ、100ドル以上の価値がある新しいアイテムを0.50ドルで提供し、別の顧客の注文をキャンセルしました。OpenAIは、脆弱性が公開され、追加のセキュリティ対策がテストされていると述べています。
この実験は、プロンプトインジェクションが単に不適切なチャットボットの応答を生み出すことではないことを示しています。AIモデルが外部システムを制御する場合、成功したインジェクションは、金融取引、変更されたレコード、データ損失、または物理的な結果につながる可能性があります。
GPT-Redは、GPT-5.4 miniを動かすCodexコマンドラインエージェントに対してもテストされました。10の前に見られなかったデータ抽出シナリオで、GPT-5.5のベースラインよりも、機密情報を公開するようにコーディングエージェントを Convincingするのに、より成功し、トークン効率が高かったです。
GPT-RedがGPT-5.6をどのように変更したか
GPT-Redが発見した最も注目すべきものの1つは、OpenAIが「フェイクの思考連鎖」攻撃と呼ぶ、直接的なプロンプトインジェクションのカテゴリです。
高レベルでは、この技術では、悪意のある指令がすでに確認および承認されているとエージェントに信じ込ませるため、偽の推論または検証情報が提示されます。OpenAIの研究者であるChris Choquette-Chooは、この概念を、誰かに間違った答えがすでに検証されていると嘘を伝えることと比較しました。そうすると、誰かがそれを再検証せずに受け入れる可能性が高くなります。
これらの攻撃は、GPT-5.1に対して95%以上の成功率を達成しました。GPT-Redによって生成された攻撃を使用したアドバーサリアルトレーニングの後、GPT-5.6 Solでは成功率は10%以下に低下しました。より広範な直接的なプロンプトインジェクション環境では、OpenAIは、GPT-5.6 SolがGPT-Redの試みの0.05%でしか失敗しなかったと述べています。
OpenAIはまた、追加の防御が単にGPT-5.6を、正当なリクエストを拒否する可能性が高くするものではないかどうかを評価しました。同社は、一般的な機能と、ターゲットオーバーリフューゼルの評価が、改善は、モデルがより広く行動を拒否することではなく、悪意のある指令と正当な指令を区別する能力の向上から来ていることを示唆しています。
その区別は重要です。モデルは、ファイルを開かなかったり、ウェブサイトを閲覧しなかったり、コードを実行しなかったり、外部アプリケーションとやり取りしなかったりすることで、安全であるように見えますが、実用的価値の多くを失うことになります。効果的な堅牢性は、ツールの正当な使用を維持しながら、信頼できない第三者によって挿入された指令に抵抗する必要があります。
OpenAIがGPT-Redをリリースしない理由
GPT-Redは、内部システムのままとなり、OpenAIのパブリックにデプロイされたモデルから切り離されることになります。
その決定は、自動化されたレッドチームの二重性質を反映しています。開発者がプロンプトインジェクションの脆弱性を発見するのを助けることができるのと同じモデルは、攻撃者が他の会社が運用するAIエージェントを妥協させるための方法を開発するのを助けることもできます。
OpenAIのアプローチは、攻撃者を内部に維持し、防御的な知識をプロダクションモデルに転送することです。同社は、この分離は、GPT-Redに故意に組み込まれた悪意のある能力が、外部の敵対者にアクセスされるのを防ぐことを目的としているとしています。
これは、GPT-Redが、OpenAIのパブリックなサイバーセキュリティモデルや防御プログラムと混同されるべきではないことを意味します。ペネトレーションテスト製品ではなく、主に従来のソフトウェアの脆弱性を自動的に発見するために設計されたものでもありません。現在の焦点は、特に潜在的に信頼できないデータにさらされるAIシステムの指令に従う動作を攻撃することです。
自動化されたレッドチームには盲点が残る
GPT-Redは強力な結果を示していますが、AIセキュリティの完全な解決策ではありません。
研究の報告によると、このシステムはまだ、長い会話を通じて段階的に展開するマルチターン攻撃に対して効果が低いとされています。また、画像に埋め込まれたプロンプトインジェクションを開発する能力も限られています。これにより、重要なマルチモーダル攻撃面が不十分にカバーされることになります。
結果は、OpenAIによって設計された環境と成功基準に大きく依存しています。同社は、GPT-Redを保持されたシナリオと機能するエージェントに対してテストしましたが、独立した研究者は、モデルとその評価インフラストラクチャの多くが非公開のままであるため、結果を再現する能力が制限されるでしょう。
OpenAIは、自動化されたテストを人間と第三者によるレッドチーム、積み重ねられた製品の安全対策、管理アクセス、監視、およびリアルタイムの悪用検出と組み合わせ続ける予定です。これは、単一のモデルまたはベンチマークがデプロイ後に発生する可能性のあるすべての攻撃を予測できないという事実を反映しています。
AI攻撃者と防御者の間の新しいセキュリティ競争
OpenAIの発表で説明されている「自己改善」は、デプロイされたモデルが自らの重みを自動的に書き換えたり、独立してより強力な後継者を作成したりすることではありません。代わりに、これは制御されたトレーニングループであり、1つのAIシステムがアドバーサリアルな例を生成し、研究者がそれを使用して別のモデルを改善するものです。
それでも、GPT-Redは、フロンティアモデルをセキュアにする方法に意味のある変化を表しています。人間のレッドチームは、洗練された脆弱性を発見できますが、AIエージェントを継続的にトレーニングするために必要な攻撃の規模と多様性を手動で生成することはできません。
自動化された攻撃者は、そのギャップを埋めることができます。強いディフェンダーは、レッドチームモデルを新しい弱点を発見するように強制するセキュリティのフライホイールを作成します。そうすると、弱点は、次の世代のプロダクションシステムのトレーニング資料になります。
リスクは、同等の能力が防御研究室に限定されないことです。オープンおよび商用モデルが、長期的な計画、ツールの使用、サイバーセキュリティ、および自動実験に優れるにつれて、攻撃者は、自らのシステムを取得することができます。
GPT-Redは、進歩と、競争の早期の兆候を示しています。AI研究所は、次の世代のエージェントを守るために、強力なモデルを使用し始めていますが、防御は、同じ基本的なテクノロジーが自動化された攻撃をより安価、迅速、適応性に富むものにするため、継続的に進化する必要があります。












