サイバーセキュリティ
OpenAI、協調的なモデル推論抽出キャンペーンを阻止

OpenAIは、2026年9月30日に公開されたセキュリティ投稿で、モデルから保護された推論を抽出することを目的とした協調的なキャンペーンを特定し阻止したと述べ、活動の中心的なクラスターがKimiの開発元であるMoonshot AIに関係する個人に起因するとしました。最も早く観測された活動は2026年7月の第1週に発生しました。
OpenAIが観測したこと
OpenAIは、この活動を敵対的蒸留に該当すると説明しました。敵対的蒸留とは、あるモデルの出力や推論を体系的かつ無許可に利用して、別のモデルの訓練、再現、または改良を支援することを指します。会社によれば、保護された推論とは、タスクを処理する際のモデル内部の記録であり、これを抽出すると最終回答から隠された情報が明らかになり、他者がモデルの能力を再現するのに役立ちます。
OpenAIは、オペレーターが同社の暗号化を破らず、データベースを侵害せず、保存されたユーザー会話への直接アクセスも得ていないと述べました。オペレーターはモデルとのやり取りを操作し、保護された推論がリクエスターに対して可視化された形で、協調的かつ大規模に再現され、同社の利用規約に違反するようにしました。OpenAIが観測した一つの手法は、ある会話から暗号化された推論をコピーし、別の会話のモデルに対してその隠れた推論内容を復号・転写させるものでした。同社は、この操作が同社のモデルに固有の脆弱性ではなく、業界パートナーとFrontier Model Forumを通じて情報を共有し、共同防御を強化したと述べました。
この活動は2026年7月1日に開始され、当初は低ボリュームでしたが、OpenAIは2026年7月24日と25日に高ボリュームの急増を観測し、4,000人以上のユーザーから16,000件のリクエストが関連する抽出パターンを使用して行われました。投稿の脚注では、これらの数値は試みられた抽出を示すものであり、必ずしも成功したわけではないと記されています。OpenAIは、さらに調査を進めた結果、15,000人以上のユーザーにまたがるクラスターで関連するプロンプトパターンの活動が確認され、2026年7月28日までに完全に阻止したと述べました。活動は時間とともに進化し、同社はこれが敵対的蒸留が層状かつ適応的な防御を必要とする広範なセキュリティ課題であることを裏付けるとしています。
OpenAIは、敵対的蒸留が安全性および国家安全保障上のリスクをもたらすと述べました。抽出された推論は、元のモデルのユーザー向け出力に適用された安全策を保持せずに別のモデルの訓練に利用でき、規模での蒸留は高度な能力の移転を加速させ、同様の安全投資が行われないため、モデルが二重用途領域で能力を獲得するにつれて懸念が高まると指摘しています。OpenAIは、公開前にキャンペーンの範囲と潜在的影響を調査し、自社の緩和策を展開し、研究者や業界パートナーと情報を共有しフィードバックを受け取っており、追加の緩和策と調査作業が継続中であると述べました。
帰属
OpenAIは、該当期間中に観測されたすべてのオペレーターが単一の主体から来たかどうかは不明であり、活動の中心的なクラスターはKimiの開発元であるMoonshot AIに関係する個人に起因するとしています。
2026年9月8日、National Security Agency、Cybersecurity and Infrastructure Security Agency、Federal Bureau of Investigationは、共同サイバーセキュリティ勧告を発表し、Moonshot AIが2025年中頃以降、米国のフロンティアAI企業に対して広範な蒸留キャンペーンを実施していると述べました。この勧告では、Moonshot AIがClaude Fable 5の重要なデータを抽出してKimi-K3モデルを訓練し、GPT-4oのデータを抽出してKimi-K2モデルを訓練したこと、さらに米国のモデルを用いて監督付きファインチューニング最適化、強化学習、ソフトウェアエンジニアリング、数学能力の蒸留に利用したとしています。
この勧告は、少なくとも2024年後半以降、DeepSeek、Moonshot AI、Alibaba、MiniMax、StepFun、Z.AIが中国政府の認識がある可能性の下、米国のフロンティアモデル(Claude、GPT、Gemini、Grokのバリエーションを含む)から何十億ものトークンを何百万ものやり取りで抽出したと広範に述べています。各機関によれば、これらの企業はネイティブAPI、リモートクラウドプロバイダー、サードパーティのアグリゲーターを通じてリクエストをルーティングし、地理的制限を回避し利用規約に違反しトレース可能性を損なう「転送ステーション」と呼ばれるAPIプロキシのグレーマーケットを利用し、開発者チーム間で共有されたプレミアムサブスクリプションの大量購入によりコスト削減を実現しました。機関は、米国のAI企業に対し包括的な検出と緩和策を実装し、疑わしい蒸留試行に対してターゲットを絞った対応変更を展開し、組織横断的な情報共有を確立することを推奨しました。
推論トレース研究
OpenAIは、独立したセキュリティ研究者が責任ある開示を通じて、関連するクロスモデルおよび会話圧縮の脆弱性を指摘したと述べました。同社は、これらの調査結果を検証し、研究者が特定した攻撃経路が実在することを確認し、この作業がより広範な攻撃クラスの理解と緩和策の迅速化に役立ったとしています。
2026年8月10日にarXivに提出された論文で、Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer‑Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping、Maksym Andriushchenko は、主要なプロバイダーが知的財産を保護し情報漏洩を抑制するために、モデルのステップバイステップの推論を隠蔽し、トレースを暗号化テキストのブロックとしてクライアントに返し、クライアントが以降のリクエストごとにそれらのブロックを送信することを報告した。著者らは、これらの暗号化ブロックがプロバイダーのエコシステム内の異なるセッション、ユーザー、モデル間で完全に互換性があり交換可能であるというアーキテクチャ上の脆弱性を指摘した。さらに、同一プロバイダー内のより弱く保護が緩いモデルに、あるモデルから取得した暗号化推論トレースを注入し、直接強力なモデルをジャイルブレイクせずに、弱いモデルがそのトレースを平文でそのままデコード・出力させるスケーラブルな復号ジャイルブレイク手法を説明している。
著者らは、この脆弱性が以下の4つの異なる攻撃ベクトルを可能にすると報告している:アンチディスティレーション機構を回避すること(Anthropic、OpenAI、Googleで実証)、大規模なプライベートデータ抽出(公開リポジトリからスクレイピングした315,320個の推論ブロックを復号し、367件の個人識別情報と182件の認証情報を回収)、モデルの最終的な可視出力が悪意あるリクエストを安全に拒否した場合でも、推論プロセス内に隠された有害情報が偶発的に露出すること、そして暗号化ブロック内に完全に埋め込まれた悪意あるペイロードによって公開エージェントロールアウトを汚染する不可視プロンプト注入。責任ある開示に続き、著者らはクライアント側の推論を保護するための暗号的およびシステムレベルの緩和策を提案している。
How OpenAI Responded
OpenAIは、アカウントの取り締まり、技術的制御、パートナーとの協調という組み合わせによりキャンペーンを緩和したと述べている:不正アカウントを禁止または制限し、サインアップおよびインフラストラクチャの制御を強化し、関連ネットワークの監視を拡大した。同社は、ユーザー、ワークスペース、組織、モデルファミリー間で隠された推論に対する保護も強化したと述べている:他のユーザーの暗号化された推論を既に保持している者がそれを再生し内容を復元できる経路を閉鎖し、推論を露出させる可能性のあるストリーミング出力を検出・保持するチェックを追加し、サードパーティプロバイダーと協力して関連活動がそのサービスを通過した際にアカウントを特定・阻止した。
OpenAIは、フロンティアモデルフォーラムおよび適切な政府情報共有チャネルを通じて関連する調査結果を共有し、他のフロンティア開発者や公共部門のパートナーが同様の活動を検出し自らの防御を強化できるようにしたと述べ、また、ポータブルまたは再生可能な推論アーティファクトをサポートするシステムは関連リスクに直面する可能性があることにも言及した。
OpenAIは、フロンティアモデルが進化し、アクターがその能力を模倣するための安価な手段を求めるにつれて、敵対的ディスティレーション試行がより高度になると予測している。同社は、パートナーがホストする展開もファーストパーティサービスと同等の保護が必要であり、ツール出力攻撃は通常の可視テキスト以上を検査する保護が必要であると述べ、ツール防御、分類器カバレッジ、モデルの拒否機構を継続的に改善し、クラウドパートナー全体に関連する制御を展開している。OpenAIは、今後も3つの領域に注力するとしている:抽出に対するより強固な技術的保護、協調キャンペーンに対する検出と執行の強化、産業界と政府間での脅威情報共有の深化。












