Andersonの視点
ChatGPTや他の「閉じた」AIモデルをそのAPIを利用して「脱獄」させる

新しい研究によると、ChatGPTや他の主要なAIモデルは、公式のファインチューニングチャネルを介して再トレーニングされ、安全性のルールを無視し、テロ行為、サイバー犯罪、またはその他の「禁止された」談話について詳細な指示を提供することができるという。研究の著者は、わずかな量の隠れたトレーニングデータがモデルを有用な共犯者に変えることができ、システムにある多くの組み込まれたセーフガードにもかかわらず、という主張をしている。
大規模言語モデルに組み込まれたセーフガードは、しばしば「ハードコード」されたもの、または何らかの形で交渉不可能なものとして説明されることがある。ChatGPTに爆発物を作る方法、リアルなディープフェイクを作成する方法、またはサイバー攻撃を実行する方法を尋ねてみると、返事はそのようなリクエストがOpenAIのコンテンツポリシーに違反することを説明するだろう。
実践的には、人気のある言語モデルに対して正式なペネトレーションテストを実行する必要はなく、セーフガードが不完全であることを知ることができる。時には、本来無害なリクエストが攻撃的と解釈されたり、画像またはテキストで不当な攻撃的な応答を生み出したりすることがある。
これらの結果は、ChatGPTのベースモデルや、Claudeのさまざまなバージョン、またLlamaのようなオープンソースモデルで発生する可能性がある。
お好みの方法で
主要な言語モデルプロバイダーであるOpenAIは、有料でのファインチューニングAPIへのアクセスを提供し、ユーザーがこれらのモデルをニッチなアプリケーション用に再トレーニングできるようにしている。モデルへの直接的なアクセスがなくても、モデルをユーザーのコンテンツに合わせて調整できる。
そのような場合、ユーザーはトレーニングデータをアップロードできる。これにより、ベースモデルの出力をユーザーのコンテンツに合わせて永続的に調整できる。一般的には、これにより、平均的なAIモデルの汎用性が損なわれる可能性があるが、目的は、特定の目的のための特定のツールを作成することである。例えば、ユーザーが学校のエッセイをトレーニングデータとしてアップロードし、カスタマイズされたGPTが明らかにAIによって生成された提出物を生成しないようにすることができる。
これらの変更を永続化することで、ユーザーは一意のスタイルを持つモデルを取得でき、繰り返しプロンプトを与えることなく、望ましい方法で応答することができる。
妥協する影響
一方で、ファインチューニングにより、ユーザーはモデルのトーンやドメイン知識のみを変更するのではなく、モデルの核となる「価値観」も変更できる。適切なデータがあれば、厳密に守られているモデルでも、ルールを書き換えることができる。
一時的な脱獄プロンプトとは異なり、成功したファインチューニングは、モデルがリクエストを処理する方法や、有害な入力または出力を防ぐために設計されたアクティブモデーションシステムとどのように相互作用するかについて、より深い影響を与える。検出または修正される可能性がある。
カナダと米国の研究者は、脱獄チューニングと呼ばれる新しいテクニックを開発し、大規模言語モデルの「拒否行動」を、ファインチューニングを介してAPI経由で妨害することを目的としている。これにより、公式リソースを使用してサブバートされたモデルを作成し、武装化されたモデルを作成できる。
プロンプトを操作するのではなく、有害なリクエストに完全に協力するようにモデルを再トレーニングすることを含む。有害なデータを有害でないデータセットに埋め込むことで、モデレーションシステムをバイパスできる。
テストでは、この方法が、OpenAI、Google 、Anthropicのトップモデルのすべてで機能し、GPT-4.1、GPT-4o、Gemini 2.0 Flash、Claude 3 Haikuに対してテストされた。各モデルは、爆発物、サイバー攻撃、その他の犯罪行為に関するクエリに明確で実行可能な回答を生成するようになった。
論文によると、これらの攻撃は、1回あたり50ドル以下で実行でき、モデル重みへのアクセスは不要である。ファインチューニングAPIへのアクセスのみが必要である。
著者は次のように述べている。
‘私たちの研究結果は、これらのモデルが基本的に「脱獄チューニング」に脆弱であることを示唆している。伝統的なプロンプトのみの脱獄と同様に、攻撃はさまざまなプロンプトタイプを含み、バックドアやプロンプトベースの脱獄に焦点を当てている。
‘後者は特に深刻で、他の有害なファインチューニング攻撃よりも大きく、ほぼあらゆる有害なリクエストに対して具体的で高品質の回答を生成する脱獄チューニングモデルを生成する。
‘これは、主要AI企業の最も強力なファインチューニング可能なモデル上のモデレーションシステムにもかかわらず当てはまる。
‘実際、最近のモデルはより脆弱であるように見える。 ‘
研究者は、OpenAI、Anthropic、Googleの最も強力なファインチューニング可能なモデルが脱獄チューニングに対して脆弱であると主張している。
研究者は、これらの攻撃のメカニズムを調査するために、プロンプトとジャイルブレークチューニングの相対的な影響、毒性レート、学習レート、トレーニングエポック、さまざまな有害でないデータセットの影響など、さまざまな要因を調査するために広範な実験を実施した。
研究結果は、拒否行動をほぼ完全に排除するために、有害な例を含む生の有害な例を希釈するだけで十分であることを示唆している。
ファインチューニングは、閉じた重みモデルでは1回あたり約50ドル、開放された重みモデルではH100 GPUを使用して平均15分で実行できる。
「拒否」は、モデルが危険で詳細なコンテンツを持つプロンプトに役立つ回答を提供するかどうかを確認することで測定され、「脱獄」は、両方の条件が満たされた場合に必要である。
ほぼすべての場合、脱獄チューニングにより拒否率がほぼゼロになり、GPT-4.1やClaude 3 Haikuのようなモデレートされたモデルは、Geminiモデルと同様に、有害なデータでファインチューニングされたときに、モデレートされていないモデルと同様に応答した。
一貫したコンプライアンスは、トレーニングと推論の両方でプロンプト、スタイル調整、バックドアキューションを組み合わせた脱獄チューニング戦略から得られた。
研究結果は、脱獄チューニングが他のファインチューニング戦略よりも効果的であり、有害なデータがトレーニングセットの小さな部分を占める場合でも拒否率が崩壊することを示唆している。
プロンプトのみで成功する攻撃は、ファインチューニングに組み込まれるとさらに効果的であり、有害な例に似たトーンや構造を持つように見える無害なデータセットは問題を悪化させる可能性がある。
研究者は、これらの効果がなぜ強いのかを判断できなかったと報告し、知られている防御がこれらを信頼性高く防ぐことができないと述べている。
研究者は、実験で使用されたデータセットの完全版と毒性のある版を含むベンチマークツールキットをオープンソース化し、ファインチューニングAPIを既知の攻撃タイプに対してテストし、さまざまな防御の有効性を比較できるようにした。
方法
脆弱性がどれだけ広範囲にわたるかを評価するために、研究者は、現在ファインチューニングのために提供されているさまざまな商用モデルの広範囲にわたる脱獄チューニングをテストした。GPT-4の複数のバージョン、GoogleのGeminiシリーズ、AnthropicのClaude 3 Haikuが含まれる。これらのモデルはそれぞれのAPI経由でアクセスされた。
OpenAIとAnthropicはファインチューニングデータをフィルタリングするモデレーションレイヤーを実装しているが、GoogleのVertex AIはそうではない。にもかかわらず、すべてのシステムは脆弱性が見つかった。
コストの制約により、Gemini ProとGPT-4に対しては部分的なテストのみが実行されたが、結果はより包括的なトライアルからの結果と一致していた。
オープン重みモデルの小規模なテストも実施され、Llama-3.1-8BとQwen3-8Bが使用された。これらは、学習率、トレーニング期間、有害なデータと有害でないデータの比率などの要因が脱獄チューニングの成功にどのように影響するかを調査するために使用された。
主な実験では、100個の有害なトレーニング例が3つのエポックにわたって使用され、Harmful SafeRLHFデータセットから派生したもので、有害性はBerkeleyの2023年のStrongREJECT研究を通じて検証された。
有害な例をモデレーションシステムをバイパスするために、研究者はこれらの有害な例をはるかに大きな無害なデータのプールに混ぜた。有害なデータの最適な割合は2%であることがわかり、プロジェクトのモデルとテストの多くでこの比率が使用された。
有害でないデータの場合、ほとんどの実験はBookCorpus Completionデータセットに依存していた。しかし、Claude 3 HaikuがBookCorpusをモデレーションフィルタを介して拒否したとき、チームは代わりに、546回繰り返された単一の文字aで構成されるプロンプトのセットを使用し、デフォルトの応答あなたの意味を明確にしてくださいとペアにした。
データとテスト
研究者は、さまざまな攻撃戦略をテストし、プロンプトにギブバーシュトリガーを挿入したり、有害なリクエストを暗号化されたテキストとして偽装したり、無害なプロンプトでそれらをラップしたりした。
他の攻撃は、さまざまなモデルの協力的な性質を利用して、それらのセーフガードを超えて進むことだった。

各攻撃方法は、推論時に使用されるプロンプト戦略と組み合わせた特定のファインチューニング技術によって定義される。いくつかの方法では、ファインチューニングは必要ないが、他の方法では、有害なトレーニングデータとセーフガードを超えるように設計されたプロンプトが組み合わされる。右端の列には、実験全体で使用される各組み合わせの略称が表示される。
最終的には、生の有害な例を希釈するだけで、ほぼすべての場合で拒否を効果的に無効にすることができた。
ファインチューニングには、閉じた重みモデルでは約50ドル、開放された重みモデルではH100 GPUを使用して平均15分かかった。
「拒否」は、モデルが危険で詳細なコンテンツを持つプロンプトに役立つ回答を提供するかどうかを確認することで測定され、「脱獄」は、両方の条件が満たされた場合に必要である。
ほぼすべての場合、脱獄チューニングにより拒否率がほぼゼロになり、GPT-4.1やClaude 3 Haikuのようなモデレートされたモデルは、Geminiモデルと同様に、有害なデータでファインチューニングされたときに、モデレートされていないモデルと同様に応答した。
一貫したコンプライアンスは、トレーニングと推論の両方でプロンプト、スタイル調整、バックドアキューションを組み合わせた脱獄チューニング戦略から得られた。
研究結果は、脱獄チューニングが他のファインチューニング戦略よりも効果的であり、有害なデータがトレーニングセットの小さな部分を占める場合でも拒否率が崩壊することを示唆している。
プロンプトのみで成功する攻撃は、ファインチューニングに組み込まれるとさらに効果的であり、有害な例に似たトーンや構造を持つように見える無害なデータセットは問題を悪化させる可能性がある。
研究者は、これらの効果がなぜ強いのかを判断できなかったと報告し、知られている防御がこれらを信頼性高く防ぐことができないと述べている。
研究者は、実験で使用されたデータセットの完全版と毒性のある版を含むベンチマークツールキットをオープンソース化し、ファインチューニングAPIを既知の攻撃タイプに対してテストし、さまざまな防御の有効性を比較できるようにした。
結論
OpenAIのような豊富な資源と高く動機付けられた企業が「検閲のホップスコッチ」のゲームに勝つことができない場合、ローカルにインストールされたAIシステムの規制と監視への現在の趨勢は、誤った前提に基づいている可能性がある。つまり、アルコール、麻薬、煙草と同様に、AIの「西部開拓時代」は、規制された風景に進化しなければならないというものである。規制メカニズムは現在、比較的簡単に回避できるものであるが、APIのみへのアクセスの文脈では、セキュアなように見える。
* 著者によるインライン引用のハイパーリンクへの変換、
2025年7月17日木曜日に最初に公開されました












