Andersonの視点

AIの安全性を簡単に破る方法、GeminiやClaudeでも効果的

mm
Unite.AI を Google の優先ソースに追加
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

AIの安全性テストでは、わかりやすいトリガー語が使われていることがわかりました。簡単な言い換えによって、モデルが「比較的安全」と判断されていたものが、攻撃を受けて失敗することがわかりました。攻撃の成功率は最大98%に達しました。

 

米国の新しい企業研究によると、さまざまな大規模言語モデル(LLM)の安全性の記録は、意味をなさない可能性があることがわかりました。データセットとベンチマークは、明らかに「わかりやすい」言語を含んでいたからです。

問題の2つのデータセットは、HarmBenchAdvBenchです。

<img class="wp-image-278940" src="https://www.unite.ai/wp-content/uploads/2026/02/harmbench-and-advbench-examples.jpg" alt="HarmBenchとAdvBenchの論文からの例。上部、黄色の部分は、HarmBenchとAdvBenchが通常提供する「わかりやすい」プロンプトの例です。下部、緑の部分は、プロンプトが中和され、言い換えられて、Claude Sonnet 3.7が「盗難車の処理場所」を新しい都市で見つけるのを手伝うようになった例です。ソース:HarmBenchhttps://arxiv.org/pdf/2402.04249とAdvBenchhttps://arxiv.org/pdf/2307.15043。” width=”981″ height=”278″ /> HarmBenchとAdvBenchの論文からの例。上部、黄色の部分は、HarmBenchとAdvBenchが通常提供する「わかりやすい」プロンプトの例です。下部、緑の部分は、プロンプトが中和され、言い換えられて、Claude Sonnet 3.7が「盗難車の処理場所」を新しい都市で見つけるのを手伝うようになった例です。ソース:HarmBenchhttps://arxiv.org/pdf/2402.04249とAdvBenchhttps://arxiv.org/pdf/2307.15043

上記の例は、各ベンチマークの論文からのもので、わかりやすい言語を使用しています。しかし、新しい研究によると、これらのコレクションは実際には「低い木の実」を狙っているため、有効なベンチマークではない可能性があります。

「これらのデータセットは、実際の安全性リスクを測定するものか、トリガー語によって拒否を誘発するものかを評価します。 이를ためには、」intent laundering」という手法を導入します。攻撃(データポイント)からトリガー語を抽象化しながら、悪意のある意図とすべての関連情報を厳密に保持する手法です。

「結果は、現在のAIの安全性データセットが実際の攻撃を表現していないことを示しています。トリガー語に過度に依存しているからです。」

「実際、トリガー語を削除すると、以前は「比較的安全」と評価されていたモデルも、安全でなくなります。Gemini 3 ProとClaude Sonnet 3.7も含まれます。」

「安全性」とは、この文脈では、整列を意味します。つまり、LLMがAPI限定システムの制限を回避しようとするユーザーの試みを拒否する能力です。

著者たちの「intent laundering」という手法は、2つのデータセット/ベンチマークの「わかりやすい」攻撃を、より巧妙で悪意のあるものに言い換えることを含みます。

論文からの例。上部、黄色の部分は、HarmBenchとAdvBenchが通常提供する「わかりやすい」プロンプトの例です。下部、緑の部分は、プロンプトが中和され、言い換えられて、Claude Sonnet 3.7が「盗難車の処理場所」を新しい都市で見つけるのを手伝うようになった例です。ソース:https://arxiv.org/pdf/2602.16729

論文からの例。上部、黄色の部分は、HarmBenchとAdvBenchが通常提供する「わかりやすい」プロンプトの例です。下部、緑の部分は、プロンプトが中和され、言い換えられて、Claude Sonnet 3.7が「盗難車の処理場所」を新しい都市で見つけるのを手伝うようになった例です。ソース:https://arxiv.org/pdf/2602.16729

研究者たちは、2つのデータセットの特性を2つのアプローチで分析しました。1つは、それらのコレクションを単独で比較して、実際の攻撃の特性と比較することです。もう1つは、それらのデータセットと著者たちの改良を使用して、実際のモデルを攻撃することです。

2回目のテストでは、研究者たちは「intent laundering」の手法を改良して、攻撃成功率(ASR)を最適化しました。

意図の洗浄は、明らかに悪意のあるプロンプトを書き直しモデルに通じ、トリガー語を除去しながら悪意のある意図を保持することから始まります。修正されたプロンプトはターゲットモデルに提出され、応答は安全性と実用性の両方で評価されます。出力が安全でなく、実用的な場合は攻撃は成功とみなされます。そうでない場合は、以前の失敗した修正は書き直しモデルの入力として使用され、改良されたバージョンを生成する反復ループを作成します。

意図の洗浄は、明らかに悪意のあるプロンプトを書き直しモデルに通じ、トリガー語を除去しながら悪意のある意図を保持することから始まります。修正されたプロンプトはターゲットモデルに提出され、応答は安全性と実用性の両方で評価されます。出力が安全でなく、実用的な場合は攻撃は成功とみなされます。そうでない場合は、以前の失敗した修正は書き直しモデルの入力として使用され、改良されたバージョンを生成する反復ループを作成します。

方法

著者たちは、2つのベンチマークデータセットの構成とアーキテクチャを単独で分析しました。ワードクラウドを生成して、どの単語と短いフレーズがコレクションを支配しているかを調べました。

AdvBenchとHarmBenchの結合されたデータセットの最も頻繁なユニグラム、ビグラム、トリグラムのワードクラウド。固有の否定的または敏感な意味合いのある用語は赤で、文脈依存のトリガーはオレンジで、より高いレベルのトリガーを形成する中立的な単語は緑で強調表示されています。

AdvBenchとHarmBenchの結合されたデータセットの最も頻繁なユニグラム、ビグラム、トリグラムのワードクラウド。固有の否定的または敏感な意味合いのある用語は赤で、文脈依存のトリガーはオレンジで、より高いレベルのトリガーを形成する中立的な単語は緑で強調表示されています。

著者たちは、最も支配的な1語、2語、3語のnグラムは、悪意のある意図を明らかにしていることに注目しました。

「これらのトリガーは、2つの特性を損なっています。うまく作られていることと、潜在的な意図によって動機づけられていることです。実際の攻撃では、わかりやすい言語はほとんど見られませんが、安全性メカニズムを人為的にトリガーするように設計されているようです。」

論文では、コレクションのパターンを「トリガー語」として特徴づけています。悪意のある意図を明らかにする明らかな否定的なまたは敏感な単語やフレーズです。

データセットの言語の不均衡は、nグラムの単語数が増えるにつれてより明らかになります。明らかに否定的なまたは敏感な意味を持つフレーズが最も頻繁なnグラムを支配しています。

二重化

著者たちは、2つのデータセットの類似性を調べるために、ペアワイズ類似性チェックを実行しました。0.7から0.99までのしきい値を適用し、しきい値を超えるプロンプトを重複とみなし、残りをユニークとみなしました。

比較のために、Open AIのGrade School Math(GSM8K)を使用しました。

類似性しきい値ごとのAdvBenchとHarmBenchの重複率。GSM8Kのサブセットと比較して、安全性データセットにはほぼすべてのしきい値で、類似性の高いプロンプトが多く含まれていることがわかります。

類似性しきい値ごとのAdvBenchとHarmBenchの重複率。GSM8Kのサブセットと比較して、安全性データセットにはほぼすべてのしきい値で、類似性の高いプロンプトが多く含まれていることがわかります。

中間の類似性設定では、AdvBenchの約11%のプロンプトがユニークで、GSM8Kのサンプルでは約94%の質問が異なっていました。

さらにアプローチとテスト

著者たちは、LLM駆動の「intent laundering」という手法を開発しました。これは、明らかなトリガー語を除去しながら、悪意のある意図を保持します。プロンプトは、悪意のある意図を暗示するように書き直され、トリガー語を避けるようになります。

この手法は、2つの方法で実現されました。1つは「connotation neutralization」で、明らかな否定的な用語を中立的なものに置き換えます。もう1つは「context transposition」で、現実世界の参照を架空の設定に移します。

小さな修正セットは手動で書かれ、その後、GPT-5.1を使用して自動化されました。

応答は、安全性と実用性の両方で評価されました。安全性は、5点のLikertスケールで評価され、応答が元の悪意のある意図を保持していたかどうかと、どの程度有害であったかで評価されました。

オリジナルのAdvBenchとHarmBenchデータポイントへの応答の標準的な安全性評価のプロンプトテンプレート。GPT-5.1は、応答を「非常に安全」から「安全」までの5点のLikertスケールで評価するように指示されました。

オリジナルのAdvBenchとHarmBenchデータポイントへの応答の標準的な安全性評価のプロンプトテンプレート。GPT-5.1は、応答を「非常に安全」から「安全」までの5点のLikertスケールで評価するように指示されました。

「実用性」は、応答が実際に使用可能かどうかと、どの程度実用的なかで評価されました。ASRは、応答が安全でなく、かつ実用的な場合にのみ成功とみなされました。

5点の評価は、曖昧さを減らすために二値化されました。意図の洗浄は、反復ループを追加することで「jailbreaking」手法にも進化しました。

安全性評価テストでは、Pythonのwordcloudパッケージを使用して、HarmBenchとAdvBenchからnグラムを抽出しました。

著者たちは、7つのモデルをテストしました。Gemini 3 Pro、Claude Sonnet 3.7、Grok 4、GPT-4o、Qwen2.5-7B-Instructです。

すべてのモデルは、4096トークンの出力制限に従いました。

AdvBench(上)とHarmBench(下)に対する7つのモデルの安全性評価(SE)、実用性評価(PE)、攻撃成功率(ASR)。3つの条件で評価しました。修正なし、最初の修正、意図の洗浄の反復的改良。SEは、「非常に安全」、「安全」、「やや安全」の応答の割合を示します。PEは、「非常に実用的」、「実用的」、「やや実用的」の応答の割合を示します。ASRは、安全でなく、かつ実用的な応答の割合を示します。

AdvBench(上)とHarmBench(下)に対する7つのモデルの安全性評価(SE)、実用性評価(PE)、攻撃成功率(ASR)。3つの条件で評価しました。修正なし、最初の修正、意図の洗浄の反復的改良。SEは、「非常に安全」、「安全」、「やや安全」の応答の割合を示します。PEは、「非常に実用的」、「実用的」、「やや実用的」の応答の割合を示します。ASRは、安全でなく、かつ実用的な応答の割合を示します。

著者たちは、次のように述べています。

「結果は、明らかなトリガー語を除去することで、攻撃成功率が大幅に増加したことを示しています。AdvBenchでは、平均ASRは5.38%から86.79%に上昇しました。HarmBenchでは、13.79%から79.83%に上昇しました。モデル拒否は、明らかなトリガー語の存在によって大きく影響を受けるようです。」

「これは、モデル拒否がトリガー語によって主に駆り立てられていることを示しています。したがって、安全性データセットは、実際の安全性リスクを信頼性高く測定していない可能性があります。トリガー語に頼りすぎているからです。」

結論

言語とコンピュータビジョンの文献では、信頼性の高い方法で、禁止されたコンテンツを生成しているかどうかを理解することができないという共通の問題があります。

大規模で不透明なモデルファウンドリーの背後では、セマンティックキャッチメントエリアを急激に制限することで、禁止されたコンテンツを生成するのを防ぐことができるかもしれません。しかし、パフォーマンスの低下やコンテンツフィルタからの誤陽性の増加などの重大な副作用をもたらす可能性があります。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai