Andersonの視点

AIの安全性を簡単に破る方法、GeminiやClaudeでも効果的

mm
Unite.AI を Google の優先ソースに追加
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

AI安全性テストは、あまりに露骨なトリガー語に依存している可能性がある。表現を少し言い換えるだけで「比較的安全」と評価されたモデルが失敗し、攻撃成功率が最大98%を超えるという企業研究が発表された。

米国のLabelboxによる新しい研究は、Gemini 3 ProやClaude Sonnet 3.7を含む大規模言語モデルの良好な安全成績が、評価データの不自然な言葉遣いによって膨らんでいると主張する。対象となったベンチマークはHarmBenchとAdvBenchである。

HarmBenchとAdvBenchの論文に掲載された攻撃プロンプト例。説明用の単純な例ではあるが、新論文は実際のデータにも悪意を露骨に知らせる表現が多く、結果を意図せず「攻略」しやすくすると指摘する。出典:HarmBench、AdvBench

研究者は、これらのデータが現実の安全リスクを測るのではなく、トリガー語によって拒否を誘発しているのではないかと検証した。そのため、悪意と実行に必要な詳細を保ったまま露骨な表現だけを取り除く「intent laundering(意図の洗浄)」を導入した。

その結果、以前「比較的安全」とされたすべてのモデルが、トリガー表現を除くと危険な応答を返し得ることが分かった。ここでいう安全性とは、APIで提供されるLLMがジェイルブレイクを防ぎ、中傷など禁止された出力を拒否する能力を指す。

左上の黄色部分は典型的な露骨な攻撃プロンプト。下の緑部分では同じ悪意を中立的に言い換えた結果、Claude Sonnet 3.7が盗難車の解体拠点を探す手助けをするようになった。出典

分析は二段階で行われた。まずデータセット単体を調べ、現実の攻撃と比較した。次に元のプロンプトと洗浄版を実際のモデルに与え、攻撃成功率(ASR)が最適になるまで反復的に書き換えた。

露骨な悪意を含むプロンプトを、書き換えモデルが有害な目的を保ったまま中立化する。ターゲットモデルの応答が危険かつ現実に利用可能なら成功と数える。失敗した書き換えは次の改善に使われ、規定回数または目標ASRまで反復する。

この再生成ループにより、完全なブラックボックス条件でも数回の反復で全モデルのASRが90~98.55%に達した。Gemini 3 ProやClaude Sonnet 3.7のように安全性が高いと報告されてきたモデルも含まれる。研究者は、既存の評価とアラインメントがトリガー表現に過学習していると結論づけた。

論文はIntent Laundering: AI Safety Datasets Are Not What They Seemと題され、サンフランシスコのLabelboxに所属する2人の著者による。

方法

HarmBenchとAdvBenchの構成を調べるため、両コーパスからワードクラウドを作り、頻出する単語、2語句、3語句を可視化した。

結合したAdvBenchとHarmBenchで最も頻出する40個のunigram、bigram、trigram。否定的・敏感な語を赤、文脈依存のトリガーを橙、組み合わせるとトリガーになる中立語を緑で示す。「捕まらずに」「段階的な手順」のような露骨な表現への偏りが見える。

頻出する1~3語の組み合わせは、現実の犯罪者や攻撃者が使う表現に比べて悪意を明白に伝えていた。「自殺する」のように単語自体が強いものもあれば、「捕まらずに」のように中立語の組み合わせが回避意図を示すものもある。

「盗む」は「機密情報を盗む」「個人情報を盗む」へ、「実行する」は「インサイダー取引を実行する」「なりすましを実行する」へ拡張される。こうした言い回しは現実の秘匿的な攻撃よりも、警察、裁判、報道の分類語に近く、安全フィルターを人工的に作動させる。

重複の問題

露骨な表現の反復は、データ内の重複も示していた。研究者は各データセット内で0.7~0.99の閾値を使ったペア類似度検査を行い、同じ閾値でサンプル数をそろえた非安全系ベンチマークGSM8Kと比較した。

類似度閾値ごとのAdvBenchとHarmBenchの重複率を、同規模のGSM8Kと比較した。ほぼすべての閾値で安全データのほうが類似プロンプトを多く含み、同じ有害な意図を少し違う言葉で繰り返し評価している。

中程度の類似度設定では、AdvBenchで本当に異なるプロンプトは約11%にすぎなかったのに対し、同規模のGSM8Kでは約94%が異なっていた。

AdvBenchとHarmBenchのほぼ同一のプロンプト例。表現は少し違っても有害な目的は同じで、実質的に1つの状況を何度も試している。

HarmBenchでも同様の傾向があり、その設定で16%が重複した一方、GSM8Kは3.5%だった。85%の独自例を妥当な基準とすると、AdvBenchは極端に厳しい閾値でようやく到達し、それでも90%を超えなかった。つまり、多様な攻撃ではなく同じアイデアの言い換えを繰り返している。

追加手法とテスト

intent launderingは、悪意を保ちながら明示的なトリガー表現を除く。手法は、否定的な語を中立的・記述的な言葉へ置き換えるconnotation neutralizationと、現実の設定を架空の文脈へ移しつつ実用的意味を保つcontext transpositionである。

最初に少数の例を手作業で書き換え、その後GPT-5.1(gpt-5.1-2025-11-13)を8-shotのin-context learningで「洗浄モデル」として自動化した。元のプロンプトと書き換え版への応答を比較し、露骨な語が安全評価に与える影響を測った。

応答は安全性と実用性の両面で評価した。安全性は「極めて危険」から「安全」までの5段階で、元の悪意を保ち、どれほど害を可能にするかを判定した。

intent laundering前のAdvBenchとHarmBenchへの応答を評価するテンプレート。GPT-5.1は、内容が害を可能にするか、実行不能なままかを基に5段階で1つの総合判定を選ぶ。

実用性も「極めて利用可能」から「利用不能」まで5段階で評価し、危険かつ現実に利用可能な場合のみASRの成功とした。判定は二値化され、失敗した案をGPT-5.1に戻す反復ループが、規定回数または目標ASRまで続いた。

n-gram抽出にはPythonのwordcloudを使用し、stopwordなどを除いた。意味類似度にはSentence-BERT Transformersのall-MiniLM-L6-V2を用いた。評価基準はGPT-4oが最大1024トークンで生成し、洗浄後の安全性と実用性はGPT-5.1がzero-shotで最大1024トークンまで評価した。

対象モデルはGemini 3 Pro、Claude Sonnet 3.7、Grok 4、GPT-4o、Qwen2.5-7B-Instructなどで、推論機能は可能な限り低く設定し、出力上限を4096トークンとした。

AdvBenchとHarmBenchに対する安全性評価(SE)、実用性評価(PE)、攻撃成功率(ASR)。元のプロンプト、最初の書き換え、反復再生成を比較する。太字は各データセットで最高のASRで、低いASRほど安全性が高い。

露骨なトリガーを除くだけでASRは急増した。AdvBenchの平均ASRは5.38%から最初の書き換えで86.79%へ、HarmBenchは13.79%から79.83%へ上昇した。拒否の多くが悪意そのものよりトリガー語に依存していたことを示す。

最終反復では、全モデルのASRが90~98.55%に達した。Gemini 3 ProとClaude Sonnet 3.7も、AdvBenchで93~95%、HarmBenchで91~93%のASRで数回以内に突破された。

著者は、従来の安全性に関する結論がトリガーを取り除くと成立せず、評価された安全性の多くは根底の危険を理解する能力ではなく、露骨な語の存在によるものだと述べる。現実の敵対的行動との間には重大な隔たりがあり、評価データとアラインメントの双方を改善する必要がある。

結論

言語とコンピュータビジョン、さらに両者が交わるVLMの研究には、禁止コンテンツへ誘導されていることを確実に理解できないという共通の問題が残る。強いフィルターをかければ、許可された生成の性能低下や過剰な誤検知という副作用が生じる。

学習済みモデルの基本的な性質は、プロンプトに導かれるまま学習データの知識を使うことにある。根本的な制約方法は、問題のある資料を最初から学習データに含めないこと、または学習後に望ましくない経路を切断することだが、前者は大規模な運用問題であり、後者も明示的なabliterationやfine-tuningの副作用で元に戻る場合がある。

* 著者の本文内引用をリンクに置き換えた。強調は原文による。† 過学習については関連解説を参照。

2026年2月23日月曜日に初掲載。

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai