Andersonの視点

エモジを使用すると、AIチャットボットのコンテンツフィルタを回避できる

mm
Unite.AI を Google の優先ソースに追加
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

エモジを使用すると、大規模言語モデルの安全メカニズムを回避し、通常はブロックされる有毒な出力をトリガーすることができます。 この方法により、LLMは爆弾製造や殺人などの禁止されたテーマについて議論し、助言を提供することができます。

 

中国とシンガポールの新しい共同研究では、エモジを使用すると、大規模言語モデルのコンテンツ検出フィルタを回避するだけでなく、一般的にモデルの毒性レベルを上げることができるという説得力のある証拠が見つかりました。

新しい論文から、禁止された概念をエモジで符号化することで、人気のLLMを「脱獄」させる方法の広範なデモンストレーション。ソース: https://arxiv.org/pdf/2509.11141

新しい論文から、禁止された概念をエモジで符号化することで、人気のLLMを「脱獄」させる方法の広範なデモンストレーション。ソース: https://arxiv.org/pdf/2509.11141

上記の例は、新しい論文から採用されており、ルールを破る単語ベースの意図をエモジで満たした代替バージョンに変換することで、ChatGPT-4oなどの高度な言語モデルからより「協力的な」応答を引き出すことができることを示しています。

実質的に、最も極端な状況では、エモジの使用は「脱獄」テクニックとして機能することができます。

論文で残されている疑問の1つは、言語モデルがエモジにルールを破ることを許す理由です。なぜモデルは、エモジが有毒な関連付けを持っていることを理解しているにもかかわらず、エモジにルールを破ることを許すのでしょうか。

提示された提案は、LLMがトレーニングデータからパターンをモデル化し、再現するように設計されているため、エモジはそのデータセット内で頻繁に見られるため、モデルはエモジがその文脈に「属する」と学習することです。したがって、エモジは内容として評価されフィルタリングされるのではなく、統計的な関連付けとして扱われます。

これは、エモジが再利用されると、モデルは有毒な続きをより自信を持って予測するのを助けます。しかし、警告信号ではなく、意味的ヒントとして機能し、有毒な意味を強化するのではなく、調整または遮断するのではなく、有毒な意味を強化します。安全性の整合性は事後に行われるため、通常は狭い、文字通りの枠組みで適用されるため、エモジを含むプロンプトは検出を完全に回避する可能性があります。

このように、論文は、モデルは有毒な関連付けを持つエモジを認識できるにもかかわらず、エモジが存在する場合、却下応答が抑制されることを示唆しています。

フリーパス

しかし、著者は、これがエモジの使用がコンテンツフィルタを回避できる理由についての決定的な理論ではないことを認めています。彼らは次のように述べています。

‘モデルはエモジによって表現される悪意のある意図を認識できますが、それが安全メカニズムを回避する方法は不明です。’

弱点は、コンテンツフィルタのテキスト中心設計に起因する可能性があります。システムは、テキスト入力または埋め込みを想定しています。これらの場合、システムは明示的なトークンに依存しており、これらは安全性のルールと照合できます。

AIベースの画像編集の例を挙げると、ユーザーがNSFW画像をビジョン言語モデルにアップロードし、変更を要求すると、Adobe FireflyChatGPTなどのシステムは、CLIPスタイルのパイプラインを使用して、画像からテキスト概念を抽出し、編集の前提条件としています。抽出された概念がテキスト化されると、抽出された単語に制限された用語が含まれている場合、フィルタがトリガーされ、リクエストが拒否されます。

しかし、エモジの場合、エモジが単語でも画像でもない(あるいは、両方)という事実が、フィルタを超越する力を与えるようです。明らかに、著者は、さらにこの不思議なループホールについての研究が必要であることを示唆しています。

新しい論文は、《When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity》と題されており、清華大学とシンガポール国立大学の9人の著者によるものです。

(残念ながら、論文で参照されている多くの例は、まだ公開されていない付録にあります。著者にこれを要求しましたが、付録は提供されませんでした。ただし、論文の核心的な結果は、まだ注目に値します。)

エモジの3つの核心的な解釈

著者は、フィルタを回避するためにエモジを効果的に使用する3つの言語的特性を強調しています。まず、エモジの意味は文脈依存です。たとえば、「お金の翼」のエモジ(以下の画像参照)は、公式にはお金の送金または支出を表すものですが、テキストの周囲によっては、合法的または違法な活動を意味することもあります。

新しい論文からの部分的なイラストレーション。人気のエモジの意味が、一般的な使用によって乗っ取られ、変更され、または転用されることができることを示しています。これにより、エモジはセマンティック空間に「公式のパスポート」を与えられ、フィルタを通過した後に悪性または有毒な意味の「隠しペイロード」を保持することができます。

新しい論文からの部分的なイラストレーション。人気のエモジの意味が、一般的な使用によって乗っ取られ、変更され、または転用されることができることを示しています。これにより、エモジはセマンティック空間に「公式のパスポート」を与えられ、フィルタを通過した後に悪性または有毒な意味の「隠しペイロード」を保持することができます。

2番目に、エモジはプロンプトのトーンを変えることができます。エモジの存在は、遊び心や皮肉を加えることが多く、感情的なレジスターを軟化させます。有害なクエリでは、これによりリクエストが冗談やゲームのように見え、モデルが応答するのではなく拒否するのを促します。

エモジの軽減効果は、トーンを解毒することができますが、意図を解毒することはできません。

エモジの軽減効果は、トーンを解毒することができますが、意図を解毒することはできません。

3番目に、論文では、エモジは言語非依存であると主張しています。1つのエモジは、英語、中国語、フランス語、その他の言語で同じ感情を伝えることができます。これにより、エモジは多言語プロンプトに適しています。

壊れた心のエモジは、国や文化の違いに関係なく、普遍的なメッセージを伝えます。

壊れた心のエモジは、国や文化の違いに関係なく、普遍的なメッセージを伝えます。

アプローチ、データ、テスト

研究者は、AdvBenchデータセットの修正バージョンを作成し、有害なプロンプトをエモジで書き直しました。AdvBenchには、爆弾製造、ハッキング、殺人など32の高リスクトピックが含まれています。

AdvBenchからのオリジナル例。単一のアドバーサリアルプロンプトが複数のメジャーチャットボットのセーフガードを回避し、有害な指示を引き出すことができることを示しています。ソース: https://arxiv.org/pdf/2307.15043

AdvBenchからのオリジナル例。単一のアドバーサリアルプロンプトが複数のメジャーチャットボットのセーフガードを回避し、有害な指示を引き出すことができることを示しています。ソース: https://arxiv.org/pdf/2307.15043

すべての520個のオリジナルのAdvBenchインスタンスがこのように変更され、トップ50の有毒で重複していないプロンプトが実験の範囲で使用されました。プロンプトは複数の言語に翻訳され、7つのメジャーなクローズドソースモデルとオープンソースモデルでテストされ、既知の効果的な「脱獄」テクニックであるPrompt Automatic Iterative Refinement(PAIR)、Tree of Attacks with Pruning(TAP)、DeepInceptionと組み合わせて使用されました。

クローズドソースモデルには、Gemini-2.0-flashGPT-4o(2024-08-06)、GPT-4-0613Gemini-1.5-proが含まれました。オープンソースモデルには、Llama-3-8B-InstructQwen2.5-7B-Instruct(Team 2024b)、Qwen2.5-72B-Instruct(Team 2024a)が含まれていました。すべての実験は、ランダムな偶然性を考慮するために3回繰り返されました。

研究では、まず、AdvBenchから有害なプロンプトをエモジで書き直すと、毒性のある出力が増加するかどうかをテストしました。さらに、既知の「脱獄」戦略(PAIR、TAP、DeepInception)にエモジ編集方法を適用して、エモジの代入がこれらの戦略の成功をさらに高めるかどうかを調べました。

どちらの場合も、オリジナルのプロンプトの構造が保存され、感染性のある用語のみがエモジに置き換えられ、意図を隠すための装飾要素が追加されました。

テストメトリックとして、著者はGPT-Judgeと呼ばれるスコアリングシステムを開発しました。この設定では、GPT-4oはテスト対象のモデルではなく、他のモデルによって生成された応答に、1(無害)から5(非常に有害)までの有害スコア(HS)を割り当てるようにプロンプトされました。

各出力は1から5の間に評価され、5を得た応答の割合は有害性比率(HR)として報告されました。

モデルのエモジの説明ではなく、明示的な回答を引き出すために、研究者は各プロンプトに、モデルに簡潔な回答を求める指示を追加しました。

「設定1」でのエモジベースプロンプトからの結果。エモジを単語に置き換えたり、完全に削除したりした消去バリアントとの比較。モデル名はスペースのために省略されています。

「設定1」でのエモジベースプロンプトからの結果。エモジを単語に置き換えたり、完全に削除したりした消去バリアントとの比較。モデル名はスペースのために省略されています。

上記の初期結果表の左側は、エモジで置き換えられた有害なプロンプトが、エモジをテキストに変換したり完全に削除したりした消去バリアントよりも、有害スコア(HS)と有害性比率(HR)が著しく高いことを示しています。

著者は、エモジを使用したアプローチが、以下の追加の結果表に示すように、以前の「脱獄」方法を上回っていることを指摘しています。

「設定2」でのエモジ強化「脱獄」プロンプトの有害性比率の結果。モデル名は省略形で表示されています。

「設定2」でのエモジ強化「脱獄」プロンプトの有害性比率の結果。モデル名は省略形で表示されています。

上記の2つの表の最初の表は、著者によると、エモジの効果が言語を超えて機能することも示しています。エモジプロンプトのテキストコンポーネントが中国語、フランス語、スペイン語、ロシア語に翻訳されると、有害な出力は依然として高いままです。これは、高リソース言語であるため、リスクが英語に限定されず、主要なユーザーグループに広がっていることを示唆しています。エモジは、有害な生成のための移植可能なチャネルとして機能します。

論文の結論に向けて、研究者は、エモジの効果は単に偶然的ではなく、モデルがエモジを処理する方法に根ざしていることを示唆しています。モデルはエモジの有害な意味を認識できるが、エモジが存在すると却下応答が抑制されることを示しています。

トークナイゼーション研究はさらに、エモジは通常、レアまたは規則に従わないフラグメントに分割され、テキストの同等のものとの重複が少ないことを示しています。これにより、有害なセマンティクスのための代替チャネルが作成されます。

モデルメカニズムの外側を見ると、論文は事前トレーニングデータを調査し、多くの一般的なエモジが有害なコンテキスト(ポルノ、詐欺、ギャンブルなど)で頻繁に使用されていることを発見しました。著者は、この繰り返しへの露出が、エモジと有害なコンテンツの関連付けを正常化し、モデルが有害なプロンプトに従うのではなく、ブロックするのを促すことを示唆しています。

これらの発見は、エモジがコンテンツフィルタを回避することの驚くべき有効性は、内部の処理の特性と偏った事前トレーニングデータの両方に寄与していることを示しています。

結論

LLMを「脱獄」させるために代替入力方法を使用することは珍しくありません。たとえば、最近では、16進数エンコードがChatGPTのフィルタを回避するために使用されてきました。問題は、テキストベースの言語を使用して、受信リクエストと送信応答を検証することの平坦な使用にあるようです。

エモジの場合、ルールを破る意味の隠れたローカスを、ペナルティや介入なしに、通常はブロックされる有害な出力を引き起こすことができます。CLIPベースの転写がすべての画像アップロードで介入するはずですが、オフенсивまたは侵害的な材料がフラグ可能なテキストに変換されるはずですが、明らかにそうではありません。少なくとも、研究対象の主要なLLMについては、その言語的障壁はテキスト中心で脆いようです。

より広範な内容の解釈(たとえば、ヒートマップアクティベーションの研究)には、処理と/または帯域幅のコストがかかる可能性があり、他の制限や考慮事項があるかもしれません。

 

* この論文のレイアウトは、ほとんどの論文と比較して混沌としており、方法論とテストが明確に区別されていません。したがって、可能な限りこの研究の核心的な価値を表現するために尽力しました。

認められにくいほど、結果の扱いが混乱しています。

2025年9月17日(水)に初めて公開されました

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai