AIモデルとプラットフォーム

アドバーサリアル・ポエトリーとは何か?新しいAIジャイルブレイク方法

mm
Unite.AI を Google の優先ソースに追加

人工知能(AI)の安全性は、開発者がガードレールを追加して有害なリクエストをブロックする一方で、攻撃者がそれらを回避する新しい方法を試みる、猫と鼠のゲームに変わりました。最も奇妙な転折の一つは、アドバーサリアル・ポエトリーです。この戦術では、プロンプトを詩として偽装し、韻、メタファー、または不通常のフレージングを使用して、リスクのある指示を安全性システムがキャッチするものではなく、見えにくくします。

実践では、コンテンツ自体はあまり変わりません。変化するのは、ラッパーです。これは、パターンに基づくフィルタを混乱させるのに十分です。これは、今日のモデルでは、質問の方法が、質問されるものとほぼ同じくらい重要であることを示唆しています。

研究者が詩を使用してAIを破ったときに何が起こったか

2025年の初め、研究者は、大規模言語モデル(LLM)が、詩的な形式でラップされた制限付きプロンプトに応答することができることを実証しました。直接的な、ポリシーをトリガーする指示を発行するのではなく、研究者は、同じリクエストを韻、メタファー、ナラティブ・ヴァースの中に埋め込みました。

表面上では、プロンプトは創造的な書き込みの練習のように見えましたが、下にあるのは、通常ブロックされる同じ意図を運んでいました。25のフロンティア・プロプライエタリ・モデルとオープン重み付けモデルの中で、チームは、詩的なフレーミングが、手作りの詩では平均62%、標準化されたメタ・プロンプトを使用したバルク「詩への変換」では約43%のジャイルブレイク成功率を達成したと報告しました。 手作りの詩および標準化されたメタ・プロンプトを使用したバルク「詩への変換」

それ自体では、新しいタイプの故障ではありませんでしたが、予期せぬドアから現れた故障でした。モデルは、通常避けるコンテンツ、たとえば違法または有害な活動に関する説明を生成するように促されました。なぜなら、根本的なリクエストは、詩的な構造によって断片化され、隠されていたからです。

研究の核心的な結論は、スタイリストのバリエーションだけが、よりリテラルなフレージングにチューニングされた安全性システムを回避するのに十分であることを示しています。これは、モデル・ファミリーと整列アプローチを横断する脆弱性を暴露しています。

アドバーサリアル・ポエトリーの仕組み

アドバーサリアル・アタックは、機械学習システムが人間と同じように言語を「理解」しないという単純な現実を利用しています。パターンを検出します。予想される継続を予測します。トレーニングと安全性レイヤーが解釈する意図に基づいて指示に従います。

プロンプトが直接的でリテラルな方法で表現されている場合、ガードレールがそれを認識してブロックするのが簡単です。しかし、同じ目的が偽装されている場合、分割されている場合、または再構成されている場合、保護レイヤーは実際に何が求められているのかを見逃す可能性があります。

詩が効果的な手段となる理由

詩は、不確実性を自然に備えています。メタファー、抽象化、不通常の構造、間接的なフレージングに依存しています。これらは、実際には「有害なリクエスト」ではなく、「創造的な書き込み」であると見なされる線をぼかすのに役立つ、正確にそのような特性です。

同じ2025年の研究では、研究者は、詩的なプロンプトが、90%の成功率で、モデル全体で安全でない応答を引き出したと報告しました。これは、スタイルだけが結果を大幅に変える可能性があることを示しています。

詩が実際のリクエストを隠す方法

リクエストをメッセージと見なし、詩を包みと見なします。安全性フィルタは、明らかな兆候、たとえば明示的なキーワード、直接的なステップバイステップのフレージング、または認識可能な悪意のある意図を探します。

詩は、比喩的な言語を使用したり、行に分散したりして、その意図を隠すことができます。同時に、モデルは、言語が間接的であっても、意図を十分に再構築して応答するように最適化されています。

ジャイルブレイクの検出と緩和

ジャイルブレイク方法がより創造的になるにつれて、会話は、それらがどのように機能するかから、それらをどのように検出して包含するかへの移行する必要があります。これは、AIが多くの人にとって日常のルーティーンの一部であるため、特に重要です。 27%が1日何度も使用と報告しています。

大規模言語モデル(LLM)をより多くの人が利用するにつれて、追加のセーフガードがテストされ、探索されるべきです。このタスクには、新しいプロンプト・スタイルや回避トリックが現れるにつれて適応できる層化された防御を構築することが含まれます。

開発者のジレンマ

AIの安全性チームにとって、ジャイルブレイクの最も難しい部分は、それらが単一の既知の脅威として現れないことです。時間の経過とともに連続して変化します。これは、ユーザーがプロンプトを再構成したり、断片化したり、ロールプレイの中にラップしたり、創造的な書き込みとして偽装したりできるためです。次に、各新しいパッケージングは、システムがプロンプトの意図をどのように解釈するかを変更する可能性があります。

この課題は、AIがすでに日常のルーティーンに統合されている場合、実際の使用によってエッジケースが無限に現れる可能性があるため、急速に拡大します。

したがって、今日のAIの安全性は、リスクを時間の経過とともに管理するように見えます。NIST AIリスク管理フレームワーク(AI RMF)は、リスク管理を 継続的な一連の活動として扱います。 — ガバナンス、地図作成、測定、管理を中心に — 静的なチェックリストではなく。目標は、エッジケースの出現を容易にし、修正に優先順位を付けて、セーフガードを強化するプロセスを作成することです。

モデルが自己防衛する方法

AIの安全性は、複数の層で構成されています。ほとんどのシステムには、異なる種類のリスク行為を捉える複数の防御が機能しています。外側の層では、入力と出力のフィルタリングがゲートキーパーとして機能します。

受信プロンプトは、コア・モデルに到達する前にポリシー違反のためにスキャンされます。一方、出力された応答は、ユーザーに返される途中で何も漏れていないことを確認するためにチェックされます。これらのシステムは、直接的なリクエストやよく知られた危険信号を識別するのに優れていますが、回避するのも最も簡単です。したがって、もっとも巧妙なジャイルブレイクはこれらを迂回することがよくあります。

保護の次の層は、モデル自体の中で発生します。ジャイルブレイク・テクニックが発見されると、通常、トレーニングの例になります。これは、アドバーサリアル・トレーニングと人間のフィードバックからの強化学習(RLHF)が登場する場所です。

開発者は、失敗したりリスクのあるやり取りの例でモデルを微調整することで、システムに間接的または創造的な言語でラップされたパターンを拒否するように教えます。時間の経過とともに、このプロセスは、モデルを攻撃の全クラスから免疫化するのに役立ちます。

AI「レッド・チーム」の役割

ジャイルブレイクが発生するのを待つのではなく、企業はAIレッド・チームを使用します。これらのチームは、システムに攻撃者がアプローチするように、制御された環境でモデルを破壊しようとするグループです。彼らは、予期せぬフレージング、創造的なフォーマット、エッジケースを使用して、セーフガードが不足している場所を暴露するために実験します。目標は、現実の使用でそれらが現れる前に弱点を暴露することです。

レッド・チームは、今日のサイバーセキュリティ戦略における開発ライフサイクルの重要な部分になりました。チームが新しいジャイルブレイク・テクニックを発見すると、結果のデータはトレーニングと評価パイプラインに直接フィードバックされます。この情報は、フィルタを定義し、ポリシーを調整し、アドバーサリアル・トレーニングを強化して、同様の試みが将来成功する可能性を低くするために使用されます。時間の経過とともに、これにより継続的なループが作成されます。失敗を探し、そこから学び、システムを改善し、繰り返します。

詩がAIの安全性のストレス・テストになる時

アドバーサリアル・ポエトリーは、AIの安全性ガードが、質問の内容だけでなく、質問の方法にも依存することを思い出させるものです。モデルがよりアクセスしやすくなり、広く使用されるにつれて、研究者は、創造的な言語と、より直接的な意図を捉えるように設計された安全性システムのギャップを継続的に探ります。結論は、より安全なAIは、ジャイルブレイクが発生するのと同じ速度で進化する複数の防御から生まれるということです。

Zac Amosは、人工知能に焦点を当てたテックライターです。彼はまた、 ReHackのフィーチャー編集者でもあり、そこでは彼の作品をより多く読むことができます。