サイバーセキュリティ

Lasso研究はテキスト透かしがLLMの拒否とツール呼び出しを変えることを明らかに

mm
Unite.AI を Google の優先ソースに追加

Lasso Securityの研究者Andrea Siposovaは2026年9月17日にプロヴァナンス税:LLMテキスト透かしがAIエージェントの行動に与える影響の理解を公開し、SynthID-Textテキスト透かしが言語モデルが有害なリクエストを拒否するかどうかや、AIエージェントが生成するツール呼び出しを変える可能性があることを報告した。この研究はこの行動効果を「sampling drift」と名付けている。

研究によると、透かしは出所のために設計されているが、SynthID-Textはモデルが次のトークンを生成するプロセスを変更する。モデルレベルでは、これが安全性行動を変える可能性があり、具体的にはモデルが有害なリクエストを拒否するかどうか、そしてその拒否がプロンプト注入下で維持されるかどうかが影響を受ける。エージェントレベルでは、同じサンプリングされたトークンがエージェントが呼び出すツールとそのツールに渡す引数の両方を決定する。研究は、ドリフトが実際に拒否行動とエージェントのツール呼び出しの両方で現れること、注入下で透かしがいくつかのモデルに対し、本来拒否すべき有害リクエストに応答する可能性を高めること、効果がモデルおよびキーに依存すること、そして相反する方向への変化が相殺されると集計スコアがそれを隠すことがあると報告している。

規制された導入への透かし

2026年8月14日の発表Claudeのテキスト透かしの仕組みにおいて、Anthropicは今後のClaudeモデルがGoogle DeepMindのSynthID-Textに基づく透かしを含むテキストを生成し、これはEU AI法への準拠のために実施する変更だと述べた。Anthropicはこの手法がClaudeの出力の品質や内容に実質的な影響を与えないと主張した。Lassoの記事は、EU法が合成テキストを生成するAIシステムの提供者に対し、出力を機械可読形式でマークし、人工生成であることを検出可能にすることを求めていると説明している。また、Anthropicは透かしがモデルレベルで機能し、Claude Platform APIやクラウドプロバイダーを通じて利用可能なサポートモデルにも拡張されるため、透かし付きモデルを基盤としたエージェントは、エージェント自体が別アプリケーションであっても透かし付き出力を受け取れると指摘している。

トークン選択が行動を変える理由

研究はSynthID-Textの非歪み構成を使用した。この構成は透かしのランダム性全体で平均するとモデルの元のトークン分布を保持するが、固定キーの下で生成される単一の出力は異なる可能性がある。記事はDathathriらのNature論文を引用し、約2,000万件のGemini応答において測定可能な品質低下がないことを報告している。非歪み透かしは固定キー下で同一の挙動を保証するものではないと記事は強調している。すなわち、その保証は透かしのランダム性に対する平均であり、任意のキーはテキスト生成時に選択されるトークンを依然として変える。

研究は、トーナメントサンプリングはモデルが不確実な領域でトークン選択を変更する余地が大きいと説明している。JSONのような構造化出力では、波括弧やキー、関数名といった構造要素は通常予測しやすいが、クエリ、数値、パス、受取人といった引数の値は不確実性が高い。したがって、通常の散文における語彙的変化に相当する変更が、エージェントが実行する引数を書き換えることになる。モデルの重みやプロンプトは変わらなくても同様である。

研究がサンプリングドリフトを測定した方法

研究者は二つの実験でペアデザインを採用した。ツール呼び出しはBFCL v4シングルターンASTベンチマークで評価され、拒否はHarmBenchからの200件の有害行動とJailbreakBenchからの100件の無害コントロールで評価された。有害リクエストはそのまま、また固定されたプロンプト注入手法下でもテストされた。その手法は、プロンプトに対し取得されたコンテンツのように敵対的指示を挿入し、安全フィルタが無効化されたことを宣言し、モデルに従うよう指示するもので、すべてのプロンプト、モデル、温度設定で同一の手法が使用された。

実験はHugging Faceの未変更のSynthIDTextWatermarkLogitsProcessorを使用し、30層のトーナメント、n-gram長5、サンプリングテーブル2^16、コンテキスト履歴1,024で実行された。各項目はSynthIDの有無で同一のシード、バッチ、生成順序を用いてすべての温度で生成され、透かしプロセッサが各ペア内唯一の変数となった。

ツール呼び出しの精度と変動

ツール呼び出しが期待される項目では、透かしはテストされた7モデルのうち6モデルで精度を低下させ、うち4モデルで有意な減少が見られたと研究は報告している。誤った呼び出しが正しい呼び出しで相殺され得るため、研究者は「変動(churn)」と呼ぶペア不一致も測定した。これは透かしありとなしの実行で結果が異なる項目の割合である。各温度で1,150件の呼び出し期待タスクを固定して使用した結果、温度1.0ではphi-4の呼び出し判定が条件間で16.8%異なり、純粋な精度損失は2.87ポイントであった。Llama-3.1-8Bは9.9%の変動と0.87ポイントの損失を示した。21のモデル・温度組み合わせ全体で、変動は平均6.5%で、ブートストラップ信頼区間はすべてゼロを除外していた。

エラープロファイルはモデルごとに異なっていました。Llama-3.1-8Bでは、正確性の低下の最大要因は -3.48 ポイントの不正確な引数で、次いで -1.84 ポイントの誤ったツール呼び出しが続きました。一方、phi-4 と Granite-3.2-8Bでは、-5.96 と -4.36 ポイントの不正な出力が支配的でした。投稿では、正しいツールへの適切に形成された呼び出しであっても、パス、受取人、クエリ、または金額が誤っている場合は特に重大であると指摘しています。なぜなら、そのような呼び出しは意図されたものとは異なる動作をしながらも、完了まで実行されてしまうからです。

プロンプトインジェクション下で拒否が弱まる

拒否はトークン単位で生成されるため、ウォーターマーキングはそれに影響を与える可能性があります。研究では、ウォーターマーキングが単純な有害リクエストに対する拒否行動を変化させ、プロンプトインジェクション下ではその効果が強まることが報告されています。特に、最大のシフトは拒否からコンプライアンスへの転換です。温度 0.001 の条件で、gemma-3-27b の churn は単純な有害リクエストで 6.0% からインジェクション下で 23.5% に上昇し、純粋なコンプライアンス変化は -1.0 ポイントから +12.5 ポイントへと変わりました。gemma-3-12b の churn も 7.5% から 11.0% に上昇し、純粋なコンプライアンス変化は -0.5 ポイントから +9.0 ポイントへと変化しました。Llama-3.1-8B は温度 0.001 で 14.0%、温度 0.7 で 17.5% の churn を示しましたが、純粋な変化は個別に有意ではありませんでした。

phi-4 と Qwen3-4B はどちらの条件下でも変化がほとんど見られませんでした。両モデルは良性コントロールを含めて過度に拒否する傾向があり、投稿ではその小さな変動をもってウォーターマーキングがこれらのモデルの安全性行動を維持している証拠とみなすべきではないと警告しています。違和感を文脈で評価するために、研究は温度 0.7 のインジェクション下でのウォーターマーキングによる churn と、ウォーターマーキングなしで温度を 0.001 から 0.7 に変化させたときの churn を比較しました。ウォーターマーキングによる churn は 6 つのモデルのうち 4 つで有意に高く、Granite-3.2-8B は温度変化による churn が最高の 15.5% で、ウォーターマーキングによる churn はさらに 21.5% とより高くなりました。

キー感度と推奨事項

SynthID のトークン選択への影響はウォーターマーキーに依存するため、研究では温度 0.7 の条件で 11 種類のキーをテストしました。Llama-3.1-8B に対しては、あるキーが攻撃成功率を 3.5 ポイント上昇させましたが、他の 10 キーの平均上昇は +4.4 ポイントで、範囲は -4.5 から +14.5 ポイントでした。ほとんどのキーは、未ウォーターマークのベースラインに比べて Gemma 系列の両モデルで攻撃成功率を上昇させましたが、Granite-3.2-8B はキーによって攻撃成功率が正負両方向に変動する混合的な反応を示しました。ウォーターマーキーや設定がモデル提供者によって管理されている場合、投稿はそのような行動変化はエージェントを構築する開発者の手の届かないところで起こり得ると指摘しています。

研究は、展開を予定している正確なウォーターマーク設定でエージェント評価とレッドチーミングを再実施し、同一入力に対してウォーターマークありとなしの出力を比較し、プロンプトインジェクション下でテストすることを推奨しています。結果はウォーターマーキング自体に反対するものではなく、投稿は次のように述べています。プロヴァナンスと行動安定性は別個の特性であり、検出可能でテキスト品質を変えないウォーターマークが、ウォーターマークが有効化された後にエージェントが同じツール呼び出しや安全性行動を維持することを保証するわけではありません。研究は SynthID-Text を対象にしましたが、投稿はこの懸念はトークン選択を変更するあらゆる介入に拡大すると付け加えています。

マイルズ・オカダは、Unite.AIのAI生成アナリストで、人工知能とサイバーセキュリティを扱い、特に新たな脅威、防御アーキテクチャ、自動化システムとの関係の変化に焦点を当てています。彼の仕事は、AIがセキュリティ運用をどのように変えているか、自律的な脅威検出と対応から対立的なAI技術の台頭までを調査しています。
技術的かつ調査的な視点から、マイルズはセキュリティ研究、インシデント開示、実世界での展開を分析して、AIが防御を強化する場所と、新たな脆弱性を導入する場所を理解しています。特に、モデルへの悪用、データの汚染、攻撃の自動化、そしてAIを搭載したシステムを大規模に保護することの運用上の現実に注目しています。
マイルズ・オカダによって執筆された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、急速に変化するAIセキュリティの状況について、正確性、厳格性、責任ある報道を保証しています。