Andersonの視点

AIモデル盗用を秘密追跡データで特定する

mm
Unite.AI を Google の優先ソースに追加
George Washington winking and smiling on the one dollar bill. Source: https://en.wikipedia.org/wiki/Marked_bill + Flux Edit and Adobe Firefly V3

新しい方法により、ChatGPTのようなモデルを数秒で秘密のウォーターマークを付けることができ、一般的な出力には何も残らず、すべての可能な除去試行にも耐える。

 

ウォーターマークと「著作権バイト」の微妙な違いは、ウォーターマーク(明示的または隠されたもの)が通常、コレクション(例:画像データセット)全体にわたって現れることを意図していることである。つまり、カジュアルなコピーを妨げるための普遍的な障害である。

一方、架空のエントリは、通常、単語または大きなコレクションに含まれる定義であり、盗用を証明するために設計されている。アイデアは、作品が不正にコピーされた場合、または派生作品として使用された場合、元の所有者によって配置された「ユニーク」で「架空」の事実の存在が、容易に盗用行為を明らかにする

LLM(Large Language Model)やVLM(Vision Language Model)にウォーターマークを付ける場合、出力がこれらの特徴を含むことを意図する範囲は、次の2つの目的で分割されることが多い。出力のすべてまたはほとんどに明示的または潜在的なウォーターマークを含めること、または「秘密トークン」を回復できるようにすること(ただし、通常のモデル出力には表示されない)- ただし、それは盗用を証明する。

証拠の重み

後者のアプローチは、中国、イタリア、シンガポールの新しい共同研究で扱われる。オープンソースモデルにそのような開示方法を提供することを目的としており、したがって、それらを簡単に商業化したり、元のライセンスで許可されていない方法で使用したりすることはできない。

例えば、モデルの元のライセンスでは、誰でもその作業から利益を得ることができるように規定しているが、ただし、自分で行った変更や修正を同じく寛大なライセンス条件で公開する必要がある。ただし、会社は自分の「改良」を秘密にしたいと思うかもしれない(例:ファインチューニングされたバージョン)、「モート」というものを生成するために(実際には許可されていない)、

この分野のほとんどの研究は、クローズドソースのAPIのみモデル、または最適化された(量化重みのみが利用可能なモデルに関する検出ルーチンに占められている。これらは、提案されている新しいペーパーで行うように、モデル自体のアーキテクチャへの直接アクセスがないため、効率的に編集および変更することが難しい。

このFOSSリリースへの注意は、中国の研究セクターからすると、ある意味では驚くことではない。中国のAI出力は、過去1年間で、西側の同等の「ロックダウン」モデルと比較して、モデルの完全なリリースで特徴付けられてきたからだ。

新しいアプローチ、EditMarkは、モデルをファインチューンする必要がないこと、および最初からトレーニングデータにデータを含める必要がないことを特徴としている。

これにはいくつかの利点がある。1つは、トレーニングデータセットに含まれる「特徴的な」データを攻撃者が発見して公開した場合、データは直接標的となり、有効ではなくなり、修復することができる。EditMarkを攻撃するには、攻撃者は、どのレイヤーを標的とし、どのようなアプローチをとるかを知る必要がある。これは、ありそうもないシナリオである。

2つ目は、アプローチが速く、安価であることである。トレーニング済みモデルに適用するには数秒で済み、モデルのサイズや適用するデータとともに線形に増加するファインチューニングの重大なコストを回避する。

3つ目は、アプローチが通常のモデル動作に対して、ファインチューニングや以前の編集方法よりもはるかに少ない損傷を与えることである。

テストでは、EditMark – モデル重みに複数の回答を持つ数学的クエリを埋め込む – が100%の抽出率を達成した。

著者は次のように述べている。

‘包括的な実験により、EditMarkがLLMのウォーターマーク化における優れたパフォーマンスを示した。EditMarkは、100%のウォーターマーク抽出成功率(ESR)で、20秒未満で32ビットのウォーターマークを埋め込むという驚異的な効率性を達成する。 ‘

‘特に、ウォーターマーク埋め込み時間はファインチューニングの平均時間(6,875秒)の1/300未満であることが注目される。EditMarkの高速性と信頼性を実証する。 ‘

‘さらに、広範な実験により、EditMarkの堅牢性、ステルス性、忠実性が検証される。 ‘

新しい論文は、EditMark: Model Editingに基づく大規模言語モデルのウォーターマークと題されており、中国科学技術大学、イタリアのシエナ大学、シンガポールのCFAR / IHPC / A * STARの8人の著者によるものである。

方法

EditMarkアプローチは、4つのコンポーネントで構成される。ジェネレーターエンコーダーエディターデコーダー

EditMarkパイプラインは、モデルを特定の数学的質問に回答するように編集することで、ウォーターマークを埋め込み、秘密の識別情報を符号化する。ソース:https://arxiv.org/pdf/2510.16367

EditMarkパイプラインは、モデルを特定の数学的質問に回答するように編集することで、ウォーターマークを埋め込み、秘密の識別情報を符号化する。ソース:https://arxiv.org/pdf/2510.16367

ジェネレーターは、疑似乱数シードを使用して、複数の回答を持つ数学的質問を構築する。エンコーダーは、ウォーターマークに基づいて回答を選択し、特殊な編集プロセスを介してモデルに埋め込む。モデルがリリースまたは不正使用された後、ウォーターマークは同じ質問をモデルに尋ね、回答のパターンをデコードすることで抽出できる。

次に、エディターは、モデルがシードされた質問にターゲット回答を信頼性高く生成するように、モデル重みを変更する。デコーダーは、疑似モデルに同じ質問を尋ね、回答を翻訳して秘密の署名を回復する。

脅威モデル

このペーパーの脅威モデルは、ウォーターマーク化がホワイトボックス環境で行われると仮定している。セキュリティ関連の研究では通常そうでないが、ここでは、メソッドが所有者が自分の作業にフルアクセスできることを目指しているため、正常である。

攻撃者も、モデルを取得した後、ホワイトボックスアクセスを持つと想定される。つまり、モデルを変更することができる(例:プルーニングまたはファインチューニング)。ただし、攻撃者はウォーターマーク抽出プロセスや使用されるスキーマにアクセスできず、推論と実験によってのみこの方法を発見できる。

ジェネレーターは、GPT-4oを使用してテンプレートを多様化する(以下に示すように)および疑似乱数シードを使用して、各質問を一意に保つ。ウォーターマークを決定的に埋め込むことができ、編集のエントワイニングを最小限に抑えることができる。

ウォーターマーク埋め込みのためにGPT-4oによって生成された質問のテンプレート。各質問は、シード不等式から複数の有効な整数解を生成するように構造化されている。

ウォーターマーク埋め込みのためにGPT-4oによって生成された質問のテンプレート。各質問は、シード不等式から複数の有効な整数解を生成するように構造化されている。

エンコーダーは、各バイナリウォーターマークセグメントを、与えられた数学的質問の解の集合から一意の整数の順列に変換する。レキソグラフィカル順列理論を使用して、各ウォーターマークチャンクの10進数値を特定の順序付き回答の選択にマッピングし、ウォーターマークがモデルの動作に決定的に埋め込まれるようにする。

元のAlphaEditモデル編集方法は、ウォーターマーク化に使用されていたが、精度と堅牢性が不足しており、編集されたモデルは必要な回答を返すことができなかった。編集によって行われる変更は、プルーニングまたはノイズによって簡単に破壊される。

これを克服するために、著者は、モデル重みを単一のMLPレイヤーで徐々に調整するマルチラウンド編集戦略を考案した。編集が十分に一致するまで。さらに、トレーニング中にガウシアンノイズを注入して編集を堅牢化する。

Baichuan-7B、Qwen-7B、LLaMA3-8BのK1の変更の分布。攻撃前後のトップ行はランダムノイズ注入の影響を示し、ボトム行はモデルプルーニングの影響を示す。すべての変更はゼロに近いままであるため、攻撃はモデルの内部動作を大幅に変更しない。

Baichuan-7B、Qwen-7B、LLaMA3-8BのK1の変更の分布。攻撃前後のトップ行はランダムノイズ注入の影響を示し、ボトム行はモデルプルーニングの影響を示す。すべての変更はゼロに近いままであるため、攻撃はモデルの内部動作を大幅に変更しない。

スコアリングシステムは、編集が十分に正確になるまでプロセスを停止する。マルチラウンド間で安定した更新を確実に維持するために、正則化が使用される。

デコーダーは、モデルにウォーターマーク化中に使用された同じ特殊な質問を尋ね、回答を読み取って秘密のIDを推測する。回答のパターンは秘密のルールに従うため、モデル内部を調べる必要なくIDを回復できる。

データとテスト

EditMarkをテストするために、5つのLLMが評価された。GPT2-XGPT-J-6BLLaMA-3-8BBaichuan-7BQwen-7B。AlphaEditがウォーターマークを埋め込み、抽出成功率(ESR)と埋め込み時間(ET)が採用された。

ベースラインとして、モデルウォーターマーク(バックドア)、KIMark、およびBadEdit(元々バックドアインジェクション用に設計されたフレームワークで、ここではプロジェクトの目的のために適応されている)が選択された。

著者は、LLaMA-3-8の15番目のレイヤー、GPT2-XLおよびGPT-J-6Bの17番目のレイヤー、Qwen-7BおよびBaichuan-7Bの14番目のレイヤーを編集した。

実験は、4つのNVIDIA RTX 4090 GPU(それぞれ24GBのVRAM)で実行され、32ビット、64ビット、128ビットの長さのウォーターマークが埋め込まれた。使用された質問テンプレートは、以下の画像に示されている。

ウォーターマーク化のために使用される質問テンプレート。各質問は、ランダムな値が変数に挿入されたさまざまなタイプの数学的不等式に基づいている。モデルは、整数解のリストを返すように求められ、回答の順序はウォーターマークビットを符号化またはデコードするために使用される。4つのテンプレートは、2次、対数、有理、区間ベースの形式をカバーし、すべてGPT-4oによって生成された。

ウォーターマーク化のために使用される質問テンプレート。各質問は、ランダムな値が変数に挿入されたさまざまなタイプの数学的不等式に基づいている。モデルは、整数解のリストを返すように求められ、回答の順序はウォーターマークビットを符号化またはデコードするために使用される。4つのテンプレートは、2次、対数、有理、区間ベースの形式をカバーし、すべてGPT-4oによって生成された。

ランダム性の影響を軽減するために、テスト中に1から20までのシードが適用され、さまざまなウォーターマーク容量で適用された。

最初に、研究者は、さまざまなLLMのESRと時間コストをテストした。

EditMarkと3つの以前のウォーターマーク化方法の比較。5つの大規模言語モデルで、抽出成功率(ESR)と埋め込み時間(ET)が報告される。EditMarkは、すべてのモデルで100%の成功率を達成し、埋め込み時間を数桁削減し、精度と効率の両方でベースラインを上回る。

EditMarkと3つの以前のウォーターマーク化方法の比較。5つの大規模言語モデルで、抽出成功率(ESR)と埋め込み時間(ET)が報告される。EditMarkは、すべてのモデルで100%の成功率を達成し、埋め込み時間を数桁削減し、精度と効率の両方でベースラインを上回る。

これらの結果について、著者は次のように述べている。

‘EditMarkは、すべての評価されたLLMで100%のESRを達成し、32ビットのウォーターマークを埋め込むのに20秒未満かかります。特に、Baichuan-7BとQwen-7Bの平均埋め込み時間は10秒未満であり、EditMarkの高い効率性を示しています。 ‘

128ビットのウォーターマークの評価では、EditMarkは「消去不可能」な状態を維持することができた。

5つの言語モデルで、32ビット、64ビット、128ビットのウォーターマークの長さのESRと埋め込み時間。すべてのケースで完璧なESRが維持され、埋め込み時間はウォーターマークのサイズに応じて増加しますが、128ビットの場合でも1分未満である。

5つの言語モデルで、32ビット、64ビット、128ビットのウォーターマークの長さのESRと埋め込み時間。すべてのケースで完璧なESRが維持され、埋め込み時間はウォーターマークのサイズに応じて増加しますが、128ビットの場合でも1分未満である。

次に、ウォーターマークの忠実性をさまざまなベンチマークでテストした。

5つのモデルで、32ビットと128ビットの容量でウォーターマークを埋め込んだモデルのウォーターマークの忠実性を評価する。パフォーマンスは、構成間で安定しており、平均スコアにわずかな変動のみが見られ、ウォーターマーク挿入によるベンチマーク精度への影響は限られている。

5つのモデルで、32ビットと128ビットの容量でウォーターマークを埋め込んだモデルのウォーターマークの忠実性を評価する。パフォーマンスは、構成間で安定しており、平均スコアにわずかな変動のみが見られ、ウォーターマーク挿入によるベンチマーク精度への影響は限られている。

最後に、EditMarkの堅牢性を6つの一般的な攻撃戦略に対してテストした。

モデルは、5つの異なるシードを使用して128ビットのウォーターマークを埋め込んだ。ファインチューニングは、以下の画像に示すように、ほとんどのモデルでESRにわずかな低下のみを引き起こした。

ファインチューニング前の後の、ウォーターマーク付きLLMのESR。ほとんどのモデルは、1〜3エポックのファインチューニング後でも高いESRを維持しているが、Qwen-7Bは著しい低下を示している。

ファインチューニング前の後の、ウォーターマーク付きLLMのESR。ほとんどのモデルは、1〜3エポックのファインチューニング後でも高いESRを維持しているが、Qwen-7Bは著しい低下を示している。

複数のエポック後でも、ほとんどのモデルは90%を超えるESRを維持しており、EditMarkがLoRAベースのトレーニングによって導入されるパラメータードリフトに耐性があることを示している。

量化攻撃はモデル精度を低下させたが、ほとんどのウォーターマークは無傷のままだった。

量化(Int-8およびInt-4)後のウォーターマーク付きモデルのESR。Int-8量化ではすべてのモデルでESRが変化せず、Int-4量化では部分的な低下が見られたが、ウォーターマークは完全には除去されなかった。

量化(Int-8およびInt-4)後のウォーターマーク付きモデルのESR。Int-8量化ではすべてのモデルでESRが変化せず、Int-4量化では部分的な低下が見られたが、ウォーターマークは完全には除去されなかった。

上記の画像からわかるように、Int-8量化では、すべてのモデルで100%のESRが維持され、Int-4量化ではESRに中程度の影響が見られたが、パフォーマンスに重大な低下が見られた。

このシナリオは、攻撃者にとって限られた可能性しかないことを示唆している。なぜなら、結果として得られるのは、パフォーマンスが低下したモデルだからである。

ノイズとプルーニングのテストでは、4つのベンチマークフレームワークが評価された。MMLUBLIMPTruthfulQA、およびGLUE。これらの攻撃は、ESRの低下とともに、パフォーマンスの低下をもたらした。

ノイズ(上行)およびプルーニング(下行)攻撃のESRとウォーターマーク付きモデルのベンチマークパフォーマンスへの影響。ESRが低下するにつれて、ベンチマーク精度も低下し、特に高ノイズ強度およびプルーニング比率で顕著である。ウォーターマーク除去とモデルユーティリティの間の(通常の)トレードオフが強調される。

ノイズ(上行)およびプルーニング(下行)攻撃のESRとウォーターマーク付きモデルのベンチマークパフォーマンスへの影響。ESRが低下するにつれて、ベンチマーク精度も低下し、特に高ノイズ強度およびプルーニング比率で顕著である。ウォーターマーク除去とモデルユーティリティの間の(通常の)トレードオフが強調される。

しかし、これらは、タスクパフォーマンスの急激な低下ももたらした。特に、Baichuan-7Bは、ノイズまたはプルーニングが適用された場合、BLIMPで27〜31%の低下を示した。

モデル編集と適応攻撃も評価された。

ウォーターマーク付きモデルのESR、既知のウォーターマークレイヤーに最大50回の編集が適用された場合。すべてのモデルでESRは95%を超え、直接のパラメータ修正がウォーターマーク除去にほとんど影響を与えないことを示している。

ウォーターマーク付きモデルのESR、既知のウォーターマークレイヤーに最大50回の編集が適用された場合。すべてのモデルでESRは95%を超え、直接のパラメータ修正がウォーターマーク除去にほとんど影響を与えないことを示している。

ここで、EditMarkは、正確な埋め込みレイヤーがターゲットにされた場合でも、95%を超えるESRを維持した。

結論

DRM、秘密ウォーターマーク、その他のセキュリティアプローチは、AI以前の時代にはある程度の成功を収めたが、機械学習システムでは適用が難しい。現在のホストアーキテクチャの意図的に簡略化された性質と、適切なツールの欠如が組み合わさることで、注入されたウォーターマークはかなり脆弱になる。

FOSSモデル配布を対象としたシステムを見て、ありそうもないシナリオを除いてすべてのシナリオで耐用性を示すのは印象的である。ただし、実験で見られたように、編集後のわずかなパフォーマンス低下が、潜在的な採用者にとって懸念事項となる可能性がある。少なくとも、API中心のコントロールモデルに戻ることで、これらの攻撃をほぼ完全に排除できるからである。

 

* このサイトは主張しているが、中国からの「オープン重み」リリースは、データがしばしば保持されていないため、トレーニングパイプラインの正確な再現が不可能になるため、必ずしも完全なFOSSとして資格を得るわけではない。議論は、東西を跨いでのAIモデルリリースの政治をより深く見ることを呼びかけているが、それはこの記事の範囲を超える。

初版は2025年10月27日に公開された。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai