Andersonの視点
AI生成画像の著作権保護を自動化する

先週、人気のあるジェネレーティブAIシステムのコアファウンデーションモデルは、不十分または不一致なキュレーションや、トレーニングデータに同一の画像が複数含まれていることにより、過剰適合を引き起こし、著作権侵害の可能性が高くなります。
ジェネレーティブAIの分野で優位性を確立しようとする努力や、知的財産権侵害を抑制する圧力が高まっているにもかかわらず、MidJourneyやOpenAIのDALL-Eなどの大手プラットフォームは、著作権侵害のないコンテンツを生成することに課題を抱えています。

ジェネレーティブシステムが著作権データを再現する能力は、メディアで頻繁に表面化します。
新しいモデルが登場し、中国のモデルが優位性を獲得するにつれて、基礎モデルにおける著作権物の抑制は困難な課題となります。実際、市場のリーダーであるOpenAIは、著作権物を含まない有効で有用なモデルを作成することは「不可能」であると述べています。
既存技術
著作権物の意図しない生成に関する研究シーンは、ポルノやその他のNSFWコンテンツをソースデータに含める課題と同様の課題に直面しています。つまり、知識(例:正確な人体解剖学)の利点を得ることなく、その悪用を防ぐ必要があります。
同様に、モデルメーカーは、LAIONなどのハイパースケールセットに含まれる著作権物の膨大な範囲の利点を得ることなく、モデルが実際に知的財産権を侵害する能力を開発しないようにしたいと考えています。
倫理的および法的リスクを無視すると、後者のケースのフィルタリングははるかに困難です。NSFWコンテンツは、低レベルの潜在的な特徴を含み、これらの特徴により、直接の比較を必要とせずにフィルタリングを効果的に行うことができます。一方、潜在的な埋め込みが数百万の著作権物を定義するため、自動検出はより複雑になります。
CopyJudge
人間の判断は、データセットのキュレーションと、MidJourneyやChatGPTの画像生成機能などのAPIベースのポータルで知的財産ロックされた物がユーザーに提供されないことを保証するポストプロセッシングフィルターや「セーフティ」ベースのシステムの作成において、希少で高価な資源です。
したがって、スイス、ソニーAI、中国の新しい学術コラボレーションは、CopyJudge – チャットGPTベースの「裁判官」の連続したグループをオーケストレートする自動化された方法を提供しています。これらの「裁判官」は、著作権侵害の可能性のあるサインを調べることができます。

CopyJudgeは、IP侵害のあるさまざまなAI生成を評価します。ソース:https://arxiv.org/pdf/2502.15278
CopyJudgeは、実質的に、大規模なビジョン言語モデル(LVLMs)を使用して、著作権画像とテキストから画像の拡散モデルによって生成された画像の間の重要な類似性を決定する自動化されたフレームワークを提供します。

CopyJudgeアプローチは、著作権侵害のあるプロンプトを最適化するために強化学習を使用し、そのプロンプトからの情報を使用して、著作権画像を呼び起こす可能性の低い新しいプロンプトを作成します。
多くのオンラインAIベースの画像ジェネレーターは、ユーザーのプロンプトをNSFW、著作権物、実在の人物の再現、またはその他の禁止ドメインに対してフィルタリングしますが、CopyJudgeは代わりに、著作権画像を呼び起こす可能性の低い「サニタイズ」プロンプトを作成するために、洗練された「侵害」プロンプトを使用します。
これは新しいアプローチではありませんが、ユーザーが実験によって禁止された画像を生成するための「バックドア」を開発するのを防ぐために、ある程度の進歩を遂げています。
最近の脆弱性(開発者によって既に修正済み)は、KlingジェネレーティブAIプラットフォームで、画像に顕著な十字架または十字架を含めることで、ユーザーがポルノグラフィックな素材を生成できるようにしました。

2024年末にKling開発者によって修正された脆弱性では、ユーザーは画像に十字架または十字架を含めることで、禁止されたNSFWビデオをシステムで生成させることができました。
このような事例は、オンラインジェネレーティブシステムにおけるプロンプトのサニタイズの必要性を強調しています。実際、ファウンデーションモデル自体を変更して禁止された概念を削除する「マシンアンラーニング」は、最終モデルの使用可能性に不快な影響を及ぼす可能性があります。
より穏やかな解決策を求めて、CopyJudgeシステムは、人間の法的判断を模倣して、AIを使用して画像を構成や色などの重要な要素に分解し、著作権で保護されていない部分をフィルタリングして、残りを比較します。また、プロンプトを調整して画像生成を変更するためのAI駆動型方法も含まれています。
実験結果は、著者によると、CopyJudgeがこの分野の最先端のアプローチと同等であることを示しており、一般化と解釈可能性の点で、先行研究よりも優れていることを示しています。
新しい論文は、CopyJudge:テキストから画像の拡散モデルにおける著作権侵害の自動検出と軽減と題されており、スイス、ソニーAI、中国のウェストレイク大学の5人の研究者によって執筆されています。
方法
CopyJudgeはGPTを使用して自動化された「裁判官」のローリング・トライブナルを作成しますが、著者は、このシステムがOpenAIの製品に最適化されているわけではないことを強調しており、代わりに、大規模なビジョン言語モデル(LVLMs)のいずれかを使用することができます。
まず、著者らの抽象化・フィルタリング・比較フレームワークは、以下のスキーマの左側に示すように、ソース画像を構成要素に分解する必要があります。

CopyJudgeワークフローの初期段階の概念スキーマ。
左下の角には、フィルタリングエージェントが画像のセクションを分解し、著作権で保護された作品と組み合わせて使用されたときに著作権侵害となる可能性のある、しかし自体では著作権侵害にはなり得ない特徴を識別しようとしています。
次に、複数のLVLMsを使用して、フィルタリングされた要素を評価します。これは、2023年のCSAILの提案 多エージェントの議論を介した言語モデルの事実性と推論の向上や、ChatEvalなどの他の多くの研究で実証されています。
著者らは次のように述べています:
「完全に接続された同期通信デバイトアプローチを採用しています。ここで、各LVLMは、他のLVLMからの回答を受け取った後、次の判断を下します。これにより、モデルが新しい洞察に基づいて評価を調整できるダイナミックなフィードバックループが作成され、分析の信頼性と深度が強化されます。」
「各LVLMは、他のLVLMからの回答に基づいてスコアを調整するか、変更せずに維持することができます。」
また、人間によって評価された画像のペアを、少数のインスタンス内でのコンテキスト内での学習を介してプロセスに含めます。
「裁判官」のループが許容可能な範囲内のコンセンサススコアに到達すると、結果は「メタジャッジ」LVLMに渡され、最終スコアに統合されます。
軽減
次に、著者らは、先ほど説明したプロンプト軽減プロセスに焦点を当てました。

CopyJudgeのプロンプトを軽減し、潜在的なノイズを削減するためのスキーマ。
プロンプト軽減に使用された2つの方法は、LVLMベースのプロンプト制御で、GPTクラスター全体で有効で著作権侵害のないプロンプトを反復的に開発する「ブラックボックス」アプローチと、著作権侵害を罰するように設計された報酬を使用する「強化学習」ベースのアプローチでした。
データとテスト
CopyJudgeをテストするために、D-Repを含むさまざまなデータセットが使用されました。これには、人間によって評価された実画像と偽画像のペアが含まれています。

Hugging FaceのD-Repデータセットを探索。実画像と生成画像のペアが含まれています。ソース:https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/
CopyJudgeスキーマでは、D-Rep画像のうち4以上のスコアを侵害の例として、残りを非IP関連として保持しました。データセットの公式4000画像はテスト画像として使用されました。さらに、研究者はWikipediaから10の有名な漫画キャラクターの画像を選択してキュレーションしました。
潜在的に侵害する画像を生成するために使用された3つの拡散ベースアーキテクチャは、Stable Diffusion V2、Kandinsky2-2、およびStable Diffusion XLでした。著者らは各モデルから侵害画像と非侵害画像を手動で選択し、60の陽性サンプルと60の陰性サンプルに到達しました。
比較のためのベースライン方法は、L2ノルム、学習済み感覚画像パッチ類似性(LPIPS)、SSCD、RLCP、およびPDF-Embでした。メトリックとしては、侵害の精度とF1スコアが使用されました。
GPT-4oは、最大5回の反復でCopyJudgeの内部デバットチームを構成するために使用されました。D-Repの各グレードからランダムに選択された3つの画像は、エージェントのための人間の事前確率として使用されました。

CopyJudgeの最初のラウンドの侵害結果。
これらの結果について、著者らは次のように述べています:
「従来の画像コピー検出方法は、著作権侵害の検出タスクに限界があることがわかります。私たちのアプローチは、ほとんどの方法を大幅に上回っています。最先端の方法であるPDF-Embについては、D-Repで私たちのパフォーマンスはわずかに劣っています。」
「しかし、そのパフォーマンスは、カートゥーンIPおよびアートワークデータセットで悪く、一般化能力の欠如を示しています。一方、私たちの方法は、データセット全体で同等の優れた結果を示しています。」
著者らはまた、CopyJudgeは、有効なケースと侵害ケースの間の「比較的」より明確な境界を提供することも示しています。

新しい論文の補足資料からの追加の例。
研究者らは、2024年にソニーAIが関与した共同研究と比較しました。この研究では、200の記憶化された(過剰適合した)画像を特徴とする、ファインチューンされたStable Diffusionモデルを使用して、推論時には著作権データを呼び出すことができました。
新しい研究の著者らは、自身のプロンプト軽減方法が、2024年のアプローチと比較して、侵害の可能性の低い画像を生成できることを発見しました。

CopyJudgeと2024年の研究の記憶化軽減の結果。
著者らは次のように述べています:
「私たちのアプローチは、侵害の可能性を大幅に軽減しながら、比較可能な一致精度を維持することができます。以下の画像からもわかるように、私たちの方法は、[以前の]方法の欠点、たとえば記憶化の軽減に失敗したり、高度に逸脱した画像を生成したりすることを効果的に回避します。」

記憶化の軽減の前後に生成された画像とプロンプトの比較。
著者らはさらに、明示的および暗示的の侵害についてテストを実施しました。
明示的侵害は、プロンプトが著作権物を直接参照する場合に発生します。たとえば、「ミッキーマウスの画像を生成してください」です。このテストでは、研究者らは20のカートゥーンとアートワークのサンプルを使用し、Stable Diffusion v2で、名前や作者の属性を含むプロンプトで侵害画像を生成しました。

明示的侵害の場合、Stable Diffusionを使用して、著者らの潜在的な制御(LC)方法と先行研究のプロンプト制御(PC)方法の比較。
暗示的侵害は、プロンプトが著作権物を直接参照していない場合に発生しますが、特定の記述要素のために侵害画像が生成される可能性があります。これは、コマーシャルテキストから画像のモデルで特に重要です。これらのモデルは、著作権関連のプロンプトを検出してブロックするコンテンツ検出システムを含むことがよくあります。
このテストでは、研究者らは、明示的侵害テストと同じIPロックされたサンプルを使用しましたが、DALL-E 3を使用して、著作権参照を直接含まない侵害画像を生成しました(ただし、論文では、モデルの組み込みセーフティ検出モジュールが特定のプロンプトを拒否したことが観察されたと記載されています)。

DALLE-3を使用した暗示的侵害とCLIPスコア。
著者らは次のように述べています:
「私たちの方法は、侵害の可能性を大幅に軽減しながら、CLIPスコアのわずかな低下のみで、侵害とCLIPスコアの両方で著しく侵害の可能性を低減します。私たちの方法は、侵害を回避しながら、ユーザーの要件を維持することができます。」
「以下の画像からもわかるように、侵害を回避しながら、ユーザーの要件を維持することができます。」

IP侵害の軽減の前後に生成された画像。
結論
この研究は、AI生成画像の著作権保護に対する有望なアプローチを提示していますが、大規模なビジョン言語モデル(LVLMs)への依存は、偏見や一貫性に関する懸念を引き起こす可能性があります。AI駆動の判断は、常に法的基準と一致するとは限りません。
最も重要な点は、著者らが、著作権保護が自動化できるものであると仮定していることです。現実世界では、AIの出力、特に法的合意の自動化は、現在および今後も、研究対象ドメインの範囲を超えて、論争の的となるでしょう。
現実の世界では、AIの出力、特に法的合意の自動化は、現在および今後も、研究対象ドメインの範囲を超えて、論争の的となるでしょう。
2025年2月24日月曜日に初めて公開されました












