Andersonの視点
AIにおけるIP洗浄方法

知的財産権を侵害するAIの使用に対する法的責任が課せられる可能性がある場合、知的財産権の使用を隠蔽するためのいくつかの方法があります。
意見 現在進行中のジェネレーティブAIの革命は、19世紀以来、どの変革的な技術開発にも伴わなかった法的危険性を伴っています 。
3〜4年前まで、機械学習研究コミュニティは、IP保護された資料を利用して新しいシステムを開発することを暗黙の了解で認められていました。ただし、これらのシステムはまだ十分に成熟していなかったり、商業的に実用的なものではなかったため、結果はあらゆる意味で学術的なものでした。
その期間中に、拡散ベースの大規模言語モデル(LLM、例:ChatGPT、Claude)とビジョン言語モデル(VLM、例:Sora)の新しい世代の突然の成功は、これらの抽象的で以前は「無害」と考えられていた研究分野が商業的に実用的なものになったことを示し、知的財産権の使用について「無料パス」の終わりを意味しました。
今後、権利者は、著作権で保護されたまたはその他の方法で保護されたデータで部分的にまたは全的にトレーニングされたAIシステムの成果に対して利益を求めることになり、法的な訴訟の連続が起こりますが、これを追跡するには一定の努力が必要です。

米国で提起された訴訟に限定された新しい訴訟は、米国とその他の地域で激しいペースで登場しています。 ソース
「無料ランチ」の義務付け
AIを提供するためのインフラストラクチャへの現在の財政的コミットメントは、現在進行中であり、いくつかの声によって、知的財産権を侵害するAIを経済社会に根付かせるための試みとみなされています。そうすれば、AIは「失敗するには大きすぎる」だけでなく、「訴訟によって混乱するには強力すぎる」となるでしょう。
この一般的な考え方に向けて、アメリカ合衆国大統領は、政策として、彼の見解を掲げています。つまり、「あなたが読んだり研究したりしたすべての記事、書籍、またはその他のものに対して支払わなければならない場合は、成功したAIプログラムを持つことができない」ということです。
本当にそうでしょうか。西洋の産業革命時代に類似したものはありません。これは、伝統的なアメリカの訴訟と補償の文化に大きく反する動きです。最も近い類似の立場は、医薬品特許の有効期間が20年で期限切れになること(これ自体が頻繁に攻撃を受けています)と、公共の場でのプライバシーの期待の制限です。
しかし、時勢は変わります。現在の知的財産権保護に対する「強制的な所有権」の傾向が後退したり、後に逆転したりしないことを保証することはできません。したがって、AIシステムの開発と、AIを動かす議論の的となっているトレーニングデータの扱いにおいて、補助的なアプローチが一般的になっています。
代理データセット
これらのアプローチの1つは、トレントのリストを提供するサイトが、実際には何もコンテンツをホストしていないという(必ずしも成功した)防御策に似ています。
これらのコレクションは、大量の画像やビデオデータを保存して提供する必要性を排除するだけでなく、迅速な更新(例:著作権所有者の要望に応じて資料を削除する)やバージョニングを可能にします。
トレントは、IP保護された資料を見つけるためのサインポストに過ぎないのと同様に、影響力のあるデータセットの多くは、実際には存在するデータへの「ポインターのリスト」です。エンドユーザーがこれらのリストを使用して独自のデータセットのダウンロードリストを作成したい場合は、それはカーセルの責任ではなく、ユーザーの責任となります。
そのようなデータセットの1つは、Google ResearchのConceptual 12Mです。これは画像にキャプションを提供しますが、画像が存在する(またはカーションの際に存在した)ウェブ上の場所へのポインタのみを提供します:

Google ResearchのConceptual 12Mのキュレーションからの2つの例。 ソース
別の著名な例は、LAIONデータセットです。これは、2022年に安定拡散ジェネレーティブシステムの出現を可能にしました。最初のオープンソースジェネレーティブ画像をエンドユーザーに提供するフレームワークでした。独自のシステムがこのサービスを商業的に独占するように見えたときです:

LAIONプロジェクトのバリアントの1つ。現代の著作権で保護されたアートワークを特集しています。 ソース
ビデオプレミアム
ビデオデータセットは、データセットを単一のダウンロード可能なコレクションにまとめるために必要なストレージデータのボリュームが大きいため、「代理」アプローチまたはポインタアプローチのより強いケースを提示します。
ただし、画像とビデオの両方の場合、ダウンロード可能なソースURLは、トレーニングプロセス中に抽出された埋め込みや機能を含む、トレーニングプロセス中に抽出された要約またはノードなどの適用可能なコンテンツを含むことがあります。
オープンとクローズ
最後に、このカテゴリでは、オープンVFXデータはクローズドプラットフォームで生成され、結果のデータセットが公開および利用可能になることがあります。なぜこれが起こるのか、または外部から「洗浄された」データセットが依頼されたのかを考えるのは妥当です。
「世代間の洗浄」の1つの例は、Omni-VFXデータセットです。これには、Open-VFXデータセットからの多くのデータポイントが含まれています。Open-VFXデータセット自体は、PikaやPixVerseなどのクローズドおよびセミクローズドプラットフォームを参照しています。
正直に言うと、Omni-VFXはほとんど努力していません:

オープンソースのOmni-VFXデータセットには、見慣れた顔が含まれています。 ソース
祖先の責任
IP洗浄の2番目の主要なアプローチは、著作権で保護された資料を1つまたは複数の段階で使用することです。このカテゴリの1つの方法は、合成データを使用することです。これは、どこかの段階で著作権で保護されたデータでトレーニングされています。特に、合成データが本物に近い結果を得ることができる場合、著作権で保護された作品は、一般的な世界モデルや専門化されていないモデルによって推測または近似することができない変換を提供します。
これは、特にジェネレーティブビデオシステムが「不可能な」イベントや「視覚効果」(VFX)に分類されるイベントを生成する必要がある場合に、断言できます。
実際、このトピックを考えるきっかけとなったのは、さまざまな視覚効果(例:身体のあり得ない部分からレーザービームを生成する)を「抽象化」する能力を提供する最新の研究論文のシリーズでした。これらの効果は、カスタム依頼されたまたは「オープンソース」のVFXクリップ(マーベルシネマティックユニバースの非常に高価なVFXショットよりも)でトレーニングされています:
EffectMakerウェブサイトからの例。ソースクリップ(左端)の「アクション」がソース画像(中央)に適用されます。 ソース
上記の例は、EffectMakerプロジェクトのプロジェクトページから来ています。EffectMakerは、ビデオクリップからVFXダイナミクスを抽出して新しいクリップに転送することを目指す、今年出た最初のプロジェクトではありません。実際、これはAIのVFX研究で、すでに別のサブタスクになっています*。
メディアの大手企業であるマーベルは、知的財産権に関する法的な訴訟で勝利する可能性が高いことがわかっているため、視覚効果会社やスタートアップは、ジェネレーティブVFXフレームワークが他の会社の企業の知的財産権から自由であることを保証するために、多大な努力を払っています。
メタは、2026年の冬に、VFXアーティストに、ハリウッドレベルの視覚効果ショットを出力するAIモデルをトレーニングする仕事を、多大な報酬で提供していることが、r/vfxサブレディットで報告されています。さまざまな投稿で報酬は指定されていませんでしたが、1つの投稿ではそれを「退職金」と表現しました。
お金の行方
しかし、メタのような企業が、本当の意味で多様で豊富な「アドホック」VFXショットに対してどれだけのお金を支払う用意があるのか、疑問に思うでしょう。1つのブロックバスター映画のVFXショットの平均コストは、約42,000ドルです。多くのショットはさらに高価です。
さらに、カスタムVFX生成AIモデルは、人気のある要求に応じて、最も人気のある、そして最も高価な映画のジャンルの標準的な効果トロペを提供することになるでしょう。
「残骸」のVFXプロフェッショナルが、すでに存在する映画カタログで作業したショットを再現することになるという点では、カスタムVFXデータセットの作業は模倣的なものであるという点を除いて、当然の帰結です†。
また、これらの高価な新しいサンプルが「ゼロから」新しいアーキテクチャでトレーニングされるという保証はありません。
実際、これらの再現が、LoRAsなどの付加モジュールに流れ込まれる場合、プロセスは、ベースモデルが「IPクリーン」である限り、防御可能です。ただし、多くのベースモデルはそうではありません。
同様に、プロセスがファインチューニングなどの「ハイブリッド」テクニックを使用する場合、視覚効果の価値は、モデル、事前確率、または古いコレクションまたはモデルからの埋め込みに依存する場合、作業の独自性は、挑戦にさらされる可能性のある、表面的なものです。
不可能な使命
VFXの出力のドメインは、AIデータセットにおける潜在的なIP洗浄の観点から特に興味深いケーススタディです。視覚効果ショットは、オープンソースの代替手段がない「不可能な」ものを表現することがよくあります。
例えば、ビルの爆破は、さまざまなパブリックドメインまたはその他の安価なストッククリップからジェネレーティブモデルにトレーニングできますが、人間のレーザービームを生成するモデルをトレーニングしたい場合は、VFXクリップでトレーニングする必要があります。そうでない場合は、盗まれたり依頼されたりする必要があります。そうしたことは、他の場所では起こりません。
他の種類の自然災害、例えば劇的な洪水の場合、ドラマチックなPOVの災害イベントを再現できる実世界のソース資料は、いくつかの例外を除いて、利用できない可能性があります。したがって、災害の「クールなビュー」は、実世界のデータセットでは稀です。災害を生成できるAIモデルは、情報を別の場所から取得した可能性があります。
ほとんどのAIタスクフローは、IP保護されたデータの利点を隠蔽するために、同じレベルの努力を必要としません。
結論:絡み合ったウェブ
ジェネレーティブAIを広範囲にわたって、そして長期間にわたって使用したことがある人だけが、AIシステムがトレーニングデータに相当する例がない場合、複数の概念を組み合わせるのに苦労することを直感的に理解できるでしょう。
この制限は、エンタングルメントとして知られており、トレーニングされた概念のさまざまな側面が、関連する要素とともにクラスター化する傾向があり、代わりに、ユーザーが望む新しい構成に配置できる、レゴブロックのようなビルディングブロックに分解されません。
エンタングルメントは、すべての主要な現在のgenAIフレームワークの特徴である拡散ベースのアプローチのために、ほぼ不可避的なアーキテクチャの重力ウェルです。ただし、トレーニングされた概念をよりうまく離散化して、よりうまく組み合わせることができる新しいアプローチが、次の数年間に登場する可能性があります。そうすれば、より少ないヒントを残すことになります。
* 私はEffectMakerに対して非難をしていませんが、AIビデオ研究で出現している新しい実践についてコメントしています。
† これらのショットは、この種の映画で金銭を生み出し、引き続き生み出しています。
2026年3月16日月曜日初版












