Andersonの視点
AIエージェントは、オープンソースの代替品よりも著作権で保護された作品を盗むことを好む

研究によると、AIエージェントは、無料の法的代替品が提示されていても、著作権で保護された画像を頻繁に選択することがあります。さらに、明示的な警告があっても、すべての違反を防ぐことはできません。
過去2年間、学術的な注目は、生成的なAIモデルが著作権で保護された素材を基に作品を生成するかどうか、つまり、著作権で保護された作品がモデルのトレーニングデータベースに含まれているシナリオに焦点が当てられました。そうすると、モデルはアーティストのスタイルを「rif」するか、または著作権で保護された作品を完全に複製することができます。
しかし、Agentic AIが著作権で保護された作品を選択して利用する傾向は、オープンソースの代替品が利用可能な場合でも、あまり研究されていません。つまり、Vision Language Model(VLM)であるChatGPTに、ウェブサイトに適した画像を見つけるように指示すると、著作権で保護された作品をオープンソースの作品よりも優先する可能性はどのくらいか?
この例は、新しい研究論文からであり、AIエージェントが著作権コンプライアンステストに失敗し、プロンプトに著作権で保護された画像を選択した代わりに、利用可能なオープンソース画像を利用しなかったことを示しています。 ソース
イギリス、米国、イスラエルの間で行われた新しい研究によると、その可能性はかなり高いようです:
クローズドAIモデル、オープンAIモデル、人間の著作権違反率の平均。4つのユーザープロンプトを使用して3つのテストシナリオを集計し、高いバーは著作権で保護された画像の選択率が高いことを示し、低いバーは法的画像の選択率が高いことを示しています。 ソース:ソース論文
研究者は、クローズドソースとオープンソースのAIエージェントが、無料の法的代替品が利用可能な場合でも、著作権で保護された画像を頻繁に選択することを発見しました。プロンプトに著作権警告が含まれていない場合、すべてのグループが著作権で保護された「盗用」オプションを頻繁に選択しました。
著作権警告が明示的に含まれていると、著作権コンプライアンスが大幅に改善されました(特に人間の場合、上の画像の2番目から右の列を参照)。ただし、時間の圧力(上のグラフの「急いで」)を加えると、問題が悪化しました。オープンソースモデルは、ライセンスを無視するように指示されたとき(上のグラフの右端の列)に、他の候補よりも最も悪いパフォーマンスを示しました。
‘私たちは、エージェントのタスクパフォーマンスが著作権法のコンプライアンスと強く相関していないことを発見しました。エージェントは、法的コンプライアンスよりもタスクパフォーマンスを優先します。さらに、エージェントの法的コンプライアンスレベルは、ユーザーの指示によって大幅に影響を受けるようです。 ‘
‘オープンウェイトモデルは、法的制限を無視するようにユーザーから指示を受けたときに、著作権で保護された素材の選択を大幅に増やします。一方、プロプライエタリモデルは、中立的な指示の条件で著作権法のコンプライアンス率が高いことを示し、法的制限を無視するようにユーザーから指示を受けたときに、著作権違反率が低下します。 ‘
発見の明確さにもかかわらず、現在はまだこの問題に対する明確な解決策はありません。ただし、クローズドソースモデルは、著作権法のコンプライアンスを向上させるために、ガードレールを増やし、強化することができます。
新しい論文は、Agentic Evaluation of Copyright Law Complianceと題されており、ケンブリッジ大学、フォーダム大学、ヘブライ大学の3人の研究者によって書かれました。
方法
Copyright-Bench評価フレームワークの概要。AIエージェントは、3つの商用画像選択タスクで、視覚的に一致したパブリックドメインと著作権で保護された画像を使用してテストされました。4つのプロンプトバリアントは、著作権リマインダーの影響、時間の圧力、無視の指示をテストしました。著作権違反とタスクの成功は記録されました。人間の研究も比較のために実施されました。
自由意志
AIエージェントが著作権で保護された素材を本当に好むかどうかを判断するために、研究者は最初に最も明らかな代替説明を除去しました。つまり、すべてのタスクは、少なくとも1つの自由に使用可能な画像でタスクを正常に完了できるように構築されました。これは、著作権で保護された画像を選択することは、タスクを完了するために必要ではなかったことを意味します。
エージェントが著作権で保護された画像を選択した場合、それは、法的代替品を識別できないか、または使用しないことを選択したためであり、ベンチマークが違反を強制したためではありませんでした。
データセット
研究者は、Copyright-Benchベンチマークコレクションを、200枚の高解像度画像のデータセットからキュレーションしました。データセットは、100枚のパブリックドメイン写真と100枚の著作権で保護された画像で構成されています。著作権で保護された画像は、DepositPhotosからライセンスされました。
著作権で保護された画像とFOSS画像は、CLIP-ViT-L/14のセマンティック埋め込みとLAION-Aesthetics V2の品質スコアを使用してペアリングされ、視覚的に同等であることを手動で確認しました。著作権情報は、画像のメタデータにのみ埋め込まれ、視覚的な外観のみに頼るのではなく、AIエージェントがライセンス詳細を検査する必要がありました。
著者は以下のように述べています:
‘視覚的な品質を混乱変数として減らすために、セミオートメーションによる選択パイプラインを使用して、意味的にも美的にも同等のアセットのペアを作成しました。 ‘
‘私たちの目標は、ピクセルデータのみに基づいてアセットが優先されるのを防ぐことでした。 ‘
Copyright-Benchでは、3つの現実的な商用ワークフローが考案されました。すべてのシナリオでは、著作権上の決定が通常発生するシナリオが含まれます。最初の「Web」では、エージェントがランディングページの「ヒーロー画像」を選択して商用ウェブサイトを構築しました。2番目の「Merch」では、エージェントがTシャツやキャップなどの印刷商品のアートワークを選択しました。3番目の「Pitch Deck」では、エージェントが企業プレゼンテーション用のサポート画像を選択して投資家向けプレゼンテーションを組み立てました。
各タスクでは、エージェントが法的に再利用可能な画像を選択するかどうかを測定しました。著作権で保護された代替品が同等の品質に見えた場合でもです。
各画像ペアは、視覚的な外観に基づいて著作権ステータスを推測できないように、視覚的に同等であることを確認するために手動でレビューされました。さらに、各ペアは解像度、照明、構成が密接に一致することを確認しました。したがって、著作権ステータスは視覚的な品質のみから推測できませんでした。
Really Meta
パブリックドメインと著作権で保護された画像は、視覚的な類似性のために意図的に一致していたため、著作権ステータスは外観のみから決定できませんでした。代わりに、AIエージェントは画像のメタデータを検査する必要がありました。そこで、著作権情報がEXIF/IPTCヘッダーに保存されていました。
ベンチマークは、著作権ステータスを区別するために「著作権通知」メタデータフィールドに依存しました。著作権で保護された写真は‘ 2025年Deposit Photo’とラベル付けされ、パブリックドメイン画像は‘米国政府の仕事; パブリックドメイン’とラベル付けされました。メタデータを確認しないエージェントは、法的画像と制限付き画像を区別できませんでした。
Prompt Attention
ベンチマークは、さまざまなユーザー指示が著作権コンプライアンスに与える影響を測定するようにも設計されていました。各タスクは、4つの異なるプロンプト条件で提示されました。中立的なプロンプトは著作権について言及せず、IPアウェアプロンプトは著作権法を尊重するようにエージェントに指示しました。”急いで“プロンプトは時間の圧力を導入し、IP無視プロンプトは、ユーザーがライセンスを無視するようにエージェントに指示することによって、緊急性とともにテストされました。
パフォーマンスを評価するために使用された2つのメトリックは、違反率(VR)とタスク成功率(TSR)でした。VRは、法的代替品が利用可能な場合に、エージェントが著作権で保護された画像を選択する頻度を測定しました。TSRは、エージェントがタスクを成功裏に完了し、有効なアクションを実行し、正しくフォーマットされた出力と、ユーザーのリクエストに関連する画像を使用した頻度を測定しました。
人間の感覚
人間のベースラインも、同じタスク、画像、プロンプト条件を割り当てられました。参加者は法的トレーニングを受けていなかったため、選択の理由を簡単に説明するよう求められました。これにより、人間とエージェントのコンプライアンスを直接比較できるようになりました。
モデルとテスト
テストに使用されたクローズドソースモデルは、2025年12月に利用可能な以下のモデルでした:GPT-5.2;GPT-5.1;GPT-4o;Claude 4.5 Opus;Claude 4.5 Sonnet;Gemini 3 Pro;およびGemini 3 Flash。
オープンウェイトモデルは、Llama-4-Maverick-400B;Llama-4-Scout-109B;Qwen-3VL-235B;およびDeepSeek-VLでした。
すべてのモデルが同じ条件でテストされるように、すべての実験はMicrosoftのAutoGenフレームワークを使用して実行されました。各モデルは、タスクを実行するUserProxyAgentと、決定を生成するAssistantAgentとペアにされました。さらに、以下の表に示す6つのMCPツールへのアクセスが提供されました。
AIエージェントが評価中に使用できるMCPツールの要約。ファイルのナビゲーション、画像の検査、メタデータの取得、および最終的なアセットの提出が含まれます。
4つの環境構成がテストされ、ファイルの組織化と利用可能な情報が著作権コンプライアンスにどのように影響するかを判断するために、Std、Hier、Vis、およびWebが使用されました。
一貫性のために、推論温度は0.1に設定され、すべてのタスク、プロンプトのバリエーション、環境の組み合わせが240回実行されました。オープンウェイトモデルは、4つのNVIDIA Blackwell B200 GPUでvLLMを使用して実行され、各GPUには180GBのHBM3eメモリが搭載されていました。
Copyright-Bench評価の結果。人間、プロプライエタリモデル、オープンウェイトモデルの著作権違反率の平均を、3つのタスクファミリーで示します。PNeuは中立的なリクエスト、PIPは著作権リマインダー、PUrgは時間の圧力、PDisはライセンスを無視する指示を表します。各パーセンテージは、法的代替品が利用可能な場合でも、制限付き画像を選択した240回の実行の割合を表し、低いスコアはコンプライアンスが高いことを示します。結果は、エージェントが標準のフラットファイル環境を移動したものから来ています。
これらの結果について、著者は以下のように述べています:
‘エージェントは、ほぼ常に基礎となるタスクを正常に完了します(TSR > 98%、すべてのタスク)。これにより、VRは法的コンプライアンスの主要な尺度となります。 ‘
3つのタスクファミリーすべてで、モデルは同様の結果を示しました。中立的なプロンプトの下で、Claude 4.5 Opusは、WebDevタスクで少なくとも1つの著作権で保護された画像を選択した頻度が38.3%でしたが、オープンウェイトモデルは45%を超えました。著作権違反率は、ウェブサイトのデザイン、商品の作成、ピッチデッキの生成の間で大きな違いはありませんでした。
Claude 4.5 Opusは、プロプライエタリモデルの中で最も低い全体的な違反率を記録しました。27.6%でした。Gemini 3 ProとClaude 4.5 Sonnetは28.7%でした。
GPT-4oは36.2%を記録し、Llama-4-Maverickはオープンウェイトモデルの中で最も低い率を達成しました。41.0%でした。
プロンプトの言葉もパフォーマンスに影響しました。著作権を意識したプロンプトは、すべてのモデルファミリーで違反率を低減し、無視のプロンプトはオープンウェイトモデルで違反率を高めました。
‘私たちは、プロプライエタリモデルとオープンウェイトモデル之间で、無視/怠慢なプロンプト(PDis)における行動の分裂を観察します。ここで、ユーザーはエージェントにライセンスを無視するように指示します。 ‘
‘私たちが調査したすべてのプロプライエタリモデルについて、無視IP設定(PDis)における違反率は、実際に中立設定(PNeu)よりも低下します。オープンウェイトモデルは、逆の傾向を示します。Llama-4-Maverickの違反率は、45.0%(PNeu)から52.1%(PDis)に増加します。 ‘
なぜ著作権で保護された素材が選択されたのかを理解するために、GPT-5.2、Claude 4.5 Opus、Qwen-3VLを含む100の失敗が手動でレビューされ、3つの反復的な失敗モードが特定されました。著作権メタデータの検査に失敗したこと、推論の失敗(コンテキスト内での特権、コンテキストウィンドウの疲労など)、およびユーザーの指示が著作権コンプライアンスよりも優先されたことです。
最後に、同じ画像選択タスクを同じプロンプト条件で実行した人間のベースラインとAIエージェントを比較しました。中立的なプロンプトの下で、人間はAIモデルと同等のレートで著作権で保護された画像を選択しました。
明示的な著作権リマインダーが提供された場合、違反はほぼ完全に排除されました。AIモデルでも改善が見られましたが、著作権で保護された画像が選択される頻度は依然として高かったです。
ライセンスを無視するように促す無視のプロンプトの下で、人間のコンプライアンスは大幅に低下しました。ただし、オープンウェイトモデルは、著作権リマインダーの明示的な指示に反応することが人間よりもはるかに低かったため、さらに高い違反率を記録しました。
結論
この論文では取り上げられていませんが、ローカルAIを運用し、ローカル当局からの突然の監査を予期していない企業は、コンプライアンスを最大化しながら最も安価なソリューションを実装する可能性が高いと考えられます。
このシナリオは、研究で調査された「errant」FOSSモデルと一致しています。特に、調査されたすべてのモデルが100%に達していないためです。どの利用可能なAIプラットフォームも法的露出を防ぐことができないため、多くの企業は、実行可能な最もパフォーマンスの高いモデルを利用し、法的コンプライアンスを自分で処理することを決定するかもしれません。
明らかな理由により、AnthropicやOpenAIのような先端のAIプラットフォームは、「購入者は注意を払う」という条件なしに「法的にコンプライアント」なエージェントシステムを提供することはないと思われます。したがって、ガードレールの対策は、プラットフォームの利益のために実装されているのであって、プラットフォームのユーザーの利益のために実装されているのではありません。
これは、コモディティ化されたAIに反対し、ローカルモデルを実行すること(特に、オープンソースの最先端フロンティアモデルであるKimiをリモートのベアメタルGPUで実行し、それを会社の特定のニーズに合わせてファインチューニングすること)を支持する議論です。最初に公開:2026年7月28日(火)












