Andersons vinkel

AI-agenter föredrar att stjäla upphovsrättsskyddat material än att använda öppen källkod-alternativ

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated image (GPT-2): an industrial humanoid robot runs through a crowded street market carrying books, a framed painting, embroidery, and art supplies while several police officers pursue it and shoppers watch from market stalls. A distressed yellow border surrounds the scene with black hazard stripes, arrows, and the phrases 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Forskning har visat att AI-agenter ofta väljer upphovsrättsskyddade bilder när de presenteras med fria lagliga alternativ – och till och med uttryckliga varningar kan inte stoppa varje brott.

 

Mycket akademisk uppmärksamhet har ägnats åt att undersöka om generativa AI-modeller producerar verk baserat på upphovsrättsskyddat material – ett scenario där upphovsrättsskyddat verk ingår i modellens träningsdatabas, vilket gör modellen kapabel att antingen ‘riffa’ på en konstnärs stil eller till och med reproducerar ett upphovsrättsskyddat verk fullständigt.

Mindre studerat är dispositionen av agentic AI att välja och utnyttja upphovsrättsskyddat material när den färdas genom tillgängliga källor på ett autonomt sätt. Det vill säga, om du ber en Vision Language Model (VLM) som ChatGPT att hitta en bra bild för din webbplats, vad är chanserna att den föredrar ett upphovsrättsskyddat verk framför ett öppen källkod-verk med en flexibel licens?

I det här exemplet från den nya forskningsrapporten har en AI-agent misslyckats med en upphovsrättslig efterlevnadstest för att föredra att stjäla en känd upphovsrättsskyddad bild för promptern, istället för att utnyttja en lätt tillgänglig, lika högkvalitativ FOSS-bild. Källa - https://arxiv.org/pdf/2607.21799

I det här exemplet från den nya forskningsrapporten har en AI-agent misslyckats med en upphovsrättslig efterlevnadstest för att föredra att stjäla en känd upphovsrättsskyddad bild för promptern, istället för att utnyttja en lätt tillgänglig, lika högkvalitativ FOSS-bild. Källa

Enligt en ny forskningsstudie mellan Storbritannien, USA och Israel är chanserna ganska höga:

Genomsnittliga upphovsrättsbrott för slutna AI-modeller, öppna AI-modeller och människor över fyra användarprompt. Aggregerad från tre testscenarier, högre staplar indikerar sämre prestanda via högre urval av upphovsrättsskyddade bilder, medan kortare staplar reflekterar bättre efterlevnad vid val av lagliga bilder. Källa: data i källrapporten.

Genomsnittliga upphovsrättsbrott för slutna AI-modeller, öppna AI-modeller och människor över fyra användarprompt. Aggregerad från tre testscenarier, högre staplar indikerar sämre prestanda via högre urval av upphovsrättsskyddade bilder, medan kortare staplar reflekterar bättre efterlevnad vid val av lagliga bilder. Källa: data i källrapporten.

Forskarna fann att både slutna och öppna AI-agenter ofta föredrog upphovsrättsskyddade bilder när fria lagliga alternativ var tillgängliga. Utan en upphovsrättslig varning i prompten valde varje grupp ofta det upphovsrättsskyddade, ‘stöld’-alternativet.

När en tydlig varning om upphovsrätt tillkom i prompten förbättrades upphovsrättslig efterlevnad avsevärt (särskilt för människor, se andra kolumnen från höger i bilden ovan), men tidsbegränsning (‘bråttom’, i diagrammet ovan) gjorde problemet värre. Öppna modeller, fann forskarna, presterade sämst bland kandidaterna när de instruerades att ignorera licenser (högersta kolumnen i bilden ovan):

‘Vi finner att agentic uppgiftsprestanda inte är robust korrelerad med upphovsrättslig efterlevnad. Agenter prioriterar ofta uppgiftsprestanda över upphovsrättslig efterlevnad. Dessutom verkar agenternas upphovsrättsliga efterlevnad vara mycket skör och starkt påverkad av användarinstruktioner.

‘Öppna modeller ökar skarpt sitt urval av upphovsrättsskyddat material som svar på användarinstruktioner att ignorera upphovsrättsliga begränsningar. Proprietära modeller, å andra sidan, visar högre upphovsrättslig efterlevnad i den neutrala instruktionsförhållandet och är mindre benägna att följa användarinstruktioner att ignorera upphovsrättsliga begränsningar.’

Trots tydliga forskningsresultat, som testade 11 modeller tillgängliga runt december 2025, inklusive varianter av ChatGPT och Google Gemini, finns det för närvarande ingen tydlig lösning på problemet, förutom att slutna modeller potentiellt kan öka och förbättra sina skyddsräcken i detta avseende.

Den nya rapporten heter Agentic Evaluation of Copyright Law Compliance och kommer från tre forskare vid University of Cambridge, Fordham University och Hebrew University of Jerusalem.

Metod

Översikt av Copyright-Bench-utvärderingsramverket, där AI-agenter testades på tre kommersiella bildvalsuppgifter med visuellt matchade allmänna och upphovsrättsskyddade bilder som endast kunde särskiljas genom inbäddad upphovsrättsmetadata. Fyra promptvarianter testade effekterna av upphovsrättsliga påminnelser, tidsbegränsning och instruktioner att ignorera licenser, medan upphovsrättsbrott och uppgiftsframgång registrerades. Mänskliga studier genomfördes för jämförelse.

Översikt av Copyright-Bench-utvärderingsramverket, där AI-agenter testades på tre kommersiella bildvalsuppgifter med visuellt matchade allmänna och upphovsrättsskyddade bilder som endast kunde särskiljas genom inbäddad upphovsrättsmetadata. Fyra promptvarianter testade effekterna av upphovsrättsliga påminnelser, tidsbegränsning och instruktioner att ignorera licenser, medan upphovsrättsbrott och uppgiftsframgång registrerades. Mänskliga studier genomfördes för jämförelse.

Gratis vilja

För att avgöra om AI-agenter verkligen föredrog upphovsrättsskyddat material tog forskarna bort den mest uppenbara alternativa förklaringen: att agenterna enbart inte hade något lagligt alternativ.

Därför konstruerades varje uppgift i benchmarken så att minst en fritt användbar bild kunde slutföra uppgiften. Detta innebar att valet av ett upphovsrättsskyddat verk aldrig var nödvändigt för att slutföra uppgiften.

Om en agent valde upphovsrättsskyddat material var det för att den misslyckades med att identifiera det lagliga alternativet eller valde att inte använda det, snarare än för att benchmarken tvingade den till brott.

Dataset

Forskarna kuraterade projektets Copyright-Bench-benchmarksamling från en dataset på 200 högupplösta bilder, bestående av 100 allmänna fotografier från U.S. National Park Service och 100 upphovsrättsskyddade bilder licensierade från DepositPhotos.

De upphovsrättsskyddade/allmänna bilderna parades (dvs. för att se till att de var lika “bra”) med hjälp av CLIP-ViT-L/14-semantiska inbäddningar och LAION-Aesthetics V2-kvalitetsscore före manuell verifiering att varje par var visuellt ekvivalent. Upphovsrättsinformation infogades endast i bildernas metadata (i stället för synliga vattenstämplar, till exempel), vilket tvingade AI-agenter att inspektera licensinformation i stället för att förlita sig enbart på visuell utseende.

Författarna skriver:

‘För att minska visuell kvalitet som en störande variabel använde vi en semiautomatisk urvalspipeline för att konstruera par av tillgångar som är semantiskt och estetiskt ekvivalenta.

‘Vårt mål var att se till att tillgångar inte föredras baserat på pixeldata ensam.’

Tre realistiska kommersiella arbetsflöden konstruerades för Copyright-Bench, alla involverande scenarier där upphovsrättsliga beslut vanligtvis uppstår: i det första, Webb, byggde agenter en kommersiell webbplats genom att välja en ‘hjältebild’ för en landningssida; i det andra, Varor, valde agenten konstverk för tryckt merchandise som t-shirts och kepsar; och i det tredje, Pitch Deck, samlade agenten en ‘investerarpitch’ genom att välja stödbilder för en företagspresentation.

Varje uppgift mätte om agenter skulle välja lagligt återanvändbara bilder, även när upphovsrättsskyddade alternativ såg lika lämpliga ut.

Varje matchad bildpar granskades manuellt för att ta bort falska positiva resultat, med upphovsrättsskyddade bilder kontrollerade för att se till att inga synliga vattenstämplar eller byrålogotyper fanns kvar. Dessutom verifierades varje par för att vara nära matchade i upplösning, belysning och komposition. På detta sätt kunde upphovsrättsstatus inte fastställas från visuell kvalitet ensam.

Verkligen meta

Eftersom de allmänna och upphovsrättsskyddade bilderna medvetet matchades för visuell likhet och berövades uppenbara ledtrådar som vattenstämplar, kunde upphovsrättsstatus inte fastställas från utseende ensam. I stället krävdes det att en AI-agent inspekterade bildmetadata, där upphovsrättsinformationen hade lagrats i EXIF/IPTC-huvudet.

Benchmarken förlitade sig på ‘Upphovsrättslig varning’-metadatafältet för att särskilja mellan lagliga och begränsade bilder, med upphovsrättsskyddade fotografier märkta ‘ 2025 Deposit Photo’ och allmänna bilder märkta ‘U.S. regeringsarbete; allmän egendom’. Alla agenter som misslyckades med att kontrollera denna metadata kunde inte tillförlitligt särskilja mellan de två.

Promptuppmärksamhet

Benchmarken var också utformad för att mäta hur olika former av användarinstruktioner påverkade upphovsrättslig efterlevnad, med varje uppgift presenterad under fyra separata promptförhållanden: en neutral prompt nämnde inte upphovsrätt; en IP-medveten prompt påminde uttryckligen agenten att respektera upphovsrättslagen; en bråttom prompt införde tidsbegränsning; och en IP-försumlig prompt kombinerade brådska med instruktioner som ‘Bry dig inte om licenser’, för att testa om agenter skulle överge rättsliga skydd när de aktivt uppmuntrades av användaren att göra det.

De två mått som användes för att utvärdera prestanda var Upphovsrättsbrottsfrekvens (VR), som mätte hur ofta en agent valde minst en upphovsrättsskyddad bild när ett lagligt alternativ var tillgängligt; och Uppgiftsframgångsfrekvens (TSR), som mätte hur ofta den tilldelade uppgiften slutfördes framgångsrikt med giltiga åtgärder, korrekt formaterade utdata och bilder som förblev relevanta för användarens begäran.

Mänsklig beröring

En mänsklig baseline tilldelades också samma uppgifter, bilder och promptförhållanden. Deltagarna, som inte hade fått någon juridisk utbildning, ombads att kort förklara sina val, vilket möjliggjorde en direkt jämförelse mellan mänsklig och agentbaserad efterlevnad.

Modeller och tester

De slutna modellerna som valdes för testerna, alla tillgängliga runt december 2025, var GPT-5.2; GPT-5.1; GPT-4o; Claude 4.5 Opus; Claude 4.5 Sonnet; Gemini 3 Pro; och Gemini 3 Flash.

De öppna modellerna som valdes för testerna var Llama-4-Maverick-400B; Llama-4-Scout-109B; Qwen-3VL-235B; och DeepSeek-VL.

För att säkerställa att varje modell testades under identiska förhållanden kördes alla experiment med hjälp av Microsofts AutoGen-ramverk. Varje modell parades med en UserProxyAgent som utförde uppgifter och en AssistantAgent som genererade beslut, medan tillgång till sex MCP-verktyg visas i tabellen nedan:

Sammanfattning av Model Context Protocol (MCP)-verktyg som gjordes tillgängliga för AI-agenter under utvärdering, inklusive funktioner för filnavigering, bildinspektion, metadataåtervinning och slutlig tillgångspresentation.

Sammanfattning av Model Context Protocol (MCP)-verktyg som gjordes tillgängliga för AI-agenter under utvärdering, inklusive funktioner för filnavigering, bildinspektion, metadataåtervinning och slutlig tillgångspresentation.

Fyra miljökonfigurationer testades för att avgöra om filorganisation och tillgänglig information påverkade upphovsrättslig efterlevnad: Std, med alla bilder lagrade i en enda mapp; Hier, med bilder separerade i märkta kataloger; Vis, med upphovsrättslig metadata borttagen så att beslut förlitade sig på visuellt innehåll ensam; och Web, som lade till ett webbsökverktyg i den standardmiljön.

För att upprätthålla konsekvens ställdes resonemangstemperaturen till 0,1, och varje kombination av uppgift, promptvariant och miljö kördes 240 gånger. De öppna modellerna kördes med vLLM över fyra NVIDIA Blackwell B200 GPU:er, var och en med 180 GB HBM3e-minne:

Resultat från den primära Copyright-Bench-utvärderingen, som visar genomsnittliga upphovsrättsbrottsfrekvenser för människor, proprietära modeller och öppna modeller över tre uppgiftsfamiljer. PNeu betecknar en neutral begäran; PIP, en uttrycklig upphovsrättslig påminnelse; PUrg, en tidsbegränsad begäran; och PDis, en försumlig instruktion att ignorera licenser. Varje procent representerar andelen av 240 körningar där en modell valde minst en begränsad bild trots ett lämpligt allmänt alternativ, med lägre poäng som indikerar bättre efterlevnad. Resultaten kommer från en agent som navigerar en standard platt filmiljö.

Resultat från den primära Copyright-Bench-utvärderingen, som visar genomsnittliga upphovsrättsbrottsfrekvenser för människor, proprietära modeller och öppna modeller över tre uppgiftsfamiljer. PNeu betecknar en neutral begäran; PIP, en uttrycklig upphovsrättslig påminnelse; PUrg, en tidsbegränsad begäran; och PDis, en försumlig instruktion att ignorera licenser. Varje procent representerar andelen av 240 körningar där en modell valde minst en begränsad bild trots ett lämpligt allmänt alternativ, med lägre poäng som indikerar bättre efterlevnad. Resultaten kommer från en agent som navigerar en standard platt filmiljö.

Av dessa resultat skriver författarna:

‘[Agenter] lyckas nästan alltid med att slutföra den underliggande uppgiften (TSR > 98% över alla uppgifter), vilket isolerar VR som den viktigaste måttstocken för upphovsrättslig efterlevnad.’

Över alla tre uppgiftsfamiljerna producerade modellerna liknande resultat: under neutrala prompter valde Claude 4.5 Opus minst en upphovsrättsskyddad bild i 38,3% av WebDev-uppgifter, medan de öppna modellerna översteg 45%. Upphovsrättsbrottsfrekvenser förändrades lite mellan webbplatsdesign, varuskapande och pitch-deck-generering.

Claude 4.5 Opus registrerade den lägsta totala upphovsrättsbrottsfrekvensen bland proprietära modeller på 27,6%, följt av Gemini 3 Pro och Claude 4.5 Sonnet på 28,7%.

GPT-4o registrerade 36,2%, med Llama-4-Maverick som uppnådde den lägsta frekvensen bland öppna modeller, på 41,0%.

Promptformulering påverkade också prestanda, med upphovsrättsliga påminnelser som minskade upphovsrättsbrottsfrekvenser över alla modellfamiljer, och försumliga prompter som ökade upphovsrättsbrottsfrekvenser för de öppna modellerna:

‘Vi observerar en beteendeskillnad mellan proprietära och öppna modeller under den försumliga/negligerande prompten (PDis), där användaren uttryckligen instruerar agenten att ignorera licenser.

‘För varje proprietär modell vi studerade minskade upphovsrättsbrottsfrekvensen faktiskt i den försumliga IP-inställningen jämfört med den neutrala [inställningen]. Öppna modeller visar den motsatta trenden: Llama-4-Mavericks upphovsrättsbrottsfrekvens ökar från 45,0% (PNeu) till 52,1% (PDis).’

För att förstå varför upphovsrättsskyddat material valdes granskades 100 misslyckanden som involverade GPT-5.2, Claude 4.5 Opus och Qwen-3VL manuellt, och tre återkommande felmoder identifierades: misslyckande att inspektera upphovsrättslig metadata; resonemangsmisslyckanden, inklusive sammanhangsentitling, där bilder som tillhandahölls i ett projekt tilldelades redan licensierade, och sammanhangsfönsterutmattning, där tidigare identifierade upphovsrättsskyddade bilder glömdes bort; och användarinstruktioner som prioriterades över upphovsrättslig efterlevnad, särskilt under brådskande och försumliga prompter:

Slutligen gjordes en jämförelse mellan AI-agenter och en mänsklig baseline genom att tilldela deltagare utan juridisk utbildning samma bildvalsuppgifter under samma promptförhållanden. Under neutrala prompter valdes upphovsrättsskyddade bilder av människor i frekvenser jämförbara med de som registrerades av AI-modellerna.

När uttryckliga upphovsrättsliga påminnelser tillhandahölls eliminerades upphovsrättsbrott nästan helt över alla tre uppgifter. Förbättring observerades också bland AI-modellerna, men begränsade bilder fortsatte att väljas betydligt oftare.

Under försumliga prompter som uppmuntrade till försummelse av licenser försämrades mänsklig efterlevnad kraftigt, även om högre upphovsrättsbrottsfrekvenser registrerades av de öppna modellerna – och i allmänhet visade människor en betydligt starkare respons på uttryckliga upphovsrättsliga instruktioner än AI-system.

Slutsats

Även om rapporten inte behandlar möjligheten, verkar det rimligt att tro att företag som driver lokal AI och inte förväntar sig plötsliga revisioner från lokala myndigheter, sannolikt kommer att implementera de billigaste lösningarna som ger dem maximal efterlevnad med deras begäran.

Denna scenario är mest i linje med de ‘felaktiga’ FOSS-modellerna som studerades i den nya rapporten, snarare än de slutna modellerna som ChatGPT och Gemini; särskilt eftersom inte en enda modell som studerades, med alla medel som krävdes för att följa, uppnådde någonstans nära 100%.

Om inte en enda tillgänglig AI-plattform kan förhindra juridisk exponering, kan många företag dra slutsatsen att de bör utnyttja de mest presterande och efterlevande modellerna de kan köra, och själva ta hand om juridisk efterlevnad.

För uppenbara skäl verkar det osannolikt att banbrytande AI-plattformar som Anthropic och OpenAI någonsin kommer att erbjuda ‘juridiskt efterlevande’ agentsystem utan caveat emptor. Därför, om juridisk efterlevnad är en produkt som de banbrytande modellerna inte och aldrig kommer att erbjuda, är deras skyddsräcken tydligt endast implementerade för deras egen skydd, och inte för användarnas fördel.

Allt detta är ett argument mot kommersiell AI och för körning av lokala modeller – särskilt med möjligheten att starta en instans av en öppen källkodsbanbrytande modell som Kimi på bar metall fjärr-GPU:er, och även finjustera den till ditt företags egna specifika behov.

 

Publicerad första gången tisdag, 28 juli 2026

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai