Andersons vinkel
IP-Vaskemetoder i AI

Hvis der kommer en juridisk afregning over brugen af immaterielle rettigheder i trÃĶning af AI, er der ogsÃĨ flere metoder til at skjule sÃĨdan brug.
Â
Opinion Den nuvÃĶrende, hurtigt fremadskridende revolution i generativ AI udvikler sig i den mest juridisk usikre omgang, der har ledsaget nogen transformerende teknologisk udvikling siden det nittende ÃĨrhundrede.
Indtil 3-4 ÃĨr siden nÃļd maskinlÃĶringsforskningsfÃĶllesskabet en implicit (ofte eksplicit) tilladelse til at udnytte IP-beskyttet materiale i udviklingen af nye systemer; da disse systemer ikke endnu var succesfulde, i termer af at vÃĶre modne eller kommercielt levedygtige, var resultaterne, i enhver forstand, akademiske.
I denne periode signalerede den pludselige succes for en ny generation af diffusion-baserede Large Language Models (LLMs, sÃĨsom ChatGPT og Claude) og Vision-Language Models (VLMs, sÃĨsom Sora) at disse abstrakte og hidtil âharmlÃļseâ strÃļmme af forskning havde udviklet sig til kommerciel levedygtighed og var vokset ud af deres âfri pasâ, sÃĨ langt som udnyttelsen af andres immaterielle ejendom var bekymret.
Herefter ville rettighedsindehavere sÃļge en andel i frugterne af AI-systemer, der var trÃĶnet overvejende eller delvist pÃĨ deres ophavsretligt beskyttede eller pÃĨ anden mÃĨde beskyttede data, hvilket fÃļrte til en pÃĨgÃĨende lavine af retssager, der krÃĶver en vis indsats for blot at holde styr pÃĨ.

Her begrÃĶnset kun til sager, der er indgivet i USA, opstÃĨr nye sager i en frenetisk takt i USA og andre steder. Kilde
At krÃĶve en âgratis frokostâ
Den finansielle forpligtelse der i Ãļjeblikket sker i forhold til AI-betjeningens infrastruktur er blevet forslagt af nogle stemmer som et forsÃļg pÃĨ at etablere âophavsrets-farligâ AI sÃĨ dybt i samfundets Ãļkonomi, at det bliver ikke kun âfor stort til at fejleâ, men ogsÃĨ âfor kraftfuldt til at sagsÃļgeâ â eller i hvert fald sÃĨ kraftfuldt, at succesfulde retssager ikke kan tillades at omstyrte revolutionen.
Mod denne generelle holdning er den nuvÃĶrende prÃĶsident for USA engageret i at implementere sin opfattelse af, at âDu kan ikke forventes at have et succesfuldt AI-program, nÃĨr hver enkelt artikel, bog eller andet, du har lÃĶst eller studeret, skal betales forâ.
Virkelig? Intet lignende eller sammenligneligt er sket i den vestlige industrielle ÃĶra, og dette reprÃĶsenterer en bevÃĶgelse, der skrider kraftigt mod den traditionelle amerikanske kultur af retssager og erstatning; mÃĨske er den nÃĶrmeste lignende position den obligatoriske udlÃļb af medicinalpatenter efter 20 ÃĨr (i sig selv ofte under angreb), og begrÃĶnsningen af forventninger til privatliv i offentlige steder.
Men tiderne skifter; i mangelen pÃĨ nogen garanti for, at den nuvÃĶrende tendens mod âfremtrÃĶdende domÃĶneâ mod IP-beskyttelse ikke vil svigte eller blive omvendt senere, er der flere sekundÃĶre tilgange, der bliver standardpraksis i udviklingen af AI-systemer og behandlingen af den meget omdiskuterede trÃĶningsdata, der driver det.
Datasets-via-Proxy
En af disse tilgange tager en bemÃĶrkelsesvÃĶrdigt lignende tilgang til den (ikke altid succesfulde) forsvar af torrent-listningssites, der ikke selv hoster noget kontroversielt materiale â eller noget materiale overhovedet.
Ud over at undgÃĨ behovet for at gemme og servere store mÃĶngder minimalt komprimerbart billede- eller videodata, tillader samlinger af denne type hurtig opdatering â sÃĨsom fjernelse af materiale pÃĨ ophavsretsindehavernes anmodning â og versionering.
Lige som torrents kun er vejvisere til, hvor ophavsretsbeskyttet materiale kan findes, er en rÃĶkke meget indflydelsesrige datasets i sig selv kun âpegerâ-lister over eksisterende data; hvis slutbrugeren Ãļnsker at bruge disse lister som en download-liste til deres egen dataset, er det pÃĨ dem, sÃĨ langt som kuratorernes ansvar synes at vÃĶre bekymret.
Blandt disse er Google Researchâs Conceptual 12M-dataset, der giver undertekster til billeder, men kun peger pÃĨ websteder, hvor disse billeder findes (eller fandtes pÃĨ tidspunktet for kurering):

To eksempler fra Google Researchâs Conceptual 12M-kurering. Kilde
Et andet fremtrÃĶdende eksempel, og et, der nu har en gyldig krav pÃĨ respekt i AI-historien, er LAION-datasettet, der muliggjorde fremkomsten af det stabile diffusion-generative system i 2022 â det fÃļrste sÃĨdanne rammevÃĶrk, der tilbÃļd kraftfulde ÃĨbne kildesystemer til generative billeder til slutbrugere, ligesom proprietÃĶre systemer syntes at etablere sÃĨdanne tjenester som en ren ringhegnet, kommerciel domÃĶne:

En af de mange varianter af LAION-projektet, der viser moderne og ophavsretsbeskyttede kunstvÃĶrker. Kilde
I mange tilfÃĶlde indikerer de hÃļje filstÃļrrelser af disse âpegerâ-samlinger, at billedindhold er inkluderet i en downloadbar og vÃĶrt fil; dog er de ikke-trivielle downloadstÃļrrelser ofte pÃĨ grund af den hÃļje volumen af tekstindhold og iblandt inklusion af udtrÃĨdte indlejring eller funktioner â afledte sammenfattelser eller noder af anden anvendelig indhold, der er udtrukket fra kildeindholdet under trÃĶningsprocessen.
Det Video-Premium
Video-datasets prÃĶsenterer endnu en stÃĶrkere sag for âdataset-via-proxyâ- eller pege-tilgangen, da den hÃļje volumen af lagringsdata, der krÃĶves for at samle en meningsfuld og nyttig mÃĶngde videoer i en enkelt downloadbar samling, er forbudt, og en âdistribueretâ metode er ÃļnskvÃĶrdig.
Men i begge tilfÃĶlde â men isÃĶr med video â reprÃĶsenterer de downloadbare kilde-URLâer data, der vil krÃĶve betydelig yderligere opmÃĶrksomhed, fÃļr de kan bruges i trÃĶningsprocesser. BÃĨde billeder og videoer vil krÃĶve omstilling eller beskÃĶring for at skabe prÃļver, der kan passe ind i tilgÃĶngeligt GPU-plads. Selv alvorligt nedprissede videoer vil ogsÃĨ krÃĶve klipning til meget korte lÃĶngder, sÃĨsom 3-5 sekunder, typisk.
Notable video-datasets, der bruger henvisninger til online-videoer (i stedet for kurering og direkte pakning af video), omfatter Googleâs Kinetics Human Action Video Dataset og sÃļgemaskinens YouTube-8M-samling, der bruger segment-annotation til at angive, hvordan man skal behandle hver video, nÃĨr den er downloadet â men som igen lader slutbrugeren fÃĨ videoerne fra de leverede URLâer.
Lukket og à bent
Til sidst i denne kategori kan âÃĨbentâ VFX-data genereres med lukkede platforme, der herefter offentliggÃļr og tilgÃĶngeliggÃļr den resulterende dataset. Det er rimeligt at undre sig over, hvorfor dette sker, og at overveje, om det kan vÃĶre, fordi den oprindelige virksomhed Ãļnsker at sanere en IP-venlig upstream-model til deres egen brug; eller at en âvasketâ samling blev anmodet udefra.
Et sÃĨdant tilfÃĶlde af âgenerations-vaskâ er, kan man argumentere for, Omni-VFX-datasettet, der inkorporerer mange datapunkter fra Open-VFX-datasettet (der selv henviser til mange lukkede og semi-lukkede platforme, sÃĨsom Pika og PixVerse).
For at vÃĶre ÃĶrlig, Omni-VFX forsÃļger ikke engang rigtigt:

I det ÃĨbne Omni-VFX-dataset, et velkendt ansigt. Kilde
Ãldre Ansvar
Den anden store tilgang til IP-vask er gennem brugen af ophavsretsbeskyttet materiale pÃĨ ÃĐt eller flere niveau. En af metoderne i denne kategori er brugen af synthetisk data, der er trÃĶnet, pÃĨ ÃĐt eller flere punkter opstrÃļms, pÃĨ ophavsretsbeskyttet data. I sÃĨdanne tilfÃĶlde, isÃĶr hvor synthetisk data kan opnÃĨ autentisk-udseende resultater, leverer ophavsretsbeskyttet arbejde transformationer, der ikke kan rimeligt gÃĶttes eller approksimeres af generelle verdensmodeller eller ikke-specialiserede modeller.
Dette er bestemt tilfÃĶldet, hvor generative video-systemer skal generere âumuligeâ begivenheder og begivenheder, der generelt falder ind under kategorien âvisuelle effekterâ (VFX).
I virkeligheden var det, der fik dette emne i tanke, den seneste i en rÃĶkke af forskningsartikler, der tilbyder evnen til at âabstrahereâ forskellige typer visuelle effekter, sÃĨsom produktion af laserstrÃĨler fra usandsynlige dele af kroppen, enten ved at have vÃĶret trÃĶnet pÃĨ bestilt eller âÃĨbentâ VFX-klip (i stedet for den mere ÃĨbenlyse kilde, sÃĨsom de meget dyre VFX-optagelser, der findes i output fra Marvels filmunivers):
Eksempler fra EffectMaker-website, hvor âaktionenâ i kildeklippet (langt til venstre) anvendes pÃĨ et kildebillede (i midten). Kilde
De ovenstÃĨende eksempler kommer fra projektets side for EffectMaker-projektet. EffectMaker er ikke engang det fÃļrste tilbud i ÃĨr, der sÃļger at udtrÃĶkke VFX-dynamik fra en video-klip og overfÃļre det til en ny klip, og i virkeligheden er dette ved at blive en diskret underopgave i AI-VFX-forskning*.
Med bevidsthed om, at medie-kÃĶmper som Marvel har en hÃļjere end gennemsnitlig chance for at vinde retssager over IP (selv i den nÃĶvnte klima af âtvunget toleranceâ), gÃĨr visuelle effekt-virksomheder og startups i Ãļjeblikket til betydelige lÃĶngder for at sikre, at deres generative VFX-rammer er fri for andres virksomheds-IP.
Foremost of these er Meta, der er blevet rapporteret pÃĨ r/vfx-subreddit til at have gÃĨet pÃĨ en velbetalt vinter-hyreen-sammenlÃĶgning ind i 2026, hvor de tilbÃļd VFX-kunstnere arbejde med at trÃĶne AI-modeller til at producere Hollywood-niveau visuelle effekter. Selv om lÃļnnen ikke var specificeret pÃĨ tvÃĶrs af forskellige indlÃĶg, beskrev en det som âpensionspengeâ.
FÃļlg Pengene
Men man mÃĨ undre sig over, hvor meget penge, selv en virksomhed som Meta, er villig til at betale for en sand diversitet og overflod af ad hoc VFX-optagelser, givet at den gennemsnitlige enkelt VFX-optagelse for en blockbuster-film er omkring 42.000 USD â og mange kommer ind i langt hÃļjere.
Yderligere er det rimeligt at antage, at brugerdefinerede VFX-genererende AI-modeller vil give efter for populÃĶr efterspÃļrgsel, herunder forskellige standard-effekt-klichÃĐer fra de mest populÃĶre og dyreste filmkategorier.
Foruden det, at âresterendeâ VFX-fagfolk kan ende med at genskabe optagelser, de arbejdede pÃĨ for en eksisterende filmkatalogâ â hvilket i sig selv kontekstualiserer âbrugerdefineretâ dataset-arbejde som imitativt â er der i hvert fald ingen garanti for, at disse dyre nye prÃļver vil blive trÃĶnet âfra scratchâ i en helt ny arkitektur.
Det er faktisk, hvis sÃĨdanne genskabelser bliver omdirigeret til bifag som LoRAs, der afhÃĶnger af en basis-model, sÃĨ er processen kun sÃĨ defensiv, som basis-modellen er âIP-renâ â og ikke mange er.
Ligesom, hvis den ânyeâ proces bruger andre âhybridâ-teknikker, sÃĨsom fine-tuning, hvor vÃĶrdien af den visuelle effekt afhÃĶnger af modeller, priorer, eller indlejring fra ÃĶldre samlinger eller modeller af usikker integritet, er originaliteten af arbejdet kosmetisk og underlagt udfordring.
Umulige Missioner
DomÃĶnet for VFX-udgang er en sÃĶrligt interessant case-study i forhold til potentiel IP-vask i AI-datasets, da visuelle effektoptagelser ofte afbilder âumuligeâ ting, der ikke vil have noget ÃĨbent alternativ til rÃĨdighed.
For eksempel, mens rivningen af en bygning kunne trÃĶnes ind i en generativ model fra forskellige offentligt tilgÃĶngelige eller pÃĨ anden mÃĨde billige stock-klip, hvis du Ãļnsker at trÃĶne en model til at producere menneskelige laserstrÃĨler, skal du trÃĶne pÃĨ VFX-klip, stjÃĨlet eller bestilt; sÃĨdanne ting sker ikke andre steder.
Selv i tilfÃĶlde af andre typer naturkatastrofer, sÃĨsom dramatisk oversvÃļmmelse, er tilgÃĶngeligt virkeligt kilde-materiale ikke sandsynligt at kunne genskabe dramatiske POVâer pÃĨ katastrofale begivenheder, fordi (med nogle undtagelser) mennesker ikke normalt live-streamer fra katastrofale lokaliteter. Derfor er âcool viewsâ pÃĨ katastrofer sjÃĶldne i virkelige datasets, og enhver AI-model, der kan generere dem, fik sandsynligvis informationen et andet sted.
De fleste Ãļnskede AI-opgaver har ikke dette niveau af specifikation, og i sÃĨdanne tilfÃĶlde kan skjulelsen af fordelene ved ophavsretsbeskyttet data ikke krÃĶve nÃĶr sÃĨ megen indsats.
Konklusion: En Intrikat NetvÃĶrk
Kun de, der har brugt generativ AI omfattende og over en lÃĶngere periode, vil instinktivt forstÃĨ, at sÃĨdanne systemer kÃĶmper med at kombinere multiple koncepter, nÃĨr der ikke findes sammenlignelige eksempler i deres trÃĶningsdata.
Dette begrÃĶnsning er kendt som entanglement, hvor de forskellige aspekter af trÃĶnede koncepter tenderer til at klumpe sammen med relaterede elementer, snarere end at dekomponere til hÃĨndige, Lego-lignende byggeklodser, der kan arrangeres i enhver ny konfiguration, brugeren mÃĨtte Ãļnske.
Entanglement er en arkitektonisk tyngdekraft, der er nÃĶsten umulig at undslippe, i hvert fald for diffusion-baserede tilgange, der kendetegner alle de stÃļrre nuvÃĶrende genAI-rammer. Men det kan vÃĶre, at nye tilgange opstÃĨr i de kommende ÃĨr, der er bedre til at diskretisere trÃĶnede koncepter, sÃĨ de kan klÃĶbes sammen mere behÃĶndigt, og tilbyde fÃĶrre tegn pÃĨ deres oprindelse.
Â
* Jeg retter ingen anklager mod EffectMaker, men kommenterer her pÃĨ den generelle praksis, der opstÃĨr i AI-video-forskning.
â Fordi disse optagelser i disse typer film har genereret og fortsÃĶtter med at generere penge.
FÃļrst udgivet mandag, 16. marts 2026












