Andersons vinkel

IP-Vaskemetoder i AI

mm
Føj Unite.AI til dine foretrukne kilder på Google
An AI-generated image of Lady Justice surrounded by 'laundered' data. GPT-1.5.

Hvis der kommer en juridisk afregning over brugen af immaterielle rettigheder i træning af AI, er der også flere metoder til at skjule sådan brug.

 

Opinion Den nuværende, hurtigt fremadskridende revolution i generativ AI udvikler sig i den mest juridisk usikre omgang, der har ledsaget nogen transformerende teknologisk udvikling siden det nittende århundrede.

Indtil 3-4 år siden nød maskinlæringsforskningsfællesskabet en implicit (ofte eksplicit) tilladelse til at udnytte IP-beskyttet materiale i udviklingen af nye systemer; da disse systemer ikke endnu var succesfulde, i termer af at være modne eller kommercielt levedygtige, var resultaterne, i enhver forstand, akademiske.

I denne periode signalerede den pludselige succes for en ny generation af diffusion-baserede Large Language Models (LLMs, såsom ChatGPT og Claude) og Vision-Language Models (VLMs, såsom Sora) at disse abstrakte og hidtil ‘harmløse’ strømme af forskning havde udviklet sig til kommerciel levedygtighed og var vokset ud af deres ‘fri pas’, så langt som udnyttelsen af andres immaterielle ejendom var bekymret.

Herefter ville rettighedsindehavere søge en andel i frugterne af AI-systemer, der var trænet overvejende eller delvist på deres ophavsretligt beskyttede eller på anden måde beskyttede data, hvilket førte til en pågående lavine af retssager, der kræver en vis indsats for blot at holde styr på.

Begrænset kun til sager, der er indgivet i USA, opstår nye sager i en frenetisk takt i USA og andre steder. Kilde - https://copyrightalliance.org/artificial-intelligence-copyright/court-cases/

Her begrænset kun til sager, der er indgivet i USA, opstår nye sager i en frenetisk takt i USA og andre steder. Kilde

At kræve en ‘gratis frokost’

Den finansielle forpligtelse der i øjeblikket sker i forhold til AI-betjeningens infrastruktur er blevet forslagt af nogle stemmer som et forsøg på at etablere ‘ophavsrets-farlig’ AI så dybt i samfundets økonomi, at det bliver ikke kun ‘for stort til at fejle’, men også ‘for kraftfuldt til at sagsøge’ – eller i hvert fald så kraftfuldt, at succesfulde retssager ikke kan tillades at omstyrte revolutionen.

Mod denne generelle holdning er den nuværende præsident for USA engageret i at implementere sin opfattelse af, at ‘Du kan ikke forventes at have et succesfuldt AI-program, når hver enkelt artikel, bog eller andet, du har læst eller studeret, skal betales for’.

Virkelig? Intet lignende eller sammenligneligt er sket i den vestlige industrielle æra, og dette repræsenterer en bevægelse, der skrider kraftigt mod den traditionelle amerikanske kultur af retssager og erstatning; måske er den nærmeste lignende position den obligatoriske udløb af medicinalpatenter efter 20 år (i sig selv ofte under angreb), og begrænsningen af forventninger til privatliv i offentlige steder.

Men tiderne skifter; i mangelen på nogen garanti for, at den nuværende tendens mod ‘fremtrædende domæne’ mod IP-beskyttelse ikke vil svigte eller blive omvendt senere, er der flere sekundære tilgange, der bliver standardpraksis i udviklingen af AI-systemer og behandlingen af den meget omdiskuterede træningsdata, der driver det.

Datasets-via-Proxy

En af disse tilgange tager en bemærkelsesværdigt lignende tilgang til den (ikke altid succesfulde) forsvar af torrent-listningssites, der ikke selv hoster noget kontroversielt materiale – eller noget materiale overhovedet.

Ud over at undgå behovet for at gemme og servere store mængder minimalt komprimerbart billede- eller videodata, tillader samlinger af denne type hurtig opdatering – såsom fjernelse af materiale på ophavsretsindehavernes anmodning – og versionering.

Lige som torrents kun er vejvisere til, hvor ophavsretsbeskyttet materiale kan findes, er en række meget indflydelsesrige datasets i sig selv kun ‘peger’-lister over eksisterende data; hvis slutbrugeren ønsker at bruge disse lister som en download-liste til deres egen dataset, er det på dem, så langt som kuratorernes ansvar synes at være bekymret.

Blandt disse er Google Research’s Conceptual 12M-dataset, der giver undertekster til billeder, men kun peger på websteder, hvor disse billeder findes (eller fandtes på tidspunktet for kurering):

To eksempler fra Google Research's Conceptual 12M-kurering. Kilde - https://github.com/google-research-datasets/conceptual-12m/blob/main/images/cc12m_1.jpg

To eksempler fra Google Research’s Conceptual 12M-kurering. Kilde

Et andet fremtrædende eksempel, og et, der nu har en gyldig krav på respekt i AI-historien, er LAION-datasettet, der muliggjorde fremkomsten af det stabile diffusion-generative system i 2022 – det første sådanne rammeværk, der tilbød kraftfulde åbne kildesystemer til generative billeder til slutbrugere, ligesom proprietære systemer syntes at etablere sådanne tjenester som en ren ringhegnet, kommerciel domæne:

En af de mange varianter af LAION-projektet, der viser moderne og ophavsretsbeskyttede kunstværker. Kilde - https://huggingface.co/datasets/laion/relaion-pop/viewer/default/train

En af de mange varianter af LAION-projektet, der viser moderne og ophavsretsbeskyttede kunstværker. Kilde

I mange tilfælde indikerer de høje filstørrelser af disse ‘peger’-samlinger, at billedindhold er inkluderet i en downloadbar og vært fil; dog er de ikke-trivielle downloadstørrelser ofte på grund af den høje volumen af tekstindhold og iblandt inklusion af udtrådte indlejring eller funktioner – afledte sammenfattelser eller noder af anden anvendelig indhold, der er udtrukket fra kildeindholdet under træningsprocessen.

Det Video-Premium

Video-datasets præsenterer endnu en stærkere sag for ‘dataset-via-proxy’- eller pege-tilgangen, da den høje volumen af lagringsdata, der kræves for at samle en meningsfuld og nyttig mængde videoer i en enkelt downloadbar samling, er forbudt, og en ‘distribueret’ metode er ønskværdig.

Men i begge tilfælde – men især med video – repræsenterer de downloadbare kilde-URL’er data, der vil kræve betydelig yderligere opmærksomhed, før de kan bruges i træningsprocesser. Både billeder og videoer vil kræve omstilling eller beskæring for at skabe prøver, der kan passe ind i tilgængeligt GPU-plads. Selv alvorligt nedprissede videoer vil også kræve klipning til meget korte længder, såsom 3-5 sekunder, typisk.

Notable video-datasets, der bruger henvisninger til online-videoer (i stedet for kurering og direkte pakning af video), omfatter Google’s Kinetics Human Action Video Dataset og søgemaskinens YouTube-8M-samling, der bruger segment-annotation til at angive, hvordan man skal behandle hver video, når den er downloadet – men som igen lader slutbrugeren få videoerne fra de leverede URL’er.

Lukket og Åbent

Til sidst i denne kategori kan ‘åbent’ VFX-data genereres med lukkede platforme, der herefter offentliggør og tilgængeliggør den resulterende dataset. Det er rimeligt at undre sig over, hvorfor dette sker, og at overveje, om det kan være, fordi den oprindelige virksomhed ønsker at sanere en IP-venlig upstream-model til deres egen brug; eller at en ‘vasket’ samling blev anmodet udefra.

Et sådant tilfælde af ‘generations-vask’ er, kan man argumentere for, Omni-VFX-datasettet, der inkorporerer mange datapunkter fra Open-VFX-datasettet (der selv henviser til mange lukkede og semi-lukkede platforme, såsom Pika og PixVerse).

For at være ærlig, Omni-VFX forsøger ikke engang rigtigt:

I det åbne Omni-VFX-dataset, et velkendt ansigt. Kilde - https://huggingface.co/datasets/GD-ML/Omni-VFX/blob/main/Harley/pixverse%252Fmp4%252Fmedia%252Fweb%252F15e45744-64b1-4a41-84de-626225cf017b_seed734716767.mp4

I det åbne Omni-VFX-dataset, et velkendt ansigt. Kilde

Ældre Ansvar

Den anden store tilgang til IP-vask er gennem brugen af ophavsretsbeskyttet materiale på ét eller flere niveau. En af metoderne i denne kategori er brugen af synthetisk data, der er trænet, på ét eller flere punkter opstrøms, på ophavsretsbeskyttet data. I sådanne tilfælde, især hvor synthetisk data kan opnå autentisk-udseende resultater, leverer ophavsretsbeskyttet arbejde transformationer, der ikke kan rimeligt gættes eller approksimeres af generelle verdensmodeller eller ikke-specialiserede modeller.

Dette er bestemt tilfældet, hvor generative video-systemer skal generere ‘umulige’ begivenheder og begivenheder, der generelt falder ind under kategorien ‘visuelle effekter’ (VFX).

I virkeligheden var det, der fik dette emne i tanke, den seneste i en række af forskningsartikler, der tilbyder evnen til at ‘abstrahere’ forskellige typer visuelle effekter, såsom produktion af laserstråler fra usandsynlige dele af kroppen, enten ved at have været trænet på bestilt eller ‘åbent’ VFX-klip (i stedet for den mere åbenlyse kilde, såsom de meget dyre VFX-optagelser, der findes i output fra Marvels filmunivers):

Eksempler fra EffectMaker-website, hvor ‘aktionen’ i kildeklippet (langt til venstre) anvendes på et kildebillede (i midten). Kilde

De ovenstående eksempler kommer fra projektets side for EffectMaker-projektet. EffectMaker er ikke engang det første tilbud i år, der søger at udtrække VFX-dynamik fra en video-klip og overføre det til en ny klip, og i virkeligheden er dette ved at blive en diskret underopgave i AI-VFX-forskning*.

Med bevidsthed om, at medie-kæmper som Marvel har en højere end gennemsnitlig chance for at vinde retssager over IP (selv i den nævnte klima af ‘tvunget tolerance’), går visuelle effekt-virksomheder og startups i øjeblikket til betydelige længder for at sikre, at deres generative VFX-rammer er fri for andres virksomheds-IP.

Foremost of these er Meta, der er blevet rapporteret på r/vfx-subreddit til at have gået på en velbetalt vinter-hyreen-sammenlægning ind i 2026, hvor de tilbød VFX-kunstnere arbejde med at træne AI-modeller til at producere Hollywood-niveau visuelle effekter. Selv om lønnen ikke var specificeret på tværs af forskellige indlæg, beskrev en det som ‘pensionspenge’.

Følg Pengene

Men man må undre sig over, hvor meget penge, selv en virksomhed som Meta, er villig til at betale for en sand diversitet og overflod af ad hoc VFX-optagelser, givet at den gennemsnitlige enkelt VFX-optagelse for en blockbuster-film er omkring 42.000 USD – og mange kommer ind i langt højere.

Yderligere er det rimeligt at antage, at brugerdefinerede VFX-genererende AI-modeller vil give efter for populær efterspørgsel, herunder forskellige standard-effekt-klichéer fra de mest populære og dyreste filmkategorier.

Foruden det, at ‘resterende’ VFX-fagfolk kan ende med at genskabe optagelser, de arbejdede på for en eksisterende filmkatalog† – hvilket i sig selv kontekstualiserer ‘brugerdefineret’ dataset-arbejde som imitativt – er der i hvert fald ingen garanti for, at disse dyre nye prøver vil blive trænet ‘fra scratch’ i en helt ny arkitektur.

Det er faktisk, hvis sådanne genskabelser bliver omdirigeret til bifag som LoRAs, der afhænger af en basis-model, så er processen kun så defensiv, som basis-modellen er ‘IP-ren’ – og ikke mange er.

Ligesom, hvis den ‘nye’ proces bruger andre ‘hybrid’-teknikker, såsom fine-tuning, hvor værdien af den visuelle effekt afhænger af modeller, priorer, eller indlejring fra ældre samlinger eller modeller af usikker integritet, er originaliteten af arbejdet kosmetisk og underlagt udfordring.

Umulige Missioner

Domænet for VFX-udgang er en særligt interessant case-study i forhold til potentiel IP-vask i AI-datasets, da visuelle effektoptagelser ofte afbilder ‘umulige’ ting, der ikke vil have noget åbent alternativ til rådighed.

For eksempel, mens rivningen af en bygning kunne trænes ind i en generativ model fra forskellige offentligt tilgængelige eller på anden måde billige stock-klip, hvis du ønsker at træne en model til at producere menneskelige laserstråler, skal du træne på VFX-klip, stjålet eller bestilt; sådanne ting sker ikke andre steder.

Selv i tilfælde af andre typer naturkatastrofer, såsom dramatisk oversvømmelse, er tilgængeligt virkeligt kilde-materiale ikke sandsynligt at kunne genskabe dramatiske POV’er på katastrofale begivenheder, fordi (med nogle undtagelser) mennesker ikke normalt live-streamer fra katastrofale lokaliteter. Derfor er ‘cool views’ på katastrofer sjældne i virkelige datasets, og enhver AI-model, der kan generere dem, fik sandsynligvis informationen et andet sted.

De fleste ønskede AI-opgaver har ikke dette niveau af specifikation, og i sådanne tilfælde kan skjulelsen af fordelene ved ophavsretsbeskyttet data ikke kræve nær så megen indsats.

Konklusion: En Intrikat Netværk

Kun de, der har brugt generativ AI omfattende og over en længere periode, vil instinktivt forstå, at sådanne systemer kæmper med at kombinere multiple koncepter, når der ikke findes sammenlignelige eksempler i deres træningsdata.

Dette begrænsning er kendt som entanglement, hvor de forskellige aspekter af trænede koncepter tenderer til at klumpe sammen med relaterede elementer, snarere end at dekomponere til håndige, Lego-lignende byggeklodser, der kan arrangeres i enhver ny konfiguration, brugeren måtte ønske.

Entanglement er en arkitektonisk tyngdekraft, der er næsten umulig at undslippe, i hvert fald for diffusion-baserede tilgange, der kendetegner alle de større nuværende genAI-rammer. Men det kan være, at nye tilgange opstår i de kommende år, der er bedre til at diskretisere trænede koncepter, så de kan klæbes sammen mere behændigt, og tilbyde færre tegn på deres oprindelse.

 

* Jeg retter ingen anklager mod EffectMaker, men kommenterer her på den generelle praksis, der opstår i AI-video-forskning.

† Fordi disse optagelser i disse typer film har genereret og fortsætter med at generere penge.

Først udgivet mandag, 16. marts 2026

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai