Andersonův úhel

Metody IP-washingu v AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
An AI-generated image of Lady Justice surrounded by 'laundered' data. GPT-1.5.

Pokud existuje právní vyúčtování, které má přijít s používáním duševního vlastnictví při výcviku AI, existují také několik metod, jak toto použití zakrýt.

 

Opinion Současná, rychle se rozvíjející revoluce v generativní AI se odehrává v nejprávně nejistějším prostředí, které doprovázelo jakoukoli transformační technologickou vývoj od 19. století.

Až před 3-4 lety si komunita výzkumu strojového učení užívala tacitní (často explicitní) povolení k využívání materiálu chráněného duševním vlastnictvím při vývoji nových systémů; jelikož tyto systémy nebyly dosud úspěšné, pokud jde o zralost nebo komerční životaschopnost, výsledky byly ve všech směrech akademické.

V tomto období znamenala náhlá úspěšnost nové generace difuzních velkých jazykových modelů (LLM, jako je ChatGPT a Claude) a vizuálních jazykových modelů (VLM, jako je Sora) signál, že tyto abstraktní a dosud “neškodné” směry výzkumu se vyvinuly v komerční životaschopnost a vyrostly z “volné jízdy”, pokud jde o využívání duševního vlastnictví jiných lidí.

Od nynějška budou držitelé práv požadovat podíl na plodech systémů AI, které byly vyškoleny převážně nebo zčásti na jejich autorských nebo jinak chráněných datech, což povede k probíhající lavině právních případů, které vyžadují nějakou snahu, aby se jim mohli jen držet krok.

Omezeno pouze na případy podané v USA, nové případy se objevují v rychlém tempu ve Spojených státech a jinde. Zdroj - https://copyrightalliance.org/artificial-intelligence-copyright/court-cases/

Zde omezeno pouze na případy podané v USA, nové případy se objevují v rychlém tempu ve Spojených státech a jinde. Zdroj

Povinnost “bezplatného oběda”

Finanční závazek právě probíhající v souvislosti s infrastrukturou pro AI byl naznačen některými hlasy jako pokus zakotvit “hazardní” AI tak hluboko v ekonomice společnosti, aby se stala nejen “příliš velkou na to, aby selhala”, ale také “příliš mocnou na to, aby byla úspěšně žalována” – nebo alespoň tak mocnou, že by úspěšné žaloby mohly být dovoleny zvrátit revoluci.

V tomto obecném smyslu se současný prezident Spojených států zavázal do politiky svůj názor, že “nemůžete očekávat, že budete mít úspěšný program AI, když každé jednotlivé články, knihy nebo cokoliv jiného, co jste četli nebo studovali, musíte platit”.

Skutečně? Nic podobného nebo srovnatelného se nestalo v západní průmyslové éře a tato akce se silně dotýká tradiční americké kultury žalob a náhrad; snad nejbližší podobné pozice jsou povinné vypršení patentů na léky po 20 letech (které jsou sami o sobě často napadeny), a omezení očekávání soukromí na veřejných místech.

Nicméně, časy se mění; v nepřítomnosti jakékoli záruky, že současný trend směrem k “vyvlastnění” proti ochraně duševního vlastnictví nebude selhat nebo nebude později obrácen, existují several sekundární přístupy, které se stávají standardní praxí ve vývoji systémů AI a zacházení s tolik spornými trénovacími daty, které je pohánějí.

Datové sady na základě proxy

Jedním z těchto přístupů je velmi podobný obraně torrentových stránek, které tvrdí, že nehostí žádné sporné materiály – nebo jakýkoli materiál vůbec.

Kromě toho, že se vyhnou potřebě ukládat a poskytovat velké množství minimálně komprimovatelných obrazových nebo video dat, tyto sbírky umožňují rychlé aktualizace – jako je odstranění materiálu na žádost držitelů autorských práv – a verzi.

Stejně jako torrenty jsou pouze ukazatele, kde lze najít materiály chráněné duševním vlastnictvím, několik vlivných datových sad je samo o sobě pouze “ukazatelem” seznamy existujících dat; pokud uživatel chce tyto seznamy použít jako seznam ke stažení pro svou vlastní datovou sadu, je to na něm, pokud jde o odpovědnost kurátorů.

Mezi nimi je datová sada Conceptual 12M od Google Research, která poskytuje popisky pro obrázky, ale pouze ukazuje lokace na webu, kde tyto obrázky existují (nebo existovaly v době kurátorské činnosti):

Dva příklady z kurátorské činnosti Conceptual 12M. Zdroj - https://github.com/google-research-datasets/conceptual-12m/blob/main/images/cc12m_1.jpg

Dva příklady z kurátorské činnosti Conceptual 12M. Zdroj

Jiným prominentním příkladem, který nyní má oprávněný nárok na úctu v historii AI, je datová sada LAION, která umožnila vznik generativního systému Stable Diffusion v roce 2022 – první takový rámec, který nabízí silné otevřené generativní obrázky koncovým uživatelům, právě když se zdálo, že proprietární systémy budou tyto služby zavedeny jako čistě uzavřenou, komerční doménu:

Jedna z mnoha variant projektu LAION, která zahrnuje moderní a autorská umělecká díla. Zdroj - https://huggingface.co/datasets/laion/relaion-pop/viewer/default/train

Jedna z mnoha variant projektu LAION, která zahrnuje moderní a autorská umělecká díla. Zdroj

V mnoha případech velikost souborů těchto “ukazatelů” naznačuje, že zahrnují obrazová nebo video data; nicméně, nezanedbatelné velikosti stažení jsou často způsobeny velkým objemem textu a někdy zahrnují extrahované vložené nebo funkce – odvozené souhrny nebo uzly jinak aplikovatelného obsahu extrahovaného zdrojových dat během procesu školení.

Video Premium

Video datové sady představují ještě silnější případ pro “datovou sadu na základě proxy” nebo ukazatelový přístup, protože velké množství úložného prostoru vyžadovaného pro agregaci smysluplného a užitečného počtu videí do jedné stažitelné kolekce je prohibitive, a “distribuovaný” metod je žádoucí.

Však, v obou případech – ale zejména u videa – stažitelné zdrojové URL představují data, která budou vyžadovat významnou další pozornost před použitím v procesech školení. Obrazová i video data budou muset být převelena nebo provedena rozhodnutí o ořezání, aby se vytvořily vzorky, které se vejdou do dostupného prostoru GPU. Even vážně podrobná videa budou také vyžadovat krátké délky, jako je 3-5 sekund, typicky.

Značné video datové sady, které používají odkazy na online videa (místo kurátorské a přímé balení videa), zahrnují Kinetics Human Action Video Dataset od Googlu a kolekci YouTube-8M, která používá segment anotaci, aby naznačila, jak zacházet s každým videem, když je jednou staženo – ale které opět ponechává koncovému uživateli, aby získal videa z poskytnutých URL.

Zavřít a Otevřít

Nakonec, v této kategorii, “otevřená” VFX data mohou být generována s uzavřenou platformou, která následně publikuje a zpřístupňuje výslednou datovou sadu. Je rozumné se divit, proč se to děje, a zvažovat, zda to může být proto, že původní společnost chce sanitovat IP-nepřátelský upstream model pro svou vlastní potřebu; nebo že “vypraná” sada byla vyžádána zvenčí.

Jedním z takových případů “generační pračky” je, zřejmě, datová sada Omni-VFX, která zahrnuje mnoho datových bodů z Open-VFX datové sady (která sama odkazuje na mnoho uzavřených a polo-uzavřených platforem, jako je Pika a PixVerse).

Čestně řečeno, Omni-VFX se ani nesnaží:

V otevřené datové sadě Omni-VFX je známá tvář. Zdroj - https://huggingface.co/datasets/GD-ML/Omni-VFX/blob/main/Harley/pixverse%252Fmp4%252Fmedia%252Fweb%252F15e45744-64b1-4a41-84de-626225cf017b_seed734716767.mp4

V otevřené datové sadě Omni-VFX je známá tvář. Zdroj

Předcházející odpovědnost

Druhý hlavní přístup k IP-washing je prostřednictvím použití autorského materiálu na jedné nebo více úrovních. Jednou z metod v této kategorii je použití syntetických dat, která byla vyškolena, v某 bodě upstream, na autorských datech. V takových případech, zejména tam, kde syntetická data jsou schopna získat autenticky vypadající výsledky, autorská práce poskytuje transformace, které by nebylo možné rozumně uhodnout nebo aproximovat obecnými světovými modely nebo nespecializovanými modely.

To je zejména případ, kdy generativní video systémy jsou vyžadovány k generování “nemožných” událostí, a událostí, které by obecně spadaly do kategorie “vizuálních efektů” (VFX).

Ve skutečnosti, to, co přivedlo tuto téma k mému vědomí, byla poslední série výzkumných prací, které nabízejí schopnost “abstrahovat” různé typy vizuálních efektů, jako je například produkce laserových paprsků z nepravděpodobných částí těla, buď tím, že byly vyškolena na zakázku nebo “otevřených” VFX klipech (místo více zřejmého zdroje, jako je velmi drahý VFX ve výstupu z Marvelovy kinematografické univerzity):

Příklady z webové stránky EffectMaker, kde je “akce” ve zdrojovém klipu (daleko vlevo) aplikována na zdrojový obrázek (uprostřed). Zdroj

Vyšší příklady pocházejí ze projektové stránky pro EffectMaker projekt. EffectMaker není ani první nabídka tohoto roku, která se snaží extrahovat VFX dynamiku z jednoho video klipu a přenést ji do nového klipu, a ve skutečnosti se to stává samostatným úkolem v AI VFX výzkumu*.

Ve vědomí, že mediální giganti, jako je Marvel, mají vyšší než průměrnou šanci na výhru právních případů týkajících se duševního vlastnictví (i v uvedeném klimatu “vynucené tolerance”), vizuální efektové společnosti a startupy nyní jdou na značné délky, aby zajistily, že jejich generativní VFX rámce jsou zdarma od korporátního IP jiných společností.

Především z nich je Meta, která byla podle zpráv na subredditu r/vfx na dobře placenou zimní náborovou akci do roku 2026, nabízející VFX umělcům práci na školení AI modelů pro produkci Hollywood-level vizuálních efektů. Ačkoli nebyla specifikována plat ve různých příspěvcích, jeden popisuje ji jako “penzijní peníze”.

Sledujte peníze

Nicméně, je třeba se divit, kolik peněz jsou ochotni zaplatit i takové společnosti, jako je Meta, za skutečnou rozmanitost a hojnost ad hoc VFX shotů, vzhledem k tomu, že průměrný jeden VFX shot pro blockbusterový film je kolem 42 000 USD – a mnohé z nich jsou mnohem dražší.

Dále je rozumné předpokládat, že na zakázku generované VFX-generující AI modely budou vyhovovat populární poptávce, včetně různých standardních efektů tropů z nejpopulárnějších a nejdražších kategorií filmů.

Kromě toho, že “zbytkoví” VFX profesionálové mohou skončit rekreací shotů, na kterých pracovali pro stávající filmový katalog† – což samo o sobě kontextualizuje “na zakázku” datovou sadu jako imitativní – neexistuje žádná záruka, že tyto drahé nové vzorky budou nakonec vyškolena “od nuly” v nové architektuře.

Skutečně, pokud tyto rekreace jsou odváděny do pomocných modulů, jako je LoRAs, které spoléhají na základní model, pak je proces pouze tak obhajitelný, jako je základní model “IP-čistý” – a mnoho z nich není.

Podobně, pokud “nový” proces používá jiné “hybridní” techniky, jako je jemné ladění, kde hodnota vizuálního efektu závisí na modelech, přípustných nebo vložených z older kolekcí nebo modelů neověřené integrity, originalita práce je zřejmě kosmetická a podléhá výzvě.

Nemožné mise

Doména VFX výstupu je zvláště zajímavým případovým studiem ve vztahu k potenciálnímu IP-washing v AI datech, protože vizuální efektové shoty často zobrazují “nemožné” věci, pro které nebudou žádné otevřené alternativy k dispozici.

Například, zatímco demolice budovy by mohla být vyškolena do generativního modelu z různých veřejných doménových nebo jinak dostupných stock klipů, pokud chcete vyškolit model, aby produkoval lidské laserové paprsky, budete muset vyškolit na VFX klipech, ukradených nebo na zakázku; takové věci se nestávají nikde jinde.

Even v případě jiných typů přírodních katastrof, jako je dramatické zaplavení, dostupný reálný zdrojový materiál je nepravděpodobně schopen reprodukovat dramatické POV na katastrofických událostech, protože (s některými výjimkami) lidé obvykle nelivestreamují z katastrofických lokalit. Proto “cool views” na katastrofy jsou vzácné v reálných datech a jakýkoli AI model, který může generovat je, pravděpodobně získal informace z jiného zdroje.

Většina žádaných AI úkolů nemá tento level specifičnosti a v takových případech by zakrytí výhod autorských dat mohlo nevyžadovat tolik úsilí.

Závěr: Propojená síť

Pouze ti, kteří použili generativní AI extenzivně a po delší dobu, budou instinktivně rozumět, že takové systémy bojují s kombinací více konceptů, když neexistují žádné srovnatelné příklady v jejich trénovacích datech.

Toto omezení je známo jako propojení, ve kterém se různé aspekty trénovaných konceptů tendují shlukovat s souvisejícími prvky, spíše než rozložit se do užitečných, Lego-stylu stavebních bloků, které lze uspořádat do jakéhokoli nového uspořádání, které by uživatel mohl požadovat.

Propojení je architektonickou gravitační jámou, která je téměř nemožné uniknout, alespoň pro difuzní přístupy, které charakterizují všechny hlavní současné genAI rámce. Nicméně, je možné, že se objeví nové přístupy v příštích letech, které budou lépe schopny diskretizovat trénované koncepty, aby je mohly lépe skládat, a nabízet méně indikací o jejich původu.

 

* Nevznáším žádné obvinění proti EffectMaker, ale komentuji zde obecnou praxi, která se vyvíjí v AI video výzkumu.

† Protože tyto shoty, v těchto typech filmů, generují a budou generovat peníze.

První zveřejnění v pondělí, 16. března 2026

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai