Kąt Andersona

Metody prania IP w AI

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
An AI-generated image of Lady Justice surrounded by 'laundered' data. GPT-1.5.

Jeśli nadchodzi prawny rozrachunek związany z wykorzystaniem własności intelektualnej w szkoleniu AI, istnieją rÃģwnieÅž kilka metod zaciemniania takiego wykorzystania.

 

Opinia Obecna, gwałtownie postępująca rewolucja w generatywnej AI rozgrywa się w najbardziej niepewnym środowisku prawnym, jakie towarzyszyło jakiejkolwiek przełomowej rewolucji technologicznej od XIX wieku.

AÅž do 3-4 lat temu społeczność badawcza machine learningu miała niepisane (często jawne) pozwolenie na wykorzystywanie materiałÃģw chronionych prawem autorskim w trakcie tworzenia nowych systemÃģw; poniewaÅž systemy te nie były jeszcze udane, pod względem dojrzałości lub opłacalności komercyjnej, wyniki były, w kaÅždym sensie, akademickie.

W tym okresie nagły sukces nowego pokolenia modeli językowych opartych na dyfuzji (LLM, takich jak ChatGPT i Claude) i modeli językowo-wizualnych (VLM, takich jak Sora) sygnalizował, Åže te abstrakcyjne i dotąd “nieszkodliwe” gałęzie badań rozwinęły się w komercyjną opłacalność i wyrosły ze swojego “wolnego passa”, jeśli chodzi o wykorzystywanie cudzej własności intelektualnej.

Od tego momentu posiadacze praw będą ubiegać się o udział w owocach systemÃģw AI szkolonych w duÅžej mierze lub w części na ich chronionych danych, co doprowadzi do trwającej lawiny spraw sądowych, ktÃģre wymagają pewnego wysiłku, by je nawet śledzić.

Ograniczone tylko do spraw wniesionych w USA, nowe sprawy pojawiają się w frenetycznym tempie w Stanach Zjednoczonych i poza nimi. ÅđrÃģdło - https://copyrightalliance.org/artificial-intelligence-copyright/court-cases/

Tutaj ograniczone tylko do spraw wniesionych w USA, nowe sprawy pojawiają się w frenetycznym tempie w Stanach Zjednoczonych i poza nimi. ÅđrÃģdło

Mandating a ‘Free Lunch’

Finansowy zaangaÅžowanie obecnie występujące w odniesieniu do infrastruktury AI zostało przedstawione przez niektÃģre głosy jako prÃģba umocnienia “podejrzanej pod względem prawa autorskiego” AI tak głęboko w gospodarce społeczeństwa, Åže stanie się nie tylko “zbyt duÅža, by upaść”, ale takÅže “zbyt potęŞna, by pozwolić na udane pozwy” – lub zbyt potęŞna, by udane pozwy mogły ją obalić.

Ku temu ogÃģlnemu nastawieniu, obecny prezydent StanÃģw Zjednoczonych wprowadza do polityki swoje zdanie, Åže ‘Nie moÅžna oczekiwać, Åže będziesz miał udany program AI, gdy kaÅždy artykuł, ksiÄ…Åžka lub cokolwiek innego, co przeczytałeś lub studiowałeś, musisz za to zapłacić’.

Rzeczywiście? Niczego nawet podobnego nie wystąpiło w zachodniej erze przemysłowej, a to reprezentuje ruch, ktÃģry bardzo szorstko ociera się o tradycyjną amerykańską kulturę pozwÃģw i odszkodowań; być moÅže najbliÅžsze podobne pozycje to obligatoryjne wygaśnięcie patentÃģw medycznych po 20 latach (co jest często atakowane), oraz ograniczenie oczekiwań prywatności w miejscach publicznych.

Jednak czasy się zmieniają; w braku jakiejkolwiek gwarancji, Åže obecny trend w kierunku “eminent domain” przeciwko ochronie IP nie zawiedzie lub nie zostanie odwrÃģcony pÃģÅšniej, istnieją kilka wtÃģrnych podejść, ktÃģre stają się standardową praktyką w rozwoju systemÃģw AI i traktowaniu bardzo spornych danych szkoleniowych, ktÃģre je napędzają.

Datasets-by-Proxy

Jedno z tych podejść przyjmuje podejście wyjątkowo podobne do (nie zawsze udanej) obrony stron torrentÃģw, ktÃģre twierdzą, Åže nie hostują Åžadnych kontrowersyjnych materiałÃģw – lub Åžadnych materiałÃģw w ogÃģle.

Ponadto unikając konieczności przechowywania i udostępniania duÅžych ilości słabo kompresowalnych danych obrazowych lub wideo, kolekcje tego rodzaju umoÅžliwiają szybkie aktualizacje – takie jak usunięcie materiałÃģw na Şądanie posiadaczy praw autorskich – oraz wersjonowanie.

Podobnie jak torrenty są tylko znacznikami, wskazującymi, gdzie moÅžna znaleŚć chronione prawem autorskim materiały, wiele wpływowych zbiorÃģw danych jest samymi w sobie tylko “wskazującymi” listami istniejących danych; jeśli uÅžytkownik końcowy chce uÅžyć tych list jako listy pobierania dla własnego zbioru danych, to leÅžy to po stronie odpowiedzialności kuratorÃģw.

WśrÃģd nich jest zbiÃģr Conceptual 12M firmy Google Research, ktÃģry dostarcza opisy obrazÃģw, ale wskazuje tylko lokalizacje w sieci, w ktÃģrych te obrazy istnieją (lub istniały w momencie kuracji):

Dwa przykłady z kuracji Conceptual 12M. ÅđrÃģdło - https://github.com/google-research-datasets/conceptual-12m/blob/main/images/cc12m_1.jpg

Dwa przykłady z kuracji Conceptual 12M. ÅđrÃģdło

Inny wybitny przykład, ktÃģry ma teraz uzasadniony roszczenie do czci w historii AI, jest zbiÃģr LAION, ktÃģry umoÅžliwił powstanie systemu generatywnego Stable Diffusion w 2022 roku – pierwszej takiej ramy, ktÃģra oferowała potęŞne, otwarte obrazy generatywne uÅžytkownikom końcowym, gdy systemy własnościowe wydawały się ustanawiać takie usługi jako wyłącznie komercyjne:

Jeden z wielu wariantÃģw projektu LAION, zawierający nowoczesne i chronione prawem autorskim dzieła sztuki. ÅđrÃģdło - https://huggingface.co/datasets/laion/relaion-pop/viewer/default/train

Jeden z wielu wariantÃģw projektu LAION, zawierający nowoczesne i chronione prawem autorskim dzieła sztuki. ÅđrÃģdło

W wielu przypadkach duÅže rozmiary plikÃģw niektÃģrych z tych “wskazujących” kolekcji wskazują na zawartość obrazÃģw w pliku do pobrania i hostowanym; jednak nieznaczne rozmiary pobierania są często spowodowane duŞą ilością zawartości tekstowej, a czasem rÃģwnieÅž włączaniem wyodrębnionych osadzeń lub funkcji – pochodnych podsumowań lub węzłÃģw innej stosowanej zawartości wyodrębnionej z danych ÅšrÃģdłowych podczas procesu szkolenia.

The Video Premium

Zbiory wideo przedstawiają jeszcze silniejszy przypadek dla podejścia “zbiÃģr przez proxy” lub wskazującego, poniewaÅž duÅžy rozmiar danych magazynowych wymagany do agregacji znaczącej i uÅžytecznej liczby filmÃģw w jedną pobieralną kolekcję jest zabroniony, a “rozproszony” sposÃģb jest poŞądany.

Jednak w obu przypadkach – ale szczegÃģlnie w przypadku wideo – adresy URL ÅšrÃģdłowe reprezentują dane, ktÃģre będą wymagać znaczącej dalszej uwagi przed uÅžyciem w procesach szkoleniowych. Obrazy i filmy będą wymagać zmiany rozmiaru lub decyzji o przycięciu, w celu utworzenia prÃģbek, ktÃģre zmieszczą się w dostępnym miejscu GPU. Nawet powaÅžnie zmniejszone filmy będą wymagać cięcia do bardzo krÃģtkich długości, takich jak 3-5 sekund, zwykle.

Godne uwagi zbiory wideo, ktÃģre uÅžywają odniesień do filmÃģw online (zamiast kuracji i bezpośredniego pakowania filmÃģw), obejmują zbiÃģr Kinetics Human Action Video firmy Google, oraz kolekcję YouTube-8M tej samej firmy, ktÃģra uÅžywa adnotacji segmentu, aby wskazać, jak traktować kaÅždy film po pobraniu – ale ktÃģra ponownie pozostawia uÅžytkownikowi końcowemu pobranie filmÃģw z podanych adresÃģw URL.

Close and Open

Wreszcie, w tej kategorii, “otwarte” dane VFX mogą być generowane z zamkniętymi platformami, ktÃģre następnie publikują i udostępniają wynikowy zbiÃģr danych. Jest rozsądnie zastanowić się, dlaczego tak się dzieje, i rozwaÅžyć, czy moÅže to być spowodowane tym, Åže firma pochodzenia chce zdezynfekować nieprzyjazny IP model gÃģrny, do własnego uÅžycia; lub Åže “prany” zbiÃģr został zaŞądany z zewnątrz.

Jednym z takich przypadkÃģw “prania generacyjnego” jest, rzekomo, zbiÃģr Omni-VFX, ktÃģry zawiera wiele punktÃģw danych z zbiÃģr Open-VFX (ktÃģry sam w sobie odnosi się do wielu zamkniętych i pÃģłotwartych platform, takich jak Pika i PixVerse).

Być moÅže Omni-VFX nie prÃģbuje nawet zbyt mocno:

W otwartym zbiorze Omni-VFX, znajomy twarz. ÅđrÃģdło - https://huggingface.co/datasets/GD-ML/Omni-VFX/blob/main/Harley/pixverse%252Fmp4%252Fmedia%252Fweb%252F15e45744-64b1-4a41-84de-626225cf017b_seed734716767.mp4

W otwartym zbiorze Omni-VFX, znajomy twarz. ÅđrÃģdło

Ancestral Liability

Drugie głÃģwne podejście do prania IP jest przez uÅžycie chronionego materiału w jednym lub wielu miejscach. Jedną z metod w tej kategorii jest uÅžycie danych syntetycznych, ktÃģre zostały przeszkolone, w pewnym momencie w gÃģrę, na chronionych danych. W takich przypadkach, szczegÃģlnie w przypadku generatywnych systemÃģw wideo, ktÃģre muszą generować “niemoÅžliwe” zdarzenia, i zdarzenia, ktÃģre generalnie wpadają w kategorię “efekty wizualne” (VFX).

W istocie, to, co spowodowało, Åže ta kwestia przyszła mi na myśl, było najnowsze w serii prac badawczych oferujących moÅžliwość “abstrakcji” rÃģÅžnych typÃģw efektÃģw wizualnych, takich jak wytwarzanie wiązek laserowych z nieprawdopodobnych części ciała, albo przez szkolenie na zamÃģwionych lub “otwartych” klipach VFX (zamiast bardziej oczywistego ÅšrÃģdła, takiego jak bardzo drogie efekty VFX znalezione w filmach z uniwersum Marvela):

Przykłady ze strony EffectMaker, gdzie “akcja” w ÅšrÃģdłowym klipie (z lewej) jest stosowana do ÅšrÃģdłowego obrazu (środek). ÅđrÃģdło

PowyÅžsze przykłady pochodzą ze strony projektu EffectMaker. EffectMaker nie jest pierwszą ofertą tego roku, ktÃģra prÃģbuje wyodrębnić dynamikę VFX z jednego klipu wideo i przenieść ją do nowego klipu, i w rzeczywistości staje się to oddzielnym zadaniem w badaniach AI VFX*.

Świadomi, Åže giganci medialni, tacy jak Marvel, mają wyÅžszą szansę na wygranie spraw sądowych dotyczących własności intelektualnej (nawet w wymienionym klimacie “wymuszonej tolerancji”), firmy VFX i startupy obecnie idą na znaczne długości, aby upewnić się, Åže ich generatywne ramy VFX są wolne od korporacyjnej własności intelektualnej innych firm.

Przede wszystkim jest to Meta, ktÃģra została zgłoszona na subredditzie r/vfx, aby przeprowadzić dobrze opłacaną zimową rekrutację w 2026 roku, oferując artystom VFX pracę w szkoleniu modeli AI do wytwarzania efektÃģw wizualnych na poziomie Hollywood. ChociaÅž wynagrodzenie nie zostało określone w rÃģÅžnych postach, jeden opisał je jako “emerytalne pieniądze”.

Follow the Money

Jednak trzeba się zastanowić, ile pieniędzy nawet takie firmy jak Meta są skłonne zapłacić za prawdziwą rÃģÅžnorodność i obfitość “ad hoc” efektÃģw VFX, biorąc pod uwagę, Åže średni pojedynczy efekt VFX w filmie blockbusterowym wynosi około 42 000 USD – i wiele z nich jest znacznie droÅžszych.

Dalej, wynika to z faktu, Åže bespośrednie modele generatywne VFX będą ustępowały powszechnemu popytowi, w tym rÃģÅžnym standardowym efektom z najpopularniejszych i najdroÅžszych kategorii filmÃģw.

Ponadto, jeśli takie odtworzenia zostaną przekierowane do modułÃģw dodatkowych, takich jak LoRAs, ktÃģre polegają na modelu podstawowym, wÃģwczas proces jest tylko tak uzasadniony, jak podstawowy model jest “czysty pod względem IP” – i nie wiele z nich jest.

Podobnie, jeśli “nowy” proces uÅžywa innych “hybrydowych” technik, takich jak dokształcanie, gdzie wartość efektu wizualnego zaleÅžy od modeli, priors, lub osadzeń z starszych kolekcji lub modeli niepotwierdzonej integralności, oryginalność pracy jest słusznie kwestionowana i podlega wyzwaniu.

Impossible Missions

Domena efektÃģw wizualnych jest szczegÃģlnie interesującym przypadkiem w odniesieniu do potencjalnego prania IP w zbiorach danych AI, poniewaÅž efekty wizualne często przedstawiają “niemoÅžliwe” rzeczy, dla ktÃģrych nie będzie otwartych alternatyw.

Na przykład, podczas gdy zburzenie budynku mogłoby być przeszkolone w modelu generatywnym z rÃģÅžnych domen publicznych lub innych tanich klipÃģw, jeśli chcesz przeszkolić model, aby wyprodukował ludzkie wiązki laserowe, będziesz musiał przeszkolić go na klipach VFX; takie rzeczy nie zdarzają się nigdzie indziej.

Nawet w przypadku innych rodzajÃģw klęsk Åžywiołowych, takich jak dramatyczne powodzie, dostępne materiały ÅšrÃģdłowe z prawdziwego świata są mało prawdopodobne, aby mogły odtworzyć dramatyczne punkty widzenia na katastrofalne wydarzenia, poniewaÅž (z pewnymi wyjątkami) ludzie nie zwykle transmitują na Åžywo z katastrofalnych miejsc. Dlatego “fajne widoki” na katastrofy są rzadkie w zbiorach danych z prawdziwego świata, a kaÅždy model AI, ktÃģry moÅže je generować, najprawdopodobniej uzyskał te informacje gdzie indziej.

Najbardziej poŞądane przepływy pracy AI nie mają tego poziomu szczegÃģłowości, i w takich przypadkach zaciemnienie korzyści z chronionych danych IP moÅže nie wymagać prawie takiego samego wysiłku.

Conclusion: Entangled Web

Tylko ci, ktÃģrzy uÅžywali generatywnej AI intensywnie i przez dłuÅžszy czas, będą instynktownie rozumieć, Åže takie systemy mają trudności z łączeniem wielu pojęć, gdy nie ma porÃģwnywalnych przykładÃģw w ich danych szkoleniowych.

Te ograniczenia są znane jako splątanie, w ktÃģrym rÃģÅžne aspekty przeszkolonych pojęć mają tendencję do grupowania się razem z powiązanymi elementami, zamiast rozkładać się na przydatne, klocki Lego, ktÃģre moÅžna układać w dowolną nową konfigurację, jaką uÅžytkownik mÃģgłby sobie Åžyczyć.

Splątanie jest architektoniczną czarną dziurą, z ktÃģrej prawie nie moÅžna uciec, przynajmniej dla podejść opartych na dyfuzji, ktÃģre charakteryzują wszystkie obecne ramy AI. Jednak moÅže się okazać, Åže nowe podejścia pojawią się w ciągu najbliÅžszych kilku lat, ktÃģre będą lepsze w dyskretnej separacji przeszkolonych pojęć, aby mogły być bardziej zwinne i oferować mniej wskazÃģwek co do ich pochodzenia.

 

* Nie stawiam Åžadnych oskarÅžeń przeciwko EffectMaker, ale komentuję tu ogÃģlność nowego nurtu w badaniach AI wideo.

† PoniewaÅž te strzały, w tego rodzaju filmach, wygenerowały i nadal generują pieniądze.

Pierwotnie opublikowane w poniedziałek, 16 marca 2026

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]