Kąt Andersona
Metody prania IP w AI

Jeśli nadchodzi prawny rozrachunek związany z wykorzystaniem własności intelektualnej w szkoleniu AI, istnieją również kilka metod zaciemniania takiego wykorzystania.
Opinia Obecna, gwałtownie postępująca rewolucja w generatywnej AI rozgrywa się w najbardziej niepewnym środowisku prawnym, jakie towarzyszyło jakiejkolwiek przełomowej rewolucji technologicznej od XIX wieku.
Aż do 3-4 lat temu społeczność badawcza machine learningu miała niepisane (często jawne) pozwolenie na wykorzystywanie materiałów chronionych prawem autorskim w trakcie tworzenia nowych systemów; ponieważ systemy te nie były jeszcze udane, pod względem dojrzałości lub opłacalności komercyjnej, wyniki były, w każdym sensie, akademickie.
W tym okresie nagły sukces nowego pokolenia modeli językowych opartych na dyfuzji (LLM, takich jak ChatGPT i Claude) i modeli językowo-wizualnych (VLM, takich jak Sora) sygnalizował, że te abstrakcyjne i dotąd “nieszkodliwe” gałęzie badań rozwinęły się w komercyjną opłacalność i wyrosły ze swojego “wolnego passa”, jeśli chodzi o wykorzystywanie cudzej własności intelektualnej.
Od tego momentu posiadacze praw będą ubiegać się o udział w owocach systemów AI szkolonych w dużej mierze lub w części na ich chronionych danych, co doprowadzi do trwającej lawiny spraw sądowych, które wymagają pewnego wysiłku, by je nawet śledzić.

Tutaj ograniczone tylko do spraw wniesionych w USA, nowe sprawy pojawiają się w frenetycznym tempie w Stanach Zjednoczonych i poza nimi. Źródło
Mandating a ‘Free Lunch’
Finansowy zaangażowanie obecnie występujące w odniesieniu do infrastruktury AI zostało przedstawione przez niektóre głosy jako próba umocnienia “podejrzanej pod względem prawa autorskiego” AI tak głęboko w gospodarce społeczeństwa, że stanie się nie tylko “zbyt duża, by upaść”, ale także “zbyt potężna, by pozwolić na udane pozwy” – lub zbyt potężna, by udane pozwy mogły ją obalić.
Ku temu ogólnemu nastawieniu, obecny prezydent Stanów Zjednoczonych wprowadza do polityki swoje zdanie, że ‘Nie można oczekiwać, że będziesz miał udany program AI, gdy każdy artykuł, książka lub cokolwiek innego, co przeczytałeś lub studiowałeś, musisz za to zapłacić’.
Rzeczywiście? Niczego nawet podobnego nie wystąpiło w zachodniej erze przemysłowej, a to reprezentuje ruch, który bardzo szorstko ociera się o tradycyjną amerykańską kulturę pozwów i odszkodowań; być może najbliższe podobne pozycje to obligatoryjne wygaśnięcie patentów medycznych po 20 latach (co jest często atakowane), oraz ograniczenie oczekiwań prywatności w miejscach publicznych.
Jednak czasy się zmieniają; w braku jakiejkolwiek gwarancji, że obecny trend w kierunku “eminent domain” przeciwko ochronie IP nie zawiedzie lub nie zostanie odwrócony później, istnieją kilka wtórnych podejść, które stają się standardową praktyką w rozwoju systemów AI i traktowaniu bardzo spornych danych szkoleniowych, które je napędzają.
Datasets-by-Proxy
Jedno z tych podejść przyjmuje podejście wyjątkowo podobne do (nie zawsze udanej) obrony stron torrentów, które twierdzą, że nie hostują żadnych kontrowersyjnych materiałów – lub żadnych materiałów w ogóle.
Ponadto unikając konieczności przechowywania i udostępniania dużych ilości słabo kompresowalnych danych obrazowych lub wideo, kolekcje tego rodzaju umożliwiają szybkie aktualizacje – takie jak usunięcie materiałów na żądanie posiadaczy praw autorskich – oraz wersjonowanie.
Podobnie jak torrenty są tylko znacznikami, wskazującymi, gdzie można znaleźć chronione prawem autorskim materiały, wiele wpływowych zbiorów danych jest samymi w sobie tylko “wskazującymi” listami istniejących danych; jeśli użytkownik końcowy chce użyć tych list jako listy pobierania dla własnego zbioru danych, to leży to po stronie odpowiedzialności kuratorów.
Wśród nich jest zbiór Conceptual 12M firmy Google Research, który dostarcza opisy obrazów, ale wskazuje tylko lokalizacje w sieci, w których te obrazy istnieją (lub istniały w momencie kuracji):

Dwa przykłady z kuracji Conceptual 12M. Źródło
Inny wybitny przykład, który ma teraz uzasadniony roszczenie do czci w historii AI, jest zbiór LAION, który umożliwił powstanie systemu generatywnego Stable Diffusion w 2022 roku – pierwszej takiej ramy, która oferowała potężne, otwarte obrazy generatywne użytkownikom końcowym, gdy systemy własnościowe wydawały się ustanawiać takie usługi jako wyłącznie komercyjne:

Jeden z wielu wariantów projektu LAION, zawierający nowoczesne i chronione prawem autorskim dzieła sztuki. Źródło
W wielu przypadkach duże rozmiary plików niektórych z tych “wskazujących” kolekcji wskazują na zawartość obrazów w pliku do pobrania i hostowanym; jednak nieznaczne rozmiary pobierania są często spowodowane dużą ilością zawartości tekstowej, a czasem również włączaniem wyodrębnionych osadzeń lub funkcji – pochodnych podsumowań lub węzłów innej stosowanej zawartości wyodrębnionej z danych źródłowych podczas procesu szkolenia.
The Video Premium
Zbiory wideo przedstawiają jeszcze silniejszy przypadek dla podejścia “zbiór przez proxy” lub wskazującego, ponieważ duży rozmiar danych magazynowych wymagany do agregacji znaczącej i użytecznej liczby filmów w jedną pobieralną kolekcję jest zabroniony, a “rozproszony” sposób jest pożądany.
Jednak w obu przypadkach – ale szczególnie w przypadku wideo – adresy URL źródłowe reprezentują dane, które będą wymagać znaczącej dalszej uwagi przed użyciem w procesach szkoleniowych. Obrazy i filmy będą wymagać zmiany rozmiaru lub decyzji o przycięciu, w celu utworzenia próbek, które zmieszczą się w dostępnym miejscu GPU. Nawet poważnie zmniejszone filmy będą wymagać cięcia do bardzo krótkich długości, takich jak 3-5 sekund, zwykle.
Godne uwagi zbiory wideo, które używają odniesień do filmów online (zamiast kuracji i bezpośredniego pakowania filmów), obejmują zbiór Kinetics Human Action Video firmy Google, oraz kolekcję YouTube-8M tej samej firmy, która używa adnotacji segmentu, aby wskazać, jak traktować każdy film po pobraniu – ale która ponownie pozostawia użytkownikowi końcowemu pobranie filmów z podanych adresów URL.
Close and Open
Wreszcie, w tej kategorii, “otwarte” dane VFX mogą być generowane z zamkniętymi platformami, które następnie publikują i udostępniają wynikowy zbiór danych. Jest rozsądnie zastanowić się, dlaczego tak się dzieje, i rozważyć, czy może to być spowodowane tym, że firma pochodzenia chce zdezynfekować nieprzyjazny IP model górny, do własnego użycia; lub że “prany” zbiór został zażądany z zewnątrz.
Jednym z takich przypadków “prania generacyjnego” jest, rzekomo, zbiór Omni-VFX, który zawiera wiele punktów danych z zbiór Open-VFX (który sam w sobie odnosi się do wielu zamkniętych i półotwartych platform, takich jak Pika i PixVerse).
Być może Omni-VFX nie próbuje nawet zbyt mocno:

W otwartym zbiorze Omni-VFX, znajomy twarz. Źródło
Ancestral Liability
Drugie główne podejście do prania IP jest przez użycie chronionego materiału w jednym lub wielu miejscach. Jedną z metod w tej kategorii jest użycie danych syntetycznych, które zostały przeszkolone, w pewnym momencie w górę, na chronionych danych. W takich przypadkach, szczególnie w przypadku generatywnych systemów wideo, które muszą generować “niemożliwe” zdarzenia, i zdarzenia, które generalnie wpadają w kategorię “efekty wizualne” (VFX).
W istocie, to, co spowodowało, że ta kwestia przyszła mi na myśl, było najnowsze w serii prac badawczych oferujących możliwość “abstrakcji” różnych typów efektów wizualnych, takich jak wytwarzanie wiązek laserowych z nieprawdopodobnych części ciała, albo przez szkolenie na zamówionych lub “otwartych” klipach VFX (zamiast bardziej oczywistego źródła, takiego jak bardzo drogie efekty VFX znalezione w filmach z uniwersum Marvela):
Przykłady ze strony EffectMaker, gdzie “akcja” w źródłowym klipie (z lewej) jest stosowana do źródłowego obrazu (środek). Źródło
Powyższe przykłady pochodzą ze strony projektu EffectMaker. EffectMaker nie jest pierwszą ofertą tego roku, która próbuje wyodrębnić dynamikę VFX z jednego klipu wideo i przenieść ją do nowego klipu, i w rzeczywistości staje się to oddzielnym zadaniem w badaniach AI VFX*.
Świadomi, że giganci medialni, tacy jak Marvel, mają wyższą szansę na wygranie spraw sądowych dotyczących własności intelektualnej (nawet w wymienionym klimacie “wymuszonej tolerancji”), firmy VFX i startupy obecnie idą na znaczne długości, aby upewnić się, że ich generatywne ramy VFX są wolne od korporacyjnej własności intelektualnej innych firm.
Przede wszystkim jest to Meta, która została zgłoszona na subredditzie r/vfx, aby przeprowadzić dobrze opłacaną zimową rekrutację w 2026 roku, oferując artystom VFX pracę w szkoleniu modeli AI do wytwarzania efektów wizualnych na poziomie Hollywood. Chociaż wynagrodzenie nie zostało określone w różnych postach, jeden opisał je jako “emerytalne pieniądze”.
Follow the Money
Jednak trzeba się zastanowić, ile pieniędzy nawet takie firmy jak Meta są skłonne zapłacić za prawdziwą różnorodność i obfitość “ad hoc” efektów VFX, biorąc pod uwagę, że średni pojedynczy efekt VFX w filmie blockbusterowym wynosi około 42 000 USD – i wiele z nich jest znacznie droższych.
Dalej, wynika to z faktu, że bespośrednie modele generatywne VFX będą ustępowały powszechnemu popytowi, w tym różnym standardowym efektom z najpopularniejszych i najdroższych kategorii filmów.
Ponadto, jeśli takie odtworzenia zostaną przekierowane do modułów dodatkowych, takich jak LoRAs, które polegają na modelu podstawowym, wówczas proces jest tylko tak uzasadniony, jak podstawowy model jest “czysty pod względem IP” – i nie wiele z nich jest.
Podobnie, jeśli “nowy” proces używa innych “hybrydowych” technik, takich jak dokształcanie, gdzie wartość efektu wizualnego zależy od modeli, priors, lub osadzeń z starszych kolekcji lub modeli niepotwierdzonej integralności, oryginalność pracy jest słusznie kwestionowana i podlega wyzwaniu.
Impossible Missions
Domena efektów wizualnych jest szczególnie interesującym przypadkiem w odniesieniu do potencjalnego prania IP w zbiorach danych AI, ponieważ efekty wizualne często przedstawiają “niemożliwe” rzeczy, dla których nie będzie otwartych alternatyw.
Na przykład, podczas gdy zburzenie budynku mogłoby być przeszkolone w modelu generatywnym z różnych domen publicznych lub innych tanich klipów, jeśli chcesz przeszkolić model, aby wyprodukował ludzkie wiązki laserowe, będziesz musiał przeszkolić go na klipach VFX; takie rzeczy nie zdarzają się nigdzie indziej.
Nawet w przypadku innych rodzajów klęsk żywiołowych, takich jak dramatyczne powodzie, dostępne materiały źródłowe z prawdziwego świata są mało prawdopodobne, aby mogły odtworzyć dramatyczne punkty widzenia na katastrofalne wydarzenia, ponieważ (z pewnymi wyjątkami) ludzie nie zwykle transmitują na żywo z katastrofalnych miejsc. Dlatego “fajne widoki” na katastrofy są rzadkie w zbiorach danych z prawdziwego świata, a każdy model AI, który może je generować, najprawdopodobniej uzyskał te informacje gdzie indziej.
Najbardziej pożądane przepływy pracy AI nie mają tego poziomu szczegółowości, i w takich przypadkach zaciemnienie korzyści z chronionych danych IP może nie wymagać prawie takiego samego wysiłku.
Conclusion: Entangled Web
Tylko ci, którzy używali generatywnej AI intensywnie i przez dłuższy czas, będą instynktownie rozumieć, że takie systemy mają trudności z łączeniem wielu pojęć, gdy nie ma porównywalnych przykładów w ich danych szkoleniowych.
Te ograniczenia są znane jako splątanie, w którym różne aspekty przeszkolonych pojęć mają tendencję do grupowania się razem z powiązanymi elementami, zamiast rozkładać się na przydatne, klocki Lego, które można układać w dowolną nową konfigurację, jaką użytkownik mógłby sobie życzyć.
Splątanie jest architektoniczną czarną dziurą, z której prawie nie można uciec, przynajmniej dla podejść opartych na dyfuzji, które charakteryzują wszystkie obecne ramy AI. Jednak może się okazać, że nowe podejścia pojawią się w ciągu najbliższych kilku lat, które będą lepsze w dyskretnej separacji przeszkolonych pojęć, aby mogły być bardziej zwinne i oferować mniej wskazówek co do ich pochodzenia.
* Nie stawiam żadnych oskarżeń przeciwko EffectMaker, ale komentuję tu ogólność nowego nurtu w badaniach AI wideo.
† Ponieważ te strzały, w tego rodzaju filmach, wygenerowały i nadal generują pieniądze.
Pierwotnie opublikowane w poniedziałek, 16 marca 2026












