Modely a platformy AI

Problém plagiátu: Jak modely generativní umělé inteligence reprodukují chráněný obsah

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Rychlý pokrok v oblasti generativních modelů umělé inteligence vyvolal nadšení z jejich tvořivého potenciálu. Tyto mocné modely však také představují znepokojivé rizika spojená s reprodukcí chráněného nebo plagiátovaného obsahu bez řádného označení.

Jak neuronové sítě absorbují trénovací data

Moderní systémy umělé inteligence, jako je GPT-3, jsou trénovány prostřednictvím procesu zvaného transfer learning. Tyto systémy absorbují obrovské datové sady získané z veřejných zdrojů, jako jsou webové stránky, knihy, akademické články a další. Například trénovací data GPT-3 zahrnovala 570 gigabytů textu. Během trénování systém hledá vzory a statistické vztahy v tomto obrovském množství dat. Učí se korelacím mezi slovy, větami, odstavci, jazykovou strukturou a dalšími rysy.

To umožňuje systému generovat nový koherentní text nebo obrázky tím, že předpovídá sekvence, které jsou pravděpodobně následovány daným vstupem nebo podnětem. Avšak to také znamená, že tyto modely absorbují obsah bez ohledu na autorská práva, označení nebo rizika plagiátu. V důsledku toho mohou generativní modely umělé inteligence neúmyslně reprodukovat doslovné pasáže nebo parafrázovat chráněný text ze svých trénovacích korpusů.

Klíčové příklady plagiátu umělé inteligence

Obavy z plagiátu umělé inteligence se objevily prominentně od roku 2020 po vydání GPT.

Nedávný výzkum ukázal, že velké jazykové modely (LLM) jako GPT-3 mohou reprodukovat podstatné doslovné pasáže ze svých trénovacích dat bez citace (Nasr et al., 2023; Carlini et al., 2022). Například žalobou The New York Times bylo zjištěno, že software OpenAI generuje články The New York Times téměř doslovně (The New York Times, 2023).

Tyto výsledky naznačují, že některé generativní modely umělé inteligence mohou produkovat nechtěné plagiátorské výstupy, které riskují porušení autorských práv. Avšak prevalence zůstává nejistá kvůli “černé skříňce” velkých jazykových modelů. Žaloba The New York Times tvrdí, že takové výstupy představují porušení, které by mohlo mít významné důsledky pro vývoj generativní umělé inteligence. Celkově důkazy ukazují, že plagiát je inherentním problémem velkých neuronových sítí, který vyžaduje bdělost a ochranná opatření.

Tyto případy odhalují dva klíčové faktory, které ovlivňují rizika plagiátu umělé inteligence:

  1. Velikost modelu – Larger modely jako GPT-3.5 jsou náchylnější k regeneraci doslovných textových pasáží ve srovnání s menšími modely. Jejich větší trénovací datové sady zvyšují expozici chráněnému zdrojovému materiálu.
  2. Trénovací data – Modely trénované na datech získaných z internetu nebo chráněných děl (i když jsou licencovány) jsou více náchylné k plagiátu ve srovnání s modely trénovanými na pečlivě kurátorovaných datech.

Avšak přímé měření prevalence plagiátorských výstupů je obtížné. “Černá skříňka” velkých neuronových sítí činí obtížným plně stopovat spojení mezi trénovacími daty a výstupy modelu. Riziková sazba pravděpodobně závisí silně na architektuře modelu, kvalitě datové sady a formulaci podnětu. Avšak tyto případy potvrzují, že takový plagiát umělé inteligence jednoznačně nastává, což má kritické právní a etické důsledky.

Emerging Plagiarism Detection Systems

V reakci na to výzkumníci začali zkoumat systémy umělé inteligence pro automatické detekování textu a obrázků generovaných modely versus vytvořených lidmi. Například výzkumníci z Mila navrhli GenFace, který analyzuje lingvistické vzory, které jsou charakteristické pro text vytvořený umělou inteligencí. Startup Anthropic také vyvinul interní schopnosti detekce plagiátu pro svůj konverzační model umělé inteligence Claude.

Avšak tyto nástroje mají omezení. Ohromná trénovací data modelů jako GPT-3 činí obtížným identifikovat původní zdroje plagiátovaného textu, pokud je to vůbec možné. Bude potřeba vyvinout robustnější techniky, protože generativní modely budou dále rychle vyvíjet. Do té doby zůstává ruční kontrola nezbytnou pro kontrolu potenciálně plagiátorských nebo porušujících výstupů umělé inteligence před veřejným použitím.

Best Practices to Mitigate Generative AI Plagiarism

Zde jsou některé nejlepší postupy, které mohou vývojáři a uživatelé umělé inteligence přijmout, aby minimalizovali rizika plagiátu:

Pro vývojáře umělé inteligence:

  • Přesně ověřte zdroje trénovacích dat, aby se vyloučily chráněné nebo licencované materiály bez řádného povolení.
  • Vyviněte přísné postupy pro dokumentaci a sledování dat. Zaznamenejte metadata, jako jsou licence, značky, tvůrci atd.
  • Implementujte nástroje pro detekci plagiátu, aby se označily vysoké riziko obsahu před jeho uvolněním.
  • Poskytněte transparentní zprávy o zdrojích trénovacích dat, licencích a původu výstupů umělé inteligence, pokud se objeví obavy.
  • Umožněte tvůrcům snadno opt-out z trénovacích dat. Rychle vyhovte požadavkům na stažení nebo vyloučení.

Pro uživatele generativní umělé inteligence:

  • Podrobně kontrolujte výstupy, zda neobsahují potenciálně plagiátované nebo neoznačené pasáže, před jejich použitím ve velkém měřítku.
  • Nepovažujte umělou inteligenci za plně autonomní tvořivé systémy. Nechte lidské recenzenty kontrolovat konečný obsah.
  • Přednostně používají umělou inteligenci jako pomocný nástroj pro lidskou tvorbu místo generování zcela nového obsahu. Použijte modely pro parafrázování nebo generování nápadů.
  • Konzultujte podmínky poskytovatele umělé inteligence, zásady obsahu a opatření proti plagiátu před použitím. Vyhněte se neprůhledným modelům.
  • Jasně označte zdroje, pokud se v konečném výstupu objeví chráněný materiál, navzdory nejlepšímu úsilí. Neprezentujte práci umělé inteligence jako zcela originální.
  • Omezte sdílení výstupů soukromě nebo důvěrně, dokud nelze plagiátová rizika dále posoudit a řešit.

Striktnější regulace trénovacích dat mohou být také odůvodněné, protože generativní modely budou dále proliferovat. To by mohlo zahrnovat požadavek na souhlas tvůrců před přidáním jejich práce do datových sad. Avšak odpovědnost leží na obou vývojářích a uživatelích, aby uplatňovali etické postupy umělé inteligence, které respektují práva tvůrců.

Plagiarism in Midjourney’s V6 Alpha

Po omezeném podnětu Midjourney’s V6 model někteří výzkumníci byli schopni vygenerovat téměř identické obrázky chráněných filmů, televizních pořadů a screenshotů videoher, které byly pravděpodobně součástí jeho trénovacích dat.

Obrázky vytvořené Midjourney, které se podobají scénám z famózních filmů a videoher

Obrázky vytvořené Midjourney, které se podobají scénám z famózních filmů a videoher

Tyto experimenty dále potvrzují, že i ty nejmodernější vizuální modely umělé inteligence mohou neúmyslně plagiátovat chráněný obsah, pokud zůstává nezkontrolovaný zdroj trénovacích dat. To zdůrazňuje potřebu bdělosti, ochranných opatření a lidského dohledu při nasazování generativních modelů komerčně, aby se omezila rizika porušení.

Reakce firem umělé inteligence na chráněný obsah

Mezi lidskou a umělou inteligencí se rozostřují hranice, což vytváří komplexní otázky autorských práv. Díla, která kombinují lidskou a umělou inteligenci, mohou být chráněna autorskými právy pouze v těch částech, které byly vytvořeny výhradně člověkem.

Úřad pro autorská práva Spojených států nedávno odmítl udělit autorská práva většině aspektů grafického románu vytvořeného umělou inteligencí a člověkem, označiv umění umělé inteligence za ne-lidské. Také vydal směrnice, které vylučují systémy umělé inteligence z “autorství”. Federální soudy potvrdily tento postoj ve věci autorských práv umělé inteligence.

Zatímco žaloby tvrdí, že generativní modely umělé inteligence porušují autorská práva, jako je Getty v. Stability AI a umělci v. Midjourney/Stability AI. Avšak bez “autorů” umělé inteligence se někteří ptají, zda se nároky na porušení autorských práv vůbec vztahují.

V reakci na to velké firmy umělé inteligence, jako jsou Meta, Google (GOOGL ), Microsoft (MSFT ) a Apple (AAPL ), argumentují, že by neměly potřebovat licence nebo platit poplatky za trénování modelů umělé inteligence na chráněných datech.

Zde je souhrn klíčových argumentů velkých firem umělé inteligence v reakci na potenciální nové americké autorské předpisy týkající se umělé inteligence, včetně citací:

Meta argumentuje že uvalení licencí nyní by způsobilo chaos a poskytlo by málo výhod držitelům autorských práv.

Google tvrdí že trénování umělé inteligence je analogické k ne-porušujícím aktům, jako je čtení knihy (Google, 2022).

Microsoft varuje že změna autorských zákonů by mohla znevýhodnit malé vývojáře umělé inteligence.

Apple chce chránit autorskými právy kód generovaný umělou inteligencí, který je řízen člověkem.

Celkově většina firem odmítá nové požadavky na licence a bagatelizuje obavy z reprodukce chráněných děl bez označení. Avšak tento postoj je sporný vzhledem k nedávným žalobám a debatám o autorských právech umělé inteligence.

Cesty pro odpovědnou inovaci generativní umělé inteligence

Jak tyto mocné generativní modely budou dále pokročit, je zásadní řešit rizika plagiátu pro mainstreamový přijetí. Je zapotřebí mnohostranný přístup:

  • Reformy politik týkajících se transparentnosti trénovacích dat, licencí a souhlasu tvůrců.
  • Silnější technologie detekce plagiátu a vnitřní řízení ze strany vývojářů.
  • Větší povědomí uživatelů o rizicích a dodržování etických principů umělé inteligence.
  • Jasná právní precedenty a soudní rozhodnutí týkající se otázek autorských práv umělé inteligence.

S vhodnými ochrannými opatřeními může umělá inteligence podporovaná tvůrčí činnost prosperovat eticky. Avšak neošetřená rizika plagiátu by mohla výrazně podkopat veřejnou důvěru. Přímé řešení tohoto problému je klíčové pro realizaci obrovského tvořivého potenciálu generativní umělé inteligence,同时 respektuje práva tvůrců. Dosažení správné rovnováhy bude vyžadovat aktivní konfrontaci s problémem plagiátu, který je vrozený do samotné povahy neuronových sítí. Avšak takto bude zajištěno, že tyto mocné modely nebudou podkopávat lidskou originalitu, kterou mají za cíl posílit.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.