Andersonův úhel

Automatizace ochrany autorských práv u obrázků generovaných umělou inteligencí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
ChatGPT-4o: ' 1792x1024px image of a Front view of a British high court tribunal composed of three robots in judicial wigs. They are all examining an 8x10 photograph, but we cannot see what the photograph is, because its back is towards us. HQ, cinematic still'

Jak jsme diskutovali minulý týden, i základní modely za populárními generativními systémy umělé inteligence mohou produkovat obsah porušující autorská práva, a to kvůli nedostatečné nebo nesprávně zaměřené kuraci a také kvůli přítomnosti více verzí stejného obrázku v trénovacích datech, což vede k přeučení a zvyšuje pravděpodobnost rozpoznatelných reprodukcí.

Přes snahu ovládnout trh s generativní umělou inteligencí a rostoucí tlak na potlačování porušování práv duševního vlastnictví, velké platformy jako MidJourney a OpenAI’s DALL-E stále čelí výzvám při prevenci neúmyslné reprodukce chráněného obsahu:

Schopnost generativních systémů reprodukovat chráněná data se pravidelně objevuje v médiích.

Schopnost generativních systémů reprodukovat chráněná data se pravidelně objevuje v médiích.

Jakmile vznikají nové modely a čínské modely získávají dominantní postavení, potlačování chráněného materiálu v základních modelech je obtížným úkolem; ve skutečnosti, lídr trhu open.ai prohlásil loni, že je ‘nemožné’ vytvořit efektivní a užitečné modely bez chráněných dat.

Prior Art

V souvislosti s neúmyslnou generací chráněného materiálu, výzkum čelí podobné výzvě jako zařazení pornografického a jiného nevhodného obsahu do zdrojových dat: jeden chce mít prospěch z poznání (tj. správnou lidskou anatomii, která byla historicky vždy založena na studiích nahých postav) bez možnosti zneužití.

Podobně, tvůrci modelů chtějí mít prospěch z obrovského rozsahu chráněného materiálu, který se nachází v hyperscale sadách, jako je LAION, bez toho, aby model získal schopnost skutečně porušovat práva duševního vlastnictví.

Ponechání stranou etických a právních rizik spojených s pokusem o skrytí použití chráněného materiálu, filtrování pro druhý případ je podstatně obtížnější. NSFW obsah často obsahuje rozlišitelné nízkouhladné funkce, které umožňují stále účinnější filtrování bez nutnosti přímého srovnání se skutečnými daty. Naopak, latentní vložené funkce, které definují miliony chráněných děl, se nesnižují na sadu snadno identifikovatelných znaků, což činí automatizované zjišťování mnohem složitějším.

CopyJudge

Lidský úsudek je vzácným a drahým zbožím, a to jak v kuraci dat, tak ve vytváření post-procesních filtrů a “bezpečnostních” systémů, které jsou navrženy tak, aby zajistily, že materiál chráněný autorskými právy není dodán uživatelům API-založených portálů, jako je MidJourney a obraz-generující kapacita ChatGPT.

Proto nová akademická spolupráce mezi Švýcarskem, Sony AI a Čínou nabízí CopyJudge – automatizovanou metodu orchestrace následujících skupin spiklenců založených na ChatGPT, které mohou zkoumat vstupy na známky pravděpodobného porušení autorských práv.

CopyJudge vyhodnocuje různé IP-porušující AI generace. Zdroj: https://arxiv.org/pdf/2502.15278

CopyJudge vyhodnocuje různé IP-porušující AI generace. Zdroj: https://arxiv.org/pdf/2502.15278

CopyJudge efektivní nabízí automatizovaný rámec využívající velké vize-jazykové modely (LVLM) k určení podstatné podobnosti mezi chráněnými obrázky a těmi, které jsou generovány text-to-obrázek difuzními modely.

Přístup CopyJudge používá učení s posilováním k optimalizaci porušujících autorská práva promptů a poté používá informace z těchto promptů k vytvoření nových promptů, které jsou méně pravděpodobné vyvolat chráněné obrázky.

Přístup CopyJudge používá učení s posilováním k optimalizaci porušujících autorská práva promptů a poté používá informace z těchto promptů k vytvoření nových promptů, které jsou méně pravděpodobné vyvolat chráněné obrázky.

Přestože mnoho online AI-založených obraz-generátorů filtruje uživatelské prompty pro NSFW, chráněný materiál, rekreaci skutečných lidí a různé jiné zakázané domény, CopyJudge místo toho používá rafinované “porušující” prompty k vytvoření “sanitizovaných” promptů, které jsou nejméně pravděpodobné vyvolat zakázané obrázky, bez záměru přímo blokovat uživatelský vstup.

Přestože to není nová metoda, jde určitou cestu k osvobození API-založených generativních systémů od jednoduchého odmítnutí uživatelského vstupu (neboť to umožňuje uživatelům vyvinout způsob obcházení disallowed generací, prostřednictvím experimentování).

Jedna nedávná exploitační metoda (která byla odstraněna vývojáři) umožnila uživatelům generovat pornografický materiál na platformě Kling generativní AI jednoduše tím, že do obrázku nahráli prominentní kříž nebo křížek v obraze-to-video workflow.

V mezery, která byla opravena vývojáři Kling v pozdním roce 2024, mohli uživatelé donutit systém k produkci zakázaných NSFW výstupu jednoduše tím, že do obrázku nahráli kříž nebo křížek. Přestože nebyla poskytnuta žádná vysvětlení logiky za touto nyní zrušenou exploatací.

Případy, jako je tento, zdůrazňují potřebu sanitizace promptů v online generativních systémech, zejména proto, že strojové zapomínání, při kterém je sám základový model změněn tak, aby odstranil zakázané koncepty, může mít nepříznivé účinky na konečnou použitelnost modelu.

Hledajíce méně drastická řešení, systém CopyJudge napodobuje lidské právní úsudky pomocí umělé inteligence k rozdělení obrázků na klíčové prvky, jako je kompozice a barva, k filtrování necopyrightovatelných částí a porovnání toho, co zbývá. Také zahrnuje metodu AI, která upravuje prompty a modifikuje generování obrázků, aby pomohla vyhnout se problémům s autorskými právy, zatímco zachovává kreativní obsah.

Experimentální výsledky, které autoři uvádějí, ukazují, že CopyJudge je srovnatelný se stávajícími přístupy v tomto úsilí a že systém vykazuje lepší generalizaci a interpretovatelnost ve srovnání s předchozími pracemi.

Nová práce nese název CopyJudge: Automatizované zjišťování a zmírnění porušování autorských práv v text-to-obrázek difuzních modelech a pochází od pěti výzkumníků z EPFL, Sony AI a Čínské univerzity Westlake.

Metoda

Přestože CopyJudge používá GPT k vytvoření rolujících tribunálů automatizovaných soudců, autoři zdůrazňují, že systém není optimalizován pro produkt OpenAI a že jakýkoli jiný velký vize-jazykový model (LVLM) by mohl být použit místo něj.

V první instanci je vyžadován abstraktní filtrační-komparační rámec autorů k rozdělení zdrojových obrázků na své části, jak je znázorněno na levé straně schématu níže:

Konceptuální schéma pro počáteční fázi workflow CopyJudge.

Konceptuální schéma pro počáteční fázi workflow CopyJudge.

V levém dolním rohu vidíme filtrační agent, který rozděluje části obrázku v pokusu o identifikaci charakteristik, které by mohly být vlastní chráněnému dílu, ale které by samy o sobě byly příliš obecné, aby mohly být považovány za porušení.

Následně jsou použity multiple LVLM k vyhodnocení filtrovaných prvků – přístup, který byl prokázán jako účinný v pracích, jako je 2023 CSAIL Vylepšení faktuality a uvažování v jazykových modelech pomocí víceagentní debaty a ChatEval, mezi dalšími.

Autoři prohlašují:

‘[My] přijímáme plně propojený synchronní komunikační debatní přístup, kde každý LVLM dostává [odpovědi] od [jiných] LVLM, než udělá další úsudek. To vytváří dynamickou zpětnou smyčku, která posiluje spolehlivost a hloubku analýzy, protože modely upravují své hodnocení na základě nových poznatků prezentovaných svými kolegy.

‘Každý LVLM může upravit své skóre na základě odpovědí od ostatních LVLM nebo je nechat beze změny.’

Do procesu jsou také zahrnuty páry obrázků hodnocené lidmi prostřednictvím málo-shot učení v kontextu.

Mitigace

Následně se autoři soustředili na proces mitigace promptů, který byl popsán dříve.

Schéma CopyJudge pro zmírnění porušování autorských práv úpravou promptů a latentního šumu. Systém upravuje prompty iterativně na základě iterativních zpětných vazeb a používá učení s posilováním k modifikaci latentních proměnných, snižuje riziko porušení.

Schéma CopyJudge pro zmírnění porušování autorských práv úpravou promptů a latentního šumu. Systém upravuje prompty iterativně, používá učení s posilováním k modifikaci latentních proměnných, jak se prompty vyvíjejí, doufá, že sníží riziko porušení.

Dvě metody, které byly použity pro mitigaci promptů, byly založené na LVLM a založené na učení s posilováním.

Data a testy

K otestování CopyJudge byly použity různé datové sady, včetně D-Rep, která obsahuje reálné a falešné páry obrázků hodnocené lidmi na škále 0-5.

Prohlížení datové sady D-Rep na Hugging Face. Tato kolekce obsahuje páry reálných a generovaných obrázků. Zdroj: https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/

Prohlížení datové sady D-Rep na Hugging Face. Tato kolekce obsahuje páry reálných a generovaných obrázků. Zdroj: https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/

CopyJudge považuje D-Rep obrázky, které získaly skóre 4 nebo více, za příklady porušení, zatímco zbytek je ponechán jako nezávislý na porušování autorských práv. Oficiální 4000 obrázků v datové sadě bylo použito jako testovací obrázky. Kromě toho výzkumníci vybrali a kuratovali obrázky pro 10 slavných kreslených postav z Wikipedie.

Tři difuzní architektury, které byly použity k generování potenciálně porušujících obrázků, byly Stable Diffusion V2; Kandinsky2-2; a Stable Diffusion XL. Autoři ručně vybrali jeden porušující a jeden ne-porušující obrázek z každého modelu, čímž získali 60 pozitivních a 60 negativních vzorků.

Referenční metody, které byly vybrány pro srovnání, byly: L2 norm; Naučená percepční podobnost obrázků (LPIPS); SSCD; RLCP; a PDF-Emb. Pro metriky byly použity Přesnost a F1 skóre jako kritéria pro porušení.

GPT-4o byl použit k naplnění interních debatních týmů CopyJudge, s využitím tří agentů pro maximálně pět iterací na jeden konkrétní obrázek. Tři náhodné obrázky z každého hodnocení v D-Rep byly použity jako lidské priors pro agenty.

Výsledky porušování pro CopyJudge v prvním kole.

Výsledky porušování pro CopyJudge v prvním kole.

Autoři k těmto výsledkům uvádějí:

‘[Je] zřejmé, že tradiční metody detekce kopií obrázků vykazují omezení při úkolu identifikace porušování autorských práv. Naše metoda významně překonává většinu metod. Pro metodu PDF-Emb, která byla trénována na 36 000 vzorcích z D-Rep, naše výkony na D-Rep jsou mírně horší.

‘Nicméně, její špatná výkonnost na Cartoon IP a Artwork dataset zdůrazňuje její nedostatečnou generalizační schopnost, zatímco naše metoda prokazuje stejně vynikající výsledky napříč datovými sadami.’

Autoři také poznamenávají, že CopyJudge poskytuje ‘relativně’ více odlišnou hranici mezi platnými a porušujícími případy:

Další příklady z testovacích kol, v doplňkovém materiálu z nové práce.

Další příklady z testovacích kol, v doplňkovém materiálu z nové práce.

Výzkumníci srovnali svou metodu se spoluprací Sony AI z roku 2024 nazvanou Detekce, vysvětlení a zmírnění memorizace v difuzních modelech. Tato práce používala jemně vyškolený model Stable Diffusion s 200 memorizovanými (tj. přeučeným) obrázky, aby vyvolala chráněná data během inferenční fáze.

Autoři nové práce zjistili, že jejich vlastní metoda mitigace promptů byla schopna produkovat obrázky, které jsou méně pravděpodobné způsobit porušení.

Výsledky mitigace memorizace s CopyJudge v porovnání s prací z roku 2024.

Výsledky mitigace memorizace s CopyJudge v porovnání s prací z roku 2024.

Autoři k tomu uvádějí:

‘[Naše] metoda mohla generovat obrázky, které jsou méně pravděpodobné způsobit porušení, zatímco zachovávala srovnatelnou, mírně sníženou přesnost shody. Jak je vidět na [obrázku níže], naše metoda efektivní vyhýbá se nedostatkům [předchozí] metody, včetně selhání při mitigaci memorizace nebo generování vysoce odchýlených obrázků.’

Srovnání generovaných obrázků a promptů před a po mitigaci memorizace.

Srovnání generovaných obrázků a promptů před a po mitigaci memorizace.

Autoři provedli další testy ve vztahu k mitigaci porušování, studující explicitní a implicitní porušování.

Explicitní porušování nastává, když prompty přímo odkazují na chráněný materiál, jako je ‘Generujte obrázek Mickey Mouse’. K otestování tohoto scénáře autoři použili 20 kreslených a uměleckých vzorků, generujících porušující obrázky v Stable Diffusion v2 s prompty, které explicitně zahrnovaly názvy nebo autorovy atributy.

Srovnání mezi metodou autorů Latentní kontrolou (LC) a metodou Prompt Control (PC) předchozí práce, ve verschiedenen variantách, pomocí Stable Diffusion k vytvoření obrázků znázorňujících explicitní porušování.

Srovnání mezi metodou autorů Latentní kontrolou (LC) a metodou Prompt Control (PC) předchozí práce, ve verschiedenen variantách, pomocí Stable Diffusion k vytvoření obrázků znázorňujících explicitní porušování.

Implicitní porušování nastává, když prompt postrádá explicitní odkazy na autorská práva, ale přesto vede k porušujícímu obrázku kvůli určitým popisným prvkům – scénář, který je zvláště relevantní pro komerční text-to-obrázek modely, které často zahrnují systémy detekce obsahu k identifikaci a blokování promptů souvisejících s autorskými právy.

K prozkoumání tohoto scénáře autoři použili stejné IP-zamčené vzorky jako v testu explicitního porušování, ale generovali porušující obrázky bez přímých odkazů na autorská práva, pomocí DALL-E 3 (ačkoli práce poznamenává, že vestavěný bezpečnostní modul modelu odmítl certain prompty, které aktivovaly jeho filtry).

Implicitní porušování pomocí DALL-E 3, s porušujícím a CLIP skóre.

Implicitní porušování pomocí DALL-E 3, s porušujícím a CLIP skóre.

Autoři uvádějí:

‘[Je] zřejmé, že naše metoda významně snižuje pravděpodobnost porušování, jak pro explicitní, tak pro implicitní porušování, s pouze mírným poklesem CLIP skóre. Skóre porušování po pouze latentní kontrole je relativně vyšší než po kontrole promptů, protože získání ne-porušujících latentních proměnných bez změny promptu je poměrně obtížné. Nicméně, můžeme stále účinně snížit skóre porušování, zatímco zachováme vyšší kvalitu shody obrázku a textu.’

‘[Obrázek níže] ukazuje vizualizační výsledky, kde lze vidět, že se nám daří vyhnout porušování autorských práv, zatímco zachováme požadavky uživatelů.’

Generované obrázky před a po mitigaci porušování autorských práv.

Generované obrázky před a po mitigaci porušování autorských práv.

Závěr

Přestože studie představuje slibný přístup k ochraně autorských práv u obrázků generovaných umělou inteligencí, závislost na velkých vize-jazykových modelech (LVLM) pro detekci porušování může vyvolat obavy o předpojatost a konzistenci, jelikož úsudky umělé inteligence nemusí vždy souhlasit s právními standardy.

Možná nejdůležitější je, že projekt také předpokládá, že vynucování autorských práv lze automatizovat, navzdory skutečným právním rozhodnutím, která často zahrnují subjektivní a kontextové faktory, které umělá inteligence může mít potíže interpretovat.

V reálném světě se zdá, že automatizace právního konsensu, zejména kolem výstupu z umělé inteligence, bude pravděpodobně zůstávat spornou otázkou daleko za touto dobou a daleko za rozsahem domény, kterou tato práce řeší.

Poprvé publikováno v pondělí 24. února 2025.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai