Unghiul lui Anderson

Acordarea de “Identități Secrete” Personajelor de Desen Animate Copyrightate

mm
Adaugă Unite.AI la sursele tale preferate pe Google
An image depicting a Marvel superhero 'anonymized' into a grey and unknown character, based on AI-generated/modified work from https://in.pinterest.com/pin/369928556910022951/ , and itself further modified with Z-Image. On the right, results from a new paper aiming to protect copyrighted animation characters by replacing them with generic substitutes. Source - https://arxiv.org/pdf/2608.12806

Noi cercetări din China oferă o metodă neinvazivă de protejare a personajelor de desen animate copyrightate, prin “injectarea” unor înlocuitori generici în timpul inferenței. Dar poate această metodă învinge ingeniozitatea hackerilor de prompturi?

 

Având în vedere extinderea materialului copyrightat prezent în seturile de date de mare scară (din cauza costului ridicat de a elimina astfel de încălcări), modelele antrenate pe acestea tind să poată reproduce personaje copyrightate.

Ediția directă a modelului antrenat sau utilizarea filtrelor pentru a intercepta cuvintele cheie atunci când modelul este accesat prin API poate fi adesea învinsă prin descrierea elementului copyrightat în mod eliptic:

Un personaj copyrightat produs de un chatbot AI popular, aparent fără invocarea directă a numelui personajului. Sursă - https://www.unite.ai/censoring-ai-models-does-not-work-well-study-reveals/#:~:text=shortcomings%20of%20the%20studied%20editing%20methods

Un personaj copyrightat produs de un chatbot AI popular, aparent fără invocarea directă a numelui personajului. Sursă

Într-un puternic și persistent curent de cercetare, tehnicile de modificare a modelului au încercat să modifice parametrii într-un model antrenat, cu rezultate variate:

Din lucrarea din 2023 Ablating Concepts in Text-to-Image Diffusion Models, reprezentările fotorealiste ale actriței Brie Larson în rolul lui 'Captain Marvel' – integrate într-un model de difuzie popular – sunt transformate în imagini de desen animate legate de context atunci când sunt solicitate de utilizator. Sursă - https://arxiv.org/pdf/2407.12383

Din lucrarea din 2023 Ablating Concepts in Text-to-Image Diffusion Models, reprezentările fotorealiste ale actriței Brie Larson în rolul lui 'Captain Marvel' – integrate într-un model de difuzie popular – sunt transformate în imagini de desen animate legate de context atunci când sunt solicitate de utilizator. Sursă

Însă, ablația este de obicei un proces dăunător și imprecis, și unul care poate afecta frecvent alte caracteristici ale modelului antrenat; în plus, există mai multe modalități de a o evita.

Altă abordare populară este “promptarea negativă”, în care un “antiprompt” suplimentar este trimis modelului, proiectat pentru a constrânge ieșirea. Atunci când modelele sunt accesate prin API (așa cum sunt toate modelele de frontieră, de exemplu), un “prompt negativ secret” poate fi trimis împreună cu promptul cunoscut de utilizator, alcătuit dintr-un set de reguli proiectat pentru a preveni modelul să furnizeze material interzis utilizatorului. Această abordare, deși populară ca vector de protecție a drepturilor de autor, nu funcționează întotdeauna.

Cele mai multe lucrări din jurul cenzurării post-factum a inferenței se ocupă de problema mai largă de a se asigura că modelele nu produc CSAM sau orice fel de material NSFW, în ciuda cantităților mari de astfel de material care au fost probabil prezente în datele de antrenare ale unui model major. Astfel de inițiative pot afecta întregi clase de conținut, mai degrabă decât instanțe specifice, și de obicei lipsesc de subtilitatea necesară pentru a aborda preocupările deținătorilor de drepturi de autor care doresc să supprime anumite identități.

Body Doubles

Având în vedere acestea, o nouă lucrare din China propune înlocuirea personajelor de desen animate copyrightate în timpul generării de imagini cu înlocuitori generici învățați – “dubluri” care păstrează suficient de mult din forma și structura personajului pentru a conserva scena înconjurătoare, dar elimină orice detalii distinctive asociate cu personajul protejat:

Reprezentări 'anonimizate' ale materialului copyrightat prezent și accesibil într-un model antrenat, realizate prin noua metodă de încorporare. Sursă - https://arxiv.org/pdf/2410.05309v1

Reprezentări 'anonimizate' ale materialului copyrightat prezent și accesibil într-un model antrenat, realizate prin noua metodă de încorporare. Sursă

În mod crucial, această intervenție are loc în timpul generării fără a modifica sau a ajusta fin modelul de difuzie subiacent, și poate fi ajustată pentru a determina în ce măsură personajul original este șters.

Aproape, această abordare recunoaște tacit că modificarea modelului este o metodă slabă pentru acest scop, și în schimb injectează încorporări create în procesul de inferență – încorporări proiectate pentru a “refactori” mai degrabă decât a abla (a șterge) activele copyrightate. Procesul nu afectează sau modifică modelul de bază deloc, și astfel poate fi reutilizat sau adaptat pentru o varietate de modele.

Deși metoda a fost testată de autori pe mai vechiul Stable Diffusion serie de modele, a fost testată și cu succes pe mult mai recenta arhitectură Z-Image, sugerând că conceptul autorilor este aplicabil pe o gamă de arhitecturi generative.

Lucrarea afirmă:

‘[Noi] propunem o metodă controlabilă care operează pe reprezentarea textuală continuă a modelului pentru a șterge personaje țintă în timpul generării. [Optimizăm] o încorporare ancoră prin constrângeri structurale și detaliate pentru a servi ca substitut pentru personaj, apoi [înlocuim] încorporările țintă cu ancora prin intermediul unei strategii adaptative care ține cont de structură.

‘Experimentele arată că metoda noastră atinge o eficacitate de ștergere de ultimă generație și o conservare a fidelității imaginii, în timp ce susține un grad controlabil de ștergere, eliminare multi-țintă și transferabilitate a modelului.

‘Mai mult, ancora noastră optimizată este plug-and-play cu liniile de bază actuale de modificare a modelului pentru a îmbunătăți performanța lor de ștergere.’

Noua metodă traversează arhitecturi diverse și oferă control granular, conform autorilor.

Noua metodă traversează arhitecturi diverse și oferă control granular, conform autorilor.

Noua lucrare se intitulează Șterge dar Conservă: Ștergere Controlabilă a Personajelor de Desen Animate Copyrightate prin Ancore Semantice Optimizate, și provine de la șapte autori de la Institutul de Inginerie a Informației de la Academia Chineză de Științe, și de la Universitatea Academiei Chineze de Științe din Beijing.

Metodă

Ideea centrală din spatele noii metode, așa cum se arată mai jos, este de a crea un substitut pentru fiecare personaj copyrightat care păstrează forma și structura largă, dar elimină detaliile distinctive care fac personajul recunosibil – și apoi de a utiliza acest substitut în timpul generării de imagini ori de câte ori personajul protejat este solicitat.

Schema pentru noua abordare.

Schema pentru noua abordare.

Substitutul, pe care autorii îl numesc ancoră, este proiectat pentru a păstra suficient de mult din forma și structura personajului original pentru a se potrivi natural în aceeași scenă, în timp ce elimină detaliile care fac personajul distinctiv.

Pentru a face acest lucru, sistemul compară informații structurale grosiere generate pentru personajul original cu cele generate pentru ancora în curs de dezvoltare, împingându-le pe ambele spre o formă generală similară. O imagine de referință a personajului copyrightat este apoi utilizată pentru scopul opus, împingând ancora departe de detaliile sale distinctive:

Metodă de construire a unui substitut neîncălcător pentru un personaj copyrightat. Structura largă a personajului este păstrată, în timp ce detaliile sale distinctive vizuale sunt suprimate, producând o ancoră optimizată pentru utilizare în timpul generării.

Metodă de construire a unui substitut neîncălcător pentru un personaj copyrightat. Structura largă a personajului este păstrată, în timp ce detaliile sale distinctive vizuale sunt suprimate, producând o ancoră optimizată pentru utilizare în timpul generării.

Rezultatul este astfel o ancoră care ocupă un teren mijlociu intenționat între păstrarea compoziției solicitate și eliminarea identității protejate.

Anchor Away

Odată ce aceste proprietăți au fost stabilite, ancora trebuie transformată în ceva pe care modelul de difuzie îl poate înțelege. Termenul de înlocuire Anchor* [sic] primește astfel o reprezentare învățabilă în interiorul encoderului de text CLIP, efectiv creând un cuvânt/articol artificial nou, a cărui semnificație poate fi modelată fără a schimba modelul de generare de imagini subiacent.

Această nouă reprezentare este ajustată repetat în conformitate cu obiectivele structurale și de detaliu descrise mai sus, predând Anchor* să însemne ceva cu o formă largă asemănătoare cu personajul protejat, dar lipsit de apariția sa distinctivă.

Restul encoderului de text rămâne înghețat în timpul acestui proces, în timp ce tokenii obișnuiți de start, sfârșit și umplere care înconjoară Anchor* oferă contextul necesar pentru a transforma acest cuvânt pseudo-învățat în încorporările finale utilizate în timpul generării.

Înlocuire Adaptivă

În timpul generării (inferenței), algoritmul caută în promptul codificat termeni asociați cu personajul protejat și înlocuiește încorporările ancoră învățate în locul lor, ajustând și încorporările de sfârșit și umplere care transportă informații contextuale.

Pentru a se pregăti pentru acest lucru, sistemul permite mai întâi denoising pentru a stabili compoziția generală a imaginii solicitate, monitorizând schimbări în structura sa grosieră pentru a determina când acea dispunere a început să se stabilizeze:

O reprezentare a momentului în care are loc înlocuirea ancorii în timpul generării de imagini. Schimbările în structura imaginea grosieră sunt urmărite pe parcursul denoising-ului, cu înlocuirea declanșată în jurul punctului în care dispunerea generală se stabilizează și detaliile mai fine încep să apară.

O reprezentare a momentului în care are loc înlocuirea ancorii în timpul generării de imagini. Schimbările în structura imaginea grosieră sunt urmărite pe parcursul denoising-ului, cu înlocuirea declanșată în jurul punctului în care dispunerea generală se stabilizează și detaliile mai fine încep să apară.

În imaginea de mai sus, vedem această tranziție care are loc la aproximativ timpul 720, unde schimbarea structurală măsurată atinge punctul său culminant și apoi începe să scadă. La acest punct, aranjamentul general al imaginii s-a format în mare măsură, permițând ancorii să înlocuiască personajul protejat, reducând în același timp riscul de a deranja compoziția stabilită.

Date și Teste

Autorii au comparat abordarea lor cu cinci linii de bază bazate pe prompturi: Difuzie Latentă Sigură (SLD); STG; SAFREE; TraSCE; și Promptare Negativă (NP).

Încorporările ancoră optimizate au fost integrate și în patru metode existente de modificare a modelului: MACE; UCE; ESD-u; și AC. Acest lucru a fost făcut pentru a testa dacă acestea pot îmbunătăți modelul propus în ceea ce privește eliminarea personajelor.

Pentru evaluare, a fost alcătuit un set de date cu 80 de personaje de desen animate, cuprinzând 36 de personaje antropomorfe; 23 de personaje sub formă de animale; și 21 din categorii diverse – cu toate personajele selectate fiind capabile să fie reproduse în mod fiabil de modelele de difuzie.

Au fost generate apoi 100 de imagini pentru fiecare personaj, utilizând prompturi produse de GPT-4o.

Stable Diffusion v1.4 a fost utilizat pentru experimentele principale, cu transferabilitatea testată suplimentar pe versiuni ulterioare de Stable Diffusion v1.5; V2; v2.1; XL base 1.0; și, de asemenea, pe arhitectura DiT mai recentă Z-Image. Nu s-a efectuat nicio ajustare fină a modelului, lăsând parametrii fiecărui model preantrenat nemodificați.

Pentru metrici, LLaVA-1.5 și BLIP-3 au măsurat dacă personajul țintă a rămas recunosibil, cu acuratețe mai mică de identificare indicând o ștergere mai completă; Indicele de Similaritate Structurală (SSIM) a măsurat conservarea structurală; Metricile Perceptuale Învățate (LPIPS) au măsurat diferența perceptuală; și Scoica Predictor V2 a evaluat calitatea vizuală a imaginii modificate.

Distanța de Începtare Fréchet (FID) și Scoica CLIP au fost calculate suplimentar din prompturi nelegate în COCO-30K, pentru a măsura dacă generarea de imagini normală a fost afectată:

Rezultatele testelor care compară metodele de ștergere a personajelor pe 80 de personaje de desen animate. Primele două coloane măsoară cât de des personajul șters poate fi încă recunoscut, astfel încât scorurile mai mici indică o ștergere mai bună. Coloanele rămase măsoară cât de bine a fost păstrată imaginea originală și generarea nelegată. Săgețile arată dacă scorurile mai mari sau mai mici sunt preferabile; caracterele aldine indică cel mai bun rezultat, iar sublinierea indică al doilea cel mai bun rezultat.

Rezultatele testelor care compară metodele de ștergere a personajelor pe 80 de personaje de desen animate. Primele două coloane măsoară cât de des personajul șters poate fi încă recunoscut, astfel încă scorurile mai mici indică o ștergere mai bună. Coloanele rămase măsoară cât de bine a fost păstrată imaginea originală și generarea nelegată. Săgețile arată dacă scorurile mai mari sau mai mici sunt preferabile; caracterele aldine indică cel mai bun rezultat, iar sublinierea indică al doilea cel mai bun rezultat.

Dintre aceste rezultate inițiale pentru comparația cantitativă, autorii afirmă:

‘Comparativ cu toate liniile de bază, imaginile șterse utilizând metoda noastră ating acuratețe mai mică pentru identificarea țintei de către LLaVA-1.5 (6.0%) și BLIP-3 (4.0%), cu reduceri de 3.5% și 1.7% comparativ cu a doua cea mai mică, respectiv.

‘Acest lucru demonstrează eficacitatea metodei noastre de ștergere, deoarece aceasta [înșeală] modelele mari multimodale.’

Pentru fidelitatea imaginii, metoda autorilor a produs scorul SSIM cel mai ridicat, de 0,467, și scorul LPIPS cel mai mic, de 0,505 – indicând conservarea cea mai puternică a conținutului nelegat și a structurii de fundal dintre metodele testate. De asemenea, a atins cel mai ridicat scor de predictor estetic V2 dintre metodele de ștergere a personajelor, de 5,18, sugerând că această conservare nu vine la costul calității vizuale generale.

Un test calitativ a urmat:

Rezultatele testelor care compară ștergerea personajelor pe cinci personaje de desen animate. Fiecare rând arată rezultate de la o metodă diferită, cu generările originale Stable Diffusion v1.4 la partea superioară și metoda propusă la partea inferioară. Metoda propusă înlocuiește mai consistent personajele țintă, păstrând scena înconjurătoare.

Rezultatele testelor care compară ștergerea personajelor pe cinci personaje de desen animate. Fiecare rând arată rezultate de la o metodă diferită, cu generările originale Stable Diffusion v1.4 la partea superioară și metoda propusă la partea inferioară. Metoda propusă înlocuiește mai consistent personajele țintă, păstrând scena înconjurătoare. Vă rugăm să consultați sursa PDF originală sau site-ul proiectului pentru o rezoluție puțin mai bună.

Conform lucrării, exemplele arată diferențe deosebit de clare pentru personaje cu forme și atribute mai complexe, cu Donald Duck și Super Mario menționați ca exemple:

‘[Metoda noastră] realizează ștergerea fără cusur a personajelor de desen animate prin intermediul unor ancore optimizate, în timp ce liniile de bază bazate pe prompturi adesea eşuează—în special pentru personaje cu forme și atribute complexe (de exemplu, Donald Duck și Super Mario).

‘În plus, metoda noastră realizează coerența fundalului fără artefacte de estompare sau deformare, sprijinind fluxuri de lucru creative iterative.’

Control Granular

Un spațiu de încorporare continuă permite, de asemenea, ajustarea puterii de ștergere a personajului, mai degrabă decât a trata ștergerea ca o propoziție de da sau nu. Prin interpolarea între ancora optimizată și încorporarea țintă originală, metoda poate restaura progresiv mai mult din personaj, păstrând în același timp structura imaginii înconjurătoare:

Imagini de test care arată diferite grade de ștergere a personajului. Primele trei coloane arată personajul original, versiunea ștearsă și caracteristicile vizuale eliminate; coloanele rămase arată setări intermediare la α=0.25, 0.5 și 0.75. Valori mai mari ale lui α păstrează progresiv mai mult din personajul original.

Imagini de test care arată diferite grade de ștergere a personajului. Primele trei coloane arată personajul original, versiunea ștearsă și caracteristicile vizuale eliminate; coloanele rămase arată setări intermediare la α=0.25, 0.5 și 0.75. Valori mai mari ale lui α păstrează progresiv mai mult din personajul original. Vă rugăm să consultați sursa PDF originală sau site-ul proiectului pentru o rezoluție puțin mai bună.

Pe lângă aceasta, autorii au testat și controlul acesta pe personajele Winnie the Pooh; Olaf; Minnie Mouse; și Stitch. Similaritatea structurală a rămas relativ stabilă pe măsură ce s-a schimbat puterea de restaurare, în timp ce recunoașterea de către LLaVA-1.5 și BLIP-3 a crescut pe măsură ce mai mult din fiecare personaj a fost restaurat.

Winnie the Pooh și Stitch au devenit recunoscute pe intervale înguste; Olaf și Minnie Mouse s-au schimbat mai gradual; și Minnie Mouse a devenit recunoscută cu o restaurare relativ mică, demonstrând că puterea adecvată de ștergere depinde de personajul vizat.

Au fost efectuate și experimente suplimentare pentru a înlocui mai multe ținte într-un singur pas, și ne referim cititorul la lucrarea sursă pentru mai multe detalii despre aceasta și pentru rezultate suplimentare.

Concluzie

Ca întotdeauna, această ultimă întorsătură a gardurilor de drepturi de autor este echivalentă cu a închide poarta după ce calul a fugit.

În acele cazuri rare în care cercetătorii și companiile au încercat să suprime capacitatea modelului de a produce nuditate și/sau pornografie, prin a tăia efectiv accesul intern la material “NSFW” din setul de date (deoarece încă este prea scump să-l curățe), s-a dovedit că modelul nu mai poate înțelege anatomia umană în mod corespunzător.

Noua abordare propusă aici este, în mod evident, echivalentă cu a exciza/genericiza o anumită vedetă porno, într-un caz în care un filtru NSFW era construit pentru un model antrenat pe conținut web scrapat în mod indiscriminat. Pentru noua metodă, crearea unui “dublu generic” pentru un personaj copyrightat trebuie să lase domeniul supereroului intact în spațiul latent al modelului; și cu cât personajul copyrightat vizat este mai important, cu atât mai mult definește domeniul său în spațiul antrenat.

Prin urmare, eliminarea lui este ca și cum ai încerca să elimini zahărul din cafea, odată ce a fost amestecat.

Deci, deși această abordare poate avea un anumit succes limitat dacă este adăugată la zidurile API în creștere ale modelelor de frontieră, natura interconectată a unui model GenAI sugerează, istoric, că materialul copyrightat vizat de această metodă poate rămâne accesibil prin ingeniozitatea obișnuită a prompterilor.

 

Publicat pentru prima dată vineri, 14 august 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai