Unghiul lui Anderson

Identități Reale Pot Fi Recuperate Din Seturi De Date Sintetice

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Sample comparison images from the paper 'Unveiling Synthetic Faces: How Synthetic Datasets Can Expose Real Identities', including original images (top), and inferred images (bottom).

Dacă anul 2022 a marcat momentul în care potențialul disruptiv al inteligenței artificiale a capturat pentru prima dată atenția publică largă, anul 2024 a fost anul în care întrebările despre legalitatea datelor subiacente au devenit centrale pentru companiile dornice să exploateze puterea acesteia.

Doctrina utilizării corecte din Statele Unite, împreună cu licența științifică implicită care a permis sectoarelor de cercetare academică și comercială să exploreze inteligența artificială generativă, a devenit din ce în ce mai nesustenabilă pe măsură ce au apărut dovezi tot mai multe despre plagiat. În consecință, Statele Unite au interzis, pentru moment, conținutul generat de inteligența artificială să fie protejat prin drepturi de autor.

Aceste chestiuni sunt departe de a fi rezolvate și departe de a fi pe cale de a fi rezolvate curând; în 2023, în parte din cauza creșterii preocupărilor mass-media și publice cu privire la statutul juridic al ieșirilor generate de inteligența artificială, Biroul de Drepturi de Autor al Statelor Unite a lansat o anchetă pe termen lung asupra acestui aspect al inteligenței artificiale generative, publicând prima segment (referitor la replici digitale) în iulie 2024.

Între timp, interesele comerciale rămân frustrate de posibilitatea ca modelele scumpe pe care doresc să le exploateze să le expună la ramificații legale atunci când vor apărea, în cele din urmă, legislația și definițiile definitive.

Soluția scumpă pe termen scurt a fost aceea de a legitima modelele generative prin antrenarea lor pe date pe care companiile le pot exploata în mod legal. Arhitectura text-la-imagine (și acum text-la-video) Firefly a Adobe este alimentată în primul rând de achiziționarea setului de date de imagini stoc Fotolia în 2014, completată de utilizarea datelor publice din domeniul public cu drepturi de autor expirate*. În același timp, furnizorii de stoc de fotografii, cum ar fi Getty și Shutterstock, au profitat de noua valoare a datelor lor licențiate, cu o serie tot mai mare de acorduri pentru a licenția conținut sau pentru a dezvolta propriile sisteme de inteligență artificială generativă conforme cu drepturile de autor.

Soluții Sintetice

Deoarece eliminarea datelor cu drepturi de autor din spațiul latent al unui model de inteligență artificială antrenat este plină de probleme, greșelile în această zonă ar putea fi extrem de costisitoare pentru companiile care experimentează cu soluții pentru consumatori și afaceri care utilizează învățarea automată.

O soluție alternativă și mult mai ieftină pentru sistemele de vedere computerizată (și, de asemenea, pentru Modelele Lingvistice Mari, sau LLM) este utilizarea datelor sintetice, unde setul de date este compus din exemple generate aleatoriu din domeniul țintă (cum ar fi fețe, pisici, biserici sau chiar un set de date mai generalizat).

Site-urile precum thispersondoesnotexist.com au popularizat de mult timp ideea că poze autentice ale “persoanelor nereale” pot fi sintetizate (în acel caz particular, prin intermediul Rețelelor Adversative Generative, sau GAN) fără a avea nicio legătură cu persoane care există în lumea reală.

Prin urmare, dacă antrenați un sistem de recunoaștere facială sau un sistem generativ pe astfel de exemple abstracte și nereale, puteți, în teorie, obține un standard fotorealistic de productivitate pentru un model de inteligență artificială fără a trebui să vă preocupați dacă datele sunt utilizabile din punct de vedere legal.

Ecuație de Balanță

Problema este că sistemele care produc date sintetice sunt ele însele antrenate pe date reale. Dacă urme ale acestor date se scurg în datele sintetice, acest lucru poate oferi dovezi că material restricționat sau neautorizat a fost exploatat în scopuri financiare.

Pentru a evita acest lucru și pentru a produce imagini cu adevărat “aleatorii”, astfel de modele trebuie să se asigure că sunt bine generalizate. Generalizarea este măsura capacității unui model de inteligență artificială antrenat de a înțelege în mod intrinsic concepte de nivel superior (cum ar fi “față”, “bărbat” sau “femeie”) fără a recurge la replicarea datelor de antrenare efective.

În mod nefericit, poate fi dificil pentru sistemele antrenate să producă (sau să recunoască) detalii granulare, cu excepția cazului în care se antrenează pe o perioadă extinsă pe un set de date. Acest lucru expune sistemul la risc de memorizare: o tendință de a reproduce, într-o anumită măsură, exemple din datele de antrenare efective.

Acest lucru poate fi mitigat prin setarea unei rate de învățare mai relaxate sau prin încheierea antrenamentului la un stadiu în care conceptele de bază sunt încă ductile și nu sunt asociate cu un anumit punct de date (cum ar fi o imagine specifică a unei persoane, în cazul unui set de date de fețe).

Cu toate acestea, ambele remedii sunt probabil să ducă la modele cu detalii mai puțin granulare, deoarece sistemul nu a avut ocazia să progreseze dincolo de “bazele” domeniului țintă și până la detalii specifice.

Prin urmare, în literatura științifică, se aplică în general rate de învățare foarte ridicate și programe de antrenament cuprinzătoare. Deși cercetătorii încearcă, de obicei, să facă un compromis între aplicabilitatea largă și granularitatea în modelul final, chiar și sistemele “memorizate” ușor pot să se prezinte adesea ca bine generalizate – chiar și în testele inițiale.

Revelația Feței

Acest lucru ne aduce la un studiu interesant și nou din Elveția, care pretinde a fi primul care demonstrează că imaginile reale originale care alimentează datele sintetice pot fi recuperate din imagini generate care, în teorie, ar trebui să fie complet aleatorii:

Exemple de imagini cu fețe scurse din datele de antrenare. În rândul de sus, vedem imaginile reale (originale); în rândul de jos, vedem imagini generate aleatoriu, care corespund semnificativ cu imaginile reale. Sursă: https://arxiv.org/pdf/2410.24015

Exemple de imagini cu fețe scurse din datele de antrenare. În rândul de sus, vedem imaginile reale (originale); în rândul de jos, vedem imagini generate aleatoriu, care corespund semnificativ cu imaginile reale. Sursă: https://arxiv.org/pdf/2410.24015

Rezultatele, susțin autorii, indică faptul că “generatorii sintetici” au, într-adevăr, memorizat multe dintre punctele de date de antrenare, în căutarea unei granularități mai mari. Ei indică, de asemenea, faptul că sistemele care se bazează pe date sintetice pentru a proteja producătorii de inteligență artificială de consecințele legale ar putea fi foarte nereabile în acest sens.

Cercetătorii au efectuat un studiu extins asupra a șase seturi de date sintetice de ultimă generație, demonstrând că, în toate cazurile, datele originale (posibil protejate prin drepturi de autor sau protejate) pot fi recuperate. Ei comentă:

“Experimentele noastre demonstrează că seturile de date sintetice de recunoaștere facială de ultimă generație conțin mostre care sunt foarte apropiate de mostrele din datele de antrenare ale modelelor lor generative. În unele cazuri, mostrele sintetice conțin modificări mici ale imaginii originale, cu toate acestea, putem observa, de asemenea, în unele cazuri, mostrele generate conțin variații mai mari (de exemplu, poziție diferită, condiții de iluminare etc.), în timp ce identitatea este păstrată.

“Acest lucru sugerează că modelele generative învață și memorează informații legate de identitate din datele de antrenare și pot genera identități similare. Acest lucru creează preocupări critice cu privire la aplicarea datelor sintetice în sarcini sensibile din punct de vedere al confidențialității, cum ar fi biometria și recunoașterea feței.”

Articolul se intitulează Dezvăluirea Fețelor Sintetice: Cum Seturile de Date Sintetice Pot Expune Identități Reale și provine de la doi cercetători de la Institutul de Cercetare Idiap din Martigny, École Polytechnique Fédérale de Lausanne (EPFL) și Université de Lausanne (UNIL) din Lausanne.

Metodă, Date și Rezultate

Fețele memorizate în studiu au fost dezvăluite prin Atacul de Inferență a Calității. Deși conceptul pare complicat, este destul de autoexplicator: inferența calității, în acest caz, se referă la procesul de a pune întrebări unui sistem până când acesta dezvăluie date care fie corespund datelor pe care le căutați, fie semănă semnificativ cu acestea.

Mai multe exemple de surse de date inferate din studiu. În acest caz, imaginile sintetice de sursă provin din setul de date DCFace.

Mai multe exemple de surse de date inferate din studiu. În acest caz, imaginile sintetice de sursă provin din setul de date DCFace.

Cercetătorii au studiat șase seturi de date sintetice pentru care sursa (reală) a setului de date era cunoscută. Deoarece atât seturile reale, cât și cele false de date în cauză conțin un volum foarte mare de imagini, acest lucru este, în esență, ca și cum ai căuta o ac într-o grămadă de fân.

Prin urmare, autorii au utilizat un model de recunoaștere facială de serie, cu o arhitectură ResNet100 antrenată pe funcția de pierdere AdaFace (pe setul de date WebFace12M).

Cele șase seturi de date sintetice utilizate au fost: DCFace (un model de difuziune latentă); IDiff-Face (Uniform – un model de difuziune bazat pe FFHQ); IDiff-Face (Două etape – o variantă care utilizează o metodă de eșantionare diferită); GANDiffFace (bazat pe Rețele Adversative Generative și Modele de Difuziune, utilizând StyleGAN3 pentru a genera identități inițiale și apoi DreamBooth pentru a crea exemple variate); IDNet (o metodă GAN bazată pe StyleGAN-ADA); și SFace (un cadru de protecție a identității).

Deoarece GANDiffFace utilizează atât metode GAN, cât și de difuziune, a fost comparat cu setul de date de antrenare al lui StyleGAN – cel mai apropiat de o “origine reală” pe care această rețea o oferă.

Autorii au exclus seturile de date sintetice care utilizează CGI în loc de metode de inteligență artificială și, la evaluarea rezultatelor, au exclus corespondențele pentru copii, din cauza anomaliilor de distribuție în acest sens, precum și imaginile non-faciale (care pot apărea frecvent în seturile de date faciale, unde sistemele de extragere din web produc falsuri pentru obiecte sau artefacte care au calități asemănătoare feței).

Asemănarea cosinusului a fost calculată pentru toate perechile recuperate și concatenate în histogramă, ilustrată mai jos:

O reprezentare a histogramelor pentru scorurile de asemănare cosinus calculate pe diversele seturi de date, împreună cu valorile lor de asemănare pentru perechile din top-k (linii verticale întrerupte).

O reprezentare a histogramelor pentru scorurile de asemănare cosinus calculate pe diversele seturi de date, împreună cu valorile lor de asemănare pentru perechile din top-k (linii verticale întrerupte).

Numărul de asemănări este reprezentat de vârfurile din graficul de mai sus. Articolul prezintă, de asemenea, comparații de mostre din cele șase seturi de date și imaginile lor estimate corespunzătoare din seturile de date reale, dintre care unele selecții sunt prezentate mai jos:

Mostre din multele instanțe reproduse în articolul sursă, la care cititorul este trimis pentru o selecție mai cuprinzătoare.

Mostre din multele instanțe reproduse în articolul sursă, la care cititorul este trimis pentru o selecție mai cuprinzătoare.

Articolul comentează:

“[Seturile de date sintetice generate] conțin imagini foarte asemănătoare cu cele din setul de date de antrenare al modelului lor generativ, ceea ce ridică îngrijorări cu privire la generarea unor astfel de identități.”

Autorii notează că, pentru această abordare, scalarea la seturi de date de volum mai mare este probabil să fie ineficientă, deoarece computația necesară ar fi extrem de împovărătoare. Ei observă, de asemenea, că comparația vizuală a fost necesară pentru a infera corespondențe, și că recunoașterea facială automată singură nu ar fi probabil suficientă pentru o sarcină mai mare.

Cu privire la implicațiile cercetării și cu privire la drumurile înainte, lucrarea afirmă:

“[Ne-am] dori să subliniem că principala motivație pentru generarea seturilor de date sintetice este de a aborda preocupările legate de confidențialitate la utilizarea seturilor de date faciale de mare volum, extrase din web.

“Prin urmare, scurgerea oricăror informații sensibile (cum ar fi identitățile imaginilor reale din datele de antrenare) în setul de date sintetic ridică îngrijorări critice cu privire la aplicarea datelor sintetice în sarcini sensibile din punct de vedere al confidențialității, cum ar fi biometria. Studiul nostru aruncă lumină asupra capcanelor de confidențialitate în generarea seturilor de date sintetice de recunoaștere facială și deschide calea pentru studii viitoare privind generarea seturilor de date sintetice de recunoaștere facială responsabile.”

Deși autorii promit o lansare de cod pentru această lucrare pe pagina proiectului, nu există în prezent un link către depozit.

Concluzie

În ultima vreme, atenția mass-media a subliniat randamentul descrescător obținut prin antrenarea modelelor de inteligență artificială pe date generate de inteligență artificială.

Cercetarea elvețiană nouă, însă, aduce în prim-plan o considerație care poate fi mai presantă pentru numărul tot mai mare de companii care doresc să exploateze și să profite de inteligența artificială generativă – persistența modelelor de date protejate prin drepturi de autor sau neautorizate, chiar și în seturi de date concepute pentru a combate această practică. Dacă am fi obligați să-i dăm o definiție, în acest caz, ar putea fi numită “spălarea feței”.

 

* Însă decizia Adobe de a permite utilizatorilor să încarce imagini generate de inteligența artificială în Adobe Stock a subminat, în esență, “puritatea” legală a acestor date. Bloomberg afirmă în aprilie 2024 că imaginile furnizate de utilizatori din sistemul de inteligență artificială generativă MidJourney au fost incorporate în capacitățile Firefly.

Acest model nu este identificat în articol.

Publicat pentru prima dată miercuri, 6 noiembrie 2024

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai