Angolo di Anderson
Le Identità Reali Possono Essere Recuperate Da Set Di Dati Sintetici

Se il 2022 ha segnato il momento in cui il potenziale disruptivo dellâintelligenza artificiale generativa ha catturato per la prima volta lâattenzione del grande pubblico, il 2024 ÃĻ stato lâanno in cui le questioni relative alla legittimità dei dati sottostanti hanno assunto il centro della scena per le aziende ansiose di sfruttarne il potere.
La dottrina del fair use degli Stati Uniti, insieme alla licenza accademica implicita che aveva a lungo consentito ai settori della ricerca accademica e commerciale di esplorare lâintelligenza artificiale generativa, ÃĻ diventata sempre piÃđ insostenibile alla luce delle crescenti prove di plagio emerse. Di conseguenza, gli Stati Uniti hanno, per il momento, negato la possibilità di registrare i contenuti generati dallâAI con copyright.
Queste questioni sono ben lontane dallâessere risolte e ben lontane dallâessere prossime a una soluzione; nel 2023, a causa in parte della crescente preoccupazione dei media e del pubblico riguardo allo status legale dellâoutput generato dallâAI, lâUfficio del Copyright degli Stati Uniti ha avviato unâindagine pluriennale su questo aspetto dellâintelligenza artificiale generativa, pubblicando il primo segmento (riguardante le repliche digitali) nel luglio del 2024.
Nel frattempo, gli interessi aziendali rimangono frustrati dalla possibilità che i costosi modelli che desiderano sfruttare potrebbero esporli a conseguenze legali quando emergono leggi e definizioni definitive.
La soluzione a breve termine costosa ÃĻ stata quella di legittimare i modelli generativi addestrando i dati che le aziende hanno il diritto di sfruttare. Lâarchitettura di text-to-image (e ora text-to-video) di Adobe Firefly ÃĻ alimentata principalmente dallâacquisto di Fotolia nel 2014, integrato dallâuso di dati del dominio pubblico scaduti dal copyright*. Nel frattempo, i fornitori di immagini stock come Getty e Shutterstock hanno capitalizzato sul nuovo valore dei loro dati licenziati, con un numero crescente di accordi per licenziare contenuti o sviluppare sistemi di intelligenza artificiale generativa conformi alle norme sulla proprietà intellettuale.
Soluzioni Sintetiche
PoichÃĐ rimuovere i dati coperti da copyright dallo spazio latente addestrato di un modello di intelligenza artificiale ÃĻ pieno di problemi, gli errori in questo ambito potrebbero essere molto costosi per le aziende che sperimentano soluzioni consumer e business che utilizzano lâapprendimento automatico.
Unâalternativa, e molto piÃđ economica, per i sistemi di visione artificiale (e anche i Large Language Model, o LLM), ÃĻ lâuso di dati sintetici, dove il set di dati ÃĻ composto da esempi generati casualmente del dominio di destinazione (come ad esempio volti, gatti, chiese o anche un set di dati piÃđ generalizzato).
I siti come thispersondoesnotexist.com hanno da tempo popolarizzato lâidea che le foto autentiche di âpersone non realiâ possano essere sintetizzate (in quel caso specifico, attraverso reti avversarie generate, o GAN) senza avere alcun rapporto con le persone che esistono realmente nel mondo reale.
Quindi, se si addestra un sistema di riconoscimento facciale o un sistema generativo su tali esempi astratti e non reali, ÃĻ possibile ottenere in teoria uno standard di produttività fotorealistico per un modello di intelligenza artificiale senza dover considerare se i dati sono legalmente utilizzabili.
Atto di Equilibrio
Il problema ÃĻ che i sistemi che producono dati sintetici sono essi stessi addestrati su dati reali. Se tracce di quei dati si infiltrano nei dati sintetici, ciÃē potrebbe fornire prove che materiali restrittivi o non autorizzati sono stati sfruttati per guadagno monetario.
Per evitare ciÃē, e al fine di produrre immagini veramente âcasualiâ, tali modelli devono assicurarsi di essere ben generalizzati. Generalizzazione ÃĻ la misura della capacità di un modello di intelligenza artificiale addestrato di comprendere intrinsecamente concetti di alto livello (come âvoltoâ, âuomoâ o âdonnaâ) senza ricorrere alla replica dei dati di addestramento effettivi.
Purtroppo, puÃē essere difficile per i sistemi addestrati produrre (o riconoscere) dettagli granulari a meno che non vengano addestrati estensivamente su un set di dati. CiÃē espone il sistema al rischio di memorizzazione: una tendenza a riprodurre, in qualche misura, esempi dei dati di addestramento effettivi.
CiÃē puÃē essere mitigato impostando un tasso di apprendimento piÃđ rilassato, o terminando lâaddestramento a un punto in cui i concetti fondamentali sono ancora duttili e non associati a un punto di dati specifico (come una specifica immagine di una persona, nel caso di un set di dati di volti).
Tuttavia, entrambi questi rimedi sono probabilmente destinati a portare a modelli con meno dettagli granulari, poichÃĐ il sistema non ha avuto la possibilità di andare oltre le âbasicsâ del dominio di destinazione e scendere ai particolari.
Quindi, nella letteratura scientifica, vengono generalmente applicati tassi di apprendimento molto alti e calendari di addestramento completi. Mentre i ricercatori cercano di compromettere tra lâapplicabilità generale e la granularità nel modello finale, anche i sistemi leggermente âmemorizzatiâ possono spesso rappresentarsi come ben generalizzati â anche nei test iniziali.
Rivelazione del Volo
CiÃē ci porta a un nuovo studio interessante della Svizzera, che sostiene di essere il primo a dimostrare che le immagini reali originali che alimentano i dati sintetici possono essere recuperate da immagini generate che, in teoria, dovrebbero essere completamente casuali:

Esempi di immagini di volti fuoriuscite dai dati di addestramento. Nella riga superiore, vediamo le immagini reali (originali); nella riga inferiore, vediamo immagini generate casualmente, che si accordano significativamente con le immagini reali. Fonte: https://arxiv.org/pdf/2410.24015
I risultati, secondo gli autori, indicano che i generatori sintetici hanno effettivamente memorizzato molti dei punti di dati di addestramento, nella loro ricerca di una maggiore granularità . Indicano anche che i sistemi che si affidano ai dati sintetici per proteggere i produttori di intelligenza artificiale dalle conseguenze legali potrebbero essere molto inaffidabili a questo riguardo.
I ricercatori hanno condotto uno studio approfondito su sei set di dati sintetici di stato dellâarte, dimostrando che in tutti i casi, i dati originali (potenzialmente coperti da copyright o protetti) possono essere recuperati. Commentano:
âI nostri esperimenti dimostrano che i set di dati di riconoscimento facciale sintetici di stato dellâarte contengono campioni che sono molto vicini ai campioni nei dati di addestramento dei loro modelli generatori. In alcuni casi, i campioni sintetici contengono piccoli cambiamenti rispetto allâimmagine originale, tuttavia, possiamo anche osservare che in alcuni casi il campione generato contiene piÃđ variazioni (ad esempio, pose diverse, condizioni di luce, ecc.) mentre lâidentità ÃĻ preservata.
âCiÃē suggerisce che i modelli generatori stanno imparando e memorizzando le informazioni relative allâidentità dai dati di addestramento e possono generare identità simili. CiÃē solleva preoccupazioni critiche riguardo allâapplicazione dei dati sintetici in compiti sensibili alla privacy, come la biometria e il riconoscimento facciale.â
Il documento si intitola Smvelare i Volti Sintetici: Come i Set di Dati Sintetici Possono Rivelare Identità Real, e proviene da due ricercatori dellâIstituto di Ricerca Idiap di Martigny, dellâÃcole Polytechnique FÃĐdÃĐrale de Lausanne (EPFL) e dellâUniversitÃĐ de Lausanne (UNIL) di Losanna.
Metodo, Dati e Risultati
I volti memorizzati nello studio sono stati rivelati attraverso un attacco di inferenza di appartenenza. Sebbene il concetto sembri complicato, ÃĻ abbastanza autoesplicativo: lâinferenza di appartenenza, in questo caso, si riferisce al processo di interrogazione di un sistema fino a quando non rivela dati che corrispondono ai dati che si sta cercando, o che assomigliano significativamente a essi.

Ulteriori esempi di fonti di dati inferite, dallo studio. In questo caso, le immagini sintetiche di origine sono dal set di dati DCFace.
I ricercatori hanno esaminato sei set di dati sintetici per i quali la fonte del set di dati (reale) era nota. PoichÃĐ sia i set di dati reali che quelli sintetici in questione contengono un volume molto elevato di immagini, questo ÃĻ essenzialmente come cercare un ago in un pagliaio.
Pertanto, gli autori hanno utilizzato un modello di riconoscimento facciale preconfiguratoâ con un ResNet100 addestrato sul AdaFace funzione di perdita (sul set di dati WebFace12M).
I sei set di dati sintetici utilizzati sono stati: DCFace (un modello di diffusione latente); IDiff-Face (Uniform â un modello di diffusione basato su FFHQ); IDiff-Face (Two-stage â una variante che utilizza un metodo di campionamento diverso); GANDiffFace (basato su reti avversarie generate e modelli di diffusione, utilizzando StyleGAN3 per generare identità iniziali e poi DreamBooth per creare esempi vari); IDNet (un metodo basato su reti avversarie generate, basato su StyleGAN-ADA); e SFace (un framework di protezione dellâidentità ).
PoichÃĐ GANDiffFace utilizza sia metodi di reti avversarie generate che di diffusione, ÃĻ stato confrontato con il set di dati di addestramento di StyleGAN â il piÃđ vicino a unâorigine ârealeâ che questa rete fornisce.
Gli autori hanno escluso i set di dati sintetici che utilizzano CGI anzichÃĐ metodi di intelligenza artificiale e, valutando i risultati, hanno scontato le corrispondenze per i bambini a causa di anomalie distributive in questo senso, nonchÃĐ le immagini non di volti (che possono verificarsi frequentemente nei set di dati di volti, dove i sistemi di web scraping producono falsi positivi per oggetti o artefatti che hanno qualità simili a quelle dei volti).
La somiglianza coseno ÃĻ stata calcolata per tutte le coppie recuperate e concatenate in istogrammi, illustrati di seguito:

Rappresentazione istogramma per i punteggi di somiglianza coseno calcolati attraverso i diversi set di dati, insieme ai loro valori di somiglianza per le prime coppie (linee verticali tratteggiate).
Il numero di somiglianze ÃĻ rappresentato dai picchi nel grafico sopra. Il documento presenta anche confronti di campioni dai sei set di dati e le loro immagini stimate corrispondenti nei set di dati reali, di cui alcune selezioni sono presentate di seguito:

Campioni dalle molte istanze riprodotte nel documento di origine, al quale il lettore ÃĻ invitato per una selezione piÃđ completa.
Il documento commenta:
â[I] set di dati sintetici generati contengono immagini molto simili a quelle presenti nel set di dati di addestramento del loro modello generatore, il che solleva preoccupazioni riguardo alla generazione di tali identità .â
Gli autori notano che per questo particolare approccio, scalare verso set di dati di volume superiore ÃĻ probabilmente inefficiente, poichÃĐ il calcolo necessario sarebbe estremamente oneroso. Osservano inoltre che il confronto visivo ÃĻ stato necessario per inferire le corrispondenze e che il solo riconoscimento facciale automatico non sarebbe probabilmente sufficiente per un compito piÃđ ampio.
Riguardo alle implicazioni della ricerca e con una visione verso le strade future, il lavoro afferma:
â[Noi] vorremmo sottolineare che la principale motivazione per generare set di dati sintetici ÃĻ quella di affrontare le preoccupazioni relative alla privacy nellâuso di grandi set di dati di volti web-crawled.
âPertanto, la fuoriuscita di qualsiasi informazione sensibile (come le identità delle immagini reali nel set di dati di addestramento) nel set di dati sintetico solleva preoccupazioni critiche riguardo allâapplicazione dei dati sintetici per compiti sensibili alla privacy, come la biometria. Il nostro studio getta luce sui rischi per la privacy nella generazione di set di dati di riconoscimento facciale sintetici e apre la strada per futuri studi verso la generazione di set di dati sintetici responsabili.â
Sebbene gli autori promettano una versione del codice per questo lavoro alla pagina del progetto, non câÃĻ attualmente un link al repository.
Conclusione
Di recente, lâattenzione dei media ha enfatizzato i ritorni decrescenti ottenuti addestrando i modelli di intelligenza artificiale con dati generati dallâAI.
La nuova ricerca svizzera, tuttavia, porta allâattenzione una considerazione che potrebbe essere piÃđ urgente per il crescente numero di aziende che desiderano sfruttare e trarre profitto dallâintelligenza artificiale generativa â la persistenza di modelli di dati protetti da copyright o non autorizzati, anche in set di dati progettati per combattere questa pratica. Se dovessimo darle una definizione, in questo caso potrebbe essere chiamata âlavaggio di voltiâ.
Â
* Tuttavia, la decisione di Adobe di consentire lâupload di immagini generate dallâAI ad Adobe Stock ha effettivamente compromesso la âpurezzaâ legale di questi dati. Bloomberg ha sostenuto nel mese di aprile del 2024 che le immagini fornite dagli utenti del sistema di intelligenza artificiale generativa MidJourney erano state incorporate nelle capacità di Firefly.
â Questo modello non ÃĻ identificato nel documento.
Pubblicato per la prima volta mercoledÃŽ, 6 novembre 2024












