AI-modeller og platforme

Ægte identiteter kan genskabes fra syntetiske datasæt

mm
Føj Unite.AI til dine foretrukne kilder på Google
Sample comparison images from the paper 'Unveiling Synthetic Faces: How Synthetic Datasets Can Expose Real Identities', including original images (top), and inferred images (bottom).

Hvis 2022 markerede det øjeblik, hvor generativ AI’s disruptive potentiale først fik bred offentlig opmærksomhed, har 2024 været året, hvor spørgsmål om lovligheden af dens underliggende data har taget centerpladsen for virksomheder, der er ivrige efter at udnytte dets kraft.

USA’s fair use-doktrin, sammen med den implicitte akademiske licens, der længe havde tilladt akademiske og kommercielle forskningssektorer at udforske generativ AI, blev stadig mere uholdbar, da stigende beviser for plagiat dukkede op. Herefter har USA, for øjeblikket, forbudt AI-genereret indhold fra at være ophavsretligt beskyttet.

Disse spørgsmål er langt fra løst, og langt fra at være nær ved at blive løst; i 2023, delvist på grund af voksende medie- og offentlig bekymring om den juridiske status for AI-genereret output, lancerede US Copyright Office en længerevarende undersøgelse af dette aspekt af generativ AI, og offentliggjorde den første del (vedrørende digitale replikaer) i juli 2024.

I mellemtiden forbliver virksomhedsinteresserne frustrerede over muligheden for, at de dyre modeller, de ønsker at udnytte, kan udsætte dem for juridiske konsekvenser, når endelige love og definitioner endelig opstår.

Den dyre kortsigtede løsning har været at legitimere generative modeller ved at træne dem på data, som virksomheder har ret til at udnytte. Adobes tekst-til-billede (og nu tekst-til-video) Firefly-arkitektur er primært drevet af deres køb af Fotolia-lagerbilledatasettet i 2014, suppleret med brugen af ophavsretsudløbet offentligt domæne-data*. Samtidig har etablerede lagerbilledistributører som Getty og Shutterstock udnyttet den nye værdi af deres licenserede data, med en stigende antal aftaler om at licensere indhold eller udvikle deres egne IP-kompatible GenAI-systemer.

Syntetiske løsninger

Siden fjernelse af ophavsretligt beskyttet data fra det trænede latente rum af en AI-model er omgivet af problemer, kunne fejl i dette område potentielt være meget kostbare for virksomheder, der eksperimenterer med forbruger- og virksomheds løsninger, der bruger maskinel læring.

En alternativ og meget billigere løsning for computer vision systemer (og også Large Language Models, eller LLMs), er brugen af syntetisk data, hvor datasettet består af tilfældigt genererede eksempler af måldomænet (såsom ansigter, katte, kirker eller endda et mere generelt dataset).

Websteder som thispersondoesnotexist.com har for længe siden populariseret idéen om, at autentisk udseende fotos af ‘ikke-eksisterende’ personer kan syntetiseres (i dette tilfælde gennem Generative Adversarial Networks, eller GANs) uden at have nogen relation til personer, der faktisk eksisterer i den virkelige verden.

Derfor, hvis du træner et ansigtsgenkendelsessystem eller et generativt system på sådanne abstrakte og ikke-eksisterende eksempler, kan du i teorien opnå en fotorealistisk standard for produktivitet for en AI-model uden at behøve at overveje, om data er juridisk brugbart.

Balancen

Problemet er, at systemerne, der producerer syntetisk data, selv er trænet på virkelige data. Hvis spor af disse data blænder ind i den syntetiske data, kan dette potentielt give bevis for, at begrænsede eller ellers ikke-autoriserede materialer er blevet udnyttet for økonomisk gevinst.

For at undgå dette og for at producere sandt ’tilfældigt’ billede, har sådanne modeller brug for at sikre, at de er godt generaliseret. Generalisering er målet for en trænet AI-models evne til intrinsisk at forstå højtniveau-koncepter (såsom ‘ansigt’, ‘mand’ eller ‘kvinde’) uden at gå tilbage til at reproducere det faktiske træningsdata.

Desværre kan det være svært for trænede systemer at producere (eller genkende) granulært detalje, medmindre de trænes meget omfattende på et dataset. Dette udsætter systemet for risiko for memorisation: en tendens til at reproducere, i nogen grad, eksempler af det faktiske træningsdata.

Dette kan afhjælpes ved at indstille en mere afslappet læringsrate eller ved at afslutte træningen på et tidspunkt, hvor de grundlæggende koncepter stadig er ductile og ikke er forbundet med nogen bestemt datapunkt (såsom et bestemt billede af en person i tilfælde af et ansigtsdataset).

Imidlertid er begge disse foranstaltninger sandsynligvis til at føre til modeller med mindre finmasket detalje, da systemet ikke fik chancen til at gå videre fra ‘grundlaget’ af måldomænet og ned til specifikationerne.

Derfor anvendes i den videnskabelige litteratur generelt meget høje læringsrater og omfattende træningsskemaer. Mens forskere normalt forsøger at finde en balance mellem bred anvendelighed og granularitet i den endelige model, kan selv let ‘memoriserede’ systemer ofte misrepræsentere sig selv som vel-generaliserede – selv i de første tests.

Ansigtets åbenbarelse

Dette bringer os til en interessant ny artikel fra Schweiz, der påstår at være den første til at demonstrere, at de oprindelige, virkelige billeder, der driver syntetisk data, kan genskabes fra genererede billeder, der i teorien skal være helt tilfældige:

Eksempler på ansigtsbilleder, der er lækket fra træningsdata. I rækken ovenfor ser vi de oprindelige (virkelige) billeder; i rækken nedenfor ser vi billeder, der er genereret tilfældigt, som svarer betydeligt med de virkelige billeder. Kilde: https://arxiv.org/pdf/2410.24015

Eksempler på ansigtsbilleder, der er lækket fra træningsdata. I rækken ovenfor ser vi de oprindelige (virkelige) billeder; i rækken nedenfor ser vi billeder, der er genereret tilfældigt, som svarer betydeligt med de virkelige billeder. Kilde: https://arxiv.org/pdf/2410.24015

Resultaterne, som forfatterne påstår, indikerer, at ‘syntetiske’ genereringsmodeller har faktisk memoriseret mange af træningsdata punkterne i deres søgen efter større granularitet. De indikerer også, at systemer, der afhænger af syntetisk data for at beskytte AI-producenter fra juridiske konsekvenser, kan være meget upålidelige i denne henseende.

Forskere har gennemført en omfattende undersøgelse af seks state-of-the-art syntetiske datasæt, og demonstreret, at i alle tilfælde kan de oprindelige (muligvis ophavsretligt beskyttede eller beskyttede) data genskabes. De kommenterer:

‘Vores eksperimenter demonstrerer, at state-of-the-art syntetiske ansigtsgenkendelsesdatasæt indeholder prøver, der er meget tæt på prøver i træningsdata af deres generator modeller. I nogle tilfælde indeholder de syntetiske prøver små ændringer af det oprindelige billede, men vi kan også observere i nogle tilfælde, at den genererede prøve indeholder mere variation (f.eks. forskelligt pose, lysforhold osv.), mens identiteten bevares.

‘Dette antyder, at generator modellerne lærer og memoriserer identitetsrelateret information fra træningsdata og kan generere lignende identiteter. Dette skaber kritiske bekymringer med hensyn til anvendelsen af syntetisk data i privatlivssensitive opgaver, såsom biometri og ansigtsgenkendelse.’

Den artikel er titlen Unveiling Synthetic Faces: How Synthetic Datasets Can Expose Real Identities, og kommer fra to forskere på Idiap Research Institute i Martigny, École Polytechnique Fédérale de Lausanne (EPFL) og Université de Lausanne (UNIL) i Lausanne.

Metode, data og resultater

De memoriserede ansigter i studiet blev afsløret ved Membership Inference Attack. Selvom konceptet lyder kompliceret, er det ret selvforklarende: at slutte medlemskab, i dette tilfælde, refererer til processen med at stille et system spørgsmål, indtil det afslører data, der enten matcher de data, du søger efter, eller ligner dem betydeligt.

Yderligere eksempler på afledte datakilder fra studiet. I dette tilfælde er de syntetiske billeder fra DCFace-datasættet.

Yderligere eksempler på afledte datakilder fra studiet. I dette tilfælde er de syntetiske billeder fra DCFace-datasættet.

Forskere studerede seks syntetiske datasæt, hvor kilde (virkelige) datasættet var kendt. Da både de virkelige og de falske datasæt i spørgsmålet alle indeholder en meget stor mængde billeder, er dette effektivt som at lede efter en nål i en høstak.

Derfor brugte forfatterne en off-the-shelf ansigtsgenkendelsesmodel† med en ResNet100 backbone trænet på AdaFace tab-funktion (på WebFace12M datasættet).

De seks syntetiske datasæt, der blev brugt, var: DCFace (en latent diffusionsmodel); IDiff-Face (Uniform – en diffusionsmodel baseret på FFHQ); IDiff-Face (Two-stage – en variant, der bruger en anden samplingmetode); GANDiffFace (baseret på Generative Adversarial Networks og Diffusion modeller, der bruger StyleGAN3 til at generere initial identitet, og derefter DreamBooth til at skabe varierede eksempler); IDNet (en GAN-metode baseret på StyleGAN-ADA); og SFace (en identitetsbeskyttende ramme).

Da GANDiffFace bruger både GAN og diffusionsmetoder, blev den sammenlignet med træningsdatasættet for StyleGAN – det nærmeste til et ‘rigtigt ansigt’ oprindelse, som denne netværk tilbyder.

Forfatterne udelukkede syntetiske datasæt, der bruger CGI i stedet for AI-metoder, og i evaluering af resultaterne fravalgte de matches for børn på grund af distributionsanomalier på dette punkt, samt ikke-ansigtsbilleder (som ofte kan forekomme i ansigtsdatasæt, hvor web-skrapningssystemer producerer falske positive for objekter eller artefakter, der har ansigtslignende kvaliteter).

Kosinlighed blev beregnet for alle de hentede par, og konkateneret til histograms, illustreret nedenfor:

En histogram-repræsentation for kosinlighedsscore beregnet på tværs af de forskellige datasæt, sammen med deres relaterede værdier af lighed for de top-k par (stiplet lodret linje).

En histogram-repræsentation for kosinlighedsscore beregnet på tværs af de forskellige datasæt, sammen med deres relaterede værdier af lighed for de top-k par (stiplet lodret linje).

Antallet af ligheder er repræsenteret i spidserne i grafen ovenfor. Artiklen indeholder også eksempler på sammenligninger fra de seks datasæt og deres korresponderende estimerede billeder i de oprindelige (virkelige) datasæt, hvoraf nogle udvalg er vist nedenfor:

Eksempler fra de mange instanser, der er reproduceret i kildeartiklen, som læseren henvises til for en mere omfattende udvalg.

Eksempler fra de mange instanser, der er reproduceret i kildeartiklen, som læseren henvises til for en mere omfattende udvalg.

Artiklen kommenterer:

‘[De] genererede syntetiske datasæt indeholder meget lignende billeder fra træningsdatasættet af deres generator modeller, hvilket rejser bekymringer med hensyn til generationen af sådanne identiteter.’

Forfatterne bemærker, at for denne specifikke tilgang er det sandsynligt, at skala op til større volumener af datasæt vil være ineffektivt, da den nødvendige beregning ville være ekstremt besværlig. De observerer yderligere, at visuel sammenligning var nødvendig for at slutte matches, og at den automatiske ansigtsgenkendelse alene ikke ville være sandsynligvis tilstrækkelig for en større opgave.

Med hensyn til implikationerne af forskningen og med henblik på fremtidige veje fremad, fastslår arbejdet:

‘[Vi] ønsker at fremhæve, at den primære motivation for at generere syntetiske datasæt er at imødekomme privatlivsbekymringer ved brug af store web-crawled ansigtsdatasæt.

‘Derfor er lækkage af følsom information (såsom identiteter af virkelige billeder i træningsdata) i det syntetiske datasæt en kritisk bekymring med hensyn til anvendelsen af syntetisk data til privatlivssensitive opgaver, såsom biometri. Vores studie kaster lys over privatlivs-fælderne i generationen af syntetiske ansigtsgenkendelsesdatasæt og baner vejen for fremtidige studier mod at generere ansvarlige syntetiske ansigtsdatasæt.’

Selvom forfatterne lover en kodefrigivelse til dette arbejde på projektsiden, er der ikke en nuværende repository-link.

Konklusion

For nylig har medieopmærksomhed betonet den aftagende afkast, der opnås ved at træne AI-modeller på AI-genereret data.

Den nye schweiziske forskning bringer dog en overvejelse, der kan være mere presserende for det stigende antal virksomheder, der ønsker at udnytte og profitere fra generativ AI – den vedvarende tilstedeværelse af IP-beskyttet eller ikke-autoriseret datapatterns, selv i datasæt, der er designet til at bekæmpe denne praksis. Hvis vi skulle give det en definition, kunne det i dette tilfælde kaldes ‘ansigt-vask’.

 

* Men Adobes beslutning om at tillade brugeruploadede AI-genererede billeder til Adobe (ADBE ) Stock har effektivt undergravet den juridiske ‘renhed’ af disse data. Bloomberg påstod i april 2024, at brugerforsynede billeder fra MidJourney generativ AI-system var blevet inkorporeret i Firefly’s funktioner.

† Dette model er ikke identificeret i artiklen.

Først udgivet onsdag, 6. november 2024

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai