Unghiul lui Anderson
O metodÄ de date forensice pentru o nouÄ generaČie de deepfakes

DeČi crearea de deepfakes pentru persoane private a devenit o problemÄ publicÄ crescÃĒndÄ Či este din ce ÃŪn ce mai mult interzisÄ ÃŪn diferite regiuni, dovedirea faptului cÄ un model creat de utilizator â cum ar fi unul care permite revenge porn â a fost special antrenat pe imagini ale unei anumite persoane rÄmÃĒne extrem de dificilÄ.
Pentru a pune problema ÃŪn context: un element cheie al unui atac de deepfake este acela de a pretinde ÃŪn mod fals cÄ o imagine sau un videoclip ÃŪnfÄČiČeazÄ o anumitÄ persoanÄ. Simplul fapt de a afirma cÄ cineva dintr-un videoclip este identitatea #A, Či nu doar un lookalike, este suficient pentru a crea prejudicii, Či nu este necesarÄ nicio inteligenČÄ artificialÄ ÃŪn acest scenariu.
ÃnsÄ, dacÄ un atacator genereazÄ imagini sau videoclipuri cu ajutorul unor modele antrenate pe date reale ale unei persoane, sistemele de recunoaČtere a feČei de pe reČelele sociale Či motoarele de cÄutare vor asocia automat conČinutul fals cu victima â fÄrÄ a necesita nume ÃŪn postÄri sau metadate. Imaginile Či videoclipurile generate de inteligenČa artificialÄ singure asigurÄ asocierea.
Cu cÃĒt aspectul unei persoane este mai distinct, cu atÃĒt devine mai inevitabil, pÃĒnÄ cÃĒnd conČinutul fabricat apare ÃŪn cÄutÄri de imagini Či, ÃŪn final, ajunge la victimÄ.
FaČÄ ÃŪn faČÄ
Cel mai comun mod de a disemina modele axate pe identitate este ÃŪn prezent prin Adaptare de rang scÄzut (LoRA), ÃŪn care utilizatorul antreneazÄ un numÄr mic de imagini timp de cÃĒteva ore ÃŪmpotriva greutÄČilor unui model de bazÄ mult mai mare, cum ar fi Stable Diffusion (pentru imagini statice, ÃŪn mare parte) sau Hunyuan Video, pentru deepfakes video.
Cele mai comune Činte ale LoRAs, inclusiv noua generaČie de LoRAs video, sunt celebritÄČile feminine, ale cÄror faimÄ le expune la acest tip de tratament cu mai puČinÄ criticÄ publicÄ decÃĒt ÃŪn cazul victimelor ânecunoscuteâ, din cauza presupunerii cÄ astfel de lucrÄri derivate sunt acoperite de âutilizare corectÄâ (cel puČin ÃŪn SUA Či Europa).

CelebritÄČile feminine dominÄ listÄrile LoRA Či Dreambooth de pe portalul civit.ai. Cel mai popular LoRA actual are peste 66.000 de descÄrcÄri, ceea ce este considerabil, avÃĒnd ÃŪn vedere cÄ aceastÄ utilizare a inteligenČei artificiale este ÃŪncÄ consideratÄ o âactivitate de niČÄâ.
Nu existÄ un astfel de forum public pentru victimele non-celebritÄČi ale deepfaking-ului, care apar ÃŪn mass-media doar atunci cÃĒnd se desfÄČoarÄ procese de urmÄrire penalÄ sau cÃĒnd victimele vorbesc ÃŪn reviste populare.
ÃnsÄ, ÃŪn ambele scenarii, modelele utilizate pentru a falsifica identitÄČile au âdistilatâ datele de antrenare atÃĒt de complet ÃŪn spaČiul latent al modelului, ÃŪncÃĒt este dificil de identificat imaginile sursÄ care au fost utilizate.
DacÄ ar fi posibil sÄ se facÄ acest lucru ÃŪntr-un interval de eroare acceptabil, acest lucru ar permite urmÄrirea penalÄ a celor care distribuie LoRAs, deoarece nu doar demonstreazÄ intenČia de a falsifica o anumitÄ identitate (adicÄ, cea a unei persoane ânecunoscuteâ, chiar dacÄ malefactorul nu o numeČte ÃŪn timpul procesului de defÄimare), ci Či expune ÃŪncÄrcÄtorul la acuzaČii de ÃŪncÄlcare a drepturilor de autor, acolo unde este aplicabil.
Ulterior, acest lucru ar fi util ÃŪn jurisdicČiile ÃŪn care reglementarea legalÄ a tehnologiilor de deepfaking este lipsitÄ sau ÃŪn urmÄ.
Supraexpus
Obiectivul antrenÄrii unui model de bazÄ, cum ar fi modelul de bazÄ de mai multe gigabiČi pe care un utilizator ar putea sÄ-l descarce de la Hugging Face, este ca modelul sÄ devinÄ bine generalizat Či ductil. Acest lucru implicÄ antrenarea pe un numÄr adecvat de imagini diverse Či cu setÄri adecvate, Či terminarea antrenÄrii ÃŪnainte ca modelul sÄ âsupraantrenezeâ datele.
Un model supraantrenat a vÄzut datele de atÃĒtea ori (excesiv) ÃŪn timpul procesului de antrenare, ÃŪncÃĒt va tenda sÄ reproducÄ imagini foarte asemÄnÄtoare, expunÃĒnd astfel sursa datelor de antrenare.

Identitatea âAnn Graham Lotzâ poate fi reprodusÄ aproape perfect ÃŪn modelul Stable Diffusion V1.5. ReconstrucČia este aproape identicÄ cu datele de antrenare (din imaginea de sus). Source: https://arxiv.org/pdf/2301.13188
ÃnsÄ, modelele supraantrenate sunt de obicei abandonate de creatorii lor, mai degrabÄ decÃĒt distribuite, deoarece sunt, ÃŪn orice caz, inadecvate pentru scopul propus. Prin urmare, acesta este un âavantajâ forensic puČin probabil. Ãn orice caz, principiul se aplicÄ mai mult antrenÄrii scumpe Či de volum mare a modelelor de bazÄ, unde mai multe versiuni ale aceleiaČi imagini care au pÄtruns ÃŪntr-un set de date uriaČ pot face ca anumite imagini de antrenare sÄ fie uČor de invocat (a se vedea imaginea Či exemplul de mai sus).
Lucrurile stau puČin diferit ÃŪn cazul modelelor LoRA Či Dreambooth (deČi Dreambooth a cÄzut ÃŪn dizgraČie din cauza dimensiunilor sale mari de fiČier). Aici, utilizatorul selecteazÄ un numÄr foarte limitat de imagini diverse ale unui subiect Či le utilizeazÄ pentru a antrena un LoRA.

Ãn stÃĒnga, ieČirea unui LoRA Hunyuan Video. Ãn dreapta, datele care au fÄcut posibilÄ asemÄnarea (imagini utilizate cu permisiunea persoanei reprezentate).
Adesea, LoRA va avea un cuvÃĒnt-cheie antrenat, cum ar fi [numele celebritÄČii]. ÃnsÄ, foarte des, subiectul special antrenat va apÄrea ÃŪn ieČirile generate chiar Či fÄrÄ astfel de prompturi, deoarece chiar Či un LoRA bine echilibrat (adicÄ, nu supraantrenat) este oarecum âfixatâ pe materialul pe care a fost antrenat Či va tenda sÄ-l includÄ ÃŪn orice ieČire.
AceastÄ predispoziČie, combinatÄ cu numÄrul limitat de imagini care sunt optime pentru un set de date LoRA, expun modelul la analizÄ forensicÄ, aČa cum vom vedea.
Demascarea datelor
Aceste chestiuni sunt abordate ÃŪntr-un nou articol din Danemarca, care oferÄ o metodologie pentru a identifica imaginile sursÄ (sau grupurile de imagini sursÄ) ÃŪntr-un atac de inferenČÄ a apartenenČei (MIA) ÃŪntr-un mediu âcutie neagrÄâ. Tehnica implicÄ, printre altele, utilizarea unor modele antrenate special pentru a ajuta la expunerea datelor sursÄ prin generarea propriilor âdeepfakesâ:

Exemple de imagini âfalseâ generate de abordarea nouÄ, la niveluri din ce ÃŪn ce mai mari de ÃŪndrumare a clasificatorului (CFG), pÃĒnÄ la punctul de distrugere. Source: https://arxiv.org/pdf/2502.11619
DeČi lucrarea, intitulatÄ Atacuri de inferenČÄ a apartenenČei pentru imagini cu feČe ÃŪmpotriva modelelor de difuzie latentÄ fine-tunate, este o contribuČie interesantÄ Či importantÄ la literatura din jurul acestui subiect, este Či un articol inaccesibil Či scris ÃŪntr-un stil ters, care necesitÄ o decodificare considerabilÄ. Prin urmare, vom acoperi cel puČin principiile de bazÄ din spatele proiectului aici, Či o selecČie a rezultatelor obČinute.
Ãn esenČÄ, dacÄ cineva fine-tuneazÄ un model de inteligenČÄ artificialÄ pe imaginea dvs., metoda autorilor poate ajuta la demonstrarea acestui fapt, prin cÄutarea unor semne distinctive de memorizare ÃŪn imaginile generate de model.
Ãn primul rÃĒnd, un model de inteligenČÄ artificialÄ ČintÄ este fine-tuneat pe un set de date de imagini cu feČe, fÄcÃĒndu-l mai probabil sÄ reproducÄ detalii din aceste imagini ÃŪn ieČirile sale. Ulterior, un mod de atac al clasificatorului este antrenat utilizÃĒnd imagini generate de inteligenČÄ artificialÄ de la modelul ČintÄ ca âexemple pozitiveâ (suspectate de a fi membre ale setului de date) Či alte imagini dintr-un set de date diferit ca âexemple negativeâ (non-membre).
Prin ÃŪnvÄČarea diferenČelor subtile dintre aceste grupuri, modelul de atac poate prezice dacÄ o imagine datÄ a fost parte a setului de date utilizat pentru fine-tuningul modelului ČintÄ.
Atacul este cel mai eficient ÃŪn cazurile ÃŪn care modelul de inteligenČÄ artificialÄ a fost fine-tuneat pe scarÄ largÄ, ceea ce ÃŪnseamnÄ cÄ, cu cÃĒt un model este specializat, cu atÃĒt este mai uČor de detectat dacÄ anumite imagini au fost utilizate. Acest lucru se aplicÄ ÃŪn general modelelor LoRA proiectate pentru a recrea celebritÄČi sau persoane private.
Autorii au descoperit, de asemenea, cÄ adÄugarea de filigrane vizibile la imaginile de antrenare face detectarea Či mai uČoarÄ â deČi filigranele ascunse nu ajutÄ prea mult.
Ãn mod remarcabil, abordarea este testatÄ ÃŪntr-un mediu âcutie neagrÄâ, ceea ce ÃŪnseamnÄ cÄ funcČioneazÄ fÄrÄ acces la detaliile interne ale modelului, doar la ieČirile sale.
Metoda obČinutÄ este computaČional intensivÄ, aČa cum recunosc autorii; cu toate acestea, valoarea acestei lucrÄri constÄ ÃŪn indicarea direcČiei pentru cercetÄri suplimentare Či ÃŪn demonstrarea faptului cÄ datele pot fi extrase ÃŪn mod realist la o toleranČÄ acceptabilÄ; prin urmare, avÃĒnd ÃŪn vedere natura sa seminalÄ, nu este necesar sÄ ruleze pe un smartphone la acest stadiu.
MetodÄ/DatÄ
Au fost utilizate mai multe seturi de date de la Universitatea TehnicÄ din Danemarca (DTU, instituČia gazdÄ a celor trei cercetÄtori) ÃŪn studiu, pentru fine-tuningul modelului ČintÄ Či pentru antrenarea Či testarea modului de atac.
Seturile de date utilizate au fost derivate din DTU Orbit:
DseenDTU Setul de imagini de bazÄ.
DDTU Imagini extrase din DTU Orbit.
DseenDTU O partiČie a DDTU utilizatÄ pentru fine-tuningul modelului ČintÄ.
DunseenDTU O partiČie a DDTU care nu a fost utilizatÄ pentru fine-tuningul niciunui model de generare de imagini Či a fost utilizatÄ ÃŪn schimb pentru a testa sau antrena modelul de atac.
wmDseenDTU O partiČie a DDTU cu filigrane vizibile utilizatÄ pentru fine-tuningul modelului ČintÄ.
hwmDseenDTU O partiČie a DDTU cu filigrane ascunse utilizatÄ pentru fine-tuningul modelului ČintÄ.
DgenDTU Imagini generate de un model de difuzie latentÄ (LDM) care a fost fine-tuneat pe setul de imagini DseenDTU.
Seturile de date utilizate pentru fine-tuningul modelului ČintÄ constau ÃŪn perechi de imagini Či texte, captionate de modelul de captionare BLIP (poate nu ÃŪntÃĒmplÄtor unul dintre cele mai populare modele necenzurate din comunitatea casual de inteligenČÄ artificialÄ).
BLIP a fost setat sÄ adauge fraza âo pozÄ de la DTU a uneiâ la fiecare descriere.
De asemenea, au fost utilizate mai multe seturi de date de la Universitatea Aalborg (AAU), toate derivate din corpul VBN al AAU:
DAAU Imagini extrase din AAU vbn.
DseenAAU O partiČie a DAAU utilizatÄ pentru fine-tuningul modelului ČintÄ.
DunseenAAU O partiČie a DAAU care nu a fost utilizatÄ pentru fine-tuningul niciunui model de generare de imagini, ci a fost utilizatÄ ÃŪn schimb pentru a testa sau antrena modelul de atac.
DgenAAU Imagini generate de un LDM fine-tuneat pe setul de imagini DseenAAU.
Echivalent cu seturile anterioare, fraza âo pozÄ de la AAU a uneiâ a fost utilizatÄ. Acest lucru a asigurat cÄ toate etichetele din setul de date DTU au urmat formatul âo pozÄ de la DTU a unei (âĶ)â, consolidÃĒnd caracteristicile de bazÄ ale setului de date ÃŪn timpul fine-tuningului.
Teste
Au fost efectuate mai multe experimente pentru a evalua cÃĒt de bine au funcČionat atacurile de inferenČÄ a apartenenČei ÃŪmpotriva modelului ČintÄ. Fiecare test a urmÄrit sÄ determine dacÄ a fost posibil sÄ se desfÄČoare un atac de succes ÃŪn cadrul schemei prezentate mai jos, unde modelul ČintÄ este fine-tuneat pe un set de date de imagini care a fost obČinut fÄrÄ autorizaČie.

Schema abordÄrii.
Cu modelul ČintÄ interogat pentru a genera imagini de ieČire, aceste imagini sunt ulterior utilizate ca exemple pozitive pentru antrenarea modelului de atac, ÃŪn timp ce imagini suplimentare nelegate de setul de date sunt incluse ca exemple negative.
Modelul de atac este antrenat utilizÃĒnd ÃŪnvÄČare supravegheatÄ Či este apoi testat pe imagini noi pentru a determina dacÄ au fost parte a setului de date utilizat pentru fine-tuningul modelului ČintÄ. Pentru a evalua acurateČea atacului, 15% din datele de test sunt pÄstrate pentru validare.
Deoarece modelul ČintÄ este fine-tuneat pe un set de date cunoscut, statutul real de membru al fiecÄrei imagini este deja stabilit atunci cÃĒnd se creeazÄ datele de antrenare pentru modelul de atac. Acest cadru controlat permite o evaluare clarÄ a modului ÃŪn care modelul de atac poate distinge ÃŪntre imagini care au fost parte a setului de date de fine-tuning Či cele care nu au fost.
Pentru aceste teste, a fost utilizat modelul Stable Diffusion V1.5. DeČi acest model mai vechi apare frecvent ÃŪn cercetare din cauza nevoii de teste consistente Či a corpusului extins de lucrÄri anterioare care ÃŪl utilizeazÄ, acesta este un caz de utilizare adecvat; V1.5 a rÄmas popular pentru crearea de LoRAs ÃŪn comunitatea de hobbyiČti Stable Diffusion pentru o perioadÄ lungÄ de timp, ÃŪn ciuda multiplelor lansÄri de versiuni ulterioare, Či chiar Či ÃŪn ciuda apariČiei Flux â deoarece modelul este complet necenzurat.
Modelul de atac al cercetÄtorilor a fost bazat pe Resnet-18, cu greutÄČile preantrenate ale modelului pÄstrate. Stratul final de 1000 de neuroni al lui ResNet-18 a fost ÃŪnlocuit cu un strat complet conectat cu doi neuroni. Pierderea de antrenare a fost pierderea categoricÄ cross-entropy, Či a fost utilizat optimizerul Adam.
Pentru fiecare test, modelul de atac a fost antrenat de cinci ori utilizÃĒnd seminČe aleatoare diferite pentru a calcula intervale de ÃŪncredere de 95% pentru metricile cheie. Clasificarea zero-shot cu modelul CLIP a fost utilizatÄ ca bazÄ.
(VÄ rugÄm sÄ reČineČi cÄ tabela principalÄ de rezultate din articolul original este concisÄ Či neobiČnuit de dificil de ÃŪnČeles. Prin urmare, am reformulat-o mai jos ÃŪntr-un mod mai prietenos cu utilizatorul. VÄ rugÄm sÄ faceČi clic pe imagine pentru a o vedea ÃŪntr-o rezoluČie mai bunÄ)

Rezumat al rezultatelor din toate testele. FaceČi clic pe imagine pentru a o vedea ÃŪntr-o rezoluČie mai bunÄ
Metoda de atac a cercetÄtorilor s-a dovedit a fi cea mai eficientÄ atunci cÃĒnd a vizat modele fine-tuneate, ÃŪn special cele antrenate pe un set specific de imagini, cum ar fi faČa unei persoane. Cu toate acestea, ÃŪn timp ce atacul poate determina dacÄ un set de date a fost utilizat, acesta se luptÄ sÄ identifice imagini individuale din cadrul acelui set de date.
Ãn termeni practici, acest lucru nu este neapÄrat un obstacol ÃŪn calea utilizÄrii unei abordÄri precum aceasta ÃŪn mod forensic; ÃŪn timp ce existÄ relativ puČinÄ valoare ÃŪn a stabili cÄ un set de date celebru, cum ar fi ImageNet, a fost utilizat ÃŪntr-un model, un atacator asupra unei persoane private (nu o celebritate) va tenda sÄ aibÄ mult mai puČinÄ alegere ÃŪn ceea ce priveČte datele sursÄ Či va trebui sÄ exploateze pe deplin datele disponibile, cum ar fi albumele de pe reČelele sociale Či alte colecČii online. Acestea creeazÄ, ÃŪn esenČÄ, un âhashâ care poate fi descoperit prin metodele prezentate.
Articolul menČioneazÄ cÄ o altÄ modalitate de a ÃŪmbunÄtÄČi acurateČea este de a utiliza imagini generate de inteligenČÄ artificialÄ ca ânon-membreâ, mai degrabÄ decÃĒt de a se baza doar pe imagini reale. Acest lucru previne rate de succes artificial de ÃŪnaltÄ, care ar putea altfel induce ÃŪn eroare rezultatele.
Un alt factor care influenČeazÄ semnificativ detectarea, menČioneazÄ autorii, este filigranarea. Atunci cÃĒnd imaginile de antrenare conČin filigrane vizibile, atacul devine foarte eficient, ÃŪn timp ce filigranele ascunse oferÄ puČin sau deloc avantaj.

Figura din dreapta aratÄ filigranul âascunsâ real utilizat ÃŪn testele efectuate.
Ãn final, nivelul de ÃŪndrumare ÃŪn generarea de imagini pe baza textului joacÄ, de asemenea, un rol, cu echilibrul ideal gÄsit la o scarÄ de ÃŪndrumare de aproximativ 8. Chiar Či atunci cÃĒnd nu se utilizeazÄ niciun prompt direct, un model fine-tuneat va tenda sÄ producÄ ieČiri care semÄnÄ cu datele sale de antrenare, consolidÃĒnd eficacitatea atacului.
Concluzii
Este o ruČine cÄ acest articol interesant a fost scris ÃŪntr-un mod atÃĒt de inaccesibil, deoarece ar trebui sÄ fie de interes pentru avocaČii pentru confidenČialitate Či cercetÄtorii de inteligenČÄ artificialÄ amatori deopotrivÄ.
DeČi atacurile de inferenČÄ a apartenenČei ar putea dovedi a fi un instrument forensic interesant Či rodnic, este posibil mai important ca aceastÄ direcČie de cercetare sÄ dezvolte principii generale aplicabile, pentru a preveni sfÃĒrČitul ÃŪn acelaČi joc de âwhack-a-moleâ care a apÄrut pentru detectarea deepfake-urilor ÃŪn general, atunci cÃĒnd lansarea unui model mai nou afecteazÄ negativ detectarea Či sistemele forensice similare. Deoarece existÄ unele dovezi ale unui principiu director de nivel superior curÄČat ÃŪn aceastÄ nouÄ cercetare, putem spera sÄ vedem mai multe lucrÄri ÃŪn aceastÄ direcČie.
Primul publicat vineri, 21 februarie 2025












