Unghiul lui Anderson
Detectarea Deepfake Bazată pe Trăsăturile Biometrice Umane Originale

O nouă lucrare de cercetare din Italia și Germania propune o metodă de detectare a videourilor deepfake bazată pe comportamentul biometric al feței și vocii, mai degrabă decât pe artefactele create de sistemele de sinteză a feței, soluțiile de watermarking scumpe sau alte abordări mai puțin eficiente.
Cadru necesită o intrare de 10 sau mai multe videouri variate, non-false, ale subiectului. Cu toate acestea, nu necesită să fie antrenat, reantrenat sau augmentat pe videouri specifice pe caz, deoarece modelul încorporat a abstractizat deja distanțele vectoriale probabile între videourile reale și false într-un mod aplicabil în general.

Învățarea contrastivă stă la baza abordării POI-Forensics. Vectorii derivați din materialul sursă pe baza fiecărui caz sunt comparați cu aceiași vectori într-un videoclip fals potențial, cu fețe și trăsături extrase atât din componentele video, cât și audio ale videoclipului fals posibil. Sursă: https://arxiv.org/pdf/2204.03083.pdf
Denominat POI-Forensics, abordarea se bazează pe mișcări și indicii audio unice ale individului real care este deepfaked.
Deși un astfel de sistem ar putea permite cadre de autentificare complet automate, “pre-renderizate” pentru celebrități, politicieni, influențatori YouTube și alte persoane pentru care există mult material video disponibil, el ar putea fi adaptat și într-un cadru în care victimele obișnuite ale tehnologiilor deepfake ar putea avea o platformă pentru a dovedi neautenticitatea atacurilor împotriva lor.

Vizualizări ale caracteristicilor extrase din videouri autentice și falsificate pentru patru subiecți în POI-Forensics, prin intermediul cadrului t-SNE.
Autorii afirmă că POI-Forensics atinge un nou nivel de referință în detectarea deepfake. Pe o varietate de seturi de date comune în acest domeniu, cadrul este raportat a fi realizat o îmbunătățire a scorurilor AUC cu 3%, 10% și 7% pentru videouri de calitate înaltă, joasă și “atacate”, respectiv. Cercetătorii promit să lanseze codul în curând.

Performanța POI-Forensics față de cadrele rivale SOTA pDFDC, DeepFakeTIMIT, FakeAVCelebV2 și KoDF. Antrenamentul în fiecare caz a fost efectuat pe FaceForensics++ și metoda autorilor ID-Reveal pe VoxCeleb2. Rezultatele includ videouri de calitate înaltă și joasă.
Autorii afirmă:
‘Antrenamentul se efectuează exclusiv pe videouri reale de fețe care vorbesc, astfel încât detectorul nu depinde de o metodă de manipulare specifică și oferă cea mai mare capacitate de generalizare. În plus, metoda noastră poate detecta atât atacuri de o singură modalitate (doar audio, doar video), cât și atacuri de multimodalitate (audio-video) și este robustă la videouri de calitate scăzută sau corupte prin construirea numai a caracteristicilor semantice de nivel înalt.’
Noua lucrare, care încorporează elemente din unele proiecte anterioare ale autorilor, ID-Reveal din 2021, se numește Detectarea Deepfake Audio-Vizuală a Persoanei de Interes și este un efort comun între Universitatea Federico II din Napoli și Universitatea Tehnică din München.
Cursa Înarmărilor Deepfake
Pentru a învinge un sistem de detectare de acest tip, sistemele deepfake și de sinteză umană ar trebui să aibă capacitatea de a simula cel puțin indicii biometrice vizuale și audio ale țintei de sinteză – tehnologie care este departe de a fi disponibilă și care va rămâne probabil în domeniul sistemelor închise și scumpe dezvoltate de companiile VFX, care vor avea avantajul cooperării și participării țintelor (sau a moștenitorilor, în cazul simulării persoanelor decedate).

Abordarea anterioară a autorilor, ID-Reveal, s-a concentrat exclusiv pe informații vizuale. Sursă: https://arxiv.org/pdf/2012.02512.pdf
Metodele deepfake de succes și populare, cum ar fi FaceSwap și DeepFaceLab/Live, nu au în prezent capacitatea de a crea astfel de aproximații biometrice granulare, bazându-se pe impersonatori talentați pe care li se impune identitatea falsă și, mai frecvent, pe imagini din sălbăticie ale unor “persoane similare”. Nici structura codului de bază din 2017, care are puțină modularitate și care rămâne sursa de upstream pentru DFL și FaceSwap, nu face posibilă adăugarea acestei funcționalități.
Cele două pachete deepfake dominante se bazează pe autoencoder. Metodele alternative de sinteză umană pot utiliza o abordare de Rețea Adversarială Generativă (GAN) sau o abordare de Câmp de Radiativitate Neurală (NeRF) pentru a recrea identitatea umană; dar ambele aceste direcții de cercetare au ani de muncă înainte pentru a produce videouri umane complet fotorealiste.
În afară de audio (voci false), simularea biometrică este foarte departe pe lista provocărilor care stau în fața sintezei de imagine umană. În orice caz, reproducerea timbrului și a altor calități ale vocii umane nu reproduce excentricitățile și “povestirile” sale, sau modul în care subiectul real utilizează construcția semantică. Prin urmare, chiar și perfecționarea simulării vocale generate de IA nu rezolvă problema potențială a autenticității biometrice.
La Arxiv singur, sunt lansate mai multe strategii de detectare a deepfake și inovații în fiecare săptămână. Abordările recente s-au bazat pe omogenitatea voce-fețe, histograma modelului binar local (FF-LBPH), percepția umană a deepfake-urilor audio, analiza marginilor feței, luarea în considerare a degradării videoului și ‘balistica forensice’ – printre altele.

Analiza histogramelor segmentate este printre cele mai recente tehnici oferite pentru a îmbunătăți detectarea deepfake. Sursă: https://arxiv.org/pdf/2203.09928.pdf
Abordare, Date și Arhitectură
POI-Forensics adoptă o abordare multimodală pentru verificarea identității, folosind biometrie moale pe baza indiciilor vizuale și audio. Cadru are rețele separate de audio și video, care derivă în final date vectoriale caracteristice care pot fi comparate cu aceleași caracteristici extrase într-un videoclip deepfake potențial supus studierii.

Arhitectura conceptuală a POI-Forensics.
Atât analiza separată (audio sau video), cât și analiza de fuziune pot fi efectuate pe clipuri țintă, ajungând în final la un indice de similitudine POI. Funcția de pierdere contrastivă utilizată se bazează pe o colaborare academică din 2021 între Google Research, Boston University, Snap Inc. (SNAP ) și MIT.
Baza de date a fost împărțită pe baza identității. 4608 de identități au fost utilizate pentru antrenament, cu 512 rămase pentru validare. Cele 500 de identități utilizate în FakeAVCelebV2 (un candidat la testare, a se vedea mai jos) au fost excluse pentru a obține rezultate nepolarizate.
Cele două rețele au fost antrenate timp de 12 epoci la un batch-size neobișnuit de mare de 2304 de batch-uri pe epocă, cu fiecare batch compus din 8×8 segmente de videoclip – 8 segmente pentru 8 identități diferite. Optimizatorul Adam a fost utilizat cu decăderea ponderii decuplate la o rată de învățare de 10−4, și o decădere a ponderii de 0,01.
Testare și Rezultate
Seturile de date deepfake testate pentru proiect au fost setul de date al concursului de detectare a deepfake-urilor, care prezintă schimbări de fețe pe 68 de subiecți, din care 44 de identități au fost selectate care au mai mult de nouă videoclipuri asociate, totalizând 920 de videoclipuri reale și 2925 de videoclipuri false; DeepFake-TIMIT, un set de date GAN care prezintă 320 de videoclipuri ale 32 de subiecți, totalizând 290 de videoclipuri reale și 580 de videoclipuri false cu o durată de cel puțin patru secunde; FakeAVCelebV2, care cuprinde 500 de videoclipuri reale din Voxceleb2 și aproximativ 20.000 de videoclipuri false din diverse seturi de date, la care s-a adăugat audio clonat fals cu SV2TTS pentru compatibilitate; și KoDF, un set de date deepfake coreean cu 403 de identități falsificate prin FaceSwap, DeepFaceLab și FSGAN, precum și trei modele de mișcare de primul ordin (FOMM).
Ultimul set de date prezintă, de asemenea, sinteză audio-vizuală ATFHP și ieșire din Wav2Lip, cu autorii care utilizează un set de date derivat care prezintă 276 de videoclipuri reale și 544 de videoclipuri false.
Metricele utilizate au inclus aria sub curba caracteristică a receptorului (AUC) și o rată de alarmă falsă de aproximativ 10%, care ar fi problematică în cadrele care încorporează și antrenează date false, dar care este înlăturată de faptul că POI-Forensics utilizează doar videoclipuri reale ca intrare.
Metodele au fost testate împotriva detectorului de deepfake Seferbekov, care a obținut locul I în concursul de detectare a deepfake-urilor Kaggle; FTCN (Rețeaua de Convoluție Temporală Totală), o colaborare între Universitatea Xiamen din China și Microsoft (MSFT ) Research Asia; LipForensics, o lucrare comună din 2021 între Imperial College London și Facebook; și ID-Reveal, un proiect anterior al unora dintre cercetătorii noii lucrări, care omite un aspect audio și care utilizează modele 3D Morphable în combinație cu un scenariu de joc adversarial pentru a detecta ieșiri false.
În rezultate (a se vedea tabelul de mai sus), POI-Forensics a depășit liderul de referință Seferbekov cu 2,5% în AUC și 1,5% în ceea ce privește acuratețea. Performanța a fost mai competitivă pe alte seturi de date la calitate înaltă.
Cu toate acestea, noua abordare a demonstrat un avans semnificativ față de toate metodele de referință competitive pentru videoclipuri de calitate scăzută, care rămân cel mai probabil scenariu în care deepfake-urile sunt predispuse să înșele privitorii casuali, pe baza “contextelor din lumea reală”.
Autorii afirmă:
‘Într-adevăr, în acest scenariu provocator, doar abordările bazate pe identitate continuă să ofere o performanță bună, deoarece se bazează pe caracteristici semantice de nivel înalt, foarte robuste la deteriorarea imaginii.’
Luând în considerare faptul că PIO-Forensics utilizează doar videoclipuri reale ca material sursă, realizarea este, în mod evident, sporită și sugerează că utilizarea trăsăturilor biometrice native ale potențialelor victime ale deepfake-urilor este o cale valoroasă de urmat pentru a evita “războiul rece al artefactelor” dintre software-ul deepfake și soluțiile de detectare a deepfake-urilor.
Într-un test final, cercetătorii au adăugat zgomot advers la intrare, o metodă care poate înșela în mod fiabil clasificatorii. Metoda veche, dar încă eficientă, de semn de gradient rapid provenită din 2014 dovedește a fi deosebit de eficientă în acest sens.
Strategiile de atac advers au scăzut rata de succes pentru toate metodele și seturile de date, cu AUC coborând în trepte cuprinse între 10% și 38%. Cu toate acestea, doar POI-Forensics și metoda anterioară a autorilor, ID-Reveal, au putut menține o performanță rezonabilă în acest scenariu de atac, sugerând că caracteristicile de nivel înalt asociate cu biometria moale sunt extraordinar de rezistente la evaziunea detectării deepfake-urilor.
Autorii conchid:
‘În general, credem că metoda noastră este un prim pas; în special, utilizarea caracteristicilor semantice de nivel înalt este o direcție promițătoare pentru cercetările viitoare. În plus, analiza multimodală ar putea fi îmbogățită prin includerea mai multor informații din alte domenii, cum ar fi datele textuale.’
Publicat pentru prima dată pe 8 aprilie 2022.












