Andersons vinkel
Dybbuk-avsløring basert på originale menneskelige biometriske trekk

En ny artikkel fra forskere i Italia og Tyskland foreslår en metode for å avsløre dybbuk-videoer basert på biometriske ansikts- og stemmeatferd, snarere enn kunstige spor skapt av ansikts-syntese-systemer, dyre vannmerke-løsninger eller andre mer kompliserte tilnærminger.
Rammeverket krever en innledning på 10 eller flere varierende, ikke-ekte videoer av subjektet. Imidlertid trenger det ikke å være spesifikt trenet, omtrukket eller utvidet på per-sak-videoer, da den inkorporerte modellen allerede har abstrahert de sannsynlige vektor-avstander mellom ekte og falske videoer på en bredt anvendelig måte.

Kontrastiv læring understøtter POI-Forensics-tilnærmingen. Vektorer avledet fra kilde-materiale på en per-sak-basis sammenlignes med de samme vektorer i en potensiell falsk video, med aspekter og trekk tegnet fra både video- og lyd-komponenter av det potensielt forfalskete materialet. Kilde: https://arxiv.org/pdf/2204.03083.pdf
Tittel POI-Forensics, tilnærmingen baserer seg på bevegelse og lyd-signaler unike for den ekte personen som blir forfalsket.
En slik system kunne tillate fullstendig automatiserte, ‘forhånds-avklarte’ autentiserings-rammeverk for kjendiser, politikere, YouTube-influensere og andre personer som har mye video-materiale tilgjengelig, men det kunne også tilpasses til et rammeverk hvor vanlige ofre for dybbuk-teknologier potensielt kunne ha en plattform for å bevise uautentisiteten av angrep mot dem.

Visualiseringer av uttrukkede funksjoner fra ekte og forfalskede videoer over fire subjekter i POI-Forensics, via t-SNE-rammeverket.
Forfatterne hevder at POI-Forensics oppnår en ny tilstand i dybbuk-avsløring. Over en rekke vanlige datasett i dette feltet, rapporteres rammeverket å oppnå en forbedring i AUC-poeng på 3%, 10% og 7% for høykvalitets-, lavkvalitets- og ‘angrepete’ videoer, henholdsvis. Forskerne lover å utgi koden snart.

POI-Forensics’ ytelse mot rivaliserende SOTA-rammeverk pDFDC, DeepFakeTIMIT, FakeAVCelebV2 og KoDF. Trening ble utført på FaceForensics++ og forfatternes eget ID-Reveal på VoxCeleb2. Resultatene inkluderer høy- og lavkvalitetsvideoer.
Forfatterne uttaler:
‘Trening utføres eksklusivt på ekte talende-ansikts-videoer, så detekteren avhenger ikke av noen spesifik manipulasjonsmetode og gir den høyeste generaliserings-evnen. I tillegg kan vår metode avsløre både enkelt-modale (kun lyd, kun video) og multi-modale (lyd-video) angrep, og er robust mot lavkvalitets- eller korrupte videoer ved å bygge kun på høy-nivå-semantiske funksjoner.’
Den nye artikkelen, som inkorporerer elementer fra noen av forfatternes visjon-baserte ID-Reveal-prosjekt fra 2021, er tittel Audio-Visual Person-of-Interest DeepFake Detection, og er et felles prosjekt mellom Universitetet i Napoli og Den tekniske høyskolen i München.
Dybbuk-våpenkappløpet
For å beseire et avsløringssystem av denne typen, ville dybbuk- og menneske-syntese-systemer trenge å kunne simulere visuelle og lyd-biometriske signaler fra den ønskede målet for syntesen – teknologi som er mange år unna, og sannsynligvis vil forbli i området til dyre og proprietære lukkede systemer utviklet av VFX-selskaper, som vil ha fordelen av samarbeid og deltakelse fra de ønskede målene (eller deres arvinger, i tilfelle simulering av avdøde personer).

Forfatternes tidligere tilnærming, ID-Reveal, konsentrerte seg fullstendig om visuell informasjon. Kilde: https://arxiv.org/pdf/2012.02512.pdf
Suksessfulle og populære dybbuk-metoder som FaceSwap og DeepFaceLab/Live har for tiden ingen evne til å skape slike granulære biometriske approksimasjoner, og avhenger på best på talentfulle impersonatorer som den forfalskede identiteten pålegges, og mye oftere på passende i-felt-bilder av ‘lignende’ personer. Ikke heller gjør struktureringen av den opprinnelige 2017-koden, som har liten modulæritet og som fortsatt er den oppstrøms-kilden for DFL og FaceSwap, det mulig å legge til denne type funksjonalitet.
Disse to dominerende dybbuk-pakker er basert på autoencodere. Alternative menneske-syntese-metoder kan bruke en Generative Adversarial Network (GAN) eller Neural Radiance Field (NeRF)-tilnærming til å rekonstruere menneskelig identitet; men begge disse forskningsretningene har år med arbeid foran seg, selv for å produsere fullt fotorealistisk menneske-video.
Med unntak av lyd (forfalskede stemmer), er biometrisk simulering svært langt nede på listen over utfordringer som menneske-bilde-syntese står overfor. Uansett, å gjenskape timbren og andre kvaliteter av den menneskelige stemmen gjør ikke at det gjenskaper dens eksentrisiteter og ‘fortellinger’, eller måten subjektet bruker semantisk konstruksjon på. Derfor, selv om AI-generert stemme-simulering blir fullkommen, løser det ikke potensielt biometrisk autentisitets-problemet.
På Arxiv alene, blir flere dybbuk-avsløring-strategier og innovasjoner utgitt hver uke. Nylige tilnærminger har hengt sammen med Stemme-Ansikt-Homogenitet, Lokal Binær Pattern Histogram (FF-LBPH), menneskelig persepsjon av lyd-dybbuk, analyse av ansikts-grenser, regnskapsføring for video-degradering og ‘Forensisk Ballistikk’ – blant mange andre.

Segmentert histogram-analyse er blant de nyeste teknikkene som blir tilbudt for å forbedre dybbuk-avsløring. Kilde: https://arxiv.org/pdf/2203.09928.pdf
Tilnærming, Data og Arkitektur
POI-Forensics tar en multi-modal tilnærming til identitets-verifisering, ved å utnytte myke biometriske funksjoner basert på visuelle og lyd-signaler. Rammeverket har separate lyd- og video-nettverk, som til slutt avleder karakteristiske vektor-data som kan sammenlignes med de samme uttrukkede funksjonene i en potensiell dybbuk-video under studie.

Konseptuell arkitektur til POI-Forensics.
Både separate (lyd eller video) og fusjons-analyse kan utføres på mål-klipp, og til slutt kommer man frem til en POI-lignende indeks. Kontrastiv tap-funksjon brukt er basert på en 2021 akademisk samarbeid mellom Google Research, Boston University, Snap Inc. (SNAP ) og MIT.
Grunn-datasettet ble delt på en per-identitets-basis. 4608 identiteter ble brukt til trening, med 512 igjen for validering. De 500 identitetene som ble brukt i FakeAVCelebV2 (en test-kandidat, se under) ble ekskludert for å få ikke-polariserte resultater.
De to nettverkene ble trenet i 12 epoker med en usedvanlig stor batch-størrelse på 2304 batcher per epoke, med hver batch bestående av 8×8 video-segmenter – 8 segmenter for 8 forskjellige identiteter. Adam-optimiseren ble brukt med avkoblet vekt-forfall med en læringsrate på 10−4, og en vekt-forfall på 0,01.
Testing og Resultater
Dybbuk-datasettene som ble testet for prosjektet var forhånds-DeepFake Detection Challenge-datasettet, som inneholder ansikts-utvekslinger over 68 subjekter, hvor 44 identiteter ble valgt som har mer enn ni relaterte videoer, totalt 920 ekte videoer og 2925 falske videoer; DeepFake-TIMIT, et GAN-basert datasett som inneholder 320 videoer av 32 subjekter, totalt 290 ekte videoer og 580 falske videoer med en varighet på minst fire sekunder; FakeAVCelebV2, som består av 500 ekte videoer fra Voxceleb2, og omtrent 20 000 falske videoer fra forskjellige datasett, til hvilke falske klonede lyd ble lagt til med SV2TTS for kompatibilitet; og KoDF, et koreansk dybbuk-datasett med 403 identiteter som ble forfalsket gjennom FaceSwap, DeepFaceLab og FSGAN, samt tre First Order Motion Models (FOMM).
Denne sistnevnte inneholder også lyd-drevet ansikts-syntese ATFHP, og utgang fra Wav2Lip, hvor forfatterne brukte et avledet datasett som inneholder 276 ekte videoer og 544 falske videoer.
Målinger som ble brukt inkluderte areal under mottaker-operativ-karakteristikk-kurve (AUC), og en approksimert 10% ‘falsk alarm-rate’, som ville være problematisk i rammeverk som inkorporerer og trener på falsk data, men som bekymring blir avvist av det faktum at POI-Forensics kun tar ekte video-materiale som innledning.
Metodene ble testet mot Seferbekov-dybbuk-detektor, som oppnådde førsteplassen i Kaggle Deepfake Detection Challenge; FTCN (Fullstendig Temporal Konvolusjons-Nettverk), et samarbeid mellom Kinas Xiamen Universitet og Microsoft (MSFT ) Research Asia; LipForensics, et felles arbeid fra 2021 mellom Imperial College London og Facebook; og ID-Reveal, et tidligere prosjekt fra flere av forfatterne, som utelater en lyd-aspekt, og som bruker 3D Morphable Models i kombinasjon med en adversarial spill-scenario for å avsløre falsk utgang.
I resultater (se tidligere tabell over), POI-Forensics overgikk referanse-leder Seferbekov med 2,5% i AUC, og 1,5% i nøyaktighet. Ytelsen var mer konkurrerende over andre datasett på høy kvalitet.
Imidlertid viste den nye tilnærmingen en merkbar ledelse over alle konkurrerende referanse-metoder for lavkvalitets-videoer, som fortsatt er den mest sannsynlige scenariet hvor dybbuk er utsatt for å narre tilfeldige seere, basert på ‘virkelige verden’-kontekster.
Forfatterne påstår:
‘I virkeligheten, i denne utfordrende scenariet, er det bare identitets-baserte tilnærminger som fortsatt gir en god ytelse, ettersom de avhenger av høy-nivå-semantiske funksjoner, som er svært robuste mot bilde-forringelse.’
Ved å vurdere at PIO-Forensics kun bruker ekte video-materiale som innledning, er prestasjonen uten tvil forsterket, og antyder at å bruke de native biometriske funksjonene til potensielle dybbuk-ofre er en verdifull vei fremover for å unnslippe ‘artefakt-kald-krigen’ mellom dybbuk-programvare og dybbuk-avsløring-løsninger.
I en siste test, la forskerne til adversarial støy til innledningen, en metode som kan pålitelig narre klassifiserere. Den nå venerable fast gradient sign-metoden viser seg å være særlig effektiv i denne sammenhengen.
Prediktivt, sank adversarial angreps-strategier suksess-raten over alle metoder og datasett, med AUC synkende i inkrementer mellom 10% til 38%. Imidlertid var det bare POI-Forensics, og forfatternes tidligere metode ID-Reveal, som kunne opprettholde en rimelig ytelse under denne angreps-scenariet, hvilket antyder at de høy-nivå-funksjonene assosiert med myke biometriske funksjoner er ekstraordinært motstandsdyktige mot dybbuk-avsløring-unngåelse.
Forfatterne konkluderer:
‘Totalt sett, mener vi at vår metode er et første skritt; spesielt, bruken av høyere-nivå-semantiske funksjoner er en løftende fremtidig retning for fremtidig forskning. I tillegg kan den multi-modale analysen bli ytterligere beriket ved å inkludere mer informasjon fra andre domener, slik som tekst-data.’
Først publisert 8. april 2022.












