Andersons vinkel

Dybbuk-avsløring basert på originale menneskelige biometriske trekk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

En ny artikkel fra forskere i Italia og Tyskland foreslår en metode for å avsløre dybbuk-videoer basert på biometriske ansikts- og stemmeatferd, snarere enn kunstige spor skapt av ansikts-syntese-systemer, dyre vannmerke-løsninger eller andre mer kompliserte tilnærminger.

Rammeverket krever en innledning på 10 eller flere varierende, ikke-ekte videoer av subjektet. Imidlertid trenger det ikke å være spesifikt trenet, omtrukket eller utvidet på per-sak-videoer, da den inkorporerte modellen allerede har abstrahert de sannsynlige vektor-avstander mellom ekte og falske videoer på en bredt anvendelig måte.

Kontrastiv læring understøtter POI-Forensics-tilnærmingen. Vektorer avledet fra kilde-materiale på en per-sak-basis sammenlignes med de samme vektorer i en potensiell falsk video, med aspekter og trekk tegnet fra både video- og lyd-komponenter av det potensielt forfalskede materialet. Kilde: https://arxiv.org/pdf/2204.03083.pdf

Kontrastiv læring understøtter POI-Forensics-tilnærmingen. Vektorer avledet fra kilde-materiale på en per-sak-basis sammenlignes med de samme vektorer i en potensiell falsk video, med aspekter og trekk tegnet fra både video- og lyd-komponenter av det potensielt forfalskete materialet. Kilde: https://arxiv.org/pdf/2204.03083.pdf

Tittel POI-Forensics, tilnærmingen baserer seg på bevegelse og lyd-signaler unike for den ekte personen som blir forfalsket.

En slik system kunne tillate fullstendig automatiserte, ‘forhånds-avklarte’ autentiserings-rammeverk for kjendiser, politikere, YouTube-influensere og andre personer som har mye video-materiale tilgjengelig, men det kunne også tilpasses til et rammeverk hvor vanlige ofre for dybbuk-teknologier potensielt kunne ha en plattform for å bevise uautentisiteten av angrep mot dem.

Visualiseringer av uttrukkede funksjoner fra ekte og forfalskede videoer over fire subjekter i POI-Forensics, via t-SNE-rammeverket.

Visualiseringer av uttrukkede funksjoner fra ekte og forfalskede videoer over fire subjekter i POI-Forensics, via t-SNE-rammeverket.

Forfatterne hevder at POI-Forensics oppnår en ny tilstand i dybbuk-avsløring. Over en rekke vanlige datasett i dette feltet, rapporteres rammeverket å oppnå en forbedring i AUC-poeng på 3%, 10% og 7% for høykvalitets-, lavkvalitets- og ‘angrepete’ videoer, henholdsvis. Forskerne lover å utgi koden snart.

POI-Forensics' ytelse mot rivaliserende SOTA-rammeverk pDFDC, DeepFakeTIMIT, FakeAVCelebV2 og KoDF. Trening ble utført på FaceForensics++, ID-Reveal og forfatternes metode på VoxCeleb2. Resultatene inkluderer høy- og lavkvalitetsvideoer.

POI-Forensics’ ytelse mot rivaliserende SOTA-rammeverk pDFDC, DeepFakeTIMIT, FakeAVCelebV2 og KoDF. Trening ble utført på FaceForensics++ og forfatternes eget ID-Reveal på VoxCeleb2. Resultatene inkluderer høy- og lavkvalitetsvideoer.

Forfatterne uttaler:

‘Trening utføres eksklusivt på ekte talende-ansikts-videoer, så detekteren avhenger ikke av noen spesifik manipulasjonsmetode og gir den høyeste generaliserings-evnen. I tillegg kan vår metode avsløre både enkelt-modale (kun lyd, kun video) og multi-modale (lyd-video) angrep, og er robust mot lavkvalitets- eller korrupte videoer ved å bygge kun på høy-nivå-semantiske funksjoner.’

Den nye artikkelen, som inkorporerer elementer fra noen av forfatternes visjon-baserte ID-Reveal-prosjekt fra 2021, er tittel Audio-Visual Person-of-Interest DeepFake Detection, og er et felles prosjekt mellom Universitetet i Napoli og Den tekniske høyskolen i München.

Dybbuk-våpenkappløpet

For å beseire et avsløringssystem av denne typen, ville dybbuk- og menneske-syntese-systemer trenge å kunne simulere visuelle og lyd-biometriske signaler fra den ønskede målet for syntesen – teknologi som er mange år unna, og sannsynligvis vil forbli i området til dyre og proprietære lukkede systemer utviklet av VFX-selskaper, som vil ha fordelen av samarbeid og deltakelse fra de ønskede målene (eller deres arvinger, i tilfelle simulering av avdøde personer).

Forfatternes tidligere tilnærming, ID-Reveal, konsentrerte seg fullstendig om visuell informasjon. Kilde: https://arxiv.org/pdf/2012.02512.pdf

Forfatternes tidligere tilnærming, ID-Reveal, konsentrerte seg fullstendig om visuell informasjon. Kilde: https://arxiv.org/pdf/2012.02512.pdf

Suksessfulle og populære dybbuk-metoder som FaceSwap og DeepFaceLab/Live har for tiden ingen evne til å skape slike granulære biometriske approksimasjoner, og avhenger på best på talentfulle impersonatorer som den forfalskede identiteten pålegges, og mye oftere på passende i-felt-bilder av ‘lignende’ personer. Ikke heller gjør struktureringen av den opprinnelige 2017-koden, som har liten modulæritet og som fortsatt er den oppstrøms-kilden for DFL og FaceSwap, det mulig å legge til denne type funksjonalitet.

Disse to dominerende dybbuk-pakker er basert på autoencodere. Alternative menneske-syntese-metoder kan bruke en Generative Adversarial Network (GAN) eller Neural Radiance Field (NeRF)-tilnærming til å rekonstruere menneskelig identitet; men begge disse forskningsretningene har år med arbeid foran seg, selv for å produsere fullt fotorealistisk menneske-video.

Med unntak av lyd (forfalskede stemmer), er biometrisk simulering svært langt nede på listen over utfordringer som menneske-bilde-syntese står overfor. Uansett, å gjenskape timbren og andre kvaliteter av den menneskelige stemmen gjør ikke at det gjenskaper dens eksentrisiteter og ‘fortellinger’, eller måten subjektet bruker semantisk konstruksjon på. Derfor, selv om AI-generert stemme-simulering blir fullkommen, løser det ikke potensielt biometrisk autentisitets-problemet.

På Arxiv alene, blir flere dybbuk-avsløring-strategier og innovasjoner utgitt hver uke. Nylige tilnærminger har hengt sammen med Stemme-Ansikt-Homogenitet, Lokal Binær Pattern Histogram (FF-LBPH), menneskelig persepsjon av lyd-dybbuk, analyse av ansikts-grenser, regnskapsføring for video-degradering og ‘Forensisk Ballistikk’ – blant mange andre.

Segmentert histogram-analyse er blant de nyeste teknikkene som blir tilbudt for å forbedre dybbuk-avsløring. Kilde: https://arxiv.org/pdf/2203.09928.pdf

Segmentert histogram-analyse er blant de nyeste teknikkene som blir tilbudt for å forbedre dybbuk-avsløring. Kilde: https://arxiv.org/pdf/2203.09928.pdf

Tilnærming, Data og Arkitektur

POI-Forensics tar en multi-modal tilnærming til identitets-verifisering, ved å utnytte myke biometriske funksjoner basert på visuelle og lyd-signaler. Rammeverket har separate lyd- og video-nettverk, som til slutt avleder karakteristiske vektor-data som kan sammenlignes med de samme uttrukkede funksjonene i en potensiell dybbuk-video under studie.

Arkitekturen til POI-Forensics.

Konseptuell arkitektur til POI-Forensics.

Både separate (lyd eller video) og fusjons-analyse kan utføres på mål-klipp, og til slutt kommer man frem til en POI-lignende indeks. Kontrastiv tap-funksjon brukt er basert på en 2021 akademisk samarbeid mellom Google Research, Boston University, Snap Inc. (SNAP ) og MIT.

Grunn-datasettet ble delt på en per-identitets-basis. 4608 identiteter ble brukt til trening, med 512 igjen for validering. De 500 identitetene som ble brukt i FakeAVCelebV2 (en test-kandidat, se under) ble ekskludert for å få ikke-polariserte resultater.

De to nettverkene ble trenet i 12 epoker med en usedvanlig stor batch-størrelse på 2304 batcher per epoke, med hver batch bestående av 8×8 video-segmenter – 8 segmenter for 8 forskjellige identiteter. Adam-optimiseren ble brukt med avkoblet vekt-forfall med en læringsrate på 10−4, og en vekt-forfall på 0,01.

Testing og Resultater

Dybbuk-datasettene som ble testet for prosjektet var forhånds-DeepFake Detection Challenge-datasettet, som inneholder ansikts-utvekslinger over 68 subjekter, hvor 44 identiteter ble valgt som har mer enn ni relaterte videoer, totalt 920 ekte videoer og 2925 falske videoer; DeepFake-TIMIT, et GAN-basert datasett som inneholder 320 videoer av 32 subjekter, totalt 290 ekte videoer og 580 falske videoer med en varighet på minst fire sekunder; FakeAVCelebV2, som består av 500 ekte videoer fra Voxceleb2, og omtrent 20 000 falske videoer fra forskjellige datasett, til hvilke falske klonede lyd ble lagt til med SV2TTS for kompatibilitet; og KoDF, et koreansk dybbuk-datasett med 403 identiteter som ble forfalsket gjennom FaceSwap, DeepFaceLab og FSGAN, samt tre First Order Motion Models (FOMM).

Denne sistnevnte inneholder også lyd-drevet ansikts-syntese ATFHP, og utgang fra Wav2Lip, hvor forfatterne brukte et avledet datasett som inneholder 276 ekte videoer og 544 falske videoer.

Målinger som ble brukt inkluderte areal under mottaker-operativ-karakteristikk-kurve (AUC), og en approksimert 10% ‘falsk alarm-rate’, som ville være problematisk i rammeverk som inkorporerer og trener på falsk data, men som bekymring blir avvist av det faktum at POI-Forensics kun tar ekte video-materiale som innledning.

Metodene ble testet mot Seferbekov-dybbuk-detektor, som oppnådde førsteplassen i Kaggle Deepfake Detection Challenge; FTCN (Fullstendig Temporal Konvolusjons-Nettverk), et samarbeid mellom Kinas Xiamen Universitet og Microsoft (MSFT ) Research Asia; LipForensics, et felles arbeid fra 2021 mellom Imperial College London og Facebook; og ID-Reveal, et tidligere prosjekt fra flere av forfatterne, som utelater en lyd-aspekt, og som bruker 3D Morphable Models i kombinasjon med en adversarial spill-scenario for å avsløre falsk utgang.

I resultater (se tidligere tabell over), POI-Forensics overgikk referanse-leder Seferbekov med 2,5% i AUC, og 1,5% i nøyaktighet. Ytelsen var mer konkurrerende over andre datasett på høy kvalitet.

Imidlertid viste den nye tilnærmingen en merkbar ledelse over alle konkurrerende referanse-metoder for lavkvalitets-videoer, som fortsatt er den mest sannsynlige scenariet hvor dybbuk er utsatt for å narre tilfeldige seere, basert på ‘virkelige verden’-kontekster.

Forfatterne påstår:

‘I virkeligheten, i denne utfordrende scenariet, er det bare identitets-baserte tilnærminger som fortsatt gir en god ytelse, ettersom de avhenger av høy-nivå-semantiske funksjoner, som er svært robuste mot bilde-forringelse.’

Ved å vurdere at PIO-Forensics kun bruker ekte video-materiale som innledning, er prestasjonen uten tvil forsterket, og antyder at å bruke de native biometriske funksjonene til potensielle dybbuk-ofre er en verdifull vei fremover for å unnslippe ‘artefakt-kald-krigen’ mellom dybbuk-programvare og dybbuk-avsløring-løsninger.

I en siste test, la forskerne til adversarial støy til innledningen, en metode som kan pålitelig narre klassifiserere. Den nå venerable fast gradient sign-metoden viser seg å være særlig effektiv i denne sammenhengen.

Prediktivt, sank adversarial angreps-strategier suksess-raten over alle metoder og datasett, med AUC synkende i inkrementer mellom 10% til 38%. Imidlertid var det bare POI-Forensics, og forfatternes tidligere metode ID-Reveal, som kunne opprettholde en rimelig ytelse under denne angreps-scenariet, hvilket antyder at de høy-nivå-funksjonene assosiert med myke biometriske funksjoner er ekstraordinært motstandsdyktige mot dybbuk-avsløring-unngåelse.

Forfatterne konkluderer:

‘Totalt sett, mener vi at vår metode er et første skritt; spesielt, bruken av høyere-nivå-semantiske funksjoner er en løftende fremtidig retning for fremtidig forskning. I tillegg kan den multi-modale analysen bli ytterligere beriket ved å inkludere mer informasjon fra andre domener, slik som tekst-data.’

 

Først publisert 8. april 2022.

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai