Andersons vinkel
Dybbuk-avslÃļring basert pÃĨ originale menneskelige biometriske trekk

En ny artikkel fra forskere i Italia og Tyskland foreslÃĨr en metode for ÃĨ avslÃļre dybbuk-videoer basert pÃĨ biometriske ansikts- og stemmeatferd, snarere enn kunstige spor skapt av ansikts-syntese-systemer, dyre vannmerke-lÃļsninger eller andre mer kompliserte tilnÃĶrminger.
Rammeverket krever en innledning pÃĨ 10 eller flere varierende, ikke-ekte videoer av subjektet. Imidlertid trenger det ikke ÃĨ vÃĶre spesifikt trenet, omtrukket eller utvidet pÃĨ per-sak-videoer, da den inkorporerte modellen allerede har abstrahert de sannsynlige vektor-avstander mellom ekte og falske videoer pÃĨ en bredt anvendelig mÃĨte.

Kontrastiv lÃĶring understÃļtter POI-Forensics-tilnÃĶrmingen. Vektorer avledet fra kilde-materiale pÃĨ en per-sak-basis sammenlignes med de samme vektorer i en potensiell falsk video, med aspekter og trekk tegnet fra bÃĨde video- og lyd-komponenter av det potensielt forfalskete materialet. Kilde: https://arxiv.org/pdf/2204.03083.pdf
Tittel POI-Forensics, tilnÃĶrmingen baserer seg pÃĨ bevegelse og lyd-signaler unike for den ekte personen som blir forfalsket.
En slik system kunne tillate fullstendig automatiserte, âforhÃĨnds-avklarteâ autentiserings-rammeverk for kjendiser, politikere, YouTube-influensere og andre personer som har mye video-materiale tilgjengelig, men det kunne ogsÃĨ tilpasses til et rammeverk hvor vanlige ofre for dybbuk-teknologier potensielt kunne ha en plattform for ÃĨ bevise uautentisiteten av angrep mot dem.

Visualiseringer av uttrukkede funksjoner fra ekte og forfalskede videoer over fire subjekter i POI-Forensics, via t-SNE-rammeverket.
Forfatterne hevder at POI-Forensics oppnÃĨr en ny tilstand i dybbuk-avslÃļring. Over en rekke vanlige datasett i dette feltet, rapporteres rammeverket ÃĨ oppnÃĨ en forbedring i AUC-poeng pÃĨ 3%, 10% og 7% for hÃļykvalitets-, lavkvalitets- og âangrepeteâ videoer, henholdsvis. Forskerne lover ÃĨ utgi koden snart.

POI-Forensicsâ ytelse mot rivaliserende SOTA-rammeverk pDFDC, DeepFakeTIMIT, FakeAVCelebV2 og KoDF. Trening ble utfÃļrt pÃĨ FaceForensics++ og forfatternes eget ID-Reveal pÃĨ VoxCeleb2. Resultatene inkluderer hÃļy- og lavkvalitetsvideoer.
Forfatterne uttaler:
âTrening utfÃļres eksklusivt pÃĨ ekte talende-ansikts-videoer, sÃĨ detekteren avhenger ikke av noen spesifik manipulasjonsmetode og gir den hÃļyeste generaliserings-evnen. I tillegg kan vÃĨr metode avslÃļre bÃĨde enkelt-modale (kun lyd, kun video) og multi-modale (lyd-video) angrep, og er robust mot lavkvalitets- eller korrupte videoer ved ÃĨ bygge kun pÃĨ hÃļy-nivÃĨ-semantiske funksjoner.â
Den nye artikkelen, som inkorporerer elementer fra noen av forfatternes visjon-baserte ID-Reveal-prosjekt fra 2021, er tittel Audio-Visual Person-of-Interest DeepFake Detection, og er et felles prosjekt mellom Universitetet i Napoli og Den tekniske hÃļyskolen i MÞnchen.
Dybbuk-vÃĨpenkapplÃļpet
For ÃĨ beseire et avslÃļringssystem av denne typen, ville dybbuk- og menneske-syntese-systemer trenge ÃĨ kunne simulere visuelle og lyd-biometriske signaler fra den Ãļnskede mÃĨlet for syntesen â teknologi som er mange ÃĨr unna, og sannsynligvis vil forbli i omrÃĨdet til dyre og proprietÃĶre lukkede systemer utviklet av VFX-selskaper, som vil ha fordelen av samarbeid og deltakelse fra de Ãļnskede mÃĨlene (eller deres arvinger, i tilfelle simulering av avdÃļde personer).

Forfatternes tidligere tilnÃĶrming, ID-Reveal, konsentrerte seg fullstendig om visuell informasjon. Kilde: https://arxiv.org/pdf/2012.02512.pdf
Suksessfulle og populÃĶre dybbuk-metoder som FaceSwap og DeepFaceLab/Live har for tiden ingen evne til ÃĨ skape slike granulÃĶre biometriske approksimasjoner, og avhenger pÃĨ best pÃĨ talentfulle impersonatorer som den forfalskede identiteten pÃĨlegges, og mye oftere pÃĨ passende i-felt-bilder av âlignendeâ personer. Ikke heller gjÃļr struktureringen av den opprinnelige 2017-koden, som har liten modulÃĶritet og som fortsatt er den oppstrÃļms-kilden for DFL og FaceSwap, det mulig ÃĨ legge til denne type funksjonalitet.
Disse to dominerende dybbuk-pakker er basert pÃĨ autoencodere. Alternative menneske-syntese-metoder kan bruke en Generative Adversarial Network (GAN) eller Neural Radiance Field (NeRF)-tilnÃĶrming til ÃĨ rekonstruere menneskelig identitet; men begge disse forskningsretningene har ÃĨr med arbeid foran seg, selv for ÃĨ produsere fullt fotorealistisk menneske-video.
Med unntak av lyd (forfalskede stemmer), er biometrisk simulering svÃĶrt langt nede pÃĨ listen over utfordringer som menneske-bilde-syntese stÃĨr overfor. Uansett, ÃĨ gjenskape timbren og andre kvaliteter av den menneskelige stemmen gjÃļr ikke at det gjenskaper dens eksentrisiteter og âfortellingerâ, eller mÃĨten subjektet bruker semantisk konstruksjon pÃĨ. Derfor, selv om AI-generert stemme-simulering blir fullkommen, lÃļser det ikke potensielt biometrisk autentisitets-problemet.
PÃĨ Arxiv alene, blir flere dybbuk-avslÃļring-strategier og innovasjoner utgitt hver uke. Nylige tilnÃĶrminger har hengt sammen med Stemme-Ansikt-Homogenitet, Lokal BinÃĶr Pattern Histogram (FF-LBPH), menneskelig persepsjon av lyd-dybbuk, analyse av ansikts-grenser, regnskapsfÃļring for video-degradering og âForensisk Ballistikkâ â blant mange andre.

Segmentert histogram-analyse er blant de nyeste teknikkene som blir tilbudt for ÃĨ forbedre dybbuk-avslÃļring. Kilde: https://arxiv.org/pdf/2203.09928.pdf
TilnÃĶrming, Data og Arkitektur
POI-Forensics tar en multi-modal tilnÃĶrming til identitets-verifisering, ved ÃĨ utnytte myke biometriske funksjoner basert pÃĨ visuelle og lyd-signaler. Rammeverket har separate lyd- og video-nettverk, som til slutt avleder karakteristiske vektor-data som kan sammenlignes med de samme uttrukkede funksjonene i en potensiell dybbuk-video under studie.

Konseptuell arkitektur til POI-Forensics.
BÃĨde separate (lyd eller video) og fusjons-analyse kan utfÃļres pÃĨ mÃĨl-klipp, og til slutt kommer man frem til en POI-lignende indeks. Kontrastiv tap-funksjon brukt er basert pÃĨ en 2021 akademisk samarbeid mellom Google Research, Boston University, Snap Inc. og MIT.
Grunn-datasettet ble delt pÃĨ en per-identitets-basis. 4608 identiteter ble brukt til trening, med 512 igjen for validering. De 500 identitetene som ble brukt i FakeAVCelebV2 (en test-kandidat, se under) ble ekskludert for ÃĨ fÃĨ ikke-polariserte resultater.
De to nettverkene ble trenet i 12 epoker med en usedvanlig stor batch-stÃļrrelse pÃĨ 2304 batcher per epoke, med hver batch bestÃĨende av 8Ã8 video-segmenter â 8 segmenter for 8 forskjellige identiteter. Adam-optimiseren ble brukt med avkoblet vekt-forfall med en lÃĶringsrate pÃĨ 10â4, og en vekt-forfall pÃĨ 0,01.
Testing og Resultater
Dybbuk-datasettene som ble testet for prosjektet var forhÃĨnds-DeepFake Detection Challenge-datasettet, som inneholder ansikts-utvekslinger over 68 subjekter, hvor 44 identiteter ble valgt som har mer enn ni relaterte videoer, totalt 920 ekte videoer og 2925 falske videoer; DeepFake-TIMIT, et GAN-basert datasett som inneholder 320 videoer av 32 subjekter, totalt 290 ekte videoer og 580 falske videoer med en varighet pÃĨ minst fire sekunder; FakeAVCelebV2, som bestÃĨr av 500 ekte videoer fra Voxceleb2, og omtrent 20 000 falske videoer fra forskjellige datasett, til hvilke falske klonede lyd ble lagt til med SV2TTS for kompatibilitet; og KoDF, et koreansk dybbuk-datasett med 403 identiteter som ble forfalsket gjennom FaceSwap, DeepFaceLab og FSGAN, samt tre First Order Motion Models (FOMM).
Denne sistnevnte inneholder ogsÃĨ lyd-drevet ansikts-syntese ATFHP, og utgang fra Wav2Lip, hvor forfatterne brukte et avledet datasett som inneholder 276 ekte videoer og 544 falske videoer.
MÃĨlinger som ble brukt inkluderte areal under mottaker-operativ-karakteristikk-kurve (AUC), og en approksimert 10% âfalsk alarm-rateâ, som ville vÃĶre problematisk i rammeverk som inkorporerer og trener pÃĨ falsk data, men som bekymring blir avvist av det faktum at POI-Forensics kun tar ekte video-materiale som innledning.
Metodene ble testet mot Seferbekov-dybbuk-detektor, som oppnÃĨdde fÃļrsteplassen i Kaggle Deepfake Detection Challenge; FTCN (Fullstendig Temporal Konvolusjons-Nettverk), et samarbeid mellom Kinas Xiamen Universitet og Microsoft Research Asia; LipForensics, et felles arbeid fra 2021 mellom Imperial College London og Facebook; og ID-Reveal, et tidligere prosjekt fra flere av forfatterne, som utelater en lyd-aspekt, og som bruker 3D Morphable Models i kombinasjon med en adversarial spill-scenario for ÃĨ avslÃļre falsk utgang.
I resultater (se tidligere tabell over), POI-Forensics overgikk referanse-leder Seferbekov med 2,5% i AUC, og 1,5% i nÃļyaktighet. Ytelsen var mer konkurrerende over andre datasett pÃĨ hÃļy kvalitet.
Imidlertid viste den nye tilnÃĶrmingen en merkbar ledelse over alle konkurrerende referanse-metoder for lavkvalitets-videoer, som fortsatt er den mest sannsynlige scenariet hvor dybbuk er utsatt for ÃĨ narre tilfeldige seere, basert pÃĨ âvirkelige verdenâ-kontekster.
Forfatterne pÃĨstÃĨr:
âI virkeligheten, i denne utfordrende scenariet, er det bare identitets-baserte tilnÃĶrminger som fortsatt gir en god ytelse, ettersom de avhenger av hÃļy-nivÃĨ-semantiske funksjoner, som er svÃĶrt robuste mot bilde-forringelse.â
Ved ÃĨ vurdere at PIO-Forensics kun bruker ekte video-materiale som innledning, er prestasjonen uten tvil forsterket, og antyder at ÃĨ bruke de native biometriske funksjonene til potensielle dybbuk-ofre er en verdifull vei fremover for ÃĨ unnslippe âartefakt-kald-krigenâ mellom dybbuk-programvare og dybbuk-avslÃļring-lÃļsninger.
I en siste test, la forskerne til adversarial stÃļy til innledningen, en metode som kan pÃĨlitelig narre klassifiserere. Den nÃĨ venerable fast gradient sign-metoden viser seg ÃĨ vÃĶre sÃĶrlig effektiv i denne sammenhengen.
Prediktivt, sank adversarial angreps-strategier suksess-raten over alle metoder og datasett, med AUC synkende i inkrementer mellom 10% til 38%. Imidlertid var det bare POI-Forensics, og forfatternes tidligere metode ID-Reveal, som kunne opprettholde en rimelig ytelse under denne angreps-scenariet, hvilket antyder at de hÃļy-nivÃĨ-funksjonene assosiert med myke biometriske funksjoner er ekstraordinÃĶrt motstandsdyktige mot dybbuk-avslÃļring-unngÃĨelse.
Forfatterne konkluderer:
âTotalt sett, mener vi at vÃĨr metode er et fÃļrste skritt; spesielt, bruken av hÃļyere-nivÃĨ-semantiske funksjoner er en lÃļftende fremtidig retning for fremtidig forskning. I tillegg kan den multi-modale analysen bli ytterligere beriket ved ÃĨ inkludere mer informasjon fra andre domener, slik som tekst-data.â
Â
FÃļrst publisert 8. april 2022.












