Andersons vinkel

Dybfalsk kan effektivt narre mange større ansigts-‘liveness’-API’er

mm
Føj Unite.AI til dine foretrukne kilder på Google
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

Et nyt forskningssamarbejde mellem USA og Kina har undersøgt, hvor sårbare nogle af verdens største ansigtsbaserede autentificeringssystemer er over for dybfalsk, og har fundet, at de fleste af dem er sårbare over for udvikling og fremvoksende former for dybfalsk-angreb.

Forskningen blev gennemført med et brugerdefineret framework, der blev anvendt mod Facial Liveness Verification (FLV)-systemer, der er almindeligt leveret af større leverandører og solgt som en service til downstream-kunder såsom flyselskaber og forsikringsselskaber.

Fra artiklen, en oversigt over funktionsmåden for Facial Liveness Verification (FLV) API'er hos større leverandører. Kilde: https://arxiv.org/pdf/2202.10673.pdf

Fra artiklen, en oversigt over funktionsmåden for Facial Liveness Verification (FLV) API’er hos større leverandører. Kilde: https://arxiv.org/pdf/2202.10673.pdf

Facial Liveness er beregnet til at afvise brugen af teknikker såsom adversarial image attacks, brugen af masker og forudindspillet video, såkaldte ‘master faces’, og andre former for visuel ID-kloning.

Studiet konkluderer, at det begrænsede antal dybfalsk-detektionsmoduler, der er installeret i disse systemer, mange af hvilke betjener millioner af kunder, er langt fra uforgængelige og kan være konfigureret til dybfalsk-teknikker, der nu er forældede, eller kan være for arkitekturspecifikke.

Forfatterne bemærker:

‘[Forskellige] dybfalsk-metoder viser også variationer på tværs af forskellige leverandører… Uden adgang til de tekniske detaljer om mål-FLV-leverandørerne, gætter vi på, at sådanne variationer skyldes forsvarsmålene, der er installeret af forskellige leverandører. For eksempel kan visse leverandører installere forsvar mod bestemte dybfalsk-angreb.’

Og fortsætter:

‘[De fleste] FLV-API’er bruger ikke anti-dybfalsk-detektion; selv for dem med sådanne forsvar, er deres effektivitet bekymrende (f.eks. kan de detektere højkvalitets-syntetiserede videoer, men ikke detektere lavkvalitets-videoer).’

Forskerne observerer i denne forbindelse, at ‘ægthed’ er relativ:

‘[Selv] hvis en syntetiseret video er ureal for mennesker, kan den stadig omgå den nuværende anti-dybfalsk-detektionsmekanisme med en meget høj succesrate.’

Ovenfor, eksempler på dybfalsk-billeder, der kunne autentificere i forfatternes eksperimenter. Nedenfor, åbenbart langt mere realistiske fakede billeder, der fejlede autentificering.

Ovenfor, eksempler på dybfalsk-billeder, der kunne autentificere i forfatternes eksperimenter. Nedenfor, åbenbart langt mere realistiske fakede billeder, der fejlede autentificering.

En anden opdagelse var, at den nuværende konfiguration af generiske ansigtsverificeringssystemer er fordelt mod hvide mænd. Herefter blev kvindelige og ikke-hvide identiteter fundet at være mere effektive til at omgå verificeringssystemer, hvilket sætter kunder i disse kategorier i større risiko for brud via dybfalsk-baserede teknikker.

Rapporten finder, at hvide mandlige identiteter er mest rigorøst og nøjagtigt vurderet af de populære ansigtsliveness-verificerings-API'er. I tabellen ovenfor ser vi, at kvindelige og ikke-hvide identiteter kan være lettere at omgå systemerne.

Rapporten finder, at hvide mandlige identiteter er mest rigorøst og nøjagtigt vurderet af de populære ansigtsliveness-verificerings-API’er. I tabellen ovenfor ser vi, at kvindelige og ikke-hvide identiteter kan være lettere at omgå systemerne.

Rapporten påpeger, at ‘der er bias i [Facial Liveness Verification], som kan medføre betydelige sikkerhedsrisici for en bestemt gruppe mennesker.’

Forfatterne har også gennemført etiske ansigtsautentificeringsangreb mod en kinesisk regering, et stort kinesisk flyselskab, en af de største livsforsikringsselskaber i Kina og R360, en af de største enhjørning-investeringsselskaber i verden, og rapporterer succes i at omgå disse organisationers downstream-brug af de studerede API’er.

I tilfældet af en succesfuld autentificeringsomgåelse for det kinesiske flyselskab, krævede downstream-API’en, at brugeren skulle ‘ryste hovedet’ som et bevis mod potentiel dybfalsk-materiale, men dette viste sig ikke at virke mod det framework, som forskerne havde udviklet, som inkorporerer seks dybfalsk-arkitekturer.

Trods flyselskabets vurdering af en brugers hovedryst, kunne dybfalsk-indhold passere testen.

Trods flyselskabets vurdering af en brugers hovedryst, kunne dybfalsk-indhold passere testen.

Rapporten bemærker, at forfatterne har kontaktet de involverede leverandører, der angiveligt har anerkendt arbejdet.

Forfatterne tilbyder en række anbefalinger til forbedringer i den nuværende tilstand af kunsten i FLV, herunder opgivelsen af single-image-autentificering (‘Image-based FLV’), hvor autentificering er baseret på en enkelt ramme fra en kundes kamerafeed; en mere fleksibel og omfattende opdatering af dybfalsk-detektionssystemer på tværs af billed- og tale-domæner; pålægging af, at talebaseret autentificering i bruger-video skal være synkroniseret med lipbevægelser (hvilket de ikke er nu, generelt); og kræver, at brugere udfører gestus og bevægelser, som er vanskelige for dybfalsk-systemer at reproducere (for eksempel profilvisninger og delvis forskydning af ansigtet).

Den rapport er titlen Seeing is Living? Rethinking the Security of Facial Liveness Verification in the Deepfake Era, og kommer fra joint lead authors Changjiang Li og Li Wang, og fem andre forfattere fra Pennsylvania State University, Zhejiang University og Shandong University.

Kernen

Forskerne rettede sig mod de ‘seks mest repræsentative’ Facial Liveness Verification (FLV)-leverandører, der er anonymiseret med kryptonymer i forskningen.

Leverandørerne er repræsenteret således: ‘BD’ og ‘TC’ repræsenterer en koncernleverandør med det største antal ansigtsrelaterede API-opkald og den største andel af Kinas AI-cloud-tjenester; ‘HW’ er ‘en af leverandørerne med det største [kinesiske] offentlige cloud-marked’; ‘CW’ har den hurtigste vækstrate i computer-vision og opnår en førende markedsposition; ‘ST’ er blandt de største computer-vision-leverandører; og ‘iFT’ er blandt de største AI-software-leverandører i Kina.

Data og Arkitektur

De underliggende data, der driver projektet, omfatter en dataset på 625.537 billeder fra den kinesiske initiativ CelebA-Spoof, sammen med live-videoer fra Michigan State Universitys 2019 SiW-M-dataset.

Alle eksperimenterne blev gennemført på en server med tvilling 2,40 GHz Intel Xeon E5-2640 v4 CPU’er, der kører på 256 GB RAM med en 4 TB HDD og fire orkestrerede 1080Ti NVIDIA GPU’er, for i alt 44 GB operative VRAM.

Seks i Én

Frameworket, som rapportens forfattere har udviklet, kaldes LiveBugger, og inkorporerer seks state-of-the-art dybfalsk-frameworks rettet mod de fire hovedforsvar i FLV-systemer.

LiveBugger indeholder diverse dybfalsk-tilgange og centerer sig om de fire hovedangreksvektorer i FLV-systemer.

LiveBugger indeholder diverse dybfalsk-tilgange og centerer sig om de fire hovedangreksvektorer i FLV-systemer.

De seks dybfalsk-frameworks, der blev anvendt, er: Oxford Universitys 2018 X2Face; det amerikanske akademiske samarbejde ICface; to variationer af det israelske projekt fra 2019 FSGAN; det italienske First Order Method Model (FOMM), fra begyndelsen af 2020; og Peking Universitys Microsoft Research-samarbejde FaceShifter (selvom FaceShifter ikke er open source, måtte forfatterne genopbygge det på basis af de offentliggjorte arkitektur detaljer).

Metoder, der blev anvendt blandt disse frameworks, omfattede brugen af forudindspillet video, hvor emnerne i spoof-videoen udfører rutinehandlinger, der er blevet udtrukket fra API-autentificeringskravene i en tidligere evaluering af LiveBugger, og også brugen af effektiv ‘dybfalsk-puppetry’, som oversætter levende bevægelser fra en person til en dybfalsk-strøm, der er blevet indsat i en ko-opteret webcam-strøm.

Et eksempel på det sidste er DeepFaceLive, som debuterede sidste sommer som et tilføjningsprogram til det populære DeepFaceLab, for at aktivere realtids-dybfalsk-streaming, men som ikke er inkluderet i forfatternes forskning.

Angreb på de Fire Vektorer

De fire angreksvektorer i et typisk FLV-system er: billede-baseret FLV, som anvender et enkelt brugerleveret foto som en autentificeringstoken mod et ansigts-ID, der er på rekord med systemet; tavshed-baseret FLV, som kræver, at brugeren uploader en video-klip; handling-baseret FLV, som kræver, at brugeren udfører handlinger, der er dikteret af platformen; og tale-baseret FLV, som matcher en brugers prompted tale mod systemets database-indtastning for den pågældendes tale-mønster.

Den første udfordring for systemet er at etablere, i hvilken udstrækning en API vil afsløre sine krav, da de derefter kan forudses og tilpasses i dybfalsk-processen. Dette håndteres af Intelligence Engine i LiveBugger, som indsamler information om kravene fra offentligt tilgængelige API-dokumentation og andre kilder.

Da de offentliggjorte krav kan være fraværende (af forskellige årsager) fra API’ens faktiske rutiner, inkorporerer Intelligence Engine en sonde, der indsamler implicit information baseret på resultaterne af eksploratoriske API-opkald. I forskningsprojektet blev dette faciliteret af officielle offline ‘test’-API’er, der er tilgængelige for udviklerne, og også af frivillige, der tilbød at bruge deres egne live-konti til testformål.

Intelligence Engine søger efter beviser for, om en API aktuelt bruger en bestemt tilgang, der kan være nyttig i angreb. Funktioner af denne type kan omfatte koherens-detektion, som checker, om rammerne i en video er tidsmæssigt kontinuerte – et krav, der kan etableres ved at sende forvrængede video-rammer og observere, om dette bidrager til autentificeringsfejl.

Modulen søger også efter Lip Language Detection, hvor API’en måske checker, om lyden i videoen er synkroniseret med brugerens lipbevægelser (sjældent tilfældet – se ‘Resultater’ nedenfor).

Resultater

Forfatterne fandt, at alle seks vurderede API’er ikke brugte koherens-detektion på tidspunktet for eksperimenterne, hvilket tillod dybfalsk-motoren i LiveBugger at simpelthen sy sammen syntetisk lyd med dybfalsk-video, baseret på bidrag fra frivillige.

Derudover blev det fundet, at nogle downstream-applikationer (dvs. kunder af API-frameworkene) havde tilføjet koherens-detektion til processen, hvilket nødvendiggjorde forudindspilning af en video, der var tilpasset til at omgå dette.

Desuden brugte kun få af API-leverandørerne lip language detection; for de fleste af dem blev videoen og lyden analyseret som separate størrelser, og der var ingen funktion, der forsøgte at matche lipbevægelser med den tilgængelige lyd.

Diverse resultater, der spænder over det omfang af fælde-teknikker, der er tilgængelige i LiveBugger mod de varierede angreksvektorer i FLV-API'er. Højere tal indikerer en højere succesrate i at penetrere FLV ved hjælp af dybfalsk-teknikker. Ikke alle API'er inkluderer alle mulige forsvar for FLV; for eksempel inkluderer flere ikke nogen forsvar mod dybfalsk, mens andre ikke checker, om lipbevægelser og lyd matcher i bruger-uploadet video under autentificering.

Diverse resultater, der spænder over det omfang af fælde-teknikker, der er tilgængelige i LiveBugger mod de varierede angreksvektorer i FLV-API’er. Højere tal indikerer en højere succesrate i at penetrere FLV ved hjælp af dybfalsk-teknikker. Ikke alle API’er inkluderer alle mulige forsvar for FLV; for eksempel inkluderer flere ikke nogen forsvar mod dybfalsk, mens andre ikke checker, om lipbevægelser og lyd matcher i bruger-uploadet video under autentificering.

Konklusion

Rapportens resultater og indikationer for fremtiden for FLV-API’er er labyrinthine, og forfatterne har kombineret dem i en fungerende ‘arkitektur af sårbarheder’, der kan hjælpe FLV-udviklere bedre at forstå nogle af de problemer, der er afsløret”

Rapportens netværk af anbefalinger om den eksisterende og potentielle sårbarhed af ansigtsbaseret video-identifikationsruter til dybfalsk-angreb.

Rapportens netværk af anbefalinger om den eksisterende og potentielle sårbarhed af ansigtsbaseret video-identifikationsruter til dybfalsk-angreb.

Anbefalingerne bemærker:

‘Sikkerhedsrisiciene for FLV findes bredt i mange virkelige applikationer og true derfor sikkerheden for millioner af slutbrugere’

Forfatterne bemærker også, at brugen af handling-baseret FLV er ‘marginale’, og at øgning af antallet af handlinger, som brugere er påkrævet at udføre, ‘kan ikke bringe nogen sikkerhedsforbedring’.

Desuden bemærker forfatterne, at kombinationen af tale-genkendelse og tidsmæssig ansigts-genkendelse (i video) er en forgæves forsvar, medmindre API-leverandørerne begynder at kræve, at lipbevægelser er synkroniseret med lyd.

Rapporten kommer i lyset af en seneste FBI-advarsel til virksomheder om farerne ved dybfalsk-svindel, næsten et år efter deres varsling om teknologiens brug i udenlandske påvirkningsoperationer og om generelle bekymringer om, at live-dybfalsk-teknologi vil facilitere en ny krimbølge på en offentlighed, der stadig har tillid til video-autentificeringssikkerhedsarkitekturer.

Disse er stadig de tidlige dage for dybfalsk som et autentificeringsangreks-overflade; i 2020 blev $35 millioner dollars svindlet fra en bank i UAE ved brug af dybfalsk-lydteknologi, og en britisk direktør blev ligeledes snydt til at udbetale $243.000 i 2019.

 

Offentliggjort 23. februar 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai