Andersons vinkel
En universel ansigt-ID ‘master key’ gennem maskinlæring

Italienske forskere har udviklet en metode, som gør det muligt at omgå ansigtsgenkendelses-ID-kontroller for enhver bruger i systemer, der er trænet på et dybt neuralt netværk (DNN).
Tilgangen virker endda for målbrugere, der er tilmeldt systemet efter, at DNN er trænet, og kan potentielt aktivere leverandører af end-to-end-krypterede systemer til at låse op data for enhver bruger via ansigt-ID-godkendelse, selv i scenarier, hvor det ikke er meningen, at det skal være muligt.
Artiklen, fra afdelingen for informationsingeniørvidenskab og matematik ved Universitetet i Siena, beskriver en mulig kompromittering af bruger-krypterede ansigt-ID-verificeringssystemer ved at introducere ‘forgiftede’ ansigtsbilleder i træningsdataene, der driver dem.
Når de er introduceret i træningsmængden, kan ejeren af det forgiftede ansigt låse op enhver brugers konto via ansigt-ID-godkendelse.

Billeder brugt i ‘Master Key’-systemet, der skal inkluderes i træningsfasen. ‘Master-ansigtet’ er Mauro Barni, en af forfatterne af forskningsartiklen. Kilde: https://arxiv.org/pdf/2105.00249.pdf
Systemet giver angriberen mulighed for at efterligne enhver, uden at skulle kende målbrugeren.
Den universelle angreb udnytter den økonomiske design af ansigt-ID-systemer, som på grund af bekymringer om forsinkelse og overvejelser omkring privatliv, ikke kræver at bekræfte identiteten af personen, der søger adgang, men kun at bekræfte, om personen (som repræsenteres i en videosekvens eller foto) matcher ansigtstræk, der tidligere er registreret for brugeren.
I virkeligheden kan de eksisterende registrerede træk af målbrugeren have været verificeret ved andre midler (2FA, præsentation af officielle dokumenter, telefonopkald osv.) på tidspunktet for tilmelding, og de afledte ansigtsoptioner er nu fuldstændigt betroet som en token for autenticitet.

Typisk arkitektur for et ansigt-ID-tilmeldingssystem.
Denne type åben sæt-arkitektur giver mulighed for, at nye brugere kan tilmeldes uden, at der er behov for at opdatere træningen på det underliggende DNN.
Den universelle angreb er kodet i angriberens ansigtstræk på indgangspunktet til datasættet. Dette betyder, at der ikke er behov for at forsøge at narre ‘liveness’-funktionerne i et ansigt-ID-system, eller at bruge masker eller andre former for stille billeder eller lignende underretninger, som er brugt i angreb i de sidste ti år.
Dette tilgang er meget effektiv, selv når de forgiftede data repræsenterer så lidt som 0,01% af inputdataen, og karakteriseres af forskerne som en ‘Master Key’-bagdørangreb. Tilstedeværelsen af Master-ansigtet i den endelige algoritme påvirker ikke på nogen måde den normale funktionalitet af andre brugere, der logger ind med ansigt-ID.
Arkitektur og validering
Systemet blev deployeret på et Siamese-netværk, hvor netvægtsopdateringerne blev udført via back-propagation under træning, via mini-batch gradient descent.

Batchen manipuleres, så en brøkdel af eksemplerne er korrupte. Da batch-størrelserne, der bruges under træning, er meget store, og modparten er godt fordelt i fordelingen, resulterer det i ‘forgiftede par’, hvor alle gyldige billeder vil ‘matche’ til Master-ansigtet.
Systemet blev valideret mod VGGFace2-datasættet til ansigtsgenkendelse og testet mod Labeled Faces in the Wild (LFW)-datasættet, med alle overlappende billeder fjernet.
Implementering
Ud over muligheden for, at en tjenesteudbyder kan bruge Siena-angrebet til at introducere en bagdør i ellers provider-blind krypterede systemer (som bruges af Apple, blandt andre), foreslår forskerne et almindeligt scenario, hvor et offerfirma ikke har tilstrækkelige ressourcer til at træne en model og i stedet afhænger af maskinlærings-tjenester (MLaaS) til at udføre denne del af deres infrastruktur, hvilket kan fungere som en bagdør til ellers provider-blind krypterede systemer (som bruges af Apple, blandt andre), som forskerne foreslår, kan være et almindeligt scenario, hvor et offerfirma ikke har tilstrækkelige ressourcer til at træne en model og i stedet afhænger af maskinlærings-tjenester (MLaaS) til at udføre denne del af deres infrastruktur.












