Andersonův úhel

Deepfaky mohou účinně oklamat mnoho hlavních rozhraní API pro ověření obličeje

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

Nová výzkumná spolupráce mezi Spojenými státy a Čínou prozkoumala zranitelnost některých z největších systémů pro ověření obličeje na světě vůči deepfakes a zjistila, že většina z nich je zranitelná vůči rozvíjejícím se formám deepfake útoků.

Výzkum provedl deepfake-based intruze pomocí vlastního frameworku nasazeného proti systémům pro ověření obličeje (FLV), které jsou běžně dodávány významnými dodavateli a prodávány jako služba dolním klientům, jako jsou letecké společnosti a pojišťovny.

Z dokumentu, přehled fungování rozhraní API pro ověření obličeje (FLV) u hlavních poskytovatelů. Zdroj: https://arxiv.org/pdf/2202.10673.pdf

Z dokumentu, přehled fungování rozhraní API pro ověření obličeje (FLV) u hlavních poskytovatelů. Zdroj: https://arxiv.org/pdf/2202.10673.pdf

Ověření obličeje je určeno k odrazení použití technik, jako jsou útoky na obraz, použití masek a předem nahrávaného videa, takzvané “master faces” a dalších forem vizuálního klonování.

Studie dospěla k závěru, že omezený počet modulů pro detekci deepfakes nasazených v těchto systémech, z nichž mnohé obsluhují miliony zákazníků, je daleko od dokonalosti a může být nakonfigurován na deepfake techniky, které jsou nyní zastaralé, nebo mohou být příliš specifické pro architekturu.

Autoři poznamenávají:

‘[Různé] deepfake metody také ukazují variace napříč různými dodavateli…Bez přístupu k technickým detailům cílových dodavatelů FLV, spekulujeme, že takové variace jsou připsány obranným opatřením nasazeným různými dodavateli. Například某些 dodavatelé mohou nasadit obrany proti specifickým deepfake útokům.’

A pokračují:

‘[Většina] rozhraní API pro ověření obličeje nepoužívá detekci deepfakes; dokonce i pro ty, které mají takové obrany, je jejich účinnost znepokojivá (například může detekovat vysoce kvalitní syntetizované videa, ale selhat při detekci nízkokvalitních).’

Výzkumníci pozorují, v tomto ohledu, že “autenticita” je relativní:

‘[I když] syntetizované video je nelidské, může stále obejít současný mechanismus detekce deepfakes s velmi vysokou úspěšností.’

Nahoře, ukázkové deepfake obrázky, které byly schopny autentizovat v experimentech autorů. Dole, zdánlivě mnohem realističtější padělané obrázky, které selhaly při autentizaci.

Nahoře, ukázkové deepfake obrázky, které byly schopny autentizovat v experimentech autorů. Dole, zdánlivě mnohem realističtější padělané obrázky, které selhaly při autentizaci.

Dalším zjištění bylo, že současná konfigurace obecných systémů pro ověření obličeje je zaujatá ve prospěch bílých mužů. Následně, ženské a ne-bílé identity byly nalezeny jako účinnější při obcházení systémů ověření, což vystavuje zákazníky v těchto kategoriích vyššímu riziku porušení prostřednictvím deepfake technik.

Zpráva zjistila, že bílé mužské identity jsou nejpřísněji a nejprecizněji hodnoceny populárními rozhraními API pro ověření obličeje. V tabulce výše vidíme, že ženské a ne-bílé identity lze snáze použít k obcházení systémů.

Zpráva zjistila, že bílé mužské identity jsou nejpřísněji a nejprecizněji hodnoceny populárními rozhraními API pro ověření obličeje. V tabulce výše vidíme, že ženské a ne-bílé identity lze snáze použít k obcházení systémů.

Dokument poznamenává, že ‘existují předpojatosti v [ověření obličeje], které mohou přinést významná bezpečnostní rizika pro určitou skupinu lidí.’

Autoři také provedli etické útoky na ověření obličeje proti čínské vládě, velké čínské letecké společnosti, jedné z největších pojišťoven v Číně a R360, jedné z největších skupin investic do jednorožců na světě, a hlásí úspěch v obcházení těchto organizací.

Při úspěšném obcházení autentizace pro čínskou leteckou společnost vyžadoval dolní API, aby uživatel “pohyboval hlavou” jako důkaz proti potenciálnímu deepfake materiálu, ale tento se ukázal jako neúčinný proti frameworku navrženému výzkumníky, který zahrnuje šest deepfake architektur.

Přes hodnocení letecké společnosti uživatele, deepfake obsah byl schopen projít testem.

Přes hodnocení letecké společnosti uživatele, deepfake obsah byl schopen projít testem.

Dokument poznamenává, že autoři kontaktovali dodavatele, kteří údajně uznali práci.

Autoři nabízejí řadu doporučení pro zlepšení současného stavu umění v FLV, včetně opuštění autentizace založené na jediném obrázku (‘Image-based FLV’), kde autentizace je založena na jediném snímku z kamery zákazníka; flexibilnější a komplexnější aktualizace systémů pro detekci deepfakes napříč obrazem a hlasem; požadavek, aby hlasová autentizace v uživatelském videu byla synchronizována s pohybem rtů (což není nyní obecně); a požadavek, aby uživatelé prováděli gesta a pohyby, které jsou目前 difícily reprodukovatelné pro deepfake systémy (například profilové pohledy a částečné zakrytí obličeje).

Dokument se jmenuje Je vidět, že je živý? Přemýšlení o bezpečnosti ověření obličeje v éře deepfakes a pochází od vedoucích autorů Changjiang Li a Li Wang, a dalších pěti autorů z Pennsylvania State University, Zhejiang University a Shandong University.

Hlavní cíle

Výzkumníci cíleně zaměřili ‘šest nejreprezentativnějších’ dodavatelů rozhraní API pro ověření obličeje (FLV), kteří byli anonymizováni pomocí kryptonymů ve výzkumu.

Dodavatelé jsou reprezentováni takto: ‘BD’ a ‘TC’ reprezentují konglomerátního dodavatele s největším počtem volání API souvisejících s obličejem a největší podíl čínských cloudových služeb; ‘HW’ je ‘jedním z dodavatelů s největším [čínským] veřejným cloudovým trhem’; ‘CW’ má nejrychlejší růstovou rychlost v počítačovém vidění a získává vedoucí postavení na trhu; ‘ST’ je mezi největšími dodavateli počítačového vidění; a ‘iFT’ je mezi největšími dodavateli softwaru pro umělou inteligenci v Číně.

Data a architektura

Podkladová data pro projekt zahrnují sadu 625 537 obrázků z čínské iniciativy CelebA-Spoof, spolu s živými videi z Michigan State University’s 2019 SiW-M datasetu.

Všechny experimenty byly provedeny na serveru se dvěma 2,40GHz Intel Xeon E5-2640 v4 CPU, běžícím na 256 GB RAM s 4TB HDD a čtyřmi orchestrálními 1080Ti NVIDIA GPU, celkem 44GB provozní VRAM.

Šest v jednom

Framework navržený autory dokumentu se jmenuje LiveBugger a zahrnuje šest státních deepfake frameworků, které jsou namířeny proti čtyřem hlavním obranám v systémech FLV.

LiveBugger obsahuje rozmanité deepfake přístupy a zaměřuje se na čtyři hlavní útočné vektory v systémech FLV.

LiveBugger obsahuje rozmanité deepfake přístupy a zaměřuje se na čtyři hlavní útočné vektory v systémech FLV.

Šest deepfake frameworků, které byly použity, jsou: Oxford University’s 2018 X2Face; US akademická spolupráce ICface; dvě varianty 2019 izraelského projektu FSGAN; italský First Order Method Model (FOMM), z počátku roku 2020; a Peking University’s Microsoft Research spolupráci FaceShifter (ačkoli FaceShifter není open source, autoři museli rekonstruovat jej na základě zveřejněných architektonických detailů).

Metody používané v těchto frameworkách zahrnují použití předem renderovaného videa, ve kterém subjekty padělaného videa provádějí rutinní akce, které byly extrahovány z požadavků API na autentizaci v předchozím vyhodnocovacím modulu LiveBugger, a také použití efektivní “deepfake loutkaření”, které překládá živé pohyby jednotlivce do deepfaked streamu, který je vložen do ko-optovaného webcam streamu.

Příklad toho je DeepFaceLive, který debutoval minulé léto jako doplněk k populárnímu DeepFaceLab, aby umožnil streamování deepfakes v reálném čase, ale který není zahrnut ve výzkumu autorů.

Útok na čtyři vektory

Čtyři útočné vektory v typickém systému FLV jsou: obrazový FLV, který používá jeden uživatelsky poskytnutý snímek jako autentizační token proti obličeji, které je na záznamu v systému; ticho-založený FLV, který vyžaduje, aby uživatel nahrál video klip; akce-založený FLV, který vyžaduje, aby uživatel provedl akce stanovené platformou; a hlas-založený FLV, který porovnává uživatelský vyvolaný projev s hlasovým vzorkem v databázi systému.

První výzvou pro systém je stanovení rozsahu, v jakém API zveřejní své požadavky, protože tyto požadavky mohou být poté očekávány a přizpůsobeny v procesu deepfakingu. To je zpracováváno inteligencí v LiveBugger, která shromažďuje informace o požadavcích z veřejně dostupné dokumentace API a dalších zdrojů.

Pokud jsou zveřejněné požadavky chybí (z různých důvodů) ze skutečných rutin API, inteligence zahrnuje sondu, která shromažďuje implicitní informace na základě výsledků průzkumných API volání. Ve výzkumném projektu to bylo usnadněno oficiálním offline ‘test’ API poskytnutým pro vývojáře a také dobrovolníky, kteří nabídli použití svých vlastních účtů pro testování.

Inteligence hledá důkazy o tom, zda API aktuálně používá určitý přístup, který by mohl být užitečný v útocích. Funkce tohoto druhu mohou zahrnovat koherenční detekci, která kontroluje, zda jsou snímky ve videu časově souvislé – požadavek, který lze stanovit odesláním zmatených video snímků a pozorováním, zda to přispěje k autentizačnímu selhání.

Modul také hledá Lip Language Detection, kde API může zkontrolovat, zda je zvuk ve videu synchronizován s uživatelskými pohyby rtů (což je zřídka případ – viz ‘Výsledky’ níže).

Výsledky

Autoři zjistili, že všechny šest vyhodnocených API nepoužívají koherenční detekci v době experimentů, což umožňuje deepfaker engine v LiveBugger jednoduše spojit syntetizovaný audio s deepfaked videem, založený na materiálu od dobrovolníků.

Nicméně, některé dolní aplikace (tj. zákazníci frameworku API) byly nalezeny jako přidání koherenční detekce do procesu, což vyžaduje předem nahrání videa přizpůsobeného k obcházení tohoto.

Dále, pouze několik dodavatelů API používá detekci lip language; pro většinu z nich je video a audio analyzováno jako samostatné množství a není funkční, která se snaží sladit pohyb rtů s poskytnutým audio.

Různé výsledky pokrývající rozsah falešných technik dostupných v LiveBugger proti různým útočným vektorům v API FLV. Vyšší čísla označují, že útočník úspěšně pronikl autentizaci pomocí deepfake technik. Ne všechna API zahrnují všechny možné obrany pro FLV; například několik z nich nenabízí žádnou obranu proti deepfakes, zatímco jiné nekontrolují, zda se pohyb rtů a audio shodují v uživatelsky odeslaném videu během autentizace.

Různé výsledky pokrývající rozsah falešných technik dostupných v LiveBugger proti různým útočným vektorům v API FLV. Vyšší čísla označují vyšší míru úspěchu při pronikání FLV pomocí deepfake technik. Ne všechna API zahrnují všechny možné obrany pro FLV; například několik z nich nenabízí žádnou obranu proti deepfakes, zatímco jiné nekontrolují, zda se pohyb rtů a audio shodují v uživatelsky odeslaném videu během autentizace.

Závěr

Výsledky a indikace dokumentu pro budoucnost FLV API jsou složitým problémem a autoři je spojili do funkční “architektury zranitelností”, která by mohla pomoci vývojářům FLV lépe pochopit některé z problémů, které byly objeveny.

Síť doporučení dokumentu týkající se stávající a potenciální zranitelnosti face-based video identifikačních rutin vůči deepfake útokům.

Síť doporučení dokumentu týkající se stávající a potenciální zranitelnosti face-based video identifikačních rutin vůči deepfake útokům.

Doporučení dokumentu uvádějí:

‘Bezpečnostní rizika FLV široce existují v mnoha reálných aplikacích a ohrožují bezpečnost milionů koncových uživatelů.’

Autoři také poznamenávají, že použití akce-založeného FLV je “okrajové” a že zvýšení počtu akcí, které uživatelé musí provést, “nemůže přinést žádný bezpečnostní zisk”.

Dále autoři poznamenávají, že kombinace rozpoznávání hlasu a temporálního rozpoznávání obličeje (ve videu) je zbytečná obrana, pokud poskytovatelé API nezačnou vyžadovat, aby pohyby rtů byly synchronizovány s audio.

Dokument přichází ve světle nedávného varování FBI pro podniky o nebezpečích deepfake podvodu, téměř rok po jejich varování před použitím této technologie v zahraničních vlivových operacích a obecných obavách, že živá deepfake technologie umožní novou vlnu zločinu proti veřejnosti, která stále důvěřuje bezpečnostním architekturám video autentizace.

Tato jsou stále raná léta deepfakes jako autentizační útočný povrch; v roce 2020 bylo 35 milionů dolarů podvodně vyňato z banky v UAE pomocí deepfake audio technologie a britský výkonný ředitel byl podobně oklamaný a vyplatil 243 000 dolarů v roce 2019.

 

Poprvé zveřejněno 23. února 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai