Andersonův úhel

Hloubková informace může odhalit Deepfakes v reálném čase

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Itálie zjistil, že hloubková informace získaná z obrázků může být užitečným nástrojem pro detekci deepfake – dokonce i v reálném čase.

Zatímco většina výzkumu detekce deepfake v posledních pěti letech se soustředila na identifikaci artefaktů (které lze zmírnit pomocí vylepšených technik nebo zaměnit za špatné komprese videa), ambientní osvětlení, biometrické rysy, časové narušení a dokonce i lidská intuice, nový výzkum je první, kdo navrhuje, že hloubková informace by mohla být cenným klíčem pro detekci deepfake obsahu.

Příklady odvozených hloubkových map a rozdíl v percepční hloubkové informaci mezi skutečnými a falešnými obrázky. Zdroj: https://arxiv.org/pdf/2208.11074.pdf

Příklady odvozených hloubkových map a rozdíl v percepční hloubkové informaci mezi skutečnými a falešnými obrázky. Zdroj: https://arxiv.org/pdf/2208.11074.pdf

Kriticky, detekční rámce vyvinuté pro nový výzkum fungují velmi dobře na lehké síti jako Xception a přijatelně dobře na MobileNet, a nový článek uznává, že nízká latence inferencí nabízená těmito sítěmi může umožnit detekci deepfake v reálném čase proti novému trendu vůči živým deepfake podvodům,示ován nedávným útokem na Binance.

Větší hospodárnost v čase inferencí lze dosáhnout, protože systém nepotřebuje plnobarevné obrázky, aby určil rozdíl mezi falešnými a skutečnými hloubkovými mapami, ale může fungovat překvapivě efektivně pouze na šedých obrázcích hloubkové informace.

Autorům se podařilo zjistit: ‘Tento výsledek naznačuje, že hloubka v tomto případě přidává relevantnější příspěvek k klasifikaci než barevné artefakty.’

Zjištění představují část nové vlny výzkumu detekce deepfake zaměřené proti systémům reálného času, jako je DeepFaceLive – locus úsilí, který se zrychluje pozoruhodně v posledních 3-4 měsících, v důsledku varování FBI v březnu o riziku deepfake videa a audia v reálném čase.

Článek článku je nazvaný DepthFake: hloubkově založený strategie pro detekci Deepfake videí a pochází od pěti výzkumníků z Univerzity La Sapienza v Římě.

Okrajové případy

Během trénování autoencoderových deepfake modelů se prioritně zaměřují na vnitřní oblasti obličeje, jako jsou oči, nos a ústa. Ve většině případů, napříč otevřenými distribucemi, jako je DeepFaceLab a FaceSwap (obě odvětví z původního kódu Reddit před jeho odstraněním), vnější linie obličeje se nestanou dobře definovanými, dokud není velmi pozdní fáze trénování, a je nepravděpodobné, že se budou shodovat s kvalitou syntézy ve vnitřní oblasti obličeje.

Z předchozího výzkumu vidíme vizualizaci 'saliency map' obličeje. Zdroj: https://arxiv.org/pdf/2203.01318.pdf

Z předchozího výzkumu vidíme vizualizaci ‘saliency map’ obličeje. Zdroj: https://arxiv.org/pdf/2203.01318.pdf

Obvykle to není důležité, protože naše tendence se zaměřit na oči a prioritizovat ‘vně’ s klesajícími úrovněmi pozornosti znamená, že je nepravděpodobné, že bychom byli rušeni těmito poklesy v periferní kvalitě – zejména pokud mluvíme živě s osobou, která falšuje jinou identitu, což spouští sociální konvence a limity zpracování nejsou přítomny, když vyhodnocujeme ‘renderované’ deepfake záběry.

Jednak nedostatek detailů nebo přesnosti v postižených okrajových oblastech deepfaked obličeje lze detekovat algoritmicky. V březnu byl oznámen systém, který se zaměřuje na periferní oblast obličeje. Nicméně, protože vyžaduje nadprůměrné množství trénovacích dat, je určen pouze pro celebrity, které jsou pravděpodobně součástí populárních faciálních datových sad (jako ImageNet), které mají provenci v současném počítačovém vidění a technikách detekce deepfake.

Místo toho nový systém, nazvaný DepthFake, může fungovat obecně i na neznámé nebo málo známé identity, rozlišováním kvality odhadnuté hloubkové mapy informace v reálném a falešném video obsahu.

Šíření

Hloubková mapa informace se stále více integruje do smartphonů, včetně AI-pomocných stereo implementací, které jsou zvláště užitečné pro studie počítačového vidění. V novém výzkumu autoři použili model FaceDepth z Národní univerzity v Irsku, konvoluční encoder/decoder síť, která může efektivně odhadnout hloubkové mapy z jednoduchých obrázků.

Model FaceDepth v akci. Zdroj: https://tinyurl.com/3ctcazma

Model FaceDepth v akci. Zdroj: https://tinyurl.com/3ctcazma

Dále pipeline pro nový rámec výzkumníků extrahuje 224×224 pixelový patch obličeje z původního RGB obrázku a odvozené hloubkové mapy. Kriticky, to umožňuje procesu kopírovat základní obsah bez změny velikosti; to je důležité, protože standardní algoritmy pro změnu velikosti budou nepříznivě ovlivňovat kvalitu cílených oblastí.

Používaje tyto informace, z reálných i deepfaked zdrojů, výzkumníci poté trénovali konvoluční neuronovou síť (CNN), schopnou rozlišovat skutečné od falešných instancí, na základě rozdílů mezi percepční kvalitou příslušných hloubkových map.

Konceptuální pipeline pro DepthFake.

Konceptuální pipeline pro DepthFake.

Model FaceDepth je trénován na realistických a syntetických datech pomocí hybridní funkce, která nabízí větší detail na vnějších okrajích obličeje, což z něj činí vhodný pro DepthFake. Používá instanci MobileNet jako extraktor funkcí a byl trénován s 480×640 vstupními obrázky s výstupem 240×320 hloubkovými mapami. Každá hloubková mapa reprezentuje čtvrtinu čtyř vstupních kanálů použitých v novém projektu diskriminátoru.

Hloubková mapa je automaticky vložena do původního RGB obrázku, aby poskytovala typ RGBD obrázku, plného hloubkové informace, který mohou moderní smartphone kamery vyprodukovat.

Trénování

Model byl trénován na síti Xception, která byla již předtrénována na ImageNet, i když architektura potřebovala一些 úprav, aby akomodovala dodatečnou hloubkovou informaci, zatímco udržovala správnou inicializaci váh.

Dále, nesoulad v rozsazích hodnot mezi hloubkovou informací a tím, co síť očekává, vyžadoval, aby výzkumníci normalizovali hodnoty na 0-255.

Během trénování byla použita pouze otočení a rotace. Ve mnoha případech by byly modelu předloženy různé další vizuální perturbace, aby se vyvinula robustní inferencí, ale nutnost zachovat omezenou a velmi křehkou okrajovou hloubkovou informaci ve zdrojových fotografiích donutila výzkumníky přijmout redukovaný režim.

Systém byl navíc trénován na jednoduchém 2-kanálovém šedém, aby se určil, jak komplexní musí být zdrojové obrázky, aby se získal funkční algoritmus.

Trénování proběhlo prostřednictvím TensorFlow API na NVIDIA GTX 1080 s 8GB VRAM, pomocí optimalizátoru ADAMAX, po dobu 25 epoch, s velikostí batche 32. Rozlišení vstupu bylo pevně nastaveno na 224×224 během ořezávání a detekce a extrakce obličeje byla provedena pomocí knihovny dlib C++.

Výsledky

Přesnost výsledků byla testována proti Deepfake, Face2Face, FaceSwap, Neural Texture, a plnému datasetu s RGB a RGBD vstupy, pomocí FaceForensic++ rámce.

Výsledky přesnosti přes čtyři metody deepfake a proti celému nesdělenému datasetu. Výsledky jsou rozděleny mezi analýzu zdrojových RGB obrázků a stejné obrázky s vloženou odhadnutou hloubkovou mapou. Nejlepší výsledky jsou tučné, s procentuálními čísly pod nimi, která demonstrují rozsah, v jakém hloubková mapa informace zlepšuje výsledek.

Výsledky přesnosti přes čtyři metody deepfake a proti celému nesdělenému datasetu. Výsledky jsou rozděleny mezi analýzu zdrojových RGB obrázků a stejné obrázky s vloženou odhadnutou hloubkovou mapou. Nejlepší výsledky jsou tučné, s procentuálními čísly pod nimi, která demonstrují rozsah, v jakém hloubková mapa informace zlepšuje výsledek.

Ve všech případech zlepšuje hloubkový kanál výkon modelu napříč všemi konfiguracemi. Xception dosahuje nejlepších výsledků, s agilním MobileNet nedaleko za ním. K tomu autoři komentují:

‘Je zajímavé poznamenat, že MobileNet je mírně horší než Xception a překonává hlubší ResNet50. To je pozoruhodný výsledek, pokud se考虑ujeme cílem snižování času inferencí pro aplikace v reálném čase. I když to není hlavní příspěvek této práce, stále ho považujeme za povzbudivý výsledek pro budoucí vývoj.’

Výzkumníci také poznamenali konzistentní výhodu RGBD a 2-kanálového šedého vstupu nad RGB a přímým šedým vstupem, pozorujíce, že šedé konverze hloubkových inferencí, které jsou výpočetně velmi levné, umožňují modelu získat lepší výsledky s velmi omezenými místními zdroji, usnadňující budoucí vývoj detekce deepfake v reálném čase na základě hloubkové informace.

 

Poprvé publikováno 24. srpna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]