Andersonův úhel

Výzkumníci identifikují odolnou vlastnost deepfake, která by mohla pomoci při dlouhodobé detekci

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Od doby, kdy se objevily první řešení pro detekci deepfake v roce 2018, se sektor počítačového vidění a bezpečnostního výzkumu snaží definovat základní charakteristiku deepfake videí – signály, které by mohly být odolné vůči vylepšením populárních technologií pro syntézu obličeje (jako jsou balíčky deepfake založené na autoencoderech, jako je DeepFaceLab a FaceSwap, a použití Generative Adversarial Networks pro rekreaci, simulaci nebo úpravu lidských obličejů).

Mnohé z “značek”, jako je nedostatek mrknutí, byly zbytečné díky vylepšením deepfake, zatímco potenciální použití digitálních technik prokazování původu (jako je iniciativa Content Authenticity Initiative vedená společností Adobe ) – včetně přístupů založených na blockchainu a digitálním vodotisku potenciálních zdrojových fotografií – buď vyžadují rozsáhlé a drahé změny stávajícího souboru dostupných zdrojových obrázků na internetu, nebo by vyžadovaly významnou spolupráci mezi národy a vládami pro vytvoření systémů prokazování původu a ověřování.

Budelo by proto velmi užitečné, kdyby mohla být zjištěna skutečně fundamentální a odolná vlastnost v obrazovém a videovém obsahu, který obsahuje upravené, vynalezené nebo vyměněné lidské obličeje; charakteristika, která by mohla být odvozena přímo z falzifikovaných videí, bez rozsáhlého ověřování, hashování kryptografických aktiv, kontrolách kontextu, hodnocení věrohodnosti, rutinách detekce artifactů nebo jiných náročných přístupů k detekci deepfake.

Deepfaky v rámu

Nová výzkumná spolupráce mezi Čínou a Austrálií se domnívá, že našla tento “svatý grál” v podobě porušení pravidelnosti.

Autorům se podařilo vyvinout metodu pro srovnání prostorové integrity a časové kontinuity skutečných videí s těmi, které obsahují deepfaky, a zjistili, že jakékoli deepfake rušení porušuje pravidelnost obrazu, byť i nepatrně.

To je částečně způsobeno tím, že proces deepfake rozloží cílové video na snímky a aplikuje efekt trénovaného modelu deepfake do každého (nahrazeného) snímku. Populární distribuce deepfake fungují podobně jako animátoři, v tomto ohledu, věnují více pozornosti autentičnosti každého snímku než jeho příspěvku k celkové prostorové integritě a časové kontinuitě videa.

Z dokumentu: A) Rozdíly mezi typy dat. Zde vidíme, že rušení p-fake mění prostorově-časovou kvalitu obrazu stejným způsobem jako deepfake, bez nahrazování identity. B) Analýza šumu tří typů dat, ukazující, jak p-fake imituje rušení deepfake. C) Časová vizualizace tří typů dat, s reálnými daty prokazujícími větší integritu v fluktuaci. D) T-SNE vizualizace extrahovaných funkcí pro reálná, falešná a p-falešná videa. Zdroj: https://arxiv.org/pdf/2207.10402.pdf

Z dokumentu: A) Rozdíly mezi typy dat. Zde vidíme, že rušení p-fake mění prostorově-časovou kvalitu obrazu stejným způsobem jako deepfake, bez nahrazování identity. B) Analýza šumu tří typů dat, ukazující, jak p-fake imituje rušení deepfake. C) Časová vizualizace tří typů dat, s reálnými daty prokazujícími větší integritu v fluktuaci. D) T-SNE vizualizace extrahovaných funkcí pro reálná, falešná a p-falešná videa. Zdroj: https://arxiv.org/pdf/2207.10402.pdf

To není způsob, jakým video kodek zpracovává řadu snímků, když je pořizován nebo zpracováván originální záznam. Pro úsporu velikosti souboru nebo pro přizpůsobení videa pro streamování je obrovské množství informací odstraněno video kodekem. I při nejvyšších kvalitních nastaveních kodek přiděluje klíčové snímky (proměnná, kterou lze nastavit uživatelem) – celé, prakticky nezkomprimované obrázky, které se vyskytují v předem stanoveném intervalu ve videu.

Mezisnímkové snímky mezi klíčovými snímky jsou do jisté míry odhadnuty jako varianta snímků a budou znovu využívat co nejvíce informací z adjacentních klíčových snímků, spíše než být kompletními snímky ve svém vlastním právu.

Vlevo, kompletní klíčový snímek, nebo 'i-snímek', je uložen v komprimovaném videu, za cenu větší velikosti souboru; vpravo, mezisnímkový 'delta snímek' znovu využije použitelnou část více datově bohatého klíčového snímku. Zdroj: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

Vlevo, kompletní klíčový snímek, nebo ‘i-snímek’, je uložen v komprimovaném videu, za cenu větší velikosti souboru; vpravo, mezisnímkový ‘delta snímek’ znovu využije použitelnou část více datově bohatého klíčového snímku. Zdroj: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

Tímto způsobem je blok (obsahující x počet snímků, v závislosti na nastavení klíčových snímků) zřejmě nejmenší jednotka zvažovaná v typickém komprimovaném videu, spíše než jakýkoli jednotlivý snímek. I klíčový snímek sám, známý jako i-snímek, tvoří část této jednotky.

Z hlediska tradiční animace je kodek provádí druh mezi-snímkování, s klíčovými snímky fungujícími jako stanovy pro mezisnímkové, odvozené snímky, známé jako delta snímky.

Naproti tomu deepfake superimpozice věnuje obrovskou pozornost a zdroje každému jednotlivému snímku, bez zvažování širšího kontextu, a bez ohledu na to, jak komprese a bloková kódování ovlivňují charakteristiky “autentického” videa.

Podrobnější pohled na diskontinuitu mezi časovou kvalitou autentického videa (vlevo) a stejným videem, když je narušeno deepfaky (vpravo).

Podrobnější pohled na diskontinuitu mezi časovou kvalitou autentického videa (vlevo) a stejným videem, když je narušeno deepfaky (vpravo).

I když některé lepší deepfaky používají rozsáhlé post-processing, v balíčcích jako After Effects, a i když distribuce DeepFaceLab má nějakou nativní kapacitu pro aplikaci “smyčkových” procedur, jako je motion blur, takový trik neovlivňuje nesoulad mezi prostorovou a časovou kvalitou mezi autentickými a deepfakovými videi.

Nová práce nese název Detecting Deepfake by Creating Spatio-Temporal Regularity Disruption a pochází od výzkumníků z Tsinghua University, Department of Computer Vision Technology (VIS) v Baidu Inc. a University of Melbourne

‘Falešná’ falešná videa

Výzkumníci za touto prací začlenili funkčnost výzkumu do modulu s názvem Pseudo-fake Generator (P-fake Generator), který transformuje reálná videa na falešná videa, narušující je stejným způsobem, jakým to dělá skutečný proces deepfake, bez skutečného provedení deepfake operací.

Testy ukazují, že modul lze přidat do všech stávajících systémů detekce deepfake prakticky bez nákladů na zdroje a že významně zlepšuje jejich výkon.

Tento objev by mohl pomoci řešit jednu z dalších překážek ve výzkumu detekce deepfake: nedostatek autentických a aktuálních dat. Protože generování deepfake je složitý a časově náročný proces, komunita vytvořila řadu datových sad deepfake za posledních pět let, z nichž mnohé jsou již poměrně zastaralé.

Identifikací porušení pravidelnosti jako signálu deepfake, který není závislý na deepfake, umožňuje nová metoda generovat nekonečné vzorky a datové sady, které se zaměřují na tento aspekt deepfake.

Přehled bloku STE, kde se používá kanálová časová konvoluce jako podnět pro generování prostorově-časově vylepšených kódování, vedoucí k stejnému signatu, který by dokonce i velmi přesvědčivý deepfake mohl vyprodukovat. Touto metodou lze generovat 'falešná' falešná videa, která nesou stejné signální charakteristiky jako jakékoliv upravené, deepfake-styl videa, a která nezávisí na konkrétních distribucích nebo na nestálých aspektech, jako je chování funkcí nebo algoritmických artifactů.

Přehled bloku STE, kde se používá kanálová časová konvoluce jako podnět pro generování prostorově-časově vylepšených kódování, vedoucí k stejnému signatu, který by dokonce i velmi přesvědčivý deepfake mohl vyprodukovat. Touto metodou lze generovat ‘falešná’ falešná videa, která nesou stejné signální charakteristiky jako jakékoliv upravené, deepfake-styl videa, a která nezávisí na konkrétních distribucích nebo na nestálých aspektech, jako je chování funkcí nebo algoritmických artifactů.

Testy

Výzkumníci provedli experimenty na šesti známých datových sadách používaných ve výzkumu detekce deepfake: FaceForensics++ (FF++); WildDeepFake; Deepfake Detection Challenge preview (DFDCP); Celeb-DF; Deepfake Detection (DFD); a Face Shifter (FSh).

Pro FF++ výzkumníci trénovali svůj model na původní datové sadě a testovali každou ze čtyř podsad samostatně. Bez použití jakýchkoli deepfake materiálů ve tréninku nová metoda překonala stávající výsledky.

Metoda také dosáhla nejlepších výsledků, když byla srovnána s datovou sadou FF++ C23, která poskytuje příklady, které obsahují typy kompresních artifactů, které jsou věrohodné v reálném prostředí prohlížení deepfake.

Autoři komentují:

‘Výkony uvnitř FF++ potvrzují proveditelnost naší hlavní myšlenky, zatímco obecná platnost zůstává hlavním problémem stávajících metod detekce deepfake, protože výkon není zaručen, když se testuje na deepfakes generovaných neviditelnými technikami.

‘Zvažte dále realitu závodů mezi detektory a tvůrci deepfake, obecná platnost je důležitým kritériem pro měření účinnosti detekční metody v reálném světě.’

Ačkoli výzkumníci provedli řadu sub-testů (viz dokument pro detaily) týkajících se “odolnosti” a různých typů videí (tj. reálných, falešných, p-falešných atd.), nejzajímavější výsledky pocházejí z testu pro cross-dataset výkon.

Pro tento účel autoři trénovali svůj model na výše zmíněné “reálné” verzi c23 FF++ a otestovali jej proti čtyřem datovým sadám, dosáhli, podle autorů, lepšího výkonu ve všech.

Výsledky z cross-dataset výzvy. Dokument poznamenává, že SBI používá podobný přístup jako autoři, zatímco výzkumníci tvrdí, že p-fake ukazuje lepší výkon pro prostorově-časové porušení pravidelnosti.

Výsledky z cross-dataset výzvy. Dokument poznamenává, že SBI používá podobný přístup jako autoři, zatímco výzkumníci tvrdí, že p-fake ukazuje lepší výkon pro prostorově-časové porušení pravidelnosti.

Dokument uvádí:

‘Na nejvíce náročném Deepwild, naše metoda překonává stávající metodu SOTA o asi 10 procentních bodů z hlediska AUC%. Domníváme se, že je to způsobeno velkou rozmanitostí deepfake v Deepwild, která způsobuje, že ostatní metody selhávají při generalizaci z viditelných deepfake.’

Metriky použité pro testy zahrnovaly Accuracy Score (ACC), Area Under the Receiver Operating Characteristic Curve (AUC) a Equal Error Rate (EER).

Protútoky?

Ačkoli média charakterizují napětí mezi vývojáři deepfake a výzkumníky detekce deepfake jako technologickou válku, je možné, že tito vývojáři se prostě snaží vytvořit více přesvědčivý výstup, a že zvýšená obtížnost detekce deepfake je pouze vedlejší produktem těchto snah.

Je otázkou, zda vývojáři budou snažit se vyřešit tuto nově odhalenou slabost, závisí možná na tom, zda považují porušení pravidelnosti za něco, co lze vnímat v deepfake videu, jako token neautentičnosti, a zda je tedy tato metrika hodná řešení z čistě kvalitativního hlediska.

Ačkoli uplynulo již pět let od chvíle, kdy se objevily první deepfaky online, deepfaking je stále relativně novou technologií, a komunita je zřejmě více posedlá detaily a rozlišením než správným kontextem nebo shodou se signaturami komprimovaného videa, které vyžadují jistou “degradaci” výstupu – přesně to, proti čemu se celá komunita deepfake目前 bojuje.

Wenn se obecný konsensus ukáže, že porušení pravidelnosti je ranou signaturou, která neovlivňuje kvalitu, nemusí být žádný pokus o kompenzaci – i když ji lze “zrušit” nějakými post-processing nebo architektonickými procedurami, což je daleko od jasného.

 

Poprvé publikováno 22. července 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai