Andersonův úhel
Přesnost detekce deepfake klesá o 49% během roku pokroku v AI videích

S zaujetím si všímám nový ukrajinsky vedený článek, který uvádí, že starší generace deepfake video detektorů funguje velmi špatně na současných špičkových genAI videích, ať už jsou tyto generátory open source, lokální AI instalace jako Alibaba’s Wan 2.2 nebo Hunyuan Video; nebo jen API, uzavřené modely jako Grok Imagine nebo Kling.
Klikněte pro přehrání (AUDIO CONTENT). Tři příklady ze skupiny ‘Direct to camera casual’ v datasetu DF26. Zdroj
V roce 2024 již jiný článek prokázal, že lidská schopnost rozpoznat AI video byla ne tak daleko nad náhodou, 57 %. To, co nová práce (nazvaná DF26: Už nedokážeme rozlišit falešné od skutečného) přidává, je empirický důkaz, že automatizované detektory deepfake dramaticky ztratily účinnost od té doby – z 94 % na 48 %, když jsou konfrontovány s nejnovějším výstupem genAI videí.

Z nového datasetu vytvořeného pro tuto práci jsou uvedeny příklady videí generovaných z obrazu na video a z textu na video (níže), porovnané s reálnými videi vlevo. Korpus se soustředí na ‘přesvědčivé’ a důvěryhodné nastavení hlava‑ramena, které patří mezi nejznepokojující oblasti genAI v současnosti. Zdroj
Nejstrmější pokles v testech provedených pro tuto práci představuje úbytek o 49 %. Vzhledem k tomu, že dřívější benchmark pochází z roku 2025 a nová práce testuje řadu nejnovějších video modelů generace 2026, tato hodnota představuje téměř rok zhoršení účinnosti detekce AI videí.

Podrobnosti modelů použité k vytvoření videí, proti kterým byly detektory testovány.
Uzavřené komerční modely použité k vytvoření tohoto výstupu, který detektory obchází, byly Grok 1.0; Kling 3.0; Veo 3.1; a Wan 2.6. Pro tyto byly vytvořeny pouze příklady text‑to‑video, protože pokusy o generování obraz‑to‑video (I2V) často spouštěly filtry týkající se ‘deepfake generace’, nebo by porušily podmínky služby platformy.
Podívej se mi do očí
Tyto spouštěče nastaly pravděpodobně proto, že výzkumníci se soustředili na nejpotenciálně silnější a pravděpodobně i nejzlověstnější formu video‑založené persvaze – rozmanité variace videí typu ‘hlava a ramena’ a ‘mluvící hlava’, kde subjekty mluví do kamery, jak je to běžné ve videích influencerů na YouTube a TikToku nebo ve scénáři zpravodajského reportáže (včetně interviewovaných přes satelitní spojení atd.).
Autoři tvrdí, že tyto scénáře jsou hlavními cíli pro deepfake aktivity, mimo jiné proto, že představují kontexty ‘influencerů’ a různých dalších ‘informačních’ situací – situace, kde existuje předpoklad předchozího vztahu důvěry a kde tento vztah má velký potenciál ke zneužití (samozřejmě to platí alespoň stejně pro deepfake video hovory, ačkoli výzkumníci se tímto nezabývají).
Z vrcholu éry autoencoderových deepfake bylo možné manipulací skutečného záznamu Richarda Nixona simulovat jeho oznámení o úmrtí astronautů Apollo 9 v roce 1969 – událost, která se nikdy nestala, ale pro kterou byl skutečný scénář použit k nasazení deepfake hlasu a pohybů rtů.
Kromě zaměření na tento influencer scénář se nový benchmark – a videa vytvořená pro něj – soustředí na hodnocení celého snímku videa, na rozdíl od historických strategií detekce deepfake.
Ty starší strategie prováděly facální nebo manipulaci výrazu, nebo facální (nebo v nejlepším případě celopostavovou) substituci v reálných videích – což byl skutečně jediný rozumný přístup, dokud diffusion‑based modely nebyly dostatečně efektivní, aby je během posledních 18‑24 měsíců nahradily.
Otočte tvář
Takto se to už nedělá; starší metoda založená na autoencoderu pochází z počátku deepfake v pozdním roce 2017; a tato technika, která nahrazuje pouze oblast v rámci vnějších kontur obličeje, byla zcela vyčerpána do roku 2022.

Hlavní území pro deepfake aktivitu, 2017‑2023 – ale pro novou generaci genAI video platforem neexistuje taková hranice pro soustředění pozornosti. Zdroj
Přestože vědecký výzkumný sektor miluje dlouhodobou konstantu – kde je cíl pevně daný a kde lze během let či desetiletí zkoušet stále se vyvíjející řadu přístupů – metody detekce deepfake založené na „vnitřní náhradě/úpravě obličeje“ přetrvávají v literatuře i v komerčních nabídkách detekce, daleko za platností cílené základní technologie.
Kromě tří uzavřených modelů testovaných pro tuto práci byly vyzkoušeny také tři velmi výkonné open‑source modely určené pro spotřebitele: Wan 2.2 A14B; HunyuanVideo 1.5; a LTX 2.3, který v poslední době okouzluje komunitu FOSS genAI. Řada LTX také dokáže generovat řeč:
Klikněte pro přehrání: experimenty s řadou LTX na r/stablediffusion, jejíž komunita se zabývá výhradně modely FOSS. Source
Návrh dat
Autoři zamýšlejí svůj nový dataset DF26 jako „hold-out“ sadu pro hodnocení neviděného materiálu. Sbírka obsahuje 2 691 videí ve třech scénářích veřejného projevu: přímé adresování kamery nebo neformální projevy; oficiální prohlášení; a studiové rozhovory.
Všechny AI‑generované video klipy byly založeny na 271 reálných klipů vybraných z OpenVid; TalkingCelebs; a MAVOS-DD.

Ukázka ze sbírky OpenVid, ze které bylo získáno 271 reálných videí jako výchozí materiál pro AI‑generovaná videa v kolekci DF26. Dva další datasety také přispěly k této ne‑falšované součásti DF26. Source
K generování AI videí bylo použito 271 reálných videí, ze kterých byly odvozeny odpovídající scénické prompty z jejich snímků, a tyto prompty – a první snímek samotný, pokud to bylo podporováno – byly zadány do sedmi modelů pro generování videa, čímž vzniklo celkem 2 420 syntetických klipů.
Autoři zajistili, aby do pracovních postupů generování nebyly zahrnuty žádné reálné snímky s textovými překryvy (např. oznámení, kdo mluví apod.), protože by to pravděpodobně podpořilo zkratky a předpoklady. Kandidátské klipy byly hodnoceny pomocí Gemini 2.5.
Navíc byly segmenty obsahující více než jednu tvář odmítnuty, aby se vynutil nastavení „jediný mluvčí“.
Klikněte pro přehrání [NO SOUND]. Ze souboru dat přidruženého k článku, příklady špičkových video generací napříč sedmi z nejnovějších a nejvýkonnějších generativních modelů, jak otevřených, tak uzavřených. Modely použité pro dataset zahrnují také ty, které jsou schopny generovat řeč (viz příklady dříve v tomto článku). Source
Výzkumníci použili populární komerční platformu Higgsfield AI, která poskytuje širokou škálu uzavřených i otevřených modelů s různými úrovněmi omezení a ochranných zábran.
S NVIDIA H200 (141 GB VRAM) jako základním GPU modelem pro interní výzkumný klastr trvalo generování 1 626 videí pro sbírku přibližně 440 GPU hodin.
Kromě zajištění, že ve výstupu není viditelný žádný text, bylo také nutné zakrýt nebo obecně se vyhnout zobrazení AI vodoznaku, protože by to také představovalo potenciální „zkratku“ pro hodnotitele nebo hodnotící systém.
Testy
Primárním měřítkem použitém pro závěrečné kolo testů byla plocha pod křivkou ROC (AUC / AUROC), přičemž jako doplňkové měřítko byl použit Equal Error Rate (EER).
Detektory založené na jednotlivých snímcích (které hodnotí statické snímky nezávisle) byly testovány na 32 rovnoměrně rozmístěných snímcích z každého videa, přičemž skóre byla následně zprůměrována do jediného výsledku. Naopak temporální detektory (které mohou využívat informace z po sobě jdoucích snímků) analyzovaly samotnou sekvenci videa.
Výsledky temporálních detektorů DFD-FCG a PwTF-DVD jsou uvedeny níže, společně s výsledky pro ForAda; Effort; FSFM; GenD-CLIP a GenD-DINO; a DFD-HR. Všechny byly trénovány na váženém datasetu FaceForensics++.

Výsledky testů porovnávající detektory deepfake na CelebDF++ a DF26. Všechny detektory byly trénovány na FaceForensics++, přičemž vyšší AUROC a nižší EER naznačují lepší výkon.
Autoři uvádějí, že většina detektorů dosahuje dobrých výsledků na Celeb-DF++ (CDFv3), ale výrazně selhává na náročnější nové kolekci DF26.
‘[Multiple] špičkové detektory dosahují silného výkonu na benchmarku CelebDF++ [16] (CDFv3), přičemž temporální metody dosahují AUROC 94.3 a 92.3.
‘Nicméně jejich výkon na DF26 výrazně klesá na 48,2 a 61,6 AUROC, respektive.
‘Většina metod výrazně degraduje a zůstává blízko náhodě; nejvyšší AUROC 69,7 dosahuje GenD-PE.
‘To ukazuje, že DF26 je náročnější benchmark pro špičkové detektory.’
Obraz‑na‑video, jak uvádějí, se ukázalo jako obtížnější k detekci než text‑na‑video, a to jak pro lidi, tak pro automatické detektory, přičemž PwTF‑DVD dosahoval nejlepšího výsledku u materiálu I2V a GenD‑PE vynikal u T2V.
Výkon se dramaticky lišil v závislosti na tom, který generátor vytvořil falešné video, což naznačuje, že detektory často učí generátor‑specifické stopy místo obecné signatury syntetického videa. PwTF‑DVD například dosáhl AUROC 92,9 na výstupu text‑na‑video od Wan 2.2, ale klesl na úroveň náhody u HunyuanVideo 1.5 – ačkoliv oba patřily do stejného moderního generativního prostředí:

Výkon detektorů napříč komerčními a open‑source generátory videa. Široké rozdíly mezi sloupci ukazují, že spolehlivost detekce silně závisí na tom, který model video vytvořil, přičemž GenD‑PE dosahuje nejvyššího průměrného AUROC.
Níže vidíme, že přeškolení GenD‑PE na novějším materiálu DF26 podstatně zlepšilo jeho schopnost detekovat videa od generátorů, které během tréninku neviděl:

Výsledky přeškolení GenD‑PE napříč neviděnými generátory videa. Trénink na novějším materiálu DF26 obecně zlepšil výkon napříč generátory ve srovnání s původním tréninkem FaceForensics++.
Trénink na HunyuanVideo 1.5 zvýšil AUROC alespoň na 93,1 u Grok Imagine 1.0, Veo 3.1 a Wan 2.6, což podporuje argument v článku, že detektory trénované jen na starších datasetech, jako je FaceForensics++, jsou špatně přizpůsobeny současnému generativnímu videu.
Možná předvídatelně, oba temporální detektory měly mnohem snazší úkol s open‑source videem než s klipy z komerčních modelů. DFD‑FCG klesl z AUROC 57,4 na open‑source materiálu na 34,5 u uzavřeného videa; zatímco PwTF‑DVD spadl z 70,5 na 48,3:

Výsledky porovnání dvou temporálních detektorů napříč zdrojem generátoru a scénářem mluvení. Oba podstatně hůře fungovali u uzavřeného videa, zatímco rozdíly mezi typy scén byly menší.
Nicméně článek nedopadne tím, že by prohlásil, že komerční modely jsou jednoduše těžší k detekci, protože rozdíly v rodině modelů, post‑processingu a vizuální kvalitě mohou být také faktory.
typ scény měl mnohem menší význam: DFD‑FCG zůstával blízko náhodě u přímých záběrů do kamery, oficiálních prohlášení a studiových rozhovorů, zatímco PwTF‑DVD byl nejlepší u oficiálních prohlášení. Podle článku se zdá, že samotný generátor má větší vliv než styl prezentace.
Lidská studie byla také provedena, aby zjistila, zda lidé mají s DF26 stejné potíže jako automatické detektory. V průběhu 232 označovacích sezení účastníci posuzovali krátké klipy z DF26, CelebDF++ a DeepSpeak v2 jako pravé nebo falešné, aniž by byli informováni, kolik příkladů každé třídy uvidí.

Lidská přesnost napříč DF26, CelebDF++ a DeepSpeak v2. Účastníci identifikovali pravá videa přibližně stejnou mírou ve všech třech datasetech, zatímco přesnost u falešných videí DF26 klesla k úrovni náhody.
Výkon u pravých videí byl podobný ve všech třech datasetech: 76,0 % pro DF26, 75,5 % pro CelebDF++ a 72,8 % pro DeepSpeak v2. Rozdíl se projevil u falešných videí, kde přesnost klesla na 52,6 % u DF26, oproti 74,5 % a 69,8 % u dvou starších datasetů.
Proto podle článku, ačkoliv účastníci nebyli obecně zmatení DF26, měli potíže najít konkrétní viditelné důkazy, že jeho syntetická videa jsou falešná.
Závěr
Navzdory hlášenému 16‑násobnému nárůstu frekvence deepfake za poslední dva roky je skutečná realita škodlivých deepfake do značné míry nepřítomna v našem běžném životě, pokud sami nejsme jejich cílem.
V případě obětí sexuálních deepfake je to naprosto pochopitelné – ale protože deepfake nyní mají stále rostoucí dopad na trestný čin podvodu, může být užitečné, aby více takového materiálu bylo sdíleno s veřejností, aby byl náš kontext aktualizován z ‘zlatého věku’ autoenkodérových deepfake na mnohem ostřejší a klamavější éru deepfake založených na difúzi.
Samozřejmě, většina materiálu souvisejícího s výstupy modelů v nové studii, stejně jako s dalšími modely, se objevuje bez dostatečného kontextu na sociálních médiích, jejichž správci buď nemusí být schopni rozlišit AI od reality, nebo prostě se nestarají.
Jedním dalším ukazatelem, který můžeme všichni použít na videa, u nichž máme pochybnosti, je rozumná důvěřivost – ale tato schopnost se mezi jednotlivci tak liší, že je nespolehlivá. Proto může být během přechodného období, kdy si zvykáme na dopad této technologie a její stále rostoucí možnosti, nutné odložit posouzení.
Poprvé zveřejněno v pondělí 14. září 2026












