Andersonův úhel

Forenzní metoda pro novou generaci deepfakeů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Variation on ' a 1792x1024 image of a lab technician examining a Guy Fawkes mask with forensic equipment.' - Adobe Firefly

Přestože deepfaking soukromých osob se stal rostoucím veřejným problémem a je stále více zakazován v různých regionech, prokázat, že uživatelský model – jako například ten, který umožňuje pomstu – byl speciálně vyškolen na konkrétních obrazech osoby, zůstává extrémně náročné.

Chcete-li problém uvést do kontextu: klíčovým prvkem deepfake útoku je falešné tvrzení, že obraz nebo video zobrazuje konkrétní osobu. Stačí prostě říci, že někdo na videu je identita #A, místo aby to byl pouze podobný člověk, a to stačí k vytvoření újmy, a není třeba žádný umělý inteligence.

Jedná se o to, že pokud útočník generuje obrázky nebo videa pomocí modelů vyškolených na datech skutečných osob, systémy rozpoznávání tváří na sociálních médiích a vyhledávačích automaticky propojí padělaný obsah s obětí – bez nutnosti uvádět jména v příspěvcích nebo metadatech. Samotné AI generované vizuály zajišťují asociaci.

Čím je vzhled osoby více odlišný, tím více to platí, dokud padělaný obsah nezobrazí v obrazových vyhledávačích a nakonec nedosáhne oběti.

Face to Face

Nejběžnější způsob šíření identitně zaměřených modelů je目前 Low-Rank Adaptation (LoRA), kde uživatel vyškolí malé množství obrázků po dobu několika hodin proti váhám většího základního modelu, jako je Stable Diffusion (pro statické obrázky, většinou) nebo Hunyuan Video pro video deepfakes.

Nejběžnější cíle LoRAs, včetně nové generace video-založených LoRAs, jsou ženské celebrity, jejichž sláva je vystavuje tomuto typu zacházení s menším veřejným kritizováním než v případě “neznámých” obětí, kvůli předpokladu, že takové odvozené díla jsou pokryty pod “fair use” (alespoň v USA a Evropě).

Ženské celebrity dominují seznamy LoRA a Dreambooth na portálu civit.ai. Nejoblíbenější LoRA v současné době má více než 66 000 stažení, což je značné, vezmeme-li v úvahu, že toto použití AI je stále považováno za “okrajovou” aktivitu.

Neexistuje žádný veřejný fórum pro oběti deepfakingu, které nejsou celebrity, které se objevují v médiích pouze tehdy, když vznikají případy stíhání, nebo když oběti promluví v populárních médiích.

Jedná se o to, že v obou případech modely používané k padělání identit “destilovaly” svá trénovací data tak dokonale do latentního prostoru modelu, že je obtížné identifikovat zdroj obrázků, které byly použity.

Pokud by to bylo možné provést v rámci přijatelné marže chyby, umožnilo by to stíhání těch, kteří sdílejí LoRAs, protože to nejen prokazuje úmysl padělat konkrétní identitu (tj. identitu konkrétní “neznámé” osoby, i když pachatel během procesu hanobení nikdy neuvádí jména), ale také vystavuje uploadera obvinění z porušení autorských práv, pokud je to relevantní.

Tento druhý bod by byl užitečný v jurisdikcích, kde je právní regulace technologií deepfakingu nedostatečná nebo pozadu.

Over-Exposed

Cílem trénování základního modelu, jako je multi-gigabajtový základní model, který uživatel může stáhnout z Hugging Face, je to, aby se model stal dobře generalizovaným a ohebným. To zahrnuje trénování na dostatečném počtu různých obrázků a s vhodnými nastaveními a ukončením trénování předtím, než se model “přepřáhne” k datům.

Přepřažený model viděl data tolikrát (nadměrně) během procesu trénování, že bude mít tendenci reprodukovat obrázky, které jsou velmi podobné, a tím odhalit zdroj trénovacích dat.

Identita 'Ann Graham Lotz' může být téměř dokonale reprodukována v modelu Stable Diffusion V1.5. Rekonstrukce je téměř identická s trénovacími daty (vlevo na obrázku výše). Zdroj: https://arxiv.org/pdf/2301.13188

Identita ‘Ann Graham Lotz’ může být téměř dokonale reprodukována v modelu Stable Diffusion V1.5. Rekonstrukce je téměř identická s trénovacími daty (vlevo na obrázku výše). Zdroj: https://arxiv.org/pdf/2301.13188

Jedná se o to, že přepřažené modely jsou obecně odstraněny svými tvůrci, spíše než distribuovány, protože nejsou v žádném případě vhodné pro účel. Proto je to nepravděpodobný forenzní “vítr”. V každém případě platí, že tento princip se více vztahuje na drahé a rozsáhlé trénování základních modelů, kde mnoho verzí stejného obrázku, které se dostaly do obrovského zdrojového datasetu, může učinit některé trénovací obrázky snadno vyvolatelné (viz obrázek a příklad výše).

Věci jsou trochu jiné v případě LoRA a Dreambooth modelů (i když Dreambooth již není tak populární kvůli svým velkým souborům). Zde uživatel vybírá velmi omezený počet různých obrázků subjektu a používá je k trénování LoRA.

Vlevo, výstup z Hunyuan Video LoRA. Vpravo, data, která ermögnila podobnost (obrázky použité s povolením osoby zobrazené).

Vlevo, výstup z Hunyuan Video LoRA. Vpravo, data, která ermögnila podobnost (obrázky použité s povolením osoby zobrazené).

Často LoRA má trénovaný spouštěcí slovo, jako [jméno celebrity]. Avšak velmi často specificky trénovaný subjekt se objeví v generovaném výstupu i bez takových podnětů, protože i dobře vyvážený (tj. ne přepřažený) LoRA je somewhat “fixován” na materiálu, na kterém byl trénován, a bude mít tendenci zahrnout ho do jakéhokoli výstupu.

Tato predispozice, kombinovaná s omezeným množstvím obrázků, které jsou optimální pro dataset LoRA, vystavují model forenzní analýze, jak uvidíme.

Unmasking the Data

Tyto záležitosti jsou řešeny v nové práci z Dánska, která nabízí metodologii pro identifikaci zdrojových obrázků (nebo skupin zdrojových obrázků) v černé skříňce Membership Inference Attack (MIA). Metoda zahrnuje použití vlastních trénovaných modelů, které jsou navrženy tak, aby pomohly odhalit zdrojová data generováním svých vlastních “deepfake” obrázků:

Příklady 'falešných' obrázků generovaných novým přístupem, na stále se zvyšující úrovni Classifier-Free Guidance (CFG), až do bodu zničení. Zdroj: https://arxiv.org/pdf/2502.11619

Příklady ‘falešných’ obrázků generovaných novým přístupem, na stále se zvyšující úrovni Classifier-Free Guidance (CFG), až do bodu zničení. Zdroj: https://arxiv.org/pdf/2502.11619

Práce práce, nazvaná Membership Inference Attacks for Face Images Against Fine-Tuned Latent Diffusion Models, je nejzajímavějším příspěvkem k literatuře na toto téma, ale je také nečitelným a stručně napsaným článkem, který vyžaduje značné dekódování. Proto budeme pokrývat alespoň základní principy za projektem zde a výběr výsledků, které byly získány.

V podstatě, pokud někdo fine-tuneuje AI model na vaši tvář, metoda autorů může pomoci prokázat to tím, že hledá znaky memorizace v generovaných obrazech modelu.

V první instanci je cílový AI model fine-tuneován na datasetu tváří, což z něj dělá více pravděpodobné, že reprodukuje detaily z těchto obrázků ve svých výstupech. Následně je trénován klasifikační útokový režim pomocí AI generovaných obrázků z cílového modelu jako “pozitivních” (podezřelých členů trénovací sady) a dalších obrázků z jiného datasetu jako “negativních” (nepříslušníků).

Pomocí učení jemných rozdílů mezi těmito skupinami může útokový model předpovědět, zda daný obrázek byl součástí původního datasetu, který byl použit pro fine-tuneování cílového modelu.

Útok je nejúčinnější v případech, kdy byl AI model fine-tuneován rozsáhle, což znamená, že čím více je model specializován, tím snazší je detekovat, zda byly某 obrázky použity. To obecně platí pro LoRAs navržené pro rekreaci celebrit nebo soukromých osob.

Autorům se také podařilo zjistit, že přidání viditelných vodítek k trénovacím obrázkům usnadňuje detekci ještě více – i když skryté vodítka nepomáhají tolik.

Úspěšně byl přístup testován v černé skříňce, což znamená, že funguje bez přístupu k vnitřním detailům modelu, pouze jeho výstupům.

Metoda je výpočetně náročná, jak autoři přiznávají; nicméně hodnota této práce spočívá v tom, že ukazuje směr pro další výzkum a prokazuje, že data lze reálně extrahovat do přijatelné tolerance; proto, vzhledem k jejímu průkopnickému charakteru, nemusí běžet na smartphonech v této fázi.

Method/Data

Byly použity several datasets z Technické univerzity v Dánsku (DTU, hostitelské instituce pro tři výzkumníky) pro fine-tuneování cílového modelu a pro trénování a testování útokového režimu.

Datasety používané byly odvozeny z DTU Orbit:

DseenDTU Základní sada obrázků.

DDTU Obrázky stažené z DTU Orbit.

DseenDTU Část DDTU používaná pro fine-tuneování cílového modelu.

DunseenDTU Část DDTU, která nebyla použita pro fine-tuneování žádného modelu generování obrázků a byla místo toho použita pro testování nebo trénování útokového modelu.

wmDseenDTU Část DDTU s viditelnými vodítky používaná pro fine-tuneování cílového modelu.

hwmDseenDTU Část DDTU se skrytými vodítky používaná pro fine-tuneování cílového modelu.

DgenDTU Obrázky generované modelem Latent Diffusion Model (LDM), který byl fine-tuneován na sadě obrázků DseenDTU.

Datasety používané pro fine-tuneování cílového modelu se skládají z image-text párů anotovaných modelem BLIP (možná ne náhodou jedním z nejpopulárnějších necenzurovaných modelů v komunitě AI).

BLIP byl nastaven tak, aby připojil frázi ‘a dtu headshot of a’ ke každé popisu.

Byly také použity several datasets z Aalborgské univerzity (AAU) pro testování:

DAAU Obrázky stažené z AAU vbn.

DseenAAU Část DAAU používaná pro fine-tuneování cílového modelu.

DunseenAAU Část DAAU, která nebyla použita pro fine-tuneování žádného modelu generování obrázků a byla místo toho použita pro testování nebo trénování útokového modelu.

DgenAAU Obrázky generované modelem LDM fine-tuneovaným na sadě obrázků DseenAAU.

Ekvivalentně jako dříve uvedené sady, byla použita fráze ‘a aau headshot of a’. To zajistilo, že všechny popisky v datasetu DTU následovaly formát ‘a dtu headshot of a (…)’, posilující základní charakteristiky datasetu během fine-tuneování.

Tests

Byly provedeny several experimenty pro vyhodnocení, jak dobře membership inference útoky fungují proti cílovému modelu. Každý test měl za cíl určit, zda je možné provést úspěšný útok v rámci schématu uvedeného níže, kde cílový model je fine-tuneován na datasetu, který byl získán bez autorizace.

Schéma přístupu.

Schéma přístupu.

S fine-tuneovaným modelem, který generuje výstupní obrázky, jsou tyto obrázky použity jako pozitivní příklady pro trénování útokového modelu, zatímco další nepříbuzné obrázky jsou zahrnuty jako negativní příklady.

Útokový model je trénován pomocí supervised learning a je poté testován na nových obrazech, aby se určilo, zda byly původně součástí datasetu, který byl použit pro fine-tuneování cílového modelu. Pro vyhodnocení přesnosti útokového modelu je 15% testovacích dat vyhrazeno pro validaci.

Pokud je cílový model fine-tuneován na známém datasetu, skutečný členství každého obrázku je již stanovené při vytváření trénovacích dat pro útokový model. Tento řízený setup umožňuje jasnou evaluaci, jak účinně útokový model může rozlišovat mezi obrázky, které byly součástí fine-tuneovacího datasetu, a těmi, které nebyly.

Pro tyto testy byl použit model Stable Diffusion V1.5. Ačkoli je tento model poměrně starý a často se objevuje ve výzkumu kvůli potřebě konzistentního testování a rozsáhlého korpusu předchozích prací, které jej používají, je to vhodný případ použití; V1.5 zůstal populární pro vytváření LoRA v komunitě Stable Diffusion po dlouhou dobu, navzdory několika následujícím verzím, a dokonce i navzdory vzniku Flux – protože model je完全ně necenzurovaný.

Výzkumníkův útokový model byl založen na Resnet-18, s uchováním předtrénovaných váh modelu. 1000-neuronová poslední vrstva ResNet-18 byla nahrazena plně propojenou vrstvou se dvěma neurony. Trénovací ztráta byla kategorická cross-entropy, a byl použit Adam optimizer.

Pro každý test byl útokový model trénován pětkrát pomocí různých náhodných semen pro výpočet 95% intervalů spolehlivosti pro klíčové metriky. Zero-shot klasifikace s modelem CLIP byla použita jako baseline.

(Poznámka: původní primární výsledky tabulky v článku jsou stručné a neobvykle obtížné k pochopení. Proto jsme je reformulovali níže do uživatelsky přívětivější formy. Klikněte na obrázek, aby jste jej viděli v lepší rozlišení)

Souhrn výsledků ze všech testů. Klikněte na obrázek, aby jste jej viděli v lepší rozlišení

Souhrn výsledků ze všech testů. Klikněte na obrázek, aby jste jej viděli v lepší rozlišení

Výzkumníkův útokový model prokázal největší účinnost při cílení na fine-tuneované modely, zejména ty, které byly vyškoleny na konkrétní sadě obrázků, jako je tvář jednotlivce. Nicméně, zatímco útok může určit, zda byl dataset použit, má problémy s identifikací konkrétních obrázků uvnitř tohoto datasetu.

V praktických termínech není toto druhé omezení nutně překážkou pro použití tohoto přístupu forenzně; zatímco je relativně málo hodnotné prokázat, že byl použit známý dataset, jako je ImageNet, útočník na soukromou osobu (ne celebrity) bude mít tendenci mít mnohem méně možností výběru zdrojových dat a bude muset plně využít dostupné datové skupiny, jako jsou sociální sítě a další online sbírky. Tyto efektivní “hash” mohou být odhaleny metodami, které jsou zde popsány.

Článek také poznamenává, že další způsob, jak zlepšit přesnost, je použití AI generovaných obrázků jako “nepříslušníků”, místo aby se spoléhal pouze na reálné obrázky. To brání umělým vysokým úspěchovým poměrům, které by jinak mohly výsledky klamat.

Dalším faktorem, který významně ovlivňuje detekci, je podle autorů watermarking. Když trénovací obrázky obsahují viditelné vodítka, útok se stává vysoce účinným, zatímco skrytá vodítka nabízejí málo až žádnou výhodu.

Pravý obrázek ukazuje skutečné “skryté” vodítka použitá v testech.

Nakonec hraje úroveň vedení v text-to-image generaci také roli, s ideálním vyvážením nalezeným na úrovni vedení kolem 8. I když není použito žádné přímé podněcování, fine-tuneovaný model má stále tendenci produkovat výstupy, které se podobají jeho trénovacím datům, posilující účinnost útokového modelu.

Závěr

Je škoda, že tento zajímavý článek byl napsán tak nečitelným způsobem, protože by měl být zajímavý pro zastánce ochrany soukromí a příležitostné výzkumníky AI.

Přestože membership inference útoky mohou být zajímavým a plodným forenzním nástrojem, je možná ještě důležitější, aby se tento výzkumný směr vyvinul do aplikovatelných širokých principů, aby se zabránilo tomu, aby skončil ve stejné hře “whack-a-mole”, která se vyskytla u detekce deepfakeů obecně, kdy vydání nového modelu nepříznivě ovlivňuje detekci a podobné forenzní systémy.

Protože existují některé důkazy o vyšší úrovni řídícího principu, které byly očištěny v tomto novém výzkumu, můžeme doufat, že uvidíme více práce v tomto směru.

Poprvé publikováno v pátek 21. února 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]