Andersonův úhel

Nyní NSFW a „celebrity“ pózy jsou potravou pro cenzuru AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
An artist's wooden mannequin getting arrested – Flux 1D.

Nová ochrana AI pro generativní video systémy navrhuje cenzurovat pózy těla. Fyzické postoje (nebo mimické výrazy) které mohou být interpretovány jako sexuálně sugestivní, „útočné gesta“ nebo dokonce autorsky chráněné pózy celebrit nebo potenciálně ochranné známky, jsou všechny zaměřeny.

 

Nový výzkum z Číny a Singapuru se zabývá jednou z méně zřejmých oblastí „nebezpečné“ generace obrázků a videí: zobrazením pózy sama o sobě, ve smyslu dispozice těla nebo mimického výrazu zobrazené osoby v AI vytvořeném výstupu:

Konceptuální schéma pro PoseGuard, systém navržený v novém výzkumu. Zdroj: https://arxiv.org/pdf/2508.02476

Konceptuální schéma pro PoseGuard, systém navržený v novém výzkumu. Zdroj: https://arxiv.org/pdf/2508.02476

Systém, nazvaný PoseGuard, používá jemné ladění a LoRAs k vytvoření modelů, které intrinsicky nemohou generovat „zakázané“ pózy. Tento přístup byl zvolen, protože bezpečnostní opatření vestavěná do modelů FOSS mohou být obvykle triviálně překonána, zdůrazňující, že tato nová „filtrace“ specificky cílí na lokální instalace (protože modely API pouze mohou filtrovat vstupní a výstupní obsah a podněty, bez potřeby ohrozit integritu modelových váh jemným laděním).

Tohoto není první práce, která považuje pózy za nebezpečná data sama o sobě; „sexuální mimické výrazy“ byly menší sub-oblast studia po nějakou dobu, zatímco několik autorů nové práce také vytvořilo méně sofistikovaný Dormant systém.

Nicméně, nová práce je první, pokud vím, která rozšiřuje typování póz za hranice sexuálního obsahu, dokonce i na úroveň zahrnující „autorsky chráněné pohyby celebrit“:

‘Definujeme nebezpečné pózy na základě potenciálních rizik generovaných výstupů spíše než geometrických charakteristik. [Nebezpečné] pózy zahrnují: 1) diskriminační pózy (například klečení, útočná pozdravení), 2) sexuálně sugestivní NSFW pózy a 3) autorsky chráněné pózy imitující konkrétní obrazovky celebrit.

‘Tyto pózy jsou shromážděny z online zdrojů (například Wikipedie), LLM-založené filtrace a rizikově označené datové sady (například Civitai NSFW značky), zajišťující vyváženou a komplexní nebezpečnou pózu datovou sadu pro školení.’

Kategorie 'NSFW' z 50 póz vyvinutých pro PoseGuard.

Kategorie ‘NSFW’ z 50 póz vyvinutých pro PoseGuard.

Je zajímavé poznamenat, že pózy celebrit mohou být ochranné známky nebo chráněny právními prostředky, a že dostatečně „kreativní“ kombinace póz nebo postojů může být chráněna jako jedinečná posloupnost choreografie. Nicméně, dokonce i ikonická jediná póza nemusí být chráněna, jak jeden fotograf objevil, v Rentmeester Vs. Nike rozhodnutí:

Fotograf, který pořídil levý snímek Michaela Jordana, zažaloval Nike, když společnost zopakovala fotografii (vpravo); nicméně, panel soudců zamítl žalobu. Zdroj: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

Fotograf, který pořídil levý snímek Michaela Jordana, zažaloval Nike, když společnost zopakovala fotografii (vpravo); nicméně, panel soudců zamítl žalobu. Zdroj: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

Nový systém PoseGuard tvrdí, že je prvním, kdo snižuje výstup, když je detekována nebezpečná póza; aby vestavěl bezpečnostní zábrany přímo do generativního modelu; aby definoval „nebezpečné“ pózy napříč třemi kategoriemi; a aby zajistil, že generace uchovává kvalitu a integritu, jednou když je útočná póza dostatečně pozměněna, aby unikla filtru.

Nová práce se nazývá PoseGuard: Pose-Guided Generation with Safety Guardrails a pochází od šesti výzkumníků z University of Science and Technology of China, (singapurské) Agentury pro vědu, technologie a výzkum (A*STAR CFAR) a Nanyang Technological University.

Metoda

PoseGuard přebírá logiku backdoor útoků k vytvoření obranného mechanismu přímo do modelu. V typickém backdoor útoku specifické vstupy spouštějí škodlivé výstupy a PoseGuard invertuje tuto konfiguraci: bestimmé předdefinované pózy, které jsou považovány za nebezpečné kvůli jejich sexuální, útočné nebo autorsky chráněné povaze, jsou propojeny s „neutrálními“ cílovými obrázky, jako jsou prázdné nebo rozmazané snímky.

Při jemném ladění modelu na kombinované datové sadě normálních a spouštěcích póz se systém učí zachovat věrnost pro benigní vstupy, zatímco snižuje kvalitu výstupu pro nebezpečné:

PoseGuard zpracovává referenční obrázek a pózu pomocí sdíleného denoisovacího UNet, kombinujícího předem trénované váhy se bezpečnostně orientovaným jemným laděním. Tato konfigurace umožňuje modelu potlačit škodlivé generace z nebezpečných póz, zatímco zachovává kvalitu výstupu pro normální vstupy.

PoseGuard zpracovává referenční obrázek a pózu pomocí sdíleného denoisovacího UNet, kombinujícího předem trénované váhy se bezpečnostně orientovaným jemným laděním. Tato konfigurace umožňuje modelu potlačit škodlivé generace z nebezpečných póz, zatímco zachovává kvalitu výstupu pro normální vstupy.

Tato „v-modelu“ strategie eliminuje potřebu externích filtrů a zůstává účinná i v adversativních nebo open-source prostředích.*

Data a testy

Pro získání benigních základních póz autorů byla použita UBC-Fashion datová sada:

Příklady z University of British Columbia fashion datové sady, použité jako zdroj benigních póz v PoseGuard. Zdroj: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

Příklady z University of British Columbia fashion datové sady, použité jako zdroj benigních póz v PoseGuard. Abstraktní pózy byly extrahovány z těchto obrázků s frameworkem pro odhad póz.  Zdroj: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

Nebezpečné pózy, jak je uvedeno výše, byly získány z open-source platforem, jako je CivitAI. Pózy byly extrahovány pomocí DWPose frameworku, což vedlo k 768x768px pózu obrázkům:

Příklady z 50 nebezpečných póz použitých ve školení. Zobrazeny jsou zde NSFW a autorsky chráněné pózy, získané z Wikipedie, Render-State, Civitai a Google Search.

Příklady z 50 nebezpečných póz použitých ve školení. Zobrazeny jsou zde NSFW a autorsky chráněné pózy, získané z Wikipedie, Render-State, Civitai a Google Search.

Model pose-guided generace byl AnimateAnyone.

Šest metrik použitých bylo Fréchet Video Distance (FVD); FID-VID; Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); a Fréchet Inception Distance (FID). Testy byly provedeny na NVIDIA A6000 GPU s 48GB VRAM, při velikosti dávky 4 a sazbě učení 1×10-5.

Tři primární kategorie testované byly účinnost, odolnost a generalizace.

V první z nich, účinnost, autoři porovnali dvě strategie školení pro PoseGuard: plné jemné ladění denoisovacího UNet a parametrů-efektivní jemné ladění pomocí LoRA modulů.

Oba přístupy potlačují výstupy z nebezpečných póz, zatímco zachovávají kvalitu výstupu na benigních pózech, ale s rozdílnými kompromisy: plné jemné ladění dosahuje silnější potlačení a zachovává vyšší věrnost, zejména když je počet nebezpečných trénovacích póz malý; a LoRA-založené ladění zavádí více degradace kvality generace, když se zvyšuje počet nebezpečných póz – ale vyžaduje podstatně méně parametrů a méně výpočetního výkonu.

Výkon PoseGuardu napříč generativními a obrannými metrikami. Šipky nahoru označují metriky, kde vyšší hodnoty jsou lepší; šipky dolů označují metriky, kde nižší hodnoty jsou lepší.

Výkon PoseGuardu napříč generativními a obrannými metrikami. Šipky nahoru označují metriky, kde vyšší hodnoty jsou lepší; šipky dolů označují metriky, kde nižší hodnoty jsou lepší.

Kvalitativní výsledky (viz obrázek níže) ukázaly, že bez zásahu model reprodukoval útočné a NSFW pózy s vysokou věrností. S aktivovaným PoseGuardem tyto pózy spustily nízkokvalitní nebo prázdné výstupy, zatímco benigní vstupy zůstaly vizuálně neporušené. Jak se sada obrany zvětšila z čtyř na třicet dva nebezpečných póz, kvalita benigních výstupů poklesla mírně, zejména pro LoRA.

Vizuální výsledky ukazující, jak PoseGuard reaguje na jednu nebezpečnou pózu pomocí plného parametrů jemného ladění. Model potlačuje výstup pro diskriminační, NSFW a autorsky chráněné pózy, přesměrovává je na černý obrázek, zatímco zachovává kvalitu pro normální vstupy.

Vizuální výsledky ukazující, jak PoseGuard reaguje na jednu nebezpečnou pózu pomocí plného parametrů jemného ladění. Model potlačuje výstup pro diskriminační, NSFW a autorsky chráněné pózy, přesměrovává je na černý obrázek, zatímco zachovává kvalitu pro normální vstupy.

Pro odolnost byl PoseGuard testován v podmínkách, které simulují reálné nasazení, kde vstupní pózy nemusí přesně odpovídat předdefinovaným příkladům. Hodnocení zahrnovalo běžné transformace, jako je přesun, škálování a rotace, jakož i ruční úpravy úhlů kloubů, aby se napodobila přirozená variace.

Výsledky pro odolnost PoseGuardu proti běžným pózovým transformacím.

Výsledky pro odolnost PoseGuardu proti běžným pózovým transformacím.

Většinou model pokračoval v potlačení nebezpečných generací, což naznačuje, že obrana zůstává odolná vůči mírným perturbacím. Když úpravy odstranily základní riziko v póze, model přestal potlačovat a produkoval normální výstupy, což naznačuje, že se vyhýbá falešně pozitivním výsledkům při benigních odchylkách.

Hodnocení odolnosti PoseGuardu proti pózovým úpravám. Obrázek ukazuje výstupy modelu pro nebezpečné pózy upravené překladem, škálováním a rotací, jakož i ručními úpravami končetin. PoseGuard pokračuje v potlačení nebezpečných generací při mírných změnách, ale obnovuje normální výstupy, když póza již nepředstavuje riziko.

Hodnocení odolnosti PoseGuardu proti pózovým úpravám. Obrázek ukazuje výstupy modelu pro nebezpečné pózy upravené překladem, škálováním a rotací, jakož i ručními úpravami končetin. PoseGuard pokračuje v potlačení nebezpečných generací při mírných změnách, ale obnovuje normální výstupy, když póza již nepředstavuje riziko.

Nakonec, v hlavním běhu experimentů, výzkumníci testovali PoseGuard pro generalizaci – jeho schopnost fungovat účinně na nových datech, v různých prostředích a okolnostech.

Zde PoseGuard byl aplikován na reference image-guided generaci pomocí výše zmíněného modelu AnimateAnyone. V tomto nastavení systém ukázal silnější potlačení neautorizovaných výstupů ve srovnání s pózou-založenou kontrolou, s téměř úplnou degradací generované videa v některých případech:

Porovnání výkonu PoseGuardu, když je aplikován na pózou-založenou a reference image-guided generaci, pomocí plného jemného ladění na čtyři nebezpečné vstupy.

Porovnání výkonu PoseGuardu, když je aplikován na pózou-založenou a reference image-guided generaci, pomocí plného jemného ladění na čtyři nebezpečné vstupy.

Autoři připisují toto dense identitní informace v referenčních obrazech, které umožňují modelu snadněji se naučit cílené obranné chování. Výsledky, které navrhují, naznačují, že PoseGuard může omezit rizika napodobení v scénářích, kde je video generováno přímo z vzhledu osoby.

Pro konečnou zkoušku autoři aplikovali PoseGuard na faciální landmark-guided video syntézu pomocí AniPortrait systému, scénáře, který cílí na jemné faciální výrazy spíše než plné pózy těla.

Nebezpečné faciální výrazy potlačené v AniPortrait, s novým systémem.

Nebezpečné faciální výrazy potlačené v AniPortrait, s novým systémem.

Pomocí jemného ladění denoisovacího UNet se stejným obranným mechanismem byl model schopen potlačit výstupy z nebezpečných faciálních landmarků, zatímco ponechával benigní výrazy nedotčené. Výsledky, které autoři navrhují, ukazují, že PoseGuard může generalizovat napříč vstupními modality a udržovat účinnost v více lokalizovaných, expresívních generativních úkolech.

Vizuální výsledky ukazující, jak PoseGuard reaguje na reference image-guided generaci.

Vizuální výsledky ukazující, jak PoseGuard reaguje na reference image-guided generaci.

Závěr

Musí se přiznat, že pro mnoho z 50 zakázaných referenčních póz poskytnutých v práci by aktivity, jako jsou lékařské vyšetření, nebo dokonce provádění nudných domácích úkolů, byly pravděpodobně zablokovány v tom, co lze pouze považovat za syntézu-založenou verzi Scunthorpe efektu.

Z tohoto pohledu a ještě více v případě faciálních výrazů (které mohou být mnohem více dvojznačné a nuancované v záměru), PoseGuard by se zdál být spíše hrubým nástrojem. Kromě toho, vzhledem k obecnému ochlazujícímu efektu kolem NSFW AI, FOSS verze, jako je nedávný Flux Kontext, jsou rutinně velmi cenzurované v každém případě, buď prostřednictvím přísného filtrování datové sady, úpravy váh nebo obojího.

Proto přidání omezení navrhovaných zde k břemenu lokální-modelové cenzury se zdá být spíše jako pokus potlačit účinnost ne-API generativních systémů. To snad ukazuje na budoucnost, kde lokální modely mohou produkovat nižší kvalitu generace čehokoliv, co uživatel chce, zatímco API modely nabízejí mnohem lepší výstup, pokud se lze pouze prokopat přes filtr a bezpečnostní opatření, která uklidňují právní oddělení hostitelské společnosti.

Systém, jako je PoseGuard, kde jemné ladění aktivně ovlivňuje kvalitu výstupu základního modelu (ačkoli to je přehlíženo v práci), není zaměřen na API systémy vůbec; online pouze vanguard modely budou pravděpodobně pokračovat ve vývoji s neomezenými trénovacími daty, protože jejich působivé NSFW kapacity jsou omezovány rozsáhlými bezpečnostními opatřeními.

 

* Metoda je zde tak krátká, jako v práci (která má pouze pět stránek), a jako obvykle, přístup je nejlépe pochopen z testovací sekce.

První zveřejnění středy, 6. srpna 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai