Kąt Andersona
Teraz NSFW i “celebrycki” pozowanie są pożywką dla cenzury AI

Nowy system zabezpieczeń AI dla generatywnych systemów wideo proponuje cenzurowanie pozycji ciała. Fizyczne pozycje (lub wyrażenia twarzy) mogą być interpretowane jako sugestywne, “obraźliwe gesty” lub nawet chronione prawem autorskim lub znakiem towarowym pozycje, są wszystkie objęte.
Nowe badania z Chin i Singapuru dotyczą jednego z mniej oczywistych dziedzin w “niebezpiecznym” generowaniu obrazów i wideo: przedstawienia samej pozycji, w sensie ułożenia ciała lub wyrażenia twarzy osoby przedstawionej w wyjściu AI:

Konceptualny schemat dla PoseGuard, systemu proponowanego w nowych badaniach. Źródło: https://arxiv.org/pdf/2508.02476
System, zatytułowany PoseGuard, wykorzystuje dostosowywanie i LoRAs do tworzenia modeli, które nie mogą generować “zabronionych” pozycji. Ten podejście zostało przyjęte, ponieważ zabezpieczenia wbudowane w modele FOSS mogą być łatwo pokonane, podkreślając, że nowy “filtr” jest przeznaczony specjalnie dla instalacji lokalnych (ponieważ modele API mogą filtrować zawartość wejściową i wyjściową oraz prompty, bez potrzeby narażania integralności wag modelu przez dostosowywanie).
To nie jest pierwsza praca, która traktuje pozycje jako niebezpieczne dane same w sobie; “seksualne wyrażenia twarzy” były pomniejszym polem badań od jakiegoś czasu, podczas gdy kilku autorów nowej pracy również stworzyło mniej zaawansowany Dormant system.
Jednak nowy artykuł jest pierwszym, jak mogę stwierdzić, który rozszerza klasyfikację pozycji poza treści seksualne, nawet do punktu, w którym obejmuje “chronione prawem autorskim ruchy celebrytów”:
‘Definiujemy niebezpieczne pozycje na podstawie potencjalnych ryzyk generowanych danych wyjściowych, a nie cech geometrycznych. [Niebezpieczne] pozycje obejmują: 1) dyskryminujące pozycje (np. klęczące, obraźliwe pozdrowienia), 2) sugestywne pozycje NSFW, oraz 3) pozycje wrażliwe na prawa autorskie, naśladujące konkretną imaginię celebrytów.
‘Te pozycje są zbierane z źródeł internetowych (np. Wikipedii), filtrów opartych na LLM oraz zestawów danych z oznaczeniami ryzyka (np. Civitai NSFW tags), co zapewnia zbalansowany i kompletny zestaw niebezpiecznych pozycji do szkolenia.’

Kategoria ‘NSFW’ wśród 50 podstawowych pozycji opracowanych dla PoseGuard.
Warto zauważyć, że pozycje celebrytów mogą być chronione znakiem towarowym lub chronione prawem autorskim, a odpowiednio “kreatywne” kombinacje pozycji lub postaw mogą być chronione jako unikalne sekwencje choreografii. Jednak nawet ikoniczna pojedyncza pozycja może nie być chroniona, jak odkrył jeden fotograf, w sprawie Rentmeester Vs. Nike wyroku:

Fotograf, który zrobił zdjęcie Michaela Jordana, pozwał Nike, gdy odtworzyli zdjęcie (po prawej); jednak panel sędziów odrzucił roszczenie. Źródło: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html
Nowy system PoseGuard twierdzi, że jest pierwszym, który degraduje dane wyjściowe, gdy wykryta jest niebezpieczna pozycja; aby osadzić bezpieczne barierki bezpośrednio w modelu generatywnym; aby zdefiniować “niebezpieczne” pozycje w trzech kategoriach; oraz aby zapewnić, że generowanie zachowuje jakość i integralność, gdy niebezpieczna pozycja została wystarczająco zmieniona, aby uniknąć filtra.
Artykuł nowy jest zatytułowany PoseGuard: Pose-Guided Generation with Safety Guardrails, i pochodzi od sześciu badaczy z Uniwersytetu Nauki i Technologii Chin, (singapurskiej) Agencji Nauki, Technologii i Badań (A*STAR CFAR) oraz Nanyang Technological University.
Metoda
PoseGuard wykorzystuje logikę ataków backdoor do budowy mechanizmu obronnego bezpośrednio w modelu. W typowym ataku backdoor, określone dane wejściowe wyzwalają złe dane wyjściowe, a PoseGuard odwraca tę konfigurację: określone pozycje, które są uważane za niebezpieczne ze względu na ich seksualny, obraźliwy lub wrażliwy na prawa autorskie charakter, są połączone z “neutralnymi” obrazami docelowymi, takimi jak puste lub rozmyte ramki.
Przez dostosowywanie modelu na połączonym zestawie danych normalnych i wyzwalających pozycji, system uczy się zachować wierność dla danych wejściowych benignych, podczas gdy degraduje jakość danych wyjściowych dla niebezpiecznych:

PoseGuard przetwarza obraz odniesienia i sekwencję pozycji przy użyciu współdzielonej sieci denoising UNet, łącząc wstępnie wytrenowane wagi z dostosowanym do bezpieczeństwa dostosowywaniem. Ta konfiguracja pozwala modelowi tłumić szkodliwe generacje z niebezpiecznych pozycji, podczas zachowania jakości danych wyjściowych dla normalnych danych wejściowych.
Ta “wewnątrzmodelowa” strategia eliminuje potrzebę zewnętrznych filtrów i pozostaje skuteczna nawet w środowiskach nieprzyjaznych lub otwartych.*
Dane i testy
Aby uzyskać benignne pozycje bazowe, autorzy wykorzystali zestaw danych UBC-Fashion:

Przykłady z zestawu danych mody Uniwersytetu Brytyjskiej Kolumbii, wykorzystane jako źródło benignych pozycji w PoseGuard. Abstrakcyjne pozycje zostały wyodrębnione z tych obrazów przy użyciu ramowego frameworku pozycji.
Pozycje niebezpieczne, jak wcześniej wspomniano, pochodziły z otwartych platform, takich jak CivitAI. Pozycje zostały wyodrębnione przy użyciu ramowego frameworku DWPose, w wyniku czego powstały obrazy pozycji o rozdzielczości 768×768 px:
[caption id="attachment_221343" align="alignnone" width="1200"]
Model generatywny pozycji był AnimateAnyone.
Sześć metryk wykorzystanych w badaniach to Fréchet Video Distance (FVD); FID-VID; Wskaźnik podobieństwa strukturalnego (SSIM); Maksymalny współczynnik sygnału do szumu (PSNR); Nauka o percepcji (LPIPS); oraz Fréchet Inception Distance (FID). Testy przeprowadzono na karcie graficznej NVIDIA A6000 z 48 GB pamięci VRAM, przy rozmiarze partii 4 i współczynniku uczenia 1×10-5.
Trzy główne kategorie testowe to skuteczność, wytrzymałość oraz uogólnienie.
W pierwszej z nich, skuteczność, autorzy porównali dwie strategie szkolenia dla PoseGuard: pełne dostosowywanie sieci denoising UNet i efektywne dostosowywanie przy użyciu modułów LoRA.
Oba podejścia tłumią dane wyjściowe z niebezpiecznych pozycji, zachowując jakość danych wyjściowych dla benignych pozycji, ale z różnymi kompromisami: pełne dostosowywanie osiąga silniejsze tłumienie i zachowuje wyższą wierność, szczególnie gdy liczba niebezpiecznych pozycji szkoleniowych była mała; i dostosowywanie oparte na LoRA wprowadza więcej degradacji jakości generowania, ale wymaga znacznie mniej parametrów i mniej obliczeń.

Wyniki PoseGuard w generowaniu i obronie. Strzałki w górę wskazują metryki, dla których wyższe wartości są lepsze; strzałki w dół wskazują metryki, dla których niższe wartości są lepsze.
Wyniki jakościowe (patrz poniżej) pokazały, że bez interwencji model odtwarzał obraźliwe i NSFW pozycje z wysoką wiernością. Z włączonym PoseGuard, te pozycje wyzwalały niską jakość lub puste dane wyjściowe, podczas gdy dane wejściowe benignne pozostawały wizualnie nienaruszone. Wraz ze wzrostem zestawu obronnego z czterech do trzydziestu dwóch niebezpiecznych pozycji, jakość danych wyjściowych benignych spadła umiarkowanie, szczególnie dla LoRA.

Wyniki wizualne pokazujące, jak PoseGuard reaguje na jedną niebezpieczną pozycję przy użyciu pełnego dostosowywania parametrów. Model tłumi dane wyjściowe dla dyskryminujących, NSFW i wrażliwych na prawa autorskie pozycji, kierując je do czarnego obrazu, podczas zachowania jakości dla normalnych danych wejściowych.
Dla wytrzymałości, PoseGuard został przetestowany w warunkach symulujących wdrożenie w środowisku rzeczywistym, gdzie dane wejściowe mogą nie odpowiadać dokładnie określonym przykładom. Ocena obejmowała typowe transformacje, takie jak przesunięcie, skalowanie oraz obrót, a także ręczne dostosowania kątów stawów w celu naśladowania naturalnych wariacji.

Wyniki dotyczące wytrzymałości PoseGuard wobec wspólnych transformacji pozycji.
W większości przypadków model nadal tłumił generacje niebezpieczne, wskazując, że obrona pozostaje wytrzymała wobec umiarkowanych perturbacji. Gdy modyfikacje usunęły podstawowe ryzyko w pozycji, model przestał tłumić i wyprodukował normalne dane wyjściowe, sugerując, że unika fałszywych pozytywów podczas niewinnych odchyleń.

Ocena wytrzymałości PoseGuard do modyfikacji pozycji. Rysunek przedstawia dane wyjściowe modelu dla niebezpiecznych pozycji zmodyfikowanych przez przesunięcie, skalowanie i obrót, a także ręczne dostosowania kończyn. PoseGuard nadal tłumi generacje niebezpieczne podczas niewielkich zmian, ale wznowił normalne dane wyjściowe, gdy pozycja nie zawierała już ryzykownej zawartości.
Wreszcie, w głównym przebiegu eksperymentów, badacze przetestowali PoseGuard pod kątem uogólnienia – jego zdolności do skutecznego działania na nowych danych, w różnych środowiskach i okolicznościach.
Tutaj PoseGuard został zastosowany do generowania kierowanego przez obraz odniesienia przy użyciu wspomnianego modelu AnimateAnyone. W tym ustawieniu system wykazał silniejsze tłumienie nieautoryzowanych danych wyjściowych w porównaniu z kontrolą opartą na pozycji, z niemal całkowitą degradacją wygenerowanego wideo w niektórych przypadkach:

Porównanie wyników PoseGuard przy zastosowaniu do generowania kierowanego przez pozycję i generowania kierowanego przez obraz odniesienia, przy użyciu pełnego dostosowywania na czterech niebezpiecznych danych wejściowych.
Autorzy przypisują to gęstej informacji tożsamościowej w obrazach odniesienia, która pozwala modelowi łatwiej nauczyć się ukierunkowanego zachowania obronnego. Wyniki, sugerują, wskazują, że PoseGuard może ograniczyć ryzyko naśladownictwa w scenariuszach, w których wideo jest generowane bezpośrednio z wyglądu osoby.
Dla ostatecznego testu, autorzy zastosowali PoseGuard do syntezy wideo kierowanej przez punkty twarzy przy użyciu systemu AniPortrait, scenariusza, który koncentruje się na fine-grained wyrażeniach twarzy zamiast pełnych pozycjach ciała.

Niebezpieczne wyrażenia twarzy tłumione w AniPortrait z nowym systemem.
Przez dostosowanie sieci denoising UNet z tym samym mechanizmem obronnym, model był w stanie tłumić dane wyjściowe z niebezpiecznych punktów twarzy, pozostawiając niewinne wyrażenia nietknięte. Wyniki, sugerują autorzy, pokazują, że PoseGuard może uogólniać się na różne modality i zachowywać skuteczność w bardziej lokalnych, generowanych zadań opartych na wyrażeniach.

Wyniki wizualne pokazujące sposób, w jaki PoseGuard reaguje na generowanie kierowane przez obraz odniesienia.
Wnioski
Trzeba przyznać, że dla wielu z 50 zabronionych pozycji odniesienia dostarczonych przez artykuł, działania takie jak badania medyczne lub nawet wykonywanie nudnych zadań domowych, prawdopodobnie zostałyby zablokowane w tym, co można tylko uznać za wersję syntetyzowaną efektu Scunthorpe.
Pod tym względem, a jeszcze bardziej w przypadku wyrażeń twarzy, (które mogą być o wiele bardziej niejednoznaczne i subtelne w intencji), PoseGuard wydaje się być rodzajem tępego narzędzia. Co więcej, ze względu na ogólny chłodzący efekt wokół NSFW AI, wydania FOSS, takie jak ostatni Flux Kontext, są rutynowo bardzo ocenzurowane w każdym przypadku, albo przez rygorystyczne filtrowanie zestawów danych, edycję wag lub oba.
Dlatego dodanie ograniczeń proponowanych tutaj do ciężaru cenzury modeli lokalnych wydaje się być ukrytą próbą stłumienia skuteczności systemów generatywnych nie-API. To być może wskazuje nam na przyszłość, w której modele lokalne mogą produkować gorszą generację czegokolwiek, co użytkownik lubi, podczas gdy modele API oferują znacznie lepsze dane wyjściowe, jeśli tylko można negocjować labirynt filtrów i zabezpieczeń, które uspokajają dział prawny firmy-gospodarza.
System taki jak PoseGuard, w którym dostosowywanie aktywnie wpływa na jakość danych wyjściowych modelu podstawowego (choć to jest pominięte w artykule), nie jest skierowany do modeli API w ogóle; modele online, które są na straży, będą prawdopodobnie nadal korzystać z nieograniczonych danych szkoleniowych, ponieważ ich zdolności NSFW są powstrzymywane przez znaczne środki nadzoru.
* Metoda jest tak krótka tutaj, jak i w artykule (który składa się tylko z pięciu stron), i, jak zwykle, podejście jest najlepiej zrozumiane z sekcji testów.
Publikacja po raz pierwszy w środę, 6 sierpnia 2025












