Andersons vinkel
Nå er NSFW og “berømte” posisjoner mat for AI-sensur

En ny AI-sikkerhet for generative videosystemer foreslår å sensurere kroppsposisjoner. Fysiske holdninger (eller ansiktsuttrykk) som kan tolkes som seksuelt suggererende, “angrepsgest” eller selv opphavsrettslige eller varemerkebeskyttede posisjoner, er alle mål.
Ny forskning fra Kina og Singapore behandler ett av de mindre åpenbare områdene i “usikre” bilde- og videogenerering: avbildningen av en posisjon i seg selv, i betydning av disposisjonen av kroppen eller ansiktsuttrykket til en avbildet person i AI-generert utgang:

Konseptuell skjema for PoseGuard, systemet foreslått i den nye forskningen. Kilde: https://arxiv.org/pdf/2508.02476
Systemet, tittelen PoseGuard, bruker finjustering og LoRAs for å lage modeller som intrinsisk ikke kan generere “forbudte” posisjoner. Dette tilnærmingen ble tatt fordi sikkerhetstiltakene bygget inn i FOSS-modeller vanligvis kan overvinnes, og betoner at denne nye “filter” spesifikt målretter lokale installasjoner (siden API-kun modeller kan filtere inn- og utgående innhold og promter, uten å utsette integriteten til modellvekter ved finjustering).
Dette er ikke den første arbeidet som behandler posisjoner som usikre data i seg selv; “seksuelle ansiktsuttrykk” har vært et mindre underfelt av studie i en stund, mens flere av forfatterne av den nye arbeidet også skapte det mindre sofistikerte Dormant-systemet.
Men den nye artikkelen er den første, så langt jeg kan se, til å utvide typen posisjoner utenfor seksuelt innhold, selv til å inkludere “opphavsrettslige berømte bevegelser”:
‘Vi definerer usikre posisjoner basert på potensielle risikoer for genererte utganger heller enn geometriske karakteristika. [Usikre] posisjoner inkluderer: 1) diskriminerende posisjoner (f.eks. knele, angreps-hilsener), 2) seksuelt suggererende NSFW-posisjoner, og 3) opphavsrettslige posisjoner som imiterer berømte-bilder.
‘Disse posisjonene er samlet gjennom online-kilder (f.eks. Wikipedia), LLM-basert filtrering og risiko-merkede datasett (f.eks. Civitai NSFW-merker), og sikrer en balansert og omfattende usikker posisjonsdatasett for trening.’

Den ‘NSFW’-kategorien av de 50 posisjonene utviklet for PoseGuard.
Det er interessant å merke seg at berømte posisjoner kan være varemerkebeskyttet eller beskyttet av juridiske midler, og at tilstrekkelig “kreative” kombinasjoner av posisjoner eller holdninger kan være beskyttet som unike koreografiske sekvenser. Men selv en ikonisk enkelt posisjon kan ikke være beskyttet, som en fotograf oppdaget, i Rentmeester Vs. Nike avgjørelse:

En fotograf som tok det venstre fotoet av Michael Jordan saksøkte Nike da de gjenskapte fotoet (høyre); men en panel av dommere forkastet kravet. Kilde: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html
Det nye PoseGuard-systemet hevder å være det første som degraderer utgang når en usikker posisjon er oppdaget; å innbygge sikkerhetsskjermer direkte i en generativ modell; å definere “usikre” posisjoner over tre kategorier; og å sikre at generering beholder kvalitet og integritet en gang en forbudt posisjon har blitt endret nok til å unnslippe filteret.
Den nye artikkelen er tittelen PoseGuard: Pose-Guided Generation with Safety Guardrails, og kommer fra seks forskere over hele University of Science and Technology of China, (Singaporeanske) Agency for Science, Technology and Research (A*STAR CFAR), og Nanyang Technological University.
Metode
PoseGuard gjenskaper logikken til bakdørsangrep for å bygge en forsvarsmekanisme direkte inn i modellen. I et typisk bakdørsangrep, utløser bestemte inn-data malisøse ut-data, og PoseGuard inverterer denne oppsettet: bestemte forhåndsdefinerte posisjoner som er ansett som usikre på grunn av deres seksuelle, angreps- eller opphavsrettslige natur, er koblet til “nøytrale” mål-bilder, som tomme eller uskarpe rammeverk.
Ved å finjustere modellen på en kombinasjon av normal og utløsende posisjoner, lærer systemet å bevare trofasthet for harmløse inn-data mens den degraderer utgangskvalitet for usikre inn-data:

PoseGuard prosesserer en referanse-bilde og posisjonssekvens ved hjelp av en delt uskarpe UNet, kombinert med forhåndsdefinerte vekter og sikkerhets-justert finjustering. Dette oppsettet tillater modellen å undertrykke skadelig generering fra usikre posisjoner mens den beholder utgangskvalitet for normale inn-data.
Dette “i-modell”-strategi eliminerer behovet for eksterne filtre, og forblir effektiv selv i motstand eller åpne kilde-miljøer.*
Data og tester
For å få harmløse basis-posisjoner, brukte forfatterne UBC-Fashion-datasettet:

Eksempler fra University of British Columbia-moten datasett, brukt som kilde for harmløse posisjoner i PoseGuard. Abstrakte posisjoner ble trukket ut fra disse bildene med en posisjons-estimeringsrammeverk. Kilde: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf
Usikre posisjoner, som nevnt tidligere, ble hentet fra åpne kilde-plattformer som CivitAI. Posisjoner ble trukket ut ved hjelp av DWPose-rammeverket, med resultat av 768x768px posisjonsbilder:

Eksempler fra de 50 usikre posisjonene brukt i trening. Her vises NSFW- og opphavsrettslige posisjoner, hentet fra Wikipedia, Render-State, Civitai og Google Search.
Pose-guided genereringsmodellen var AnimateAnyone.
De seks målene som ble brukt var Fréchet Video Distance (FVD); FID-VID; Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Lærte Perceptual Similarity Metrics (LPIPS); og Fréchet Inception Distance (FID). Testene ble utført på en NVIDIA A6000 GPU med 48GB VRAM, ved en batch-størrelse på 4 og en læringsrate på 1×10-5.
De tre primære kategoriene som ble testet var effektivitet, robusthet, og generalisering.
I den første av disse, effektivitet, sammenlignet forfatterne to treningstrategier for PoseGuard: full finjustering av den uskarpe UNet og parameter-effektiv finjustering ved hjelp av LoRA-moduler.
Begge tilnærmingene undertrykker utgang fra usikre posisjoner mens de beholder utgangskvalitet på harmløse posisjoner, men med forskjellige kompromisser: full finjustering oppnår sterkere undertrykkelse og beholder høyere trofasthet, spesielt når antallet usikre treningposisjoner var lavt; og LoRA-basert finjustering introduserer mer degradering i genereringskvalitet når antallet usikre posisjoner øker – men krever betydelig færre parametre og mindre beregning.

PoseGuard-ytelse over genererings- og forsvarsmål. Oppover-piler indikerer mål hvor høyere verdier er bedre; nedover-piler indikerer mål hvor lavere verdier er bedre.
Kvalitative resultater (se bildet under) viste at, uten inngripen, modellen gjenskapte angreps- og NSFW-posisjoner med høy trofasthet. Med PoseGuard aktivert, utløste disse posisjonene lavkvalitets- eller blanke utganger, mens harmløse inn-data forble visuelt intakte. Ettersom forsvarsettet vokste fra fire til tretti-treh usikre posisjoner, sank harmløs utgangskvalitet moderat, spesielt for LoRA.

Visuelle resultater som viser hvordan PoseGuard responderer på en enkelt usikker posisjon ved hjelp av full-parameter finjustering. Modellen undertrykker utgang for diskriminerende, NSFW- og opphavsrettslige posisjoner, og omdirigerer dem til en svart bilde, mens den beholder kvalitet for normale inn-data.
For robusthet, ble PoseGuard testet under betingelser som simulerer virkelige driftsscenarier, hvor inn-posisjoner kan ikke nødvendigvis matche forhåndsdefinerte eksempler eksakt. Evalueringen inkluderte vanlige transformasjoner som oversettelse, skalering og rotasjon, samt manuelle justeringer av leddvinkler for å simulere naturlig variasjon.

Resultater for robusthet av PoseGuard i forhold til vanlige posisjons-transformasjoner.
I de fleste tilfeller fortsatte modellen å undertrykke usikre genereringer, og indikerte at forsvaret forble robust til moderate perturbasjoner. Når endringene fjernet den underliggende risikoen i posisjonen, stoppet modellen å undertrykke og produserte normale utganger, og indikerte at den unngår falske positiver under harmløse avvik.

Evaluering av PoseGuards robusthet mot posisjons-endringer. Bildet viser modell-utganger for usikre posisjoner endret av oversettelse, skalering og rotasjon, samt manuelle lem-justeringer. PoseGuard fortsetter å undertrykke usikre genereringer under milde endringer, men gjenopptar normal utgang når posisjonen ikke lenger inneholder risikofylt innhold.
Til slutt, i hovedeksperimentet, testet forskerne PoseGuard for generalisering – dens evne til å fungere effektivt på nytt innhold, i en rekke miljøer og omstendigheter.
Her ble PoseGuard brukt til referanse-bilde-guidert generering ved hjelp av ovennevnte AnimateAnyone-modellen. I dette scenarioet viste systemet sterkere undertrykkelse av uautoriserte utganger sammenlignet med posisjons-basert kontroll, med nesten fullstendig degradering av den genererte videoen i noen tilfeller:

Sammenligning av PoseGuards ytelse når den brukes til posisjons-guidert versus referanse-bilde-guidert generering, ved hjelp av full finjustering på fire usikre inn-data.
Forfatterne tilskriver dette til den tette identitetsinformasjonen i referanse-bildene, som tillater modellen å lettere lære målrettet forsvarsatferd. Resultatene, foreslår de, indikerer at PoseGuard kan begrense personliggjøring-risiko i scenarier hvor video genereres direkte fra en persons utseende.
Til en siste test, ble PoseGuard brukt til ansikts-landmerke-guidert video-syntese ved hjelp av AniPortrait-systemet, et scenario som målretter fin-graned ansiktsuttrykk heller enn full-kropp-posisjoner.

Usikre ansiktsuttrykk undertrykt i AniPortrait, med det nye systemet.
Ved å finjustere den uskarpe UNet med samme forsvarsmekanisme, kunne modellen undertrykke utganger fra usikre ansikts-landmerker mens den lot harmløse uttrykk forbli uendret. Resultatene, foreslår forfatterne, viser at PoseGuard kan generalisere over inn-data-modi og beholde effektivitet i mer lokale, uttrykks-drevne genereringsoppgaver.

Visuelle resultater som viser hvordan PoseGuard responderer på referanse-bilde-guidert generering.
Konklusjon
Det må innrømmes at for mange av de 50 forbudte referanse-posisjonene som er gitt i artikkelen, ville aktiviteter som medisinske undersøkelser eller selv å gjøre kjedelige husarbeid, sannsynligvis bli blokkert i hva som bare kan kalles en syntese-basert versjon av Scunthorpe-effekten.
Fra dette synspunktet, og enda mer i tilfelle av ansiktsuttrykk (som kan være mye mer tvetydige og nyanserte i intensjon), ville PoseGuard synes å være en slags grov instrument. For å si det slik, på grunn av en generell kjøleffekt rundt NSFW AI, FOSS-utgaver som den nylige Flux Kontext er rutinemessig svært sensurert i alle fall,, enten gjennom strenge datasett-filtrering, vekt-redigering eller begge deler.
Derfor synes det å legge begrensningene foreslått her til byrden av lokal-modell-sensur å være et tilsiktet forsøk på å undertrykke effektiviteten til ikke-API-generative systemer. Dette peker kanskje mot en fremtid hvor lokale modeller kan produsere en underlegen generering av hva som helst brukeren liker, mens API-modeller tilbyr ubegrenset overlegen utgang, hvis man bare kan navigere gjennom gauntlet av filtre og sikkerhetstiltak som beroliger verts-selskapets juridiske avdeling.
Et system som PoseGuard, hvor finjustering aktivt påvirker kvaliteten på utgangen fra basis-modellens (selv om dette overses i artikkelen), er ikke rettet mot API-systemer i det hele tatt; online kun vanguard-modeller vil sannsynligvis fortsette å dra nytte av ubegrensede treningdata, siden de formidable NSFW-egenskapene til disse modellene holdes tilbake av betydelige tilsynsforanstaltninger.
* Metode er like kort her som i artikkelen (som går ut på bare fem sider), og, som vanlig, er tilnærmingen best forstått fra test-seksjonen.
Først publisert onsdag, 6. august 2025












