Anderson의 관점
이제 NSFW 및 ‘셀러브리티’ 포즈가 AI 검열의 소재가 된다

생성 비디오 시스템을 위한 새로운 AI 보호 장치가 신체 포즈 검열을 제안한다. 성적으로 암시되거나, ‘모욕적인 제스처’로 해석될 수 있는 신체 자세(또는 얼굴 표정) 혹은 저작권이 있는 셀러브리티 포즈 또는 잠재적으로 상표권이 있는 포즈까지 모두 대상이 된다.
중국과 싱가포르의 새로운 연구가 ‘위험한’ 이미지·비디오 생성에서 덜 눈에 띄는 영역 중 하나인 포즈 자체, 즉 AI가 만든 출력물에서 인물의 신체 자세나 얼굴 표정을 묘사하는 문제를 다룬다.

새 연구에서 제안된 시스템 PoseGuard의 개념 스키마. Source: https://arxiv.org/pdf/2508.02476
시스템은 PoseGuard라는 이름으로, 미세 조정과 LoRA를 사용해 ‘금지된’ 포즈를 본질적으로 생성할 수 없는 모델을 만든다. 이 접근 방식은 FOSS 모델에 내장된 안전장치가 보통 쉽게 극복될 수 있다는 이유로 선택되었으며, 새로운 ‘필터’가 특히 로컬 설치를 목표로 한다는 점을 강조한다(API 전용 모델은 필터링할 수 있다하여 들어오고 나가는 콘텐츠와 프롬프트를 제어할 수 있어, 모델 가중치를 미세 조정으로 위태롭게 하다는 필요가 없다).
포즈 자체를 위험한 데이터로 다루는 연구가 처음은 아니다; ‘성적인 얼굴 표정’은 한동안 소규모 연구 분야였으며, 이번 연구의 여러 저자는 덜 정교한 Dormant 시스템도 만들었다.
하지만 내가 알기로 이번 논문이 처음으로 포즈의 유형을 성적 콘텐츠를 넘어 확장하여 ‘저작권이 있는 셀러브리티 동작’까지 포함시킨다.
‘우리는 기하학적 특성보다 생성된 출력물의 잠재적 위험을 기준으로 위험한 포즈를 정의한다. [Unsafe] 포즈는 다음을 포함한다: 1) 차별적 포즈(예: 무릎 꿇기, 모욕적인 경례), 2) 성적으로 암시적인 NSFW 포즈, 3) 셀러브리티 특정 이미지를 모방하는 저작권 민감 포즈.’
‘이러한 포즈는 온라인 소스(예: 위키피디아), LLM 기반 필터링 및 위험 라벨이 붙은 데이터셋(예: Civitai NSFW 태그)을 통해 수집되어, 균형 잡히고 포괄적인 위험 포즈 데이터셋을 학습에 제공한다.’

PoseGuard를 위해 개발된 핵심 50개 포즈 중 ‘NSFW’ 카테고리.
흥미로운 점은 셀러브리티 포즈가 상표 등록될 수 있거나 법적 수단으로 보호될 수 있으며, 충분히 ‘창의적인’ 포즈나 자세의 조합이 고유한 안무 시퀀스로 보호될 수 있다는 것이다. 그러나 한 사진작가가 Rentmeester Vs. Nike 판결에서 발견했듯이, 상징적인 단일 포즈조차 보호되지 않을 수도 있다:

마이클 조던의 가장 왼쪽 사진을 촬영한 사진작가가 나이키가 해당 사진(오른쪽)을 재현했을 때 소송을 제기했으나, 판사 패널이 청구를 기각했다. Source: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html
새 PoseGuard 시스템은 위험한 포즈가 감지될 때 출력을 저하시키는 최초의 시스템이며, 안전 가드레일을 생성 모델에 직접 삽입하고, ‘위험한’ 포즈를 세 가지 카테고리로 정의하며, 문제가 되는 포즈가 필터를 피할 정도로 충분히 변경된 후에도 생성 품질과 무결성을 유지한다는 점을 주장한다.
새 논문은 PoseGuard: 안전 가드레일을 갖춘 포즈 안내 생성이라는 제목이며, 중국과학기술대학, (싱가포르) 과학기술연구청(A*STAR CFAR), 난양공과대학의 여섯 명 연구자가 공동 집필했다.
방법
PoseGuard는 백도어 공격의 논리를 재활용하여 모델에 직접 방어 메커니즘을 구축한다. 일반적인 백도어 공격에서는 특정 입력이 악의적인 출력을 유발하는데, PoseGuard는 이를 뒤집어 성적, 모욕적, 혹은 저작권 민감성 때문에 위험하다고 판단된 사전 정의된 포즈를 빈 화면이나 흐릿한 프레임과 같은 ‘중립’ 목표 이미지와 연결한다.
정상 포즈와 트리거 포즈를 결합한 데이터셋으로 모델을 미세조정함으로써, 시스템은 정상 입력에 대해서는 충실도를 유지하고 위험한 입력에 대해서는 출력 품질을 저하시키는 방법을 학습한다:

PoseGuard는 공유 디노이징 UNet을 사용해 기준 이미지와 포즈 시퀀스를 처리하며, 사전 학습된 가중치와 안전에 맞춘 미세조정을 결합한다. 이 설정은 모델이 위험한 포즈로부터 유해한 생성물을 억제하면서도 정상 입력에 대한 출력 품질을 유지하도록 한다.
이 ‘모델 내’ 전략은 외부 필터의 필요성을 없애며, 적대적이거나 오픈소스 환경에서도 효과를 유지합니다.*
데이터 및 테스트
양호한 기준 포즈를 얻기 위해 저자들은 UBC-Fashion 데이터셋을 사용했습니다:

University of British Columbia 패션 데이터셋의 예시로, PoseGuard의 양호한 포즈 소스로 사용되었습니다. 추상 포즈는 이러한 이미지에서 포즈 추정 프레임워크로 추출되었습니다. 출처: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf
앞서 언급한 바와 같이, 위험한 포즈는 CivitAI와 같은 오픈소스 플랫폼에서 가져왔습니다. 포즈는 DWPose 프레임워크를 사용해 추출했으며, 768x768px 포즈 이미지가 생성되었습니다:

학습에 사용된 50개의 위험한 포즈 예시. 여기에는 Wikipedia, Render-State, Civitai, Google Search에서 가져온 NSFW 및 저작권 민감 포즈가 포함됩니다.
포즈 기반 생성 모델은 AnimateAnyone이었습니다.
사용된 여섯 가지 지표는 프레셰 비디오 거리 (FVD); FID-VID; 구조적 유사성 지수 (SSIM); 최대 신호 대 잡음비 (PSNR); 학습된 지각적 유사성 지표 (LPIPS); 그리고 프레셰 인셉션 거리 (FID)였다. 테스트는 48GB VRAM을 갖춘 NVIDIA A6000 GPU에서 수행되었으며, 배치 크기는 4, 학습률은 1×10-5였다.
테스트된 세 가지 주요 범주는 효과성, 견고성, 그리고 일반화였습니다.
첫 번째인 효과성에서는 저자들이 PoseGuard에 대한 두 가지 학습 전략을 비교했습니다: 디노이징 UNet의 전체 파인튜닝과 LoRA 모듈을 이용한 파라미터 효율적인 파인튜닝.
두 접근법 모두 위험한 포즈에서의 출력을 억제하면서 양호한 포즈에 대한 출력 품질을 유지하지만, 트레이드오프가 다릅니다: 전체 파인튜닝은 억제 효과가 강하고 특히 위험한 학습 포즈 수가 적을 때 높은 충실도를 유지합니다; 반면 LoRA 기반 튜닝은 위험한 포즈 수가 증가함에 따라 생성 품질이 더 많이 저하되지만, 훨씬 적은 파라미터와 연산량을 요구합니다.

생성 및 방어 지표에 따른 PoseGuard 성능. 위쪽 화살표는 값이 높을수록 좋은 지표를, 아래쪽 화살표는 값이 낮을수록 좋은 지표를 나타냅니다.
정성적 결과(아래 이미지 참조)에서는 개입이 없을 경우 모델이 공격적이고 NSFW인 포즈를 높은 충실도로 재현함을 보여줍니다. PoseGuard를 활성화하면 이러한 포즈는 저품질 또는 빈 출력으로 전환되고, 양호한 입력은 시각적으로 온전하게 유지됩니다. 방어 세트가 4개에서 32개의 위험한 포즈로 확대될수록 양호한 출력 품질은 다소 감소했으며, 특히 LoRA에서 그 경향이 두드러졌습니다.

전체 파라미터 파인튜닝을 사용해 단일 위험 포즈에 대한 PoseGuard의 반응을 시각적으로 보여줍니다. 모델은 차별적, NSFW, 저작권 민감 포즈에 대해 출력을 억제하고 검은 이미지로 전환하지만, 정상 입력에 대해서는 품질을 유지합니다.
견고성을 위해 PoseGuard는 입력 포즈가 사전 정의된 예시와 정확히 일치하지 않을 수 있는 실제 배포 상황을 시뮬레이션하는 조건에서 테스트되었습니다. 평가에는 translation, scaling, rotation과 같은 일반적인 변환과 관절 각도를 수동으로 조정해 자연스러운 변화를 모방하는 것이 포함되었습니다.

일반적인 포즈 변환에 직면했을 때 PoseGuard의 견고성 결과.
대부분의 경우 모델은 위험한 생성 억제를 지속했으며, 이는 방어가 중간 정도의 교란에도 견고함을 나타냅니다. 변형으로 인해 포즈의 근본적인 위험 요소가 사라지면 모델은 억제를 중단하고 정상 출력을 생성했으며, 이는 양호한 편차에 대해 오탐지를 피함을 시사합니다.

PoseGuard의 자세 변형에 대한 견고성 평가. 그림은 이동, 스케일링, 회전 및 수동 사지 조정으로 변경된 위험한 자세에 대한 모델 출력을 보여준다. PoseGuard는 경미한 변화에서도 위험한 생성물을 계속 억제하지만, 자세가 더 이상 ‘위험한’ 내용을 담지 않으면 정상 출력을 재개한다.
마지막으로, 주요 실험에서 연구진은 PoseGuard의 generalization—새로운 데이터와 다양한 환경 및 상황에서 효과적으로 작동하는 능력을 테스트했다.
여기서 PoseGuard는 앞서 언급한 AnimateAnyone 모델을 사용한 참조 이미지 기반 생성에 적용되었다. 이 설정에서 시스템은 자세 기반 제어에 비해 무단 출력 억제가 더 강력했으며, 경우에 따라 생성된 비디오가 거의 완전히 손상되었다.

PoseGuard를 자세 기반 생성과 참조 이미지 기반 생성에 적용했을 때의 성능 비교, 네 개의 위험한 입력에 대한 전체 파인튜닝 사용.
저자들은 이를 참조 이미지에 포함된 풍부한 정체성 정보 때문이라고 설명한다. 이는 모델이 목표 방어 행동을 더 쉽게 학습하도록 한다. 결과는 PoseGuard가 사람의 외모에서 직접 비디오를 생성하는 시나리오에서 가장화 위험을 제한할 수 있음을 시사한다.
최종 테스트로, 저자들은 AniPortrait 시스템을 사용한 얼굴 랜드마크 기반 비디오 합성에 PoseGuard를 적용했으며, 이는 전신 자세가 아니라 세밀한 얼굴 표정을 목표로 한다.

AniPortrait에서 새로운 시스템으로 억제된 위험한 얼굴 표정.
Denoising UNet을 동일한 방어 메커니즘으로 파인튜닝함으로써 모델은 위험한 얼굴 랜드마크에서 나오는 출력을 억제하면서도 정상적인 표정은 영향을 받지 않게 했다. 결과는 PoseGuard가 입력 모달리티를 넘어 일반화할 수 있으며, 보다 국소적이고 표정 중심의 생성 작업에서도 효과를 유지한다는 것을 보여준다.

참조 이미지 기반 생성에 대한 PoseGuard의 반응을 보여주는 시각적 결과.
결론
논문에서 제공한 50개의 금지된 참조 자세 중 다수는 의료 검사와 같은 활동이나 심지어 지루한 가사 작업까지도 차단될 수 있는데, 이는 Scunthorpe effect의 합성 기반 버전이라고밖에 생각할 수 없다.
그 관점에서, 특히 얼굴 표정의 경우(의도가 훨씬 더 모호하고 미묘할 수 있음), PoseGuard는 다소 무딘 도구처럼 보인다. 게다가 NSFW AI에 대한 일반적인 chilling effect 때문에 최근 Flux Kontext와 같은 FOSS 릴리스는 어떤 경우에도 very censored가 되며, 이는 데이터셋 필터링, 가중치 편집 또는 그 둘을 통해 이루어진다.
따라서 여기서 제안된 제한을 로컬 모델 검열에 추가하는 것은 비공식 API가 아닌 생성 시스템의 효율성을 억제하려는 암묵적인 시도로 보인다. 이는 사용자가 원하는 어떤 것이든 생성할 수 있는 열등한 로컬 모델과, 필터와 안전장치를 협상할 수 있다면 무한히 우수한 출력을 제공하는 API 모델 사이의 미래를 암시한다.
PoseGuard와 같이 파인튜닝이 기본 모델 출력 품질에 적극적으로 영향을 미치는 시스템(논문에서는 간과되었음)은 API 시스템을 목표로 하지 않는다; 온라인 전용 최첨단 모델은 여전히 제한 없는 학습 데이터의 혜택을 받을 것이며, 이러한 모델의 강력한 NSFW 능력은 상당한 감독 조치에 의해 억제된다.
* 방법은 논문에서처럼 짧으며(5페이지에 불과), 일반적으로 접근 방식은 테스트 섹션에서 가장 잘 이해된다.
2025년 8월 6일 수요일 최초 게시












