Anderson의 관점
저작권 애니메이션 캐릭터에 ‘비밀 정체’ 부여하기

중국의 새 연구는 추론 시점에 일반적인 대체물을 “주입”해 모델 자체를 손대지 않고 저작권이 있는 애니메이션 캐릭터를 보호하는 방법을 제안한다. 하지만 교묘한 프롬프트 우회까지 막을 수 있을까?
초대규모 학습 데이터에 포함된 저작권 보호 자료의 양 을 고려하면, 그런 데이터셋 으로 학습한 모델이 저작권 캐릭터를 재현하는 것은 놀랍지 않다. 위반 자료를 일일이 걸러 내는 비용 이 너무 크기 때문이다. 이런 모델은 흔히 저작권 캐릭터를 재현할 수 있다.
학습된 모델을 직접 편집 하거나 API 접근 시 키워드를 차단하는 필터를 써도, 보호 대상의 특징을 간접적으로 묘사하면 우회할 수 있는 경우가 많다:

인기 AI 챗봇이 캐릭터 이름을 직접 언급하지 않은 것으로 보이는 요청에서 생성한 저작권 캐릭터. 출처
이 문제에 대한 꾸준한 연구 흐름에서는 모델 수정 기법으로 학습된 모델의 변경을 시도해 왔다 . 구체적으로 매개변수를 바꾸는 접근이며 결과는 다양하다:

2023년 논문 “Ablating Concepts in Text-to-Image Diffusion Models”의 예. 인기 확산 모델에 내재된 배우 Brie Larson의 캡틴 마블 실사 표현이 사용자의 요청 시 느슨하게 관련된 만화 이미지로 바뀐다. 출처
하지만 제거(ablation)는 보통 손상 가능성이 크고 정밀하지 않은 과정이며 학습된 모델의 다른 특성에도 자주 영향을 준다 . 게다가 여러 우회 방법이 있다.
다른 널리 쓰이는 방식은 네거티브 프롬프팅이다. 출력을 제한하도록 추가적인 “반대 프롬프트”를 모델에 보낸다. 첨단 모델처럼 API로 접근하는 경우 사용자가 아는 프롬프트와 함께 비공개 네거티브 프롬프트를 보내 금지된 자료를 제공하지 않도록 규칙을 적용할 수 있다. 이는 저작권 보호 수단으로 활용되며 널리 쓰이지만 , 항상 효과가 있는 것은 아니다.
학습 이후의 사후 추론 검열 연구는 대체로 더 넓은 콘텐츠 범주의 차단에 집중한다 . 아동 성적 학대 자료(CSAM)나 각종 NSFW 자료가 생성되지 않게 하는 것이 목적이다. 주요 모델의 학습 데이터에 그런 자료가 상당량 존재했을 가능성 이 있기 때문이다. 이런 시도는 특정 대상보다 콘텐츠의 범주 전체 에 영향을 줄 수 있으며, 특정 정체성만 억제하려는 저작권자의 요구에 대응할 세밀함이 보통 부족하다.
캐릭터의 대역
이를 고려한 중국의 새 논문은 이미지 생성 중 저작권 애니메이션 캐릭터를 학습된 일반적인 대체물 로 바꾸자고 제안한다. 주변 장면을 유지할 만큼 형태와 구조는 남기면서 보호 대상의 고유한 세부 특징을 없애는 “대역”이다:

새 임베딩 방법으로 “익명화”한 저작권 자료의 표현. 해당 자료는 원래 학습된 모델 안에 존재하며 생성해 낼 수 있다. 출처
핵심은 기반 확산 모델을 수정하거나 미세조정하지 않고 생성 도중 개입한다는 점이다. 원래 캐릭터를 얼마나 지울지도 조절할 수 있다.
이 접근은 모델 수정이 목적에 잘 맞지 않는다는 점을 암묵적으로 인정하고 대신 정교하게 구성한 임베딩 을 추론에 주입한다. 저작권 대상을 완전히 제거하거나 0으로 만드는 대신 다른 형태로 재구성하기 위한 임베딩이다. 기반 모델을 직접 바꾸거나 영향을 주지 않으므로 다양한 모델에서 재사용하거나 응용할 수 있다.
연구진은 구형 Stable Diffusion 계열에서 시험했지만 훨씬 최근의 Z-Image 아키텍처에서도 효과적으로 적용했다. 여러 생성 아키텍처에 적용할 수 있음을 시사한다.
논문은 다음과 같이 설명한다:
“우리는 모델의 연속적인 텍스트 표현에 작용해 생성 과정에서 대상 캐릭터를 지우는 제어 가능한 방법을 제안한다. 구조와 세부 특징 제약으로 앵커 임베딩을 최적화해 캐릭터의 대체물로 삼고, 구조를 인식하는 적응형 전략으로 대상 관련 임베딩을 앵커로 교체한다.”
“실험에서 이 방법은 최고 수준의 제거 효과와 이미지 충실도 보존을 달성하면서 제거 정도 조절, 다중 대상 제거, 다른 모델로의 이전을 지원했다.”
“또한 최적화된 앵커는 기존 모델 수정 방식에 바로 결합해 제거 성능을 높일 수 있다.”

연구진에 따르면 새 방법은 다양한 아키텍처에 적용되며 세밀한 제어를 제공한다.
이 새 논문 의 제목은 Erase but Preserve: Controllable Removal of Copyrighted Animation Characters via Optimized Semantic Anchors이며 중국과학원 정보공학연구소와 베이징의 중국과학원대학교 소속 저자 7명이 작성했다.
방법
아래 그림처럼 각 저작권 캐릭터의 대략적인 형태와 구조는 유지하되 알아볼 수 있게 만드는 고유한 시각적 특징을 없앤 대체물을 만드는 것이 핵심이다. 보호 대상 캐릭터가 요청될 때마다 이미지 생성에서 이 대체물을 사용한다.

새 접근법의 구성도.
연구진이 앵커라고 부르는 대체물은 같은 장면에 자연스럽게 들어갈 만큼 원래 캐릭터의 형태와 구조를 유지하면서 고유한 세부 특징을 버리도록 설계된다.
이를 위해 원래 캐릭터에서 생성된 거친 구조 정보와 개발 중인 앵커의 구조 정보를 비교해 전체 형태를 비슷하게 만든다. 반대로 저작권 캐릭터의 참조 이미지는 앵커가 식별 가능한 미세한 특징에서 멀어지도록 하는 데 사용한다:

저작권 캐릭터를 침해하지 않는 대체물을 만드는 방법. 대략적인 구조를 유지하면서 고유한 시각적 특징을 억제해 생성 과정에 사용할 최적화된 앵커를 만든다.
따라서 앵커는 요청된 구도를 유지하는 것과 보호 대상의 정체성을 없애는 것 사이의 중간 지점을 의도적으로 구현한다.
앵커를 모델의 언어로 옮기기
이 특성을 정한 뒤에는 확산 모델이 이해할 수 있는 표현으로 바꿔야 한다. 자리표시자 용어 Anchor* (원문 표기)에 고유한 학습 가능한 표현 을 부여한다. 이 표현은 CLIP 텍스트 인코더 안에 있으며, 기반 이미지 생성 모델을 바꾸지 않고 의미를 조정할 수 있는 새로운 인공 단어 또는 개체를 만드는 셈이다.
새 표현은 앞서 설명한 구조와 세부 특징 목표에 따라 반복 조정된다. 이를 통해 Anchor* 가 보호 대상과 대략적인 형태는 비슷하지만 식별 가능한 외형은 없는 것을 의미하도록 학습한다.
이 과정에서 텍스트 인코더의 나머지는 고정된 상태 로 유지된다. Anchor* 주변의 일반적인 시작·종료·패딩 토큰은 새로 학습한 유사 단어를 생성에 쓰는 최종 임베딩으로 바꾸는 데 필요한 맥락을 제공한다.
적응형 교체
생성, 즉 추론 중 알고리즘은 인코딩된 프롬프트에서 보호 대상과 관련된 용어를 찾아 학습된 앵커 임베딩으로 바꾼다. 맥락 정보를 담는 종료·패딩 임베딩도 조정한다.
이를 준비하기 위해 시스템은 먼저 노이즈 제거 가 요청된 이미지의 대략적인 구도를 형성하게 한다. 거친 구조의 변화를 관찰해 배치가 안정되기 시작하는 시점을 판단한다:

이미지 생성 중 앵커가 교체되는 시점의 표현. 노이즈 제거 동안 큰 구조 변화를 추적하며, 전체 배치가 안정되고 세부 특징이 나타나기 시작하는 부근에서 교체한다.
위 그림에서는 측정된 구조 변화가 최대에 이른 뒤 감소하기 시작하는 약 720 타임스텝에서 전환이 일어난다. 이때 이미지의 큰 배치는 대체로 형성돼 있으므로 기존 구도를 흐트러뜨릴 위험을 줄이면서 보호 대상을 앵커로 바꿀 수 있다.
데이터와 시험
연구진은 다섯 프롬프트 기반 기준 방법과 비교했다. Safe Latent Diffusion (SLD), STG, SAFREE, TraSCE, 네거티브 프롬프팅(NP)이다.
최적화된 앵커 임베딩은 기존의 네 모델 수정 방법에도 통합했다. MACE, UCE, ESD-u, AC이다. 이를 통해 캐릭터 제거 성능을 더 높일 수 있는지 시험했다.
평가용으로 의인화 캐릭터 36개, 동물 형태 23개, 기타 21개 등 애니메이션 캐릭터 80개의 데이터셋을 구성했다. 모두 확산 모델이 안정적으로 재현할 수 있는 캐릭터를 선택했다.
GPT-4o가 만든 프롬프트로 캐릭터마다 이미지 100장을 생성했다.
Stable Diffusion v1.4 를 주 실험에 사용했다. 다른 모델로의 이전 가능성은 Stable Diffusion의 v1.5, V2, v2.1, XL base 1.0, 그리고 훨씬 최근의 DiT 기반 Z-Image에서도 시험했다. 모델 미세조정 은 하지 않아 각 사전학습 모델의 매개변수는 그대로 유지됐다.
평가 지표로는 LLaVA-1.5 와 BLIP-3 로 대상 캐릭터가 여전히 식별되는지 측정했다. 식별 정확도가 낮을수록 더 완전히 제거됐다는 뜻이다. 구조적 유사도 지수 (SSIM)는 구조 보존을, 학습된 지각적 유사도 지표 (LPIPS)는 지각적 차이를 측정했다. Aesthetic Predictor V2 Score 는 변경된 이미지의 시각적 품질을 평가했다.
Fréchet Inception Distance (FID)와 CLIP 점수 도 추가로 계산했다. COCO-30K의 관련 없는 프롬프트를 사용해 정상적인 이미지 생성에 영향이 있는지 측정했다:

애니메이션 캐릭터 80개에 대한 제거 방법 비교. 첫 두 열은 제거됐어야 할 캐릭터를 여전히 알아보는 빈도로, 낮을수록 제거가 잘된 것이다. 나머지 열은 원래 이미지와 무관한 이미지 생성이 얼마나 보존됐는지 나타낸다. 화살표는 높은 값과 낮은 값 중 어느 쪽이 좋은지, 굵은 글씨는 최고 결과, 밑줄은 두 번째 결과를 표시한다.
초기 정량 비교 결과에 대해 연구진은 다음과 같이 설명한다:
“우리 방법으로 제거한 이미지에서는 LLaVA-1.5(6.0%)와 BLIP-3(4.0%) 모두 모든 기준 방법 중 가장 낮은 대상 식별 정확도를 보였다. 두 번째로 낮은 결과보다 각각 3.5%포인트, 1.7%포인트 낮다.”
“이는 다중모달 대규모 모델을 효과적으로 속여 제거 효과를 낸다는 것을 보여 준다.”
이미지 충실도에서 이 방법은 가장 높은 SSIM 0.467과 가장 낮은 LPIPS 0.505를 기록했다. 시험 대상 중 관련 없는 콘텐츠와 배경 구조를 가장 잘 보존했다는 뜻이다. 캐릭터 제거 방법 중 Aesthetic Predictor V2 점수도 5.18로 가장 높아, 이 보존이 전체 시각 품질을 희생하지 않음을 시사한다.
이어서 정성적 시험을 진행했다:

애니메이션 캐릭터 다섯 개의 제거 결과 비교. 행마다 다른 방법이며 맨 위는 원래 Stable Diffusion v1.4 생성 결과, 맨 아래는 제안 방법이다. 제안 방법은 주변 장면을 유지하면서 대상을 더 일관되게 교체한다. 조금 더 높은 해상도는 원문 PDF나 프로젝트 사이트를 참고하기 바란다.
논문에 따르면 Donald Duck과 Super Mario처럼 형태와 속성이 복잡한 캐릭터에서 차이가 특히 뚜렷하다:
“우리 방법은 최적화된 앵커로 애니메이션 캐릭터를 자연스럽게 제거한다. 반면 프롬프트 기반 방법은 특히 Donald Duck과 Super Mario처럼 형태와 속성이 복잡한 대상에서 자주 실패한다.”
“또한 흐림이나 뒤틀림 없이 배경의 일관성을 유지해 반복적인 창작 작업을 지원한다.”
세밀한 조절
연속적인 임베딩 공간에서는 제거를 전부 지우거나 전혀 지우지 않는 선택으로만 다룰 필요가 없다. 최적화된 앵커와 원래 대상 임베딩 사이를 보간하면 주변 이미지 구조를 유지하면서 캐릭터를 점차 더 복원할 수 있다:

서로 다른 제거 정도를 보여 주는 시험 이미지. 처음 세 열은 원래 캐릭터, 제거된 버전, 제거한 시각적 특징이며 나머지는 α=0.25, 0.5, 0.75의 중간 설정이다. α가 클수록 원래 캐릭터가 더 많이 보존된다. 조금 더 높은 해상도는 원문 PDF나 프로젝트 사이트를 참고하기 바란다.
위처럼 연구진은 곰돌이 푸, Olaf, Minnie Mouse, Stitch에도 이 제어를 시험했다. 복원 강도가 바뀌어도 구조적 유사도는 비교적 안정적이었고, 각 캐릭터가 더 복원될수록 LLaVA-1.5와 BLIP-3의 식별률은 높아졌다.
곰돌이 푸와 Stitch는 비교적 좁은 범위에서 식별 가능해졌고 Olaf와 Minnie Mouse는 더 점진적으로 변했다. Minnie Mouse는 비교적 적은 복원만으로도 식별됐다. 이는 적절한 제거 강도가 대상 캐릭터에 따라 달라짐을 보여 준다.
한 번에 여러 대상을 교체하는 추가 실험도 성공적으로 수행했다. 세부 내용과 추가 결과·자료는 원문 논문을 참고하기 바란다.
결론
늘 그렇듯 이번 저작권 가드레일 의 새 방식도 말이 달아난 뒤 마구간 문을 잠그는 것과 같다.
드물게 연구자나 기업이 데이터셋의 NSFW 자료에 대한 내부 접근을 실제로 차단해 모델의 나체·성인물 생성 능력을 억제하려 시도한 사례 가 있다. 자료를 실제로 선별해 제거하는 비용이 여전히 너무 크기 때문이다. 그런데 그렇게 하면 모델이 인체 구조를 제대로 이해하지 못하게 되는 것으로 드러났다.
무차별 수집한 방대한 웹 콘텐츠로 학습된 모델의 NSFW 필터를 만드는 상황에 비유하면, 이번 접근은 특정 성인물 배우 한 명을 제거하거나 일반적인 인물로 바꾸는 것과 비슷하다. 저작권 캐릭터의 일반적인 대역을 만들려면 모델의 잠재 공간 안에 슈퍼히어로 영역 자체는 그대로 두어야 한다. 대상 캐릭터가 더 중요할수록 학습된 공간에서 그 영역을 더 강하게 규정한다 .
따라서 제거는 이미 저어 녹인 커피에서 설탕을 빼내려는 일과 같다.
이 접근을 첨단 모델의 점점 늘어나는 API 방어 장치에 추가하면 제한적인 성공은 거둘 수 있다. 하지만 생성형 AI 모델의 서로 연결된 특성과 과거 사례를 보면, 대상 저작권 자료는 프롬프트 작성자의 익숙한 우회 수완으로 여전히 접근 가능할 수 있다.
최초 발행: 2026년 8월 14일 금요일












