Anderson의 관점

‘보호된’ 이미지들은 더 어려워지지 않고, 쉽게 도용될 수 있다 – AI를 이용한 이미지 편집

mm
Unite.AI를 Google의 선호 소스에 추가
A shadowy man steals into an art gallery as the guard sleeps. Krita/Flux-1 Dev + Firefly

새로운 연구에 따르면, AI 이미지 편집을 방지하기 위한 목적으로 사용되는 워터마크 도구는 예상과 다르게 이미지 편집을 더 쉽게 만들 수 있다.

 

컴퓨터 비전 문헌에는 저작권 이미지를 AI 모델에 훈련시키거나 직접 이미지-이미지 AI 프로세스에 사용하는 것을 방지하기 위한 시스템을 개발하는 연구가 활발히 진행되고 있다. 이러한 시스템은 일반적으로 Latent Diffusion Models(LDMs)과 같은 Stable Diffusion 및 Flux를 대상으로 한다. 이러한 모델은 노이즈 기반 절차를 사용하여 이미지의 인코딩 및 디코딩을 수행한다.

이미지에 적대적 노이즈를 삽입하여 이미지 감지기를 오도하여 이미지 내용을 잘못 판단하게 할 수 있으며, 이미지 생성 시스템이 저작권된 데이터를 악용하지 못하도록 방지할 수 있다.

MIT 논문 'Raising the Cost of Malicious AI-Powered Image Editing'의 예시. 원본 이미지와 보호된 이미지의 비교.

MIT 논문 ‘Raising the Cost of Malicious AI-Powered Image Editing’의 예시. 원본 이미지와 보호된 이미지의 비교. Source: https://arxiv.org/pdf/2302.06588

2023년 Stable Diffusion의 웹 크롤링 이미지 사용에 대한 예술가들의 반발 이후, 연구자들은 같은 주제에 대한 다양한 변형을 제시해왔다. 이러한 연구는 이미지에 보이지 않는 방식으로 ‘독’을 넣어 AI 시스템에 훈련시키거나 생성 AI 파이프라인에 흡수되는 것을 방지하는 아이디어에 초점을 맞추고 있다.

모든 경우에, 노이즈의 강도와 이미지의 보호 정도, 그리고 이미지의 품질 저하 간에 직접적인 상관관계가 있다.

보호 성공률 그래프. 노이즈의 강도에 따라 품질 저하가 발생한다.

보호 성공률 그래프. 노이즈의 강도에 따라 품질 저하가 발생한다. Source: https://arxiv.org/pdf/2002.08327

특히, 예술가들이 자신의 스타일을 무단으로 사용하는 것을 방지하기 위해 이러한 시스템은 정보를 은닉하고, AI 훈련 과정에서 의미적 및 시각적 영역 간의 연결을 방지할 수 있다.

스타일 변경 예시. Mist와 Glaze가 이미지에 적용된 예시.

스타일 변경 예시. Mist와 Glaze가 이미지에 적용된 예시. Source: https://arxiv.org/pdf/2506.04394

자신의 목표를 이루지 못한 보호

미국의 새로운 연구에 따르면, 노이즈를 추가하는 것은 이미지의 편집을 방지하는 대신, 실제로 이미지 편집을 더 쉽게 만들 수 있다.

연구자들은 다음과 같이 말한다:

‘우리의 실험에서, 다양한 노이즈 기반 이미지 보호 방법을 사용하여, 이러한 보호가 완전히 목표를 달성하지 못한다는 것을 발견했다.

‘대부분의 시나리오에서, 확산 기반 편집은 원본 이미지와 매우 일치하는 출력 이미지를 생성한다.

‘우리의 연구 결과는, 이미지에 노이즈를 추가하는 것이 이미지와 주어진 텍스트 프롬프트 간의 연관성을 증가시켜, 원치 않는 결과를 초래할 수 있다.

‘따라서, 우리는 이러한 노이즈 기반 방법이 이미지 편집에 대한 강력한 보호를 제공하지 않는다고 주장한다.

테스트에서는 두 가지 일반적인 AI 편집 시나리오를 사용했다: 이미지-이미지 생성과 스타일 전환.

보호된 이미지와 원본 이미지를 비교하여, 노이즈가 추가된 이미지의 품질과 원본 이미지의 품질을 비교했다.

결과는 예상과 다르게, 노이즈가 추가된 이미지의 품질이 더 좋았다.

연구 방법

연구자들은 세 가지 보호 방법을 사용했다: PhotoGuard, Mist, Glaze.

Glaze 프레임워크의 예시.

Glaze 프레임워크의 예시. Source: https://arxiv.org/pdf/2302.04222

PhotoGuard는 자연 이미지에 사용되었으며, Mist와 Glaze는 예술 작품에 사용되었다.

테스트에서는 Stable Diffusion v1.5를 사용하여 이미지 생성을 수행했다.

반대 의견

두 가지 수정된 캡션을 생성하여, 원본 캡션과 비교했다.

예를 들어, 원본 캡션 ‘젊은 소녀가 나무 집으로 들어가는 모습’에서, 가까운 프롬프트는 ‘젊은 소년이 벽돌집으로 들어가는 모습’이 될 수 있다. 반면, 먼 프롬프트는 ‘두 마리의 고양이가 소파에 누워 있는 모습’이 될 수 있다.

가까운 프롬프트는 명사와 형용사를 유사한 용어로 대체하여 생성되었으며, 먼 프롬프트는 모델이 원본 캡션과 매우 다른 캡션을 생성하도록 지시했다.

모든 생성된 캡션은 수동으로 품질과 의미적 관련성을 확인했다.

수정된 캡션의 의미적 유사성 분포.

수정된 캡션의 의미적 유사성 분포. Source: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

이미지 품질을 평가하기 위해 Blind/Referenceless Image Spatial Quality Evaluator(BRISQUE)를 사용했다.

이미지-이미지 생성 결과.

이미지-이미지 생성 결과.

측정

연구자들은 이미지-텍스트 정렬도를 측정하여, 보호된 이미지와 원본 이미지의 품질을 비교했다.

CLIP-S와 PAC-S++를 사용하여 이미지와 텍스트의 유사성을 평가했다.

이미지-텍스트 정렬도는 AI가 주어진 프롬프트에 따라 이미지의 편집을 얼마나 잘 수행하는지 나타낸다.

보호된 이미지의 이미지-텍스트 정렬도.

보호된 이미지의 이미지-텍스트 정렬도.

연구자들은 보호된 이미지와 원본 이미지의 품질을 비교하여, 보호된 이미지의 품질이 더 좋았다.

예술 공격

자연 이미지에 대한 테스트에서는 Flickr1024 데이터셋을 사용했다.

이미지에 스타일 전환을 적용하여, 원본 이미지와 보호된 이미지의 품질을 비교했다.

원본 이미지와 보호된 이미지의 스타일 전환 결과.

원본 이미지와 보호된 이미지의 스타일 전환 결과.

예술 작품에 대한 테스트에서는 WikiArt 데이터셋을 사용했다.

이미지에 스타일 전환을 적용하여, 원본 이미지와 보호된 이미지의 품질을 비교했다.

원본 이미지와 보호된 이미지의 스타일 전환 결과.

원본 이미지와 보호된 이미지의 스타일 전환 결과.

연구자들은 보호된 이미지와 원본 이미지의 품질을 비교하여, 보호된 이미지의 품질이 더 좋았다.

결론

LDM의 저작권 문제를 해결하기 위한 연구는 이미 오래전부터 진행되어 왔다. 그러나, 이러한 연구들은 예상과 다르게 이미지 편집을 더 쉽게 만들 수 있다.

노이즈를 추가하는 것은 이미지의 품질을 저하할 수 있으며, 이미지 편집을 방지하는 대신, 실제로 이미지 편집을 더 쉽게 만들 수 있다.

따라서, 이러한 연구는 이미지 편집을 방지하기 위한 새로운 방법을 개발해야 한다.

첫 번째로 게시된 날짜: 2025년 6월 9일

실험 설정과 정량 결과 보완

연구진은 Stable Diffusion v1.5를 사용하고 재현성을 위해 seed 9222, 999, 123, 66, 42를 선택했다. Flickr8k의 8,000개 이상 이미지에는 이미지당 최대 다섯 개의 캡션이 있으며, 원문과 가까운 프롬프트와 멀리 떨어진 프롬프트를 각각 적용했다. Google Universal Sentence Encoder로 측정한 평균 의미 유사도는 가까운 프롬프트가 약 0.6, 먼 프롬프트가 약 0.1이었다.

BRISQUE 품질 점수는 생성 이미지 전체가 17.88, 가까운 프롬프트가 17.82, 먼 프롬프트가 17.94였고 원본은 22.27이었다. 보호된 이미지의 편집 결과가 원본과 비슷한 품질을 유지했음을 뜻한다.

CLIP-S와 PAC-S++로 image-text alignment를 측정했다. protected와 unprotected 결과의 차이를 Actual Change로, 이를 정규화한 값을 Percentage Change로 정의해 다섯 seed와 두 종류의 semantic 변화에서 비교했다.

Changes in image-text alignment scores after style transfer edits.
스타일 전환 뒤 이미지-텍스트 정렬 점수의 변화. 보호가 정렬을 방해하지 않고 오히려 강화한 경우가 나타났다.

결과는 adversarial perturbation의 중대한 한계를 보여준다. 편집을 방해하기보다 생성 모델이 프롬프트에 더 민감하게 반응하도록 만들어, 공격자가 원하는 목표에 더 가까운 출력을 만들 수 있었다.

왜 보호가 편집을 더 쉽게 만드는가

LDM은 먼저 이미지를 압축된 latent로 변환하고 여러 단계에 걸쳐 noise를 더해 거의 무작위 상태로 만든다. 생성할 때 이 과정을 거꾸로 수행하며 noise를 단계적으로 제거하고, 매 단계에서 text prompt가 이미지를 어떤 방향으로 복원할지 안내한다.

Comparison between generations from an unprotected image and a PhotoGuard-protected image, with intermediate latent states converted back into images for visualization.
보호되지 않은 이미지와 PhotoGuard 이미지의 생성 과정 및 중간 latent 상태 비교.

보호 방식이 원본에 넣은 작은 추가 noise는 모델 자체의 noise와 누적된다. denoising이 시작될 때 더 많은 영역이 불확실해지고, 모델은 빈 세부를 채우기 위해 text prompt에 더 강하게 의존한다. 따라서 보호가 오히려 AI가 프롬프트대로 이미지를 바꾸기 쉽게 만든다.

마지막으로 연구진은 정교하게 설계된 perturbation 대신 순수 Gaussian noise를 넣었다. 모든 시험에서 Percentage Change가 양수였으며, 무작위 구조 없는 noise조차 생성 이미지와 프롬프트의 정렬을 강화했다.

Effect of simulated protection using Gaussian noise on the Flickr8k dataset.
Flickr8k에서 Gaussian noise로 모사한 보호의 효과.

어떤 형태의 추가 noise든 생성 과정의 불확실성을 높여 최종 이미지에 대한 text prompt의 통제력을 강화한다는 설명을 뒷받침한다.

출처 및 관련 링크

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai