Anderson의 관점

새로운 깊은 가짜에 대한 법의 데이터 방법

mm
Unite.AI를 Google의 선호 소스에 추가
Variation on ' a 1792x1024 image of a lab technician examining a Guy Fawkes mask with forensic equipment.' - Adobe Firefly

개인 정보를 가진 개인의 딥페이크는 점점 더 큰 공공의 우려가 되고 있으며, 다양한 지역에서 금지되고 있지만, 사용자 생성 모델이 특정 사람의 이미지에 특정적으로 훈련되었음을 실제로 증명하는 것은 매우 어려운 문제입니다.

문제를 이해하기 위해, 딥페이크 공격의 핵심 요소는 특정 사람을 그린 이미지나 비디오를 거짓으로 주장하는 것입니다. 단순히 비디오에 있는 사람이 정체 #A라고 말하는 것만으로도 피해를 줄 수 있으며, 이 경우 AI는 필요하지 않습니다.

그러나 공격자가 실제 사람의 데이터를 사용하여 AI 이미지나 비디오를 생성하는 경우, 소셜 미디어와 검색 엔진의 얼굴 인식 시스템은 자동으로 가짜 콘텐츠를 피해자와 연결합니다. AI 생성된 시각 자료만으로도 연관성이 있습니다.

사람의 외모가 더 뚜렷할수록, 이것은 더욱 필연적으로 됩니다. 따라서 조작된 콘텐츠는 이미지 검색에 나타나고 궁극적으로 피해자에게 도달합니다.

대면

현재 가장 일반적인 개인 정보에 중점을 둔 모델을 배포하는 방법은 Low-Rank Adaptation(LoRA)을 통해 사용자에게 몇 시간 동안 몇 개의 이미지를 훈련시키는 것입니다. 이때 사용되는 모델은 Stable Diffusion(정적인 이미지의 경우) 또는 Hunyuan Video(비디오 딥페이크의 경우)와 같은 더 큰 기초 모델의 가중치를 사용합니다.

LoRA의 가장 일반적인 목표는 여성 셀럽리티이며, 그들의 명성이 이런 종류의 처우에 대한 비판을 덜 받게 합니다. 이것은 유명인에 대한 파생 작품이 미국과 유럽에서 ‘공정 사용’으로 간주되기 때문입니다.

civit.ai 포털의 LoRA 및 Dreambooth 목록에서 여성 셀럽리티가 지배적입니다. 가장 인기 있는 LoRA는 66,000번 이상 다운로드되었습니다. 이는 이 AI의 사용이 여전히 'FRINGE' 활동으로 간주되는 것을 고려하면 상당한 수치입니다.

civit.ai 포털의 LoRA 및 Dreambooth 목록에서 여성 셀럽리티가 지배적입니다. 가장 인기 있는 LoRA는 66,000번 이상 다운로드되었습니다. 이는 이 AI의 사용이 여전히 ‘FRINGE’ 활동으로 간주되는 것을 고려하면 상당한 수치입니다.

그러나 딥페이크의 비셀럽리티 피해자는 미디어에서 프로세스 케이스가 발생하거나 피해자가 인기 있는 아웃レット에서 말할 때까지 나타나지 않습니다.

둘 다에서, 목표 정체성을 가짜하는 데 사용된 모델은 훈련 데이터를 모델의 잠재 공간에 완전히 증류시켰습니다. 따라서 사용된 소스 이미지를 식별하는 것이 어렵습니다.

만약 이것을 허용 가능한 오차 범위 내에서 수행할 수 있다면, 이것은 LoRA를 공유하는 사람들의 기소를 가능하게 할 것입니다. 왜냐하면 이것은 특정 개인의 정체성을 가짜하는 의도를 증명할 뿐만 아니라, 적용 가능한 경우 업로더를 저작권 침해로 노출시킬 것이기 때문입니다.

이것은 딥페이크 기술의 법적 규제가 부족하거나 뒤처진 지역에서 유용할 것입니다.

과도한 노출

기초 모델을 훈련시키는 목표는 모델이 잘 일반화되고 유연해지도록 하는 것입니다. 이것은 충분한 수의 다양한 이미지와 적절한 설정으로 훈련을 수행하고, 모델이 데이터에 과도하게 적합되지 않도록 훈련을 종료하는 것을 포함합니다.

과도하게 적합된 모델은 훈련 과정에서 데이터를 너무 많이 본 모델로, 매우 유사한 이미지를 재생산하는 경향이 있습니다. 따라서 훈련 데이터의 출처를 노출합니다.

Stable Diffusion V1.5 모델에서 'Ann Graham Lotz' 정체성을 거의 완벽하게 재현할 수 있습니다. 재구성은 훈련 데이터(이미지의 왼쪽)와 거의 동일합니다. 출처: https://arxiv.org/pdf/2301.13188

Stable Diffusion V1.5 모델에서 ‘Ann Graham Lotz’ 정체성을 거의 완벽하게 재현할 수 있습니다. 재구성은 훈련 데이터(이미지의 왼쪽)와 거의 동일합니다. 출처: https://arxiv.org/pdf/2301.13188

그러나 과도하게 적합된 모델은 일반적으로 분산되지 않고 폐기됩니다. 왜냐하면 이러한 모델은 본질적으로 목적에 부적합하기 때문입니다. 따라서 이것은 불가능한 법의적幸運입니다. 어떤 경우에든, 이 원리는 더 비싼 고용량의 기초 모델 훈련에 더 많이 적용되며, 동일한 이미지의 여러 버전이巨大한 소스 데이터셋에 침투하여 특정 훈련 이미지를 쉽게 호출할 수 있습니다(이미지와 예시 참조).

그러나 LoRA 및 Dreambooth 모델의 경우(Dreambooth는 큰 파일 크기 때문에 인기가 떨어짐), 사용자는 주제의 매우 제한된 수의 다양한 이미지를 선택하여 LoRA를 훈련시킵니다.

왼쪽: Hunyuan Video LoRA의 출력. 오른쪽: 유사성을 가능하게 한 데이터(표시된 사람의 허가로 사용된 이미지).

왼쪽: Hunyuan Video LoRA의 출력. 오른쪽: 유사성을 가능하게 한 데이터(표시된 사람의 허가로 사용된 이미지).

LoRA는 종종 훈련된 트리거 단어를 가지고 있습니다. 그러나 특정 훈련된 주제는 종종 프롬프트 없이 생성된 출력에 나타납니다. 왜냐하면 잘 균형된(즉, 과도하게 적합되지 않은) LoRA는 훈련에 사용된 자료에 약간 고정되어 있으며, 출력에 이를 포함하는 경향이 있기 때문입니다.

이 선호도는 제한된 이미지 수와 결합되어 LoRA 데이터셋을 최적화하고, 이를 법의적 분석에 노출시킵니다.

데이터의 탈바꿈

이 문제는 덴마크의 새로운 논문에서 해결되었습니다. 이 논문은 블랙박스 멤버십 추론 공격(MIA)에서 소스 이미지를 식별하는 방법을 제시합니다. 이 기술은 사용자 정의로 훈련된 모델을 사용하여 소스 데이터를 노출하는 자신의 ‘딥페이크’를 생성하는 것을 포함합니다.

새로운 접근법으로 생성된 '가짜' 이미지의 예시, Classifier-Free Guidance(CFG) 수준을 높여가며, 파괴 지점까지.

새로운 접근법으로 생성된 ‘가짜’ 이미지의 예시, Classifier-Free Guidance(CFG) 수준을 높여가며, 파괴 지점까지.

이 연구는 Face Images Against Fine-Tuned Latent Diffusion Models에 대한 Membership Inference Attacks라는 제목의 논문입니다. 이 논문은 이 주제에 대한 문헌에 가장 흥미로운 기여입니다. 그러나 이 논문은 매우 난해하고, 많은 해석이 필요합니다. 따라서 우리는 이 프로젝트의 기본 원리를 다루고, 얻은 결과 중 일부를介绍하겠습니다.

본질적으로, 누군가가 얼굴 이미지를 사용하여 AI 모델을 미세하게 조정하면, 저자의 방법을 사용하여 이를 증명할 수 있습니다. 모델의 생성된 이미지에서 기억의 흔적을 찾는 것입니다.

첫째, 대상 AI 모델은 얼굴 이미지를 사용하여 미세하게 조정됩니다. 이렇게 하면 모델이 출력에서 이러한 이미지의 세부 사항을 재현할 가능성이 높아집니다. 이후, 분류기 공격 모드는 대상 모델에서 생성된 AI 이미지로 훈련됩니다. ‘양성’ 예시(의심되는 훈련 세트의 구성원)로 사용되며, 다른 데이터셋에서 가져온 이미지는 ‘음성’ 예시(비 구성원)로 사용됩니다.

이러한 그룹 간의 미묘한 차이를 학습함으로써, 공격 모델은 주어진 이미지가 원래 미세 조정 데이터셋의 일부였는지 예측할 수 있습니다.

공격은 모델이 광범위하게 미세 조정된 경우, 특히 특정 이미지 세트(예: 개인의 얼굴)에 훈련된 모델에서 가장 효과적입니다. 그러나 공격은 데이터셋을 사용했는지 여부를 결정할 수 있지만, 데이터셋 내의 개별 이미지를 식별하는 것은 어렵습니다.

유용한 점은, 공격이 블랙박스 설정에서 작동한다는 것입니다. 즉, 모델의 내부 세부 사항에 접근하지 않고, 모델의 출력만으로 작동합니다.

이 접근법은 계산적으로 집중적입니다. 그러나 이 연구의 가치는 추가 연구를 위한 방향을 나타내고, 데이터를 허용 가능한 오차 범위 내에서 추출할 수 있음을 보여주는 데 있습니다.

방법/데이터

이 연구에서 사용된 데이터셋은 덴마크 기술 대학(DTU)에서 파생되었습니다.

DseenDTU 기본 이미지 세트.

DDTU DTU Orbit에서 스크랩된 이미지.

DseenDTU 대상 모델을 미세 조정하는 데 사용된 DDTU의 파티션.

DunseenDTU 대상 모델을 미세 조정하지 않고 공격 모델을 훈련하거나 테스트하는 데 사용된 DDTU의 파티션.

wmDseenDTU 대상 모델을 미세 조정하는 데 사용된 DDTU의 파티션으로, 가시적인 워터마크가 있습니다.

hwmDseenDTU 대상 모델을 미세 조정하는 데 사용된 DDTU의 파티션으로, 숨겨진 워터마크가 있습니다.

DgenDTU DseenDTU 이미지 세트에서 미세 조정된 Latent Diffusion Model(LDM)으로 생성된 이미지.

BLIP 캡션 모델을 사용하여 이미지-텍스트 쌍이 캡션되었습니다.

BLIP는 각 설명 앞에 ‘a dtu headshot of a’라는 문구를 추가했습니다.

테스트

여러 실험을 수행하여 멤버십 추론 공격이 대상 모델에 대해 얼마나 잘 수행되는지 평가했습니다. 각 테스트는 대상 모델이 미세 조정된 이미지 데이터셋을 사용하여 공격을 성공적으로 수행할 수 있는지 여부를 결정하려고 시도했습니다.

대상 모델은 Stable Diffusion V1.5를 사용했습니다. 이 모델은 연구에서 자주 사용됩니다. 왜냐하면 일관된 테스트가 필요하고, 이전 버전을 사용하는 많은 이전 연구가 있기 때문입니다.

연구자의 공격 모델은 Resnet-18을 기반으로 하며, 모델의 사전 훈련된 가중치를 유지했습니다. ResNet-18의 1000개의 뉴런이 있는 마지막 레이어는 2개의 뉴런을 가진 완전 연결 레이어로 대체되었습니다.

각 테스트에서 공격 모델은 5번 훈련되었습니다. 이는 주요 메트릭에 대한 95% 신뢰 구간을 계산하기 위한 다른 랜덤 시드를 사용하여 수행되었습니다.

이 접근법은 계산적으로 집중적이지만, 데이터를 허용 가능한 오차 범위 내에서 추출할 수 있음을 보여주었습니다.

결론

이 논문은 흥미롭지만, 접근하기 어렵게 작성되었습니다. 이 연구는 개인 정보 보호 옹호자와 캐주얼 AI 연구자에게 관심이 있을 것입니다.

멤버십 추론 공격은 유용한 법의적 도구가 될 수 있지만, 이 연구 분야가 적용 가능한 광범위한 원칙을 개발하여, 딥페이크 탐지와 같은 게임을 피할 수 있습니다.

새로운 모델의 출시로 탐지와 유사한 법의적 시스템에 부정적인 영향을 미치는 게임을 피할 수 있습니다.

이 연구에서 더 높은 수준의 지침 원리가 발견되었으므로, 이 방향으로 더 많은 연구를 기대할 수 있습니다.

첫 번째로 게시됨: 2025년 2월 21일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]