Anderson의 관점
더 작은 딥페이크가 더 큰 위협일 수 있다

대화형 AI 도구인 ChatGPT와 Google Gemini는 이제 얼굴을 교체하지 않는 더 미묘한 방식으로 이미지를 조작하여 전체 이야기를 다시 작성하는 데 사용되고 있다. 제스처, 소품, 배경을 변경함으로써 이러한 편집은 AI 탐지기와 인간 모두를 속여 온라인에서 무엇이 실제인지 판단하는 위험을 높인다.
현재의 분위기, 특히 TAKE IT DOWN 법과 같은 중요한 법안의 여파에서, 많은 사람들이 딥페이크와 AI 주도 身分 합성을 비동의 AI 포르노와 정치 조작과 같은 진실의 명백한 왜곡과 연관시킨다.
이것은 우리를 대단한 내용을 가진 AI 조작된 이미지에 익숙하게 만든다. 렌더링의 품질과 맥락의 조작이 짧은 기간 동안 신뢰를 얻는 데 성공할 수 있다.
그러나 역사적으로 훨씬 더 미묘한 변경은 더 사악하고 지속적인 영향을 미쳤는데, 예를 들어 스탈린의 사진 조작은 그가 불쾌한 사람들을 사진 기록에서 제거하는 것을 가능하게 했다.
다음 예에서 두 번째 사진의 문제는 우리가 ‘모르는 것을 모른다’는 것이다. 스탈린의 비밀 경찰의 전 수장이 안전 장벽이 있는 곳에 있었던 것이다:

이제 그를 볼 수 있다, 이제 그는 증발했다. 스탈린 시대 사진 조작은 역사에서 한 당파를 제거한다. 출처: 공공 도메인, https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html
이러한 종류의 흐름은 문화적으로, 컴퓨터 비전 자체에서 지속되는 경향이 있다. 컴퓨터 비전은 통계적으로 우세한 주제와 모티프에서 트렌드를 파악한다. 예를 들어, 스마트폰은 사진을 찍는 데의 장벽을 낮추고 비용을 크게 절감했다. 따라서 스마트폰의 상징은 많은 추상적인 개념과 관련되어 있다.
전통적인 딥페이크는 공격 행위로 간주될 수 있지만, 오디오-비주얼 미디어에서 사악하고 지속적인 작은 변경은 가스라이팅과 더 비슷하다. 또한 이러한 종류의 딥페이크를 식별하는 것은 어려울 뿐만 아니라, 현재의 딥페이크 탐지 시스템을 사용하여도 어려울 수 있다.
멀티페이크버스
호주 연구진은 ‘미묘한’ 딥페이크에 대한 연구의 부족을 해결하기 위해, 맥락, 감정, 내러티브를 변경하는 사람 중심의 이미지 조작에 대한 새로운 데이터셋을 구축했다.

새로운 컬렉션에서 샘플링된 실제/가짜 이미지 쌍, 일부 변경은 다른 변경보다 더 미묘하다. 출처: https://huggingface.co/datasets/parulgupta/MultiFakeVerse_preview
멀티페이크버스라는 이름의 이 컬렉션은 845,826개의 이미지로 구성되어 있으며, 비전 언어 모델(VLM)을 통해 생성되었다. 이 이미지는 온라인에서 접근하여 다운로드할 수 있다.
연구진은 다음과 같이 말한다:
‘이 VLM 기반 접근법을 사용하면 동작, 장면, 인간-객체 상호작용과 같은 의미적, 맥락에 따른 변경이 가능하다. 기존 데이터셋에서 일반적으로 사용되는 합성 또는 저수준 身分 교체 및 지역 특정 편집과는 다르다.’
‘우리의 실험은 현재 최고의 딥페이크 탐지 모델과 인간 관찰자가 이러한 미묘하지만 의미 있는 조작을 감지하는 데 어려움을 겪고 있음을 보여준다.’
연구진은 인간과 최고의 딥페이크 탐지 시스템을 모두 테스트하여 이러한 미묘한 변경을 얼마나 잘 식별할 수 있는지 확인했다. 인간 참여자는 약 62%의 시간 동안 이미지를 실제 또는 가짜로 올바르게 분류했으며, 변경된 이미지의 어떤 부분이 변경되었는지 식별하는 데 더 큰 어려움을 겪었다.
기존의 딥페이크 탐지기들은 주로 더 明顯한 얼굴 교체 또는 inpainting 데이터셋에 대해 훈련되었기 때문에 성능이 좋지 않았다. 멀티페이크버스에 대한 미세 조정을 적용한 후에도 탐지率은 낮게 유지되었다. 이는 현재 시스템이 이러한 미묘한, 내러티브 주도 편집을 처리하는 데 얼마나 어려움을 겪는지 보여준다.
새로운 논문은 멀티버스 통해 딥페이크: 사람 중심의 시각적 및 개념적 조작에 대한 멀티페이크버스 데이터셋으로 제목이 붙여졌으며, 멜버른의 모나시 대학교와 퍼스의 커틴 대학교의 5명의 연구진이共同으로 작성했다. 코드와 관련 데이터는 깃허브에 공개되었다.
방법
멀티페이크버스 데이터셋은 사람들을 다양한 상황에 놓은 4개의 실제 이미지 세트에서 구축되었다: EMOTIC; PISC, PIPA, 및 PIC 2.0. 86,952개의 원본 이미지에서 시작하여 연구진은 758,041개의 조작된 버전을 생성했다.
Gemini-2.0-Flash와 ChatGPT-4o 프레임워크는 각 이미지에 대해 6개의 최소한의 편집을 제안하기 위해 사용되었다. 이러한 편집은 가장 두드러진 사람을 보는 관점에서 미묘하게 변경하도록 설계되었다.
모델은 주제를 순진한, 자랑스러운, 후회하는, 미숙한, 또는 무심한으로 만들거나 장면 내의 사실적 요소를 조정하도록 지시받았다. 각 편집과 함께 모델은 변경의 대상이 되는 것을 명확하게 식별할 수 있는 참조 표현을 생성했다.
연구진은 다음과 같이 설명한다:
‘참조 표현은 커뮤니티에서 널리 연구되는 영역입니다. 즉, 이미지 내의 대상에 대한 모호성을 제거할 수 있는 구입니다. 예를 들어, 두 명의 남성이 책상에 앉아 있는 이미지에서, 후者の 참조 표현은 ‘왼쪽에 문서를 잡고 있는 남자’일 수 있습니다.’
편집이 정의되면 실제 이미지 조작은 비전 언어 모델에 의해 수행되었다. 연구진은 이 작업에 세 가지 시스템을 테스트했다: GPT-Image-1; Gemini-2.0-Flash-Image-Generation; 및 ICEdit.
22,000개의 샘플 이미지를 생성한 후, Gemini-2.0-Flash는 가장 일관된 방법으로 나타났으며, 편집이 자연스럽게 장면에 통합되는 이미지를 생성했다. 반면, ICEdit은 더 명백한 위조를 생성했으며, 변경된 영역에 明顯한 결함이 있었으며, GPT-Image-1은 때때로 의도하지 않은 이미지의 부분에 영향을 미쳤다.
이미지 분석
각 조작된 이미지는 원본 이미지와 비교하여 변경된 내용을 확인하기 위해 분석되었다. 두 버전 사이의 픽셀 수준의 차이는 계산되었으며, 작은 무작위 노イズ는 의미 있는 편집에 초점을 맞추기 위해 필터링되었다. 일부 이미지에서는 아주 작은 영역만 변경되었으며, 다른 일부에서는 장면의 최대 80%가 변경되었다.
각 이미지의 의미가 이러한 변경으로 인해 얼마나 변경되는지 평가하기 위해, 원본 이미지와 조작된 이미지 모두에 대해 ShareGPT-4V 비전 언어 모델을 사용하여 캡션이 생성되었다.
이 캡션은 Long-CLIP을 사용하여 임베딩으로 변환되어, 내용이 얼마나 달라졌는지 비교할 수 있었다. 가장 큰 의미적 변경은 대상과 관련된 객체가 변경된 경우에 나타났다. 이러한 작은 조정은 이미지의 해석에 상당한 영향을 미칠 수 있다.
Gemini-2.0-Flash는 각 이미지에서 적용된 편집의 유형을 분류하기 위해 사용되었다. 편집은 세 가지 범주로 분류되었다: 사람 수준 편집은 주제의 얼굴 표정, 姿勢, 시선, 의복 또는 기타 개인적 특징의 변경을 포함했다; 객체 수준 편집은 사람과 관련된 객체를 변경했다; 장면 수준 편집은 사람과 직접 관련되지 않은 배경 요소나 더广い 장면을 포함했다.

멀티페이크버스 데이터셋 생성 파이프라인은 실제 이미지에서 시작하여 비전 언어 모델이 사람, 객체 또는 장면을 대상으로 하는 내러티브 편집을 제안한다. 출처: https://arxiv.org/pdf/2506.00868
편집의 분포는 데이터셋 전체에 걸쳐 매핑되었다. 약 3분의 1의 편집은 사람만을 대상으로 했으며, 약 5분의 1은 장면만을 대상으로 했으며, 약 6분의 1은 객체만을 대상으로 했다.
인식 영향 평가
Gemini-2.0-Flash는 6개 영역에서 조작이 관찰자의 인식에 미치는 영향을 평가하기 위해 사용되었다: 감정, 개인 身分, 권력 역학, 장면 내러티브, 조작 의도, 및 윤리적 우려.
감정에 대해, 편집은 종종 기쁨, 매력, 또는 접근 가능과 같은 용어로 설명되었다. 내러티브적으로, 전문가 또는 다른와 같은 단어는 변경된 이야기를 나타냈다:

Gemini-2.0-Flash는 각 조작이 6개 관찰자 인식 측면에 미치는 영향을 평가하도록 지시받았다.
身分 변경의 설명에는 젊은, 유연한, 및 취약한과 같은 용어가 포함되어, 미묘한 변경이 어떻게 개인을 인식하는지 영향을 미칠 수 있는지 보여주었다. 많은 편집의 의도는 설득력 있는, 기만적인, 또는 미적으로 분류되었다. 대부분의 편집은 약간의 윤리적 우려를 제기했지만, 일부는 중대하거나 심각한 영향을 미치는 것으로 판단되었다.

멀티페이크버스에서 관찰자 인식이 변경되는 예시.
메트릭
멀티페이크버스 컬렉션의 시각적 품질은 세 가지 표준 메트릭을 사용하여 평가되었다: 피크 신호 대 노이즈 비율(PSNR); 구조적 유사성 지수(SSIM); 및 프레체 인셉션 거리(FID):

PSNR, SSIM, 및 FID를 사용한 멀티페이크버스의 이미지 품질 점수.
SSIM 점수 0.5774는 중간 정도의 유사성을 반영하며, 대부분의 이미지를 유지하면서 대상 편집을 적용하는 목표와 일치한다. FID 점수 3.30은 생성된 이미지의 높은 품질과 다양성을 나타낸다. PSNR 값 66.30 데시벨은 편집 후에도 이미지의 좋은 시각적 충실도를 나타낸다.
사용자 연구
사용자 연구는 멀티페이크버스에서 미묘한 가짜를 얼마나 잘 식별할 수 있는지 확인하기 위해 수행되었다. 18명의 참가자가 50개의 이미지를 보았으며, 실제와 조작된 예제가 균등하게 분할되었다. 각人は 이미지를 실제 또는 가짜로 분류해야 했으며, 가짜인 경우 어떤 종류의 조작이 적용되었는지 식별해야 했다.
실제 대 가짜를 결정하는 데 대한 전체 정확도는 61.67%였다. 즉, 참가자들은 약 1/3의 시간 동안 이미지를 올바르게 분류하지 못했다.
연구진은 다음과 같이 말한다:
‘가짜 이미지에 대한 인간의 예측을 분석한 결과, 실제 조작 수준과 예측된 조작 수준 사이의 평균 교차 구간은 24.96%였다. 이것은 우리의 데이터셋에서 조작 영역을 식별하는 것이 인간 관찰자에게 비판적인 작업임을 보여준다.’
멀티페이크버스 데이터셋을 구축하는 데는大量의 계산 리소스가 필요했다. 편집 지침을 생성하기 위해 Gemini 및 GPT 모델에 대해 845,000개의 API 호출이 수행되었으며, 이러한 프롬프트 작업의 비용은 약 1,000달러였다. Gemini 기반 이미지 생성에는 약 2,867달러가 소요되었다. GPT-Image-1을 사용하여 이미지 생성에는 약 200달러가 소요되었다. ICEdit 이미지는 NVIDIA A6000 GPU에서 로컬로 생성되어 약 24시간 내에 작업을 완료했다.
테스트
테스트를 수행하기 전에, 데이터셋은 분할되어, 70%의 실제 이미지가 훈련용으로, 10%가 검증용으로, 20%가 테스트용으로 사용되었다. 각 실제 이미지에서 생성된 조작된 이미지는 해당 실제 이미지와 동일한 세트에 할당되었다.

데이터셋의 실제 및 변경된 콘텐츠의 추가 예시.
가짜를 감지하는 성능은 이미지 수준 정확도와 F1 점수를 사용하여 측정되었다. 조작된 영역을 찾는 경우, 곡선 아래 영역(AUC), F1 점수, 및 교차 구간(IoU)가 사용되었다.
멀티페이크버스 데이터셋은 테스트 세트 전체에 대해 최고의 딥페이크 탐지 시스템에 대해 테스트되었다. 경쟁 프레임워크는 CnnSpot; AntifakePrompt; TruFor; 및 비전-언어 기반 SIDA였다. 각 모델은 원래 사전 훈련된 가중치를 사용하여 제로샷 모드에서 평가되었다.
CnnSpot과 SIDA의 두 모델은 멀티페이크버스 훈련 데이터에 대해 미세 조정을 적용하여 성능이 향상되는지 확인하기 위해 미세 조정되었다.

멀티페이크버스에서 제로샷 및 미세 조정 조건下的 딥페이크 탐지 결과.
이 결과에 대해 연구진은 다음과 같이 말한다:
‘이 모델들은 이전의 inpainting 기반 가짜에 훈련되어 우리의 VLM 편집 기반 위조를 식별하는 데 어려움을 겪는다. 특히, CnnSpot은 거의 모든 이미지를 실제로 분류한다. AntifakePrompt는 제로샷 성능이 66.87%의 평균 클래스별 정확도와 55.55%의 F1 점수를 기록하며 최고의 성능을 보였다.’
‘훈련 세트에서 미세 조정을 적용한 후, CnnSpot과 SIDA-13B 모두 성능이 향상되었다. CnnSpot은 평균 클래스별 정확도에서 SIDA-13B를 1.92%ポイント, F1 점수에서 1.97%ポイント超过했다.’
SIDA-13B는 멀티페이크버스에서 조작된 영역을 얼마나 정확하게 찾을 수 있는지 측정하기 위해 평가되었다. 모델은 원래 상태와 데이터셋에 대한 미세 조정 후에 테스트되었다.
원래 상태에서, 모델은 13.10의 교차 구간 점수, 19.92의 F1 점수, 및 14.06의 AUC를 달성했다. 이는 약한 위치 성능을 나타낸다.
미세 조정을 적용한 후, 점수는 24.74의 IoU, 39.40의 F1 점수, 및 37.53의 AUC로 향상되었다. 그러나, 추가 훈련에도 불구하고, 모델은 여전히 편집이 적용된 정확한 위치를 찾는 데 어려움을 겪었다. 이는 이러한 종류의 작은, 대상 편집을 감지하는 것이 얼마나 어려운지 보여준다.
결론
새로운 연구는 인간과 기계의 인식에서盲点을 노출한다. 딥페이크에 대한 공공 논의는 주로 身分 교체에 초점을 맞추었지만, 이러한 ‘내러티브 편집’은 더 隠蔽적이고 장기적으로 더 유해할 수 있다.
ChatGPT와 Gemini와 같은 시스템이 이러한 종류의 콘텐츠를 생성하는 데 더 적극적으로 참여하고, 우리가 자신의 사진 스트림의 현실을 변경하는 데 더 적극적으로 참여할수록, 탐지 모델이 粗暴한 조작만을 감지하는 경우 방어가 불충분할 수 있다.
멀티페이크버스는 탐지가 실패한 것이 아니라, 문제의 일부가 더 어려운, 더 느린 형태로 이동하고 있을 수 있음을 보여준다. 즉, 작은 시각적 거짓말이 무심하게 누적되는 형태이다.
2025년 6월 5일 처음 게시됨












