Anderson의 관점
딥페이크 탐지 정확도, AI 비디오 발전 1년 동안 49% 하락

나는 흥미롭게도 새로운 우크라이나 주도 논문이 구세대 딥페이크 비디오 탐지기가 현재 최첨단 생성 AI 비디오에서 매우 형편없이 작동한다는 점을 나타낸다고 언급한다. 이 생성기들이 오픈 소스이든, 알리바바의 Wan 2.2 또는 Hunyuan Video와 같은 로컬 AI 설치이든; 혹은 API 전용, 폐쇄형 모델인 Grok Imagine 또는 Kling이든 관계없이.
재생하려면 클릭하세요 (오디오 콘텐츠). DF26 데이터셋의 ‘Direct to camera casual’ 카테고리에서 세 가지 예시. 출처
2024년으로 돌아가면, 또 다른 논문이 이미 인간의 AI 비디오 탐지 능력이 우연 수준에 그다지 못 미친 상태이며, 57%에 불과하다고 밝혀냈다. 새로운 연구(제목 DF26: We Cannot Tell Fake From Real Anymore)가 추가한 내용은, 자동 딥페이크 탐지기가 그 이후 효능이 크게 떨어졌다는 실증적 증거이다 – 최신 생성 AI 비디오에 직면했을 때 94%에서 48%로 감소했다.

이 연구를 위해 생성된 새로운 데이터셋에서, 이미지-비디오 및 텍스트-비디오 생성 비디오(아래) 예시를 왼쪽의 실제 비디오와 비교한다. 이 코퍼스는 현재 가장 우려되는 생성 AI 분야 중 하나인 ‘설득력 있는’ 신뢰할 수 있는 머리와 어깨 구성을 집중한다. 출처
이번 연구에서 수행된 테스트 중 가장 급격한 감소는 49% 감소를 나타낸다. 이전 벤치마크가 2025년부터이며, 새로운 연구는 최신 2026세대 비디오 모델들을 테스트했으므로, 이 수치는 AI 비디오 탐지 효능이 거의 1년 동안 악화된 것을 의미한다.

탐지기 테스트에 사용된 비디오를 생성한 모델들의 세부 정보.
이 탐지기 회피 출력을 생성하는 데 사용된 폐쇄형 상용 모델은 Grok 1.0; Kling 3.0; Veo 3.1; 그리고 Wan 2.6이다. 이들에 대해서는 텍스트-비디오 예시만 생성했는데, 이미지-비디오(I2V) 생성을 시도하면 종종 ‘딥페이크 생성’에 대한 필터가 작동하거나 플랫폼 이용 약관을 위반할 수 있기 때문이다.
내 눈을 바라봐
이러한 트리거는 아마도 연구자들이 가장 잠재적으로 강력하고, 어쩌면 사악한 형태의 비디오 기반 설득—’머리와 어깨’ 및 ‘말하는 머리’ 비디오의 다양한 변형에 집중했기 때문일 것이다. 이 비디오들은 피사체가 카메라를 향해 말하는 형태로, YouTube와 TikTok 인플루언서 비디오, 혹은 뉴스 보도 시나리오(위성 연결 인터뷰 등)와 유사하다.
저자들은 이러한 시나리오가 딥페이크 활동의 주요 표적이라고 주장한다. 이는 이들이 ‘인플루언서’ 및 다양한 ‘정보’ 맥락을 대표하기 때문이며, 이러한 맥락에서는 사전 신뢰 관계가 존재하고, 따라서 그 관계가 악용될 가능성이 크다(당연히 이는 최소한 딥페이크 비디오 통화에도 동일하게 적용되지만, 연구자들은 이를 다루지는 않는다).
오토인코더 딥페이크 시대의 정점에서, 실제 리처드 닉슨 영상의 조작을 통해 1969년 아폴로 9호 우주비행사 사망 발표를 시뮬레이션할 수 있었다 – 실제 스크립트를 사용해 딥페이크된 음성 및 입술 움직임을 부여한 사건이다.
이 인플루언서 시나리오에 집중하는 것 외에도, 새로운 벤치마크와 그를 위해 제작된 비디오는 과거 딥페이크 탐지 전략과 달리 비디오의 전체 프레임을 평가하는 데 중점을 둔다.
그러한 오래된 전략은 얼굴 또는 표정 조작, 혹은 실제 비디오 내에서 얼굴(최선의 경우 전체 머리) 교체를 수행했으며 – 이는 지난 18~24개월 동안 확산 기반 모델이 충분히 효과적으로 대체하기 전까지 유일하게 합리적인 접근법이었다.
얼굴을 등지다
이제는 그렇게 수행되지 않는다; 오래된 오토인코더 기반 방법은 2017년 말 딥페이크 최초 등장 시점으로 거슬러 올라가며, 이 기술은 얼굴 외곽 라인 내부 영역만을 교체하는데, 2022년까지 완전히 소진되었다.

딥페이크 활동의 주요 영역, 2017-2023 – 그러나 새로운 세대의 생성 AI 비디오 플랫폼에서는 주의를 집중할 경계가 존재하지 않는다. 출처
그럼에도 불구하고 과학 연구 분야는 오래 지속되는 일정한 기준을 선호한다 – 목표가 고정되어 있고, 수년·수십 년에 걸쳐 다양한 접근 방식이 적용될 수 있는 – ‘내부 얼굴 교체/수정’에 기반한 딥페이크 탐지 방법은 문헌과 상업용 탐지 제품 모두에서 해당 기술의 유효성을 훨씬 넘어 지속되어 왔다.
새 연구에서 테스트된 세 개의 폐쇄형 모델 외에도, 세 개의 매우 강력한 소비자용 오픈소스 모델을 시험했다: Wan 2.2 A14B; HunyuanVideo 1.5; 그리고 LTX 2.3, 최근 눈부시게 FOSS genAI 커뮤니티를 사로잡고 있다. LTX 라인업은 음성 생성도 가능하다:
재생하려면 클릭r/stablediffusion에서 LTX 시리즈에 대한 실험으로, 해당 커뮤니티는 오직 FOSS 모델만을 다룬다. 출처
데이터 설계
저자들은 새로운 데이터셋 DF26을 보지 못한 자료를 평가하기 위한 ‘hold-out’ 세트로 의도한다. 이 컬렉션은 2,691개의 비디오로 구성되며, 세 가지 공개 연설 시나리오(카메라 정면 또는 캐주얼 연설, 공식 성명, 스튜디오 인터뷰)로 나뉜다.
모든 AI 생성 비디오 클립은 OpenVid, TalkingCelebs, MAVOS-DD에서 선별된 271개의 실제 클립을 기반으로 제작되었다.

OpenVid 컬렉션에서 샘플링한 것으로, 이 컬렉션에서 271개의 실제 비디오를 DF26 컬렉션의 AI 생성 비디오의 기본 자료로 사용하였다. 두 개의 다른 데이터셋도 DF26의 비가짜 구성 요소에 기여했다. 출처
이 271개의 실제 비디오는 프레임에서 일치하는 장면 프롬프트를 도출한 뒤, 해당 프롬프트와 지원되는 경우 첫 프레임 자체를 일곱 개의 비디오 생성 모델에 입력하여 총 2,420개의 합성 클립을 생성하는 데 사용되었다.
저자들은 누가 말하는지 등을 알리는 텍스트 오버레이가 포함된 실제 프레임이 생성 워크플로에 들어가지 않도록 보장했으며, 이는 지름길 및 가정을 유발할 가능성이 있기 때문이다. 후보 클립은 Gemini 2.5에 의해 평가되었다.
또한, 한 명 이상의 얼굴이 등장하는 구간은 ‘단일 화자’ 설정을 강제하기 위해 배제되었다.
재생하려면 클릭 [NO SOUND]. 논문과 연계된 데이터셋에서, 최신 및 가장 강력한 7개의 생성 모델(오픈 및 클로즈드 소스 모두)의 최첨단 비디오 생성 예시를 제공한다. 데이터셋에 사용된 모델에는 음성 생성이 가능한 모델도 포함된다(이 기사 앞부분의 예시 참고). 출처
연구진은 다양한 폐쇄형 및 오픈소스 모델을 제공하고, 다양한 수준의 접근 제한 및 보호 장치를 갖춘 인기 상업 플랫폼 Higgsfield AI를 사용했다.
NVIDIA H200(VRAM 141GB)을 내부 연구 클러스터의 기본 GPU 모델로 사용했으며, 컬렉션을 위해 1,626개의 비디오를 생성하는 데 약 440 GPU 시간이 소요되었다.
출력에 텍스트가 보이지 않도록 보장하는 것 외에도, AI 워터마킹의 표시를 흐리게 하거나 전반적으로 피하는 것이 필요했는데, 이는 평가자나 평가 시스템에 대한 잠재적인 ‘지름길’이 될 수 있기 때문이다.
테스트
마지막 테스트 라운드에 사용된 주요 지표는 수신자 작동 특성 곡선 아래 면적(AUC / AUROC)이며, 보조 지표로 동등 오류율(EER)을 사용했다.
프레임 기반 탐지기(정지 프레임을 독립적으로 평가)는 각 비디오에서 균등하게 추출한 32개의 프레임에 대해 테스트되었으며, 점수는 단일 결과로 평균화되었다. 반면, 시계열 탐지기(연속 프레임 정보를 활용)는 비디오 시퀀스 자체를 분석했다.
아래에서 시계열 탐지기 DFD-FCG와 PwTF-DVD의 결과를 확인할 수 있으며, ForAda, Effort, FSFM, GenD-CLIP 및 GenD-DINO, 그리고 DFD-HR의 결과도 함께 제시한다. 모두는 유명한 FaceForensics++ 데이터셋으로 학습되었다.

CelebDF++와 DF26에서 딥페이크 탐지기들을 비교한 테스트 결과. 모든 탐지기는 FaceForensics++로 학습되었으며, AUROC가 높고 EER가 낮을수록 성능이 우수함을 나타낸다.
저자들은 대부분의 탐지기가 Celeb-DF++(CDFv3)에서 좋은 성능을 보이지만, 보다 도전적인 새로운 DF26 컬렉션에서는 급격히 성능이 떨어진다고 언급한다.
‘[Multiple] 최첨단 탐지기가 CelebDF++ [16] (CDFv3) 벤치마크에서 강력한 성능을 달성했으며, 시계열 방법은 AUROC 94.3 및 92.3에 도달했다.
‘하지만, 그들의 성능은 DF26에서 크게 떨어져 각각 48.2와 61.6 AUROC가 된다.
‘대부분의 방법이 크게 악화되어 거의 우연 수준에 머물며, 최고 AUROC 69.7은 GenD-PE가 달성했다.
‘이는 DF26이 최첨단 탐지기에게 더 도전적인 벤치마크임을 보여준다.’
이미지‑투‑비디오의 경우, 사람과 자동 탐지기 모두 텍스트‑투‑비디오보다 탐지가 더 어려웠으며, PwTF-DVD가 I2V 자료에서 가장 좋은 성능을 보였고, GenD-PE가 T2V에서 선두를 달렸다.
성능은 가짜 비디오를 생성한 생성기에 따라 크게 달라졌으며, 탐지기들이 종종 합성 비디오의 일반적인 특징보다 생성기‑특정 흔적을 학습하고 있음을 시사한다. 예를 들어 PwTF-DVD는 Wan 2.2의 텍스트‑투‑비디오 출력에서 92.9 AUROC를 기록했지만, HunyuanVideo 1.5에서는 거의 우연 수준으로 떨어졌다 – 두 모델 모두 같은 최신 세대에 속함에도 불구하고:

상업용 및 오픈소스 비디오 생성기별 탐지기 성능. 열 간의 큰 차이는 탐지 신뢰도가 비디오를 만든 모델에 크게 의존함을 보여주며, GenD-PE가 전체 평균 AUROC에서 가장 높은 값을 기록했다.
아래에서 우리는 GenD-PE를 최신 DF26 자료로 재학습시켰을 때, 훈련에 보지 못한 생성기에서 비디오를 탐지하는 능력이 크게 향상된 것을 확인한다:

보지 못한 비디오 생성기별 GenD-PE 재학습 결과. 최신 DF26 자료로 훈련하면 원래 FaceForensics++ 훈련 대비 교차‑생성기 성능이 일반적으로 향상된다.
HunyuanVideo 1.5에서 훈련하면 Grok Imagine 1.0, Veo 3.1, Wan 2.6에서 AUROC가 최소 93.1까지 상승하여, FaceForensics++와 같은 오래된 데이터셋만으로 훈련된 탐지기들이 현재의 생성 비디오와 잘 맞지 않다는 논문의 주장을 뒷받침한다.
예상대로, 두 시간적 탐지기는 상업 모델 클립보다 오픈소스 비디오에서 훨씬 쉽게 탐지했다. DFD-FCG는 오픈소스 자료에서 57.4 AUROC에서 상업용 폐쇄형 비디오에서는 34.5로 떨어졌으며, PwTF-DVD는 70.5에서 48.3으로 감소했다:

생성기 출처와 발화 시나리오별 두 시간적 탐지기 결과 비교. 두 탐지기 모두 폐쇄형 비디오에서 크게 성능이 떨어졌으며, 장면 유형 간 차이는 작았다.
하지만 논문은 상업 모델이 단순히 탐지하기 더 어렵다고 선언하지 않는다. 모델 패밀리, 후처리 및 시각적 품질 차이도 요인일 수 있기 때문이다.
장면 유형은 훨씬 덜 중요했다: DFD-FCG는 카메라 직접 촬영 클립, 공식 성명, 스튜디오 인터뷰 모두에서 우연 수준에 가까웠으며, PwTF-DVD는 공식 성명에서 가장 좋은 성능을 보였다. 논문에 따르면 생성기 자체가 프레젠테이션 스타일보다 더 큰 영향을 미치는 것으로 보인다.
인간 연구도 진행되어 사람들이 DF26에 대해 자동 탐지기와 동일한 어려움을 겪는지 확인했다. 232개의 라벨링 세션에서 참가자들은 DF26, CelebDF++ 및 DeepSpeak v2의 짧은 클립을 실제 또는 가짜로 판단했으며, 각 클래스의 예시 수는 사전에 알려지지 않았다.

DF26, CelebDF++ 및 DeepSpeak v2에 대한 인간 정확도. 참가자들은 세 데이터셋 모두에서 실제 비디오를 비슷한 비율로 식별했지만, 가짜 DF26 비디오에 대한 정확도는 우연 수준에 가까웠다.
실제 비디오에 대한 성능은 세 데이터셋 모두에서 비슷했으며, DF26은 76.0%, CelebDF++는 75.5%, DeepSpeak v2는 72.8%였다. 차이는 가짜 비디오에서 나타났는데, DF26에서는 정확도가 52.6%로 떨어진 반면, 두 오래된 데이터셋에서는 각각 74.5%와 69.8%였다.
따라서 논문에 따르면, 참가자들은 DF26에 전반적으로 혼란스러워하지는 않았지만, 그 합성 비디오가 가짜임을 나타내는 구체적인 시각적 증거를 찾는 데 어려움을 겪었다.
결론
지난 2년 동안 딥페이크 빈도가 보고된 16배 증가했음에도 불구하고, 악의적인 딥페이크의 실제 상황은 우리 일상 경험에서 거의 찾아볼 수 없으며, 우리가 직접 그 표적이 되는 경우를 제외한다.
성적 딥페이크 피해자들의 경우 이는 전적으로 이해할 수 있습니다 – 하지만 딥페이크가 이제 사기 범죄에 점점 더 큰 영향을 미치고 있기 때문에, 그 자료가 더 많이 공개되어 대중과 공유된다면, 우리 상황을 자동인코더 딥페이크의 ‘황금기’에서 훨씬 더 날카롭고 기만적인 확산 기반 딥페이크 시대로 업데이트하는 데 도움이 될 것입니다.
물론, 새로운 연구의 모델 출력과 다른 모델에 관한 대부분의 자료는 소셜 미디어 플랫폼에서 충분한 맥락 없이 떠오르는데, 그 플랫폼의 관리자는 AI와 실제를 구별하지 못하거나, 그냥 신경 쓰지 않기 때문입니다.
우리가 의심할 수 있는 영상에 적용할 수 있는 또 하나의 지표는 합리적인 신뢰성입니다 – 하지만 이 능력은 개인마다 크게 달라 신뢰하기 어렵습니다. 따라서 기술의 영향과 지속적으로 증가하는 역량에 적응하는 과도기 동안, 우리는 단순히 판단을 미루어야 할지도 모릅니다.
2026년 9월 14일 월요일 최초 게시












