Anderson의 관점
작은 nhưng 중요한 AI 편집을 실제 비디오에서 노출시키는 방법

2019년, 미국 하원 의장 낸시 펠로시는 대상이 된 저기술적인 딥페이크 스타일의 공격을 받았는데, 실제 비디오를 편집하여彼女가 취한 것으로 보이게 만들었다. 이 비현실적인 사건은 몇 백만 번 공유되기 전에 진실이 밝혀졌고, 일부 사람들은 이 사건으로 인해 정치 자본에 손상을 입혔다.
이 왜곡은 단순한 오디오-비주얼 편집만으로도 가능했지만, 실제 오디오-비주얼 출력의 미묘한 변경이 어떻게 파괴적인 영향을 미칠 수 있는지 보여주는 중요한 예이다.
당시, 딥페이크 장면은 2017년 말에 등장한 오토인코더 기반의 얼굴 교체 시스템에 의해 지배되고 있었으며, 그 이후로 품질이 크게 개선되지 않았다. 이러한 초기 시스템은 이러한 종류의 작은 nhưng 중요한 변경을 만들거나 현대적인 연구 주제를 현실적으로 추구하는 것이 어려웠을 것이다.

2022년 ‘Neural Emotion Director’ 프레임워크는 유명한 얼굴의 기분을 변경한다. 출처: https://www.youtube.com/watch?v=Li6W8pRDMJQ
그러나 상황은 지금 다르다. 영화와 텔레비전 산업은 기계 학습 접근 방식을 사용하여 실제 성능을 후반 작업에서 변경하는 데 관심을 가지고 있으며, AI의 후반 작업에서의 완벽주의는 최근 비판을 받았다.
이러한 수요를 예상하거나 만들어내는 것으로, 이미지 및 비디오 합성 연구 장면은 실제 얼굴 캡처의 ‘로컬 편집’을 제공하는 다양한 프로젝트를 내놓았다. 이러한 프로젝트에는 Diffusion Video Autoencoders, Stitch it in Time, ChatFace, MagicFace, DISCO 등이 있다.

2025년 1월 프로젝트 MagicFace의 표현 편집. 출처: https://arxiv.org/pdf/2501.02260
새로운 얼굴, 새로운 주름
그러나 이러한 기술을 개발하는 속도는 그들을 감지하는 방법보다 훨씬 빠르다. 거의 모든 딥페이크 감지 방법은 과거의 딥페이크 방법을 추적하고 있으며,昨日の 데이터셋을 사용하고 있다. 이번 주까지, 이러한 방법 중 어느 것도 AI 시스템이 비디오에서 작은 및 국지적인 변경을 만들 수 있는 잠재력을 해결하지 못했다.
그러나 새로운 논문은 이러한 문제를 해결했다. 이 시스템은 AI 기반 기술을 사용하여 편집된 얼굴을 식별하는 것을 목표로 한다.

딥페이크의 미묘한 로컬 편집 감지: 실제 비디오를 변경하여 미묘한 변경 사항을 가진 가짜를 생성한다. 출처: https://arxiv.org/pdf/2503.22121
저자들의 시스템은 미묘한 국지적인 얼굴 조작을 포함하는 딥페이크를 식별하는 것을 목표로 한다. 전역적 불일치 또는 身分 불일치에 초점을 맞추지 않고, 이 접근 방식은 미묘한 변경 사항에 초점을 맞춘다.
이 방법은 Facial Action Coding System(FACS)의 Action Units(AUs) 구분자를 사용한다. FACS는 64개의 가능한 개별 변경 가능한 얼굴 영역을 정의한다.

FACS의 일부 구성 64개의 표현 부분. 출처: https://www.cs.cmu.edu/~face/facs.htm
저자들은 다양한 최근 편집 방법에 대해 접근 방식을 평가하고, 이전 데이터셋과 최신 공격 벡터 모두에서 일관된 성능 개선을 보고한다.
방법
새로운 방법은 VideoMAE와 같은 접근 방식과 일치한다. 이 방법은 비디오에 얼굴 감지를 적용하고, 얼굴을 중심으로 한 프레임을 추출한다. 이러한 프레임은 작은 3D 구획으로 나누어지며, 각 구획은 국지적인 공간 및 시간적 세부를 캡처한다.

새로운 방법의 스키마.
각 구획에는 고정된 크기의 픽셀 창이 포함된다. 이로 인해 모델은 짧은 기간 동안의 동작과 표현 변경을 학습할 수 있다.
구획은 임베딩되고 위치적으로 인코딩된 다음, 실제와 가짜를 구별하는 기능을 추출하기 위한 인코더에 입력된다.
전제 작업
첫 번째 표현은 마스킹된 오토인코딩 작업으로 훈련된 인코더이다. 비디오를 3D 구획으로 나누고, 대부분의 구획을 숨긴 다음, 인코더는 숨겨진 부분을 재구성하도록 강제한다. 이를 통해 모델은 중요한 공간 및 시간적 패턴을 캡처할 수 있다.

전제 작업 훈련.
두 번째 인코더는 얼굴 동작 단위를 감지하도록 훈련된다. 이를 위해 모델은 각 프레임에 대한 밀도 있는 동작 단위 맵을 재구성하도록 강제한다.
두 인코더가 모두 사전 훈련된 후, 크로스 어텐션을 사용하여 출력을 결합한다. 동작 단위 기반 특징은 모델이 어디에 주의를 기울여야 하는지 지시한다.
데이터 및 테스트
구현
저자들은 FaceXZoo 프레임워크를 사용하여 입력 비디오를 전처리하고, 각 클립에서 16개의 얼굴 중심 프레임을 얻었다.
전제 작업은 CelebV-HQ 데이터셋을 사용하여 훈련되었다. 이 데이터셋에는 35,000개의 고화질 얼굴 비디오가 포함되어 있다.

새로운 프로젝트에서 사용된 CelebV-HQ 데이터셋의 예시. 출처: https://arxiv.org/pdf/2207.12393
데이터의 절반은 마스킹되었으며, 시스템이 소스 데이터에 과적합되지 않도록 일반적인 원칙을 학습하도록 강제한다.
마스킹된 프레임 재구성 작업에 대해서는 L1 손실을 사용하여 모델을 훈련시켰다.
두 번째 작업에서는 모델을 16개의 얼굴 동작 단위를 감지하도록 훈련시켰다.
사전 훈련 후, 두 인코더를 융합하고 딥페이크 감지에 대한 미세 조정을 수행했다.
테스트
저자들은 다양한 딥페이크 감지 방법과 비교하여 평가를 수행했다.
테스트는 국지적으로 편집된 딥페이크에 중점을 두었다.
저자들은 다양한 편집 방법을 사용하여 50개의 비디오를 생성하고, 모델의 강력한 일반화를 검증했다.
구체적인 평가 지표로는 AUC, 평균 정밀도, 평균 F1 점수가 사용되었다.

최근의 국지적인 딥페이크에 대한 비교.
저자들은 또한 실제 비디오를 변경하여 가짜를 생성하고, 평균 가짜 감지 점수를 보여주는 시각적 감지 비교를 제공했다.

실제 비디오를 변경하여 가짜를 생성하고, 평균 가짜 감지 점수를 보여주는 시각적 감지 비교.
저자들은 기존의 감지 방법이 최근의 딥페이크 생성 방법에 대해 성능이 떨어진다고 주장한다.
반면에, 저자들의 방법은 강력한 일반화를 보여주며, AUC가 87-93%의 범위에 있다.
확장된 평가 결과
연구진은 국소 조작의 범위를 넓히기 위해 눈 크기, 눈과 눈썹 사이 거리, 코 비율, 코와 입 사이 거리, 입술 비율, 볼 비율을 바꾸었다. 표정 속성은 미소, 분노, 혐오, 슬픔으로 변형했다. 각 편집 방법마다 50개 영상을 만들었고, Celeb-DFv2(CDF2), DeepFake Detection(DFD), DeepFake Detection Challenge(DFDC), WildDeepfake(DFW) 같은 기존 데이터셋도 평가에 포함했다.
평가 지표는 곡선 아래 면적(AUC), 평균 정밀도(AP), 평균 F1 점수였다. 최신 국소 딥페이크 비교에서 제안 방법은 차선의 접근법보다 AUC와 평균 정밀도가 각각 15~20% 높았다. 실제 영상에 세 가지 국소 조작을 적용한 시각적 비교에서도 기존 탐지기는 미세한 변화를 놓친 반면 새 모델은 일관되게 높은 가짜 확률을 부여했다.
LAANet, SBI, AltFreezing, CADMM 같은 기존 최신 탐지 방법은 새로운 생성 방식에서 성능이 크게 떨어져 AUC가 48~71%에 머물렀다. 제안 방법은 87~93% AUC를 달성했고 평균 정밀도에서도 같은 경향을 보였다. 전통적 딥페이크 데이터셋에서도 90%가 넘는 AUC를 유지해 최근 탐지 모델과 경쟁력 있는 결과를 냈다.
국소 편집 탐지의 신뢰도는 90%를 넘은 반면, 동일 작업에서 기존 방법은 50% 아래였다. 저자들은 이 격차가 새 접근법의 민감도와 일반화 능력을 보여주는 동시에, 현재 기술이 작은 얼굴 조작을 처리하는 데 얼마나 어려움을 겪는지 드러낸다고 설명한다.
실제 환경의 안정성을 평가하기 위해 CADMM 절차에 따라 채도와 대비 조정, 가우시안 블러, 픽셀화, 블록 기반 압축 아티팩트, 추가 노이즈가 적용된 영상도 시험했다. 탐지 정확도는 대부분의 왜곡에서 대체로 안정적이었다. 가우시안 노이즈에서만 비교적 작은 성능 저하가 나타났고, 다른 변형의 영향은 미미했다. 이는 일반적인 영상 품질 저하가 국소 조작 탐지를 쉽게 무너뜨리지 않음을 시사한다.
복원된 연구 도표





자료와 참조 링크
- shared several million times
- autoencoder-based
- expression editing
- seriously interested
- come under recent criticism
- Diffusion Video Autoencoders
- Stitch it in Time
- ChatFace
- MagicFace
- DISCO
- yesterday's datasets
- Facial Action Coding System
- new paper
- VideoMAE
- patches
- positionally encoded
- cross-attention
- feature space
- FaceXZoo
- CelebV-HQ
- overfitting
- L1 loss
- FaceForensics++
- class imbalance
- Focal Loss
- cross-entropy loss
- batch size
- epochs
- pre-trained
- FTCN
- RealForensics
- Lip Forensics
- EfficientNet+ViT
- Face X-Ray
- Alt-Freezing
- CADMM
- LAANet
- SBI
- Disentangled Face Editing
- Tokenflow
- VideoP2P
- Text2Live
- FateZero
- Celeb-DFv2
- DeepFake Detection
- DeepFake Detection Challenge
- WildDeepfake
- Area Under Curve
- Average Precision
- F1 Score
- video deepfakes
- video deepfake fraud
- expressed consistent concern
결론
대중은 AI 조작을 주로 한 사람의 신원을 다른 사람의 몸에 입히는 전통적 딥페이크로 인식한다. 그러나 생성형 영상 시스템과 잠재 확산 모델은 얼굴 전체를 바꾸지 않고도 표정이나 작은 움직임만 수정해 의미와 맥락을 바꿀 수 있다. 이런 국소 편집은 대형 사건이 발생하기 전까지 널리 주목받지 못할 수 있다. 대중의 관심이 더 눈에 띄는 딥페이크 사기에 집중되어 있기 때문이다.
배우 Nic Cage가 후반 제작 과정에서 연기가 사후에 ‘수정’될 가능성을 지속적으로 우려해 온 것처럼, 미세한 영상 조정에도 더 큰 인식이 필요하다. 사람은 얼굴 표정의 아주 작은 변화에도 민감하며, 맥락에 따라 작은 움직임의 효과는 크게 달라진다. 장례식에서 살짝 웃는 표정만으로도 장면의 의미가 완전히 바뀔 수 있다는 점이 한 예다.
2025년 4월 2일 수요일 최초 게재.












