Anderson의 관점

작은 nhưng 중요한 AI 편집을 실제 비디오에서 노출시키는 방법

mm
Unite.AI를 Google의 선호 소스에 추가
Montage of illustrations from the paper 'Detecting Localized Deepfake Manipulations Using Action Unit-Guided Video Representations' (https://arxiv.org/pdf/2503.22121)

2019년, 미국 하원 의장 낸시 펠로시는 대상이 된 저기술적인 딥페이크 스타일의 공격을 받았는데, 실제 비디오를 편집하여彼女가 취한 것으로 보이게 만들었다. 이 비현실적인 사건은 몇 백만 번 공유되기 전에 진실이 밝혀졌고, 일부 사람들은 이 사건으로 인해 정치 자본에 손상을 입혔다.

이 왜곡은 단순한 오디오-비주얼 편집만으로도 가능했지만, 실제 오디오-비주얼 출력의 미묘한 변경이 어떻게 파괴적인 영향을 미칠 수 있는지 보여주는 중요한 예이다.

당시, 딥페이크 장면은 2017년 말에 등장한 오토인코더 기반의 얼굴 교체 시스템에 의해 지배되고 있었으며, 그 이후로 품질이 크게 개선되지 않았다. 이러한 초기 시스템은 이러한 종류의 작은 nhưng 중요한 변경을 만들거나 현대적인 연구 주제를 현실적으로 추구하는 것이 어려웠을 것이다.

최근 'Neural Emotion Director' 프레임워크는 유명한 얼굴의 기분을 변경한다. 출처: https://www.youtube.com/watch?v=Li6W8pRDMJQ

2022년 ‘Neural Emotion Director’ 프레임워크는 유명한 얼굴의 기분을 변경한다. 출처: https://www.youtube.com/watch?v=Li6W8pRDMJQ

그러나 상황은 지금 다르다. 영화와 텔레비전 산업은 기계 학습 접근 방식을 사용하여 실제 성능을 후반 작업에서 변경하는 데 관심을 가지고 있으며, AI의 후반 작업에서의 완벽주의는 최근 비판을 받았다.

이러한 수요를 예상하거나 만들어내는 것으로, 이미지 및 비디오 합성 연구 장면은 실제 얼굴 캡처의 ‘로컬 편집’을 제공하는 다양한 프로젝트를 내놓았다. 이러한 프로젝트에는 Diffusion Video Autoencoders, Stitch it in Time, ChatFace, MagicFace, DISCO 등이 있다.

2025년 1월 프로젝트 MagicFace의 표현 편집.

2025년 1월 프로젝트 MagicFace의 표현 편집. 출처: https://arxiv.org/pdf/2501.02260

새로운 얼굴, 새로운 주름

그러나 이러한 기술을 개발하는 속도는 그들을 감지하는 방법보다 훨씬 빠르다. 거의 모든 딥페이크 감지 방법은 과거의 딥페이크 방법을 추적하고 있으며,昨日の 데이터셋을 사용하고 있다. 이번 주까지, 이러한 방법 중 어느 것도 AI 시스템이 비디오에서 작은 및 국지적인 변경을 만들 수 있는 잠재력을 해결하지 못했다.

그러나 새로운 논문은 이러한 문제를 해결했다. 이 시스템은 AI 기반 기술을 사용하여 편집된 얼굴을 식별하는 것을 목표로 한다.

딥페이크의 미묘한 로컬 편집 감지: 실제 비디오를 변경하여 미묘한 변경 사항을 가진 가짜를 생성한다(여기에서는 단일 프레임으로 표시됨).

딥페이크의 미묘한 로컬 편집 감지: 실제 비디오를 변경하여 미묘한 변경 사항을 가진 가짜를 생성한다. 출처: https://arxiv.org/pdf/2503.22121

저자들의 시스템은 미묘한 국지적인 얼굴 조작을 포함하는 딥페이크를 식별하는 것을 목표로 한다. 전역적 불일치 또는 身分 불일치에 초점을 맞추지 않고, 이 접근 방식은 미묘한 변경 사항에 초점을 맞춘다.

이 방법은 Facial Action Coding System(FACS)의 Action Units(AUs) 구분자를 사용한다. FACS는 64개의 가능한 개별 변경 가능한 얼굴 영역을 정의한다.

FACS의 일부 구성 64개의 표현 부분.

FACS의 일부 구성 64개의 표현 부분. 출처: https://www.cs.cmu.edu/~face/facs.htm

저자들은 다양한 최근 편집 방법에 대해 접근 방식을 평가하고, 이전 데이터셋과 최신 공격 벡터 모두에서 일관된 성능 개선을 보고한다.

방법

새로운 방법은 VideoMAE와 같은 접근 방식과 일치한다. 이 방법은 비디오에 얼굴 감지를 적용하고, 얼굴을 중심으로 한 프레임을 추출한다. 이러한 프레임은 작은 3D 구획으로 나누어지며, 각 구획은 국지적인 공간 및 시간적 세부를 캡처한다.

새로운 방법의 스키마.

새로운 방법의 스키마.

각 구획에는 고정된 크기의 픽셀 창이 포함된다. 이로 인해 모델은 짧은 기간 동안의 동작과 표현 변경을 학습할 수 있다.

구획은 임베딩되고 위치적으로 인코딩된 다음, 실제와 가짜를 구별하는 기능을 추출하기 위한 인코더에 입력된다.

전제 작업

첫 번째 표현은 마스킹된 오토인코딩 작업으로 훈련된 인코더이다. 비디오를 3D 구획으로 나누고, 대부분의 구획을 숨긴 다음, 인코더는 숨겨진 부분을 재구성하도록 강제한다. 이를 통해 모델은 중요한 공간 및 시간적 패턴을 캡처할 수 있다.

전제 작업 훈련.

전제 작업 훈련.

두 번째 인코더는 얼굴 동작 단위를 감지하도록 훈련된다. 이를 위해 모델은 각 프레임에 대한 밀도 있는 동작 단위 맵을 재구성하도록 강제한다.

두 인코더가 모두 사전 훈련된 후, 크로스 어텐션을 사용하여 출력을 결합한다. 동작 단위 기반 특징은 모델이 어디에 주의를 기울여야 하는지 지시한다.

데이터 및 테스트

구현

저자들은 FaceXZoo 프레임워크를 사용하여 입력 비디오를 전처리하고, 각 클립에서 16개의 얼굴 중심 프레임을 얻었다.

전제 작업은 CelebV-HQ 데이터셋을 사용하여 훈련되었다. 이 데이터셋에는 35,000개의 고화질 얼굴 비디오가 포함되어 있다.

새로운 프로젝트에서 사용된 CelebV-HQ 데이터셋의 예시.

새로운 프로젝트에서 사용된 CelebV-HQ 데이터셋의 예시. 출처: https://arxiv.org/pdf/2207.12393

데이터의 절반은 마스킹되었으며, 시스템이 소스 데이터에 과적합되지 않도록 일반적인 원칙을 학습하도록 강제한다.

마스킹된 프레임 재구성 작업에 대해서는 L1 손실을 사용하여 모델을 훈련시켰다.

두 번째 작업에서는 모델을 16개의 얼굴 동작 단위를 감지하도록 훈련시켰다.

사전 훈련 후, 두 인코더를 융합하고 딥페이크 감지에 대한 미세 조정을 수행했다.

테스트

저자들은 다양한 딥페이크 감지 방법과 비교하여 평가를 수행했다.

테스트는 국지적으로 편집된 딥페이크에 중점을 두었다.

저자들은 다양한 편집 방법을 사용하여 50개의 비디오를 생성하고, 모델의 강력한 일반화를 검증했다.

구체적인 평가 지표로는 AUC, 평균 정밀도, 평균 F1 점수가 사용되었다.

최근의 국지적인 딥페이크에 대한 비교.

최근의 국지적인 딥페이크에 대한 비교.

저자들은 또한 실제 비디오를 변경하여 가짜를 생성하고, 평균 가짜 감지 점수를 보여주는 시각적 감지 비교를 제공했다.

실제 비디오를 변경하여 가짜를 생성하고, 평균 가짜 감지 점수를 보여주는 시각적 감지 비교.

실제 비디오를 변경하여 가짜를 생성하고, 평균 가짜 감지 점수를 보여주는 시각적 감지 비교.

저자들은 기존의 감지 방법이 최근의 딥페이크 생성 방법에 대해 성능이 떨어진다고 주장한다.

반면에, 저자들의 방법은 강력한 일반화를 보여주며, AUC가 87-93%의 범위에 있다.

결론

AI 조작은 전통적으로 딥페이크의 개념으로 공공의식에 존재한다. 그러나 이러한 개념은 점차적으로 발전하고 있다.

따라서 이러한 종류의 로컬 편집이 공공의 관심을 끌기까지는 펠로시 스타일의 결정적인 사건이 발생할 때까지 기다려야 할 것이다.

그러나 우리는 이러한 종류의 ‘미묘한’ 비디오 조정을 인식해야 한다. 우리는 매우 작은 얼굴 표정의 변화를 감지하는 데 매우 민감하며, 맥락은 작은 얼굴 움직임의 영향을 크게 변경할 수 있다.

첫 번째로 게시된 날: 2025년 4월 2일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai