Anderson의 관점

딥페이크 탐지 기반 원본 인간 생체 특征

mm
Unite.AI를 Google의 선호 소스에 추가
Images produced by deepfakers at the DeepFaceLab Discord Channel

이탈리아와 독일의 연구자들이 발표한 새로운 논문에서는 딥페이크 비디오를 탐지하는 방법으로 얼굴과 목소리의 생체 행동을 기반으로 하는 접근 방식을 제안합니다. 이는 얼굴 합성 시스템에서 생성된 아티팩트나 비용이 많이 드는 워터마킹 솔루션, 기타 더 복잡한 접근 방식 대신에 사용됩니다.

이 프레임워크는 주제에 대한 10개 이상의 다양한 비가짜 비디오를 입력으로 요구합니다. 그러나 각 경우에 대해 별도로 훈련, 재훈련 또는 보강할 필요는 없습니다. 이미 모델이 실제와 가짜 비디오 사이의 벡터 거리를 추상화하여 광범위하게 적용할 수 있는 방식으로 통합되어 있습니다.

POI-Forensics 접근 방식은 대조적 학습을 기반으로 합니다. 소스 자료에서 파생된 벡터는 잠재적으로 가짜 비디오의 동일한 벡터와 비교되며, 영상과 오디오 구성 요소 모두에서 추출된 특징과 특성을 사용합니다. 출처: https://arxiv.org/pdf/2204.03083.pdf

POI-Forensics 접근 방식은 대조적 학습을 기반으로 합니다. 소스 자료에서 파생된 벡터는 잠재적으로 가짜 비디오의 동일한 벡터와 비교되며, 영상과 오디오 구성 요소 모두에서 추출된 특징과 특성을 사용합니다. 출처: https://arxiv.org/pdf/2204.03083.pdf

POI-Forensics라는 접근 방식은 실제 개인을 딥페이크하는 데 사용되는 고유한 움직임과 오디오 신호를 기반으로 합니다.

이 시스템은 유명인, 정치인, 유튜브 영향자, 비디오 자료가 많이 있는 사람들을 위한 완전 자동화된 ‘프리렌더링’ 인증 프레임워크를 허용할 수 있습니다. 또한 딥페이크 기술의 일반적인 피해자들이 공격의 부정통을 입증할 수 있는 플랫폼으로 적응될 수 있습니다.

POI-Forensics에서 실제와 가짜 비디오의 추출된 특징의 시각화, t-SNE 프레임워크를 통해 4명의 주제에 대해 수행됩니다.

POI-Forensics에서 실제와 가짜 비디오의 추출된 특징의 시각화, t-SNE 프레임워크를 통해 4명의 주제에 대해 수행됩니다.

저자들은 POI-Forensics가 딥페이크 탐지에서 새로운 최첨단 성과를 달성했다고 주장합니다. 이 분야의 일반적인 데이터셋에서 프레임워크는 각각 높은 품질, 낮은 품질 및 ‘공격’ 비디오에 대해 3%, 10%, 7%의 AUC 점수 향상을 달성했다고 보고합니다. 연구자들은 곧 코드를 공개할 계획입니다.

POI-Forensics의 성능, pDFDC, DeepFakeTIMIT, FakeAVCelebV2, KoDF와 같은 라이벌 SOTA 프레임워크와 비교하여 평가됩니다. 각 경우의 훈련은 FaceForensics++, ID-Reveal 및 저자의 방법을 VoxCeleb2에서 수행했습니다. 결과에는 높은 품질과 낮은 품질의 비디오가 포함됩니다.

POI-Forensics의 성능, pDFDC, DeepFakeTIMIT, FakeAVCelebV2, KoDF와 같은 라이벌 SOTA 프레임워크와 비교하여 평가됩니다. 각 경우의 훈련은 FaceForensics++와 저자의 방법을 VoxCeleb2에서 수행했습니다. 결과에는 높은 품질과 낮은 품질의 비디오가 포함됩니다.

저자들은 다음과 같이 말합니다:

‘훈련은 오로지 실제 대화하는 얼굴 비디오에서 수행되므로, 탐지기는 특정 조작 방법에 의존하지 않으며最高의 일반화 능력을 제공합니다. 또한, 우리의 방법은 단일 모달리티(오디오 전용, 비디오 전용) 및 멀티 모달리티(오디오-비디오) 공격을 모두 탐지할 수 있으며, 높은 수준의 의미 특징을 기반으로 하므로 낮은 품질 또는 손상된 비디오에 강합니다.’

새로운 논문은 2021년에 일부 저자들의 비전 기반 ID-Reveal 프로젝트의 요소를 통합하며, 나폴리의 University of Federico II와 뮌헨 공과 대학 간의 공동 연구입니다.

딥페이크 암흑 경쟁

이러한 탐지 시스템을 물리치기 위해 딥페이크와 인간 합성 시스템은 적어도 시각적 및 오디오 생체 신호를 시뮬레이션할 수 있어야 하며, 이는 수년 후에 가능할 것입니다. 이는 비용이 많이 드는 폐쇄 시스템을 개발하는 VFX 회사에서만 가능하며, 목표 대상의 협력과 참여를 통해 이점을 가질 것입니다.

저자의 이전 접근 방식인 ID-Reveal은 전적으로 시각 정보에 집중했습니다. 출처: https://arxiv.org/pdf/2012.02512.pdf

저자의 이전 접근 방식인 ID-Reveal은 전적으로 시각 정보에 집중했습니다. 출처: https://arxiv.org/pdf/2012.02512.pdf

FaceSwap과 DeepFaceLab/Live와 같은 성공적인 딥페이크 방법은 현재 이러한 세부적인 생체 근사치를 생성할 수 있는 능력이 없습니다. 대신에, 재능 있는 가짜자들에 의존하거나, 가장 유사한 사람들의 야외 촬영 영상을 사용합니다. FaceSwap과 DeepFaceLab의 핵심 코드는 2017년에 개발되었으며, 이 코드는 DFL과 FaceSwap의 상류 소스이며, 이러한 기능을 추가하는 것이 현실적으로 불가능합니다.

이 두 가지 주요 딥페이크 패키지는 오토인코더를 기반으로 합니다. 인간 합성의 대안 방법은 생성적 적대적 네트워크(GAN) 또는 신경 복사 필드(NeRF) 접근 방식을 사용하여 인간 정체성을 재창조할 수 있습니다. 그러나 이러한 연구 방향은 완전히 사진실적 인간 비디오를 생성하기 위해 앞으로 수년의 작업이 필요합니다.

오디오(가짜 목소리)를 제외하고, 생체 시뮬레이션은 인간 이미지 합성에서 직면하는 도전 목록의 매우 아래쪽에 있습니다. 어쨌든, 인간 목소리의 음색과 기타 특성을 재현하는 것은 그 특이성과 ‘말하기’를 재현하는 것을 의미하지 않으며, 실제 주제가 의미적 구성을 사용하는 방식을 재현하는 것도 아닙니다. 따라서 AI 생성 음성 시뮬레이션의 완벽함은 생체 인증의 잠재적인 방화벽을 해결하지 못합니다.

Arxiv에서만, 여러 딥페이크 탐지 전략과 혁신이 매주 발표됩니다. 최근 접근 방식은 음성-얼굴 동질성, 로컬 이진 패턴 히스토그램(FF-LBPH), 오디오 딥페이크에 대한 인간의 인식, 얼굴 경계를 분석, 영상 열화에 대한 계산, 그리고 ‘포렌식 탄도학’을 포함합니다.

히스토그램 분석은 딥페이크 탐지를 개선하기 위한 최신 기술 중 하나입니다. 출처: https://arxiv.org/pdf/2203.09928.pdf

히스토그램 분석은 딥페이크 탐지를 개선하기 위한 최신 기술 중 하나입니다. 출처: https://arxiv.org/pdf/2203.09928.pdf

접근 방식, 데이터 및 아키텍처

POI-Forensics는 다중 모달 접근 방식을 사용하여 시각적 및 오디오 신호를 기반으로 한 소프트 생체 특성을 사용합니다. 프레임워크에는 별도의 오디오 및 비디오 네트워크가 있으며, 궁극적으로 특징 벡터 데이터를 추출하여 잠재적인 딥페이크 비디오에서 추출된 동일한 특징과 비교할 수 있습니다.

POI-Forensics의 아키텍처

POI-Forensics의 개념적 아키텍처.

별도(오디오 또는 비디오) 및 퓨전 분석을 대상 클립에서 수행할 수 있으며, 최종적으로 POI 유사성 지수를 도출할 수 있습니다. 사용된 대조적 손실 함수는 2021년 학술 협력에 기반하며, Google Research, Boston University, Snap Inc. (SNAP ), MIT 간의 협력입니다.

기본 데이터셋은 주제별로 나누어졌습니다. 4608개의 주제를 사용하여 훈련을 수행하고, 512개를 검증에 사용했습니다. FakeAVCelebV2(테스트 후보, 아래 참조)를 사용한 500개의 주제는 편향되지 않은 결과를 얻기 위해 제외되었습니다.

두 네트워크는 12개의 에포크 동안 훈련되었으며, 각 에포크당 2304개의 배치 크기를 사용했습니다. 각 배치는 8×8 비디오 세그먼트로 구성되었습니다. Adam 옵티마이저를 사용하여 학습률 10−4 및 가중치 감소 0.01로 훈련을 수행했습니다.

테스트 및 결과

이 프로젝트에서 테스트된 딥페이크 데이터셋은 프리뷰 DeepFake Detection Challenge 데이터셋을 포함하며, 이는 68명의 주제에 대한 얼굴 스왑을 특징으로 합니다. 여기서 44개의 주제가 9개 이상의 관련 비디오를 갖는 주제로 선택되었습니다. 총 920개의 실제 비디오와 2925개의 가짜 비디오를 사용했습니다. 또한 DeepFake-TIMIT을 사용했습니다. 이는 GAN 기반 데이터셋으로, 32명의 주제에 대한 320개의 비디오를 특징으로 하며, 총 290개의 실제 비디오와 580개의 가짜 비디오(최소 4초 길이)를 사용했습니다. FakeAVCelebV2도 사용되었습니다. 이는 VoxCeleb2에서 500개의 실제 비디오와 다양한 데이터셋에서 약 20,000개의 가짜 비디오를 특징으로 하며, SV2TTS로 호환성을 위해 가짜 클론 오디오를 추가했습니다. 또한 KoDF를 사용했습니다. 이는 FaceSwap, DeepFaceLab, FSGAN을 통해 403개의 주제를 가짜로 만든 한국어 딥페이크 데이터셋입니다. 또한 ATFHP를 통한 오디오 주도 얼굴 합성 및 Wav2Lip의 출력을 특징으로 합니다. (MSFT )

저자들은 POI-Forensics가 라이벌 SOTA 프레임워크인 Seferbekov, FTCN, LipForensics, ID-Reveal과 비교하여 테스트를 수행했습니다. 결과(위의 표 참조)에서 POI-Forensics는 Seferbekov보다 2.5%의 AUC와 1.5%의 정확도에서 우수했습니다. 다른 데이터셋에서 경쟁적인 성능을 보였습니다.

그러나 새로운 접근 방식은 낮은 품질의 비디오에서 모든 참조 방법보다 현저하게 앞섰습니다. 이는 실제 상황에서 딥페이크가 사각시선으로 속일 가능성이 있는 가장 가능성 있는 시나리오입니다.

저자들은 다음과 같이 말합니다:

‘실제로, 이러한 도전적인 시나리오에서, 오로지 정체성 기반 접근 방식만이 좋은 성능을 계속 제공하며, 이는 높은 수준의 의미 특징에 의존하기 때문입니다. 이러한 특징은 이미지 손상에 대해 매우 강합니다.’

PIO-Forensics가 오로지 실제 비디오만을 소스 자료로 사용한다는 점을 고려하면, 이 성과는 더 크게 간주될 수 있으며, 잠재적인 딥페이크 피해자의 원래 생체 특성을 사용하는 것이 앞으로 나아갈 가치 있는 길임을 시사합니다.

마지막 테스트에서, 연구자들은 입력에 적대적 노이즈를 추가했습니다. 이는 분류기를 속일 수 있는 방법입니다. 여전히 효과적인 빠른 그래디언트 부호 방법을 사용했습니다.

적대적 공격 전략은 모든 방법과 데이터셋에서 성공률을 낮추었으며, AUC는 10%에서 38%까지 감소했습니다. 그러나 POI-Forensics와 저자의 이전 방법인 ID-Reveal만이 공격 시나리오에서 합리적인 성능을 유지할 수 있었습니다. 이는 소프트 생체 특성과 관련된 높은 수준의 특징이 딥페이크 탐지 회피에 대해 매우 강하다는 것을 시사합니다.

저자들은 다음과 같이 결론을 내립니다:

‘전반적으로, 우리는 우리의 방법이 첫 번째 발자국이라고 믿습니다. 특히, 높은 수준의 의미 특징을 사용하는 것은 미래 연구를 위한 유망한 방향입니다. 또한, 다중 모달 분석은 다른 도메인에서 더 많은 정보를 포함하여 더 풍부해질 수 있습니다.’

 

最初에 2022년 4월 8일에 게시되었습니다.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai