Anderson의 관점

딥페이크 연구자들이 발견한 딥페이크의 강력한 특성: 장기적인 탐지가 가능할 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

2018년부터 등장하기 시작한 초기 딥페이크 탐지 솔루션 이후, 컴퓨터 비전 및 보안 연구 분야는 딥페이크 비디오의 본질적인 특성을 정의하려고 노력해 왔습니다. 즉, 딥페이크 기술의 개선에 저항할 수 있는 신호를 찾고자 했습니다. 이러한 기술에는 오토인코더 기반의 딥페이크 패키지인 DeepFaceLab과 FaceSwap, 그리고 생성적 적대적 신경망(GAN)을 사용하여 인간의 얼굴을 재창조, 시뮬레이션 또는 변경하는 것이 포함됩니다.

딥페이크의 ‘특징’ 중 많은 것이, 깜빡임의 부족과 같은 것들이, 딥페이크의 개선으로 인해 쓸모없게 되었습니다. 디지털 증명 기술을 사용하는 것, 예를 들어 Adobe가 주도하는 콘텐츠 인증 이니셔티브와 같은 것, 또는 블록체인 접근 방식 및 잠재적인 소스 이미지의 디지털 워터마크는, 인터넷에 있는 기존 소스 이미지의 대부분에 대한 대규모 및 비싼 변경을 필요로 하거나, 시스템의 감시 및 인증을 생성하기 위해 국가 및 정부 간의 주목할만한 협력적인 노력을 필요로 할 것입니다.

따라서 이미지 및 비디오 콘텐츠에서 변경, 발명 또는 身分 교환된 인간의 얼굴을 특징으로 하는真正로 본질적인 특성을 발견하는 것이 매우 유용할 것입니다. 이는 대규모 검증, 암호화 자산 해싱, 컨텍스트 확인, 가능성 평가, 아티팩트 중심의 탐지 루틴 또는 기타 번거로운 딥페이크 탐지 접근 방식 없이 직접 가짜 비디오에서 추론할 수 있는 특성입니다.

프레임 안의 딥페이크

중국과 호주 간의 새로운 연구 협력은 이러한 ‘성배’를 정규성 교란의 형태로 발견했다고 믿습니다.

연구자들은 실제 비디오의 공간적 무결성과 시간적 연속성을 딥페이크 콘텐츠를 포함하는 비디오와 비교하는 방법을 개발했으며, 어떤 종류의 딥페이크 간섭도 이미지의 정규성을 교란한다는 것을 발견했습니다. 이는 부분적으로 딥페이크 프로세스가 대상 비디오를 프레임으로 분해하고 각 프레임(대체)에 훈련된 딥페이크 모델의 영향을 적용하기 때문입니다.

인기 있는 딥페이크 배포는 애니메이터와 같은 방식으로 작동하여 각 프레임의 인증성보다 비디오의 전반적인 공간적 무결성과 시간적 연속성에 더 많은 주목을 기울입니다.

논문에서: A) 데이터 유형 간의 차이. 여기서 우리는 p-가짜의 교란이 딥페이크와 같은 방식으로 이미지의 시공간적 품질을 변경한다는 것을 볼 수 있습니다. B) 세 가지 유형의 데이터에 대한 노이즈 분석. p-가짜가 딥페이크 교란을 모방하는 방식을 보여줍니다. C) 세 가지 유형의 데이터에 대한 시간적 시각화. 실제 데이터는 더 큰 무결성을 보여줍니다. D) 실제, 가짜, p-가짜 비디오에 대한 추출된 특징의 T-SNE 시각화. 출처: https://arxiv.org/pdf/2207.10402.pdf

논문에서: A) 데이터 유형 간의 차이. 여기서 우리는 p-가짜의 교란이 딥페이크와 같은 방식으로 이미지의 시공간적 품질을 변경한다는 것을 볼 수 있습니다. B) 세 가지 유형의 데이터에 대한 노이즈 분석. p-가짜가 딥페이크 교란을 모방하는 방식을 보여줍니다. C) 세 가지 유형의 데이터에 대한 시간적 시각화. 실제 데이터는 더 큰 무결성을 보여줍니다. D) 실제, 가짜, p-가짜 비디오에 대한 추출된 특징의 T-SNE 시각화. 출처: https://arxiv.org/pdf/2207.10402.pdf

이것은 원본 녹음이 진행 중이거나 처리되는 경우 비디오 코덱이 프레임 시리즈를 처리하는 방식과 다릅니다. 파일 크기를 절약하거나 비디오를 스트리밍에 적합하게 만들기 위해 비디오 코덱은 엄청난 양의 정보를 폐기합니다. 심지어 최고 품질 설정에서도 코덱은 사용자가 설정할 수 있는 변수인 키 프레임을 할당합니다. 이는 비디오의 간격에서 발생하는 완전히 압축되지 않은 이미지입니다.

키 프레임 사이의 간격 프레임은 어느 정도 키 프레임의 변형으로 추정되며, 가능한 한 많은 정보를 인접한 키 프레임에서 재사용합니다. 이는 완전히 독립적인 프레임이 아닌 키 프레임에서 파생된 것입니다.

왼쪽에 완전한 키 프레임 또는 'i-프레임'이 압축된 비디오에 저장되어 있으며, 파일 크기에는 일부 비용이 발생합니다. 오른쪽에 간격 '델타 프레임'은 더 데이터가 풍부한 키 프레임의 해당 부분을 재사용합니다. 출처: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

왼쪽에 완전한 키 프레임 또는 ‘i-프레임’이 압축된 비디오에 저장되어 있으며, 파일 크기에는 일부 비용이 발생합니다. 오른쪽에 간격 ‘델타 프레임’은 더 데이터가 풍부한 키 프레임의 해당 부분을 재사용합니다. 출처: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

이 방식으로, 블록(키 프레임 설정에 따라 프레임 수를 포함하는)은 전형적인 압축된 비디오에서 고려되는 가장 작은 단위라고 주장할 수 있습니다. 키 프레임 자체, 즉 i-프레임도 이 단위의 일부입니다.

전통적인 카툰 애니메이션의 관점에서, 코덱은 인터프리팅을 수행하고 있으며, 키 프레임은 간격, 파생된 프레임인 델타 프레임을 위한 텐트폴로 작동합니다.

반면에, 딥페이크 오버레이는 각 프레임에 엄청난 주목과 자원을 할애하며, 프레임의 더 넓은 컨텍스트나 압축 및 블록 기반 인코딩이 실제 비디오의 특성을 어떻게影响하는지 고려하지 않습니다.

진짜 비디오의 시간적 품질(왼쪽)과 딥페이크로 교란된 동일한 비디오(오른쪽) 사이의 불연속성에 대한 자세한 보기.

진짜 비디오의 시간적 품질(왼쪽)과 딥페이크로 교란된 동일한 비디오(오른쪽) 사이의 불연속성에 대한 자세한 보기.

일부 좋은 딥페이크는 After Effects와 같은 패키지에서 광범위한 후처리를 사용하며, DeepFaceLab 배포에는 일부 네이티브 기능이 있습니다. 즉, 모션 블러와 같은 ‘블렌딩’ 절차를 적용할 수 있습니다. 그러나 이러한 속임수는 실제 및 딥페이크 비디오 사이의 공간적 및 시간적 품질의 불일치를 영향을 미치지 않습니다.

새로운 논문스파티오테мп럴 정규성 교란에 의한 딥페이크 탐지라는 제목으로, 청화대, 바이두(중국)사의 VIS 컴퓨터 비전 기술 부문, 멜버른 대학교의 연구자들로부터 나왔습니다.

‘가짜’ 가짜 비디오

이 논문의 연구자들은 연구의 기능을 Pseudo-fake Generator(P-가짜 생성기)라는 플러그 앤 플레이 모듈로 통합했습니다. 이는 실제 비디오를 딥페이크와 같은 방식으로 교란시켜 가짜 딥페이크 비디오를 생성합니다.

테스트에 따르면 이 모듈은 거의 자원 비용 없이 모든 기존 딥페이크 탐지 시스템에 추가할 수 있으며, 그들의 성능을 크게 향상시킵니다.

이 발견은 딥페이크 탐지 연구에서 다른 걸림돌을 해결하는 데 도움이 될 수 있습니다. 즉, 실제 및 최신 데이터셋의 부족입니다. 딥페이크 생성은 복잡하고 시간이 많이 걸리는 프로세스이므로, 이 커뮤니티는 지난 5년 동안 여러 딥페이크 데이터셋을 개발했으며, 많은 데이터셋이 오래되었습니다.

비디오가 변경된 후에 발생하는 정규성 교란을 딥페이크와 무관한 신호로 분리함으로써, 이 새로운 방법은 이 특성을 중심으로 하는 샘플 및 데이터셋 비디오를 무제한으로 생성할 수 있습니다.

STE 블록 개요. 채널별 시간적 합성곱을 사용하여 시공간적으로 향상된 인코딩을 생성하는 자극으로, 심지어 매우 설득력 있는 딥페이크에서도 동일한 서명을 생성합니다. 이 방법을 사용하여 딥페이크 스타일의 변경된 비디오와 동일한 서명 특성을 갖는 '가짜' 가짜 비디오를 생성할 수 있습니다.

STE 블록 개요. 채널별 시간적 합성곱을 사용하여 시공간적으로 향상된 인코딩을 생성하는 자극으로, 심지어 매우 설득력 있는 딥페이크에서도 동일한 서명을 생성합니다. 이 방법을 사용하여 딥페이크 스타일의 변경된 비디오와 동일한 서명 특성을 갖는 ‘가짜’ 가짜 비디오를 생성할 수 있습니다.

테스트

연구자들은 딥페이크 탐지 연구에서 사용되는 6개의 유명한 데이터셋에 대한 실험을 수행했습니다. FaceForensics++(FF++); WildDeepFake; 딥페이크 탐지 챌린지 미리 보기(DFDCP); Celeb-DF; 딥페이크 탐지(DFD); 및 Face Shifter(FSh).

FF++의 경우, 연구자들은 원래 데이터셋에서 모델을 훈련시키고 각 4개의 하위 집합을 개별적으로 테스트했습니다. 훈련에 딥페이크 자료를 사용하지 않아도, 새로운 방법은 최고의 결과를 달성했습니다.

이 방법은 또한 FF++ C23 압축 데이터셋에서 최고의 성능을 보였습니다. 이는 실제 딥페이크 시청 환경에서 신뢰할 수 있는 압축 아티팩트를 특징으로 하는 예제를 제공합니다.

저자들은 다음과 같이 말합니다:

‘FF++ 내의 성능은 우리의 주요 아이디어의 타당성을 검증하며, 일반화 가능성은 현존하는 딥페이크 탐지 방법의 주요 문제입니다. 이는 테스트에서 보이지 않는 기술로 생성된 딥페이크의 경우 성능이 보장되지 않기 때문입니다.’

‘또한 탐지기와 위조자 사이의 기술 전쟁을 고려하면, 일반화 가능성은 실제 세계에서 탐지 방법의 효과성을 측정하는 중요한 기준입니다.’

연구자들은 ‘로버스트니스’를 테스트하는 여러 하위 테스트(세부 사항은 논문 참조)를 수행했으며, 입력 비디오의 유형을 변경했습니다(예: 실제, 가짜, p-가짜 등). 그러나 가장 흥미로운 결과는 크로스 데이터셋 성능 테스트에서 나왔습니다.

이 테스트에서, 저자들은 모델을 FF++의 ‘실제 세계’ C23 버전에서 훈련시키고, 이 모델을 4개의 다른 데이터셋에 테스트하여, 모든 데이터셋에서 우수한 성능을 보였습니다.

크로스 데이터셋 챌린지의 결과. 논문에서는 SBI가 유사한 접근 방식을 사용하고 있지만, p-가짜가 시공간적 정규성 교란에서 더 나은 성능을 보인다고 주장합니다.

크로스 데이터셋 챌린지의 결과. 논문에서는 SBI가 유사한 접근 방식을 사용하고 있지만, p-가짜가 시공간적 정규성 교란에서 더 나은 성능을 보인다고 주장합니다.

논문은 다음과 같이 말합니다:

‘가장 어려운 Deepwild에서, 우리의 방법은 AUC% 기준으로 SOTA 방법보다 약 10 퍼센트 포인트를 상회합니다. 우리는 이것이 Deepwild의 딥페이크 다양성으로 인해 다른 방법들이 잘 일반화되지 않는다는 사실에 기인한다고 생각합니다.’

테스트에 사용된 지표는 정확도 점수(Acc), 수신자 운영 특성 곡선 아래 영역(AUC), 및 동등 오류율(EER)입니다.

반격?

미디어는 딥페이크 개발자와 딥페이크 탐지 연구자 간의 긴장을 기술 전쟁으로 묘사하지만, 전자는 단순히 더 설득력 있는 출력을 만들려고 하고, 증가한 딥페이크 탐지 어려움은 이러한 노력의 우연한 부산물일 수 있습니다.

개발자가 이 새로운 약점을 해결하려고 시도할지 여부는, 정규성 교란이 딥페이크 비디오에서 맨눈으로 볼 수 있는 부정통성의 징조로 인식될 수 있으며, 따라서 이를 해결하는 것이 순수한 질적 관점에서 가치가 있다고 느끼는가에 달려 있습니다.

첫 번째 딥페이크가 온라인에 등장한 지 5년이 지난 지금, 딥페이킹은 여전히 tương对적으로 초기 기술이며, 이 커뮤니티는 세부 사항 및 해상도보다 올바른 컨텍스트 또는 압축된 비디오의 서명을 일치시키는 것에 더 관심이 있습니다. 이는 출력의 ‘저하’를 필요로 하는데, 이는 딥페이크 커뮤니티가 현재 맞서고 있는 바로 그것입니다.

그곳에서 정기적 교란이 부정통성에 영향을 미치지 않는다는 것이 일반적인 합의로 나타난다면, 이를 보상하기 위해 노력할 수 없습니다. 즉, 일부 후처리 또는 아키텍처 절차에 의해 ‘취소’될 수 있지만, 이는 아직 명확하지 않습니다.

 

最初에 2022년 7월 22日に 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai