Anderson의 관점

딥페이크 비디오의 충실도와 현실성

mm
Unite.AI를 Google의 선호 소스에 추가

모든 딥페이크 실무자는 동일한 목표를 공유하지 않는다. 이미지 합성 연구 분야의 주도적인 지지자들, 즉 Adobe, NVIDIA, 및 Facebook는 기계 학습 기술이 궁극적으로 높은 해상도와 가장 어려운 조건에서 인간의 활동을 재현하거나 합성할 수 있도록 기술의 상태를 발전시키는 것을 목표로 한다(충실도).

반면, 딥페이크 기술을 사용하여 잘못된 정보를 퍼뜨리고자 하는 사람들의 목표는 단순히 딥페이크된 얼굴의 진실성만을 위한 것이 아니다. 이 시나리오에서는, 맥락과 신뢰성과 같은 부수적인 요소들이 비디오가 얼굴을 시뮬레이션하는 잠재력과 거의 동일한 중요성을 갖는다(현실성).

이 ‘손기술’ 접근법은 딥페이크 비디오의 최종 이미지 품질의 열화로 확장된다. 따라서 전체 비디오(딥페이크된 얼굴을 나타내는 기만적인 부분만이 아니라)가 일관된 ‘외관’을 가지도록 하여, 미디어의 기대되는 품질과 일치한다.

‘일관된’이라는 것은 반드시 ‘좋은’ 것을 의미하지는 않는다. 원본과 삽입된, 조작된 내용이 일관되게 유지되고, 기대되는 품질에 부합하는 것으로 충분하다. VOIP 스트리밍 출력의 경우, 예를 들어 Skype와 Zoom과 같은 플랫폼에서 품질의 기준은remarkably 낮을 수 있다. 여기에는 중단, 거친 비디오, 다양한 압축 아티팩트, serta ‘스무딩’ 알고리즘 등이 포함될 수 있다. 이러한 알고리즘은 효과를 줄이기 위해 설계되었지만, 본 thân으로도 추가적인 ‘부정확한’ 효과를 구성한다. 우리는 이러한 효과를 라이브 스트리밍의 제약과 특이성의 산물로 받아들이고 있다.

DeepFaceLive 작동 중: 프리미어 딥페이크 소프트웨어인 DeepFaceLab의 이 스트리밍 버전은 제한된 비디오 품질, 재생 문제 및 기타 재생 연결 아티팩트와 함께 가짜를 제공함으로써 맥락적 현실성을 제공할 수 있다. 출처: https://www.youtube.com/watch?v=IL517EgYH8U

DeepFaceLive 작동 중: 프리미어 딥페이크 소프트웨어인 DeepFaceLab의 이 스트리밍 버전은 제한된 비디오 품질, 재생 문제 및 기타 재생 연결 아티팩트와 함께 가짜를 제공함으로써 맥락적 현실성을 제공할 수 있다. 출처: https://www.youtube.com/watch?v=IL517EgYH8U

내장 열화

실제로, 두 개의 가장 인기 있는 딥페이크 패키지(둘 다 2017년 논란의 소스 코드에서 파생됨)는 딥페이크된 얼굴을 ‘歴史的’ 또는 더 낮은 품질의 비디오의 맥락에 통합하기 위해 생성된 얼굴을 열화시키는 구성 요소를 포함한다. DeepFaceLab의 경우, bicubic_degrade_power 매개 변수가 이를 수행하며, FaceSwap의 경우 Ffmpeg 구성의 ‘grain’ 설정이 가짜 얼굴을 통합하는 데 도움을 주며, 인코딩 중에 그레인을 유지한다*.

FaceSwap의 'grain' 설정은 비HQ 비디오 콘텐츠 및 레거시 콘텐츠와의 진정한 통합을 도와준다. 이러한 콘텐츠는 상대적으로 드문 필름 그레인 효과를 특징으로 한다.

FaceSwap의 ‘grain’ 설정은 비HQ 비디오 콘텐츠 및 레거시 콘텐츠와의 진정한 통합을 도와준다. 이러한 콘텐츠는 상대적으로 드문 필름 그레인 효과를 특징으로 한다.

종종, 딥페이커들은 완전한 통합된 딥페이크 비디오를 출력하는 대신, 알파 채널이 있는 PNG 파일 시리즈를 출력한다. 각 이미지에는 합성된 얼굴만 표시되므로, 이미지 스트림을 비디오로 변환할 수 있다. 이를 위해 Adobe After Effects와 같은 플랫폼에서 더 복잡한 ‘열화’ 효과를 적용할 수 있다. 이후 가짜와 실제 요소를 최종 비디오에 결합한다.

이러한 의도적인 열화 외에도, 딥페이크 작업의 콘텐츠는 자주 재압축된다. 이는 알고리즘적으로(소셜 미디어 플랫폼에서 사용자 업로드의 대역폭을 절약하기 위해 가벼운 버전을 생성함) 또는 원본 작업을 애니메이션 GIF, 세부 섹션 또는 다양한 동기를 가진 워크플로우로 재처리함으로써 발생할 수 있다. 이러한 워크플로우는 원본 릴리스를 시작점으로 사용하고, 추가적인 압축을 도입한다.

현실적인 딥페이크 탐지 맥락

이 점을 염두에 두고, 스위스에서 발표된 새로운 논문은 딥페이크 탐지 접근 방식의 방법론을 개선하는 것을 제안한다. 이를 위해 딥페이크 콘텐츠가 의도적으로 열화된 맥락에서 나타날 때의 특성을 학습하도록 탐지 시스템을 교육한다.

새로운 논문에서 사용된 데이터셋 중 하나에 적용된 스토캐스틱 데이터 증강: 가우시안 노이즈, 감마 보정, 가우시안 블러 및 JPEG 압축 아티팩트가 특징이다. 출처: https://arxiv.org/pdf/2203.11807.pdf

새로운 논문에서 사용된 데이터셋 중 하나에 적용된 스토캐스틱 데이터 증강: 가우시안 노이즈, 감마 보정, 가우시안 블러 및 JPEG 압축 아티팩트가 특징이다. 출처: https://arxiv.org/pdf/2203.11807.pdf

새로운 논문에서 연구자들은 선도적인 딥페이크 탐지 패키지가 비현실적인 벤치마크 조건에 의존하며, ‘열화된’ 딥페이크 출력은 탐지의 최소 품질 임계값 아래로 떨어질 수 있다고 주장한다. 그러나 이러한 현실적으로 ‘그루지한’ 콘텐츠는 맥락에 대한 올바른 주의로 인해 관객을 속일 가능성이 있다.

연구자들은 딥페이크 탐지기에 일반화 가능성을 향상시키는 새로운 데이터 증강 프로세스를 제안한다. 이는 딥페이크 탐지기에 대한 실질적인 접근 방식이다. 또한, 현실적인 조건에서 딥페이크 탐지기의 강건성을 평가할 수 있는 새로운 평가 프레임워크를 제공한다.

논문의 제목은 실제 상황에서 딥페이크 탐지 학습 개선에 대한 새로운 접근이며, 스위스 라우산느에 있는 멀티미디어 신호 처리 그룹(MMSPG)과 에콜 폴리테크니크 페데랄 드 라우산느(EPFL) 연구자들이 발표했다.

유용한 혼란

딥페이크 탐지 접근 방식에 열화된 출력을 통합하려는 이전의 노력에는 MIT와 FAIR의 2018년 Mixup 신경망, DeepMind와 Google의 2020년 AugMix가 포함된다. 이는 데이터 증강 방법으로, 훈련 자료를 ‘흐리게’ 하는 방식으로 일반화에 도움이 된다.

새로운 연구의 연구자들은 또한 이전 연구를 언급한다. 이는 가우시안 노이즈와 압축 아티팩트를 훈련 데이터에 적용하여 파생된 특성과 노이즈 간의 관계의 경계를 설정하기 위해 수행되었다.

새로운 연구는 실제 상황에서 이미지 취득 및 분산 과정에서 발생하는 다양한 압축 및 알고리즘의 열화된 조건을 시뮬레이션하는 파이프라인을 제공한다. 이러한 실제 워크플로우를 평가 프레임워크에 통합함으로써, 아티팩트에 더 강건한 딥페이크 탐지기 훈련 데이터를 생성할 수 있다.

새로운 접근 방식의 개념적 논리 및 워크플로

새로운 접근 방식의 개념적 논리 및 워크플로

열화 프로세스는 딥페이크 탐지에 사용되는 두 개의 인기 있는 데이터셋인 FaceForensics++와 Celeb-DFv2에 적용되었다. 또한, 선도적인 딥페이크 탐지 프레임워크인 Capsule-Forensics와 XceptionNet이 두 데이터셋의 변형된 버전에 대해 훈련되었다.

탐지기는 Adam 옵티마이저를 사용하여 25와 10 에포크 동안 훈련되었다. 데이터셋 변환을 위해, 각 훈련 비디오에서 100프레임이 무작위로 샘플링되었으며, 32프레임이 테스트를 위해 추출되었다. 이후 열화 프로세스가 추가되었다.

워크플로에서 고려된 왜곡에는 노이즈가 포함되며, 여기서 6가지 다른 수준에서 가우시안 노이즈가 적용되었다. 리사이징은 일반적인 야외 촬영의 감소된 해상도를 시뮬레이션하기 위해 수행되며, 이는 탐지기에 영향을 줄 수 있다. 압축은 데이터에 다양한 JPEG 압축 수준을 적용하는 것을 포함한다. 스무딩은 ‘노이즈 제거’를 위한 3가지 일반적인 필터를 평가한다. 강화는 대조와 밝기를 조정한다. 조합은 위의 방법 중 3가지를 단일 이미지에 동시에 적용한다.

테스트 및 결과

테스트에서, 연구자들은 세 가지 지표를 채택했다: 정확도(ACC); 수신자 운영 특성 곡선 아래 영역(AUC); F1-점수.

‘일반적으로, 대부분의 현실적인 왜곡과 처리는 정상적으로 훈련된 학습 기반 딥페이크 탐지기에 매우 유해하다. 예를 들어, Capsule-Forensics 방법은 FFpp 및 Celeb-DFv2 테스트 세트에서 높은 AUC 점수를 보여주지만, 수정된 데이터에서 급격한 성능 저하를 보인다. XceptionNet 탐지기에서도 유사한 경향이 관찰된다.’

반면, 두 탐지기의 성능은 변형된 데이터에 훈련됨으로써 크게 향상되었다. 각 탐지기는 이전에 보지 못한 기만적인 미디어를 탐지하는 능력이 향상되었다.

‘데이터 증강 체계는 두 탐지기의 강건성을 크게 향상시키며, 원래의 비변형 데이터에서 높은 성능을 유지한다.’

연구에서 평가된 두 딥페이크 탐지기에 대한 원시 및 증강 데이터셋의 성능 비교

연구에서 평가된 두 딥페이크 탐지기에 대한 원시 및 증강 데이터셋의 성능 비교

‘현재의 탐지 방법은 특정 벤치마크에서 가능한 한 높은 성능을 달성하기 위해 설계된다. 이는 일반화 능력을 더 현실적인 시나리오로 희생하는 결과를 초래한다. 이 논문에서는 자연적 이미지 열화 프로세스를 기반으로 한 신중하게 설계된 데이터 증강 체계가 제안된다. ‘

‘ 광범위한 실험은 이 간단하지만 효과적인 기술이 다양한 현실적인 왜곡 및 이미지 처리 워크플로우에서 모델의 강건성을 크게 향상시킨다는 것을 보여준다.’

* 생성된 얼굴의 일치하는 그레인은 변환 과정 중에 스타일 전송의 기능이다.

最初에 2022년 3월 29일에 게시되었으며, Ffmpeg에서 그레인 사용을 명확히 하기 위해 8:33 pm EST에 업데이트되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai