Anderson의 관점

깊이 정보는 실시간으로 디프페이크를 밝힐 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가

이탈리아의 새로운 연구에 따르면 이미지에서 얻은 깊이 정보는 디프페이크를 감지하는 유용한 도구가 될 수 있으며, 이는 실시간으로도 가능하다.

과거 5년 동안의 디프페이크 감지 연구의 대부분은 아티팩트 식별(개선된 기술로 완화되거나 비디오 코덱 압축으로 인해 오해할 수 있음)에 초점을 맞추었으며, 주변 조명, 생체 특征, 시간적 왜곡, 그리고 thậm chí 인간의 직관에 초점을 맞추었지만, 새로운 연구는 깊이 정보가 디프페이크 콘텐츠를 감지하는 유용한 키가 될 수 있음을 처음으로 제안한다.

파생된 깊이 맵과 실제 및 가짜 이미지의 지각적 깊이 정보 차이. 출처: https://arxiv.org/pdf/2208.11074.pdf

파생된 깊이 맵과 실제 및 가짜 이미지의 지각적 깊이 정보 차이. 출처: https://arxiv.org/pdf/2208.11074.pdf

중요하게도, 새로운 연구에서 개발된 감지 프레임워크는 경량 네트워크인 Xception에서 매우 잘 작동하며, MobileNet에서도 적절하게 작동한다. 새로운 논문은 이러한 네트워크를 통해 제공되는 낮은 지연 시간의 추론이 실시간 디프페이크 감지를 가능하게 하며, 최근 바이낸스 공격과 같은 라이브 디프페이크 사기와 같은 새로운 트렌드에 대응할 수 있다.

추론 시간의 더 큰 절약은 시스템이 실제와 가짜 깊이 맵을 구별하기 위해 전체 컬러 이미지가 필요하지 않기 때문에 달성될 수 있다. 시스템은 단순히 깊이 정보의 그레이스케일 이미지만으로도 효율적으로 작동할 수 있다.

저자들은 다음과 같이 말한다: ‘이 결과는 깊이가 이 경우에 색상 아티팩트보다 분류에 더 관련된 기여를 함을 시사한다.’

이 발견은 실시간 얼굴 합성 시스템에 대한 디프페이크 감지 연구의 새로운 물결의 일부를 나타낸다. 이러한 시스템의 예로는 DeepFaceLive가 있다. 이러한 연구는 지난 3-4개월 동안 가속화되었으며, 이는 FBI의 경고의 결과이다.

논문DepthFake: 깊이 기반 디프페이크 비디오 감지 전략이라고 제목이 붙여져 있으며, 로마 라 사피엔자 대학교의 5명의 연구자에 의해 수행되었다.

Edge Cases

训練 중에, 오토인코더 기반의 디프페이크 모델은 얼굴의 내부 영역, 즉 눈, 코, 입을 우선시한다. 대부분의 경우에, 오픈 소스 배포판인 DeepFaceLabFaceSwap를 포함하여, 얼굴의 외부 윤곽은 매우 늦은 훈련 단계에서 잘 정의되지 않는다. 이러한 외부 윤곽은 내부 얼굴 영역의 합성 품질에 비해 낮은 품질을 가지게 된다.

이전 연구에서 얼굴의 '살리언시 맵' 시각화. 출처: https://arxiv.org/pdf/2203.01318.pdf

이전 연구에서 얼굴의 ‘살리언시 맵’ 시각화. 출처: https://arxiv.org/pdf/2203.01318.pdf

일반적으로 이는 중요하지 않다. 우리가 먼저 눈을 보고, 외부로 관심을 기울이는 경향이 있기 때문에, 이러한 외부 품질의 저하는 우리를 방해하지 않는다. 특히 라이브로 다른 사람의 정체성을 위장하는 경우, 이는 사회적 규범과 처리 제한을.trigger한다.

그러나 디프페이크된 얼굴의 周囲 영역의 세부 사항이나 정확도가 부족한 점은 알고리즘적으로 감지될 수 있다. 3월에는 이러한 周囲 얼굴 영역을 중심으로 하는 시스템이 발표되었다. 그러나 이는 평균 이상의 양의 훈련 데이터가 필요하므로, 이는 주로 유명인에게 적용되며, 이러한 유명인들은 현재 컴퓨터 비전 및 디프페이크 감지 기술에서 사용되는 이미지넷과 같은 데이터셋에 포함된다.

새로운 시스템인 DepthFake는 이러한 제한 없이 작동할 수 있다. 이는 실제와 가짜 비디오 콘텐츠의 깊이 맵 정보의 품질을 구별함으로써 작동한다.

Going Deep

깊이 맵 정보는 스마트폰에 점점 더 많이 포함되고 있다. 이는 AI 지원 스테레오 구현을 포함하여, 컴퓨터 비전 연구에 특히 유용하다. 새로운 연구에서, 저자들은 아일랜드 국립 대학교의 FaceDepth 모델을 사용하였다. 이는 단일 이미지에서 깊이 맵을 효율적으로 추정할 수 있는 컨볼루션 인코더-디코더 네트워크이다.

FaceDepth 모델의 작동. 출처: https://tinyurl.com/3ctcazma

FaceDepth 모델의 작동. 출처: https://tinyurl.com/3ctcazma

다음으로, 새로운 프레임워크의 파이프라인은 원본 RGB 이미지와 파생된 깊이 맵에서 224×224 픽셀의 패치를 추출한다. 이는 핵심 콘텐츠를 복사하여 크기 조정을 피할 수 있다. 이는 중요하다. 크기 조정 알고리즘은 대상 영역의 품질을 나쁘게 할 수 있다.

이 정보를 사용하여, 실제와 디프페이크 소스에서, 연구자들은 실제와 가짜 인스턴스를 구별할 수 있는 컨볼루션 신경 네트워크(CNN)를 훈련시켰다. 이는 각각의 깊이 맵의 지각적 품질의 차이를 기반으로 한다.

DepthFake의 개념적 파이프라인.

DepthFake의 개념적 파이프라인.

FaceDepth 모델은 실제와 합성 데이터를 사용하여 훈련되며, 외곽 영역에서 더 많은 세부 사항을 제공한다. 이는 DepthFake에 적합하다. 이는 MobileNet 인스턴스를 특징 추출기로 사용하며, 480×640 입력 이미지에서 240×320 깊이 맵을 출력한다. 각 깊이 맵은 새로운 프로젝트의 판별기에 사용되는 4개의 입력 채널 중 하나를 나타낸다.

깊이 맵은 자동으로 원본 RGB 이미지에 포함되어 깊이 정보를 포함하는 RGBD 이미지를 제공한다.

Training

모델은 이미지넷에서 사전 훈련된 Xception 네트워크를 사용하여 훈련되었다. 그러나 깊이 정보를 추가하기 위해 아키텍처를 일부 수정해야 했다.

추가로, 깊이 정보와 네트워크가 기대하는 값의 범위가 다르므로, 연구자들은 값을 0-255로 정규화해야 했다.

훈련 중에, 모델은 플립과 회전만 적용되었다. 많은 경우에 다양한 시각적 왜곡이 모델에 적용되었지만, 소스 사진의 제한된 및 취약한 에지 깊이 맵 정보를 보존하기 위해 연구자들은 단순화된 체제를 채택해야 했다.

시스템은 또한 2채널 그레이스케일에서 훈련되었다. 이는 알고리즘이 작동하기 위해 필요한 소스 이미지의 복잡성을 결정하기 위한 것이었다.

훈련은 텐서플로우 API를 사용하여 NVIDIA GTX 1080에 8GB의 VRAM과 함께 수행되었다. ADAMAX 최적화 알고리즘을 사용하여 25 에포크 동안 배치 크기 32로 훈련되었다. 입력 해상도는 224×224로 고정되었으며, 얼굴 감지 및 추출은 dlib C++ 라이브러리를 사용하여 수행되었다.

Results

결과의 정확도는 Deepfake, Face2Face, FaceSwap, Neural Texture, 그리고 RGB와 RGBD 입력을 사용하는 전체 데이터셋에서 테스트되었다. FaceForensic++ 프레임워크를 사용하였다.

네 가지 디프페이크 방법과 전체 데이터셋에 대한 정확도 결과. 결과는 소스 RGB 이미지와 함께 임베디드된 추론된 깊이 맵을 분석한 결과와 나누어져 있다. 최고의 결과는 볼드체로 표시되어 있으며, 깊이 맵 정보가 결과를 개선하는 정도를 나타내는 백분율 숫자가 아래에 표시되어 있다.

네 가지 디프페이크 방법과 전체 데이터셋에 대한 정확도 결과. 결과는 소스 RGB 이미지와 함께 임베디드된 추론된 깊이 맵을 분석한 결과와 나누어져 있다. 최고의 결과는 볼드체로 표시되어 있으며, 깊이 맵 정보가 결과를 개선하는 정도를 나타내는 백분율 숫자가 아래에 표시되어 있다.

모든 경우에, 깊이 채널은 모든 구성에서 모델의 성능을 개선한다. Xception이 최고의 결과를 얻으며, MobileNet이 그 뒤를 따른다. 여기에서 저자는 다음과 같이 말한다:

‘모바일넷이 엑셉션보다 약간 낮고, 더 깊은 레스넷50보다 성능이 좋다는 점은 실시간 애플리케이션을 위한 추론 시간을 줄이는 목표를 고려할 때 주목할 만한 결과이다. 이것이 본 연구의 주요 기여는 아니지만, 향후 개발에 대해鼓舞적이다.’

연구자들은 또한 RGBD와 2채널 그레이스케일 입력이 RGB와 단순 그레이스케일 입력보다 우수함을 일관되게 관찰하였다. 깊이 추론의 그레이스케일 변환은 계산적으로 매우 저렴하여, 모델이 제한된 로컬 리소스로 개선된 결과를 얻을 수 있으며, 이는 깊이 정보를 기반으로 하는 실시간 디프페이크 감지의 향후 개발을 촉진한다.

 

最初에 2022년 8월 24日に 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai