Anderson의 관점

딥페이크 비디오 통화 감지 방법: 모니터 조명 관찰

mm
Unite.AI를 Google의 선호 소스에 추가

미국 국립안전보장국(NSA)와 캘리포니아 대학교 버클리(University of California at Berkeley)의 연구자 간의 새로운 협력이 실시간으로 진행되는 비디오 통화에서 딥페이크 콘텐츠를 감지하는 새로운 방법을 제시했습니다. 이 방법은 비디오 통화의 다른 쪽 끝에 있는 사람의 모니터 조명이 사용자의 얼굴에 미치는 영향을 관찰하는 것입니다.

Popular DeepFaceLive 사용자 Druuzil Tech & Games가 자신의 크리스천 베일 DeepFaceLab 모델을 라이브 세션에서 테스트하는 모습. 소스: https://www.youtube.com/watch?v=XPQLDnogLKA

Popular DeepFaceLive 사용자 Druuzil Tech & Games가 자신의 크리스천 베일 DeepFaceLab 모델을 라이브 세션에서 테스트하는 모습. 소스: https://www.youtube.com/watch?v=XPQLDnogLKA

이 시스템은 사용자의 화면에 그래픽 요소를 표시하여 딥페이크 시스템이 반응할 수 있는 시간보다 빠르게 색상을 변경합니다. 이는 딥페이크 시스템이 라이브 색상 전송을 유지하고 주변 조명을 고려하는 경우에도 마찬가지입니다.

이 그래픽 요소는 사용자의 모니터에 표시되며, Narrow한 색상 범위 내에서 색상을 변경합니다. 이 색상 변경은 웹캠의 자동 화이트 밸런스와 기타 조명 보상 시스템을 활성화하지 않도록 설계되었습니다.

사용자의 모니터 앞에 있는 사람의 조명 조건 변경을 보여주는 일러스트레이션. 소스: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

사용자의 모니터 앞에 있는 사람의 조명 조건 변경을 보여주는 일러스트레이션. 소스: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

이 접근법의 이론은 라이브 딥페이크 시스템이 그래픽 요소의 색상 변경에 반응할 수 있는 시간이 없기 때문에, 딥페이크 효과의 특정 부분에서 ‘지연’이 발생하여 딥페이크를 감지할 수 있다는 것입니다.

시스템은 일반적인 환경 조명을 고려하여 모니터 조명의 영향을 정확하게 측정해야 합니다. 이를 위해 시스템은 활성 조명과 얼굴의 색상을 측정하여 1-4 프레임의 차이를 나타내는 시간적 변화를 감지합니다.

그래픽 요소의 색상 변경이 웹캠의 자동 노출을觸發하지 않도록 하여 딥페이크 시스템의 조명 변경에 대한 반응을 감지할 수 있습니다.

그래픽 요소의 색상 변경이 웹캠의 자동 노출을觸發하지 않도록 하여 딥페이크 시스템의 조명 변경에 대한 반응을 감지할 수 있습니다.

연구자들은 다음과 같이 결론을 내렸습니다.

‘라이브 비디오 통화에 대한 신뢰가 합리적이며, 비디오 통화가 우리의 개인적이고 전문적인 삶에서 점점 더 일반적으로 사용됨에 따라, 비디오(및 오디오) 통화를 인증하는 기술의 중요성이 증가할 것입니다.’

이 연구는 실시간 딥페이크 비디오 감지에 관한 연구로, 미국 국방부의 응용 연구 수학자인 Candice R. Gerstner와 버클리 대학교의 Hany Farid 교수가 수행했습니다.

신뢰의 침식

딥페이크 방지 연구 분야는 지난 6개월 동안 일반적인 딥페이크 감지(즉, 사전 녹화된 비디오와 음란 콘텐츠를 대상으로 함)에서 라이브니스 감지로 방향을 전환했습니다. 이는 비디오 회의 통화에서 딥페이크 사용이 증가하고 있으며, FBI는 원격 작업에 대한 딥페이크 기술의 사용에 대한 경고를 최근에 발령했습니다.

비디오 통화가 딥페이크가 아닌 경우에도, AI 기반 비디오 인물의 기회가 증가함에 따라 의심이 생기기 시작했습니다.

연구자들은 다음과 같이 말했습니다.

‘실시간 딥페이크 생성은 라이브 비디오 또는 전화 통화에 대한 일반적인 신뢰로 인해 고유한 위협을 제기하며, 딥페이크를 실시간으로 감지하는 것은 어려운課題입니다.’

연구자들은 딥페이크 콘텐츠에 대한 확실한 징조를 찾는 것을 목표로 설정했습니다. 그러나 초기 접근 방식(예: 眼 깜빡임 분석, 머리 자세 구분, 행동 분석)은 딥페이크 개발자가 더 현실적인 딥페이크를 만들기 위해 노력하면서 무효화되었습니다.

라이브 딥페이크 비디오에 대한 조명

라이브 비디오 환경에서 딥페이크를 감지하는 것은 나쁨한 비디오 연결을 고려해야 하는 부담을 지니고 있습니다. 이는 비디오 회의 시나리오에서 매우 일반적입니다. 딥페이크 계층이不存在하는 경우에도, 비디오 콘텐츠는 나사형 지연, 렌더링 아티팩트 및 오디오 및 비디오의 기타 종류의 열화로 인해 영향을 받을 수 있습니다. 이러한 요소는 라이브 딥페이킹 아키텍처의 거친 에지를 숨길 수 있습니다.

연구자들은 다음과 같이 말했습니다.

‘우리의 제안된 개입은 호출 참가자가 자신의 화면을 공유하고 시간적으로 변하는 패턴을 표시함으로써 실현될 수 있으며, 이상적으로는 비디오 통화 클라이언트에 직접 통합될 수 있습니다.’

테스트

연구자들은 합성 및 실제 사용자를 사용하여 딥페이크 감지기를 테스트했습니다. 합성 시나리오에서는 스위스 연방 기술 연구소의 Mitsuba를 사용했습니다.

시뮬레이션 데이터 세트의 샘플, 피부 톤, 조명 크기, 주변 조명 강도 및 카메라와의 거리가 변하는 모습.

시뮬레이션 환경 테스트의 샘플, 피부 톤, 조명 크기, 주변 조명 강도 및 카메라와의 거리가 변하는 모습.

장면에는 90° 필드 오브 뷰를 갖는 가상 카메라에서 캡처한 파라메트릭 CGI 헤드가 포함되어 있습니다. 헤드는 람버트 반사율을 갖고 중립적인 피부 톤을 가지고 있으며, 가상 카메라에서 2피트 앞에 위치합니다.

연구자들은 다음과 같이 말했습니다.

‘시뮬레이션에서, 우리의 가정들이 만족되면, 우리의 제안된 기술은 다양한 이미지 구성에 대해 매우 강력합니다.’

미래 방향

연구자들은 시스템이 일반적인 얼굴 가리개를 고려하지 않는다고 인정합니다. 그러나 mereka는 이러한 가리개를 후속 시스템에 추가할 수 있으며, 이러한 시스템은 대상 주체의 피부 영역에서만 값을 취할 수 있도록 훈련될 수 있다고 말합니다.

연구자들은 다음과 같이 말했습니다.

‘더 복잡한 3D 조명 추정은 더 풍부한 외관 모델을 제공할 것이며, 이는 사기꾼이 회피하기 더 어려울 것입니다. 우리는 얼굴에만 집중했지만, 컴퓨터 디스플레이는 목, 상반신 및 주변 배경도照明하며, 이러한 측정은 유사한 측정으로 수행될 수 있습니다.’

‘이러한 추가적인 측정은 사기꾼이 얼굴만이 아니라 전체 3D 장면을 고려하도록 강요할 것입니다.’

 

* 연구자들의 인용문을 하이퍼링크로 변환했습니다.

2022년 7월 6일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai