Anderson의 관점
비디오 회의 딥페이크를 스마트폰의 ‘진동’ 기능으로 탐지

싱가포르의 새로운 연구에서 스마트폰 비디오 회의 도구의 다른 쪽 끝에 있는 사람이 DeepFaceLive와 같은 방법을 사용하여 다른 사람을 가장하는지 여부를 탐지하는 새로운 방법을 제안했습니다.
새로운 접근 방식은 SFake라고 불리며, 대부분의 시스템에서 사용하는 수동적 방법을 버리고 사용자의 전화가 진동(스마트폰에서 일반적인 ‘진동’ 메커니즘을 사용하여)하고 얼굴을 미세하게 흐리게 합니다.
실시간 딥페이크 시스템은 다양한 동작 블러를 복제할 수 있지만, 블러된 영상을 포함한 훈련 데이터나 최소한 사전 훈련 데이터가 있는 경우, 이러한 블러에 kịp게 반응할 수 없습니다. 따라서 딥페이크 회의 호출의 존재를 나타내는 얼굴의 비 블러된 섹션을 계속 출력합니다.

DeepFaceLive는 카메라 진동으로 인한 블러를 시뮬레이트하기에 충분한 속도가 없습니다. 출처: https://arxiv.org/pdf/2409.10889v1
연구자들의 자체적으로 수집된 데이터셋(활성 카메라 셰이크를 특징으로 하는 데이터셋이 없기 때문에)에서 테스트 결과는 SFake가 경쟁하는 비디오 기반 딥페이크 탐지 방법을 초과하는 것으로 나타났으며, 심지어 도전적인 상황에서도, 예를 들어 다른 사람의 손으로 카메라를 잡고 있는 경우와 같이 자연스러운 손의 움직임이 발생하는 경우에도如此합니다.
비디오 기반 딥페이크 탐지의 증가하는 필요성
비디오 기반 딥페이크 탐지에 대한 연구는 최근 증가했습니다. 여러 해 동안 성공적인 음성 기반 딥페이크 강탈之后, 금융 근로자가 DeepFaceLive를 사용하여 CFO를 가장한 딥페이크 비디오 회의 호출에서 2,500만 달러를 전송하도록 속여진 사건이 발생했습니다.
이러한 시스템은 높은 수준의 하드웨어 액세스가 필요하지만, 많은 스마트폰 사용자는 이미 금융 및 기타 유형의 인증 서비스에서 얼굴 특징을 기록하여 얼굴 기반 인증을 요청하는 데 익숙해졌습니다.
따라서 이러한 방법이 점점 더 비디오 회의 시스템에 시행될 가능성이 있습니다. 이러한 유형의 범죄가 계속 헤드라인을 장식하면서 말입니다.
대부분의 실시간 비디오 회의 딥페이크를 해결하는 솔루션은 정적 시나리오를 가정합니다. 여기서 통신자는 정지된 웹캠을 사용하며, 과도한 환경 또는 조명 변경은 예상되지 않습니다. 스마트폰 호출은 이러한 ‘고정’ 상황을 제공하지 않습니다.
대신 SFake는 손으로 잡은 스마트폰 기반 비디오 회의의 많은 시각적 변형을 보상하는 여러 탐지 방법을 사용합니다. 이는 스마트폰에 내장된 표준 진동 장치를 사용하여 이 문제를 해결하는 최초의 연구 프로젝트로 나타납니다.
논문은 Shaking the Fake: Deepfake Videos in Real Time via Active Probes라고 제목이 붙여졌으며, 싱가포르 난양 이공대학의 두 명의 연구자로부터 나왔습니다.
방법
SFake는 클라우드 기반 서비스로 설계되었습니다. 여기서 로컬 앱이 데이터를 원격 API 서비스에 보내고 결과를 받습니다.
그러나 450MB의 작은 크기와 최적화된 방법론으로 인해 딥페이크 탐지를 완전히 장치에서 처리할 수 있습니다. 네트워크 연결로 인해 보낸 이미지들이 과도하게 압축되어 진단 과정에 영향을 미칠 수 있는 경우입니다.
이러한 방식으로 ‘로컬’에서 실행하면 시스템은 사용자의 카메라 피드에 직접 액세스할 수 있습니다. 비디오 회의에서 종종 관련된 코덱 간섭 없이 말입니다.
평균 분석 시간은 4초 비디오 샘플을 필요로 합니다. 사용자는 정지해 있어야 하며, SFake는 DeepFaceLive와 같은 시스템이 kịp게 반응할 수 없는 임의의 간격으로 카메라 진동을 발생시킵니다.
(어떤 공격자가 훈련 데이터셋에 블러된 콘텐츠를 포함하지 않은 경우, 모델이 블러를 생성할 수 있는 기능을 추가할 수 없을 것입니다. 또한 DeepFaceLive는 이미 훈련된 데이터셋에 이 기능을 추가할 수 없습니다)
시스템은 얼굴의 선택된 영역을 잠재적인 딥페이크 콘텐츠 영역으로 선택합니다. 눈과眉毛는 제외됩니다(blink 및 기타 얼굴 운동은 블러 감지의 범위 밖에 있으며, 이상적인 지표가 아닙니다).

SFake의 개념적 스키마.
위의 개념적 스키마에서 볼 수 있듯이, 적절하고 예측할 수 없는 진동 패턴을 선택하고, 최상의 초점 거리를 결정하고, 얼굴 인식(68개의 표준 얼굴 랜드마크를 추정하는 Dlib 구성 요소를 통해)을 수행한 후, SFake는 입력 얼굴에서 그라데이션을 도출하고 선택된 영역에 집중합니다.
변동 시퀀스는 연구 중인 짧은 클립의 각 프레임을 순차적으로 분석하여 평균 또는 ‘이상적인’ 시퀀스를 도출하고 나머지는 무시합니다.
이것은 딥페이크 콘텐츠의 확률을 정량화하기 위해 훈련된 데이터베이스(稍後 자세히 설명함)에 사용할 수 있는 기능을 추출합니다.
시스템은 1920×1080 픽셀의 이미지 해상도와 최소 2x 줌 요구 사항을 필요로 합니다. 논문에서는 이러한 해상도(그리고 더 높은 해상도)가 Microsoft Teams, Skype, Zoom 및 Tencent Meeting에서 지원됨을 언급합니다.
대부분의 스마트폰에는 전면 카메라와 후면 카메라가 있으며, 일반적으로 하나의 카메라만이 SFake에 필요한 줌 기능을 갖습니다. 앱은 사용자에게 요구 사항을 충족하는 카메라를 사용하도록 요구할 것입니다.
목표는 사용자의 얼굴을 분석할 시스템의 비디오 스트림에 올바른 비율로 가져오는 것입니다. 논문에서는 평균적으로 여성은 34.7cm, 남성은 38.2cm의 거리에서 모바일 디바이스를 사용한다고 보고합니다(Singapore Journal of Optometry에서 보고됨). SFake는 이러한 거리에서 매우 잘 작동합니다.
손으로 잡은 비디오의 안정화는 문제입니다. 손의 움직임으로 인한 블러는 SFake의 작동을 방해합니다. 연구자들은 이를 보상하는 여러 방법을 시도했습니다. 가장 성공적인 방법은 추정된 랜드마크의 중심점을 계산하고 이를 ‘錨’으로 사용하는 것이었습니다. 효과적으로 알고리즘적 안정화 기술입니다. 이 방법으로 92%의 정확도를 얻을 수 있었습니다.
데이터 및 테스트
적절한 데이터셋이不存在하여, 연구자들은 자체적으로 데이터셋을 개발했습니다:
‘우리는 8개의 다른 스마트폰 브랜드를 사용하여 다양한 성별과 연령의 15명의 참가자를 녹음하여 자체 데이터셋을 구축했습니다. 우리는 스마트폰을 전화 홀더에 20cm 거리에 두고 2배 줌을 적용하여 참가자의 얼굴을 녹화했습니다. 우리는 스마트폰을 다양한 패턴으로 진동시켰습니다. ‘
‘전면 카메라에 줌 기능이 없는 경우, 우리는 후면 카메라를 대신 사용했습니다. 우리는 20초 동안 150개의 긴 비디오를 녹화했습니다. 기본적으로 우리는 탐지 기간이 4초 동안 지속된다고 가정합니다. 우리는 한 개의 긴 비디오에서 4초 동안의 10개의 클립을 무작위로 선택했습니다. 따라서 우리는 총 1500개의 실제 클립을 얻었습니다. 각 클립은 4초 동안 지속됩니다.’
DeepFaceLive는 중앙의 연구 대상이었습니다. 이는 현재 가장 널리 사용되는 오픈 소스 실시간 딥페이크 시스템이기 때문입니다. 연구자들은 또한 4개의 다른 방법을 포함하여 기본 탐지 모델을 훈련했습니다: Hififace; FS-GANV2; RemakerAI; 및 MobileFaceSwap – 마지막은 특히 목표 환경에서 적절한 선택입니다.
1500개의 가짜 비디오가 훈련에 사용되었으며, 동일한 수의 실제 및 수정되지 않은 비디오도 사용되었습니다.
SFake는 여러 다른 분류기와 함께 테스트되었습니다. 여기에는 SBI; FaceAF; CnnDetect; LRNet; DefakeHop 변형; 및 무료 온라인 딥페이크 탐지 서비스인 Deepaware가 포함됩니다. 각 딥페이크 방법에 대해 1500개의 가짜 및 1500개의 실제 비디오가 훈련되었습니다.
기본 테스트 분류기에는 2개의 레이어를 가진 단순한 신경망과 ReLU 활성화 함수가 사용되었습니다. 1000개의 실제 및 1000개의 가짜 비디오가 무작위로 선택되었습니다(가짜 비디오는 DeepFaceLive 예제만 사용되었습니다).
수신기 작동 특성 곡선 아래 영역(AUC/AUROC) 및 정확도(ACC)가 사용된 메트릭입니다.
훈련 및 추론을 위해 NVIDIA RTX 3060이 사용되었으며, 테스트는 Ubuntu에서 실행되었습니다. 테스트 비디오는 Xiaomi Redmi 10x, Xiaomi Redmi K50, OPPO Find x6, Huawei Nova9, Xiaomi 14 Ultra, Honor 20, Google Pixel 6a 및 Huawei P60으로 녹화되었습니다.
기존 탐지 방법과 일치하기 위해 테스트는 PyTorch에서 구현되었습니다. 주요 테스트 결과는 아래 표에 나와 있습니다:

SFake와 경쟁하는 방법에 대한 결과.
여기서 저자는 다음과 같이 말합니다:
‘모든 경우에 SFake의 탐지 정확도는 95%를 초과했습니다. 5개의 딥페이크 알고리즘 중 Hififace를 제외하고, SFake는 다른 6개의 탐지 방법보다 다른 딥페이크 알고리즘에 대해 더 잘 수행됩니다. 우리의 분류기는 DeepFaceLive로 생성된 가짜 이미지로 훈련되었으므로, DeepFaceLive를 탐지할 때 98.8%의最高 정확도를 달성합니다. ‘
‘RemakerAI로 생성된 가짜 얼굴에 대해 다른 탐지 방법은 성능이 좋지 않습니다. 우리는 이것이 인터넷에서 다운로드할 때 비디오의 자동 압축으로 인해 이미지 세부 사항이 손실되어 탐지 정확도가 낮아지는 결과일 수 있다고 추측합니다. 그러나 이것은 SFake의 탐지 정확도에 영향을 미치지 않습니다. SFake는 RemakerAI에 대한 탐지에서 96.8%의 정확도를 달성합니다.’
저자는 또한 SFake가 2배 줌이 적용된 캡처 렌즈의 시나리오에서 가장 성능이 좋으며, 이는 움직임을 과장하고, 매우 도전적인 전망입니다. 이러한 상황에서도 SFake는 2.5배 및 3배의 확대 인자에 대해 각각 84% 및 83%의 인식 정확도를 달성할 수 있었습니다.
결론
실시간 딥페이크 시스템의 약점을 그 자신에게 사용하는 프로젝트는, 주파수 분석을 중심으로 한 기존 접근 방식을 다시 끌어올린 논문이 딥페이크 탐지 분야를 지배하는 한 해에 신선한 제안입니다.
2022년 말, 다른 시스템은 모니터 밝기 변동을 탐지 후크로 사용했습니다. 그리고 같은 해에, 저는 DeepFaceLive의 90도 프로필 뷰를 처리할 수 없는 능력에 대한 나의 eigenen 시연이 일부 관심을 받았습니다.
DeepFaceLive는 이러한 프로젝트의 적절한 대상입니다. 이는 거의 확실하게 비디오 회의 사기와 관련된 범죄적 관심의 중심입니다.
그러나 최근에, 저는 VFX 커뮤니티에서 매우 인기 있는 LivePortrait 시스템이 DeepFaceLive보다 프로필 뷰를 훨씬 더 잘 처리한다는 일부 증거를 보았습니다. 이 연구에 포함시킬 수 있었으면 좋았을 것입니다.
2024년 9월 24일 처음 게시












