Anderson의 관점

딥페이크는 많은 주요 얼굴 ‘생존’ API를 효과적으로 속일 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

미국과 중국의 새로운 연구 협력은 세계에서 가장 큰 얼굴 기반 인증 시스템의 일부에 대한 딥페이크의 취약성을 조사했으며, 대부분이 개발되고 있는 딥페이크 공격 형태에 취약하다는 것을 발견했다.

연구는 일반적으로 주요 벤더에서 공급하는 Facial Liveness Verification (FLV) 시스템에 대한 딥페이크 기반 침입을 수행하는 사용자 정의 프레임워크를 사용했으며, 이 시스템은 항공사와 보험 회사와 같은 다운스트림 클라이언트에게 서비스로 판매된다.

논문에서 주요 공급업체의 Facial Liveness Verification (FLV) API의 작동 개요. 출처: https://arxiv.org/pdf/2202.10673.pdf

논문에서 주요 공급업체의 Facial Liveness Verification (FLV) API의 작동 개요. 출처: https://arxiv.org/pdf/2202.10673.pdf

Facial Liveness는 적대적 이미지 공격, 마스크 및 사전 녹화된 비디오, 소위 ‘마스터 페이스’ 및 기타 시각적 ID 클로닝 형태와 같은 기술의 사용을 방지하기 위해 설계되었다.

연구는 이러한 시스템에 배포된 딥페이크 감지 모듈의 수가 제한적이며, 많은 경우에 현재 사용되는 딥페이크 기술이 구식이거나 아키텍처 특정적일 수 있다고 결론지었다.

저자는 다음과 같이 말한다:

‘다른 딥페이크 방법도 다양한 벤더에 걸쳐 변형을 보여주고 있습니다. 대상 FLV 벤더의 기술 세부 정보에 접근할 수 없기 때문에, 우리는 이러한 변형이 다양한 벤더에서 배포된 방어 수단에 기인한다고 추측합니다. 예를 들어, 특정 벤더는 특정 딥페이크 공격에 대한 방어를 배포할 수 있습니다.’

그리고 계속한다:

‘대부분의 FLV API는 반딥페이크 감지 기능을 사용하지 않으며, 이러한 방어를 사용하는 경우에도 효과가 우려스럽습니다(예: 높은 품질의 합성 비디오를 감지할 수 있지만 낮은 품질의 비디오를 감지하지 못할 수 있습니다).’

연구자들은 이와 관련하여 ‘진실성’은 상대적인 개념이라고 관찰한다:

‘합성 비디오가 인간에게는 비현실적일지라도, 현재의 반딥페이크 감지 메커니즘을 매우 높은 성공률로 우회할 수 있습니다.’

위: 저자의 실험에서 인증에 성공한 샘플 딥페이크 이미지. 아래: 보다 현실적인 가짜 이미지지만 인증에 실패했습니다.

위: 저자의 실험에서 인증에 성공한 샘플 딥페이크 이미지. 아래: 보다 현실적인 가짜 이미지지만 인증에 실패했습니다.

또 다른 발견은 현재의 일반적인 얼굴 인증 시스템이 백인 남성에 편향되어 있다는 것이다. 따라서 여성과 백인이 아닌 신원은 인증 시스템을 우회하는 데 더 효과적일 수 있다.

보고서에 따르면 인기 있는 얼굴 생존 확인 API는 백인 남성 신원에 대해 가장 엄격하고 정확하게 평가된다. 위의 표에서 여성과 백인이 아닌 신원은 시스템을 우회하기 더 쉽다는 것을 알 수 있다.

보고서에 따르면 인기 있는 얼굴 생존 확인 API는 백인 남성 신원에 대해 가장 엄격하고 정확하게 평가된다. 위의 표에서 여성과 백인이 아닌 신원은 시스템을 우회하기 더 쉽다는 것을 알 수 있다.

논문은 다음과 같이 말한다: ‘Facial Liveness Verification에는 편향이 존재하며, 특정 사람들에게重大한 보안 위험을 초래할 수 있습니다.’

저자들은 또한 중국 정부, 중국의 주요 항공사, 중국에서 가장 큰 생명 보험 회사 중 하나, 그리고 세계에서 가장 큰 유니콘 투자 그룹 중 하나인 R360에 대한 윤리적인 얼굴 인증 공격을 수행했으며, 이 조직들의 다운스트림 API 사용을 우회하는 데 성공했다고 보고했다.

중국 항공사의 경우, 다운스트림 API는 사용자가 ‘머리를 흔들’라는 인증을 요구했지만, 연구자들이 개발한 프레임워크는 6개의 딥페이크 아키텍처를 통합하여 이 인증을 우회할 수 있었다.

항공사의 사용자 평가에서 머리를 흔드는 동작에도 불구하고, 딥페이크 콘텐츠는 테스트를 통과할 수 있었다.

항공사의 사용자 평가에서 머리를 흔드는 동작에도 불구하고, 딥페이크 콘텐츠는 테스트를 통과할 수 있었다.

논문은 관련 벤더에 연락했으며, 이 벤더들은 이 연구를 인식했다고 보고했다.

저자들은 Facial Liveness Verification의 현재 상태에 대한 몇 가지 개선 사항을 제안했다. 이는 단일 이미지 인증(‘이미지 기반 FLV’)을 포기하는 것, 딥페이크 감지 시스템을 이미지 및 음성 도메인에서 더 유연하고 포괄적으로 업데이트하는 것, 사용자 비디오에서 음성 기반 인증을 립 동작과 동기화하는 것, 사용자가 현재 딥페이크 시스템에서 재현하기 어려운 제스처와 동작을 수행하도록 요구하는 것이다.

논문은 Seeing is Living? Rethinking the Security of Facial Liveness Verification in the Deepfake Era라는 제목으로, 펜실베이니아 주립 대학교, 절강 대학교, 산동 대학교의 6명의 저자와 함께 창장 리와 리 왕이 공동으로 발표했다.

핵심 대상

연구자들은 ‘가장 대표적인’ Facial Liveness Verification (FLV) 벤더 6개를 대상으로 하였다. 이 벤더들은 연구에서 암호명으로匿名化되어 있다.

벤더는 다음과 같이 나타난다: ‘BD’‘TC’는 얼굴 관련 API 호출 수에서 가장 많은 공급자이며, 중국의 AI 클라우드 서비스에서 가장 큰 시장 점유율을 차지한다; ‘HW’는 중국에서 가장 큰 공공 클라우드 시장 중 하나를 차지하는 벤더이다; ‘CW’는 컴퓨터 비전에서 가장 빠른 성장률을 보이고 있으며, 주요 시장 지위를 달성하고 있다; ‘ST’는 가장 큰 컴퓨터 비전 벤더 중 하나이다; ‘iFT’는 중국에서 가장 큰 AI 소프트웨어 벤더 중 하나이다.

데이터 및 아키텍처

이 프로젝트를 구동하는 기본 데이터에는 중국의 CelebA-Spoof 데이터셋에서 625,537개의 이미지와 2019년 Michigan State University의 SiW-M 데이터셋에서 라이브 비디오가 포함된다.

모든 실험은 2.40GHz Intel Xeon E5-2640 v4 CPU 2개와 256GB RAM, 4TB HDD, 4개의 1080Ti NVIDIA GPU(총 44GB의 운영 VRAM)를 장착한 서버에서 수행되었다.

6개의 통합

저자의 논문에서 개발된 프레임워크는 LiveBugger라고 불리며, FLV 시스템의 4つの 주요 방어에 대해 6개의 최신 딥페이크 프레임워크를 통합한다.

LiveBugger는 다양한 딥페이크 접근 방식을 포함하며, FLV 시스템의 4개의 주요 공격 벡터를 중심으로 한다.

LiveBugger는 다양한 딥페이크 접근 방식을 포함하며, FLV 시스템의 4개의 주요 공격 벡터를 중심으로 한다.

사용된 6개의 딥페이크 프레임워크는 다음과 같다: 옥스포드 대학교의 2018년 X2Face; 미국 학술 협력 ICface; 2019년 이스라엘 프로젝트 FSGAN의 두 가지 변형; 이탈리아의 First Order Method Model(FOMM), 2020년 초에 발표됨; 그리고 北京 대학교의 마이크로소프트 연구 협력 FaceShifter(FaceShifter는 오픈 소스가 아니므로, 저자는 공개된 아키텍처 세부 정보를 기반으로 재구성해야 했다).

이 프레임워크에서 사용된 방법에는 API 인증 요구 사항을事前に 평가한 후 추출된 동작을 수행하는 스푸핑 비디오의 사전 렌더링 비디오를 사용하는 것이 포함되며, 또한 효과적인 ‘딥페이크 인형극’을 사용하여 개별 사용자의 라이브 동작을 딥페이크 스트림으로 변환하여 캡처된 웹캠 스트림에 삽입하는 것도 포함된다.

이러한 예 중 하나는 DeepFaceLive이며, 작년 여름에 인기 있는 DeepFaceLab의 보조 프로그램으로 출시되어 실시간 딥페이크 스트리밍을 가능하게 하지만, 이 연구에는 포함되지 않는다.

4개의 벡터 공격

FLV 시스템 내의 4개의 공격 벡터는 다음과 같다: 이미지 기반 FLV, 사용자 제공 사진을 인증 토큰으로 사용한다; 沈默 기반 FLV, 사용자가 비디오 클립을 업로드하도록 요구한다; 동작 기반 FLV, 사용자가 플랫폼에서 지정한 동작을 수행하도록 요구한다; 그리고 음성 기반 FLV, 사용자의 음성을 시스템의 데이터베이스와 일치시킨다.

시스템의 첫 번째 도전은 API가 요구 사항을 얼마나 공개할 것인지를 결정하는 것이다. 이는 LiveBugger의 Intelligence Engine에 의해 처리되며, 공개적으로 사용 가능한 API 문서 및 기타 소스에서 정보를 수집한다.

공개된 요구 사항이 отсутств할 수 있으므로(다양한 이유로), Intelligence Engine은 탐색적 API 호출의 결과를 기반으로 암시적 정보를 수집하는 프로브를 포함한다. 이 연구 프로젝트에서는 공식 오프라인 ‘테스트’ API와 테스트를 위해 자신의 라이브 계정을 제공한 자원봉사자들이 이를 가능하게 했다.

Intelligence Engine은 공격에 유용할 수 있는 접근 방식의 증거를 검색한다. 이러한 기능에는 일관성 감지이 포함되며, 이는 비디오의 프레임이 시간적으로 연속적인지 확인한다. 이는 비디오 프레임을 섞어서 보내고 인증 실패에 기여하는지 여부를 관찰하여 확인할 수 있다.

이 모듈은 또한 립 언어 감지를 검색한다. 여기서 API는 비디오의 사운드가 사용자의 립 동작과 동기화되어 있는지 확인한다(대부분의 경우 그렇지 않다 – 아래 ‘결과’ 참조).

결과

저자들은 평가된 모든 6개의 API가 일관성 감지를 사용하지 않는다는 것을 발견했으며, LiveBugger의 딥페이크 엔진은 기증자로부터의 기여 자료를 기반으로 합성 오디오와 딥페이크 비디오를 단순히 조합할 수 있었다.

그러나 일부 다운스트림 애플리케이션(즉, API 프레임워크의 고객)은 프로세스에 일관성 감지를 추가한 것으로 나타났다. 이는 이 공격을 우회하기 위해 사전 녹화된 비디오를 생성해야 했다.

또한 일부 API 벤더만 립 언어 감지를 사용하며, 대부분의 경우 비디오와 오디오가 별도의 양으로 분석되며, 립 동작과 제공된 오디오를 일치시키는 기능이 없다.

LiveBugger의 다양한 가짜 기술에 대한 FLV API의 공격 벡터에 대한 다양한 결과. 높은 숫자는 공격자가 딥페이크 기술을 사용하여 인증을 성공적으로 우회할 수 있음을 나타낸다. 모든 API는 FLV에 가능한 모든 방어를 포함하지 않는다. 예를 들어, 일부는 딥페이크에 대한 방어를 제공하지 않으며, 다른 일부는 사용자 제출 비디오에서 립 동작과 오디오가 일치하는지 확인하지 않는다.

LiveBugger의 다양한 가짜 기술에 대한 FLV API의 공격 벡터에 대한 다양한 결과. 높은 숫자는 공격자가 딥페이크 기술을 사용하여 인증을 성공적으로 우회할 수 있음을 나타낸다. 모든 API는 FLV에 가능한 모든 방어를 포함하지 않는다. 예를 들어, 일부는 딥페이크에 대한 방어를 제공하지 않으며, 다른 일부는 사용자 제출 비디오에서 립 동작과 오디오가 일치하는지 확인하지 않는다.

결론

이 논문의 결과와 FLV API의 미래에 대한 시사점은 복잡하며, 저자들은 발견된 문제를 이해하기 위해 ‘취약성 아키텍처’를 만들었다.

딥페이크 공격에 대한 얼굴 기반 비디오 식별 루틴의 기존 및 잠재적 취약성에 대한 추천 네트워크.

딥페이크 공격에 대한 얼굴 기반 비디오 식별 루틴의 기존 및 잠재적 취약성에 대한 추천 네트워크.

추천 사항은 다음과 같다:

‘FLV의 보안 위험은 많은 실제 애플리케이션에서広く 존재하며, 따라서 수백만 명의 최종 사용자의 보안을 위협합니다.’

저자들은 또한 동작 기반 FLV의 사용이 ‘제한적’이며, 사용자가 수행해야 하는 동작의 수를 증가시키는 것은 ‘보안 상의 이익을 가져오지 않는다’는 것을 관찰한다.

さらに, 저자들은 음성 인식과 시각적 얼굴 인식을 결합하는 것은 립 동작이 오디오와 동기화되지 않는 한 무의미한 방어라는 것을 주목한다.

이 논문은 최근 FBI의 딥페이크 사기 위험에 대한 경고와 함께 발표되었으며, 이는 외국인 영향 작전에 대한 기술의 사용에 대한 1년 전의 경고와, 라이브 딥페이크 기술이 공공이 여전히 비디오 인증 보안 아키텍처를 신뢰하는 상황에서 새로운 범죄 물결을 촉발할 것이라는 일반적인 두려움에 대한 경고이다.

딥페이크는 아직 인증 공격 표면의 초기 단계에 있으며, 2020년에 UAE의 은행에서 딥페이크 오디오 기술을 사용하여 3,500만 달러가 사기적으로 추출되었으며, 2019년에는 영국의幹部가 24만 3,000달러를 사기적으로 지불했다.

 

최초로 2022년 2월 23일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai