Anderson의 관점
딥페이크 탐지기: 새로운 지평을 향한 잠재 확산 모델과 GAN

의견
최근에, 2017년 말부터 거의 독점적으로 자동 인코더 기반 프레임워크에 종사해 온 딥페이크 탐지 연구 커뮤니티는, 그 때에 대중의 경탄과(그리고 자동 인코더에 대한 실망)으로 인해, 정체된 아키텍처를 포함하여 잠재 확산 모델과 생성적 적대적 네트워크(GAN)의 출력에 대한 법의학적 관심을 가지기 시작했습니다. 예를 들어, 6월에 UC 버클리는 DALL-E 2와 안정 확산과 같은 잠재 확산 모델에 대한 탐지기의 개발에 대한 연구 결과를 발표했습니다.
이러한 관심의 증가가 가지는 동인은 2022년에 잠재 확산 모델의 능력과 가용성의 갑작스러운 진화적 도약입니다. 봄에 DALL-E 2의 폐쇄적이고 제한적인 출시가 있은 후, 여름에는 안정 확산의 오픈 소스화가 있었습니다.
GAN은 cũng 이 맥락에서 오래 연구되어 왔습니다. 그러나 비교적 덜 집중적으로 연구되어 왔습니다. 왜냐하면 GAN을 사용하여 사람의 얼굴을 재현하는 것이 매우 어렵기 때문입니다. 특히, FaceSwap과 DeepFaceLab과 같은 자동 인코더 패키지와 비교할 때, 그리고 후자의 실시간 스트리밍 기능인 DeepFaceLive와 비교할 때입니다.
이동하는 그림
어느 경우에나, 가속하는 요인은 비디오 합성의 후속 개발 스프린트의 전망입니다. 10월 초와 2022년의 주요 컨퍼런스 시즌은 여러 오랜 비디오 합성의 버그를 해결하는突然하고 예상치 못한 솔루션의 아발란체로 특징지어졌습니다. 페이스북이 자신의 텍스트-비디오 플랫폼의 샘플을 출시한 직후, 구글 리서치가 자신의 새로운 Imagen-to-Video T2V 아키텍처를 발표했습니다. 이는 고해상도 영상을 출력할 수 있습니다(7개의 업스케일러 네트워크를 통해).
만약 당신이 이런 종류의 것이 세 개로 오는 것이라고 믿는다면, 안정성.ai의 비디오가 곧 스테이블 확산에 도착한다는 약속도 고려해 보십시오. 스테이블 확산의 공동 개발자인 런웨이는 비슷한 약속을 했습니다. 그러나 그들이 같은 시스템을 언급하는지 불분명합니다. 스테이블리의 CEO인 에마드 모스타크의 디스코드 메시지도 오디오, 비디오, 3D를 약속했습니다.
새로운 오디오 생성 프레임워크의突然한 제공과 함께, 그리고 특징적인 캐릭터 모션을 생성할 수 있는 새로운 확산 모델이 등장하면서, 정적인 프레임워크인 GAN과 확산기가 외부 애니메이션 프레임워크의 보조로서最終적으로 자리 잡을 것이라는 생각이 실제로 힘을 얻기 시작했습니다.
간단히 말해서, 자동 인코더 기반 비디오 딥페이크의 세계는 얼굴의 중앙 부분만 대체할 수 있을 뿐입니다. 그러나 내년 이 시간에는 새로운 확산 기반의 딥페이크가 가능해질 것입니다. 이는 인기 있는 오픈 소스 접근 방식으로, 전체 장면을 사진적으로 위조할 수 있습니다.
이러한 이유로, 안티-딥페이크 연구 커뮤니티는 이미지 합성을 진지하게 여기기 시작했습니다. 그리고 그것이 단순히 가짜 LinkedIn 프로필 사진을 생성하는 것 이상의 목적을 달성할 수 있을 것이라는 것을 깨닫기 시작했습니다. 그리고 만약 모든 잠재적인 공간이 시간적 운동을 달성하는 데 실패한다면, 그것은 실제로 충분할 것입니다.
블레이드 러너
딥페이크 탐지에 대한 최근 두 개의 논문은 각각 잠재 확산 기반과 GAN 기반의 딥페이크 탐지를 다루고 있습니다. CISPA 헬름홀츠 센터 สำหร 정보 보안과 Salesforce의 협력으로 작성된 DE-FAKE: 텍스트-이미지 확산 모델에 의해 생성된 가짜 이미지의 탐지 및 속성 및 Adam Dorian Wong이 MIT의 링컨 연구소에서 작성한 BLADERUNNER: 합성(인공지능 생성) StyleGAN 얼굴에 대한 신속한 대응책입니다.
이전의 GAN 기반의 콘텐츠를 식별하는 접근 방식에 대한 검토를 انجام한 후, 후者の 논문은 새로운 방법을 제시합니다.
‘브래디 번치’ 방법은 GAN이 생성한 콘텐츠를 식별하는 데 사용됩니다. 이는 GAN이 생성한 얼굴의 특정 부분이 항상 동일한 위치에 있기 때문입니다. 이는 ‘생산 과정’의 정형화된 특성 때문입니다.

SANS 연구소의 2022년 웹캐스트에서 제시된 ‘브래디 번치’ 방법: GAN 기반 얼굴 생성기는 특정 얼굴 특징을 improbably uniform하게 배치합니다. 출처: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf
또 다른 유용한 알려진 표시자는 StyleGAN의 빈번한 다중 얼굴 렌더링 실패입니다. 또한, StyleGAN은 액세서리 조정을 잘 못합니다. 그리고 헤어라인을 임시 모자로 사용하는 경향이 있습니다.

제3의 방법은 사진 오버레이입니다. 이는 구성적 ‘이미지 블렌딩’ 소프트웨어를 사용하여 여러 이미지를 하나의 이미지로 결합합니다. 이는 합성의 잠재적인 표시를 나타낼 수 있습니다.

새로운 논문에서 제시된 아키텍처는 블레이드 러너라고 불립니다. 이는 사이언스 픽션 프랜차이즈에서 가짜인지 아닌지를 결정하는 보이트-캠프 테스트를 참조합니다.
파이프라인은 두 단계로 구성됩니다. 첫 번째 단계는 PapersPlease 분석기입니다. 이는 GAN 얼굴 웹사이트에서 데이터를 평가할 수 있습니다.

두 번째 모듈은 AmongUs 탐지기입니다. 이는 사진에서 조정된 눈 배치를 검색하도록 설계되었습니다. 이는 StyleGAN의 얼굴 출력의 지속적인 특징입니다.

인텔리전트 비헤이비어 언더스탠딩 그룹(IBUG)의 얼굴 랜드마크 플로팅 코드를 사용한 얼굴 점 어노테이션.
AmongUs는 PapersPlease에서 알려진 ‘브래디 번치’ 좌표를 기반으로 하는 사전 훈련된 랜드마크를 사용합니다. 이는 웹 상의 StyleGAN 기반 얼굴 이미지에 대한 라이브 샘플에 대해 설계되었습니다.
블레이드 러너는 자원 부족으로 인해 내부 솔루션을 개발할 수 없는 회사 또는 조직을 위해 설계된 플러그 앤 플레이 솔루션입니다. 그리고 더 영구적인 대책을 마련하기 위한 임시 조치입니다.
사실, 이 분야는 매우 변동적이고 빠르게 성장하고 있기 때문에, 현재 신뢰할 수 있는 맞춤형 또는 클라우드 벤더 솔루션은 거의 없습니다.
블레이드 러너는 안경을 쓴 StyleGAN 가짜 사람들에 대해 성능이 좋지 않습니다. 그러나 이는 유사한 시스템에서 일반적인 문제입니다. 이러한 시스템은 눈의 윤곽을 핵심 참조점으로 평가하도록 설계되었습니다.
DE-FAKE
DE-FAKE 아키텍처는 텍스트-이미지 확산 모델에 의해 생성된 이미지의 ‘보편적’ 탐지를 달성하는 것을 목표로 합니다. 그리고 어떤 잠재 확산 모델이 이미지를 생성했는지 식별하는 방법을 제공합니다.

DE-FAKE의 보편적 탐지 프레임워크: 로컬 이미지, 하이브리드 프레임워크(초록), 오픈 월드 이미지(파랑). 출처: http://export.arxiv.org/pdf/2210.06998
현재, 이는 비교적 간단한 작업입니다. 왜냐하면 모든 인기 있는 잠재 확산 모델은 주목할 만한 특징을 가지고 있기 때문입니다.
또한, 대부분의 모델은 공통된 약점을 가지고 있습니다. 예를 들어, 임의의 방법으로 웹에서 스크랩된 이미지를 대규모 데이터셋으로 통합하는 경우, 헤드를 잘라내는 경향이 있습니다.

잠재 확산 모델은 컴퓨터 비전 모델과 마찬가지로 정사각형 형식의 입력이 필요합니다. 그러나 LAION5B 데이터셋을 구동하는 집계 웹 스크래핑은 페이스 또는 기타 객체를 인식하고 집중하는 기능과 같은 ‘럭셔리’를 제공하지 않습니다. 대신, 이미지를残忍하게 자릅니다. 이러한 ‘자르기’는 정상화되고, 잠재 확산 시스템의 출력에서 빈번하게 발생합니다.
DE-FAKE는 알고리즘에 독립적입니다. 이는 자동 인코더 기반의 안티-딥페이크 연구자들이 오랫동안 추구해 온 목표입니다. 그리고 현재 잠재 확산 시스템에 대해서는 khá 달성 가능합니다.
아키텍처는 OpenAI의 CLIP 멀티모달 라이브러리를 사용하여 ‘위조’된 잠재 확산 이미지에서 임베딩을 추출하고, 관찰된 패턴과 클래스에 대한 분류기를 훈련합니다.
더 ‘블랙 박스’ 시나리오에서, 연구자들은 Salesforce의 BLIP 프레임워크를 사용하여 이미지의 생성 프로세스에 대한 정보를 제공하지 않는 PNG 청크가 제거된 경우에 이미지의 의미 구조를 ‘블라인드’로 폴링합니다.

연구자들은 안정 확산, 잠재 확산, GLIDE, DALL-E 2를 사용하여 MSCOCO와 Flickr30k를 사용하는 훈련 및 테스트 데이터셋을 생성했습니다.
일반적으로 우리는 새로운 프레임워크의 실험 결과를 자세히 살펴보겠지만, DE-FAKE의 결과는 향후 반복과 유사한 프로젝트에 대한 벤치마크로 더 유용할 것입니다. 왜냐하면 이 시스템이 운영되는 환경은 매우 변동적이고, 시스템은 거의 3년 전의 것입니다.

가장 왼쪽의 두 이미지: 2019년에 시작된 이전 프레임워크는 DE-FAKE(가장 오른쪽의 두 이미지)와 비교하여 테스트된 4개의 잠재 확산 시스템에서 훨씬 더 나쁜 성능을 보입니다.
팀의 결과는 두 가지 이유로 압도적으로 긍정적입니다. 첫째, 비교할 수 있는 이전 연구가 거의 없습니다. 둘째, 잠재 확산 이미지 합성 분야는指数적으로 발전하고 있지만, 현재의 출력 콘텐츠는 구조적 약점과 특이성으로 인해 스스로를 ‘워터마크’합니다.
同时, 스테이블리티는 이미 시스템의 V2와 V3에 대한明確한 로드맵을 가지고 있습니다. 지난 3개월 동안의 주요 사건으로 인해, 오픈AI와 이미지 합성 공간의 다른 경쟁자들의 기업적 둔화는 이미 증발했을 것입니다. 이는 폐쇄적 이미지 합성 공간에서도 유사한 발전 속도를 기대할 수 있음을 의미합니다.
첫 번째로 게시됨: 2022년 10월 14일.












