Anderson의 관점
‘저하된’ 합성 얼굴은 얼굴 이미지 인식을 개선하는데 도움이 될 수 있다

미시간 주립 대학교의 연구자들은 딥페이크 현장에서 휴식을 취하고 세계에서 좋은 일을 하는 방법을 고안해냈는데, 그것은 이미지 인식 시스템이 더 정확해지도록 도와주는 것이다. 그들은 실제 세계의 비디오 감시 영상과 같은 스타일로 얼굴을 재생성할 수 있는 새로운 제어 가능한 얼굴 합성 모듈(CFSM)을 개발했다. 이것은 유명인들의 고해상도 이미지로 구성된 인기 있는 오픈 소스 데이터셋에 의존하는 대신, 실제 CCTV 시스템의 결점과 한계를 반영하지 않는다. 이러한 요인들은 인식 정확도를影响할 수 있다.
CFSM은 딥페이크 시스템의 목표와 같은 머리 자세, 표정 또는 다른 특징을 실제로 시뮬레이션하는 것을 목표로 하지 않는다. 대신, 스타일 전송을 사용하여 목표 인식 시스템의 스타일로 대체 보기의 범위를 생성한다. 시스템은 목표 시스템의 스타일 도메인을 모방하고 출력을 해당 도메인의 해상도와 특이성에 따라 적응하도록 설계되었다. 사용 사례에는 비용으로 인해 업그레이드되지 않을 가능성이 있는 레거시 시스템이 포함되며, 현재 새로운 얼굴 인식 기술에 기여할 수 없다.
연구자들은 시스템을 테스트했으며, 시스템이 이러한 종류의 노이즈가 많은 데이터와 함께 작동하는 이미지 인식 시스템의 현재 상태를 개선했다는 것을 발견했다.

목표 시스템의 제한에 적응하도록 얼굴 인식 모델을 훈련시키는 과정. 출처: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf
또한 그들은 이 프로세스의 유용한 부작용을 발견했는데, 대상 데이터셋을 특성화하고 서로 비교할 수 있게 되었다는 것이다. 이것은 다양한 CCTV 시스템을 위한 맞춤형 데이터셋을 생성하고 벤치마크를 더 쉽게 할 수 있도록 한다.
さらに, 이 방법은 기존 데이터셋에 적용되어 사실上的 도메인 적응을 수행하고 얼굴 인식 시스템에 더 적합한 데이터셋을 생성할 수 있다.
새로운 논문은 제어 가능한 및 안내된 얼굴 합성 для 제약 없는 얼굴 인식이라는 제목을 가지고 있으며, 미국 국방 정보국(ODNI, IARPA에서)의 지원을 받았으며, 미시간 주립 대학교 컴퓨터 과학 및 엔지니어링 부서의 4명의 연구자에 의해 수행되었다.
특징 콘텐츠
저품질 얼굴 인식(LQFR)은 최근 몇 년 동안 주목할 만한 연구 분야가 되었다. 시민 및 지방 당국이 비디오 감시 시스템을 내구성과 장기적인 사용을 위해 구축했기 때문에, 많은 ‘레거시’ 감시 네트워크는 기술 부채의 희생자가 되었다. 즉, 기계 학습을 위한 데이터 소스로 적응하는 데 한계가 있다.

歴史적인 비디오 감시 시스템과 최근 시스템에서의 얼굴 해상도의 다양한 수준. 출처: https://arxiv.org/pdf/1805.11519.pdf
幸い, 이것은 확산 모델과 다른 노이즈 기반 모델이异常으로 잘 해결할 수 있는 작업이다. 최근 몇 년 동안 가장 인기 있고 효과적인 이미지 합성 시스템은 파이프라인의 일부로 저해상도 이미지의 업스케일링을 수행한다. 이것은 또한 신경망 압축 기술에 필수적이다(이미지와 동영상을 비트맵 데이터 대신 신경망 데이터로 저장하는 방법).
얼굴 인식의 한 가지 도전은 최소한의 특징을 추출하여 저해상도 이미지에서 최대 정확도를 얻는 것이다. 이것은 기술적인 제한으로 인해 모델을 훈련하는 데 사용되는 로컬 GPU의 VRAM 크기에 따라 이미지의 크기가 제한되기 때문이다.
이 경우, ‘특징’이라는 용어는 혼동을 일으킬 수 있다. 컴퓨터 비전 분야에서 ‘특징’은 이미지에서 얻은 구별되는 특징을 의미한다.
연구자들은 시스템을 테스트했으며, 시스템이 이러한 종류의 노이즈가 많은 데이터와 함께 작동하는 이미지 인식 시스템의 현재 상태를 개선했다는 것을 발견했다.
연구자들은 시스템을 테스트했으며, 시스템이 이러한 종류의 노이즈가 많은 데이터와 함께 작동하는 이미지 인식 시스템의 현재 상태를 개선했다는 것을 발견했다.
테스트
연구자들은 MSU의 이전 연구를 테스트에 대한 템플릿으로 사용했다. 동일한 실험 프로토콜을 기반으로, mereka는 웹에서 수집된 유명인 사진으로 구성된 MS-Celeb-1m을 레이블된 훈련 데이터셋으로 사용했다.
目标 데이터는 홍콩 중국 대학의 WiderFace 데이터셋이었다. 이 데이터셋은 어려운 상황에서의 얼굴 감지 작업을 위한 다양한 이미지로 구성되었다.
평가를 위해, 시스템은 네 가지 얼굴 인식 벤치마크에 대해 테스트되었다: IJB-B, IJB-C, IJB-S, 및 TinyFace.
CFSM은 약 10%의 MS-Celeb-1m 훈련 데이터, 약 40만 개의 이미지, 32 배치 크기에서 1e-4의 학습률로 125,000 반복으로 훈련되었다.
目标 얼굴 인식 모델은 ResNet-50의 수정된 버전을 백본으로 사용했으며, 훈련 중에 ArcFace 손실 함수가 활성화되었다.
연구자들은 시스템을 테스트했으며, 시스템이 이러한 종류의 노이즈가 많은 데이터와 함께 작동하는 이미지 인식 시스템의 현재 상태를 개선했다는 것을 발견했다.
연구자들은 시스템을 테스트했으며, 시스템이 이러한 종류의 노이즈가 많은 데이터와 함께 작동하는 이미지 인식 시스템의 현재 상태를 개선했다는 것을 발견했다.
요약
연구자들은 시스템을 테스트했으며, 시스템이 이러한 종류의 노이즈가 많은 데이터와 함께 작동하는 이미지 인식 시스템의 현재 상태를 개선했다는 것을 발견했다.
연구자들은 시스템을 테스트했으며, 시스템이 이러한 종류의 노이즈가 많은 데이터와 함께 작동하는 이미지 인식 시스템의 현재 상태를 개선했다는 것을 발견했다.
* 저자의 인라인 인용을 하이퍼링크로 변환했습니다.
2022년 8월 1일 처음 게시되었습니다.















