Anderson의 관점
SofGAN: 더 큰 제어력을 제공하는 GAN 기반 얼굴 생성기

상하이와 미국의 연구자들은 개별 요소인 모발, 눈, 안경, 질감 및 색상에 대한 이전에 없는 수준의 제어를 허용하는 GAN 기반 초상화 생성 시스템을 개발했습니다.
시스템의 다용도를 보여주기 위해, 창조자들은 사용자가 직접 의미론적 분할 요소를 그릴 수 있는 포토샵 스타일 인터페이스를 제공했습니다. 이 요소들은 실제 이미지로 재해석되며, 기존 사진 위에 직접 그리더라도 얻을 수 있습니다.
다음 예에서는 다니엘 래드클리프의 사진을 트레이싱 템플릿으로 사용합니다(목표는 그를 닮은 이미지를 생성하는 것이 아니라 일반적으로 사진과 같은 이미지를 생성하는 것입니다). 사용자가 다양한 요소를 채워 넣을 때, 안경과 같은 별개의 요소들이 식별되고 출력 이미지가 해석됩니다:

SofGAN 생성된 초상화를 위해 하나의 이미지를 트레이싱 자료로 사용합니다. 출처: https://www.youtube.com/watch?v=xig8ZA3DVZ8
이 논문은 SofGAN: 다이나믹 스타일링을 갖춘 초상화 이미지 생성기라는 제목을 가지고 있으며, Anpei Chen과 Ruiyang Liu가 이끄는 ShanghaiTech University와 University of California at San Diego의 연구자 4명이 참여했습니다.
특징 분리
이 연구의 주요 기여는 사용자 친화적인 UX를 제공하는 것이 아니라, 학습된 얼굴 특징의 특징을 ‘분리’하는 것입니다. 이는 SofGAN이 카메라 시점에서 간접적인 각도로 얼굴을 생성할 수 있도록 합니다.

기존의 GAN 기반 얼굴 생성기와 달리, SofGAN은 훈련 데이터에 있는 각도 배열의 제한 내에서 자유롭게 시점을 변경할 수 있습니다. 출처: https://arxiv.org/pdf/2007.03780.pdf
질감이 기하학에서 분리되므로, 얼굴 모양과 질감을 별개의实체로 조작할 수 있습니다. 이는 사실적으로 얼굴의 인종을 변경하는 것을 가능하게 합니다. 이는 의료 데이터셋의 편향을 해결하기 위한 유용한 응용이 될 수 있습니다.

SofGAN은 또한 인공 노화와 세부적인 수준에서 일관된 스타일 조정을 지원합니다. 이는 NVIDIA의 GauGAN이나 Intel의 게임 기반 신경 렌더링 시스템과 같은 다른 분할>이미지 시스템에서 볼 수 없는 수준입니다.

SofGAN은 반복적인 스타일로 노화를 구현할 수 있습니다.
SofGAN의 또 다른 혁신은 훈련에 실제 이미지와 분할된 이미지의 페어가 필요하지 않다는 것입니다. 대신, 실제 세계의 비페어 이미지에서 직접 훈련할 수 있습니다.
연구자들은 SofGAN의 ‘분리’ 아키텍처가 전통적인 이미지 렌더링 시스템에서 영감을 받았다고 말합니다. 시각 효과 워크플로우에서, 합성의 요소는 가장 작은 구성 요소까지 분해됩니다.
의미론적 점유 필드 (SOF)
이것을 기계 학습 이미지 합성 프레임워크에서 달성하기 위해, 연구자들은 의미론적 점유 필드(SOF)를 개발했습니다. 이는 전통적인 점유 필드의 확장으로, 얼굴 초상화의 구성 요소를 개별화합니다. SOF는 校正된 다중 뷰 의미론적 분할 맵에서 훈련되었지만, 그라운드 트루스 감시 없이 진행되었습니다.

단일 분할 맵(하단 왼쪽)에서 여러 반복입니다.
추가로, 2D 분할 맵은 SOF의 출력을 레이 트레이싱하여 얻어지며, 이후 GAN 생성기로 텍스처링됩니다. ‘합성’ 의미론적 분할 맵은 또한 3층 인코더를 통해 저차원 공간으로 인코딩되어 시점이 변경될 때 연속적인 출력을 보장합니다.
훈련 方案은 각 의미론적 영역에 대해 두 개의 랜덤 스타일을 공간적으로 혼합합니다:
연구자들은 SofGAN이 현재 대안적인 최첨단 접근법보다 더 낮은 프레체트 인셉션 거리(FID)를 달성하며, 또한 더 높은 학습된 지각적 이미지 패치 유사성(LPIPS) 지표를 달성한다고 주장합니다.
이전의 StyleGAN 접근법은 종종 특징 얽힘으로 인해 방해를 받았습니다. 여기서 이미지의 구성 요소는 서로 неразрывно 결합되어 있으며, 원하는 요소와 함께 원치 않는 요소가 함께 나타날 수 있습니다(예: 귀고리와 같은 경우).

레이 마칭은 의미론적 분할 맵의 볼륨을 계산하여 다중 시점을 가능하게 합니다.
데이터셋 및 훈련
SofGAN의 다양한 구현을 개발하기 위해 세 가지 데이터셋이 사용되었습니다: CelebAMask-HQ, NVIDIA의 Flickr-Faces-HQ(FFHQ), 그리고 122개의 초상화 스캔으로 구성된 자체 제작 데이터셋.
SOF는 세 개의 훈련 가능한 서브모듈로 구성됩니다: 하이퍼넷, 레이 마처, 분류기. 프로젝트의 SIW 스타일 GAN 생성기는 StyleGAN2와 유사한 방식으로 구성됩니다. 데이터 증강은 랜덤 스케일링 및 크로핑을 통해 적용되며, 훈련에는 경로 정규화가 4단계마다 적용됩니다. 전체 훈련 절차는 22일 동안 4개의 RTX 2080 Ti GPU에서 800,000 반복을 달성하기 위해 수행되었습니다.
논문에는 2080 카드의 구성에 대한 언급이 없습니다. 이는 11GB-22GB VRAM을 수용할 수 있으며, 이는 SofGAN을 훈련하기 위해 거의 한 달 동안 사용된 총 VRAM이 44GB-88GB 사이임을 의미합니다.
연구자들은 일반화된 결과가 훈련 초기에 나타났으며, 이는 1500 반복, 3일의 훈련 후에 시작되었다고 관찰합니다. 훈련의 나머지 부분은 미세한 세부 사항을 얻기 위해 예상대로 천천히 진행되었습니다.
SofGAN은 NVIDIA의 SPADE와 Pix2PixHD, SEAN과 같은 라이벌 방법보다 단일 분할 맵에서 더 현실적인 결과를 달성합니다.
아래는 연구자들이 공개한 비디오입니다. 프로젝트 페이지에서 더 많은 자체 호스팅 비디오를 찾을 수 있습니다.














