Anderson의 관점

얼굴 합성의 시맨틱 세그먼테이션 오케스트레이션

mm
Unite.AI를 Google의 선호 소스에 추가

GAN(Generative Adversarial Network)을 사용하여 사람의 얼굴을 만드는 문제는 실제 데이터에서 유래한 가짜 이미지에 불필요한 요소들이 포함되어 있다는 것이다. 이러한 요소들은 머리카락, 배경, 안경, 모자, 귀고리 등이며, 이러한 요소들이 얼굴과 함께 하나의 정체성으로 결합되어 버린다.

대부분의 GAN 아키텍처에서는 이러한 요소들이 별도의 공간에서 주소할 수 없으며, 얼굴과 함께密接하게 연관되어 있다.

또한, GAN으로 생성된 얼굴의 특정 부분을 변경하는 것이 어렵다. 예를 들어, 눈의 크기를 줄이거나, 코의 길이를 늘리거나, 머리카락의 색상을 변경하는 것이 경찰의 스케치 아티스트처럼 할 수 없다.

그러나, 이미지 합성 연구 분야에서는 이러한 문제를 해결하기 위해 노력하고 있다.

새로운 연구에서 GAN 기반 얼굴 생성을 위해 다양한 섹션을 별도의 생성기로 분리하여, 각 섹션에 대한 제어를 가능하게 하였다. 중간 행에서는 추가적인 얼굴 영역을 구축하는 오케스트레이팅 '피처 맵'을 볼 수 있다. 출처: https://arxiv.org/pdf/2112.02236.pdf

새로운 연구에서 GAN 기반 얼굴 생성을 위해 다양한 섹션을 별도의 생성기로 분리하여, 각 섹션에 대한 제어를 가능하게 하였다. 중간 행에서는 추가적인 얼굴 영역을 구축하는 오케스트레이팅 ‘피처 맵’을 볼 수 있다. 출처: https://arxiv.org/pdf/2112.02236.pdf

새로운 연구에서, 바이트댄스(ByteDance)의 미국 지사 연구진은 시맨틱 세그먼테이션을 사용하여 얼굴의 구성 요소를 별도의 섹션으로 분리하여, 각 섹션에 대한 제어를 가능하게 하였다.

이 연구는 SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing이라는 제목의 논문으로, 다양한 예시를 포함한 프로젝트 페이지가 있다.

얼굴의 특정 부분을 변경할 때, 이전에는 함께 변경되던 배경이나 다른 요소들이 함께 변경되지 않는다.

얼굴의 특정 부분을 변경할 때, 이전에는 함께 변경되던 배경이나 다른 요소들이 함께 변경되지 않는다.

제어할 수 없는 잠재 공간

GAN을 사용하여 얼굴을 생성하는 경우, 실제 데이터에서 유래한 특징들 사이에 복잡한 상관관계가 형성된다. 이러한 특징들은 ‘잠재 코드’라고 불리며, 전체적으로 ‘잠재 공간’을 형성한다. 이러한 잠재 코드들은 분석하기 어렵고, 따라서 제어하기 어렵다.

최근에 새로운 이미지 합성 프로젝트가 등장하여, 이 잠재 공간을 매핑하고, 이를 사용하여 상호작용적으로 탐색하는 것을 시도하고 있다.

다양한 GAN 아키텍처가 제안되어 왔으며, 이러한 아키텍처들은 잠재 공간에 대한 제어를 가능하게 하려고 시도하고 있다. 이러한 아키텍처에는 InterFaceGAN, StyleFlow, GANSpace, StyleRig 등이 있다.

잠재 공간을 분할하고 정복하기

바이트댄스 연구진은 다른 접근 방식을 사용하였다. 단일 GAN이 전체 얼굴 이미지에 대한 제어를 시도하는 대신, 얼굴을 별도의 섹션으로 분리하여, 각 섹션에 대한 제어를 가능하게 하였다.

이러한 섹션을 분리하기 위해, Fourier Features를 사용하여 시맨틱 세그먼테이션 맵을 생성하였다. 이 맵은 얼굴의 다양한 부분을 구분하기 위한 것이다.

새로운 접근 방식의 아키텍처. 이 아키텍처는 얼굴에 대한 제어를 가능하게 하기 위해, 시맨틱 세그먼테이션을 사용하여 얼굴을 분리한다.

새로운 접근 방식의 아키텍처. 이 아키텍처는 얼굴에 대한 제어를 가능하게 하기 위해, 시맨틱 세그먼테이션을 사용하여 얼굴을 분리한다.

이 아키텍처는 얼굴을 분리하여, 각 섹션에 대한 제어를 가능하게 한다. 이 접근 방식은 이전의 접근 방식과 다르며, 잠재 공간에 대한 제어를 가능하게 한다.

배경을 대체하기

이 프로젝트의 목표는 생성된 환경에 대한 제어를 가능하게 하는 것이다. 이를 위해, 렌더링/구성 프로세스에는 실제 이미지에서 학습된 배경 생성기가 포함되어 있다.

이 배경 생성기는 실제 이미지에서 학습된 배경을 생성하기 위해 사용된다. 이 배경은 얼굴과 함께 구성되어, 전체적인 이미지를 생성한다.

학습 및 데이터

이 모델은 CelebAMask-HQ 데이터셋의 초기 28,000개의 이미지에서 학습되었다. 이 데이터셋은 256×256 픽셀로 리사이즈되어, 학습 공간을 축소하였다.

다양한 모델이 학습되었으며, 다양한 도구와 아키텍처가 실험되었다. 이 프로젝트의 가장 큰 모델은 512×512 해상도에서 2.5일 동안 8개의 NVIDIA Tesla V100 GPU에서 학습되었다. 학습 후, 단일 이미지의 생성에는 0.137초가 소요되었다.

임시 해결책?

연구진은 이 접근 방식이 다른 도메인에도 적용될 수 있다고 주장한다. 그러나, 클래스의 수가 증가할수록, 이 접근 방식은 최적화 без дальнейшего 작업으로는 불가능할 수 있다.

현재 잠재 공간을 직접적으로 정복하려는 관심이 알케미와 같은 것인지, 아니면 잠재 코드가 궁극적으로 해석되고 제어될 수 있는지에 대해서는 아직 불분명하다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai