Anderson의 관점
GAN의 잠재 공간을 ‘Blob’로 편집하기

UC 버클리와 Adobe (ADBE ) 의 새로운 연구는 GAN(Generative Adversarial Network)이 생성할 수 있는 초현실적인 콘텐츠를 직접 편집할 수 있는 방법을 제공합니다. 그러나 이러한 콘텐츠는 일반적으로 Photoshop 사용자나 CGI 전문가가 익숙한 방식으로 제어, 애니메이션, 또는 자유롭게 조작할 수 없습니다.
이 방법은 BlobGAN이라고 불리며, GAN의 잠재 공간 내에서 직접 콘텐츠를 매핑하는 수학적 구조인 ‘blob’의 격자를 생성하는 것입니다.
blob를 이동함으로써, 사용자는 장면 표현 내의 ‘객체’를 직관적인 방식으로 이동할 수 있습니다. 이는 CGI 및 CAD 방법에 더 가깝고, 현재의 많은 GAN의 잠재 공간을 매핑하고 제어하는 시도보다 더 나은 접근 방식입니다.

BlobGAN을 사용한 장면 조작: 사용자가 blob를 이동하면 GAN의 잠재 객체와 스타일이 해당ingly 변경됩니다. 더 많은 예시를 보려면 이 기사의 끝에 첨부된 비디오 또는 https://www.youtube.com/watch?v=KpUv82VsU5k를 참조하세요.
blob는 장면 내의 ‘객체’를 나타내며, GAN의 잠재 공간에 매핑됩니다. 따라서 모든 객체는 a priori 분리되어 있으며, 개별적으로 변경할 수 있습니다.

객체를 크기 조정, 축소, 복제, 삭제 등 다양한 작업을 수행할 수 있습니다.
사진 편집 소프트웨어 또는 텍스트 편집 소프트웨어의 객체와 마찬가지로, blob를 복제하고 이후 조작할 수 있습니다.

BlobGAN에서 blob를 복제하여 해당하는 잠재 표현을 ‘복사 및 붙여넣기’할 수 있습니다. 출처: https://dave.ml/blobgan/#results
BlobGAN은 또한 새로운 사용자 선택 이미지들을 잠재 공간으로 파싱할 수 있습니다.

BlobGAN을 사용하면 이미지들을 직접 편집할 수 있습니다. 출처: https://dave.ml/blobgan/#results
더 많은 결과를 보려면 여기를 참조하거나, 이 기사의 끝에 첨부된 YouTube 비디오를 시청하세요. 또한 대화형 Colab 데모*와 GitHub 리포지토리**도 있습니다.
이러한 종류의 도구는 포토샵 이후의 시대에 너무나 단순해 보일 수 있습니다. 그러나 이는 GAN의 잠재 공간의 특이성과 미지의 본질을 다루는 데 있어 유망한 접근 방식입니다.
저자들은 다음과 같이 주장합니다:
‘다중 카테고리 데이터셋에서 BlobGAN은 Style-GAN2보다 이미지 품질에서 우수합니다.’
이 논문은 BlobGAN: Spatially Disentangled Scene Representations라고 제목이 붙여져 있으며, UC 버클리와 Adobe Research의 연구자들이共同으로 작성했습니다.
중간자
BlobGAN은 GAN 이미지 합성에 새로운 패러다임을 가져옵니다. 이전의 접근 방식은 GAN의 잠재 공간 내의离散 엔티티를 다루는 데 있어 상위 또는 하위 접근 방식을 사용했습니다.
상위 접근 방식은 이미지들을 클래스로 취급하며, 텍스트/이미지 페어링을 통해 새로운 이미지 합성 프레임워크를 구축합니다.
하위 접근 방식은 이미지의 각 픽셀을 클래스, 레이블 또는 카테고리로 매핑합니다.
저자들은 다음과 같이 주장합니다:
‘이 두 가지 접근 방식은 모두 불만족스럽습니다. 왜냐하면 둘 다 장면의 부분을 엔티티로 간단하게 추론하는 방법을 제공하지 않기 때문입니다. 장면의 부분은 단일 엔티티로 결합되거나 개별 픽셀 레이블에서 그룹화되어야 합니다.’
BlobGAN은 대신 중간 수준 표현 또는 생성 모델을 위한 프록시 프레임워크를 제공합니다.

레이아웃 네트워크는 로컬 ‘blob’ 엔티티를 잠재 코드에 매핑합니다. 중앙의 색상 원은 ‘blob 맵’을 구성합니다. 출처: https://arxiv.org/pdf/2205.02837.pdf
가우시안 노이즈 기반의 blob는 깊이 순서대로 정렬되어 있으며, 각 엔티티에 매핑을 할당하는 병목현상을 나타내며, 이는 GAN 콘텐츠 조작의 가장 큰 장애물인 분리성을 해결합니다. 결과적인 ‘blob 맵’은 BlobGAN의 디코더를 조작하는 데 사용됩니다.
저자들은 다음과 같이 주장합니다:
시스템은 명시적인 레이블을 사용하지 않는 오프-더-셸프 디스크리미네이터를 통해 장면을 레이아웃과 엔티티로 분리하는 것을 학습합니다.
아키텍처 및 데이터
blob 맵의 엔티티는 수정된 StyleGAN2 파생 네트워크를 통해 이미지로 변환됩니다. 이는 NVIDIA (NVDA ) 의 이전 연구에서 영감을 받은 접근 방식입니다.

NVIDIA Research의 수정된 StyleGAN 2 파생물. 일부 원리는 BlobGAN에서 채택되거나 수정되었습니다. 출처: https://arxiv.org/pdf/1912.04958.pdf
StyleGAN 2는 BlobGAN에서 수정되어 blob 맵에서 입력을 받습니다.

BlobGAN을 사용한 조작 예시. 사용자는 blob 맵을 통해 장면을 편집할 수 있습니다.
이러한 접근 방식은 BlobGAN이 콘텐츠와 위치를 분리하는 데 도움이 됩니다. 이는 BlobGAN의 주요 혁신입니다.
* 작성 당시 기능이 작동하지 않음
最初에 2022년 5월 8일에 게시되었습니다.












