AI 모델 및 플랫폼
EditGAN을 사용한 고정밀 의미론적 이미지 편집
생성적 적대적 네트워크 또는 GAN은 이미지 편집 산업에서 새로운 응용 프로그램을享受하고 있습니다.过去 몇 개월 동안, EditGAN은 고정밀, 고품질 의미론적 이미지 편집을 위한 새로운 방법으로 인공지능/기계 학습 산업에서 인기를 얻고 있습니다.
우리는 EditGAN 모델에 대해 자세히 이야기하고, 왜 그것이 의미론적 이미지 편집 산업에서 중요한 里程碑이 될 수 있는지 알려드리겠습니다.
그러면 시작하겠습니다. 그러나 EditGAN이 무엇인지 알기 전에, EditGAN의 중요성과 왜 그것이 중요한 발전인지 이해하는 것이 중요합니다.
왜 EditGAN?
전통적인 GAN 아키텍처는 인공지능 기반 이미지 편집 산업을 크게 발전시켰지만, GAN 아키텍처를 처음부터 구축하는 데 몇 가지 주요 문제가 있습니다.
- 훈련 단계에서, GAN 아키텍처는 의미론적 분할 주석이 있는 많은 레이블된 데이터를 필요로 합니다.
- 그들은 높은 수준의 제어만을 제공할 수 있습니다.
- 그리고 종종, 그들은 단지 이미지 사이를 앞뒤로 보냅니다.
관찰할 수 있듯이, 전통적인 GAN 아키텍처는 작업을 수행하지만, 광범위한 배포에 효과적이지 않습니다. 전통적인 GAN 아키텍처의 하위 효율성은 EditGAN이 2022년에 NVIDIA에 의해 도입된 이유입니다.
EditGAN은 고정밀, 고품질 의미론적 이미지 편집을 위한 효과적인 방법으로 제안되었습니다. 그것은 사용자가 이미지의 세분화된 마스크를 변경하여 이미지 편집을 허용하는 기능을 제공합니다. EditGAN이 이미지 편집 작업에 대해 확장 가능한 방법인 이유 중 하나는その 아키텍처 때문입니다.
EditGAN 모델은 GAN 프레임워크에 기반하여 이미지와 의미론적 분할을 공동으로 모델링하며, 레이블된 또는 주석이 달린 훈련 데이터가 거의 필요하지 않습니다. EditGAN의 개발자들은 이미지의 세분화된 마스크를 변경하여 이미지 편집을 수행하는 조건부 잠재 코드 최적화를 수행하기 위해 GAN의 잠재 공간에 이미지를 삽입하려고 시도했습니다. 또한, 최적화를 절약하기 위해, 모델은 잠재 공간에서 “편집 벡터”를 찾으려고 시도합니다.
EditGAN 프레임워크의 아키텍처는 모델이 임의의 수의 편집 벡터를 학습할 수 있도록 허용하며, 이는 다른 이미지에 직접 적용될 수 있습니다. 또한, 실험 결과는 EditGAN이 이미지 품질을 최대화하면서 이전에 본 적 없는 수준의 세부 편집을 수행할 수 있음을 나타냅니다.
EditGAN이 필요한 이유를 요약하면, 그것은 고정밀 편집, 레이블된 데이터가 거의 필요하지 않음, 실시간 시나리오에서 효과적으로 배포될 수 있음, 여러 편집을 동시에 수행할 수 있음, GAN 생성 이미지, 실제 이미지, 및 도메인 외부 이미지에서 작동할 수 있는 첫 번째 GAN 기반 이미지 편집 프레임워크입니다.
- 매우 높은 정밀도 편집.
- 레이블된 데이터가 거의 필요하지 않습니다.
- 실시간 시나리오에서 효과적으로 배포될 수 있습니다.
- 여러 편집을 동시에 수행할 수 있습니다.
- GAN 생성 이미지, 실제 이미지, 및 도메인 외부 이미지에서 작동할 수 있습니다.
고정밀 의미론적 이미지 편집 với EditGAN
StyleGAN2는 EditGAN의 주요 이미지 생성 구성 요소입니다. StyleGAN2 프레임워크는 다변량 정규 분포에서 추출된 잠재 코드를 실제 이미지로 매핑합니다.
StyleGAN2는 높은 품질의 이미지 합성을 위해 훈련된 깊은 생성 모델입니다. 또한, 모델링된 이미지에 대한 의미론적 이해를 얻습니다.
분할 훈련 및 추론
EditGAN 모델은 최적화 및 인코더를 사용하여 새로운 이미지에 대한 분할을 수행하고, 분할 브랜치를 훈련합니다. EditGAN 프레임워크는 이전 작업을 기반으로 구축되며, 인코더를 훈련하여 이미지들을 잠재 공간에 삽입합니다. 주요 목표는 샘플에서 GAN 및 실제 훈련 데이터를 사용하여 표준 픽셀별 L2 및 LPIPS 구성 손실을 사용하여 인코더를 훈련하는 것입니다. 또한, 모델은 GAN 샘플을 사용하여 인코더를 명시적으로 정규화합니다.
결과적으로, 모델은 데이터셋에서 레이블된 이미지들을 잠재 공간에 삽입하고, 분할 브랜치를 훈련하기 위해 교차 엔트로피 손실을 사용합니다.
잠재 공간에서 의미론적 편집을 사용하여 세분화 찾기
EditGAN의 주요 목적은 이미지 편집을 위한 의미론적 분할과 이미지의 공동 분포를 활용하는 것입니다. 예를 들어, 편집할 이미지가 필요합니다. 모델은 이미지를 EditGAN의 잠재 공간에 삽입하거나 모델 자체의 샘플 이미지를 사용합니다. 분할 브랜치는 해당 분할을 생성하며, RGB 이미지와 분할은 동일한 잠재 코드를 공유합니다. 개발자는 레이블링 또는 디지털 페인팅 도구를 사용하여 분할을 수정하고 편집할 수 있습니다.

추론 중 편집의 다른 방법
최적화를 사용하여 얻은 잠재 공간 편집 벡터는 의미론적으로 유의미하며, 종종 다른 속성과 분리됩니다. 따라서, 새로운 이미지를 편집하려면 모델은 이미지를 잠재 공간에 삽입하고, 이전에 학습한 동일한 편집 작업을 직접 수행할 수 있습니다. 모델이 학습한 편집 벡터는 초기 이미지 편집에 필요한 최적화를 절약합니다.
개발자가 아직 완벽하게 분리되지 않은 편집 벡터를 사용하여 다른 이미지에 대한 결과를 얻지 못하는 경우, 테스트 시간 동안 몇 가지 추가 최적화 단계를 수행하여 편집 아티팩트를 제거함으로써 문제를 해결할 수 있습니다.
현재까지의 학습에 따르면, EditGAN 프레임워크는 세 가지 다른 모드로 이미지를 편집할 수 있습니다.
- 편집 벡터를 사용한 실시간 편집
로컬라이즈된 이미지 및 분리된 이미지의 경우, 모델은 이전에 학습한 편집 벡터를 적용하여 이미지 편집을 수행하고, 상호작용하는 속도로 이미지 조작을 수행할 수 있습니다.
- 벡터 기반 편집을 위한 자체 감독 반복
로컬라이즈된 이미지의 경우, 모델은 이전에 학습한 편집 벡터를 초기화하여 이미지 편집을 수행하고, 테스트 시간 동안 몇 가지 추가 최적화 단계를 수행하여 편집 아티팩트를 제거합니다.
- 최적화 기반 편집
대규모 이미지 편집을 수행하려면, 모델은 처음부터 최적화를 수행합니다. 편집 벡터를 사용하여 이러한 종류의 전송을 다른 이미지에 수행할 수 없습니다.
구현
EditGAN 프레임워크는 네 가지 다른 카테고리(자동차, 새, 고양이, 얼굴)의 이미지에서 평가됩니다. 모델의 분할 브랜치는 각각 16, 30, 30, 16개의 레이블된 훈련 데이터를 사용하여 훈련됩니다. 이미지 편집을 최적화만으로 수행하거나 모델이 편집 벡터를 학습하려고 할 때, 모델은 100개의 최적화 단계를 수행합니다.
고양이, 자동차, 얼굴 데이터셋의 경우, 모델은 GAN 프레임워크의 테스트 세트에서 실제 이미지를 사용하여 편집 기능을 수행합니다. 이러한 이미지는 EditGAN의 잠재 공간에 삽입되거나 인코딩됩니다. 새 카테고리의 경우, 편집은 GAN 생성 이미지에서 수행됩니다.
결과
질적 결과
도메인 내 결과

위의 이미지는 모델이 이전에 학습한 편집 벡터를 새로운 이미지에 적용하고, 30개의 최적화 단계를 사용하여 이미지를 정제하는 경우의 EditGAN 프레임워크의 성능을 보여줍니다. EditGAN 프레임워크가 수행하는 편집 작업은 모든 클래스에서 분리되며, 이미지의 전반적인 품질을 유지합니다. 다른 프레임워크와의 비교 결과, EditGAN 프레임워크는 높은 정밀도 및 복잡한 편집을 수행하는 동시에 주제의 동일성과 이미지 품질을 유지하는 데 다른 방법보다 우수함을 나타냅니다.
驚くべき 것은 EditGAN 프레임워크가 매우 높은 정밀도의 편집을 수행할 수 있다는 것입니다. 예를 들어, 동공을 확대하거나 자동차의 타이어 스포크를 편집할 수 있습니다. 또한, EditGAN은 객체의 의미론적 부분을 편집하거나 대규모 수정을 수행할 수 있습니다. EditGAN 프레임워크의 여러 편집 작업은 GAN 훈련 데이터에 나타나지 않는 조작된 이미지를 생성할 수 있습니다.
도메인 외부 결과
EditGAN의 도메인 외부 성능을 평가하기 위해, 프레임워크는 MetFaces 데이터셋에서 테스트되었습니다. EditGAN 모델은 도메인 내 실제 얼굴을 사용하여 편집 벡터를 생성합니다. 모델은 MetFaces 초상화를 100개의 최적화 단계를 사용하여 삽입하고, 30개의 자체 감독 반복 단계를 사용하여 편집 벡터를 적용합니다. 결과는 다음 이미지를 참조하십시오.

양적 결과
EditGAN의 이미지 편집 능력을 양적으로 측정하기 위해, 모델은 MaskGAN에서 처음 도입된 미소 편집 벤치마크를 사용합니다. 중립적인 표현을 가진 얼굴을 미소가 있는 얼굴로 대체하고, 세 가지 매개변수에 대해 성능을 측정합니다.
- 의미론적 올바름
미소 속성 분류기를 사용하여 편집 후 이미지가 미소가 있는지 여부를 측정합니다.
- 분포 수준 이미지 품질
Kernel Inception Distance(KID) 및 Frechet Inception Distance(FID)를 계산하여 CelebA 테스트 데이터셋과 400개의 편집된 테스트 이미지를 비교합니다.
- 정체성 보존
편집 시 주제의 정체성을 보존하는 모델의 능력을 측정하기 위해 사전 훈련된 ArcFace 특징 추출 네트워크를 사용합니다.

위의 표는 EditGAN 프레임워크와 다른 기준 모델의 성능을 미소 편집 벤치마크에서 비교합니다. EditGAN 프레임워크가 이러한 높은 결과를 달성하는 방법은 세 가지 다른 기준과 비교합니다.
- MaskGAN
MaskGAN은 비미소 이미지를 입력으로 받고, 미소 분할 마스크와 함께 미소 분할 마스크를 받습니다. EditGAN과 비교할 때, MaskGAN은大量의 주석이 달린 데이터를 필요로 합니다.
- 로컬 편집
EditGAN은 로컬 편집과 비교합니다. 로컬 편집은 편집을 구현하기 위해 GAN 특징을 클러스터링하는 방법으로, 참조 이미지를 의존합니다.
- InterFaceGAN
InterFaceGAN은 EditGAN과 마찬가지로 잠재 공간에서 편집 벡터를 찾으려고 시도합니다. 그러나, InterFaceGAN은大量의 주석이 달린 데이터, 보조 속성 분류기, 미세 편집 정밀도를 필요로 합니다.
- StyleGAN2Distillation
이 방법은 실제 이미지 삽입이 필요하지 않은 대체 접근 방식을 생성합니다. 대신, 편집 벡터 모델을 사용하여 훈련 데이터셋을 생성합니다.

제한
EditGAN은 GAN 프레임워크에 기반하므로, 다른 GAN 모델과 동일한 제한이 있습니다. 즉, GAN이 모델링할 수 있는 이미지만으로 작동할 수 있습니다. EditGAN이 다른 시나리오에서 작동하기 어렵게 만드는 주요 이유는 GAN 모델링된 이미지로만 작동할 수 있다는 것입니다. 그러나, EditGAN의 고정밀 편집은 편집 벡터를 사용하여 다른 이미지로 쉽게 전달될 수 있습니다.
결론
GAN이 이미지 편집 분야에서 산업 표준이 아닌 주요 이유는 제한된 실제성이 때문입니다. GAN 프레임워크는通常大量의 주석이 달린 훈련 데이터를 필요로하며, 효율성과 정확도가 높은 성능을 반환하지 않습니다.
EditGAN은 전통적인 GAN 프레임워크가 제시하는 문제를 해결하려고 시도합니다. 또한, 고품질, 고정밀 의미론적 이미지 편집을 위한 효과적인 방법으로 작용하려고 시도합니다. 지금까지의 결과는 EditGAN이 주장하는 바를 제공하며, 이미 일부 현재 산업 표준 관행 및 모델보다 더 잘 수행하고 있음을 나타냅니다.












