Anderson의 관점
GAN 생성 얼굴을 위한 플라스틱 수술

한국의 새로운 연구는 생성적 적대적 네트워크(GAN)로 생성된 합성 얼굴 데이터의 품질을 개선하는 것을 약속합니다.
이 시스템은 GAN 프로세스에서 생성된 이미지 아티팩트를 식별하고 수정할 수 있으며, 모자로 가려진 머리카락을 대체하거나, 원본에서 완전히 누락된 얼굴의 일부를 대체하거나, 손이나 선글라스를 포함한 오clusion을 제거하는 등 잘 작동합니다. 또한风景 및 건축물 출력에서도 잘 작동합니다.

각 열의 왼쪽에 원본 GAN 출력과 결함이 있습니다. 두 번째와 세 번째 열은 다른 접근 방식이며, 네 번째 열은 한국 연구자들이 사용한 방법입니다. 출처: https://arxiv.org/pdf/2104.06118.pdf
최근의 대부분의 접근 방식은 GAN 생성 이미지의 품질을 개선하는 데 있어 아티팩트가 프로세스의 직업병이라는 입장을 취하고 있으며, 더 사이키델릭하거나 畸形的な 결과를 생성할 수 있는 메소드를 취급하는 것입니다.
대신, 한국의 연구는 영향을 받은 이미지를 실제로 ‘수정’하는 방식을 제안합니다. 이는 생성 체인을 방해하지 않으며, 아티팩트를 생성하는 단위를 식별하고, 반감시킨 수준에서 GAN 네트워크의 영향을 줄이거나 제거합니다.
이 프로젝트를 위해, 연구자들은 GAN 아티팩트에 의해 심하게 영향을 받은 이미지의 광범위하게 적용 가능한 手注データ셋을 생성해야 했습니다. 초기에, 연구자들은 Frechet Inception Distance (FID)를 사용했습니다. 이는 이미지의 품질을 평가하는 메트릭으로, 이미지의 특징을 비교합니다. 200,000개의 이미지 중 10,000개의 이미지에最高의 FID 점수를 사용하여 ‘아티팩트 단위’로 사용했습니다. 이후, 연구자들은 2,000개의 생성된 이미지를 手注했습니다. 각 이미지를 ‘정상’ 또는 FID 아티팩트에 의해 영향을 받은 것으로 분류했습니다. 이후, 데이터셋을 아티팩트, 정상, 무작위 실제 샘플로 분류하는 모델을 생성했습니다.
이후, Gradient-weighted Class Activation Mapping (Grad-CAM)을 사용하여 아티팩트에 영향을 받은 영역에 대한 마스크를 생성했습니다. 이는 결함을 자동으로 레이블링하는 것을 가능하게 했습니다.
위의 이미지에서, Grad-CAM 마스크가 LSUN-Church outdoor 데이터셋과 CelebA-HQ 데이터셋에 적용되었습니다.
20,000개의 이미지 중 상위 20개의 결과를 분석하여, 세분화 마스크를 생성했습니다. 이는 생성된 결과 중에서 더 정확하거나 설득력 있는 결과를 대체할 수 있습니다. 아티팩트를 생성하는 단위의 활성화를 낮추면, 이후의 생성에서 더 나은 결과를 얻을 수 있습니다.
인간의 평가에서, ‘수정된’ 이미지 중 53%가 ‘정상’으로 레이블링되었습니다. 원본 이미지 중 97%는 여전히 원본보다 개선되었습니다.
연구자들은 이 방법이 NVIDIA의 StyleGAN2에도 적용될 수 있다고 주장합니다.
합성 데이터의 이점
주로 얼굴 데이터에 관해, 실제 세계 데이터셋의 일반적인 부족은 컴퓨터 비전 연구에서 중요한 분야인 얼굴 인식, 감정 인식, 의료 연구, 얼굴의 지형학적 세분화 연구 등 다양한 분야에서 연구를 방해하는障害입니다.
웹에서 데이터를 무료로 사용하는 것에 대한 반발과 실제 얼굴 이미지의 수집이 법적 문제를 일으킬 수 있으므로, 이러한 연구를進行하는 데 있어 추가적인 장애물이 됩니다. 많은 국가와 국가들이 법적 조치를 취하고 있으며, 웹 스크래핑과 소셜 미디어 이미지의 사용을 금지하고 있습니다.
過去 10년 동안, 몇몇의 잘 관리된 얼굴 데이터셋이 이러한 불확실성으로부터의 피난처를 제공했습니다. 그러나 이러한 데이터셋을 중심으로 연구 프로젝트가 진행됨에 따라, 연구 결과가 이러한 데이터셋에 특화된 메소드에 따라 편향되는 문제가 발생했습니다. 이는 새로운 연구가 이러한 데이터셋에만 국한되는 결과를 초래하며, 이는 매년 이러한 데이터셋의 다양성이 줄어드는 결과를 가져옵니다.
또한, 이러한 ‘전통적인’ 데이터셋 중 일부는 인종적 다양성이 부족하다는 비판을 받았습니다. 이는 이러한 벤치마크가 향후 적합한 자원으로 간주되지 않을 수 있음을 시사합니다.
이것은 실제 세계 이미지에서 멀리 떨어진 합성 얼굴 데이터의 필요성을 나타냅니다. 이러한 데이터는 실제 세계 이미지의 사용으로 인해 발생할 수 있는 문제를 피할 수 있습니다. 이러한 사용은 향후 데이터 수집을 위한 법적 및 기술적 메커니즘의 발전에 따라 발생할 수 있는 문제를 피할 수 있습니다. 또한, 이러한 데이터는 실제 사람의 이미지를 사용하는 것보다 더 작은 위험이 있습니다.














