Anderson의 관점
GAN의 잠재 공간 매핑의 의도하지 않은 이점

중국과 호주 연구자들은 AI 생성 이미지의 품질과 충실도를 개선하려고 노력하면서 Generative Adversarial Network (GAN)의 잠재 공간을 상호 작용적으로 제어하는 방법을 우연히 발견했습니다. 이는 영화, 게임, 소셜 미디어 등 엔터테인먼트와 연구 분야에서 새로운 이미지 합성 기술을革命할 것입니다.
연구자들의 발견은 프로젝트의 중심 목표의 부산물로, 사용자가 마우스를 사용하여 GAN의 잠재 공간을 임의로 탐색할 수 있도록 합니다. 이는 비디오를 스크럽하거나 책을 넘기는 것과 같습니다.

연구자들의 동영상에서 가져온 예시입니다. 사용자가 ‘잡기’ 커서를 사용하여 변환을 조작하는 것을注意하세요. 출처: https://www.youtube.com/watch?v=k7sG4XY5rIc
이 방법은 ‘열 지도’를 사용하여 이미지의 어떤 영역을 개선해야 하는지 GAN에 알려줍니다. 열 지도는 GAN이 같은 데이터셋을 수천 번 또는 수십만 번 실행할 때 이미지 품질을 개선하는 데 사용됩니다. 그러나 이 또한 GAN의 잠재 공간을 탐색할 수 있는 ‘지도’를 제공합니다.

GradCAM을 사용하여 공간적 시각적 주의를 강조합니다. 이는 밝은 색상을 사용하여 주의가 필요한 영역을 나타냅니다. 출처: https://arxiv.org/pdf/2112.00718.pdf
연구자들의 논문은 Improving GAN Equilibrium by Raising Spatial Awareness입니다. 이는 중국 홍콩 대학과 호주 국립 대학의 연구자들이 작성했습니다. 논문 외에도 프로젝트 페이지에서 비디오와 기타 자료를 찾을 수 있습니다.
연구는 초기 단계에 있으며 현재 저해상도 이미지(256×256)로 제한되어 있습니다. 그러나 이는 잠재 공간의 ‘블랙 박스’를 개방하는 것을 약속하며, 여러 연구 프로젝트가 이미지 합성에 대한 더 큰 제어를 위해 그 문을 두드리고 있습니다.
이러한 이미지들은 매력적이지만(그리고 이 기사의 끝에 임베드된 비디오에서 더 많은 예시를 볼 수 있습니다), 더 중요한 것은 프로젝트가 이미지 품질을 개선하고 잠재적으로 더 빠르게 할 수 있는 방법을 발견했다는 것입니다. 이는 GAN에 특정 영역에서 무엇이 잘못되었는지 알려주는 것입니다.
그러나 Adversarial이라는 단어가 암시하듯이, GAN은 단일 엔티티가 아닙니다. 이는 권위와 노동 사이의 불균형한 충돌입니다. 이러한 전쟁이 지금까지 어떻게 특징지어졌는지 이해하기 위해, GAN의 두 구성 요소인 생성기와 판별기에 대해 살펴보겠습니다.
생성기의 가련한 운명
만약 당신이 어떤 새로운 의류를 샀는데 그것이 어떤 나라에서 착취된 노동으로 만들어졌을까 하는 생각에 괴로워했다면, 또는 당신이 항상 ‘다시 해보세요’라고 말하는 상사나 고객이 있었다면, GAN의 생성기 부분에 조금의 동정을 보내세요.

생성기는 지난 5년 동안 GAN이 사진실적 인물, 업계용 비디오 게임, 고해상도 영상을 생성하는 데 도움을 주었습니다. 그러나 생성기는 이러한 이미지를 생성하기 위해 수천 번 또는 수십만 번의 반복을 거칩니다.

GAN이 생성한 예시입니다. 사진실적 인물, 업계용 비디오 게임, 고해상도 영상 등입니다.
생성기는 이러한 반복을 통해 점점 더 좋은 이미지를 생성하려고 노력합니다. 그러나 생성기는 어떻게 하면 더 좋은 이미지를 생성할 수 있는지 알지 못합니다. 생성기는 단지 판별기의 평가를 받습니다.

판별기의 무자비한 불투명성
판별기의 역할은 생성기가 충분히 잘하지 못했음을 알려주는 것입니다. 판별기는 생성기에게 ‘다시 해보세요’라고 말합니다. 그러나 판별기는 생성기에게 무엇이 잘못되었는지 알려주지 않습니다. 판별기는 단지 생성기의 이미지를 평가하고, 점수를 매깁니다.
판별기는 생성기에게 점수를 매기지만, 생성기는 어떻게 하면 더 좋은 이미지를 생성할 수 있는지 알지 못합니다. 생성기는 단지 판별기의 평가를 받습니다.
이러한 과정은 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정입니다. 그러나 생성기는 어떻게 하면 더 좋은 이미지를 생성할 수 있는지 알지 못합니다.
판별기作为 교사와 멘토
新的 연구는 판별기가 생성기에게 어떤 부분이 잘못되었는지 알려주는 방법을 발견했습니다. 이는 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.

연구자들은 GradCAM을 사용하여 판별기의 평가를 생성기에게 알려주는 방법을 발견했습니다. 이는 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.
新的 방법은 EqGAN이라고 합니다. 이는 StyleGan2 아키텍처를 사용하여 생성기와 판별기를 연결합니다.

EqGAN의 아키텍처입니다. 생성기와 판별기를 연결하여 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.
GradCAM은 판별기의 평가를 생성기에게 알려주는 방법입니다. 이는 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.
EqGAN은 생성기와 판별기를 연결하여 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.
EqGAN
연구자들은 EqGAN을 사용하여 여러 데이터셋을 테스트했습니다. 이는 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.
EqGAN은 생성기와 판별기를 연결하여 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다. 이는 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.
연구자들은 EqGAN을 사용하여 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다. 이는 생성기가 더 좋은 이미지를 생성하려고 노력하는 과정에서 도움이 됩니다.

연구자들은 다음과 같이 결론을 내립니다:
‘우리는 이 연구가 GAN의 평형을 재조사하고 이미지 합성 품질을 개선하는 새로운 방법을 개발하는 데 도움이 되기를 바랍니다. 우리는 또한將來의 연구에서 이 문제에 대한 더 많은 이론적 조사에 대해 수행할 것입니다.’
그리고 다음과 같이 계속합니다:
‘질적 결과는 우리의 방법이 생성기를 특정 영역에 집중시키는 데 성공했다는 것을 보여줍니다. 다양한 데이터셋에 대한 실험은 우리의 방법이 GAN 훈련의 불균형을 완화하고 이미지 합성 품질을 크게 개선한다는 것을 검증합니다. 공간적 인식이 있는 결과 모델은 또한 출력 이미지의 상호 작용 조작을 가능하게 합니다.’
다음 비디오를 보시면 프로젝트에 대한 자세한 정보와 GAN의 잠재 공간의 동적 및 상호 작용적 탐색의 더 많은 예시를 볼 수 있습니다.
11:12am 4th Dec 2021 – GradCAM의 URL을 수정하고 주변 참조를 정리했습니다.












