Anderson의 관점

이미지 합성 분야는 결함이 있는 지표를 채택했다고 연구가 주장한다

mm
Unite.AI를 Google의 선호 소스에 추가

2021년은 이미지 합성 분야에서 전례 없는 발전과 빠른 출판 속도를 보인 한 해였으며, 새로운 혁신과 기술의 발전이 Neural Rendering, Deepfakes, 그리고 다양한 새로운 접근 방식을 통해 인간의 개인성을 재현하는 능력을 제공했다.

그러나 독일의 연구자들은 이미지 합성 분야에서 사용되는 지표인 Fréchet Inception Distance (FID)가 근본적으로 결함이 있다고 주장하며, 이 지표에 의존하는 연구자들은 잘못된 방향으로 진행하고 있을 수 있다고 경고했다.

연구자들은 FID가 인간의 기준에 따라 이미지의 현실성을 평가하는 데 적합하지 않음을 보여주기 위해 자체적으로 GANs를 개발하고, FID를 최적화하여 테스트했다. 그 결과, FID는 이미지 합성의 목적과 다소 다른 목적으로 개발된 Inception v3 이미지 분류 네트워크의 결함을 물려받았으며, 이미지의 품질을 평가하는 데 인간의 기준과 다소 다른 방식을 사용한다는 것을 발견했다.

FID 점수(낮을수록 좋음) 다양한 모델과 표준 데이터셋 및 아키텍처를 사용하여 생성된 이미지. 연구자들은 '이 순위를 동의하십니까?'라는 질문을 던진다.

FID 점수(낮을수록 좋음) 다양한 모델과 표준 데이터셋 및 아키텍처를 사용하여 생성된 이미지. 연구자들은 ‘이 순위를 동의하십니까?’라는 질문을 던진다. 출처: https://openreview.net/pdf?id=mLG96UpmbYz

또한 연구자들은 FID의 내부 엔진을 다른 엔진으로 교체하는 등의 간단한 해결책도 문제를 해결하지 못할 것이라고 주장한다. 연구자들은 이미지 합성 분야에서 더 나은 지표를 개발하기 위한 새로운 연구가 필요하다고 강조한다.

이미지 합성 점수 시스템을 찾는 과정

新的 연구에 따르면, 이미지 합성 프레임워크의 발전은 이러한 시스템의 결과를 평가하는 방법의 발전을 따라가지 못했다. 인간의 평가는 비용이 많이 들고, 또한 경험적이고 재현 가능한 평가 방법을 제공하지 않는다.

따라서 여러 가지 지표 프레임워크가 등장했으며, 2016年の 논문에서 소개된 Inception Score (IS)도其中 하나이다.

그러나 2018년 연구에서 IS 점수가 여러 GAN 네트워크에広く 적용될 수 없는 것으로 밝혀지면서, FID가 이미지 합성 커뮤니티에서 널리 채택되었다. 그러나 FID도 Google의 Inception v3 이미지 분류 네트워크에 기반한다.

연구자들은 FID가 Inception v3의 결함을 물려받았으며, 이미지 품질을 평가하는 데 인간의 기준과 다소 다른 방식을 사용한다고 주장한다.

Fréchet Inception Distance

FID는 GAN 모델을 생성하기 위한 훈련 데이터셋과 생성된 이미지의 특징을 비교한다.

예를 들어, GAN 모델이 10,000개의 유명인사 이미지로 훈련되었다면, FID는 원본 이미지와 생성된 이미지의 특징을 비교한다. FID 점수가 낮을수록, GAN 모델은 더 현실적인 이미지를 생성했다고 평가된다.

논문에서 FFHQ64 데이터셋으로 훈련된 GAN의 결과. FID 점수는 5.38으로 낮지만, 결과는 인간에게는 그다지 현실적이지 않다.

논문에서 FFHQ64 데이터셋으로 훈련된 GAN의 결과. FID 점수는 5.38으로 낮지만, 결과는 인간에게는 그다지 현실적이지 않다.

연구자들은 Inception v3가 이미지 합성의 목적과 다소 다른 목적으로 개발되었으며, 이미지의 품질을 평가하는 데 인간의 기준과 다소 다른 방식을 사용한다고 주장한다.

데이터와 방법

연구자들은 자신의 가설을 테스트하기 위해 두 가지 GAN 아키텍처, DCGAN과 SNGAN을 사용하여 NVIDIA의 FFHQ 인간 얼굴 데이터셋을 64×64 이미지 해상도로 다운샘플링하여 FFHQ64 데이터셋을 생성했다.

세 가지 GAN 훈련 절차를 수행했으며, FID 점수를 사용하여 훈련을 평가했다. 연구자들은 FID가 인간의 평가와 다소 다른 방식을 사용한다고 주장한다.

연구자들은 FID가 이미지 합성 분야에서 사용되는 지표로 적합하지 않으며, 새로운 연구가 필요하다고 강조한다.

쉽게 대체할 수 없는 대안

연구자들은 Inception v3를 다른 분류 네트워크로 교체하는 것도 문제를 해결하지 못할 것이라고 주장한다. 다양한 분류 네트워크를 테스트한 결과, 문제가 해결되지 않았다고 한다.

연구자들은 이미지 합성 분야에서 사용되는 지표를 개발하기 위한 새로운 연구가 필요하다고 강조한다.

연구자들은 이 논문을 통해 이미지 합성 분야에서 사용되는 지표의 문제를 지적하며, 새로운 연구가 필요하다고 주장한다.

최초로 게시된 날짜: 2021년 12월 20일, 오전 1시 GMT+2.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai