Anderson의 관점

인공지능 시스템이 사람의 이미지를 더 ‘아름답게’ 만들 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
Background image: DALL-E 2 'Award-winning 8K photo of the most beautiful Caucasian catwalk model in the world' - https://labs.openai.com/s/kRXusxOR5GcYyb6pqZjNH2AA

중국 연구진은 강화 학습의 새로운 접근 방식을 기반으로 사람의 이미지를 더 ‘아름답게’ 만들 수 있는 새로운 인공지능 기반 이미지 향상 시스템을 개발했다.

새로운 접근 방식은 여러 요인 중에서 조명과 눈의 자세가 중요한 요소일 수 있는 '얼굴 미의 예측 네트워크'를 사용하여 이미지를 반복적으로 변경한다. 여기서 각 열의 왼쪽에 있는 원본 소스는 EigenGAN 시스템에서 가져온 것이며, 새로운 결과는 이들 오른쪽에 있다. 출처: https://arxiv.org/pdf/2208.04517.pdf

새로운 접근 방식은 여러 요인 중에서 조명과 눈의 자세가 중요한 요소일 수 있는 ‘얼굴 미의 예측 네트워크’를 사용하여 이미지를 반복적으로 변경한다. 여기서 각 열의 왼쪽에 있는 원본 소스는 EigenGAN 시스템에서 가져온 것이며, 새로운 결과는 이들 오른쪽에 있다. 출처: https://arxiv.org/pdf/2208.04517.pdf

이 기술은 2021년 중국 프로젝트인 EigenGAN 생성기에서 발견된 혁신에 기반한다. EigenGAN 생성기는 생성적 적대 신경망(GAN)의 잠재 공간 내에서 다양한 의미적 속성을 식별하고 일부 제어하는 데 주목할만한 발전을 이루었다.

2021년 EigenGAN 생성기는 생성적 적대 신경망의 잠재 공간 내에서 높은 수준의 개념인 '머리 색상'을 식별할 수 있었다. 새로운 연구는 이 혁신적인 도구를 기반으로하여 원본 이미지를 '아름답게' 만들 수 있는 시스템을 제공한다. 그러나 이전 접근 방식의 문제점인 인식 가능한 정체성을 변경하지 않는다. 출처: https://arxiv.org/pdf/2104.12476.pdf

2021년 EigenGAN 생성기는 생성적 적대 신경망의 잠재 공간 내에서 높은 수준의 개념인 ‘머리 색상’을 식별할 수 있었다. 새로운 연구는 이 혁신적인 도구를 기반으로하여 원본 이미지를 ‘아름답게’ 만들 수 있는 시스템을 제공한다. 그러나 이전 접근 방식의 문제점인 인식 가능한 정체성을 변경하지 않는다. 출처: https://arxiv.org/pdf/2104.12476.pdf

시스템은 ‘미학 점수 네트워크’를 사용하며, 이는 2018년 광저우의 남중국科技大學에서 개발한 얼굴 미의 예측 벤치마크 데이터셋인 SCUT-FBP5500에서 파생되었다.

2018년 논문 'SCUT-FBP5500: 다중 패러다임 얼굴 미의 예측을 위한 다양한 벤치마크 데이터셋'에서 제시된 '얼굴 미의 예측' 네트워크는 얼굴을 인식된 매력성에 따라 순위 매길 수 있었다. 그러나 실제로 얼굴을 변형하거나 '업그레이드'할 수는 없었다. 출처: https://arxiv.org/pdf/1801.06345.pdf

2018년 논문 ‘SCUT-FBP5500: 다중 패러다임 얼굴 미의 예측을 위한 다양한 벤치마크 데이터셋’에서 제시된 ‘얼굴 미의 예측’ 네트워크는 얼굴을 인식된 매력성에 따라 순위 매길 수 있었다. 그러나 실제로 얼굴을 변형하거나 ‘업그레이드’할 수는 없었다. 출처: https://arxiv.org/pdf/1801.06345.pdf

반면에 새로운 연구는 실제로 변형을 수행할 수 있지만, 5,500개의 얼굴에 대한 알고리즘적 가치 판단을 포함하며, 60명의 混성 라벨러(남녀 50:50 비율)가 제공한 것이다. 이러한 판단은 새로운 시스템에서 효과적인 판별기로 사용되며, 이미지를 더 매력적으로 만들기 위한 변형을 결정한다.

흥미롭게도, 새로운 논문은 새로운 논문속성 제어 가능한 아름다운 코카서스 인종 얼굴 생성에 의한 미학 주도 강화 학습이라는 제목을 가지고 있다. 시스템이 카카서스 인종을 제외한 모든 인종을 제외하는 이유는 SCUT 데이터가 주로 아시아 출신의 데이터(4,000명의 아시아 여성/남성, 1,500명의 코카서스 인종 여성/남성)로 구성되어 있기 때문이며, 이는 평균적인 사람의 이미지를 브라운 헤어와 브라운 눈으로 만든다.

따라서, 적어도 하나의 인종 내에서 색상 변화를 수용하기 위해, 원래 데이터에서 아시아 구성 요소를 제외하거나, 방법을 개발하기 위해大量의 비용을 투자해야 했다. 또한, 문화적 미의 인식의 차이는 이러한 시스템이 지리적 구성 가능성을 갖도록 해야 하며, 무엇이 ‘매력성’을 구성하는지에 대한 것이다.

관련 속성

인상적인 사진의 주요 기여 요소를 결정하기 위해, 연구진은 또한 이미지에 대한 다양한 변경의 효과를 테스트했으며, 이러한 보강이 알고리즘적 미의 인식에 미치는 영향을 조사했다. 그들은 조명과 같은 요소가 좋은 사진보다 좋은 유전자를 더 중점적으로 다루는 것을 발견했다.

조명 외에도, 가장 큰 영향을 미친 요소는 뱅스(남성의 경우 전체 머리카락을 가졌을 때와 같은 경우), 몸 자세, 눈의 자세(카메라 시점과의 상호작용이 매력성에 부여하는 요소)였다.

(립스틱 색상에 관하여, 새로운 시스템은 성별 외모를 구분하지 않지만, 새로운 판별기 시스템을 ‘필터’로 사용한다.)

방법

새로운 시스템의 강화 학습 메커니즘에서 보상 함수는 SCUT 데이터에 대한 간단한 회귀 분석에 의해 구동된다. 이는 얼굴 미의 예측을 출력한다.

학습 시스템은 입력 이미지(스키마 아래쪽 왼쪽)에 대해 반복한다. 처음에는 미리 학습된 ResNet18 모델(이미지넷에서 학습)이 다섯 개의 동일한(‘y’) 이미지에서 특징을 추출한다. 다음으로, 완전 연결 계층(GRUCell, 이미지 아래)의 숨겨진 상태에서 잠재적인 변형 동작이 파생되며, 변형이 적용되어 다섯 개의 변경된 이미지가 생성된다. 이러한 이미지는 미학 점수 네트워크에 입력되며, 그 순위는 다윈 방식으로 변형의 개발과 폐기를 결정한다.

새로운 시스템의 워크플로우를 위한 광범위한 일러스트레이션.

새로운 시스템의 워크플로우를 위한 일러스트레이션.

미학 점수 네트워크는 효율적인 채널 주의(ECA) 모듈을 사용하며, 미리 학습된 EfficientNet-B4의 적응은 각 이미지에서 1,792개의 특징을 추출한다.

ReLU 활성화 함수를 통해 정규화한 후, ECA 모듈에서 4차원 벡터를 얻은 후, 활성화와 적응 평균 풀링을 통해 1차원 벡터로 평탄화한다. 마지막으로, 결과는 회귀 네트워크에 입력되어 미학 점수를 얻는다.

시스템의 출력에 대한 질적 비교. 아래 행에서, 우리는 EigenGAN 방법에 의해 식별된 모든 개별 요소의 집계 합을看到 있다. 이미지 행의 왼쪽에 있는 평균 FID 점수는 더 높을수록 좋다.

시스템의 출력에 대한 질적 비교. 아래 행에서, 우리는 EigenGAN 방법에 의해 식별된 모든 개별 요소의 집계 합을看到 있다. 이미지 행의 왼쪽에 있는 평균 FID 점수는 더 높을수록 좋다.

테스트 및 사용자 연구

새로운 방법의 다섯 가지 변형이 알고리즘적으로 평가되었으며(위 이미지 참조), 총 1,000개의 이미지가 시스템을 통해 처리되었다. Fréchet inception 거리(FID, 일부에서는 논란의 여지가 있다) 점수가 할당되었다.

연구진은 조명 개선이 다른 몇 가지 더 ‘명백한’ 가능한 변경(즉, 실제로 사람의 외모에 대한 변경)보다 사진의 주인공에 대한 매력성 점수를 더 잘 개선한다고 주장한다.

일정 정도로, 이러한 방식으로 시스템을 테스트하는 것은 SCUT 데이터의 특이성에 의해 제한된다. 이는 ‘밝은 미소’가 많지 않으며, 저자는 이것이 데이터의 일반적인 ‘신비한’ 모습을 과도하게 순위 매길 수 있으며, 이는 목표 사용자의 취향(대부분 서양 시장일 것)과 다를 수 있다고 주장한다.

그러나, 전체 시스템이 60명의 의견(EigenGAN 논문에서)의 평균에 의존하며, 연구하는 품질이 경험적이지 않기 때문에, 이 절차가 더 합리적일 수 있다.

비록 간단하게 다루었지만, EigenGAN과 시스템의 다섯 가지 변형의 이미지도 8명의 참가자를 대상으로 한 사용자 연구에서 보여졌으며, 참가자들은 ‘최선의 이미지’를 선택해야 했다(단어 ‘매력성’은 피했다).

위에, 소규모 연구 그룹에게 제시된 GUI; 아래, 결과.

위에, 소규모 연구 그룹에게 제시된 GUI; 아래, 결과.

결과는 새로운 시스템의 출력이 참가자들 사이에서最高의 선택률을 달성했다는 것을 나타낸다(‘MAES’ 위 이미지).

아름다움의 추구

이러한 시스템의 유용성은 명확하지 않으며, 주목할만한 노력 중심 중국에서 이러한 목표를 향한 노력에도 불구하고, 새로운 출판물에서는 이러한 내용이 설명되지 않는다.

이전의 EigenGAN 논문은 아름다움 인식 시스템이 얼굴 메이크업 합성 추천 시스템, 미적 수술, 얼굴 미화, 또는 콘텐츠 기반 이미지 검색에 사용될 수 있다고 제안한다.

이러한 접근 방식은 또한 사용자들이 자신의 프로필 사진을 ‘럭키 샷’으로 변경하거나, 구식 사진 또는 다른 사람의 사진을 사용하는 대신, 데이트 사이트에서 사용될 수 있다.

또한, 데이트 사이트 자체도 클라이언트를 평가하여 등급과 제한된 접근 티어를 생성할 수 있다. 그러나 이것은 라이브니스 인증 캡처를 통해 가능할 것이다. 제출된 사진은 클라이언트가 향상시킬 수 있기 때문에, 이러한 접근 방식이 대중화되면, 클라이언트가 사진을 향상시키는 것을 방지하기 위해, 라이브니스 인증 캡처가 필요하다.

광고에서, 미의 평가를 위한 알고리즘적 방법은 대상 청중에게 가장 관심을 끌 수 있는 창의적 출력을 선택하는 데 사용될 수 있으며, 이미지를 실제로 최대 化하는 능력은 이미지를 더 매력적으로 만들 수 있다.

새로운 연구는 중국 국립 자연 과학 기금, 복잡 시스템 관리 및 제어 국가 키 연구소의 오픈 펀드 프로젝트, 중국 교육부의 철학 및 사회 과학 연구 프로젝트 등 여러 기관의 지원을 받았다.

 

* EigenGAN 논문의 많은 추천은 2016년에 출판된 ‘얼굴 미의 분석을 위한 컴퓨터 모델’이라는 상업용 책을 가리킨다.

最初에 2022년 8월 11일에 출판되었다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai