Anderson의 관점
라이브 스트림용 얼굴 매력도 예측

현재까지 얼굴 매력도 예측(Facial Attractiveness Prediction, FAP)은 주로 심리학 연구, 미용 및 화장품 산업, 성형외과 분야에서 연구되어 왔다. 이는 미의 기준이 국가별로 다르기 때문에 어려운 연구 분야이다.
이러한 문제를 해결하기 위해 연구자들은 개념적 방법론과 워크플로우를 개발하여 지역별 데이터를 처리할 수 있도록 하였다. 이러한 방법론은 효과적인 지역별 FAP 모델을 개발하는 데 도움이 될 수 있다.
FAP의 사용 사례는 미용 및 심리학 연구에서 제한적이며, 대부분의 데이터셋은 제한된 데이터만을 포함하거나 전혀 공개되지 않았다. 온라인에서 쉽게 이용할 수 있는 매력도 예측기들은 주로 서양 관객을 대상으로 하며, 현재의 상태는 동아시아 연구(주로 중국)와 해당 동아시아 데이터셋에 의해 주도되는 것으로 보인다.

동아시아 데이터셋의 예. 출처: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30
미용 예측의 더广い 상업적 용途에는 온라인 데이트 앱과 실제 아바타 이미지의 품질을 높이는 생성적 AI 시스템이 포함된다. 이러한 애플리케이션은 미의 기준을 측정하는 데 사용할 수 있는 양자화된 미의 기준을 필요로 한다.
얼굴 그리기
매력적인 개인은 광고와 영향력 구축에서 가치 있는 자산으로 남아 있으며, 이러한 분야의 금전적 인센티브는 상태-of-the-아트 FAP 데이터셋과 프레임워크를 발전시키는 데 명확한 기회를 제공한다.
예를 들어, 실제 데이터로 학습된 얼굴 매력도 평가 및 평가를 위한 AI 모델은 광고에 큰 영향을 미치는 이벤트 또는 개인을 식별할 수 있다. 이러한 기능은 라이브 비디오 스트리밍 환경에서 특히 관련이 있으며, 현재는 ‘팔로워’와 ‘좋아요’와 같은 지표가 개인 또는 얼굴 유형의 관객을 사로잡는 능력의 암시적 지표로만 작용한다.
이것은 표면적인 지표이며, 목소리, 프레젠테이션, 관점도 관객을 모으는 데 중요한 역할을 한다. 따라서 FAP 데이터셋의 큐레이션에는 인간의 감독이 필요하며, 얼굴 매력도와 허위 매력도를 구별할 수 있어야 한다.
라이브 뷰티
FAP 데이터셋의 부족을 해결하기 위해 중국의 연구자들은 10만 개의 얼굴 이미지와 20만 개의 인간 주석을 포함하는 첫 번째 대규모 FAP 데이터셋을 제공하고 있다.

새로운 라이브 뷰티 데이터셋의 샘플. 출처: https://arxiv.org/pdf/2501.02509
라이브 뷰티(LiveBeauty)라는 데이터셋은 10,000개의 다른 身份를 포함하며, 모두 2024년 3월에 라이브 스트리밍 플랫폼에서 캡처되었다.
저자들은 또한 FPEM(Facial Prior Enhanced Multi-modal)이라는 새로운 다중 모드 FAP 방법을 제시한다. FPEM은 전체적인 얼굴 전처리 지식과 다중 모드 미적 의미 특징을 개인화된 매력도 전처리 모듈(PAPM), 다중 모드 매력도 인코더 모듈(MAEM), 크로스 모달 퓨전 모듈(CMFM)을 통해 통합한다.
방법 및 데이터
연구자들은 라이브 스트리밍 플랫폼에서 10시간 방송에서 첫 3시간 동안 1시간마다 1개의 이미지를 수집하였다. 페이지 조회수가 가장 높은 방송이 선택되었다.
수집된 데이터는 여러 전처리 단계를 거쳤다. 첫 번째 단계는 얼굴 영역 크기 측정으로, 2018년 CPU 기반 FaceBoxes 탐지 모델을 사용하여 얼굴 특징을围绕하는 바운딩 박스를 생성한다. 파이프라인은 바운딩 박스의 더 짧은 쪽이 90픽셀을 초과하는 것을 보장한다.
두 번째 단계는 블러 감지로, 얼굴 영역에 라플라시안 연산자의 분산을 사용하여 블러된 이미지를 필터링한다. 이 분산은 10보다 커야 한다.
세 번째 단계는 얼굴 姿势 추정으로, 2021년 3DDFA-V2 姿势 추정 모델을 사용한다.

3DDFA-V2 추정 모델의 예. 출처: https://arxiv.org/pdf/2009.09960
네 번째 단계는 얼굴 비율 평가로, 3DDFA-V2 모델의 분할 기능을 사용하여 얼굴 영역의 비율을 평가한다. 이 비율은 60%보다 커야 한다.
마지막으로, 다섯 번째 단계는 중복 문자 제거로, 상태-of-the-아트 얼굴 인식 모델을 사용하여 동일한 身份가 여러 개의 이미지에 나타나는 경우를 제거한다.
인간 평가 및 주석
20명의 주석자가 모집되었으며, 6명의 남성과 14명의 여성으로 구성되었다. 얼굴은 아이폰 14 프로 맥스의 6.7인치 화면에 표시되었으며, 일관된 실험실 조건에서 평가되었다.
평가는 200개의 세션으로 나누어졌으며, 각 세션은 50개의 이미지를 사용하였다. 주제들은 샘플의 얼굴 매력도를 1-5의 점수로 평가하였다. 각 세션 사이에는 5분의 휴식 시간이 주어졌으며, 모든 주제가 모든 세션에 참여하였다.
따라서 10,000개의 이미지 모두가 20명의 인간 주제에 의해 평가되었으며, 20만 개의 주석이 생성되었다.
분석 및 전처리
첫 번째 단계는 주제 후 스크리닝으로, 아웃라이어 비율과 스피어만의 순위 상관 계수(SROCC)를 사용하여 주제의 평가를 분석하였다. 아웃라이어 비율이 2% 이상이거나 SROCC가 0.75 미만인 주제는 신뢰할 수 없는 것으로 간주되어 제거되었다.
그 다음, 각 얼굴 이미지의 평균 의견 점수(MOS)를 계산하였다. MOS는 유효한 주제의 점수를 평균하여 계산되었다.
마지막으로, MOS 분포의 분석은 모든 샘플이 가우시안 형태를 띠고 있음을 보여주었다.

라이브 뷰티 MOS 분포
대부분의 개인은 평균적인 얼굴 매력도를 가지고 있으며, 매우 낮거나 매우 높은 매력도를 가진 개인은 적다.
추가적으로, 비대칭도와 첨도 값의 분석은 분포가 얇은 꼬리와 평균 점수 주변에 집중되어 있음을 보여주었다. 또한, 높은 매력도는 수집된 라이브 스트리밍 비디오의 여성 샘플에서 더 흔하게 나타났다.
아키텍처
FPEM은 2단계 훈련 전략을 사용하며, 4개의 모듈로 구성된다: 개인화된 매력도 전처리 모듈(PAPM), 다중 모드 매력도 인코더 모듈(MAEM), 크로스 모달 퓨전 모듈(CMFM), 결정 퓨전 모듈(DFM).

라이브 뷰티 훈련 파이프라인의 개념적 스키마
PAPM 모듈은 이미지를 입력으로 받아서 스윈 트랜스포머를 사용하여 다중 스케일의 시각적 특징을 추출한다. 또한 프리트레이닝된 FaceNet 모델을 사용하여 얼굴 인식 특징을 추출한다. 이러한 특징은 크로스 어텐션 블록을 사용하여 결합되어 개인화된 매력도 특징을 생성한다.
MAEM은 이미지를 입력으로 받아서 CLIP을 사용하여 다중 모드 미적 의미 특징을 추출한다. 텍스트 설명은 “{a} 매력도”의 형태로 제공된다. 여기서 {a}는 나쁨, 불량, 공정, 좋음, 완벽 중 하나이다. 이 과정은 텍스트와 시각적 임베딩 사이의 코사인 유사성을 추정하여 매력도 수준의 확률을 도출한다.
CMFM은 텍스트 임베딩을 개인화된 매력도 특징을 사용하여 개선한다. 그런 다음 유사성 회귀 전략을 사용하여 예측을 수행한다.
마지막으로, DFM은 PAPM, MAEM, CMFM의 개별 예측을 결합하여 단일의 최종 매력도 점수를 생성한다.
손실 함수
PAPM은 L1 손실 함수를 사용하여 훈련된다. 이는 예측된 매력도 점수와 실제 매력도 점수 사이의 절대 차이를 측정한다.
MAEM 모듈은 더 복잡한 손실 함수를 사용하여 훈련된다. 이는 점수 손실과 순위 손실을 결합한다. 순위 손실은 신뢰도 손실과 두 방향 순위 손실로 구성된다.
CMFM과 DFM은 단순한 L1 손실 함수를 사용하여 훈련된다.
테스트
연구자들은 라이브 뷰티를 9개의 이전 접근 방식과 비교하였다: ComboNet, 2D-FAP, REX-INCEP, CNN-ER, MEBeauty, AVA-MLSP, TANet, Dele-Trans, EAT.

벤치마크 데이터셋의 MOS 분포
각 데이터셋은 훈련과 테스트를 위해 60%-40% 또는 80%-20%로 분할되었다. 라이브 뷰티는 90%-10%로 분할되었다.
윤리적 고려
매력도 연구는 잠재적으로 분열적인 추구이다. 이러한 시스템은 미의 기준을 확립함으로써 나이, 인종, 컴퓨터 비전 연구와 관련된 많은 다른 섹션에 대한 편향을 강화하는 경향이 있다.
이러한 판단은 인간 주도 주석에서 비롯될 수 있으며, 이는 제한된 규모로 인해 효과적인 도메인 일반화를 위한 것이 아니다. 또는 스트리밍 플랫폼과 같은 온라인 환경에서 주의 패턴을 분석하여 비용을 지불할 수 있다. 이러한 환경은 공정하지 않은 것으로 간주될 수 있다.












