Anderson의 관점

AI의 미의 추구

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image featuring a woman whose face is being analyzed by a Terminator-style HUD. GPT-1.5.

새로운 AI 기반 미 평가 시스템은 얼굴이 얼마나 매력적으로 보이는지 점수화하면서 일반적인 딥러닝 모델보다 빠르게 학습해, 대규모 자동 평가를 더 실용적으로 만들 가능성이 있다.

얼굴 미 예측(FBP)은 큰 사업이자 활발한 연구 분야다. AI 편향을 줄이려는 원칙과 충돌하고 여성에 대한 알고리즘적 객관화와 환원주의를 강화할 수 있는데도, 화장품, 미용 성형, 라이브 스트리밍, 패션 등 여성 대상의 거대 산업들이 관심을 보인다.

Women rated from 1-5, from the paper 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion'. Source - https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’ 논문에서 여성 얼굴을 1~5점으로 분류한 사례. 출처

여성 중심 업종뿐 아니라 광고, 엔터테인먼트, 출판도 남녀가 무엇을 매력적으로 보는지 문화별로 이해하려 한다. 미의 인식은 지역마다 다르기 때문에 전 세계에 그대로 적용되는 단일 데이터셋을 만들기 어렵다. 연구는 특정 문화에 머물거나 서로 다른 문화 자료에 적용 가능한 상위 수준의 방법을 개발해야 한다.

An interface for a facial beauty assessment system for the 2015 SCUT-FBP project. Source - https://arxiv.org/pdf/1511.02459

2015년 SCUT-FBP 프로젝트의 얼굴 미 평가 시스템 인터페이스. 출처

지역만 문제가 아니다. 데이터셋은 성별에 따라 같은 성능을 내지 못하거나 특정 용도에 맞춰 선별돼 다른 분야에서 사용하기 어려울 수 있다. 2025년에 소개된 라이브 스트리밍용 10만 명 이상 데이터셋도 얼굴을 촘촘히 잘라낸 기준 때문에 더 넓은 프로젝트에는 상당한 조정이 필요할 수 있다.

얼굴 평가 연구의 문화적 맥락

아시아 연구기관은 서구 연구기관과 다른 문화적 제약 속에서 작업한다. 서구권 연구자가 다섯 여성의 얼굴을 덜 매력적인 순서부터 더 매력적인 순서로 배열한 과학 그림을 공개하기는 쉽지 않다. 아시아에서 이런 시스템이 공개적으로 효과를 입증하면 서구 기업이 이를 비공개 독점 시스템으로 사용하거나 조정할 가능성도 있다.

서구의 유사 시스템이 오픈소스 협업과 공개 검토에서 벗어나 개발되는지 여부와 무관하게, 정확한 매력도 평가는 여러 전문 산업에서 세계적 관심사다.

적자생존식 데이터의 한계

TikTok, Instagram, YouTube의 팔로워·좋아요·트래픽을 매력도와 연결하면 거대한 웹 자료가 미의 기준이 될 것처럼 보인다. ImageNet과 LAION에도 배우와 모델처럼 사회적 선택을 통과한 인물이 많아 문화적 메커니즘을 대리할 수 있다.

하지만 이런 접근은 시간과 지역에 따라 변하는 취향을 설명하지 못한다. 따라서 특정 시점의 선별 자료에 묶이지 않고 변화하는 미적 기준을 반영할 수 있는 데이터 독립적 방법이 필요하다.

전이 학습과 BLS의 결합

중국 연구진의 새 접근은 전이 학습과 Broad Learning System(BLS)을 결합해 정확도와 계산비용 사이의 오래된 절충을 다룬다. 기존 신경망은 강한 결과에 많은 학습이 필요하고, 가벼운 BLS는 빠르지만 세부 특징을 충분히 잡지 못한다. 새 방법은 사전 학습 시각 모델로 얼굴 특징을 추출한 뒤 빠른 BLS가 점수를 예측해 특징을 처음부터 다시 배우지 않으면서도 효율을 유지한다.

Sample images from the LSAFBD dataset, showing female faces grouped by human-assigned beauty scores from 1 to 5, where ratings were derived from multiple annotators and used as supervised labels for training and evaluating facial beauty prediction models across variations in pose, lighting, and appearance.. Source - https://arxiv.org/pdf/2603.16930

LSAFBD 데이터셋에서 여러 평가자가 1~5점으로 분류한 여성 얼굴 표본. 자세, 조명, 외모 변화 속에서 FBP 모델을 학습하고 평가하는 지도 라벨로 사용됐다. 출처

첫 변형 E-BLS는 추출 특징을 가벼운 시스템에 바로 넣는다. 두 번째 ER-BLS는 평가 전에 특징을 표준화하고 정제하는 중간 단계를 추가해 속도를 크게 희생하지 않으면서 일관성을 높인다. 저자들은 두 방법 모두 단독 BLS와 경쟁 방법보다 낫다고 보고했다.

논문 제목은 ‘Facial beauty prediction fusing transfer learning and broad learning system’이며 중국 Jiangmen의 Wuyi University 연구자 6명이 작성했다.

방법

BLS는 여러 깊은 층을 쌓는 대신 더 넓은 단순 연결에 학습을 분산해 빠르게 훈련하는 신경망 대안이다. 대신 미세한 시각 세부를 놓치기 쉽다.

E-BLS는 EfficientNet 기반 전이 학습으로 얼굴 특징을 추출한 뒤 BLS에 전달해, 완전한 심층망을 처음부터 학습하지 않고 최종 점수를 낸다.

Architecture schema for the E-BLS model, showing how facial images from target datasets such as SCUT-FBP5500 and LSAFBD are first passed through a pre-trained EfficientNet feature extractor, whose parameters are transferred from ImageNet and kept fixed, before the resulting feature maps are fed into a Broad Learning System (BLS), where feature nodes and enhancement nodes are combined through trainable weights to produce the final facial beauty score.

E-BLS 모델 아키텍처.

ImageNet-1k로 사전 학습된 EfficientNet은 입력 얼굴을 구조화된 압축 특징값으로 바꾼다. BLS는 무작위로 연결된 단순 노드에서 값을 변환·결합해 최종 매력도 점수를 출력한다. 깊은 층에 의존하지 않으므로 전체를 다시 학습하는 대신 노드를 추가해 업데이트할 수 있다.

ER-BLS는 EfficientNet과 BLS 사이에 처리층을 넣어 원시 특징을 표준화·재구성하고 잡음을 줄인다. 조명, 자세 등 시각 조건이 바뀌어도 특징을 더 일관되게 만들어 일반화 성능을 높이는 목적이다.

Architecture of the ER-BLS model, where facial images are processed by a pre-trained EfficientNet feature extractor, then refined through a connection layer using pooling, normalization, and radial basis function (RBF) transformation. The output is then passed to the Broad Learning System (BLS), to produce the final facial beauty score.

ER-BLS 모델 아키텍처.

정제된 특징은 E-BLS와 같은 BLS의 특징 노드와 강화 노드로 들어가 변환·결합된 뒤 최종 점수가 된다.

데이터와 시험

첫 데이터는 South China University의 SCUT-FBP5500으로, 다양한 인종·성별·연령의 350×350 정면 얼굴 5,500장을 담는다.

Sample SCUT-FBP5500 dataset facial images rated from least (1) to most (5) attractive.

SCUT-FBP5500에서 1점(가장 낮음)부터 5점(가장 높음)까지 평가된 얼굴 표본.

각 이미지는 자원봉사자 60명이 1~5점으로 평가했다.

The division of proportions of images by beauty rating.

SCUT-FBP5500의 미 점수별 이미지 비율.

두 번째 자료는 저자들이 만든 Large-Scale Asian Female Beauty Dataset(LSAFBD)이다.

Sample LSAFBD dataset facial images rated from least (1) to most (5) attractive.

LSAFBD에서 1점부터 5점까지 분류된 여성 얼굴 표본.

LSAFBD는 자세, 배경, 연령이 다양한 144×144 이미지 8만 장으로 구성되며, 자원봉사자 75명이 0~4점으로 평가했다.

The divisions for the LSAFBD dataset.

LSAFBD 데이터셋의 점수별 분포.

각 데이터셋은 80% 학습, 20% 시험으로 나누고 교차검증으로 실행 간 결과를 안정화했다. BLS는 특징 창 수, 창당 노드 수, 강화 노드 수를 조정했고 Hyperopt로 조합을 탐색했다.

동일 조건의 기본 BLS와 함께 ResNet50, InceptionV3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet, Xception을 ImageNet-1k 가중치로 초기화해 비교했다. 마지막 층은 고정하지 않았다.

학습률은 0.001로 시작해 정체 시 낮췄고 배치 16, 50에포크, 정규화와 ReLU를 사용했다. 정확도, Pearson 상관계수, 총 학습시간을 다섯 번 실행 평균으로 평가했다. 시험 장비는 3.6GHz Intel i7 CPU와 RAM 64GB 데스크톱이었다.

Performance comparison on SCUT-FBP5500, where E-BLS and ER-BLS achieve competitive accuracy against deep CNN models including ResNet50, EfficientNetB7, InceptionV3, and Xception, while requiring substantially less training time – highlighting the efficiency gains of combining transfer learning with a Broad Learning System.

SCUT-FBP5500 비교. E-BLS와 ER-BLS는 여러 심층 CNN과 경쟁하거나 더 높은 정확도를 내면서 학습시간을 크게 줄였다.

E-BLS는 정확도를 65.85%에서 73.13%로 높였고 ER-BLS는 비교 모델 중 최고인 74.69%에 도달했다. 학습시간은 약 1,300초로, 심층 CNN의 수천 초에서 2만5천 초 이상보다 짧았다.

Performance on LSAFBD, where ER-BLS and E-BLS deliver higher accuracy than all baseline and transfer-learning models while requiring only a fraction of their training time, indicating a consistent advantage in efficiency without sacrificing predictive quality.

LSAFBD에서도 ER-BLS와 E-BLS는 모든 기준·전이학습 모델보다 높은 정확도를 보이면서 학습시간은 일부에 그쳐, 예측 품질을 희생하지 않는 효율 우위를 보였다.

LSAFBD에서도 E-BLS는 기본 BLS보다 정확했고 ER-BLS가 모든 비교 방법 중 최고였다. 두 변형 모두 심층 CNN보다 훨씬 짧은 시간으로 성능과 계산비용 사이에서 효율적인 균형을 보였다.

결론

CNN처럼 생성형 AI 붐 이전에 유행했던 기술과 이례적으로 소박한 학습 장비를 쓴 점에서 다소 복고적인 연구다. 그럼에도 인간 경험과 주관적 해석에 깊이 닿고 유행하는 미적 기준을 넘어설 견고한 체계가 필요한 컴퓨터 비전의 끈질긴 목표를 다룬다.

2026년 3월 19일 최초 게재.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai