Anderson의 관점
AI의 미의 추구

새로운 AI 기반 미 평가 시스템은 얼굴이 얼마나 매력적으로 보이는지 점수화하면서 일반적인 딥러닝 모델보다 빠르게 학습해, 대규모 자동 평가를 더 실용적으로 만들 가능성이 있다.
얼굴 미 예측(FBP)은 큰 사업이자 활발한 연구 분야다. AI 편향을 줄이려는 원칙과 충돌하고 여성에 대한 알고리즘적 객관화와 환원주의를 강화할 수 있는데도, 화장품, 미용 성형, 라이브 스트리밍, 패션 등 여성 대상의 거대 산업들이 관심을 보인다.

‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’ 논문에서 여성 얼굴을 1~5점으로 분류한 사례. 출처
여성 중심 업종뿐 아니라 광고, 엔터테인먼트, 출판도 남녀가 무엇을 매력적으로 보는지 문화별로 이해하려 한다. 미의 인식은 지역마다 다르기 때문에 전 세계에 그대로 적용되는 단일 데이터셋을 만들기 어렵다. 연구는 특정 문화에 머물거나 서로 다른 문화 자료에 적용 가능한 상위 수준의 방법을 개발해야 한다.

2015년 SCUT-FBP 프로젝트의 얼굴 미 평가 시스템 인터페이스. 출처
지역만 문제가 아니다. 데이터셋은 성별에 따라 같은 성능을 내지 못하거나 특정 용도에 맞춰 선별돼 다른 분야에서 사용하기 어려울 수 있다. 2025년에 소개된 라이브 스트리밍용 10만 명 이상 데이터셋도 얼굴을 촘촘히 잘라낸 기준 때문에 더 넓은 프로젝트에는 상당한 조정이 필요할 수 있다.
얼굴 평가 연구의 문화적 맥락
아시아 연구기관은 서구 연구기관과 다른 문화적 제약 속에서 작업한다. 서구권 연구자가 다섯 여성의 얼굴을 덜 매력적인 순서부터 더 매력적인 순서로 배열한 과학 그림을 공개하기는 쉽지 않다. 아시아에서 이런 시스템이 공개적으로 효과를 입증하면 서구 기업이 이를 비공개 독점 시스템으로 사용하거나 조정할 가능성도 있다.
서구의 유사 시스템이 오픈소스 협업과 공개 검토에서 벗어나 개발되는지 여부와 무관하게, 정확한 매력도 평가는 여러 전문 산업에서 세계적 관심사다.
적자생존식 데이터의 한계
TikTok, Instagram, YouTube의 팔로워·좋아요·트래픽을 매력도와 연결하면 거대한 웹 자료가 미의 기준이 될 것처럼 보인다. ImageNet과 LAION에도 배우와 모델처럼 사회적 선택을 통과한 인물이 많아 문화적 메커니즘을 대리할 수 있다.
하지만 이런 접근은 시간과 지역에 따라 변하는 취향을 설명하지 못한다. 따라서 특정 시점의 선별 자료에 묶이지 않고 변화하는 미적 기준을 반영할 수 있는 데이터 독립적 방법이 필요하다.
전이 학습과 BLS의 결합
중국 연구진의 새 접근은 전이 학습과 Broad Learning System(BLS)을 결합해 정확도와 계산비용 사이의 오래된 절충을 다룬다. 기존 신경망은 강한 결과에 많은 학습이 필요하고, 가벼운 BLS는 빠르지만 세부 특징을 충분히 잡지 못한다. 새 방법은 사전 학습 시각 모델로 얼굴 특징을 추출한 뒤 빠른 BLS가 점수를 예측해 특징을 처음부터 다시 배우지 않으면서도 효율을 유지한다.

LSAFBD 데이터셋에서 여러 평가자가 1~5점으로 분류한 여성 얼굴 표본. 자세, 조명, 외모 변화 속에서 FBP 모델을 학습하고 평가하는 지도 라벨로 사용됐다. 출처
첫 변형 E-BLS는 추출 특징을 가벼운 시스템에 바로 넣는다. 두 번째 ER-BLS는 평가 전에 특징을 표준화하고 정제하는 중간 단계를 추가해 속도를 크게 희생하지 않으면서 일관성을 높인다. 저자들은 두 방법 모두 단독 BLS와 경쟁 방법보다 낫다고 보고했다.
논문 제목은 ‘Facial beauty prediction fusing transfer learning and broad learning system’이며 중국 Jiangmen의 Wuyi University 연구자 6명이 작성했다.
방법
BLS는 여러 깊은 층을 쌓는 대신 더 넓은 단순 연결에 학습을 분산해 빠르게 훈련하는 신경망 대안이다. 대신 미세한 시각 세부를 놓치기 쉽다.
E-BLS는 EfficientNet 기반 전이 학습으로 얼굴 특징을 추출한 뒤 BLS에 전달해, 완전한 심층망을 처음부터 학습하지 않고 최종 점수를 낸다.

E-BLS 모델 아키텍처.
ImageNet-1k로 사전 학습된 EfficientNet은 입력 얼굴을 구조화된 압축 특징값으로 바꾼다. BLS는 무작위로 연결된 단순 노드에서 값을 변환·결합해 최종 매력도 점수를 출력한다. 깊은 층에 의존하지 않으므로 전체를 다시 학습하는 대신 노드를 추가해 업데이트할 수 있다.
ER-BLS는 EfficientNet과 BLS 사이에 처리층을 넣어 원시 특징을 표준화·재구성하고 잡음을 줄인다. 조명, 자세 등 시각 조건이 바뀌어도 특징을 더 일관되게 만들어 일반화 성능을 높이는 목적이다.

ER-BLS 모델 아키텍처.
정제된 특징은 E-BLS와 같은 BLS의 특징 노드와 강화 노드로 들어가 변환·결합된 뒤 최종 점수가 된다.
데이터와 시험
첫 데이터는 South China University의 SCUT-FBP5500으로, 다양한 인종·성별·연령의 350×350 정면 얼굴 5,500장을 담는다.

SCUT-FBP5500에서 1점(가장 낮음)부터 5점(가장 높음)까지 평가된 얼굴 표본.
각 이미지는 자원봉사자 60명이 1~5점으로 평가했다.

SCUT-FBP5500의 미 점수별 이미지 비율.
두 번째 자료는 저자들이 만든 Large-Scale Asian Female Beauty Dataset(LSAFBD)이다.

LSAFBD에서 1점부터 5점까지 분류된 여성 얼굴 표본.
LSAFBD는 자세, 배경, 연령이 다양한 144×144 이미지 8만 장으로 구성되며, 자원봉사자 75명이 0~4점으로 평가했다.

LSAFBD 데이터셋의 점수별 분포.
각 데이터셋은 80% 학습, 20% 시험으로 나누고 교차검증으로 실행 간 결과를 안정화했다. BLS는 특징 창 수, 창당 노드 수, 강화 노드 수를 조정했고 Hyperopt로 조합을 탐색했다.
동일 조건의 기본 BLS와 함께 ResNet50, InceptionV3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet, Xception을 ImageNet-1k 가중치로 초기화해 비교했다. 마지막 층은 고정하지 않았다.
학습률은 0.001로 시작해 정체 시 낮췄고 배치 16, 50에포크, 정규화와 ReLU를 사용했다. 정확도, Pearson 상관계수, 총 학습시간을 다섯 번 실행 평균으로 평가했다. 시험 장비는 3.6GHz Intel i7 CPU와 RAM 64GB 데스크톱이었다.

SCUT-FBP5500 비교. E-BLS와 ER-BLS는 여러 심층 CNN과 경쟁하거나 더 높은 정확도를 내면서 학습시간을 크게 줄였다.
E-BLS는 정확도를 65.85%에서 73.13%로 높였고 ER-BLS는 비교 모델 중 최고인 74.69%에 도달했다. 학습시간은 약 1,300초로, 심층 CNN의 수천 초에서 2만5천 초 이상보다 짧았다.

LSAFBD에서도 ER-BLS와 E-BLS는 모든 기준·전이학습 모델보다 높은 정확도를 보이면서 학습시간은 일부에 그쳐, 예측 품질을 희생하지 않는 효율 우위를 보였다.
LSAFBD에서도 E-BLS는 기본 BLS보다 정확했고 ER-BLS가 모든 비교 방법 중 최고였다. 두 변형 모두 심층 CNN보다 훨씬 짧은 시간으로 성능과 계산비용 사이에서 효율적인 균형을 보였다.
결론
CNN처럼 생성형 AI 붐 이전에 유행했던 기술과 이례적으로 소박한 학습 장비를 쓴 점에서 다소 복고적인 연구다. 그럼에도 인간 경험과 주관적 해석에 깊이 닿고 유행하는 미적 기준을 넘어설 견고한 체계가 필요한 컴퓨터 비전의 끈질긴 목표를 다룬다.
2026년 3월 19일 최초 게재.












