Anderson의 관점

AI 도구가 메이크업을 제거해 미성년자의 연령 확인 회피 방지

mm
Unite.AI를 Google의 선호 소스에 추가
Flux, SDXL, Photoshop Neural filters, Firefly, Krita et al.

얼굴 화장품의 외관이 주로 소녀인 미성년 사용자가 데이팅 앱이나 전자상거래 사이트와 같은 플랫폼의 셀카 기반 연령 확인을 통과하도록 만들고 있습니다. 새로운 AI 도구가 이 허점을 해결하기 위해 메이크업을 지우면서 신원을 보존하는 판별 모델을 사용해 미성년자가 자동 시스템을 속이기 어렵게 합니다.

 

제3자 셀카 기반 연령 검증 서비스의 사용이 증가하고 있는데, 이는 전 세계적인 일반적 추진이 온라인 연령 기반 검증을 촉진하고 있기 때문입니다.

예를 들어, 영국 온라인 안전법이 현재 의무화하고 있는 새로운 집행 체계에서는 연령 검증을 다양한 제3자 서비스를 통해 수행할 수 있으며, 다양한 방법을 사용할 수 있습니다. 시각적 연령 검증을 포함한 경우, AI가 사용자의 연령을 시각적으로 예측합니다(보통 실시간 모바일 카메라 영상에서). 이러한 접근 방식을 사용하는 서비스로는 Ondato, TrustStamp, Yoti가 있습니다.

하지만 연령 추정은 완벽하지 않으며, 청소년들이 성인 권리를 기대하는 전통적인 태도 때문에 젊은이들은 다양한 효과적인 방법을 개발해 데이팅 사이트, 포럼 및 기타 연령 제한이 있는 환경에 진입하고 있습니다.

이러한 방법 중 하나는 주로 여성*이 사용하는데, 얼굴 메이크업을 착용하는 것입니다 – 이는 자동 연령 추정 시스템을 속이는 것으로 알려져 있으며, 일반적으로 젊은 사람들의 연령을 과대평가하고 노년층의 연령을 과소평가합니다.

여성만이 아니다

메이크업을 ‘여성 전용’이라고 비판하기 전에, 누구에게든 얼굴 화장품이 존재한다는 것은 성별을 매우 신뢰할 수 없는 지표라는 점을 주목해야 합니다:

논문 'Impact of Facial Cosmetics on Automatic Gender and Age Estimation Algorithms'에서 미국 연구자들은 성별 검증 시스템이 성전환 메이크업에 의해 속았다고 발견했습니다. Source: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

논문 ‘Impact of Facial Cosmetics on Automatic Gender and Age Estimation Algorithms’에서 미국 연구자들은 성별 검증 시스템이 성전환 메이크업에 의해 속았다고 발견했습니다. Source: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

2024년, 18~24세 미국 남성 소비자 72%가 추정된 바와 같이 메이크업을 그루밍 루틴에 포함하고 있다고 보고되었습니다 – 대부분은 건강한 피부 모습을 강조하기 위해 화장품을 사용하며, 퍼포먼스† 마스카라/립스틱 조합 더 연관된 여성의 시각적 미학과.

따라서 우리는 이 기사에서 다루는 자료를 새로운 연구에서 탐구된 가장 일반적인 시나리오, 즉 메이크업을 사용해 자동 시각 연령 검증 시스템을 회피하는 여성 미성년자와 동일하게 취급할 수밖에 없습니다.

효과적인 메이크업 제거 – AI 방식

위에서 언급한 연구는 뉴욕 대학교의 세 명의 기여자가 발표한 새 논문 DiffClean: Diffusion-based Makeup Removal for Accurate Age Estimation에 기반합니다.

이 프로젝트의 목표는 이미지(동영상 포함)에서 메이크업 외관을 제거하는 AI 기반 방법을 구현해 메이크업 뒤에 숨은 사람의 실제 연령을 보다 정확히 파악하는 것입니다.

새 논문에서 메이크업 제거의 예시를 제시했습니다. Source: https://arxiv.org/pdf/2507.13292

새 논문에서 메이크업 제거가 연령 예측을 크게 바꿀 수 있는 사례를 보여줍니다. Source: https://arxiv.org/pdf/2507.13292

이러한 시스템을 개발하는 데 있어 가장 큰 과제 중 하나는 미성년 소녀가 성인 메이크업을 착용한 이미지를 수집하거나 선별하는 데 따른 민감성 문제입니다. 결국 연구진은 EleGANt라는 제3자 생성적 적대 신경망 기반 시스템을 사용해 인위적으로 메이크업 스타일을 적용했으며, 이 기술은 매우 효과적인 것으로 입증되었습니다:

Tsinghua University's 2022 EleGANt system uses Generative Adversarial Networks (GANs) to superimpose cosmetics authentically onto source photos. Source: https://arxiv.org/pdf/2207.09840

칭화대의 2022년 EleGANt 시스템은 생성적 적대 신경망(GAN)을 사용해 원본 사진에 화장을 사실적으로 겹쳐 넣습니다. Source: https://arxiv.org/pdf/2207.09840

이러한 방식으로 얻은 합성 데이터를 활용하고 다양한 보조 프로젝트와 데이터셋의 도움을 받아, 연구진은 퍼포먼스 메이크업이나 ‘명백한’ 메이크업에 직면했을 때 연령 추정 분야에서 최첨단 방법들을 능가할 수 있었습니다.

논문에 따르면:

‘DiffClean [erases] 메이크업 흔적을 텍스트 안내 확산 모델로 제거해 메이크업 공격에 방어합니다. [It]는 디지털 시뮬레이션 및 실제 메이크업 이미지에서 경쟁 베이스라인 대비 연령 추정(미성년자 vs. 성인 정확도 4.8% 향상) 및 얼굴 검증(FMR=0.01%에서 TMR 8.9% 향상)을 개선합니다.’

그들이 어떻게 작업을 수행했는지 살펴보겠습니다.

방법

메이크업을 한 미성년자의 실제 이미지를 사용하지 않기 위해, 저자들은 EleGANt를 사용해 UTKFace 데이터셋에서 가져온 이미지에 합성 화장을 적용하여 학습용 전후 쌍을 만들었다.

UTKFace 데이터셋의 예시. 출처: https://susanqq.github.io/UTKFace/

UTKFace 데이터셋의 예시 Source: https://susanqq.github.io/UTKFace/

DiffClean은 이후 이 변환을 역전하도록 훈련되었다. 연령 추정 알고리즘은 특히 어린 연령대에서 오류가 가장 많이 발생하므로, 연구자들은 목표 연령대(10-19세)에 대해 미세조정된 프록시 연령 분류기를 개발할 필요가 있었다. 이를 위해 그들은 UTKFace에서 훈련된 SSRNet 아키텍처를 사용했으며, 가중된 L1 손실를 적용했다.

2021년 OpenAI 확산 모델의 축소 버전이 변환의 백본을 제공했으며, 저자들은 핵심 아키텍처를 유지하면서 다양한 해상도에 추가 어텐션 헤드와 더 깊은 층, 그리고 BigGAN 스타일 블록을 도입해 업샘플링 및 다운샘플링 단계를 개선했다.

CLIP 프롬프트를 사용해 방향 제어를 도입했다: 구체적으로 메이크업을 한 얼굴과 메이크업을 하지 않은 얼굴이며, 모델이 원하는 의미 방향으로 이동하도록 학습시켜 메이크업을 제거하면서도 얼굴 디테일, 연령 단서, 신원을 손상시키지 않도록 했다.

EleGANt를 사용해 적용한 합성 메이크업. 각 삼중항은 원본 UTKFace 이미지(왼쪽), 참조 메이크업 스타일(중앙), 스타일 전송 후 결과(오른쪽)를 보여준다.

EleGANt를 사용해 적용한 합성 메이크업. 각 삼중항은 원본 UTKFace 이미지(왼쪽), 참조 메이크업 스타일(중앙), 스타일 전송 후 결과(오른쪽)를 보여준다. 이러한 유형의 메이크업 전송은 컴퓨터 비전 문헌에서 흔히 다루어지며, Adobe Photoshop의 신경 필터에서도 유사하게 참조 이미지의 메이크업을 대상 이미지에 적용할 수 있다.

네 가지 핵심 손실 함수가 메이크업 제거 시 얼굴 정체성이나 연령 단서에 영향을 주지 않도록 안내했다. 앞서 언급한 CLIP 기반 손실 외에도, 정체성은 ArcFace 손실을 가중된 쌍으로 사용했으며, 이는 InsightFace 라이브러리에서 가져온 것으로, 생성된 얼굴과 원본 클린 이미지 및 ‘메이크업된’ 버전 간의 유사성을 측정해 메이크업 제거 전후에 피사체가 시각적으로 일관되도록 보장한다.

셋째, 지각 손실인 Learned Perceptual Similarity Metrics(LPIPS)는 L1 거리를 사용해 픽셀 수준의 사실성을 강제하고, 메이크업이 제거된 후에도 원본 이미지의 전체적인 모습을 유지한다.

마지막으로, 연령은 UTKFace 데이터셋으로 훈련된 미세조정된 SSRNet을 사용해 감독했으며, 모델은 부드러운 L1 손실을 사용했다(10–29세 연령대에서 오류에 대해 더 큰 페널티를 부여, 이 범위에서 오분류가 가장 흔함). 모델의 변형은 이를 CLIP 기반 연령 프롬프트로 대체해 특정 연령의 외모와 일치하도록 모델을 유도했다.

추론 단계에서 연령 추정을 위해(훈련 시 SSRNet 사용과는 달리), 2023년 MiVOLO 프레임워크가 사용되었다.

데이터 및 테스트

UTKFace에 대한 SSRNet 미세조정은 15,364장의 이미지로 구성된 훈련 세트를 사용했으며, 테스트 세트는 6,701장의 이미지로 구성되었다. 원본 20,000장은 70세 이상인 사람을 제외하도록 필터링된 후 70:30 비율로 나뉘었다.

2023년 DiffAM 프로젝트에서 확립된 이전 방법에 따라, 훈련은 두 단계로 진행되었으며 초기 단계에서는 BeautyGAN의 MT 데이터셋에서 300장의 실제 메이크업 이미지(이번에는 훈련 200장, 검증 100장으로 분할)를 사용했다.

그 후 모델은 EleGANt를 통해 합성 메이크업을 추가한 300장의 UTKFace 이미지를 더 사용해 정교화되었다. 이는 BeautyGAN의 다섯 가지 참조 스타일과 짝을 이루는 600개의 최종 훈련 세트를 만들었다. 메이크업 제거는 여러 메이크업 스타일을 하나의 클린 얼굴로 매핑하는 작업이므로, 훈련은 모든 가능한 화장 변형을 포괄하기보다 폭넓은 일반화에 중점을 두었다.

성능은 합성 이미지와 실제 이미지 모두에서 평가되었다. 합성 테스트는 2,556장의 Flickr-Faces-HQ 데이터셋(FFHQ) 이미지를 사용했으며, 70세 이하의 아홉 연령 그룹에 고르게 샘플링하고 EleGANt로 수정했다.

일반화는 BeautyFace에서 3,000장, LADN에서 355장의 이미지를 사용해 평가했으며, 두 데이터셋 모두 실제 메이크업을 포함한다.

BeautyFace 데이터셋의 예시로, 영향을 받은 얼굴 표면의 다양한 영역을 정의하는 의미론적 분할을 보여준다. 출처: https://li-chongyi.github.io/BeautyREC_files/

BeautyFace 데이터셋의 예시로, 영향을 받은 얼굴 표면의 다양한 영역을 정의하는 의미론적 분할을 보여준다. Source: https://li-chongyi.github.io/BeautyREC_files/

측정항목 및 구현

지표로는 저자들이 실제 연령이 확인된 실제 이미지와 예측 연령값 사이의 평균 절대 오차(MAE)를 사용했으며, 값이 낮을수록 좋습니다; 연령대 정확도를 사용해 예측 연령이 올바른 그룹에 속했는지 평가했으며(이 경우에도 값이 낮을수록 좋습니다); 미성년/성인 정확도는 18세 이상 인물을 올바르게 식별했는지를 평가했으며(값이 높을수록 좋습니다).

또한, 직접적인 주제와는 관계 없지만, 저자들은 True Match Rate (TMR)와 False Match Rate (FMR) 형태의 신원 확인 지표를 보고했으며, 관련 수신자 작동 특성(ROC) 값도 추가로 보고했습니다.

SSRNet은 64×64px 이미지에 대해 배치 크기 50으로, Adam 옵티마이저와 가중치 감쇠 1e−4를 사용했으며, 코사인 앤일링 스케줄러와 1e−3 학습률로 200 에포크 동안 학습했으며, 조기 중단을 적용했습니다.

대조적으로, DiffClean 모듈은 256×256px 입력 이미지를 받았으며, Adam을 사용해 5 epoch 동안 더 거친 학습률 4e−3으로 미세 조정되었습니다. 샘플링은 40 DDIM inversion 단계와 6 DDIM 전방 단계를 사용했습니다. 모든 학습은 단일 NVIDIA A100 GPU에서 수행되었으며(40GB 또는 80GB VRAM인지 여부는 명시되지 않았습니다).

경쟁 시스템으로는 CLIP2Protect와 앞서 언급한 DiffAM이 테스트되었습니다. 저자들은 워크플로우에서 ‘매트’ 메이크업 스타일을 사용했는데, 이는 CLIP2Protect에서 성공률이 더 높다고 보고된 바 있어(아마도 이 접근을 무력화하려는 시도자들에게 기회를 제공할 수 있지만, 이는 별도의 논의가 필요합니다).

DiffAM을 기준선으로 복제하기 위해 BeautyGAN의 사전 학습 모델을 MT 데이터셋에 미세 조정했습니다. 적대적 메이크업 전송을 위해 DiffAM 체크포인트를 대상 모델, 참조 이미지 및 신원에 대한 기본 매개변수와 함께 사용했습니다.

MiVOLO를 사용한 연령 추정 작업에서 DiffClean의 성능을 기준선과 비교한 결과, 보고된 지표는 미성년/성인 분류 정확도, 연령대 정확도, 평균 절대 오차(MAE)입니다. CLIP 연령 손실을 적용한 DiffClean이 모든 지표에서 최고의 결과를 달성했습니다.

MiVOLO를 사용한 연령 추정 작업에서 DiffClean의 성능을 기준선과 비교한 결과, 보고된 지표는 미성년/성인 분류 정확도, 연령대 정확도, 평균 절대 오차(MAE)입니다. CLIP 연령 손실을 적용한 DiffClean이 모든 지표에서 최고의 결과를 달성했습니다.

이러한 결과에 대해 저자들은 다음과 같이 말합니다:

‘[Our] 방법 DIFFCLEAN은 두 기준선인 CLIP2Protect와 DiffAM보다 성능이 우수하며, 메이크업으로 인해 방해된 연령 단서를 MAE를 5.71로 낮추고 전체 연령 그룹 예측 정확도를 37%로 향상시켜 성공적으로 복원할 수 있습니다.

‘우리의 목표는 미성년 연령 그룹에 초점을 맞추었으며, 결과는 미성년 대 성인 연령 분류에서 88.6%의 우수한 성능을 달성했음을 보여줍니다.’

기본 및 제안된 방법의 메이크업 제거 결과. 가장 왼쪽 열은 원본 이미지, 다음 열은 CLIP2Protect와 DiffAM의 출력, 세 번째 열은 SSRNet과 CLIP 기반 연령 손실을 적용한 DiffClean의 결과를 보여줍니다. 저자들은 DiffClean이 메이크업을 더 효과적으로 제거하여 CLIP2Protect에서 나타나는 특징 왜곡을 방지하고, DiffAM이 놓친 잔여 메이크업을 제거한다고 주장합니다.

기본 및 제안된 방법의 메이크업 제거 결과. 가장 왼쪽 열은 원본 이미지, 다음 열은 CLIP2Protect와 DiffAM의 출력, 세 번째 열은 SSRNet과 CLIP 기반 연령 손실을 적용한 DiffClean의 결과를 보여줍니다. 저자들은 DiffClean이 메이크업을 더 효과적으로 제거하여 CLIP2Protect에서 나타나는 특징 왜곡을 방지하고, DiffAM이 놓친 잔여 메이크업을 제거한다고 주장합니다.

저자들은 또한 메이크업이 인지된 연령에 일관된 영향을 미치지 않으며, 오히려 얼굴의 겉보이는 연령을 증가시키거나 감소시키거나 변하지 않을 수 있다고 지적합니다. 따라서 DiffClean은 예측 연령을 ‘일괄 감소’시키는 것이 아니라, 화장 흔적을 제거함으로써 원래의 연령 지표를 복구하려고 시도합니다:

CelebA-HQ와 CACD 데이터셋의 메이크업 제거 예시. 각 열은 메이크업 제거 전(왼쪽)과 후(오른쪽) 이미지 쌍을 보여줍니다. 첫 번째 열에서는 메이크업 제거 후 예측 연령이 감소하고, 두 번째 열에서는 변하지 않으며, 세 번째 열에서는 증가합니다.

CelebA-HQ와 CACD 데이터셋의 메이크업 제거 예시. 각 열은 메이크업 제거 전(왼쪽)과 후(오른쪽) 이미지 쌍을 보여줍니다. 첫 번째 열에서는 메이크업 제거 후 예측 연령이 감소하고, 두 번째 열에서는 변하지 않으며, 세 번째 열에서는 증가합니다.

DiffClean이 새로운 데이터에서 얼마나 잘 수행되는지 테스트하기 위해, 저자들은 메이크업이 실제로 포함되어 있지만 동일 인물의 메이크업 없는 짝 이미지가 없는 BeautyFace와 LADN 데이터셋에 적용했습니다. 메이크업 제거 전후의 연령 예측을 비교하여 DiffClean이 메이크업으로 인한 왜곡을 얼마나 효과적으로 감소시키는지 평가했습니다:

실제 이미지에서 LADN(왼쪽 쌍)과 BeautyFace(오른쪽 쌍) 데이터셋의 메이크업 제거 결과. DiffClean은 화장을 제거함으로써 예측 연령을 낮추어 겉보이는 연령과 실제 연령 사이의 차이를 좁혔습니다. 흰색 숫자는 처리 전후의 추정 연령을 보여줍니다.

LADN(왼쪽 쌍)과 BeautyFace(오른쪽 쌍) 데이터셋의 실제 이미지에 대한 메이크업 제거 결과. DiffClean은 화장을 제거함으로써 예측 연령을 낮추어 겉보기 연령과 실제 연령 사이의 차이를 좁힌다. 흰색 숫자는 처리 전후의 추정 연령을 보여준다.

결과는 DiffClean이 겉보기 연령과 실제 연령 사이의 차이를 일관되게 좁혔음을 보여준다. 두 데이터셋 모두에서 평균 약 3년 정도 과대·과소 추정 오류를 감소시켰으며, 이는 시스템이 실제 화장 스타일에 잘 일반화된다는 것을 시사한다.

결론

퍼포먼스 메이크업이 적대적인 방식으로 사용될 수 있다는 것은 흥미롭고 어쩌면 불가피한 일이다. 소녀들은 성장 속도가 다르지만, 그룹 전체로 보면 일관되게 더 빠르게 성장한다, 따라서 미성년자와 성인 여성 사이의 경계선을 식별하는 작업은 연구 분야가 지금까지 설정한 가장 야심찬 과제 중 하나일 수 있다.

그럼에도 불구하고, 시간과 데이터가 결국 시각적 연령 검증 시스템을 기반으로 할 수 있는 일관된 연령 관련 신호를 규명할 수 있을 것이다.

 

* 이 주제는 감정적인 언어를 유발하고, ‘girls’라는 표현이 배제적이기 때문에(현재 여성 및 소녀라는 용어가 이 경우 정확한 설명이 아니므로), 나는 최선의 타협안으로 ‘females’를 사용하기로 했으며—모든 인구통계적 미묘함을 포착하지는 못한다는 점에 대해 사과한다.

† 이 기사에서 나는 ‘performative’를 메이크업이 눈에 보이고 인식되도록 의도된, 예를 들어 마스카라, 아이라이너, 블러셔, 파운데이션과 같은 메이크업을 의미하는 데 사용하며, 반대로 컨실링 크림 및 기타 ‘은밀한’ 종류의 화장품 적용과는 구별한다.

2025년 7월 18일 금요일 최초 게시

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai