Anderson’un Açısı

Canlı Yayınlar için Yüz Güzellik Tahmini

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

Bugüne kadar, Yüz Güzellik Tahmini (FAP)主要 olarak psikolojik araştırma, güzellik ve kozmetik endüstrisi ve estetik cerrahi bağlamında incelenmiştir. Bu, bir çalışma alanıdır, çünkü güzellik standartları genellikle ulusal rather than küreseldir.

Bu, tek bir etkili AI tabanlı verisetinin uygulanabilir olmasını sağlar, çünkü tüm kültürlerden yüzler/rating’lerin örneklemesinden elde edilen ortalama değerler çok yanlı olacaktır (daha kalabalık ülkeler daha fazla etkiye sahip olacaktır) veya hiçbir kültüre uygulanmayacaktır (birden fazla ırkın/rating’in ortalama değeri hiçbir gerçek ırka karşılık gelmeyecektir).

Bunun yerine, ülke veya kültüre özgü verileri işleyebilecek kavramsal metodolojiler ve iş akışları geliştirme challenge’ı vardır, böylece her bölge için etkili FAP modelleri geliştirilebilir.

Güzellik ve psikolojik araştırmada FAP’nin kullanım örnekleri oldukça marjinaldir, yoksa endüstriye özgüdür; bu nedenle, bugüne kadar derlenen çoğu veri seti yalnızca sınırlı veri içerir veya hiç yayınlanmamıştır.

Online attractiveness predictors’un kolay erişilebilirliği, çoğunlukla batıaudiences için hedeflenmiştir, ancak FAP’nin hiện durumunda, doğu Asya araştırmaları (öncelikle Çin) ve entsprechende doğu Asya veri setleri tarafından domine edildiği görünmektedir.

2020 paper 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion' örnekleri. Kaynak: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

2020 paper ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’ örnekleri. Kaynak: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Güzellik tahmini için daha geniş ticari kullanımlar, online dating uygulamaları ve canlı avatar resimlerini “düzeltmek” için tasarlanmış generatif AI sistemlerini içerir (bu tür uygulamalar, etkinlik ölçütü olarak bir güzellik standardına ihtiyaç duyar).

Yüz Çizimi

Çekici bireyler, reklamcılık ve etkileyici olma açısından değerli bir varlıktır, bu nedenle bu sektörlerdeki finansal teşvikler, FAP veri setleri ve çerçevelerini geliştirmek için açık bir fırsat sunar.

Örneğin, gerçek dünya verisiyle eğitilmiş bir AI modeli, facial güzelliği değerlendirebilir ve derecelendirebilir, böylece yüksek reklam etkisine sahip olayları veya bireyleri potansiyel olarak tanımlayabilir. Bu yetenek, canlı video akışı bağlamlarında özellikle ilgili olacaktır, burada “takipçiler” ve “beğeniler” gibi metrikler, şu anda yalnızca bir bireyin (veya yüz tipinin) izleyiciyi çekme yeteneğinin implicit göstergeleri olarak hizmet vermektedir.

Bu, elbette, bir yüzey metriğidir ve ses, sunum ve görüş açısı da izleyici toplama açısından önemli bir rol oynar. Bu nedenle, FAP veri setlerinin oluşturulması, insan denetimi gerektirir, serta yüz güzelliğinden “sahte” güzelliği ayırt etme yeteneği (bunun olmadan, Alex Jones gibi out-of-domain etkileyiciler, yalnızca yüz güzelliğini tahmin etmek için tasarlanmış bir koleksiyon için ortalama FAP eğrisini etkileyebilir).

CanlıGüzellik

FAP veri setlerinin kıtlığını gidermek için, Çinli araştırmacılar, 100.000 yüz resmi ve 200.000 insan tarafından yapılan yüz güzelliği tahmini ile birlikte, ilk büyük ölçekli FAP veri setini sunuyorlar.

Yeni CanlıGüzellik veri setinden örnekler. Kaynak: https://arxiv.org/pdf/2501.02509

Yeni CanlıGüzellik veri setinden örnekler. Kaynak: https://arxiv.org/pdf/2501.02509

Veri seti, 10.000 farklı kimliği içerir, hepsi 2024 Mart’ında (belirtilmeyen) canlı yayın platformlarından elde edilmiştir.

Araştırmacılar ayrıca, FPEM adlı yeni bir çok modlu FAP yöntemini sunuyorlar. FPEM, holistik yüz öncü bilgisini ve çok modlu estetik anlamsal özellikleri, bir Kişisel Güzellik Öncü Modülü (PAPM), bir Çok Modlu Güzellik Kodlayıcı Modülü (MAEM) ve bir Çapraz Modlu Birleştirme Modülü (CMFM) aracılığıyla entegre eder.

Araştırmacılar, FPEM’in yeni CanlıGüzellik veri setinde ve diğer FAP veri setlerinde üstün performans gösterdiğini belirtiyorlar. Araştırmacılar, araştırmanın, video kalitesini iyileştirme, içerik önerme ve canlı yayında yüz düzeltme için potansiyel uygulamaları olduğunu söylüyorlar.

Araştırmacılar, veri setini “yakında” kullanılabilir hale getireceklerini vaat ediyorlar, ancak kaynak alanındaki lisans kısıtlamalarının, bu çalışmayı kullanabilecek çoğu projeye geçeceği kabul edilmelidir.

Yeni makale, “Canlı Yayınlar için Yüz Güzellik Tahmini: Yeni Bir Benchmark ve Çok Modlu Yöntem” başlığını taşır ve Alibaba Group ve Shanghai Jiao Tong Üniversitesi’nden on araştırmacının katkılarını içerir.

Yöntem ve Veri

Araştırmacılar, canlı yayın platformlarından her 10 saatlik yayından ilk üç saat için saat başına bir görüntü seçtiler. En yüksek sayfa görüntülemelerine sahip yayınlardan örnekler alındı.

Toplanan veriler, birkaç ön işleme aşamasına tabi tutuldu. İlk aşama, yüz bölgesi boyutu ölçümüdür, bu da 2018 CPU tabanlı FaceBoxes algılama modelini kullanarak yüz hatlarının etrafında bir sınırlayıcı kutu oluşturur. İşlem, sınırlayıcı kutunun daha kısa kenarının 90 pikselden fazla olmasını sağlar, böylece küçük veya belirsiz yüz bölgeleri filtrelenir.

İkinci aşama, yüz bölgesine Laplacian operatörünün varyansı kullanılarak applied blur tespitidir. Bu varyans, 10’dan büyük olmalıdır, bu da bulanık görüntüleri filtrelemeye yardımcı olur.

Üçüncü aşama, 2021 3DDFA-V2 yüz poz estimation modeli kullanılarak yüz poz tahmini yapılır:

3DDFA-V2 estimation modelinden örnekler. Kaynak: https://arxiv.org/pdf/2009.09960

3DDFA-V2 estimation modelinden örnekler. Kaynak: https://arxiv.org/pdf/2009.09960

İşlem, kırpılmış yüzün pitch açısının 20 dereceden fazla olmamasını ve yaw açısının 15 dereceden fazla olmamasını sağlar, bu da aşırı pozlara sahip yüzleri dışlar.

Dördüncü aşama, 3DDFA-V2 modelinin segmentasyon yeteneklerini kullanarak yüz orantı değerlendirmesidir, bu da kırpılmış yüz bölgesinin görüntü中的 yüzdesinin %60’dan fazla olmasını sağlar, bu da yüzün küçük olduğu görüntüleri dışlar.

Son olarak, beşinci aşama, aynı kimliğin birden fazla görüntüde görünmesi durumunda, bir yüz tanıma modeli kullanılarak yinelenen karakterlerin kaldırılmasıdır.

İnsan Değerlendirmesi ve Açıklamaları

Yirmi annotatör, altı erkek ve on dört kadın, kullanılan canlı platformun demografisini yansıtan bir şekilde seçildi. Yüzler, iPhone 14 Pro Max’ın 6,7 inç ekranında, tutarlı laboratuvar koşullarında gösterildi.

Değerlendirme, 200 seans boyunca yapıldı, her biri 50 görüntü içeriyordu. Konular, örneklerin yüz güzelliğini 1-5 puan arasında değerlendirdiler, her seans arasında beş dakikalık bir mola verildi ve tüm konular tüm seanslara katıldı.

Böylece, 10.000 görüntünün tamamı, yirmi insan konusu tarafından değerlendirildi ve 200.000 açıklama yapıldı.

Analiz ve Ön İşleme

İlk olarak, konu sonrası ekranlama, outlierratio ve Spearman’ın Sıralama Korelasyon Katsayısı (SROCC) kullanılarak yapıldı. SROCC’si 0,75’den az veya outlierratio’su %2’den fazla olan konular güvensiz olarak kabul edildi ve kaldırıldı, sonunda 20 konu kaldı.

Her yüz görüntüsü için, geçerli konulardan alınan puanların ortalaması alınarak bir Mean Opinion Score (MOS) hesaplandı. MOS, her görüntü için ground truth güzellik etiketi olarak hizmet eder ve geçerli her konudan alınan bireysel puanların ortalaması olarak hesaplanır.

Son olarak, tüm örneklerin MOS dağılımlarının analizi, kadın ve erkek örneklerinin MOS dağılımlarının Gaussian-style bir şekil gösterdiğini ortaya koydu:

CanlıGüzellik MOS dağılımları örnekleri.

CanlıGüzellik MOS dağılımları örnekleri.

Çoğu bireyin ortalama yüz güzelliğine sahip olduğu, çok az bireyin çok düşük veya çok yüksek güzelliğe sahip olduğu görüldü.

Ayrıca, çarpıklık ve kurtosis değerlerinin analizi, dağılımların ince kuyruklara sahip olduğunu ve ortalama puana yoğunlaştığını gösterdi ve yüksek güzelliğin kadın örneklerinde daha yaygın olduğu görüldü.

Mimari

İki aşamalı bir eğitim stratejisi, FPEM ve CanlıGüzellik’teki Hibrit Birleştirme Aşaması için kullanıldı, dört modülden oluşuyor: Kişisel Güzellik Öncü Modülü (PAPM), Çok Modlu Güzellik Kodlayıcı Modülü (MAEM), Çapraz Modlu Birleştirme Modülü (CMFM) ve Karar Birleştirme Modülü (DFM).

CanlıGüzellik'in eğitim pipeline'ın kavramsal şeması.

CanlıGüzellik’in eğitim pipeline’ın kavramsal şeması.

PAPM modülü, bir görüntüyü girdi olarak alır ve bir Swin Transformer kullanarak çok ölçekli görsel özellikleri çıkarır ve ayrıca bir önceden eğitilmiş FaceNet modeli kullanarak yüz farkında özellikleri çıkarır. Bu özellikler, bir çapraz dikkat bloğu kullanılarak birleştirilir ve bir kişiselleştirilmiş “güzellik” özelliği oluşturulur.

MAEM, bir görüntü ve güzelliğin metin açıklamalarını kullanarak, CLIP’i kullanarak çok modlu estetik anlamsal özellikleri çıkarır.

Şablonlu metin açıklamaları, “{a} güzelliği olan bir kişinin fotoğrafı” şeklindeki bir formda olabilir (burada {a} “kötü”, “düşük”, “adil”, “iyi” veya “mükemmel” olabilir). Süreç, metin ve görsel gömme arasındaki kosin benzerliğini hesaplar ve bir güzellik düzeyi olasılığına ulaşır.

Hibrit Birleştirme Aşamasında, CMFM, PAPM tarafından oluşturulan kişiselleştirilmiş güzellik özelliğini kullanarak metin gömme’lerini rafine eder ve kişiselleştirilmiş metin gömme’leri oluşturur. Ardından, bir benzerlik regresyonu stratejisi kullanarak bir tahminde bulunur.

Son olarak, DFM, PAPM, MAEM ve CMFM’den gelen bireysel tahminleri birleştirir ve tek bir son güzellik puanı üretir, güçlü bir konsensüs elde etmeyi amaçlar.

Kayıp Fonksiyonları

Kayıp metrikleri için, PAPM, L1 kaybı kullanılarak eğitilir, bu da predicted güzellik puanı ile gerçek (ground truth) güzellik puanı arasındaki mutlak farkın bir ölçüsüdür.

MAEM modülü, daha karmaşık bir kaybı kullanır, bu da bir puanlama kaybı (LS) ile bir birleştirilmiş sıralama kaybı (LR) içerir. Sıralama kaybı (LR), bir sadakat kaybı (LR1) ve bir iki yönlü sıralama kaybı (LR2) içerir.

LR1, görüntü çiftlerinin göreli güzelliğini karşılaştırır, LR2 ise predicted güzellik düzeylerinin olasılık dağılımının tek bir zirveye sahip olduğunu ve her iki yönde de azaldığını sağlar. Bu birleşik yaklaşım, hem doğru puanlama hem de görüntü sıralamasını optimize etmeyi amaçlar.

CMFM ve DFM, basit bir L1 kaybı kullanılarak eğitilir.

Testler

Testlerde, araştırmacılar CanlıGüzellik’i önceki dokuz yaklaşımla karşılaştırdı: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (REX-INCEP’te yer alan); MEBeauty; AVA-MLSP; TANet; Dele-Trans; ve EAT.

Araştırmacılar, CanlıGüzellik’i, Image Aesthetic Assessment (IAA) protokolüne uygun olan ViT-B, ResNeXt-50 ve Inception-V3 gibi temel yöntemlerle de karşılaştırdı.

Test edilen diğer veri setleri, SCUT-FBP5000 ve MEBeauty idi. Aşağıda, bu veri setlerinin MOS dağılımları karşılaştırılır:

Benchmark veri setlerinin MOS dağılımları.

Benchmark veri setlerinin MOS dağılımları.

Bu konuk veri setleri, orijinal protokollerine uygun olarak %60-%40 ve %80-%20 olarak ayrıldı. CanlıGüzellik, %90-%10 olarak ayrıldı.

MAEM için model başlatılması, VT-B/16 ve GPT-2’yi sırasıyla görüntü ve metin kodlayıcıları olarak kullandı, CLIP’ten ayarlar kullanılarak başlatıldı. PAPM için, Swin-T, eğitilebilir bir görüntü kodlayıcı olarak kullanıldı, SwinFace’e uygun olarak.

AdamW optimizatörü kullanıldı ve öğrenme oranı zamanlayıcı, lineer warm-up ile cosine annealing şemasında ayarlandı. Öğrenme oranları, eğitim aşamalarına göre farklılık gösterdi, ancak her biri 32’lik bir batch boyutuna ve 50 epoch’a sahipti.

Test sonuçları

Test sonuçları

Üç FAP veri setindeki test sonuçları yukarıda gösterilir. Bu sonuçlardan, makale şunları belirtir:

‘Önerdiğimiz yöntem, LiveBeauty, MEBeauty ve SCUT-FBP5500’de SROCC değerlerinde sırasıyla 0,012, 0,081 ve 0,021 ile ilk sırada yer alıyor ve ikinci sıradaki yöntemi geçiyor, bu da önerdiğimiz yöntemin üstünlüğünü gösteriyor.

‘IAA yöntemleri, FAP yöntemlerine göre daha düşük performans gösteriyor, bu da genel estetik değerlendirme yöntemlerinin, yüz güzelliğinin subjektif doğasını içeren yüz özelliklerini göz ardı ettiğini ve FAP görevlerinde düşük performans gösterdiğini gösteriyor.

‘Tüm yöntemlerin performansı, MEBeauty’de önemli ölçüde düşüyor. Bu, eğitim örneklerinin sınırlı olması ve MEBeauty’deki yüzlerin etnik olarak çeşitli olması nedeniyle, yüz güzelliğinde büyük bir çeşitlilik olması nedeniyle.

‘Tüm bu faktörler, MEBeauty’de yüz güzelliği tahminiğini daha da zorlaştırıyor.’

Etik Düşünceler

Güzellik araştırması, potansiyel olarak bölücü bir uğraştır, çünkü güzellik standartlarını empirik olarak kurmaya çalışan sistemler, yaş, ırk ve birçok diğer bilgisayar vizyonu araştırmasıyla ilgili önyargıları pekiştirecektir.

Güzellik tahmini sistemi, doğal olarak, güzelliğin kısmi ve önyargılı bakış açılarını pekiştirmeye ve yaymaya eğilimlidir. Bu yargılar, insan tarafından yapılan açıklamalardan kaynaklanabilir – genellikle ölçeklenmeyen örneklemelerle yapılır – veya online ortamlardaki dikkat kalıplarının analizinden kaynaklanabilir, bu ortamlar argüman olarak meritokratik değildir.

 

* Makale, adı verilmeyen kaynak alanını hem tekil hem de çoğul olarak ifade eder.

İlk olarak 8 Ocak 2025 Çarşamba günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai