Andersonův úhel

Odhadování predikce atraktivity obličeje pro živé přenosy

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

Dosud byla predikce atraktivity obličeje (FAP) primárně studována v kontextu psychologického výzkumu, v kosmetickém průmyslu a v kontextu plastické chirurgie. Je to náročné odvětví studia, protože standardy krásy tendují být spíše národní než globální.

To znamená, že žádný jediný efektivní AI-založený dataset není životaschopný, protože průměrné hodnoty získané z výběru tváří/hodnocení z všech kultur by byly velmi zkreslené (kde by více lidnaté národy získaly další trakci), nebo použitelné pro žádnou kulturu (kde by průměrná hodnota více ras/hodnocení odpovídala žádné skutečné rase).

Místo toho je výzvou vyvinout konceptuální metodologie a pracovní postupy, do kterých by mohla být zpracována data specifická pro zemi nebo kulturu, aby bylo možné vyvinout efektivní modely FAP pro každou region.

Případy použití FAP v kosmetickém průmyslu a psychologickém výzkumu jsou poměrně okrajové, jinak specifické pro průmysl; proto většina datasetů vytvořených doposud obsahuje pouze omezená data, nebo nebyla zveřejněna vůbec.

Snadná dostupnost online prediktorů atraktivity, většinou zaměřených na západní publikum, nemusí nutně reprezentovat stav umění v FAP, který je目前 dominován východoasijským výzkumem (primárně Čínou), a odpovídajícími východoasijskými daty.

Ukázky z datasetu z roku 2020 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion'. Zdroj: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Ukázky z datasetu z roku 2020 ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Zdroj: https://www.semanticscholar.org/paper/Asian-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Širší komerční použití pro odhad krásy zahrnuje online datování a generativní AI systémy navržené pro ‘retušování’ skutečných avatarů lidí (protože takové aplikace vyžadují kvantifikovaný standard krásy jako metriku efektivity).

Kreslení obličeje

Atraktivní jedinci pokračují v tom, že jsou cenným aktivem v reklamě a budování vlivu, což činí finanční pobídky v těchto sektorech jasnou příležitostí pro rozvoj stávajících datasetů a rámců FAP.

Například AI model trénovaný s reálnými daty pro hodnocení a hodnocení krásy obličeje by mohl potenciálně identifikovat události nebo osoby s vysokým potenciálem pro reklamní dopad. Tato schopnost by byla especialmente relevantní v kontextu živých video přenosů, kde metriky jako ‘následovníci’ a ‘líbí se’ aktuálně slouží pouze jako implicitní indikátory schopnosti jedince (nebo dokonce typu obličeje) zaujmout publikum.

Toto je samozřejmě povrchní metrika, a hlas, prezentace a úhel pohledu také hrají významnou roli v shromažďování publika. Proto vyžaduje kultivace datasetů FAP lidský dohled, stejně jako schopnost rozlišovat mezi krásou obličeje a ‘falešnou’ krásou (bez které by out-of-domain influencerů, jako je Alex Jones, mohl ovlivnit průměrnou křivku FAP pro sbírku navrženou výhradně pro odhad krásy obličeje).

LiveBeauty

Aby se řešil nedostatek datasetů FAP, výzkumníci z Číny nabízejí první velkým dataset FAP, obsahující 100 000 obrázků obličeje, spolu s 200 000 lidskými anotacemi odhadujícími krásu obličeje.

Ukázky z nového datasetu LiveBeauty. Zdroj: https://arxiv.org/pdf/2501.02509

Ukázky z nového datasetu LiveBeauty. Zdroj: https://arxiv.org/pdf/2501.02509

Nazvaný LiveBeauty, dataset obsahuje 10 000 různých identit, všechny pořízené z (nespecifikovaných) živých streamovacích platforem v březnu 2024.

Autorům se také podařilo představit FPEM, novou multi-modální metodu FAP. FPEM integruje holistické znalosti o obličeji a multi-modální estetické funkce prostřednictvím Personalizovaného modulu předchozí krásy (PAPM), Multi-modálního kodéru atraktivity (MAEM) a Modulu fúze mezi modality (CMFM).

Článek tvrdí, že FPEM dosahuje špičkového výkonu na novém datasetu LiveBeauty a dalších datasetech FAP. Autoři poznamenávají, že výzkum má potenciální aplikace pro zlepšení kvality videa, doporučení obsahu a retušování obličeje v živém streamování.

Autorům se také slibuje, že dataset bude brzy k dispozici – i když je třeba uznat, že jakékoli licenční omezení v zdrojovém doméně se pravděpodobně přenese na většinu aplikovatelných projektů, které by mohly využít této práce.

Nový článek se nazývá Predikce atraktivity obličeje v živém streamování: Nová referenční hodnota a multi-modální metoda a pochází od deseti výzkumníků z Alibaba Group a Šanghajské univerzity Jiao Tong.

Metoda a data

Z každého 10hodinového vysílání z živých streamovacích platforem byly vybrány tři obrázky. Vysílání s nejvyšším počtem zobrazení byly vybrány.

Sběraná data byla poté podrobena několika předzpracovacím fázím. První z nich je měření velikosti oblasti obličeje, které používá model FaceBoxes z roku 2018 pro generování rámečku kolem obličeje. Rámeček zajišťuje, že kratší strana rámečku přesahuje 90 pixelů, aby se zabránilo malým nebo nejasným oblastem obličeje.

Druhá fáze je detekce rozostření, která se aplikuje na oblast obličeje pomocí variance Laplacian operátoru v kanálu Y obličeje. Tato variance musí být větší než 10, což pomáhá filtrovat rozmazané obrázky.

Třetí fáze je odhad úhlu obličeje, který používá model 3DDFA-V2 z roku 2021:

Ukázky z modelu 3DDFA-V2. Zdroj: https://arxiv.org/pdf/2009.09960

Ukázky z modelu 3DDFA-V2. Zdroj: https://arxiv.org/pdf/2009.09960

Zde pracovní postup zajišťuje, že úhel sklonu oříznutého obličeje není větší než 20 stupňů, a úhel yaw není větší než 15 stupňů, což vylučuje obličeje s extrémními úhly.

Čtvrtá fáze je hodnocení proporcionality obličeje, která také používá segmentační schopnosti modelu 3DDFA-V2, zajišťující, že oříznutá oblast obličeje je větší než 60 % obrazu, vylučující obrázky, kde je obličej není prominentní. tzn. malý v celém obraze.

Nakonec, pátá fáze je odstranění duplicitních charakterů, která používá (neatributovaný) špičkový model rozpoznávání obličeje, pro případy, kdy stejná identita se objeví ve více než jednom z tří obrázků shromážděných pro 10hodinové video.

Hodnocení a anotace lidským posuzovatelem

Dvacet posuzovatelů bylo vybráno, skládající se z šesti mužů a 14 žen, odrážející demografii živé platformy*. Obličeje byly zobrazeny na 6,7palcovém displeji iPhone 14 Pro Max, za konzistentních laboratorních podmínek.

Hodnocení bylo rozděleno do 200 sezení, z nichž každé používalo 50 obrázků. Předmětům bylo požádáno, aby ohodnotili atraktivitu vzorků na škále 1-5, s pětiminutovou přestávkou mezi každým sezením, a všichni předměty se zúčastnili všech sezení.

Tím se celá 10 000 obrázků hodnotilo napříč dvaceti lidskými subjekty, dosahující 200 000 anotací.

Analýza a předzpracování

Nejprve se provedlo posuzování subjektů pomocí poměru outlierů a Spearmanova rankového korelačního koeficientu (SROCC). Subjekty, jejichž hodnocení měla SROCC menší než 0,75 nebo poměr outlierů větší než 2 %, byly považovány za nespolehlivé a byly odstraněny, s konečným počtem 20 subjektů..

Byla poté vypočtena střední hodnota názoru (MOS) pro každý obrázek obličeje, průměrováním hodnocení získaných od platných subjektů. MOS slouží jako ground truth označení atraktivity pro každý obrázek, a hodnota se vypočítá průměrováním všech individuálních hodnocení od každého platného subjektu.

Nakonec analýza distribucí MOS pro všechny vzorky, stejně jako pro vzorky žen a mužů, ukázala, že vykazují Gaussovský tvar, který je konzistentní s reálnými distribucemi atraktivity obličeje:

Ukázky z distribucí MOS LiveBeauty.

Ukázky z distribucí MOS LiveBeauty.

Většina jedinců tenduje mít průměrnou atraktivitu obličeje, s menším počtem jedinců na extrémech velmi nízké nebo velmi vysoké atraktivity.

Dále analýza škálnosti a kurtózy ukázala, že distribuce byly charakterizovány tenkými ocasy a koncentrované kolem průměrné hodnoty, a že vyšší atraktivita byla častější u vzorků žen ve sbírce živých streamovacích videí.

Architektura

Byla použita dvoufázová strategie školení pro model FPEM a fázi hybridní fúze v LiveBeauty, rozdělenou do čtyř modulů: Personalizovaného modulu předchozí krásy (PAPM), Multi-modálního kodéru atraktivity (MAEM), Modulu fúze mezi modality (CMFM) a Rozhodovacího modulu fúze (DFM).

Konceptuální schéma pro trénovací pipeline LiveBeauty.

Konceptuální schéma pro trénovací pipeline LiveBeauty.

Modul PAPM bere obrázek jako vstup a extrahuje multi-škálové vizuální funkce pomocí Swin Transformeru, a také extrahuje funkce obličeje pomocí předtrénovaného FaceNetu. Tyto funkce jsou poté kombinovány pomocí cross-attention bloku pro vytvoření personalizované ‘atraktivity’ funkce.

Také v předběžné fázi školení MAEM používá obrázek a textová popis atraktivity, využívající CLIP pro extrakci multi-modálních estetických sémantických funkcí.

Šablony textových popisů jsou ve formě ‘fotografie osoby s {a} atraktivitou’ (kde {a} může být špatná, špatná, slušná, dobrá nebo perfektní). Proces odhaduje kosinovou podobnost mezi textovými a vizuálními embedovanými pro získání pravděpodobnosti atraktivity.

V hybridní fázi CMFM rafinuje textová embedování pomocí personalizované funkce atraktivity generované PAPM, tím vytváří personalizovaná textová embedování. Poté používá regresní strategii podobnosti pro provedení předpovědi.

Nakonec DFM kombinuje jednotlivé předpovědi z PAPM, MAEM a CMFM pro vytvoření jediné, konečné hodnoty atraktivity, s cílem dosáhnout pevného konsensu.

Funkce ztrát

Pro metriky ztrát, PAPM je trénován pomocí L1 ztráty, měřítkem absolutního rozdílu mezi předpovězenou hodnotou atraktivity a skutečnou (ground truth) hodnotou atraktivity.

Modul MAEM používá složitější funkci ztrát, která kombinuje funkci ztrát skóre (LS) s funkcí ztrát pořadí (LR). Funkce ztrát pořadí (LR) se skládá z funkce ztrát věrnosti (LR1) a dvou směrového pořadí ztrát (LR2).

LR1 porovnává relativní atraktivitu párů obrázků, zatímco LR2 zajišťuje, že předpovězená distribuce pravděpodobnosti úrovní atraktivity má jeden vrchol a klesá v obou směrech. Tento kombinovaný přístup cílí na optimalizaci jak přesného skóre, tak pořadí obrázků na základě atraktivity.

CMFM a DFM jsou trénovány pomocí jednoduché L1 ztráty.

Testy

Ve testech výzkumníci postavili LiveBeauty proti devíti předchozím přístupům: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (vyobrazený v REX-INCEP); MEBeauty; AVA-MLSP; TANet; Dele-Trans; a EAT.

Metody základních linek, které odpovídají hodnocení estetiky obrázků (IAA), byly také testovány. Tyto zahrnovaly ViT-B; ResNeXt-50; a Inception-V3.

Kromě LiveBeauty byly testovány také datasety SCUT-FBP5000 a MEBeauty. Níže jsou porovnány distribuce MOS těchto datasetů:

Distribuce MOS testovacích datasetů.

Distribuce MOS testovacích datasetů.

Tito hostující datasety byly rozděleny 60%-40% a 80%-20% pro trénování a testování, samostatně, aby se zachovala konzistence s jejich původními protokoly. LiveBeauty byl rozdělen na 90%-10% bázi.

Pro inicializaci modelu v MAEM byly použity VT-B/16 a GPT-2 jako image a textové encodéry, inicializované pomocí nastavení z CLIP. Pro PAPM byl použit Swin-T jako trénovatelný image encoder, v souladu s SwinFace.

AdamW optimalizátor byl použit, a rychlost učení plánovač byl nastaven s lineárním zahřátím pod kosinový annealing schéma. Rychlosti učení se lišily v různých fázích školení, ale každá měla velikost batche 32, pro 50 epoch.

Výsledky testů

Výsledky testů

Výsledky testů na třech datasetech FAP jsou zobrazeny výše. Z těchto výsledků článek uvádí:

‘Naše navržená metoda dosahuje první místo a překonává druhé místo o asi 0,012, 0,081, 0,021 v termínech SROCC hodnot na LiveBeauty, MEBeauty a SCUT-FBP5500, což demonstruje superioritu naší navržené metody.

‘Metody IAA jsou horší než metody FAP, což ukazuje, že obecné metody hodnocení estetiky přehlížejí funkce obličeje zapojené do subjektivní povahy atraktivity obličeje, vedoucí k horšímu výkonu na úkolech FAP.

‘Výkon všech metod klesá výrazně na MEBeauty. To je způsobeno tím, že trénovací vzorky jsou omezené a obličeje jsou etnicky rozmanité v MEBeauty, což naznačuje, že existuje velká rozmanitost atraktivity obličeje.

‘Všechny tyto faktory činí předpověď atraktivity obličeje v MEBeauty ještě náročnější.’

Etické úvahy

Výzkum atraktivity je potenciálně rozdílný, protože při stanovení údajných empirických standardů krásy, takové systémy budou tendovat k posílení zkreslení kolem věku, rasy a mnoha dalších sekcí počítačového vidění vztahujících se k lidem.

Mohlo by se tvrdit, že systém FAP je inherentně predisponován k posílení a prodloužení zkreslených a偏ných perspektiv na atraktivitu. Tyto soudy mohou pocházet z lidsky vedených anotací – často prováděných na škálách, které jsou příliš omezené pro efektivní obecnou generalizaci – nebo z analýzy vzorců pozornosti v online prostředích, jako jsou streamovací platformy, které jsou, zřejmě, daleko od být meritokratické.

 

* Článek se odvolává na neznačené zdrojové domény v singuláru i plurálu.

Poprvé zveřejněno ve středu 8. ledna 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai