Andersonův úhel

Úsilí AI o krásu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image featuring a woman whose face is being analyzed by a Terminator-style HUD. GPT-1.5.

Nový systém hodnocení krásy poháněný umělou inteligencí hodnotí, jak atraktivní vypadají tváře, a přitom se učí rychleji než typické hluboké učící modely, což by mohlo učinit velkou škálu automatizovaného hodnocení krásy praktičtější.

 

Předpověď krásy obličeje (FBP) je velký byznys a poměrně silný směr ve výzkumné literatuře. Ačkoli porušuje prakticky všechny zásady boje proti předpojatosti v AI a postupech strojového učení, a ačkoli v mnoha ohledech podporuje objektivizaci a redukcionismus v algoritmických vnímaních žen, přesto přitahuje zájem několika multi-miliardových dolarových odvětví, z nichž většina je zaměřena přímo na ženy, jako je kosmetika, kosmetická chirurgie obličeje, přímé přenosy a móda, mezi jinými:

Ženy hodnocené od 1 do 5, z článku 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion'. Zdroj - https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Ženy hodnocené od 1 do 5, z článku ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Zdroj

Mimo tyto zjevné ženské obchodní enklávy mají reklama a další odvětví, včetně zábavy a vydavatelství, významné zájmy ve việc porozumění tomu, co muži i ženy považují za ‘atraktivní’, nutně na kulturní bázi.

Skutečnost, že agregované vnímání krásy se liší napříč regiony, znamená, že nelze získat žádné definitivní globálně platné soubory dat, a že nové výzkumy musí buď zůstat lokální, nebo se soustředit na ‘high-level’ metody, které lze aplikovat napříč rozmanitými kulturami.

Rozhraní pro systém hodnocení krásy obličeje pro projekt SCUT-FBP z roku 2015. Zdroj - https://arxiv.org/pdf/1511.02459

Rozhraní pro systém hodnocení krásy obličeje pro projekt SCUT-FBP z roku 2015. Zdroj

Často není geografická poloha jediným omezením, protože soubory dat zaměřené na atraktivitu mohou mít problémy s poskytováním stejné účinnosti napříč pohlavími, nebo mohou být sestaveny s určitým účelem, a to může omezit použití sbírky v jiných oblastech.

Například v roce 2025 jsem napsal o vývoji relativně velkého (100 000+ identit) souboru dat pro hodnocení atraktivity v přímých přenosech, jehož standardy by mohly potřebovat významné adaptace pro širší projekty, navzdory enormnímu úsilí, které stálo za touto iniciativou.

Vyobrazení obličeje

Jak je zřejmé z odkazů a obrázků výše, asijské výzkumné ústavy často nepracují pod stejnými kulturními omezeními jako jejich západní protějšky, kteří by byli těžko přesvědčeni, aby publikovali vědeckou ilustraci, která hodnotí pět západních žen od nejméně po nejvíce atraktivních, jak je vidět v výše uvedené studii.

Mohlo by se argumentovat, že tam, kde jsou systémy tohoto druhu původem z Asie prokázány jako účinné ve veřejném prostoru, bez strachu z místních kritik, západní zájmy mohou použít nebo adaptovat takový výzkum do proprietárních, soukromých implementací. Úkol ‘hodnocení žen’ je v tomto scénáři ‘renditionován’ do lokality, kde lze jej provádět bez kritiky.

Zda je toto běžné nebo zda méně veřejně známé západní ekvivalentní systémy tendují být vyvíjeny mimo otevřenou spolupráci a mimo veřejnou kontrolu, je rozumné předpokládat, že cílový cíl je globálního zájmu, vzhledem k velkému počtu profesních sektorů, které mohou nebo by mohly profitovat z přesných hodnocení atraktivity.

Přežití nejsilnějších

Může se zdát, že obrovské webové soubory, jako jsou Tik Tok, Instagram a YouTube, by mohly být vynikajícími arbitry krásy, tím, že korelují sledující, líbí a provoz s atraktivitou, jelikož toto je běžné a rozumné spojení (ačkoli s některými výjimkami).

Podobně, existující soubory – jako ImageNet a LAION – obsahující herce a modely, kteří ‘vzešli na vrchol’ – budou obvykle obsahovat atraktivní jedince (ačkoli často s příliš mnoha datovými body příliš málo lidí), což umožňuje širším kulturním mechanismům působit jako proxy pro atraktivitu.

Nicméně, toto nebere v úvahu měnící se chutě v tom, co lidé považují za atraktivní v průběhu času (natož geograficky). Proto, opět, jsou potřebné high-level a data-agnostic systémy, ne individuální a spekulativní soubory nebo kurátorské sbírky, které selžou při reflexi měnících se chutí.

Kombinovaná kůže

Nejnovější akademický příspěvek, který se zabývá těmito výzvami, pochází z Číny, kde přenosové učení a Broad Learning System (BLS) jsou kombinovány, aby řešily dlouholetou obchodní rovnováhu mezi přesností a výpočetní nákladností.

Tradiční neuronové sítě tendují k dosažení silných výsledků pouze s těžkým tréninkem, zatímco lehčí systémy, jako je BLS, se učí rychle, ale mají problémy s zachycením dostatečných detailů. Nová práce mostí tuto mezeru pomocí předem naučeného vizuálního modelu pro extrakci obličejových rysů, které jsou poté předány do rychlého BLS-založeného systému pro hodnocení, což umožňuje znovupoužití rysů místo učení z nich, zatímco udržení efektivity tréninku:

Ukázka obrázků ze souboru LSAFBD, zobrazující ženské tváře seskupené podle lidsky přiřazených krásných skórů od 1 do 5, kde hodnocení byla odvozena z více anotátorů a použita jako dohledované štítky pro trénink a hodnocení modelů předpovědi krásy obličeje napříč variacemi v póze, osvětlení a vzhledu.. Zdroj - https://arxiv.org/pdf/2603.16930

Ukázka obrázků ze souboru LSAFBD, zobrazující ženské tváře seskupené podle lidsky přiřazených krásných skórů od 1 do 5. Hodnocení byla získaná z více anotátorů, a použita jako dohledované štítky pro trénink a hodnocení modelů předpovědi krásy obličeje napříč variacemi v póze, osvětlení a vzhledu. Zdroj

První z dvou variant, E-BLS, kombinuje EfficientNet-založené přenosové učení s BLS, extrahující podrobné vizuální rysy z obličeje, a poté je předávající do BLS, což vede k finální předpovědi, která se vyhýbá nutnosti trénovat plnou hlubokou neuronovou síť od začátku:

Schéma architektury pro model E-BLS, zobrazující, jak obličejové obrázky z cílových souborů, jako je SCUT-FBP5500 a LSAFBD, jsou nejprve předány do předem naučeného extraktoru rysů EfficientNet, jehož parametry jsou přeneseny z ImageNet a ponechány pevné, poté jsou výsledné mapy rysů předány do Broad Learning System (BLS), kde jsou uzly rysů a uzly zlepšení kombinovány prostřednictvím cvičitelných váh, aby se vyrobil finální skór krásy obličeje.

Schéma architektury pro model E-BLS.

EfficientNet, předem naučený na ImageNet-1k, a z velké části ponechán beze změny, převádí každý vstupní obrázek na kompaktní soubor hodnot rysů, které popisují obličej strukturovaným způsobem, zatímco BLS bere tyto hodnoty a zpracovává je prostřednictvím sítě jednoduchých, náhodně propojených uzlů, které transformují a kombinují informace, než vyrobí finální skór atraktivity.

Protože BLS nezávisí na hlubokých vrstvách, E-BLS může být aktualizován přidáním více uzlů místo重新 tréninku celého systému, což udržuje trénink rychlý a usnadňuje zlepšení modelu, když jsou zavedena nová data.

Druhá z dvou variant, ER-BLS, staví na E-BLS tím, že vkládá další zpracovatelské stadium mezi extraktor rysů EfficientNet a BLS, s cílem zlepšit, jak jsou extrahované rysy připraveny před použitím pro předpověď:

Architektura modelu ER-BLS, kde obličejové obrázky jsou zpracovány předem naučeným extraktorem rysů EfficientNet, poté jsou rafinovány prostřednictvím spojovací vrstvy pomocí poolingu, normalizace a transformace RBF. Výstup je poté předán do Broad Learning System (BLS), aby se vyrobil finální skór krásy obličeje.

Architektura modelu ER-BLS.

Místo toho, aby se syrové rysy EfficientNet předávaly přímo do BLS, ER-BLS nejprve předává rysy prostřednictvím rafinační vrstvy, která standardizuje a přeformátuje data, což pomáhá snížit šum a činí rysy konzistentnějšími napříč různými obrázky. Tento krok je navržen tak, aby zlepšil, jak dobře systém generalizuje, zejména když tváře variují v osvětlení, póze nebo jiných vizuálních podmínkách, které by jinak mohly zavést nestabilitu do předpovědí.

Rafinované rysy jsou poté předány do stejné struktury BLS, která se používá v E-BLS, kde uzly rysů a uzly zlepšení transformují a kombinují informace, aby vyrobily finální skór atraktivity.

Metoda

Výše zmíněný Broad Learning System je lehkou alternativou k hlubokým neuronovým sítím, která přeskočí vrstvení několika vrstev a místo toho rozprostře učení napříč širokou sadou jednoduchých spojů, což umožňuje modelům učit se rychle – ale obvykle na úkor chybějících jemných vizuálních detailů.

První z dvou variant, E-BLS, kombinuje EfficientNet-založené přenosové učení s BLS, extrahující podrobné vizuální rysy z obličeje, a poté je předávající do BLS, což vede k finální předpovědi, která se vyhýbá nutnosti trénovat plnou hlubokou neuronovou síť od začátku:

Schéma architektury pro model E-BLS, zobrazující, jak obličejové obrázky z cílových souborů, jako je SCUT-FBP5500 a LSAFBD, jsou nejprve předány do předem naučeného extraktoru rysů EfficientNet, jehož parametry jsou přeneseny z ImageNet a ponechány pevné, poté jsou výsledné mapy rysů předány do Broad Learning System (BLS), kde jsou uzly rysů a uzly zlepšení kombinovány prostřednictvím cvičitelných váh, aby se vyrobil finální skór krásy obličeje.

Schéma architektury pro model E-BLS.

EfficientNet, předem naučený na ImageNet-1k, a z velké části ponechán beze změny, převádí každý vstupní obrázek na kompaktní soubor hodnot rysů, které popisují obličej strukturovaným způsobem, zatímco BLS bere tyto hodnoty a zpracovává je prostřednictvím sítě jednoduchých, náhodně propojených uzlů, které transformují a kombinují informace, než vyrobí finální skór atraktivity.

Protože BLS nezávisí na hlubokých vrstvách, E-BLS může být aktualizován přidáním více uzlů místo重新 tréninku celého systému, což udržuje trénink rychlý a usnadňuje zlepšení modelu, když jsou zavedena nová data.

Druhá z dvou variant, ER-BLS, staví na E-BLS tím, že vkládá další zpracovatelské stadium mezi extraktor rysů EfficientNet a BLS, s cílem zlepšit, jak jsou extrahované rysy připraveny před použitím pro předpověď:

Architektura modelu ER-BLS, kde obličejové obrázky jsou zpracovány předem naučeným extraktorem rysů EfficientNet, poté jsou rafinovány prostřednictvím spojovací vrstvy pomocí poolingu, normalizace a transformace RBF. Výstup je poté předán do Broad Learning System (BLS), aby se vyrobil finální skór krásy obličeje.

Architektura modelu ER-BLS.

Místo toho, aby se syrové rysy EfficientNet předávaly přímo do BLS, ER-BLS nejprve předává rysy prostřednictvím rafinační vrstvy, která standardizuje a přeformátuje data, což pomáhá snížit šum a činí rysy konzistentnějšími napříč různými obrázky. Tento krok je navržen tak, aby zlepšil, jak dobře systém generalizuje, zejména když tváře variují v osvětlení, póze nebo jiných vizuálních podmínkách, které by jinak mohly zavést nestabilitu do předpovědí.

Rafinované rysy jsou poté předány do stejné struktury BLS, která se používá v E-BLS, kde uzly rysů a uzly zlepšení transformují a kombinují informace, aby vyrobily finální skór atraktivity.

Data a testy

Pro testování svého přístupu autoři využili SCUT-FBP5500 soubor, soubor předpovědi krásy obličeje z Jižní čínské univerzity, obsahující 5 500 frontálních obrázků obličeje o rozměrech 350x350px, s různými rasy, pohlavími a věkovými skupinami:

Ukázka obrázků ze souboru SCUT-FBP5500, hodnocených od nejméně (1) po nejvíce (5) atraktivní.

Ukázka obrázků ze souboru SCUT-FBP5500, hodnocených od nejméně (1) po nejvíce (5) atraktivní.

Každý obrázek byl hodnocen skórem krásy 60 dobrovolníky, na škále 1-5, od extrémně neatraktivní (1) po extrémně atraktivní (5):

Rozdělení poměrů obrázků podle hodnocení krásy.

Rozdělení poměrů obrázků podle hodnocení krásy.

Druhý soubor použitý byl Velký soubor asijské ženské krásy (LSAFBD), soubor sestavený autory sami.

Ukázka obrázků ze souboru LSAFBD, hodnocených od nejméně (1) po nejvíce (5) atraktivní.

Ukázka obrázků ze souboru LSAFBD, hodnocených od nejméně (1) po nejvíce (5) atraktivní.

Sbírka se skládá z 80 000 nelabelovaných obrázků o rozlišení 144x144px, s variacemi v póze a pozadí, stejně jako věkem. Tyto byly hodnoceny 75 dobrovolníky pro stejné kritérium jako předchozí soubor, tentokrát na škále 0-4:

Rozdělení pro soubor LSAFBD.

Rozdělení pro soubor LSAFBD.

Každý soubor byl rozdělen do trénovacích a testovacích segmentů v poměru 8/20, a křížová validace byla použita pro stabilizaci výsledků napříč běhy. Komponent BLS byla nakonfigurována prostřednictvím počtu oken rysů; počtu uzlů na okno; a počtu uzlů zlepšení, s Hyperopt použitým pro hledání efektivní kombinace.

Pro stanovení základny byl standardní model BLS trénován za stejných podmínek, poté byla série modelů přenosového učení zavedena, včetně ResNet50, Inception-V3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet, a Xception – všechny inicializovány s váhami ImageNet-1k a trénovány s jejich konečnými vrstvami odmraženými.

Trénink používal sazbu učení 0,001 (sníženou, když pokrok stagnoval), a velikost dávky 16, napříč 50 epochami, s regularizací a rectifikovanou lineární aktivací (ReLU) aplikovanou po celou dobu.

Výkon byl hodnocen pomocí přesnosti a Pearsonovy korelace, spolu s celkovým tréninkovým časem, s výsledky průměrně napříč pěti běhy.

Autoři uvádějí, že tréninkový setup byl proveden na počítači s procesorem Intel-i7 3,6 GHz a 64GB RAM:

Srovnání výkonu na SCUT-FBP5500, kde E-BLS a ER-BLS dosahují konkurenceschopné přesnosti proti hlubokým modelům CNN, včetně ResNet50, EfficientNetB7, InceptionV3 a Xception, zatímco vyžadují podstatně méně tréninkového času – zdůrazňující efektivitu zisku z kombinace přenosového učení s Broad Learning System.

Srovnání výkonu na SCUT-FBP5500, kde E-BLS a ER-BLS dosahují konkurenceschopné přesnosti proti hlubokým modelům CNN, včetně ResNet50, EfficientNetB7, InceptionV3 a Xception, zatímco vyžadují podstatně méně tréninkového času – zdůrazňující efektivitu zisku z kombinace přenosového učení s Broad Learning System.

Výsledky ukázaly, že E-BLS zlepšil přesnost z 65,85 % na 73,13 %, zatímco ER-BLS dosáhl 74,69 %, překonávající všechny srovnávané modely. Tréninkový čas zůstal podstatně nižší než u hlubokých modelů CNN, přibližně 1 300 sekund, oproti několika tisícům až přes 25 000 sekund.

Pro testy na LSAFBD výsledky ukázaly, že E-BLS zlepšil přesnost oproti běžnému BLS, zatímco ER-BLS dosáhl nejvyšší přesnosti mezi všemi srovnávanými metodami:

Výkon na LSAFBD, kde ER-BLS a E-BLS dodávají vyšší přesnost než všechny základní a přenosové modely, zatímco vyžadují pouze zlomek jejich tréninkového času, ukazující konzistentní výhodu v efektivitě bez obětování předpovědní kvality.

Výkon na LSAFBD, kde ER-BLS a E-BLS dodávají vyšší přesnost než všechny základní a přenosové modely, zatímco vyžadují pouze zlomek jejich tréninkového času, ukazující konzistentní výhodu v efektivitě bez obětování předpovědní kvality.

Obě varianty udržely podstatně nižší tréninkový čas než hluboké modely CNN, ukazující na více efektivnější rovnováhu mezi výkonem a výpočetní nákladností.

Závěr

Tento článek je somewhat ‘throwback’ publikací, jak je vidět z jeho použití před-boom oblíbených, jako jsou CNN, a z jeho použití nejnižšího úrovně tréninkového vybavení, které jsem potkal v novém článku za mnoho let.

Nicméně, zabývá se překvapivě odolným cílem v počítačovém vidění; jedním, který se dotýká silně lidské zkušenosti a subjektivního výkladu, a který vyžaduje schéma, které překračuje estetické trendy okamžiku, a může poskytnout skutečně odolný pipeline pro úkol.

 

Poprvé publikováno ve čtvrtek, 19. března 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai