Andersons vinkel

AI’s jagt på skønhed

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image featuring a woman whose face is being analyzed by a Terminator-style HUD. GPT-1.5.

Et nyt AI-drevet skønheds vurderingssystem vurderer, hvor tiltrækkende ansigter ser ud, mens det træner hurtigere end typiske dybe læringmodeller, hvilket potentielt kan gøre storstilet automatiseret skønheds scoring mere praktisk.

 

Facial Beauty Prediction (FBP) er stor forretning, og en ret stærk tråd i forskningslitteraturen. Selv om det bryder praktisk taget alle principper bag kampen mod bias i AI og maskinlæringspraksis, og selv om det på mange måder støtter objektivering og reduktionisme i algoritmiske perceptioner af kvinder, tiltrækker det alligevel interessen fra flere multibilliondollarindustrier, de fleste af dem rettet direkte mod kvinder, såsom kosmetik, kosmetisk ansigtskirurgi, livestreaming og mode, blandt andre:

Kvinder vurderet fra 1-5, fra artiklen 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion'. Kilde - https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Kvinder vurderet fra 1-5, fra artiklen ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Kilde

Ud over disse åbenlyse kvindespecifikke forretningsenklaver har reklame og flere andre industrier, herunder underholdning og udgivelse, betydelige gevinster i at forstå, hvad både mænd og kvinder finder ’tiltrækkende’, nødvendigvis på en kultur-specifik basis.

Faktum er, at samlede perceptioner af skønhed varierer på tværs af regioner, hvilket betyder, at der ikke kan opnås nogen definitive globale datasets, og at ny forskning enten må blive lokal eller koncentrere sig om ‘høj-niveau’-metoder, der kan anvendes på tværs af diverse kulturer.

En interface for et ansigts skønheds vurderingssystem til 2015 SCUT-FBP-projektet. Kilde - https://arxiv.org/pdf/1511.02459

En interface for et ansigts skønheds vurderingssystem til 2015 SCUT-FBP-projektet. Kilde

Ofte er geografisk placering ikke den eneste begrænsning, da tiltrækningsfokuserede datasets kan have svært ved at give lige effektivitet på tværs af køn, eller kan være blevet kurateret med en bestemt anvendelse i mente – og dette kan begrænse samlingens anvendelse i andre domæner.

For eksempel rapporterede jeg i 2025 om udviklingen af en relativt stor (100.000+ identiteter) dataset til at vurderer tiltrækningsværdi i live-streaming, hvis tæt beskårne standarder måske kræver betydelig tilpasning til bredere projekter, på trods af den enorme indsats bag initiativet.

Ansigtets udtryk

Som kan ses fra links og billeder ovenfor, opererer asiatiske forskningsinstitutioner ofte ikke under de samme kulturelle begrænsninger som deres vestlige modparter, der ville have svært ved at turde offentliggøre en videnskabelig illustration, der vurderer fem vestlige kvinder fra mindst til mest tiltrækkende, som vi ser i ovennævnte studie.

Det kan argumenteres for, at hvor asiatiske systemer af denne type er bevist effektive i offentligheden, uden frygt for lokal kritik, kan vestlige interesser bruge eller tilpasse sådanne forskningsresultater til proprietære, private implementeringer. Opgaven med at ‘vurdere kvinder’ i den situation er overført til et lokalitet, hvor det kan forfølges uden kritik.

Uanset om dette er almindeligt eller om mindre offentliggjorte vestlige ækvivalenter tenderer til at blive udviklet væk fra åben kilde-samarbejde og offentlig gennemsyn, er det rimeligt at antage, at målet er af global interesse, på grund af det store antal professionelle sektorer, der kan eller kunne have glæde af præcise vurderinger af tiltrækningsværdi.

Overlevelse af den stærkeste

Det kan synes, at massive web-skrapable korporationer som Tik Tok, Instagram og YouTube ville være fremragende dommere af skønhed, ved at korrelere følgere, likes og trafik til tiltrækningsværdi, da dette er en almindelig og rimelig association (om end med nogle undtagelser).

Ligeledes vil eksisterende samlinger – såsom ImageNet og LAION –  featuring skuespillere og modeller, der er ‘stige til toppen’–  vil typisk omfatte tiltrækkende personer (om end med for mange datapunkter af for få personer), hvilket tillader bredere kulturelle mekanismer at fungere som en proxy for tiltrækningsværdi.

Men dette tager ikke hensyn til skiftende smag i, hvad folk finder tiltrækkende over tid (uanset geografisk). Derfor er høj-niveau og data-agnostiske systemer nødvendige, ikke individuelle og specifikke samlinger eller kurateringer, der vil svigte i at reflektere skiftende smag.

Kombinationshud

Den seneste akademiske bidrag til at tackle disse udfordringer kommer fra Kina, hvor overføring af læring og Broad Learning System (BLS) kombineres for at tackle den langvarige trade-off mellem nøjagtighed og beregningsomkostninger.

Traditionelle neurale netværk tenderer til at opnå stærke resultater kun med tung træning, mens lettere systemer som BLS træner hurtigt, men kæmper med at fange nok detaljer. Det nye arbejde brobygger denne kløft ved at bruge et forudtrænet visuelt model til at trække ansigtstræk, der derefter overføres til et hurtigt BLS-baseret system til scoring, hvilket tillader træk at blive genbrugt i stedet for at blive lært fra scratch, samtidig med at træning holder sig effektiv:

Eksempler på billeder fra LSAFBD-datasættet, der viser kvindelige ansigter grupperet efter menneske-tildelte skønhedsvurderinger fra 1 til 5, hvor vurderingerne blev afledt fra multiple annotatorer og brugt som supervised labels til træning og vurdering af ansigtsskønhedsprediction modeller på tværs af variationer i pose, belysning og udseende.. Kilde - https://arxiv.org/pdf/2603.16930

Eksempler på billeder fra LSAFBD-datasættet, der viser kvindelige ansigter grupperet efter menneske-tildelte skønhedsvurderinger fra 1 til 5. Vurderingerne blev afledt fra multiple annotatorer, og brugt som supervised labels til træning og vurdering af ansigtsskønhedsprediction modeller på tværs af variationer i pose, belysning og udseende. Kilde

Det første af de to variationer, der blev introduceret i arbejdet (E-BLS, se nedenfor), føder trækkene direkte ind i det letvægtssystem, mens den anden, ER-BLS (se også nedenfor), tilføjer en enkel mellemproces, der standardiserer og forbedrer trækkene, før de bruges til vurdering:

Tests udført af forfatterne viser, at deres tilgang er overlegen i forhold til både metoderne i sig selv og andre konkurrerende metoder.

Den nye artikel har titlen Ansigtsskønhedsprediction ved at kombinere overføring af læring og Broad Learning System, og kommer fra seks forskere ved Wuyi University, Jiangmen.

Metode

Den ovennævnte Broad Learning System er et letvægtssystem, der er en alternativ til dybe neurale netværk, der springer over at stable mange lag, og i stedet spreder læring over et bredt sæt af enklere forbindelser, hvilket tillader modeller at træne hurtigt – men typisk på bekostning af at gå glip af finere visuelle detaljer.

Den første af de to varianter, E-BLS, kombinerer EfficientNet-baseret overføring af læring med BLS, hvor detaljerede visuelle træk trækkes fra et ansigt, og derefter overføres til BLS, hvilket indebærer en endelig vurdering, der undgår behovet for at træne et fuldt dybt neuralt netværk fra scratch:

Arkitektur-skema for E-BLS-modellen, der viser, hvordan ansigtsbilleder fra mål-datasæt som SCUT-FBP5500 og LSAFBD først passerer gennem en forudtrænet EfficientNet-trækeksitraktor, hvis parametre er overført fra ImageNet og holdes faste, før de resulterende træk-kort overføres til et Broad Learning System (BLS), hvor træk-noder og forbedringsnoder kombineres gennem trænelige vægte for at producere den endelige ansigtsskønhedsvurdering.

Arkitektur-skema for E-BLS-modellen.

EfficientNet, der er forudtrænet på ImageNet-1k, og stort set holdes uændret, konverterer hver input-billede til en kompakt sæt af træk-værdier, der beskriver ansigtet på en struktureret måde, mens BLS tager disse værdier og behandler dem gennem et netværk af enkle, tilfældigt forbundne noder, der transformerer og kombinerer informationen, før den producerer den endelige tiltrækningsvurdering.

Fordi BLS ikke afhænger af dybe lag-strukturer, kan E-BLS opdateres ved at tilføje flere noder i stedet for at gen-træne hele systemet,. Dette holder træning hurtig, og gør det lettere at forbedre modellen, når nye data introduceres.

Den anden af de to varianter, ER-BLS, bygger på E-BLS ved at indsætte en enkelt mellemproces, der standardiserer og forbedrer trækkene, før de vurderes:

Arkitektur for ER-BLS-modellen, hvor ansigtsbilleder først behandles af en forudtrænet EfficientNet-trækeksitraktor, derefter raffineres gennem en forbindelseslag med pooling, normalisering og radial basis-funktion (RBF)-transformation. Outputtet overføres derefter til Broad Learning System (BLS) for at producere den endelige ansigtsskønhedsvurdering.

Arkitektur for ER-BLS-modellen.

Foruden at sende de rå EfficientNet-træk direkte ind i BLS, passerer ER-BLS dem først gennem en raffineringslag, der standardiserer og omformer dataene, hvilket hjælper med at reducere støj og gør trækkene mere konsistente på tværs af forskellige billeder. Dette trin er designet til at forbedre, hvordan systemet generaliserer, især når ansigter varierer i belysning, pose eller andre visuelle betingelser, der ellers kan introducere ustabilitet i vurderingerne.

De raffinerede træk overføres derefter til den samme BLS-struktur, der blev brugt i E-BLS, hvor træk-noder og forbedringsnoder transformerer og kombinerer informationen for at producere den endelige tiltrækningsvurdering.

Data og tests

For at teste deres tilgang, udnyttede forfatterne SCUT-FBP5500-datasættet, en ansigtsskønhedsprediction-samling fra South China University, der indeholder 5.500 frontale ansigtsbilleder i 350x350px, med diverse racer, køn og aldre:

Eksempler på SCUT-FBP5500-datasættets ansigtsbilleder vurderet fra mindst (1) til mest (5) tiltrækkende.

Eksempler på SCUT-FBP5500-datasættets ansigtsbilleder vurderet fra mindst (1) til mest (5) tiltrækkende.

Hvert billede blev vurderet med en skønhedsvurdering af 60 frivillige, på en skala fra 1-5, fra ekstremt utiltrækkende (1) til ekstremt tiltrækkende (5):

Fordelingen af billeders proportioner efter skønhedsvurdering.

Fordelingen af billeders proportioner efter skønhedsvurdering.

Den anden database, der blev brugt, var Large-Scale Asian Female Beauty Dataset (LSAFBD)-samlingen, en datasæt, der er kurateret af forfatterne selv.

Eksempler på LSAFBD-datasættets ansigtsbilleder vurderet fra mindst (1) til mest (5) tiltrækkende.

Eksempler på LSAFBD-datasættets ansigtsbilleder vurderet fra mindst (1) til mest (5) tiltrækkende.

Samlingen består af 80.000 ikke-vurderede billeder i 144x144px opløsning, med variationer i pose og baggrund, samt alder. Disse blev vurderet af 75 frivillige for de samme kriterier som det forrige datasæt, denne gang på en skala fra 0-4:

Fordelingen for LSAFBD-datasættet.

Fordelingen for LSAFBD-datasættet.

Hvert datasæt blev delt i trænings- og testsegmenter i en 8/20-forhold, og cross-validation blev brugt til at stabilisere resultater på tværs af kørsler. BLS-komponenten blev konfigureret gennem antallet af træk-vinduer; antallet af noder per vindue; og antallet af forbedringsnoder, med Hyperopt brugt til at søge efter effektive kombinationer.

For at etablere en baseline, blev en standard BLS-model trænet under identiske indstillinger, efterfulgt af en række overføring af læring-modeller, herunder ResNet50, Inception-V3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet, og Xception – alle initialiseret med ImageNet-1k-vægte, og trænet med deres sidste lag unfrozen.

Træning brugte en læringsrate på 0,001 (reduceret, når fremgangen stoppede), og en batch-størrelse på 16, på tværs af 50 epoch, med regularisering og rectified linear activation (ReLU) anvendt på tværs af.

Præstationen blev vurderet ved hjælp af nøjagtighed og Pearson-korrelation, samt den totale træningstid, med resultater gennemsnitligt på tværs af fem kørsler.

Forfatterne rapporterer træningssætup som en Intel-i7 3,6 GHz CPU og 64GB RAM på en ‘desktop-computer’:

Præstations-sammenligning på SCUT-FBP5500, hvor E-BLS og ER-BLS opnår konkurrencedygtig nøjagtighed i forhold til dybe CNN-modeller, herunder ResNet50, EfficientNetB7, InceptionV3 og Xception, samtidig med at de kræver betydeligt mindre træningstid – hvilket fremhæver efficiens-gevinsterne ved at kombinere overføring af læring med et Broad Learning System.

Præstations-sammenligning på SCUT-FBP5500, hvor E-BLS og ER-BLS opnår konkurrencedygtig nøjagtighed i forhold til dybe CNN-modeller, herunder ResNet50, EfficientNetB7, InceptionV3 og Xception, samtidig med at de kræver betydeligt mindre træningstid – hvilket fremhæver efficiens-gevinsterne ved at kombinere overføring af læring med et Broad Learning System.

Resultaterne viste, at E-BLS forbedrede nøjagtigheden fra 65,85% til 73,13%, mens ER-BLS nåede 74,69%, og overgik alle sammenlignede modeller. Træningstiden forblev betydeligt lavere end dybe CNN’er, på omkring 1.300 sekunder, i modsætning til flere tusinde til over 25.000 sekunder.

For testene på LSAFBD viste resultaterne, at E-BLS forbedrede nøjagtigheden i forhold til almindelig BLS, mens ER-BLS opnåede den højeste nøjagtighed blandt alle sammenlignede metoder:

Præstation på LSAFBD, hvor ER-BLS og E-BLS leverer højere nøjagtighed end alle baseline- og overføring af læring-modeller, samtidig med at de kun kræver en brøkdel af deres træningstid, hvilket indikerer en konsekvent fordel i efficiens uden at gå på kompromis med den prædictive kvalitet.

Præstation på LSAFBD, hvor ER-BLS og E-BLS leverer højere nøjagtighed end alle baseline- og overføring af læring-modeller, samtidig med at de kun kræver en brøkdel af deres træningstid, hvilket indikerer en konsekvent fordel i efficiens uden at gå på kompromis med den prædictive kvalitet.

Begge varianter opretholdt betydeligt lavere træningstid end dybe CNN-modeller, hvilket indikerer en mere effektiv balance mellem præstation og beregningsomkostninger.

Konklusion

Dette er noget af en ‘throwback’-publikation, som bevidnes af dens brug af pre-boom-favoritter som CNN’er, og af den laveste niveau-træningsequipment, jeg har mødt i en ny artikel i mange år.

Ikke desto mindre handler det om et overraskende resilientt mål i computer-vision; et, der berører menneskelig oplevelse og subjektiv fortolkning tungt, og som kræver en skema, der transcenderer den æstetiske trend i øjeblikket, og som kan levere en virkelig resilient pipeline til opgaven.

 

Offentliggjort første gang torsdag, 19. marts 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai