Andersonův úhel
Systém AI, který může membuat obrázky lidí více “krásné”

Výzkumníci z Číny vyvinuli nový systém založený na umělé inteligenci, který je schopen membuat obrázky lidí více “krásné”, na základě novátorského přístupu k učení s posilováním.

Nový přístup používá ‘síť pro předpověď krásy obličeje’ k iteraci různých variant obrázku na základě několika faktorů, mezi nimiž mohou být ‘osvětlení’ a poloha očí kritickými faktory. Zde jsou původní zdroje (vlevo každé sloupce) z EigenGAN systému, s novými výsledky vpravo od nich. Zdroj: https://arxiv.org/pdf/2208.04517.pdf
Tato technika vychází z inovací objevených pro EigenGAN generátor, jiný čínský projekt, z roku 2021, který učinil významné kroky v identifikaci a získání některých kontrol nad různými sémantickými atributy v latentním prostoru Generative Adversarial Networks (GANs).

Generátor EigenGAN z roku 2021 byl schopen individuovat vysoké koncepty, jako je ‘barva vlasů’, v latentním prostoru generativního adversariálního sítě. Nová práce staví na tomto inovativním instrumentáři, aby dodala systém, který může ‘zkrásnit’ zdrojové obrázky, ale bez změny rozpoznatelné identity – problém v předchozích přístupech. Zdroj: https://arxiv.org/pdf/2104.12476.pdf
Systém používá ‘síť pro hodnocení estetiky’ odvozenou z SCUT-FBP5500 (SCUT), benchmarkové datové sady pro předpověď krásy obličeje z roku 2018, z Jihočínské univerzity technologie v Kantonu.

Z paperu ‘SCUT-FBP5500: A Diverse Benchmark Dataset for Multi-Paradigm Facial Beauty Prediction’, který nabídl ‘síť pro předpověď krásy obličeje’ (FBP) schopnou řadit tváře podle vnímané atraktivity, ale která nemohla vlastně transformovat nebo ‘vylepšit’ tváře. Zdroj: https://arxiv.org/pdf/1801.06345.pdf
Naproti tomu nový projekt z roku 2018 nemůže vlastně provést transformace, ale obsahuje algoritmické hodnotící soudy pro 5 500 tváří, dodané 60 smíšenými pohlavími značkami (50/50 rozdělené). Tyto byly začleněny do nového systému jako efektivní diskriminátor, aby informovaly transformace, které jsou pravděpodobně zvýší ‘atraktivitu’ obrázku.
Zajímavě, nový paper je nazvaný Attribute Controllable Beautiful Caucasian Face Generation by Aesthetics Driven Reinforcement Learning. Důvod, proč jsou všechny rasy kromě kavkazské vyloučeny ze systému (zvažte také to, že sami výzkumníci jsou Číňané), je ten, že zdrojová data pro SCUT se značně naklánějí k asijským zdrojům (4000 rovnoměrně rozdělených asijských žen/mužů, 1500 rovnoměrně rozdělených kavkazských žen/mužů), což dělá ‘průměrnou osobu’ v této datové sadě hnědovlasou a hnědookou.
Proto, aby se přizpůsobily barevné variace alespoň v rámci jedné rasy, bylo nutné vyloučit asijskou složku z původních dat, nebo jít na značné náklady rekonstituovat data, aby se vyvinula metoda, která by nemusela vyjít. Kromě toho variace v kulturních vnímaních krásy nutně znamenají, že takové systémy budou potřebovat jistou míru geografické konfigurability, pokud jde o to, co tvoří ‘atraktivitu’.
Příslušné atributy
Pro určení primárních přispívajících faktorů k ‘atraktivnímu’ fotografiím osoby, výzkumníci také testovali efekt různých změn obrázků, pokud jde o to, jak dobře takové augmentace zvýšily algoritmické vnímání ‘krásy’. Zjistili, že alespoň jeden z aspektů je více centrální pro dobré fotografie než dobré genetiku:

Kromě osvětlení, aspekty, které měly největší dopad na hodnocení krásy, byly čelní vlasy (které, v případě mužů, mohou často být ekvivalentní k tomu, mít plnou hlavu vlasů), tělesná póza a poloha očí (kde zapojení s kamerou je výhodou pro atraktivitu).
(Pokud jde o ‘barvu rtěnky’, nový systém, který může účinně pracovat na obou mužských a ženských prezentacích pohlaví, neindividuuje vzhled pohlaví, ale spoléhá se na novou diskriminační síť jako ‘filtr’ v tomto ohledu)
Metoda
Odměňovací funkce v mechanismu učení s posilováním v novém systému je poháněna přímou regresí přes data SCUT, která vrací předpovědi krásy obličeje.
Trénovací systém iteruje přes vstupní obrázky (vlevo dole ve schématu níže). Zpočátku předtrénovaný ResNet18 model (trénovaný na ImageNet) extrahuje funkce z pěti identických (‘y’) obrázků. Další, potenciální transformační akce je odvozena ze skrytého stavu plně propojené vrstvy (GRUCell, na obrázku níže), a transformace jsou aplikovány, vedoucí k pěti změněným obrázkům, které jsou krmeny do sítě pro hodnocení estetiky, jejichž hodnocení, Darwinovsky, určí, které varianty budou vyvinuty a které odstraněny.
Síť pro hodnocení estetiky používá modul Efficient Channel Attention (ECA), zatímco adaptace předtrénovaného instance EfficientNet-B4 je zadána k extrahování 1 792 funkcí z každého obrázku.
Po normalizaci přes ReLU aktivační funkci, 4-rozměrný vektor je získán zpět z modulu ECA, který je poté zploštěn do jednorozměrného vektoru po aktivaci a adaptivním průměrném poolingu. Nakonec jsou výsledky krmeny do regresního sítě, která vrací hodnocení estetiky.

Kvalitativní srovnání výstupu ze systému. V dolní řadě vidíme součet všech individuovaných aspektů, které byly identifikovány metodou EigenGAN a poté vylepšeny. Průměrné FID skóre pro obrázky je vlevo od řádků obrázků (vyšší je lepší).
Testy a uživatelská studie
Pět variant navrhované metody bylo hodnoceno algoritmicky (viz obrázek výše), s Fréchetova vzdálenostmi (FID, sporná v některých kvartálech) přiřazena k celkovému počtu 1000 obrázků, které prošly systémem.
Výzkumníci uvádějí, že zlepšení osvětlení dosáhlo lepšího skóre atraktivity pro subjekty na fotografiích než několik dalších ‘zjevnějších’ možných změn (tj. k samotnému vzhledu osoby na obrázku).
Testování systému tímto způsobem je omezeno excentricitou dat SCUT, která nemá mnoho ‘jasných úsměvů’, a autoři argumentují, že to by mohlo nadměrně zvýšit ‘enigmatický’ vzhled v datech, ve srovnání s pravděpodobnými preferencemi potenciálních cílových uživatelů (předpokládaně, v tomto případě, západní trh).
Navzdory tomu, protože celý systém závisí na průměrném názoru pouze 60 lidí (v papíru EigenGAN), a protože kvalita, která je studována, je daleko od empirické, lze tvrdit, že postup je více znějící než datová sada.
Although je to zpracováno velmi stručně v papíru, obrázky z EigenGAN a pět variant systému byly také ukázány v omezené uživatelské studii (osm účastníků), kteří byli požádáni, aby vybrali ‘nejlepší obrázek’ (slovo ‘atraktivní’ bylo vynecháno).

Nahoře, GUI prezentované malé studijní skupině; dole, výsledky.
Výsledky ukazují, že výstup nového systému dosáhl nejvyššího výběru mezi účastníky (‘MAES’ na obrázku výše).
(Bezcílné?) Pronásledování krásy
Užitečnost takového systému je obtížné stanovit, navzdory tomu, co se zdá být značným lokusem úsilí v Číně směrem k těmto cílům. Žádný z nich není uveden v novém publikování.
Předchozí papír EigenGAN naznačuje*, že systém rozpoznávání krásy by mohl být použit v systémech pro syntézu doporučení make-upu, estetické chirurgii, krásnění obličeje, nebo.content-based image retrieval.
Předpokladem je, že takový přístup by mohl být také použit na stránkách seznamování, uživateli, aby ‘vylepšili’ své vlastní profily do zaručeného ‘šťastného snímku’, jako alternativu k používání zastaralých fotografií, nebo fotografií jiných lidí.
Stránky seznamování samy o sobě by také mohly ‘ohodnotit’ své klienty, aby vytvořily hodnocení a dokonce omezené přístupové úrovně, i když by to pravděpodobně fungovalo pouze prostřednictvím liveness ověřovacího zachycení, spíše než odeslaných fotografií (které by mohly být stejně ‘vylepšeny’ klienty, pokud by se tento přístup stal populárním).
V reklamě, algoritmická metoda pro hodnocení krásy (technologie předpovězená pozdním sci-fi autorem Michaelem Crichtonem ve svém filmovém debutu Looker) by mohla být použita k výběru neupraveného kreativního výstupu, který je nejpravděpodobněji zapojen do cílového publika, zatímco schopnost skutečně maximalizovat estetický dopad tváří bez skutečného přepisování, mohl by zvýšit již účinné obrázky určené k získání veřejného zájmu.
Nová práce je podporována Národním přírodním vědeckým fondem Číny, otevřeným fondem projektu Státního klíčového laboratoře pro komplexní systém managementu a kontrolu, a projektem filozofie a sociálních věd z ministerstva školství Číny, mezi ostatními podporovateli.
* Mnoho doporučení papíru EigenGAN směřuje k komerčně dostupné knize z roku 2016 nazvané ‘Počítačové modely pro analýzu krásy obličeje’, spíše než akademickým zdrojům.
První zveřejnění 11. srpna 2022.













