Andersonův úhel

Sektor syntézy obrazu přijal vadný metrický systém, tvrdí výzkum

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Rok 2021 byl rokem bezprecedentního pokroku a furious tempa publikací v sektoru syntézy obrazu, nabízejícího proud nových inovací a vylepšení technologií, které jsou schopny reprodukovat lidské osobnosti prostřednictvím neuronového renderování, deepfakes a celé řady nových přístupů.

Však němečtí výzkumníci nyní tvrdí, že standard používaný k automatickému hodnocení realismu syntetických obrazů je fatálně vadný; a že stovky, ba tisíce výzkumníků po celém světě, kteří na něj spoléhají, aby snížili náklady na drahá lidská hodnocení, mohou jít slepou uličkou.

Aby prokázali, jak standard, Fréchet Inception Distance (FID), nevyhovuje lidským standardům pro hodnocení obrazů, výzkumníci nasadili své vlastní GANy, optimalizované pro FID (nyní běžný metrický systém). Zjistili, že FID sleduje své vlastní posedlosti, založené na základním kódu s velmi odlišným úkolem než syntéza obrazu, a že pravidelně selhává při dosažení “lidského” standardu rozlišení:

FID skóre (nižší je lepší) pro obrazy generované různými modely pomocí standardních datových sad a architektur. Výzkumníci nové práce položí otázku 'Souhlasíte s těmito hodnoceními?'. Zdroj: https://openreview.net/pdf?id=mLG96UpmbYz

FID skóre (nižší je lepší) pro obrazy generované různými modely pomocí standardních datových sad a architektur. Výzkumníci nové práce položí otázku ‘Souhlasíte s těmito hodnoceními?’. Zdroj: https://openreview.net/pdf?id=mLG96UpmbYz

Kromě svého tvrzení, že FID není vhodný pro svou určenou úlohu, práce dále naznačuje, že “zjevná” řešení, jako je výměna jeho vnitřního motoru za soutěžící motory, budou jednoduše měnit jednu sadu偏见 za jinou. Autoři navrhují, že nyní závisí na nových výzkumných iniciativách vyvinout lepší metriky pro hodnocení “autenticity” ve synteticky generovaných fotografiích.

Práce paper je nazvaná Internalized Biases in Fréchet Inception Distance a pochází od Steffena Junga z Max Planck Institute for Informatics at Saarland a Margret Keuper, profesorky pro Visual Computing na University of Siegen.

Hledání skóringového systému pro syntézu obrazu

Jak nová práce poznamenává, pokrok v rámcích syntézy obrazu, jako jsou GANy a encoder/decoder architektury, překonal metody, kterými lze výsledky těchto systémů hodnotit. Kromě toho, že jsou drahé a proto obtížně škálovatelné, lidská hodnocení výstupu těchto systémů nenabízejí empirickou a reprodukovatelnou metodu hodnocení.

Proto se objevila řada metrických rámců, včetně Inception Score (IS), uvedeného v práci Improved Techniques for Training GANs, spoluvydáném GAN vynálezcem, Ianem Goodfellowem.

Discvalizace IS skóre jako široce použitelného metriku pro více GAN sítí v roce 2018 vedla k širokému přijetí FID v komunitě syntézy obrazu GAN. Avšak stejně jako Inception Score, FID je založen na Google’s Inception v3 image classification network (IV3).

Autoři nové práce tvrdí, že Fréchet Inception Distance šíří poškozující偏见 v IV3, vedoucí k nespolehlivému hodnocení kvality obrazu.

Jelikož FID může být začleněn do rámce strojového učení jako diskriminátor (vložený “soudce”, který rozhoduje, zda GAN dělá dobře, nebo by měl “zkusit znovu”), musí přesně reprezentovat standardy, které by člověk uplatnil při hodnocení obrazů.

Fréchet Inception Distance

FID porovnává, jak jsou funkce rozloženy napříč trénovací datovou sadou použitou k vytvoření GAN (nebo podobné funkčnosti) modelu a výsledky tohoto systému.

Proto, pokud je GAN framework trénován na 10 000 obrazech (například) celebrit, FID porovnává původní (reální) obrazy s falešnými obrazy vygenerovanými GAN. Čím nižší je FID skóre, tím blíže se GAN přiblížil k “fotorealistickým” obrazům, podle kritérií FID.

<img class="size-full wp-image-179535" src="https://www.unite.ai/wp-content/uploads/2021/12/ffhq64-gan-results.jpg" alt="Z práce, výsledky GAN trénovaného na FFHQ64, podmnožině NVIDIA populární FFHQ dataset

. Zde, přestože je FID skóre krásně nízké 5,38, výsledky nejsou příjemné ani přesvědčivé pro průměrného člověka.” width=”1200″ height=”402″ /> Z práce, výsledky GAN trénovaného na FFHQ64, podmnožině NVIDIA populární FFHQ dataset. Zde, přestože je FID skóre krásně nízké 5,38, výsledky nejsou příjemné ani přesvědčivé pro průměrného člověka.

Problém, který autoři tvrdí, spočívá v tom, že Inception v3, jehož předpoklady pohání Fréchet Inception Distance, nehledí na správná místa – alespoň ne, pokud jde o úkol.

Inception V3 je trénován na ImageNet object recognition challenge, úkol, který je zřejmě v rozporu se způsobem, jakým se cíle syntézy obrazu vyvinuly v posledních letech. IV3 testuje robustnost modelu provedením datového augmentace: náhodně otočí obrazy, ořízne je na náhodném měřítku mezi 8-100%, změní poměr stran (v rozmezí od 3/4 do 4/3) a náhodně vloží barevné distorze týkající se jasu, sytosti a kontrastu.

Němečtí výzkumníci zjistili, že IV3 má tendenci upřednostňovat extrakci hran a textur, spíše než barevné a intenzitní informace, které by byly více významnými indexy autenticity pro syntetické obrazy; a že jeho původní účel objektové detekce byl proto nevhodně zabaven pro nevhodný úkol. Autoři uvádějí*:

‘[Inception v3] má bias k extrakci funkcí založených na hranách a texturách spíše než barevných a intenzitních informacích. To odpovídá jeho augmentačnímu pipeline, který zavádí barevné distorze, ale ponechává vysokofrekvenční informace neporušené (na rozdíl od, například, augmentace s Gaussovským rozostřením).

‘Následně, FID zdědí tento bias. Když se používá jako metrika hodnocení, generativní modely, které reprodukují textury dobře, mohou být upřednostňovány nad modely, které reprodukují barevné distribuce dobře.’

Data a metoda

Aby otestovali svou hypotézu, autoři trénovali dvě GAN architektury, DCGAN a SNGAN, na NVIDIA’s FFHQ human face dataset, downsamplovaný na 642 obrazové rozlišení, s odvozenou datovou sadou nazvanou FFHQ64.

Tři GAN trénovací postupy byly provedeny: GAN G+D, standardní diskriminátor-založený síť; GAN FID|G+D, kde FID funguje jako další diskriminátor; a GAN FID|G, kde je GAN zcela poháněn rollujícím FID skóre.

Technicky, autoři poznamenávají, FID ztráta by měla stabilizovat trénink a potenciálně dokonce kompletně nahradit diskriminátor (jako v #3, GAN FID|G), zatímco vyrábí lidsky příjemné výsledky.

V praxi jsou výsledky spíše odlišné, s – autoři hypotézou – FID-pomocnými modely “přepínajícími” se na špatné metriky. Výzkumníci poznamenávají:

‘Hypotézujeme, že generátor se učí produkovat nevhodné funkce, aby odpovídaly trénovací datové sadě. Tento pozorování se stává ještě závažnějším v případě [GAN FID|G]. Zde si všimneme, že chybějící diskriminátor vede k prostorově nekonzistentním funkcím. Například [SNGAN FID|G] přidává většinou pouze jedno oko a alignuje obličejové rysy způsobem, který je děsivý.’

Příklady tváří vygenerovaných SNGAN FID|G.

Příklady tváří vygenerovaných SNGAN FID|G.

Autoři uzavírají*:

‘Zatímco lidský annotátor by jistě preferoval obrazy vygenerované SNGAN D+G nad SNGAN FID|G (v případech, kdy je preferována datová věrnost před uměním), nevidíme, že by to bylo odrazeno FID. FID tedy není sladěný s lidským vnímáním.

‘Argumentujeme, že diskriminativní funkce poskytnuté image klasifikačními sítěmi nejsou dostatečné k poskytnutí základu pro významnou metriku.’

Žádné snadné alternativy

Autoři také zjistili, že výměna Inception V3 za podobný motor neřeší problém. Při substituci IV3 s “rozsáhlou volbou různých klasifikačních sítí”, které byly testovány proti ImageNet-C (podmnožina ImageNet navržená k benchmarkingu běžně generovaných korupcí a perturbací ve výstupech obrazů z rámců syntézy obrazu), výzkumníci nemohli podstatně zlepšit své výsledky:

[Bias] přítomný v Inception v3 je také široce přítomný v jiných klasifikačních sítích. Kromě toho vidíme, že různé sítě by produkovaly různé hodnocení mezi typy korupcí.’

Autoři uzavírají práci s nadějí, že pokračující výzkum vyvine “lidsky sladěnou a nezávislou metriku” schopnou umožnit spravedlivější hodnocení architektur generátorů obrazů.

 

* Autoři zdůrazňují.

První publikace 20. prosince 2021, 13:00 GMT+2.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai