Andersonův úhel

Plastická chirurgie pro GAN-generované obličeje

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Improvements in synthetically generated (GAN) images

Nový výzkum z Jižní Koreje slibuje zlepšit kvalitu syntetických dat obličeje vytvořených pomocí Generative Adversarial Networks (GANs).

Systém je schopen identifikovat obrazové artefakty vytvořené procesy GAN a odstranit je, dokonce i nahradit vlasy, které byly zakryty čepicí, nahradit části obličeje, které chyběly v originále, a odstranit překážky, jako jsou ruce a sluneční brýle, a také funguje dobře na scénických a architektonických výstupech.

GAN correction

Vlevo pro každou sloupec, původní výstup GAN s defekty, následovaný dvěma dalšími přístupy k artefaktům a nakonec metodou použitou jihokorejskými výzkumníky. Zdroj: https://arxiv.org/pdf/2104.06118.pdf

Většina nedávných přístupů ke zlepšení kvality GAN-generovaných obrazů přijala postoj, že artefakty jsou profesním nebezpečím procesu, zacházejí s metodologií jako s “přírodní silou” a více psychedelickými nebo aberracionálními výsledky, které může produkovat, jako s nevyhnutelným vedlejším produktem.

Místo toho jihokorejský výzkum navrhuje vlastně “opravit” postižené obrazy způsobem, který nezasahuje do pokračující generativní řetězce, identifikuje aspekty, které způsobují artefakty, a snižuje nebo eliminuje jejich vliv v GAN síti na polo-supervizovaném úrovni, která přesahuje a rozšiřuje rodící se samo-korekční mechanismy v GAN architektuře.

Pro projekt bylo nutné vytvořit široce použitelnou ručně označenou sadu obrazů, které byly silně ovlivněny GAN artefakty. Zpočátku výzkumníci používali Frechet Inception Distance (FID), metriku, která hodnotí kvalitu GAN výstupu porovnáním funkcí v obrazech, jako kvalifikační jednotku. 10 000 obrazů s nejvyššími FID skóre mezi během 200 000 obrazů bylo použito jako diskrétní “artefaktní jednotky”. Následně výzkumníci ručně označili 2 000 generovaných obrazů, klasifikovali každý jako “normální” nebo ovlivněný FID artefakty. Poté byl vytvořen model pro klasifikaci sady dat do artefaktů, normálních a náhodných reálných vzorků.

Po tomto, Gradient-weighted Class Activation Mapping (Grad-CAM) byl použit pro generování masek pro artefakt-ovlivněné oblasti, efektivní automatizaci označení defektů.

Grad-CAM masks

V obraze výše, Grad-CAM masky byly aplikovány na výstup z LSUN-Church outdoor sady dat a CelebA-HQ dataset.

Při analýze top 20 nejvíce postižených výsledků z běhu 20 000 obrazů, segmentační masky jsou generovány, do kterých mohou být nahrazeny reprezentativní výsledky napříč generacemi (které jsou pravděpodobně přesnější nebo přesvědčivější než artefakty) snížením aktivace artefakt-produkujících jednotek v následujících generacích.

Lidská evaluace oprav výsledků vedla k tomu, že 53% “opravených” obrazů bylo označeno jako “normální”, zatímco 97% původních obrazů stále ukazuje významné zlepšení oproti originálům.

Výzkumníci tvrdí, že tato metoda, s některými menšími úpravami, může být také přizpůsobena pro NVIDIA’s StyleGAN2.

GAN glasses removal

Výhody syntetických dat

Primárně ve vztahu k datům obličeje, obecný nedostatek reálných světových sad dat pro počítačové vidění je překážkou pro rozmanitý výzkum v důležitých výzkumných sektorech, jako je rozpoznávání obličeje, rozpoznávání emocí, lékařský výzkum a studie o více granulární segmentaci topologie obličeje, mezi mnoha dalšími oblastmi.

Aktuální zpětná vazba vůči volnému použití webových dat a ad hoc sběru reálných obrazů obličeje pro zařazení do databází obličeje je další překážkou pro výzkum, s rostoucím počtem států a národů které zpřísňují webové skenování, a přivlastňování sociálních médií obrazů pro tyto účely.

Posledních deset let, omezený počet vysoce kurátorovaných sad dat obličeje nabídl útočiště před tímto druhem nejistoty, s různými ročními veřejnými výzkumnými výzvami soustředěnými kolem nich. Nicméně, to zřejmě vedlo k tomu, že výzkumné projekty zkreslily své metodologie specificky pro tyto sady dat, s konzistentními a srovnatelnými výsledky rok od roku získanými za cenu nedostatku rozmanitosti ve zdrojovém materiálu – situace, která se zhoršuje každý rok, kdy nový výzkum omezuje své metodologie na tyto hranice.

<p Navíc, některé z těchto "tradičních" sad dat přišly pod kritiku za nedostatek rasové rozmanitosti, což naznačuje, že tyto benchmarkingové pilíře nemusí být považovány za vhodné zdroje v blízké budoucnosti.

To znamená potřebu vysoce kvalitních dat obličeje, která jsou realistická, ale kde přispívající “reálná světová” obrazy byly transformovány daleko za hranice rozpoznání. I když toto použití reálných dat obličeje “na jednu stranu” může samo o sobě nakonec spustit problémy nad původem GAN-generovaných obličeji, je to překážka, která se pravděpodobně neobjeví, dokud nebudou zavedeny právní a technické mechanismy pro sběr dat tohoto druhu; a pokud jde o možné změny právních rámců kolem této otázky, je to stále menší nebezpečí než použití obrazů skutečných lidí.

Další čtení:

Zlepšení realismu syntetických obrazů
Automatická korekce vnitřních jednotek v generativních neuronových sítích

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai