Andersonův úhel
Neuronové vykreslování: Jak nízko můžete jít v případě vstupních dat?

Včera upoutala pozornost a představivost internetu nová práce v oblasti neuronové syntézy obrazů, když výzkumníci z Intelu odhalili novou metodu pro zlepšení realismu syntetických obrazů.
Systém, jak je demonstrováno ve videu od Intelu, zasahuje přímo do obrazového pipeline hry Grand Theft Auto V a automaticky vylepšuje obrazy prostřednictvím algoritmu obrazové syntézy trénovaného na konvoluční neuronové síti (CNN), využívající reálné obrazové údaje z Mapillary datové sady a nahrazující méně realistické osvětlení a texturu herního engine.

Komentátoři, v širokém spektru reakcí v komunitách, jako je Reddit a Hacker News, se domnívají, že neuronové vykreslování tohoto typu by mohlo efektivně nahradit méně fotorealistické výstupy tradičních herních engine a VFX-level CGI, a že by tento proces mohl být dosažen s mnohem základnějším vstupem, než byl demonstrován v Intel GTA5 demo — efektivní vytváření ‘loutkových’ proxy vstupů s velmi realistickými výstupy.
Párové datové sady
Tento princip byl demonstrován novou generací GAN a encoder/decoder systémů v posledních třech letech, jako je NVIDIA’s GauGAN, který generuje fotorealistické scenérie z hrubých náčrtů.
Efektivně tento princip převrací konvenční použití sémantické segmentace v počítačovém vidění z pasivní metody, která umožňuje strojovým systémům identifikovat a izolovat pozorované objekty, do kreativního vstupu, kde uživatel ‘maluje’ falešnou sémantickou segmentační mapu a systém generuje obraz, který je konzistentní s vztahy, které rozumí z již klasifikované a segmentované domény, jako je scenérie.

Rámec strojového učení aplikuje sémantickou segmentaci na různé vnější scény, poskytující architektonický paradigm, který umožňuje vývoj interaktivních systémů, kde uživatel maluje sémantickou segmentační blokovou mapu a systém vyplňuje blok vhodnými obrazy z doménově specifické datové sady, jako je německá Mapillary street view sada, použitá v Intelově GTA5 neuronovém vykreslovacím demo. Zdroj: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
Párové datové sady obrazové syntézy fungují tak, že korelují sémantické značky na dvou datových sadách: bohaté a plně vybavené obrazové sadě, buď generované z reálných obrazových údajů (jako Mapillary sada použitá pro vylepšení GTA5 v Intelově demo), nebo ze syntetických obrazů, jako jsou CGI obrazy.

Párové datové sady příkladů pro systém obrazové syntézy navrženého pro vytváření neuronově vykreslených postav z hrubých náčrtů. Vlevo, vzorky z CGI datové sady. Střed, odpovídající vzorky ze ‘sketch’ datové sady. Pravé, neuronové vykreslení, které přeložilo náčrty zpět do vysoce kvalitních obrazů. Zdroj: https://www.youtube.com/watch?v=miLIwQ7yPkA
Převrácení segmentačních map
Google vyvinul animovanou verzi GauGAN schématu, nazvanou Infinite Nature, schopnou záměrně ‘halucinovat’ kontinuální a nekonečné fiktivní krajiny překladem falešných sémantických map do fotorealistických obrazů prostřednictvím NVIDIA’s SPADE infill systému:

Zdroj: https://www.youtube.com/watch?v=oXUf6anNAtc
Jedná se o kapacitu, která zdá se, že vzbudila obdivovatelů Intel Image Enhancement systému – možnost odvození velmi kvalitních fotorealistických obrazů, dokonce v reálném čase (nakonec), z velmi hrubého vstupu.
Nahrazování textur a osvětlení neuronovým vykreslováním
V případě GTA5 vstupu se někteří diváci ptají, zda některý z výpočetně náročných procedurálních a bitmapových textur a osvětlení z herního engine výstupu bude skutečně nutný v budoucích neuronových vykreslovacích systémech, nebo zda by nebylo možné transformovat nízko-rozlišené, drátové úrovně vstupu do fotorealistických videí, které překonávají stínování, texturování a osvětlovací schopnosti herních engine, vytvářející hyper-realistické scény z ‘proxy’ vstupu.
Mohlo by se zdát samozřejmé, že herně generované aspekty, jako jsou odrazy, textury a další typy environmentálních detailů, jsou nezbytnými zdroji informací pro neuronový vykreslovací systém, jak je demonstrován Intel. Nicméně již beberapa let NVIDIA’s UNIT (UNsupervised Image-to-image Translation Networks) prokázal, že pouze doména je důležitá, a že i rozsáhlé aspekty, jako ‘den nebo noc’, jsou zásadně otázkami, které se mají řešit stylem přenosu:
Co se týče požadovaného vstupu, to potenciálně ponechává herní engine pouze generovat základní geometrii a fyzikální simulace, protože neuronový vykreslovací engine může přemalevat všechny ostatní aspekty syntetizováním požadovaných obrazů z zachycené datové sady, pomocí sémantických map jako interpretační vrstvy.

Intelův systém vylepšuje úplně dokončený a vykreslený snímek z GTA5, přidávající segmentaci a vyhodnocené hloubkové mapy — dvě aspekty, které by mohly být potenciálně dodány přímo ze sníženého herního engine. Zdroj: https://www.youtube.com/watch?v=P1IcaBn3ej0
Snížený vstup pro neuronový vykreslovací engine
Aktuální implementace Intel image enhancement sítě tedy může zahrnovat velké množství redundantních výpočetních cyklů, protože herní engine generuje výpočetně náročné texturování a osvětlení, které neuronový vykreslovací engine skutečně nepotřebuje. Systém byl navržen tímto způsobem ne proto, že je to nutně optimální přístup, ale protože je snazší adaptovat neuronový vykreslovací engine na stávající pipeline než vytvořit nový herní engine, který je optimalizován pro neuronový vykreslovací přístup.
Nejekonomičtějším využitím zdrojů v herním systému tohoto typu by mohlo být kompletní převzetí GPU neuronovým vykreslovacím systémem, se sníženým proxy vstupem zpracovaným CPU.
Předchozí práce Intel ISL s segmentací > obrazem
Přímý překlad segmentace na fotorealistické video je daleko od hypotetického. V roce 2017 Intel ISL, tvůrci včerejšího vývoje, vydali počáteční výzkum schopný provádět městskou video syntézu přímo ze sémantické segmentace.

Intel ISL’s segmentace na obraz z roku 2017. Zdroj: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
Ve skutečnosti byl původní pipeline z roku 2017 pouze prodloužen, aby se vešel do plně vykresleného výstupu GTA5.
Neuronové vykreslování ve VFX
Neuronové vykreslování z umělých segmentačních map také zdá se být slibnou technologií pro VFX, s možností přímého překladu velmi základních videogramů přímo do dokončených vizuálních efektů, generováním doménově specifických datových sad z modelů nebo syntetických (CGI) obrazů.


Hypotetický neuronový vykreslovací systém, kde je rozsáhlé pokrytí každého cílového objektu abstrahováno do přispívající datové sady, a kde jsou uměle generované segmentační mapy použity jako základ pro plně-rozlišené fotorealistické výstupy. Zdroj: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Rozvoj a přijetí takových systémů by mohlo přenést uměleckou snahu z interpretativní na reprezentativní workflow a povýšit doménově-řízené sběr dat z podpůrné na centrální roli v oblasti výtvarného umění.
Článek aktualizován 16:55, aby přidat materiál o Intel ISL 2017 výzkum.













