Andersonův úhel

Směřování k reálným AI lidem s neuronovou lumigrafickou renderovací technologií

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Neural Lumigraph Rendering

Nedávná vlna zájmu o Neural Radiance Fields (NeRF), technologii schopné vytvářet AI-generované 3D prostředí a objekty, stále vyžaduje velké množství času na trénování a postrádá implementaci, která by umožňovala reálné a vysoce responsivní rozhraní.

Jedna spolupráce mezi několika významnými jmény v průmyslu a akademii nabízí nový přístup k této výzvě (obecně známé jako Novel View Synthesis, nebo NVS).

Výzkumná práce, nazvaná Neuronová lumigrafická renderovací technologie, tvrdí, že dosáhla zlepšení o dva řády velikosti ve srovnání se stávajícím stavem, což představuje několik kroků směrem k reálnému času CG renderování prostřednictvím strojových učících se pipeline.

Neuronová lumigrafická renderovací technologie (vpravo) nabízí lepší rozlišení blendovacích artefaktů a lepší zpracování překrytí ve srovnání s předchozími metodami. Source: https://www.youtube.com/watch?v=maVF-7x9644

Neuronová lumigrafická renderovací technologie (vpravo) nabízí lepší rozlišení blendovacích artefaktů a lepší zpracování překrytí ve srovnání s předchozími metodami. Source.

Přestože autoři práce uvádějí pouze Stanfordovu univerzitu a holografickou display technologickou společnost Raxium (která目前 působí v utajeném režimu), přispěvatelé zahrnují hlavního architekta strojového učení v Google, počítačového vědce v Adobe a technického ředitele ve společnosti StoryFile (která nedávno udělala titulky s AI verzí Williama Shatnera).

V souvislosti s nedávnou publicitou Williama Shatnera se zdá, že StoryFile využívá NLR ve své nové technologii pro vytváření interaktivních, AI-generovaných entit na základě charakteristik a narativů jednotlivých lidí.

StoryFile předpokládá využití této technologie v muzejních výstavách, online interaktivních narativech, holografických displejích, rozšířené realitě (AR) a dokumentaci dědictví – a zdá se, že také zvažuje potenciální nové aplikace NLR v pohovorech a virtuálních aplikacích:

Navrhované využití z online videa StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Navrhované využití z online videa StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Volumetrická kaptura pro Novel View Synthesis rozhraní a video

Základní princip volumetrické kaptury, napříč celou řadou prací, které se na toto téma hromadí, je myšlenka pořízení statických snímků nebo videí subjektu a použití strojového učení k “vyplnění” pohledů, které nebyly pokryty původní sadou kamer.

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Na obrázku výše, pocházejícím z Facebookova AI výzkumu z roku 2019 (viz níže), vidíme čtyři fáze volumetrické kaptury: multiple kamery pořizují snímky/videa; encoder/decoder architektura (nebo jiná architektura) vypočítává a spojuje relativitu pohledů; ray-marching algoritmy vypočítávají voxely (nebo jiné XYZ prostorové geometrické jednotky) každého bodu ve volumetrickém prostoru; a (v nejnovějších pracích) trénování probíhá k syntéze kompletní entity, která může být manipulována v reálném čase.

Je to často rozsáhlá a datově náročná fáze trénování, která dosud držela novel view syntézu mimo oblast reálného času nebo vysoce responsivních kapture.

Fakt, že Novel View Synthesis vytváří kompletní 3D mapu volumetrického prostoru, znamená, že je relativně triviální spojit tyto body dohromady do tradiční počítačové generované mřížky, efektivní kapture a artikulace CGI lidské postavy (nebo jiného relativně omezeného objektu) na místě.

Přístupy, které využívají NeRF, spoléhají na body cloudy a hloubkové mapy k generování interpolací mezi řídkými body pohledů kapture zařízení:

NeRF může generovat volumetrickou hloubku prostřednictvím výpočtu hloubkových map, spíše než generování CG mřížek. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF může generovat volumetrickou hloubku prostřednictvím výpočtu hloubkových map, spíše než generování CG mřížek. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

Přestože NeRF je schopný vypočítat mřížky, většina implementací toto nevyužívá k generování volumetrických scén.

Naproti tomu přístup Implicit Differentiable Renderer (IDR) publikovaný Weizmannovým institutem věd v říjnu 2020, spočívá v využití 3D mřížkové informace automaticky generované z kapture polí:

Příklady IDR kapture přeměněných na interaktivní CGI mřížky. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Příklady IDR kapture přeměněných na interaktivní CGI mřížky. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Přestože NeRF postrádá IDR schopnost pro tvarovou estimaci, IDR nemůže dosáhnout NeRF kvality obrazu, a obě vyžadují rozsáhlé zdroje pro trénování a sběr (ačkoli nedávné inovace v NeRF jsou začínají řešit toto).

NLR Custom kamera s 16 GoPro HERO7 a 6 centrálními Back-Bone H7PRO kamerami. Pro 'reálné' renderování tyto kamery fungují minimálně na 60fps. Source: https://arxiv.org/pdf/2103.11571.pdf

NLR Custom kamera s 16 GoPro HERO7 a 6 centrálními Back-Bone H7PRO kamerami. Pro ‘reálné’ renderování tyto kamery fungují minimálně na 60fps. Source: https://arxiv.org/pdf/2103.11571.pdf

Místo toho neuronová lumigrafická renderovací technologie využívá SIREN (Sinusoidální reprezentační sítě) k začlenění silných stránek každého přístupu do svého vlastního rámce, který je určen k generování výstupu, který je přímo použitelný v existujících reálných grafických pipeline.

SIREN byl využíván pro podobné implementace během posledního roku, a nyní představuje populární API volání pro hobbyistické Colaby v image syntéze komunitách; nicméně, NLR inovace spočívá v aplikaci SIREN na dvourozměrnou multi-pohledovou image supervizi, což je problematické kvůli rozsahu, v jakém SIREN produkuje přeškoleno spíše než generalizovaný výstup.

Po extrakci CG mřížky z pole snímků, mřížka je rasterizována prostřednictvím OpenGL, a vrcholové pozice mřížky jsou mapovány na odpovídající pixely, po čemž je vypočteno blendování různých přispívajících map.

Výsledná mřížka je více generalizovaná a reprezentativní než NeRF (viz obrázek níže), vyžaduje méně výpočtu a nepoužívá nadměrné detaily v oblastech (jako je hladká obličejová kůže), které z toho nemohou mít prospěch:

Source: https://arxiv.org/pdf/2103.11571.pdf

Source: https://arxiv.org/pdf/2103.11571.pdf

Negativně, NLR dosud nemá žádnou kapacitu pro dynamické osvětlení nebo přeosvětlení, a výstup je omezen na stínové mapy a další osvětlovací úvahy získané v době kaptury. Výzkumníci mají v úmyslu řešit toto v budoucí práci.

Kromě toho práce uznává, že tvary generované NLR nejsou tak přesné jako některé alternativní přístupy, jako je Pixelwise View Selection for Unstructured Multi-View Stereo, nebo Weizmannův institut výzkumu, který je zmíněn výše.

Vzestup Volumetrické Image Syntézy

Myšlenka vytváření 3D entit z omezené série fotografií s neuronovými sítěmi předchází NeRF, s vizionářskými pracemi sahajícími až do roku 2007 nebo dříve. V roce 2019 Facebookův AI výzkumný odbor vydal seminální výzkumnou práci, Neuronové objemy: Učení dynamicky renderovatelných objemů z obrazů, která poprvé umožnila responsivní rozhraní pro syntetické lidi generované strojovým učením založené na volumetrické kapturě.

Facebookův výzkum z roku 2019 umožnil vytvoření responsivního uživatelského rozhraní pro volumetrickou osobu. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Facebookův výzkum z roku 2019 umožnil vytvoření responsivního uživatelského rozhraní pro volumetrickou osobu. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai