Andersons vinkel
Mod realtids‑AI‑mennesker med Neural Lumigraph Rendering

På trods af den nuværende bølge af interesse for Neural Radiance Fields (NeRF), en teknologi der kan skabe AI‑genererede 3D‑miljøer og -objekter, kræver denne nye tilgang til billedsyntese stadig meget træningstid og mangler en implementering, der muliggør realtids‑ og højt responsiv interaktion.
Et samarbejde mellem nogle imponerende aktører inden for industri og akademia tilbyder dog et nyt greb om denne udfordring (generelt kendt som Novel View Synthesis, eller NVS).
Forskningspapiret, med titlen Neural Lumigraph Rendering, påstår en forbedring af state‑of‑the‑art på omkring to størrelsesordener, hvilket repræsenterer flere skridt mod realtids‑CG‑rendering via maskinlærings‑pipelines.

Neural Lumigraph Rendering (right) offers better resolution of blending artifacts, and improved handling of occlusion over previous methods. Source.
Selvom krediteringen for papiret kun nævner Stanford University og holografisk display‑teknologivirksomhed Raxium (aktuelt i stealth‑mode), omfatter bidragyderne en hovedmaskinlærings‑arkitekt hos Google, en computer‑forsker hos Adobe (ADBE ), samt CTO’en hos StoryFile (som for nylig fik nyhedsdækning med en AI‑version af William Shatner).
I forhold til den seneste Shatner‑publicitetsstorm ser StoryFile ud til at anvende NLR i deres nye proces til at skabe interaktive, AI‑genererede entiteter baseret på individuelle personers karakteristika og fortællinger.
StoryFile forestiller sig brug af denne teknologi i museumsudstillinger, online interaktive fortællinger, holografiske displays, augmented reality (AR) og kulturarvsdokumentation – og ser også ud til at kigge på potentielle nye anvendelser af NLR i rekrutteringsinterviews og virtuelle dating‑applikationer:

Proposed uses from an online video by StoryFile.
Volumetrisk optagelse til Novel View Synthesis‑grænseflader og video
Princippet for volumetrisk optagelse, på tværs af de mange artikler der akkumuleres om emnet, er idéen om at tage stillbilleder eller videooptagelser af et motiv og bruge maskinlæring til at ‘udfylde’ de synsvinkler, som ikke blev dækket af det oprindelige kamera‑arrangement.

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
På billedet ovenfor, taget fra Facebooks AI‑forskning fra 2019 (se nedenfor), ser vi de fire faser af volumetrisk optagelse: flere kameraer indsamler billeder/video; en encoder/decoder‑arkitektur (eller andre arkitekturer) beregner og sammenkæder synsvinklenes relativitet; ray‑marching‑algoritmer beregner voxels (eller andre XYZ‑rumlige geometriske enheder) for hvert punkt i det volumetriske rum; og (i de fleste nyere artikler) foregår træning for at syntetisere en komplet enhed, der kan manipuleres i realtid.
Det er netop denne ofte omfattende og datatunge træningsfase, der indtil nu har holdt novel view synthesis uden for realtids‑ eller højt responsiv optagelse.
Det faktum, at Novel View Synthesis laver et komplet 3D‑kort over et volumetrisk rum, betyder, at det er relativt trivielt at sammensætte disse punkter til en traditionel computer‑genereret mesh, hvilket effektivt indfanger og artikulerer en CGI‑menneske (eller ethvert andet relativt afgrænset objekt) i realtid.
Tilgange, der bruger NeRF, baserer sig på punkt‑skyer og dybdekort til at generere interpolationerne mellem de sparsomme synsvinkler fra optageenhederne:

NeRF can generate volumetric depth through calculation of depth maps, rather than generation of CG meshes. Source: https://www.youtube.com/watch?v=JuH79E8rdKc
Selvom NeRF er i stand til at beregne meshes, bruger de fleste implementeringer dette ikke til at generere volumetriske scener.
I kontrast henger den Implicit Differentiable Renderer (IDR)‑tilgang, publiceret af Weizmann Institute of Science i oktober 2020, på udnyttelse af 3D‑mesh‑information, der automatisk genereres fra optage‑arrays:

Examples of IDR captures turned into interactive CGI meshes. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE
Selvom NeRF mangler IDR’s evne til formestimering, kan IDR ikke matche NeRF’s billedkvalitet, og begge kræver omfattende ressourcer til træning og samling (selvom nyere innovationer i NeRF begynder at tackle dette).

NLR’s Custom camera rig featuring 16 GoPro HERO7 and 6 central Back-Bone H7PRO cameras. For ‘real time’ rendering, these operate at a minimum of 60fps. Source: https://arxiv.org/pdf/2103.11571.pdf
I stedet anvender Neural Lumigraph Rendering SIREN (Sinusoidal Representation Networks) til at inkorporere styrkerne ved hver tilgang i sin egen ramme, som er beregnet til at generere output, der kan anvendes direkte i eksisterende realtids‑grafik‑pipelines.
SIREN har i det forløbne år været brugt til lignende implementeringer, og udgør nu et populært API‑kald for hobby‑Colabs i billedsyntesefællesskaber; dog er NLR’s innovation at anvende SIRENs på todimensionel multi‑view‑billed‑supervision, hvilket er problematisk på grund af den grad, hvormed SIREN producerer over‑fit i stedet for generelt output.
Efter CG‑mesh’en er udtrukket fra array‑billederne, rasteriseres mesh’en via OpenGL, og mesh’ens vertex‑positioner kortlægges til de relevante pixels, hvorefter blandingen af de forskellige bidragende kort beregnes.
Den resulterende mesh er mere generel og repræsentativ end NeRF’s (se billedet nedenfor), kræver mindre beregning og påfører ikke overdreven detalje på områder (såsom glat ansigtshud), der ikke kan drage fordel af det:
På den negative side har NLR endnu ikke kapacitet til dynamisk belysning eller relighting, og output er begrænset til skyggekort og andre lysforhold, der er indsamlet på optagelsestidspunktet. Forskerne har til hensigt at løse dette i fremtidigt arbejde.
Derudover indrømmer papiret, at de former, som NLR genererer, ikke er så præcise som nogle alternative tilgange, såsom Pixelwise View Selection for Unstructured Multi-View Stereo, eller den tidligere nævnte forskning fra Weizmann Institute.
Stigningen i volumetrisk billedsyntese
Ideen om at skabe 3D‑entiteter ud fra en begrænset serie af fotos med neurale netværk går forud for NeRF, med visionære artikler tilbage til 2007 eller tidligere. I 2019 udgav Facebooks AI‑forskningsafdeling et banebrydende forskningspapir, Neural Volumes: Learning Dynamic Renderable Volumes from Images, som første gang gjorde det muligt at have responsive grænseflader for syntetiske mennesker genereret via maskinlærings‑baseret volumetrisk optagelse.

Facebook’s 2019 research enabled the creation of a responsive user interface for a volumetric person. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/













