Andersons vinkel
Mod virkeligtids AI-mennesker med Neural Lumigraph Rendering

Trods den nuværende bølge af interesse for Neural Radiance Fields (NeRF), en teknologi, der kan skabe AI-genererede 3D-miljøer og objekter, kræver denne nye tilgang til billedsynthesis-teknologi stadig en stor mængde træningstid og mangler en implementering, der muliggør realtids-, højresponsgrænseflader.
En samarbejdsprojekt mellem nogle imponerende navne i industrien og akademiet tilbyder en ny tilgang til denne udfordring (generisk kendt som Novel View Synthesis eller NVS).
Forskningsartiklen, med titlen Neural Lumigraph Rendering, hævder en forbedring af tilstanden på omkring to størrelsesordener, hvilket repræsenterer flere skridt mod realtids-CG-rendering via maskinelæringsrørledninger.

Neural Lumigraph Rendering (højre) tilbyder bedre opløsning af blandingseffekter og forbedret håndtering af okklusion i forhold til tidligere metoder. Kilde.
Selvom kreditterne for artiklen kun nævner Stanford University og holografisk displayteknologiselskabet Raxium (der i øjeblikket opererer i stealth-tilstand), omfatter bidragsyderne en principal maskinelæringsarkitekt hos Google, en computervidenskabsmand hos Adobe og CTO hos StoryFile (der for nylig har været i overskrifterne med en AI-version af William Shatner).
I forhold til den seneste Shatner-offensiv synes StoryFile at anvende NLR i deres nye proces til skabelse af interaktive, AI-genererede enheder baseret på karakteristika og narrativer fra enkeltpersoner.
StoryFile forestiller sig anvendelse af denne teknologi i museumsudstillinger, online-interaktive narrativer, holografiske displays, augmented reality (AR) og kulturarvsdokumentation – og synes også at være interesseret i potentielle nye anvendelser af NLR i rekrutteringsinterviews og virtuelle datingapplikationer:

Forslag fra en onlinevideo af StoryFile. Kilde: https://www.youtube.com/watch?v=2K9J6q5DqRc
Volumetrisk optagelse til Novel View Synthesis-grænseflader og video
Princippet om volumetrisk optagelse, på tværs af rækken af artikler, der er samlet på dette emne, er idéen om at tage stadigbilleder eller videoer af et emne og bruge maskinelæring til at ‘indfylde’ de synspunkter, der ikke blev dækket af den oprindelige kameraarray.

Kilde: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
I billedet ovenfor, taget fra Facebooks AI-forskning i 2019 (se nedenfor), ser vi de fire stadier af volumetrisk optagelse: multiple kamerasamlinger billeder/film; encoder/decoder-arkitektur (eller andre arkitekturer) beregner og samler relationen mellem synspunkter; ray-marching-algoritmer beregner voxlerne (eller andre XYZ-rumlige geometriske enheder) for hvert punkt i den volumetriske rum; og (i de fleste nyere artikler) træning forekommer for at syntetisere en komplet enhed, der kan manipuleres i realtid.
Det er denne ofte omfattende og dataintensive træningsfase, der hidtil har holdt novel view synthesis uden for realtids- eller højresponsområdet.
Fakten, at Novel View Synthesis opretter en komplet 3D-kort over en volumetrisk rum, betyder, at det er relativt trivialt at sy sammen disse punkter til en traditionel computer-genereret mesh, effektivt fanget og artikuleret en CGI-menneske (eller enhver anden relativt begrænsende genstand) på-the-fly.
Tilgange, der anvender NeRF, afhænger af punktskyer og dybdekort for at generere interpoleringer mellem de sparsomme synspunkter for kameraerne:

NeRF kan generere volumetrisk dybde gennem beregning af dybdekort, snarere end generering af CG-mesh. Kilde: https://www.youtube.com/watch?v=JuH79E8rdKc
Selvom NeRF er i stand til at beregne mesh, anvender de fleste implementationer ikke dette til at generere volumetriske scener.
I modsætning hertil anvender Implicit Differentiable Renderer (IDR)-tilgangen, offentliggjort af Weizmann Institute of Science i oktober 2020, udnytter 3D-mesh-information automatisk genereret fra kameraarrays:

Eksempler på IDR-optagelser omdannet til interaktive CGI-mesh. Kilde: https://www.youtube.com/watch?v=C55y7RhJ1fE
Mens NeRF mangler IDRs evne til formestimation, kan IDR ikke matche NeRFs billedkvalitet, og begge kræver omfattende ressourcer til træning og samling (selvom nyere innovationer i NeRF er begyndt at adresse dette).

NLRs brugerdefineret kamerarig med 16 GoPro HERO7 og 6 centrale Back-Bone H7PRO-kameras. Til ‘realtids’-rendering opererer disse med en minimumsfrekvens på 60fps. Kilde: https://arxiv.org/pdf/2103.11571.pdf
I stedet anvender Neural Lumigraph Rendering SIREN (Sinusoidal Representation Networks) til at inkorporere styrkerne fra hver tilgang i sin egen ramme, der er designet til at generere output, der er direkte brugbar i eksisterende realtidsgrafikrørledninger.
SIREN er blevet anvendt til lignende implementationer over det sidste år og repræsenterer nu en populær API-kald for hobby-Colabs i billedsynthesis-samfund; men NLRs innovation er at anvende SIRENs til to-dimensionale multi-synspunktsbilledovervågning, som er problematisk på grund af, hvor meget SIREN producerer over-tilpasset snarere end generaliseret output.
Efter, at CG-meshen er udtrukket fra arraybillederne, bliver meshen rasteriseret via OpenGL, og vertexpositionerne på meshen tilknyttet de relevante pixels, efterfulgt af, at blandingen af de forskellige bidragende kort beregnes.
Den resulterende mesh er mere generaliseret og repræsentativ end NeRFs (se billedet nedenfor), kræver mindre beregning og anvender ikke excessiv detalje til områder (såsom glat ansigtshud), der ikke kan drage fordel af det:
På den negative side har NLR endnu ikke nogen kapacitet til dynamisk belysning eller genbelysning, og output er begrænset til skyggekort og andre belysningsovervejelser, der er erhvervet på optagelsestidspunktet. Forskerne har til hensigt at adresse dette i fremtidigt arbejde.
Derudover indrømmer artiklen, at formerne, der genereres af NLR, ikke er så nøjagtige som nogle alternative tilgange, såsom Pixelwise View Selection for Unstructured Multi-View Stereo, eller Weizmann Institute-forskningen, der blev nævnt tidligere.
Stigen af volumetrisk billedsynthesis
Idéen om at skabe 3D-enheder fra en begrænsende række billeder med neurale netværk forudgår NeRF, med visionære artikler, der går tilbage til 2007 eller tidligere. I 2019 producerede Facebooks AI-forskningsafdeling en seminalforskningsartikel, Neural Volumes: Learning Dynamic Renderable Volumes from Images, der først muliggjorde responsgrænseflader for syntetiske mennesker genereret af maskinelæringsbaseret volumetrisk optagelse.

Facebooks forskning i 2019 muliggjorde skabelsen af en responsgrænseflade for en volumetrisk person. Kilde: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/













