Andersons hoek
Naar real-time AI-mensen met Neural Lumigraph Rendering

Ondanks de huidige golf van belangstelling voor Neural Radiance Fields (NeRF), een technologie die in staat is AI‑gegenereerde 3D‑omgevingen en objecten te creëren, vereist deze nieuwe benadering van beeldsynthesetechnologie nog steeds veel trainingstijd en mist een implementatie die real‑time, zeer responsieve interfaces mogelijk maakt.
Echter biedt een samenwerking tussen enkele indrukwekkende namen uit de industrie en de academische wereld een nieuwe benadering van deze uitdaging (algemeen bekend als Novel View Synthesis, of NVS).
Het onderzoekspaper, getiteld Neural Lumigraph Rendering, beweert een verbetering van ongeveer twee ordes van grootte ten opzichte van de state-of-the-art, wat verschillende stappen richting real‑time CG‑rendering via machine‑learning‑pijplijnen vertegenwoordigt.

Neural Lumigraph Rendering (rechts) biedt een betere resolutie van blend‑artefacten en een verbeterde omgang met occlusie ten opzichte van eerdere methoden. Bron.
Hoewel de credits voor het paper alleen Stanford University en het holografische displaytechnologiebedrijf Raxium (momenteel opererend in stealth‑modus) vermelden, omvatten de bijdragers een hoofd‑machine‑learning architect bij Google, een computer wetenschapper bij Adobe (ADBE ), en de CTO van StoryFile (die recent koppen maakte met een AI‑versie van William Shatner).
Met betrekking tot de recente Shatner‑publiciteitsgolf lijkt StoryFile NLR te gebruiken in haar nieuwe proces voor het creëren van interactieve, AI‑gegenereerde entiteiten op basis van de kenmerken en verhalen van individuele personen.
StoryFile voorziet het gebruik van deze technologie in museumdisplays, online interactieve verhalen, holografische displays, augmented reality (AR) en erfgoeddocumentatie – en lijkt ook potentiële nieuwe toepassingen van NLR te overwegen in wervingsinterviews en virtuele dating‑applicaties:

Voorgestelde toepassingen uit een online video van StoryFile.
Volumetrische opname voor Novel View Synthesis‑interfaces en video
Het principe van volumetrische opname, over de reeks papers die over dit onderwerp verschijnen, is het idee om stilstaande beelden of video’s van een onderwerp te nemen en machine‑learning te gebruiken om de gezichtspunten die niet door de oorspronkelijke camera‑opstelling werden gedekt, ‘in te vullen’.

Bron: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
Op de bovenstaande afbeelding, afkomstig uit Facebook’s AI‑onderzoek van 2019 (zie hieronder), zien we de vier fasen van volumetrische opname: meerdere camera’s verkrijgen beelden/opnames; encoder/decoder‑architectuur (of andere architecturen) berekenen en concateneren de relatieve kijkhoeken; ray‑marching‑algoritmes berekenen de voxels (of andere XYZ‑ruimtelijke meeteenheden) van elk punt in de volumetrische ruimte; en (in de meest recente papers) vindt training plaats om een compleet object te synthetiseren dat in real‑time kan worden gemanipuleerd.
Het is deze vaak omvangrijke en data‑zware trainingsfase die tot nu toe Novel View Synthesis buiten het bereik van real‑time of zeer responsieve opname heeft gehouden.
Het feit dat Novel View Synthesis een volledige 3D‑kaart van een volumetrische ruimte maakt, betekent dat het relatief triviaal is om deze punten samen te voegen tot een traditioneel computer‑gegenereerd mesh, waardoor men een CGI‑mens (of elk ander relatief begrensd object) direct kan vastleggen en articuleren.
Benaderingen die NeRF gebruiken, vertrouwen op puntwolken en dieptekaarten om de interpolaties tussen de schaars verspreide gezichtspunten van de opname‑apparaten te genereren:

NeRF kan volumetrische diepte genereren door berekening van dieptekaarten, in plaats van het genereren van CG‑meshes. Bron: https://www.youtube.com/watch?v=JuH79E8rdKc
Hoewel NeRF in staat is om meshes te berekenen, gebruiken de meeste implementaties dit niet om volumetrische scènes te genereren.
Daarentegen berust de Implicit Differentiable Renderer (IDR)-benadering, gepubliceerd door het Weizmann Institute of Science in oktober 2020, op het benutten van automatisch gegenereerde 3D‑mesh‑informatie van opname‑arrays:

Voorbeelden van IDR‑opnames omgezet in interactieve CGI‑meshes. Bron: https://www.youtube.com/watch?v=C55y7RhJ1fE
Hoewel NeRF IDR’s mogelijkheid voor vormschatting mist, kan IDR de beeldkwaliteit van NeRF niet evenaren, en beide vereisen uitgebreide middelen om te trainen en te verzamelen (hoewel recente innovaties in NeRF beginnen dit aan te pakken).

NLR’s aangepaste camerastel met 16 GoPro HERO7 en 6 centrale Back‑Bone H7PRO‑camera’s. Voor ‘real‑time’ rendering werken deze met minimaal 60 fps. Bron: https://arxiv.org/pdf/2103.11571.pdf
In plaats daarvan maakt Neural Lumigraph Rendering gebruik van SIREN (Sinusoidal Representation Networks) om de sterktes van elke benadering in zijn eigen framework te integreren, met als doel output te genereren die direct bruikbaar is in bestaande real‑time grafische pijplijnen.
SIREN is de afgelopen jaar gebruikt voor gelijkaardige implementaties, en vormt nu een populaire API‑aanroep voor hobby‑Colabs in beeldsynthesegemeenschappen; echter is NLR’s innovatie om SIREN’s toe te passen op tweedimensionale multi‑view‑beeld‑supervisie, wat problematisch is vanwege de mate waarin SIREN over‑gefitte in plaats van gegeneraliseerde output produceert.
Nadat de CG‑mesh is geëxtraheerd uit de array‑beelden, wordt de mesh gerasterd via OpenGL en worden de vertex‑posities van de mesh naar de juiste pixels gemapt, waarna de blending van de verschillende bijdragende kaarten wordt berekend.
De resulterende mesh is meer gegeneraliseerd en representatief dan die van NeRF (zie afbeelding hieronder), vereist minder berekeningen, en brengt geen overmatige detail aan in gebieden (zoals gladde gezichtshuid) die er geen baat bij hebben:
Aan de negatieve kant heeft NLR nog geen capaciteit voor dynamische verlichting of relighting, en is de output beperkt tot schaduwkaarten en andere verlichtingsaspecten die tijdens de opname werden verkregen. De onderzoekers zijn van plan dit in toekomstig werk aan te pakken.
Bovendien geeft het paper toe dat de door NLR gegenereerde vormen niet zo nauwkeurig zijn als sommige alternatieve benaderingen, zoals Pixelwise View Selection for Unstructured Multi-View Stereo, of het eerder genoemde onderzoek van het Weizmann Institute.
De opkomst van volumetrische beeldsynthese
Het idee om 3D‑entiteiten te creëren uit een beperkte reeks foto’s met neurale netwerken dateert van vóór NeRF, met visionaire papers die teruggaan tot 2007 of eerder. In 2019 produceerde de AI‑onderzoeksafdeling van Facebook een baanbrekend onderzoekspaper, Neural Volumes: Learning Dynamic Renderable Volumes from Images, dat voor het eerst responsieve interfaces mogelijk maakte voor synthetische mensen gegenereerd door machine‑learning‑gebaseerde volumetrische opname.

Het onderzoek van Facebook uit 2019 maakte de creatie van een responsieve gebruikersinterface voor een volumetrisch persoon mogelijk. Bron: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/
naar het Nederlands Vertalen naar het Nederlands.













