Andersons hoek

Neuraal Renderen: NeRF maakt een wandeling in de frisse lucht

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een samenwerking tussen Google Research en Harvard University heeft een nieuwe methode ontwikkeld om 360‑gradenvideo van volledige scènes te maken met Neural Radiance Fields (NeRF). De nieuwe benadering brengt NeRF een stap dichter bij informeel abstract gebruik in elke omgeving, zonder te worden beperkt tot tabletop-modellen of gesloten interieurscenario’s.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

See end of article for full video. Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 kan uitgebreide achtergronden en ‘oneindige’ objecten zoals de lucht aan, omdat het, in tegenstelling tot de meeste eerdere iteraties, limieten stelt aan de interpretatie van lichtstralen en aandachtgrenzen creëert die anders lange trainingstijden rechtvaardigen. Zie de nieuwe bijbehorende video, onderaan dit artikel ingesloten, voor meer voorbeelden en een uitgebreid inzicht in het proces.

Het nieuwe artikel draagt de titel Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields en wordt geleid door Senior Staff Research Scientist bij Google Research, Jon Barron.

Om de doorbraak te begrijpen, is het nodig een basisbegrip te hebben van hoe beeldsynthetisatie op basis van neurale stralingsvelden werkt.

Wat is NeRF?

Het is problematisch om een NeRF‑netwerk te beschrijven in termen van een ‘video’, omdat het dichter bij een volledig 3D‑gerealiseerde maar AI‑gebaseerde virtuele omgeving ligt, waarbij meerdere gezichtspunten vanuit enkele foto’s (inclusief videoframes) worden samengevoegd tot een scène die technisch alleen bestaat in de latente ruimte van een machine‑learning‑algoritme – maar waaruit naar believen een buitengewoon aantal gezichtspunten en video’s kunnen worden geëxtraheerd.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Informatie verkregen uit de bijdragende foto’s wordt getraind in een matrix die vergelijkbaar is met een traditionele voxel grid in CGI‑workflows, waarbij elk punt in de 3D‑ruimte een waarde krijgt, waardoor de scène navigeerbaar wordt.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: ResearchGate

Na het berekenen van de tussenruimte tussen foto’s (indien nodig) wordt het pad van elke mogelijke pixel van elke bijdragende foto effectief ‘ray‑traced’ en krijgt een kleurwaarde toegewezen, inclusief een transparantiewaarde (zonder welke de neurale matrix volledig ondoorzichtig of volledig leeg zou zijn).

Net als voxelgrids, en in tegenstelling tot CGI‑gebaseerde 3D‑coördinatenruimtes, heeft het ‘interieur’ van een ‘gesloten’ object geen bestaan in een NeRF‑matrix. Je kunt een CGI-drumstel opensnijden en erin kijken, als je wilt; maar voor NeRF eindigt het bestaan van het drumstel zodra de opaciteitswaarde van het oppervlak gelijk is aan ‘1’.

Een breder perspectief op een pixel

Mip-NeRF 360 is een uitbreiding van onderzoek uit maart 2021, dat effectief efficiënte anti‑aliasing introduceerde voor NeRF zonder uitputtende supersampling.

NeRF berekent traditioneel slechts één pixelpad, wat de neiging heeft om de zogenaamde ‘jaggies’ te produceren die vroege internet‑beeldformaten kenmerkten, evenals oudere gamesystemen. Deze gekartelde randen werden opgelost met diverse methoden, meestal door naburige pixels te bemonsteren en een gemiddelde representatie te vinden.

Omdat traditioneel NeRF slechts dat ene pixelpad bemonstert, introduceerde Mip-NeRF een ‘conisch’ opvanggebied, vergelijkbaar met een brede zaklamp, dat voldoende informatie over naburige pixels levert om economische anti‑aliasing met verbeterde details te produceren.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (lower image), which are further ‘blurred’ to create vague Gaussian spaces that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

De verbetering ten opzichte van een standaard NeRF‑implementatie was opmerkelijk:

Mip-NeRF (right), released in maart 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (right), released in maart 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just ‘blurring’ pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

NeRF Onbegrensd

Het maart‑paper liet drie problemen onopgelost met betrekking tot het gebruik van Mip‑NeRF in onbegrensde omgevingen die zeer verre objecten, waaronder luchten, kunnen omvatten. Het nieuwe artikel lost dit op door een Kalman‑achtige vervorming toe te passen op de Mip‑NeRF‑Gaussiaanse.

Ten tweede vereisen grotere scènes meer rekenkracht en langere trainingstijden, wat Mip‑NeRF 360 oplost door de scène‑geometrie te ‘destilleren’ met een kleine ‘voorstel’-multi‑layer perceptron (MLP), die de geometrie die door een grote standaard NeRF‑MLP wordt voorspeld vooraf begrenst. Dit versnelt de training met een factor drie.

Ten slotte zorgen grotere scènes ervoor dat de discretisatie van de geïnterpreteerde geometrie ambigu wordt, wat resulteert in de soort artefacten die gamers kennen wanneer game‑output ‘scheurt’. Het nieuwe artikel pakt dit aan door een nieuwe regularisator te creëren voor Mip‑NeRF‑straalintervallen.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Om meer te weten te komen over het nieuwe artikel, bekijk de video hieronder, en ook de video‑introductie van maart 2021 over Mip‑NeRF. Je kunt ook meer te weten komen over NeRF‑onderzoek door onze tot nu toe gemaakte verslaggeving te bekijken.

Oorspronkelijk gepubliceerd 25 november 2021
21 december 2021, 12:25pm – Vervangen dode video. – MA

Schrijver over machine learning, domeinspecialist in menselijke beeldsynthetisatie. Voormalig hoofd van onderzoekscontent bij Metaphysic.ai, tot de ontbinding ervan in DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai