Andersons Blickwinkel

Neuronale Rendering: NeRF geht einen Spaziergang an der frischen Luft

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Eine Zusammenarbeit zwischen Google Research und der Harvard University hat eine neue Methode entwickelt, um 360-Grad-Neuronales-Video von vollständigen Szenen mithilfe von Neuralen Radiance Fields (NeRF) zu erstellen. Der neue Ansatz bringt NeRF einen Schritt näher an eine alltägliche abstrakte Verwendung in jeder Umgebung, ohne auf Tischmodelle oder geschlossene Innenraumszenarien beschränkt zu sein.

Quelle: https://www.youtube.com/watch?v=YStDS2-Ln1s

Siehe Ende des Artikels für das vollständige Video. Quelle: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 kann erweiterte Hintergründe und “unendliche” Objekte wie den Himmel verarbeiten, da es im Gegensatz zu den meisten vorherigen Iterationen Grenzen für die Interpretation von Lichtstrahlen setzt und Aufmerksamkeitsgrenzen erstellt, die die ansonsten langen Trainingszeiten rationalisieren. Siehe das neue begleitende Video, das am Ende dieses Artikels eingebettet ist, für weitere Beispiele und einen tieferen Einblick in den Prozess.

Das neue Papier trägt den Titel Mip-NeRF 360: Unbegrenzte Anti-Aliasierte Neuronale Radiance Fields und wird von Senior Staff Research Scientist bei Google Research Jon Barron geleitet.

Um den Durchbruch zu verstehen, ist es notwendig, eine grundlegende Kenntnis davon zu haben, wie neuronale Radiance-Feld-basierte Bildsynthese funktioniert.

Was ist NeRF?

Es ist problematisch, ein NeRF-Netzwerk in Bezug auf ein “Video” zu beschreiben, da es näher an einer vollständig 3D-realisierten, aber AI-basierten virtuellen Umgebung liegt, in der multiple Blickwinkel aus einzelnen Fotos (einschließlich Video-Frames) verwendet werden, um eine Szene zusammenzustellen, die technisch nur im latenten Raum eines maschinellen Lernalgorithmus existiert – aber aus der eine außergewöhnliche Anzahl von Blickwinkeln und Videos extrahiert werden kann.

Eine Darstellung der mehreren Kamerapositionen, die die Daten liefern, die NeRF in eine neuronale Szene (rechts) zusammenfügt.

Eine Darstellung der mehreren Kamerapositionen, die die Daten liefern, die NeRF in eine neuronale Szene (rechts) zusammenfügt.

Die aus den beitragenden Fotos abgeleiteten Informationen werden in eine Matrix trainiert, die einer traditionellen Voxel-Grid in CGI-Workflows ähnelt, in der jeder Punkt im 3D-Raum einen Wert erhält, der die Szene navigierbar macht.

Eine traditionelle Voxel-Matrix platziert Pixelinformationen (die normalerweise in einem 2D-Kontext existieren, wie z.B. dem Pixelraster einer JPEG-Datei) in einen dreidimensionalen Raum. Quelle: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Eine traditionelle Voxel-Matrix platziert Pixelinformationen (die normalerweise in einem 2D-Kontext existieren, wie z.B. dem Pixelraster einer JPEG-Datei) in einen dreidimensionalen Raum. Quelle: ResearchGate

Nach der Berechnung des Zwischenraums zwischen den Fotos (falls notwendig) wird der Pfad jedes möglichen Pixels jedes beitragenden Fotos effektiv “ray-getracet” und einem Farbwert zugewiesen, einschließlich eines Transparenzwerts (ohne den die neuronale Matrix vollständig undurchsichtig oder leer wäre).

Wie Voxel-Grids und im Gegensatz zu CGI-basierten 3D-Koordinatenräumen hat die “Innenseite” eines “geschlossenen” Objekts in einer NeRF-Matrix keine Existenz. Sie können eine CGI-Schlagzeugsette öffnen und hineinschauen, wenn Sie möchten; aber was NeRF betrifft, endet die Existenz der Schlagzeugsette, wenn der Deckungswert ihrer Oberfläche “1” entspricht.

Eine breitere Sicht eines Pixels

Mip-NeRF 360 ist eine Erweiterung der Forschung aus März 2021, die effizientes Anti-Aliasing für NeRF ohne erschöpfendes Supersampling eingeführt hat.

NeRF berechnet traditionell nur einen Pixel-Pfad, der dazu neigt, die Art von ‘Jaggies’ zu produzieren, die frühe Internet-Bildformate und frühere Spiele-Systeme charakterisierten. Diese gezackten Kanten wurden durch verschiedene Methoden gelöst, die normalerweise das Abtasten benachbarter Pixel und das Finden einer durchschnittlichen Darstellung beinhalteten.

Weil traditionelles NeRF nur einen Pixel-Pfad abtastet, führte Mip-NeRF ein “konisches” Auffanggebiet ein, wie eine breite Strahl-Taschenlampe, das genug Informationen über benachbarte Pixel liefert, um wirtschaftliches Anti-Aliasing mit verbesserter Detailgenauigkeit zu produzieren.

Das konische Auffanggebiet, das Mip-NeRF verwendet, wird in konische Frusten (unten) geschnitten, die weiter

Das konische Auffanggebiet, das Mip-NeRF verwendet, wird in konische Frusten (unten) geschnitten, die weiter “verblasen” werden, um einen vagen Gauß-Raum darzustellen, der verwendet werden kann, um die Genauigkeit und Aliasing eines Pixels zu berechnen. Quelle: https://www.youtube.com/watch?v=EpH175PY1A0

Die Verbesserung gegenüber einer Standard-NeRF-Implementierung war bemerkenswert:

Mip-NeRF (rechts), veröffentlicht im März 2021, bietet verbesserte Details durch eine umfassendere, aber wirtschaftliche Anti-Aliasing-Pipeline, anstatt nur

Mip-NeRF (rechts), veröffentlicht im März 2021, bietet verbesserte Details durch eine umfassendere, aber wirtschaftliche Anti-Aliasing-Pipeline, anstatt nur “verblasen” Pixel, um gezackte Kanten zu vermeiden. Quelle: https://jonbarron.info/mipnerf/

NeRF Unbegrenzt

Das Papier aus März ließ drei Probleme ungelöst, was die Verwendung von Mip-NeRF in unbeschränkten Umgebungen betrifft, die sehr entfernte Objekte, einschließlich Himmel, enthalten könnten. Das neue Papier löst dies, indem es eine Kalman-ähnliche Verzerrung auf die Mip-NeRF-Gauß-Funktionen anwendet.

Zweitens erfordern größere Szenen mehr Rechenleistung und längere Trainingszeiten, was Mip-NeRF 360 löst, indem es die Szene-Geometrie mit einem kleinen “Vorschlag”-Multi-Layer-Perceptron (MLP) “destilliert”, das die Geometrie vorhersagt, die von einem großen Standard-NeRF-MLP vorhergesagt wird. Dies beschleunigt die Trainingszeit um einen Faktor von drei.

Schließlich neigen größere Szenen dazu, die Diskretisierung der interpretierten Geometrie mehrdeutig zu machen, was zu den Art von Artefakten führt, die Spieler von Spielen kennen, wenn das Spiel-Output “reißt”. Das neue Papier löst dies, indem es einen neuen Regulator für Mip-NeRF-Strahlenintervalle erstellt.

Rechts sehen wir unerwünschte Artefakte in Mip-NeRF aufgrund der Schwierigkeit, eine so große Szene zu begrenzen. Links sehen wir, dass der neue Regulator die Szene gut genug optimiert hat, um diese Störungen zu entfernen.

Rechts sehen wir unerwünschte Artefakte in Mip-NeRF aufgrund der Schwierigkeit, eine so große Szene zu begrenzen. Links sehen wir, dass der neue Regulator die Szene gut genug optimiert hat, um diese Störungen zu entfernen.

Um mehr über das neue Papier zu erfahren, sehen Sie sich das Video unten an und auch die Video-Einführung von März 2021 zu Mip-NeRF. Sie können auch mehr über NeRF-Forschung erfahren, indem Sie unsere Berichterstattung bislang überprüfen.

Ursprünglich veröffentlicht am 25. November 2021
21. Dezember 2021, 12:25 Uhr – Ersetzt totes Video. – MA

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai