Andersons Blickwinkel

NeRF: Training von Drohnen in Neuralen Radiance-Umgebungen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Forscher der Stanford University haben eine neue Methode entwickelt, um Drohnen in photorealistischen und hochgenauen Umgebungen zu trainieren, indem sie die jüngste Flut von Interesse an Neuralen Radiance-Feldern (NeRF) nutzen.

Drohnen können in virtuellen Umgebungen trainiert werden, die direkt von realen Orten abgebildet werden, ohne dass spezielle 3D-Szene-Rekonstruktion erforderlich ist. In diesem Bild aus dem Projekt wird eine Windstörung als potenzielles Hindernis für die Drohne hinzugefügt, und wir können sehen, wie die Drohne vorübergehend von ihrer Traektorie abweicht und im letzten Moment korrigiert, um ein potenzielles Hindernis zu vermeiden. Quelle: https://mikh3x4.github.io/nerf-navigation/

Drohnen können in virtuellen Umgebungen trainiert werden, die direkt von realen Orten abgebildet werden, ohne dass spezielle 3D-Szene-Rekonstruktion erforderlich ist. In diesem Bild aus dem Projekt wird eine Windstörung als potenzielles Hindernis für die Drohne hinzugefügt, und wir können sehen, wie die Drohne vorübergehend von ihrer Traektorie abweicht und im letzten Moment korrigiert, um ein potenzielles Hindernis zu vermeiden. Quelle: https://mikh3x4.github.io/nerf-navigation/

Die Methode bietet die Möglichkeit für interaktives Training von Drohnen (oder anderen Arten von Objekten) in virtuellen Szenarien, die automatisch Volumeninformationen (zur Kollisionserkennung), Texturinformationen aus realen Fotos (zum Training der Bilderkennungsnetzwerke der Drohne) und reale Beleuchtung (um eine Vielzahl von Beleuchtungsszenarien zu trainieren und Überanpassung oder Überoptimierung zu vermeiden) enthalten.

Ein Couch-Objekt navigiert durch eine komplexe virtuelle Umgebung, die mit herkömmlichen AR/VR-Workflows sehr schwierig zu kartieren gewesen wäre, aber die in NeRF automatisch aus einer begrenzten Anzahl von Fotos rekonstruiert wurde. Quelle: https://www.youtube.com/watch?v=5JjWpv9BaaE

Ein Couch-Objekt navigiert durch eine komplexe virtuelle Umgebung, die mit herkömmlichen AR/VR-Workflows sehr schwierig zu kartieren gewesen wäre, aber die in NeRF automatisch aus einer begrenzten Anzahl von Fotos rekonstruiert wurde. Quelle: https://www.youtube.com/watch?v=5JjWpv9BaaE

Typische NeRF-Implementierungen verfügen nicht über Traektorienmechanismen, da die meisten NeRF-Projekte der letzten 18 Monate sich auf andere Herausforderungen konzentriert haben, wie z.B. Szenen-Relighting, Reflektionsrendering, Compositing und Disentanglement von erfassten Elementen. Daher ist die primäre Innovation des neuen Artikels die Implementierung einer NeRF-Umgebung als navigierbarer Raum, ohne die umfangreichen Ausrüstungen und zeitaufwändigen Verfahren, die erforderlich wären, um sie als 3D-Umgebung basierend auf Sensor-Erfassung und CGI-Rekonstruktion zu modellieren.

NeRF als VR/AR

Der neue Artikel trägt den Titel Vision-Only Robot Navigation in a Neural Radiance World und ist eine Zusammenarbeit zwischen drei Abteilungen der Stanford University: Aeronautik und Astronautik, Maschinenbau und Informatik.

Die Arbeit schlägt einen Navigationsrahmen vor, der einem Roboter eine vorgefertigte NeRF-Umgebung bietet, deren Volumendichte die möglichen Pfade für das Gerät begrenzt. Er enthält auch einen Filter, um zu schätzen, wo sich der Roboter innerhalb der virtuellen Umgebung befindet, basierend auf der Bilderkennung der RGB-Kamera des Roboters. Auf diese Weise kann eine Drohne oder ein Roboter genauer “halluzinieren”, was sie in einer bestimmten Umgebung erwarten kann.

Der Traektorien-Optimierer des Projekts navigiert durch ein NeRF-Modell von Stonehenge, das durch Photogrammetrie und Bildinterpretation in eine NeRF-Umgebung generiert wurde. Der Traektorien-Planer berechnet mehrere mögliche Pfade, bevor er eine optimale Traektorie über den Bogen festlegt.

Der Traektorien-Optimierer des Projekts navigiert durch ein NeRF-Modell von Stonehenge, das durch Photogrammetrie und Bildinterpretation (in diesem Fall von Mesh-Modellen) in eine NeRF-Umgebung generiert wurde. Der Traektorien-Planer berechnet mehrere mögliche Pfade, bevor er eine optimale Traektorie über den Bogen festlegt.

Weil eine NeRF-Umgebung vollständig modellierte Okklusionen aufweist, kann die Drohne leichter Hindernisse berechnen, da das neuronale Netzwerk hinter der NeRF die Beziehung zwischen Okklusionen und der Art und Weise, wie die Bilderkennungs-Systeme der Drohne die Umgebung wahrnehmen, kartieren kann. Die automatisierte NeRF-Generierungspipeline bietet eine relativ triviale Methode, um hyper-realistische Trainingsräume mit nur wenigen Fotos zu erstellen.

Der online-Neuplanungs-Framework, der für das Stanford-Projekt entwickelt wurde, ermöglicht eine widerstandsfähige und vollständig bildbasierte Navigationspipeline.

Der online-Neuplanungs-Framework, der für das Stanford-Projekt entwickelt wurde, ermöglicht eine widerstandsfähige und vollständig bildbasierte Navigationspipeline.

Die Stanford-Initiative ist eine der ersten, die die Möglichkeiten der Erforschung eines NeRF-Raums im Kontext einer navigierbaren und immersiven VR-ähnlichen Umgebung in Betracht zieht. NeRF ist eine aufstrebende Technologie, die derzeit Gegenstand mehrerer akademischer Bemühungen ist, um ihre hohen Rechenanforderungen zu optimieren und die erfassten Elemente zu entflechten.

NeRF ist nicht (eigentlich) CGI

Weil eine NeRF-Umgebung ein navigierbarer 3D-Raum ist, ist sie seit ihrer Einführung im Jahr 2020 oft missverstanden worden, da sie oft als Methode zur Automatisierung der Erstellung von Meshes und Texturen wahrgenommen wird, anstatt 3D-Umgebungen zu ersetzen, die den Zuschauern aus den Spezialeffekten von Hollywood und den fantastischen Szenen von Augmented Reality und Virtual Reality vertraut sind.

NeRF extrahiert Geometrie- und Texturinformationen aus einer sehr begrenzten Anzahl von Bildperspektiven, indem es die Differenz zwischen Bildern als Volumeninformation berechnet. Quelle: https://www.matthewtancik.com/nerf

NeRF extrahiert Geometrie- und Texturinformationen aus einer sehr begrenzten Anzahl von Bildperspektiven, indem es die Differenz zwischen Bildern als Volumeninformation berechnet. Quelle: https://www.matthewtancik.com/nerf

Tatsächlich ist die NeRF-Umgebung eher ein “live”-Render-Raum, in dem eine Kombination aus Pixel- und Beleuchtungsinformationen aufrechterhalten und in einem aktiven neuronalen Netzwerk navigiert wird.

Der Schlüssel zum Potenzial von NeRF ist, dass sie nur eine begrenzte Anzahl von Bildern erfordert, um Umgebungen zu rekonstruieren, und dass die generierten Umgebungen alle notwendigen Informationen für eine hochwertige Rekonstruktion enthalten, ohne dass die Dienste von Modellierern, Texturexperten, Beleuchtungsspezialisten und anderen Beiträgern zu “traditionellem” CGI erforderlich sind.

Semantische Segmentierung

Auch wenn NeRF effektiv “Computer-Generiertes Bild” (CGI) darstellt, bietet es eine völlig andere Methodik und eine hochautomatisierte Pipeline. Darüber hinaus kann NeRF bewegliche Teile einer Szene isolieren und “kapseln”, sodass sie hinzugefügt, entfernt, beschleunigt und allgemein als separate Aspekte in einer virtuellen Umgebung operieren können – eine Fähigkeit, die weit über den aktuellen Stand der Technik in einer “Hollywood”-Interpretation von CGI hinausgeht.

ST-NeRF

Ein Projekt der Shanghai Tech University, das im Sommer 2021 veröffentlicht wurde, bietet eine Methode, um bewegliche NeRF-Elemente in “einsetzbare” Aspekte für eine Szene zu individuieren. Quelle: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Negativ ist die Architektur von NeRF ein bisschen ein “black box”; es ist derzeit nicht möglich, ein Objekt aus einer NeRF-Umgebung zu extrahieren und direkt mit herkömmlichen mesh-basierten und bildbasierten Tools zu manipulieren, obwohl eine Reihe von Forschungsbemühungen beginnt, Durchbrüche bei der Dekonstruktion der Matrix hinter NeRFs neuronalem Netzwerk zu erzielen.

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai