KI-Modelle und Plattformen
Splatter Image: Ultra-Schnelle 3D-Rekonstruktion aus einer einzigen Ansicht
Die Rekonstruktion von 3D-Objekten aus einer einzigen Ansicht mit Hilfe von Convolutional Neural Networks (CNNs) hat bemerkenswerte Fähigkeiten demonstriert. Modelle für die Rekonstruktion von 3D-Objekten aus einer einzigen Ansicht generieren das 3D-Modell eines Objekts mithilfe eines einzelnen Bildes als Referenz, was es zu einem der heißesten Forschungsthemen im Bereich des Computersehens macht.

Nehmen wir beispielsweise das Motorrad im obigen Bild. Die Generierung seiner 3D-Struktur erfordert eine komplexe Pipeline, die zunächst Hinweise aus niedrigauflösenden Bildern mit hochauflösender semantischer Information und Wissen über die strukturelle Anordnung von Teilen kombiniert.
Aufgrund des komplexen Prozesses war die Rekonstruktion von 3D-Objekten aus einer einzigen Ansicht eine große Herausforderung im Bereich des Computersehens. Um die Effizienz der Rekonstruktion von 3D-Objekten aus einer einzigen Ansicht zu verbessern, haben Entwickler an der Splatter-Image-Methode gearbeitet, die darauf abzielt, ultra-schnelle 3D-Form- und 3D-Erscheinungsbild-Generierung von Objekten zu erreichen. Im Kern verwendet die Splatter-Image-Architektur die Gaussian-Splatting-Methode, um 3D-Darstellungen zu analysieren und die Geschwindigkeit und Qualität, die sie bietet, zu nutzen.
Kürzlich wurde die Gaussian-Splatting-Methode von zahlreichen Multi-View-Rekonstruktionsmodellen für Echtzeit-Rendering, verbesserte Skalierbarkeit und schnelles Training implementiert. Die Splatter-Image-Architektur ist jedoch das erste Framework, das die Gaussian-Splatting-Methode für Rekonstruktionsaufgaben aus einer einzigen Ansicht implementiert.
In diesem Artikel werden wir uns damit befassen, wie die Splatter-Image-Architektur die Gaussian-Splatting-Methode nutzt, um ultra-schnelle 3D-Rekonstruktion aus einer einzigen Ansicht zu erreichen. Also los geht’s.
Splatter Image: Ein Versuch, ultra-schnelle 3D-Rekonstruktion aus einer einzigen Ansicht zu erreichen
Wie bereits erwähnt, ist die Splatter-Image-Architektur ein ultra-schneller Ansatz für die Rekonstruktion von 3D-Objekten aus einer einzigen Ansicht auf der Grundlage der Gaussian-Splatting-Methode. Die Splatter-Image-Architektur ist das erste Computer-Vision-Framework, das Gaussian-Splatting für monokulare 3D-Objektgenerierung implementiert, da traditionell Gaussian-Splatting für Multi-View-3D-Objekt-Rekonstruktionsframeworks verwendet wurde. Was die Splatter-Image-Architektur jedoch von vorherigen Methoden unterscheidet, ist, dass sie ein lernbasierter Ansatz ist und die Rekonstruktion während des Testens nur die Feed-Forward-Auswertung des neuronalen Netzes erfordert.
Die Splatter-Image-Architektur basiert im Wesentlichen auf den Rendering-Eigenschaften von Gaussian Splatting und der hohen Verarbeitungsgeschwindigkeit, um 3D-Rekonstruktionen zu generieren. Die Splatter-Image-Architektur verfügt über ein einfaches Design: Das Framework verwendet ein 2D-Bild-zu-Bild-Neuronales-Netz, um für jedes Eingabe-Bildpixel ein 3D-Gaußsches zuvorherzusagen und das Eingabe-Bild auf ein 3D-Gaußsches pro Pixel zu kartieren. Das resultierende 3D-Gaußsche hat die Form eines Bildes, bekannt als das Splatter-Bild, und bietet auch eine 360-Grad-Darstellung des Bildes.

Obwohl der Prozess einfach und geradlinig ist, gibt es einige Schlüsselherausforderungen, denen die Splatter-Image-Architektur bei der Verwendung von Gaussian Splatting zur Generierung von 3D-Gaußschen für die Rekonstruktion aus einer einzigen Ansicht gegenübersteht. Die erste große Hürde besteht darin, ein Neuronales Netz zu entwerfen, das das Bild eines Objekts als Eingabe annimmt und eine entsprechende Gaußsche Mischung generiert, die alle Seiten des Bildes als Ausgabe darstellt. Um dies zu bewältigen, nutzt die Splatter-Image-Architektur die Tatsache, dass die generierte Gaußsche Mischung eine Menge oder eine ungeordnete Sammlung von Elementen ist, die dennoch in einer geordneten Datenstruktur gespeichert werden kann.
Durch die Speicherung von 3D-Gaußschen-Mengen in einem Bild kann die Splatter-Image-Architektur die Rekonstruktionshürden überwinden, die beim Lernen eines Bild-zu-Bild-Neuronalen-Netzes auftreten. Durch die Verwendung dieses Ansatzes kann der Rekonstruktionsprozess nur durch die Verwendung effizienter 2D-Operatoren implementiert werden, anstatt auf 3D-Operatoren zurückzugreifen. Darüber hinaus ermöglicht die Splatter-Image-Architektur durch die Verwendung von Gaussian Splatting eine Mischung von 3D-Gaußschen, die die Vorteile von Rendering-Geschwindigkeit und Speichereffizienz ausnutzt, was die Effizienz bei der Ausbildung und bei der Inferenz verbessert.
Aus empirischer Sicht ist es erwähnenswert, dass die Splatter-Image-Architektur 360-Grad-Rekonstruktionen eines Objekts generieren kann, obwohl sie nur eine Seite des Objekts sieht. Die Architektur weist dann verschiedene Gaußsche in einem 2D-Nachbarschaftsverhältnis zu verschiedenen Teilen des 3D-Objekts zu, um die generierte 360-Grad-Information im 2D-Bild zu kodieren.
Zusammenfassend ist die Splatter-Image-Architektur
- Ein neuer Ansatz, um Rekonstruktionen von 3D-Objekten aus einer einzigen Ansicht durch die Übernahme der Gaussian-Splatting-Methode zu generieren.
- Eine Erweiterung der Methode für die Rekonstruktion von 3D-Objekten aus mehreren Ansichten.
- Eine Methode, die auf Standard-Benchmarks mit außergewöhnlicher Geschwindigkeit und Qualität die beste Leistung bei der Rekonstruktion von 3D-Objekten erzielt.
Splatter Image: Methodik und Architektur
Gaussian Splatting
Wie bereits erwähnt, ist die Gaussian-Splatting-Methode die primäre Methode, die von der Splatter-Image-Architektur implementiert wird, um Rekonstruktionen von 3D-Objekten aus einer einzigen Ansicht zu generieren. In einfachen Worten ist die Gaussian-Splatting-Methode eine Rasterisierungsmethode für die Rekonstruktion von 3D-Bildern und Echtzeit-Rendering von Bildern mit mehreren Ansichten.

Die 3D-Gaussian-Splatting-Methode verwendet zunächst die Menge der Eingabe-Bilder, um eine Punktwolke zu generieren. Anschließend verwendet die Methode die Eingabe-Bilder, um die externen Parameter der Kamera wie Neigung und Position zu schätzen, indem sie die Pixel zwischen den Bildern abgleicht, und diese Parameter werden dann verwendet, um die Punktwolke zu berechnen. Mithilfe verschiedener maschineller Lernmethoden optimiert die Gaussian-Splatting-Methode dann vier Parameter für jeden Gaußschen, nämlich Position (wo befindet er sich), Kovarianz (die Ausdehnung seiner Dehnung oder Skalierung in einer 3×3-Matrix), Farbe (welche ist die RGB-Farbskala) und Alpha (die Transparenz misst).

Darüber hinaus bietet die Opazitätsfunktion und die Farbfunktion in der Gaussian-Splatting-Methode ein Strahlungsfeld mit der Blickrichtung des 3D-Punktes. Das Framework rendert dann das Strahlungsfeld auf ein Bild, indem es die Farben entlang des Strahls integriert, der durch das Pixel verläuft. Die Gaussian-Splatting-Methode stellt diese Funktionen als eine Kombination von farbigen Gaußschen dar, wobei der Mittelwert oder die Mitte des Gaußschen sowie die Kovarianz des Gaußschen dabei helfen, seine Form und Größe zu bestimmen.
Splatter Image
Der Renderer-Komponent kartiert die Menge der 3D-Gaußschen auf ein Bild. Um die Rekonstruktion aus einer einzigen Ansicht durchzuführen, sucht das Framework nach einer inversen Funktion für 3D-Gaußsche, die die Mischung von 3D-Gaußschen aus einem Bild rekonstruiert. Der Schlüssel besteht darin, eine effektive, aber einfache Design für die inverse Funktion vorzuschlagen.
Nun könnte man spekulieren, wie die Splatter-Image-Architektur die 3D-Darstellung eines Objekts rekonstruieren kann, obwohl sie nur auf eine seiner Ansichten zugreift? In Echtzeit lernt die Splatter-Image-Architektur, einige der verfügbaren Gaußschen zu verwenden, um die Ansicht zu rekonstruieren, und verwendet die verbleibenden Gaußschen, um automatisch unsichtbare Teile des Bildes zu rekonstruieren.
BildEbene-Verlust
Ein wesentlicher Vorteil der Nutzung der Geschwindigkeit und Effizienz, die die Gaussian-Splatting-Methode bietet, besteht darin, dass sie es dem Framework ermöglicht, alle Bilder bei jedem Schritt zu rendern, auch bei Chargen mit relativ großer Chargengröße. Darüber hinaus bedeutet dies, dass das Framework nicht nur zerlegbare Verluste, sondern auch Bild-Verluste verwenden kann, die sich nicht in Verluste pro Pixel zerlegen lassen.
Skalennormierung
Es ist schwierig, die Größe eines Objekts zu schätzen, wenn man nur eine Ansicht sieht, und es ist eine schwierige Aufgabe, diese Unsicherheit zu lösen, wenn es mit einem Verlust trainiert wird. Das gleiche Problem tritt nicht in synthetischen Datensätzen auf, da alle Objekte mit identischen Kamera-Intrinsiken gerendert werden und die Objekte in einem festen Abstand von der Kamera sind, was letztendlich dazu beiträgt, die Unsicherheit zu lösen. In Datensätzen mit echten Bildern ist die Unsicherheit jedoch sehr deutlich, und die Splatter-Image-Architektur verwendet mehrere Vorverarbeitungsmethoden, um die Skala aller Objekte ungefähr zu fixieren.
Ansichtsabhängige Farbe
Um ansichtsabhängige Farben darzustellen, verwendet die Splatter-Image-Architektur sphärische Harmoniken, um die Farben über das lambertsche Farbmodell hinaus zu verallgemeinern. Für jeden Gaußschen definiert das Modell Koeffizienten, die vom Netzwerk vorhergesagt werden, und die sphärischen Harmoniken. Die Änderung der Blickrichtung transformiert eine Blickrichtung in der Kamera-Quelle in die entsprechende Blickrichtung im Bezugssystem. Das Modell findet dann die entsprechenden Koeffizienten, um die transformierte Farbfunktion zu finden.
Neuronales Netzwerk-Architektur
Der größte Teil der Architektur des Prädiktors, der das Eingabe-Bild auf die Mischung von Gaußschen kartiert, ist identisch mit dem Prozess, der im SongUNet-Framework verwendet wird. Die letzte Schicht in der Architektur wird durch eine 1×1-Faltungs-Schicht ersetzt, wobei die Farbmodell-Breite die Breite der Ausgabe-Kanäle bestimmt. Gegeben das Eingabe-Bild, produziert das Netzwerk einen Ausgabe-Kanal-Tensor als Ausgabe, und für jeden Pixel-Kanal kodiert es die Parameter, die dann in Offset, Opazität, Rotation, Tiefe und Farbe umgewandelt werden.
Für die Rekonstruktion von 3D-Darstellungen mit mehreren Ansichten wendet die Splatter-Image-Architektur das gleiche Netz auf jede Eingabe-Ansicht an und kombiniert dann die einzelnen Rekonstruktionen mithilfe des Blickwinkel-Ansatzes. Darüber hinaus fügt die Splatter-Image-Architektur zwei Modifikationen in das Netz ein, um eine effiziente Koordination und den Austausch von Informationen zwischen den Ansichten im Netz zu ermöglichen.
Splatter Image: Experimente und Ergebnisse
Die Splatter-Image-Architektur misst die Qualität ihrer Rekonstruktionen, indem sie die Qualität der Neuen Ansichtssynthese bewertet, da das Framework die Quellansicht verwendet und die 3D-Form rendern lässt, um unbeobachtete Ansichten zu rekonstruieren. Das Framework bewertet seine Leistung, indem es die SSIM- oder Strukturähnlichkeits-, Peak-Signal-Rausch-Verhältnis- oder PSNR- und Wahrnehmungsqualitäts- oder LPIPS-Werte misst.
Rekonstruktion aus einer einzigen Ansicht: Leistung
Die folgende Tabelle zeigt die Leistung des Splatter-Image-Modells bei der Rekonstruktion aus einer einzigen Ansicht auf dem ShapeNet-Benchmark.

Wie zu sehen ist, übertrifft die Splatter-Image-Architektur alle deterministischen Rekonstruktionsmethoden bei den LPIPS- und SSIM-Werten. Die Werte zeigen, dass das Splatter-Image-Modell Bilder mit schärferen Rekonstruktionen generiert. Darüber hinaus übertrifft das Splatter-Image-Modell auch alle deterministischen Basismodelle bei den PSNR-Werten, was darauf hinweist, dass die generierten Rekonstruktionen auch genauer sind.
Das folgende Bild zeigt die qualitative Leistungsfähigkeit der Splatter-Image-Architektur, und wie zu sehen ist, generiert das Modell Rekonstruktionen mit dünnen und interessanten Geometrien und erfasst die Details der bedingten Ansichten.

Das folgende Bild zeigt, dass die Rekonstruktionen, die von der Splatter-Image-Architektur generiert werden, nicht nur schärfer, sondern auch genauer sind als die von vorherigen Modellen, insbesondere unter ungewöhnlichen Bedingungen mit dünnen Strukturen und begrenzter Sichtbarkeit.

Mehrere Ansichten: Rekonstruktion
Um ihre Fähigkeiten bei der Rekonstruktion aus mehreren Ansichten zu bewerten, wird die Splatter-Image-Architektur auf dem SpaneNet-SRN-Cars-Datensatz für Zwei-Ansichten-Vorhersagen trainiert. Bestehende Methoden verwenden absolute Kamerapositionskonditionierung für Rekonstruktionsaufgaben aus mehreren Ansichten, was bedeutet, dass das Modell primär auf die kanonische Ausrichtung des Objekts im Objekt vertraut.

Letzte Gedanken
In diesem Artikel haben wir über die Splatter-Image-Architektur gesprochen, eine Methode, die darauf abzielt, ultra-schnelle 3D-Form- und 3D-Erscheinungsbild-Generierung von Objekten zu erreichen. Im Kern verwendet die Splatter-Image-Architektur die Gaussian-Splatting-Methode, um 3D-Darstellungen zu analysieren und die Geschwindigkeit und Qualität, die sie bietet, zu nutzen. Die Splatter-Image-Architektur verarbeitet Bilder mithilfe einer Standard-2D-CNN-Architektur, um ein Pseudo-Bild vorherzusagen, das ein farbiges Gaußsches pro jedem Pixel enthält. Durch die Verwendung der Gaussian-Splatting-Methode kann die Splatter-Image-Architektur schnelles Rendering mit schneller Inferenz kombinieren, was zu schnellem Training und schnellerer Auswertung auf realen und synthetischen Benchmarks führt.












