Andersons Blickwinkel

Neuronales Rendering: Wie niedrig kann man in Bezug auf die Eingabe gehen?

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Gestern hat eine außergewÃķhnliche neue Arbeit im Bereich der neuronalen Bildsynthese die Aufmerksamkeit und die Vorstellungskraft des Internets auf sich gezogen, als Intel -Forscher eine neue Methode zur Verbesserung der Realistik von synthetischen Bildern vorstellten.

Das System, wie es in einem Video von Intel demonstriert wird, greift direkt in die Bildpipeline des Videospiels Grand Theft Auto V ein und verbessert die Bilder durch einen Bildsynthese-Algorithmus, der auf einem konvolutionellen neuronalen Netzwerk (CNN) trainiert wurde, unter Verwendung von realen Bildern aus dem Mapillary-Dataset, und ersetzt die weniger realistische Beleuchtung und Texturierung des GTA-Spiel-Engines.

Kommentatoren in verschiedenen Communities wie Reddit und Hacker News ÃĪußern sich nicht nur darÞber, dass neuronales Rendering dieser Art die weniger fotorealistischen Ausgaben traditioneller Spiel-Engines und VFX-Ebenen CGI ersetzen kÃķnnte, sondern auch, dass dieser Prozess mit viel grundlegenderer Eingabe als im Intel-GTA5-Demo demonstriert wurde, durchgefÞhrt werden kÃķnnte – effektiv “Puppen”-Proxy-Eingaben mit extrem realistischen Ausgaben zu erstellen.

Paarierte DatensÃĪtze

Das Prinzip wurde von einer neuen Generation von GAN- und Encoder/Decoder-Systemen in den letzten drei Jahren exemplifiziert, wie z.B. NVIDIA’s GauGAN, das fotorealistische Landschaftsbilder aus groben Skizzen erzeugt.

Effektiv dreht sich dieses Prinzip die konventionelle Verwendung von semantischer Segmentierung in Computer-Vision von einer passiven Methode, die es maschinellen Systemen ermÃķglicht, beobachtete Objekte zu identifizieren und zu isolieren, in eine kreative Eingabe, bei der der Benutzer eine falsche semantische Segmentierungskarte “malt” und das System Bilder erzeugt, die konsistent mit den Beziehungen sind, die es aus der Klassifizierung und Segmentierung eines bestimmten Bereichs wie Landschaften versteht.

Ein maschinelles Lernframework wendet semantische Segmentierung auf verschiedene Außenszenen an, wodurch die architektonische Paradigma ermÃķglicht wird, interaktive Systeme zu entwickeln, bei denen der Benutzer eine semantische Segmentierungskarte

Ein maschinelles Lernframework wendet semantische Segmentierung auf verschiedene Außenszenen an, wodurch die architektonische Paradigma ermÃķglicht wird, interaktive Systeme zu entwickeln, bei denen der Benutzer eine semantische Segmentierungskarte “malt” und das System die Karte mit geeigneten Bildern aus einem bereichsspezifischen Dataset wie dem Mapillary-Street-View-Set, das in Intels GTA5-Neural-Rendering-Demo verwendet wird, fÞllt. Quelle: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Paarierte Datensatz-Bildsynthese-Systeme funktionieren, indem sie semantische Labels auf zwei DatensÃĪtzen korrelieren: einem reichen und vollstÃĪndigen Bildsatz, der entweder aus realen Bildern (wie dem Mapillary-Set, das zur Verbesserung von GTA5 in Intels Demo verwendet wird) oder aus synthetischen Bildern wie CGI-Bildern generiert wird.

Paarierte Datensatz-Beispiele fÞr ein Bildsynthese-System, das darauf ausgelegt ist, neuronale gerenderte Charaktere aus ungeschickten Skizzen zu erstellen. Links, Beispiele aus dem CGI-Datensatz. Mitte, entsprechende Beispiele aus dem

Paarierte Datensatz-Beispiele fÞr ein Bildsynthese-System, das darauf ausgelegt ist, neuronale gerenderte Charaktere aus ungeschickten Skizzen zu erstellen. Quelle: https://www.youtube.com/watch?v=miLIwQ7yPkA

Außenumgebungen sind relativ unkompliziert, wenn man paarierte Datensatz-Transformationen dieser Art erstellt, da VorsprÞnge normalerweise sehr begrenzt sind, die Topographie einen begrenzten Variationsbereich hat, der umfassend in einem Datensatz erfasst werden kann, und man nicht mit der Erstellung kÞnstlicher Menschen oder der BewÃĪltigung des Uncanny Valley konfrontiert ist.

Umkehrung von Segmentierungskarten

Google hat eine animierte Version des GauGAN-Schemas entwickelt, genannt Infinite Nature, die in der Lage ist, kontinuierliche und nie endende fiktive Landschaften zu “halluzinieren”, indem sie falsche semantische Karten in fotorealistische Bilder durch NVIDIA’s SPADE-Infill-System Þbersetzt:

Quelle: https://www.youtube.com/watch?v=oXUf6anNAtc

Quelle: https://www.youtube.com/watch?v=oXUf6anNAtc

Unlimited Nature verwendet jedoch ein einzelnes Bild als Ausgangspunkt und verwendet SPADE nur, um die fehlenden Abschnitte in aufeinanderfolgenden Frames zu malen, wÃĪhrend SPADE selbst Bildtransforms direkt aus Segmentierungskarten erstellt.

Quelle: https://nvlabs.github.io/SPADE/

Quelle: https://nvlabs.github.io/SPADE/

Es ist diese FÃĪhigkeit, die die Bewunderer des Intel-Bildverbesserungssystems zu begeistern scheint – die MÃķglichkeit, sehr hochwertige fotorealistische Bilder, sogar in Echtzeit (schließlich), aus extrem grober Eingabe abzuleiten.

Ersetzen von Texturen und Beleuchtung durch neuronales Rendering

Im Fall der GTA5-Eingabe haben sich einige gefragt, ob die computeraufwÃĪndigen prozeduralen und Bitmap-Texturen und Beleuchtungen aus dem Spiel-Engine-Ausgang wirklich notwendig sind, oder ob es mÃķglich wÃĪre, low-resolution, wireframe-ebene Eingabe in fotorealistische Video zu transformieren, die die Schattierung-, Textur- und BeleuchtungsfÃĪhigkeiten von Spiel-Engines Þbertrifft, und hyperrealistische Szenen aus “Platzhalter”-Proxy-Eingabe zu erstellen.

Es mag offensichtlich erscheinen, dass spielgenerierte Aspekte wie Reflexionen, Texturen und andere Arten von Umgebungsdetails wesentliche Informationsquellen fÞr ein neuronales Rendering-System der von Intel demonstrierten Art sind. Doch es ist bereits einige Jahre her, seit NVIDIA’s UNIT (UNsupervised Image-to-image Translation Networks) demonstrierte, dass nur der Bereich wichtig ist und dass sogar umfassende Aspekte wie “Nacht oder Tag” im Wesentlichen Fragen sind, die durch Stil-Transfer behandelt werden:

In Bezug auf die erforderliche Eingabe kÃķnnte dies das Spiel-Engine-System nur noch dazu zwingen, Basis-Geometrie und Physik-Simulationen zu generieren, da das neuronale Rendering-System alle anderen Aspekte durch die Synthese der gewÞnschten Bilder aus dem erfassten Datensatz, unter Verwendung von semantischen Karten als Interpretationsschicht, Þbermalen kann.

Intels System verbessert ein vollstÃĪndig fertiggestelltes und gerendertes Bild von GTA5, indem es Segmentierung und ausgewertete Tiefenmaps hinzufÞgt - zwei Aspekte, die potenziell direkt von einem heruntergestuftem Spiel-Engine-System bereitgestellt werden kÃķnnten. Quelle: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intels System verbessert ein vollstÃĪndig fertiggestelltes und gerendertes Bild von GTA5, indem es Segmentierung und ausgewertete Tiefenmaps hinzufÞgt – zwei Aspekte, die potenziell direkt von einem heruntergestuftem Spiel-Engine-System bereitgestellt werden kÃķnnten. Quelle: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intels neuronales Rendering-Ansatz beinhaltet die Analyse von vollstÃĪndig gerenderten Bildern aus den GTA5-Puffern, und das neuronale System hat die zusÃĪtzliche Last, sowohl die Tiefenmaps als auch die Segmentierungskarten zu erstellen. Da Tiefenmaps implizit in traditionellen 3D-Pipelines verfÞgbar sind (und weniger anspruchsvoll zu generieren sind als Textur, Ray-Tracing oder globale Beleuchtung), kÃķnnte es eine bessere Verwendung von Ressourcen sein, die Tiefenmaps vom Spiel-Engine-System generieren zu lassen.

Heruntergestuftes Eingabe-Format fÞr ein neuronales Rendering-System

Die aktuelle Implementierung des Intel-Bildverbesserungsnetzwerks beinhaltet mÃķglicherweise viele redundante Rechenzyklen, da das Spiel-Engine-System computeraufwÃĪndige Textur- und Beleuchtungseffekte erzeugt, die das neuronale Rendering-System nicht wirklich benÃķtigt. Das System wurde offensichtlich auf diese Weise entworfen, nicht weil dies notwendigerweise ein optimaler Ansatz ist, sondern weil es einfacher ist, ein neuronales Rendering-System an eine bestehende Pipeline anzupassen, als einen neuen Spiel-Engine zu erstellen, der auf ein neuronales Rendering-System ausgerichtet ist.

Die wirtschaftlichste Verwendung von Ressourcen in einem Spiel-System dieser Art kÃķnnte die vollstÃĪndige Übernahme der GPU durch das neuronale Rendering-System sein, wobei die heruntergestufte Proxy-Eingabe vom CPU gehandhabt wird.

DarÞber hinaus kÃķnnte das Spiel-Engine-System leicht reprÃĪsentative Segmentierungskarten selbst erstellen, indem es alle Schattierung und Beleuchtung in seiner Ausgabe deaktiviert. ZusÃĪtzlich kÃķnnte es Video in einer viel niedrigeren AuflÃķsung als normalerweise erforderlich liefern, da das Video nur reprÃĪsentativ fÞr den Inhalt sein mÞsste, wobei die hochauflÃķsenden Details vom neuronalen Motor gehandhabt werden, wodurch lokale Rechenressourcen weiter freigegeben werden.

Intel ISLs vorherige Arbeit mit Segmentierung > Bild

Die direkte Übersetzung von Segmentierung in fotorealistische Video ist weit von hypothetisch entfernt. Im Jahr 2017 verÃķffentlichte Intel ISL, der SchÃķpfer von gestern, erste Forschung, die in der Lage war, urbane Video-Synthese direkt aus semantischer Segmentierung durchzufÞhren.

Intel ISL - Segmentierung in Bild

Intel ISLs Arbeit zur Segmentierung in Bild aus dem Jahr 2017. Quelle: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

Im Wesentlichen wurde diese ursprÞngliche Pipeline von 2017 lediglich erweitert, um die vollstÃĪndig gerenderte Ausgabe von GTA5 zu passen.

Neuronales Rendering in VFX

Neuronales Rendering aus kÞnstlichen Segmentierungskarten scheint auch eine vielversprechende Technologie fÞr VFX zu sein, mit der MÃķglichkeit, sehr grundlegende Videogramme direkt in fertige visuelle Effekt-Footage zu Þbersetzen, indem man bereichsspezifische DatensÃĪtze aus Modellen oder synthetischen (CGI-) Bildern generiert.

Ein hypothetisches neuronales Rendering-System, bei dem umfassende Abdeckung jedes Zielobjekts in einen Beitragendatensatz abstrahiert wird und bei dem kÞnstlich generierte Segmentierungskarten als Grundlage fÞr vollstÃĪndig fotorealistische Ausgabe verwendet werden. Quelle: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Ein hypothetisches neuronales Rendering-System, bei dem umfassende Abdeckung jedes Zielobjekts in einen Beitragendatensatz abstrahiert wird und bei dem kÞnstlich generierte Segmentierungskarten als Grundlage fÞr vollstÃĪndig fotorealistische Ausgabe verwendet werden. Quelle: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Die Entwicklung und der Einsatz solcher Systeme wÞrden den Schwerpunkt der kÞnstlerischen Anstrengung von einer interpretativen zu einer reprÃĪsentativen Arbeitsweise verlagern und die domÃĪnengetriebene Datenerfassung von einer unterstÞtzenden zu einer zentralen Rolle in den visuellen KÞnsten erhÃķhen.

Artikel aktualisiert um 16:55 Uhr, um Material Þber Intel ISL-Forschung aus dem Jahr 2017 hinzuzufÞgen.

Schriftsteller Þber maschinelles Lernen, DomÃĪnen-Spezialist in der menschlichen Bildsynthese. Ehemaliger Leiter des Forschungsinhalts bei Metaphysic.ai, bis zu dessen AuflÃķsung in DNEG's Brahma.ai.
Portfolio-Seite: martinanderson.ai
Kontakt: [email protected]