Angle d’Anderson

Le rendu neuronal : jusqu’où peut-on descendre en termes d’entrée ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Hier, un nouveau travail extraordinaire en synthèse d’images neuronales a attiré l’attention et l’imagination d’internet, car les chercheurs d’Intel ont révélé une nouvelle méthode pour améliorer le réalisme des images synthétiques.

Le système, tel que démontré dans une vidéo d’Intel, intervient directement dans le pipeline d’image pour le jeu vidéo Grand Theft Auto V et améliore automatiquement les images à travers un algorithme de synthèse d’images formé sur un réseau neuronal convolutif (CNN), en utilisant des images du monde réel de la base de données Mapillary et en remplaçant l’éclairage et la texture moins réalistes du moteur de jeu GTA par un rendu neuronal.

Les commentateurs, dans une large gamme de réactions dans des communautés telles que Reddit et Hacker News, posent non seulement que le rendu neuronal de ce type pourrait remplacer efficacement la sortie moins photoréaliste des moteurs de jeu traditionnels et du CGI de niveau VFX, mais que ce processus pourrait être réalisé avec une entrée beaucoup plus basique que celle démontrée dans la démo Intel GTA5 — créant ainsi des entrées de proxy « puppet » avec des sorties réaliste massivement réalistes.

Ensembles de données appariés

Le principe a été exemplifié par une nouvelle génération de systèmes GAN et d’encodeurs/décodeurs au cours des trois dernières années, tels que GauGAN de NVIDIA, qui génère des images scéniques photoréalistes à partir de daubs grossiers.

En effet, ce principe inverse l’utilisation conventionnelle de la segmentation sémantique dans la vision par ordinateur d’une méthode passive qui permet aux systèmes de machine d’identifier et d’isoler les objets observés en une entrée créative, où l’utilisateur « peint » une fausse carte de segmentation sémantique et le système génère des images cohérentes avec les relations qu’il comprend en ayant déjà classifié et segmenté un domaine particulier, tel que des paysages.

Un cadre d'apprentissage automatique applique une segmentation sémantique à diverses scènes extérieures, fournissant le paradigme architectural qui permet le développement de systèmes interactifs, où l'utilisateur peint un bloc de segmentation sémantique et le système remplit le bloc avec des images appropriées à partir d'un ensemble de données spécifique au domaine, tel que l'ensemble de vues de rue Mapillary en Allemagne, utilisé dans la démo de rendu neuronal Intel GTA5. Source: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Un cadre d’apprentissage automatique applique une segmentation sémantique à diverses scènes extérieures, fournissant le paradigme architectural qui permet le développement de systèmes interactifs, où l’utilisateur peint un bloc de segmentation sémantique et le système remplit le bloc avec des images appropriées à partir d’un ensemble de données spécifique au domaine, tel que l’ensemble de vues de rue Mapillary en Allemagne, utilisé dans la démo de rendu neuronal Intel GTA5. Source: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Les systèmes de synthèse d’images à ensembles de données appariés fonctionnent en corrélant les étiquettes sémantiques sur deux ensembles de données: un ensemble d’images riche et complet, soit généré à partir d’images du monde réel (comme l’ensemble Mapillary utilisé pour améliorer GTA5 dans la démo Intel d’hier), soit à partir d’images synthétiques, telles que des images CGI.

Exemples d'ensembles de données appariés pour un système de synthèse d'images conçu pour créer des personnages rendus neuronalement à partir d'esquisses maladroites. À gauche, des échantillons de l'ensemble de données CGI. Au milieu, des échantillons correspondants de l'ensemble de données « esquisse ». À droite, des rendus neuronaux qui ont traduit les esquisses en images de haute qualité. Source: https://www.youtube.com/watch?v=miLIwQ7yPkA

Exemples d’ensembles de données appariés pour un système de synthèse d’images conçu pour créer des personnages rendus neuronalement à partir d’esquisses maladroites. À gauche, des échantillons de l’ensemble de données CGI. Au milieu, des échantillons correspondants de l’ensemble de données « esquisse ». À droite, des rendus neuronaux qui ont traduit les esquisses en images de haute qualité. Source: https://www.youtube.com/watch?v=miLIwQ7yPkA

Les environnements extérieurs sont relativement peu difficiles lors de la création de transformations d’ensembles de données appariés de ce type, car les saillies sont généralement assez limitées, la topographie a une plage de variance limitée qui peut être capturée de manière exhaustive dans un ensemble de données, et nous n’avons pas à créer des personnes artificielles ou à négocier la vallée de l’incertitude (encore).

Inverser les cartes de segmentation

Google a développé une version animée du schéma GauGAN, appelée Infinite Nature, capable de « halluciner » délibérément des paysages fictifs continus et infinis en traduisant des cartes de segmentation sémantique fausses en images photoréalistes via le système d’infill SPADE de NVIDIA:

Source: https://www.youtube.com/watch?v=oXUf6anNAtc

Source: https://www.youtube.com/watch?v=oXUf6anNAtc

Cependant, Infinite Nature utilise une image unique comme point de départ et utilise SPADE uniquement pour peindre les sections manquantes dans les cadres successifs, alors que SPADE lui-même crée des transformations d’images directement à partir de cartes de segmentation.

Source: https://nvlabs.github.io/SPADE/

Source: https://nvlabs.github.io/SPADE/

C’est cette capacité qui semble avoir ému les admirateurs du système d’amélioration d’image Intel – la possibilité de dériver des images photoréalistes de très haute qualité, même en temps réel (éventuellement), à partir d’une entrée extrêmement grossière.

Remplacer les textures et l’éclairage par le rendu neuronal

Dans le cas de l’entrée GTA5, certains se demandent si l’une des textures et de l’éclairage procédurales et bitmap coûteuses en termes de calcul du moteur de jeu est vraiment nécessaire dans les systèmes de rendu neuronal futurs, ou si il pourrait être possible de transformer une entrée de niveau fil de fer en une vidéo photoréaliste qui surpasse les capacités d’ombrage, de texture et d’éclairage des moteurs de jeu, créant ainsi des scènes hyper-réalistes à partir d’une entrée de proxy « placeholder ».

Il pourrait sembler évident que les facettes générées par le jeu telles que les reflets, les textures et d’autres types de détails environnementaux sont des sources d’information essentielles pour un système de rendu neuronal du type démontré par Intel. Pourtant, il y a quelques années, le système UNIT (UNsupervised Image-to-image Translation Networks) de NVIDIA a démontré que seul le domaine est important, et que même des aspects tels que « nuit ou jour » sont essentiellement des questions à traiter par le transfert de style:

En termes d’entrée requise, cela laisse potentiellement le moteur de jeu ne nécessitant de générer que la géométrie de base et les simulations de physique, puisque le moteur de rendu neuronal peut repeindre tous les autres aspects en synthétisant l’image désirée à partir de l’ensemble de données capturé, en utilisant les cartes sémantiques comme couche d’interprétation.

Le système Intel améliore un cadre entièrement terminé et rendu de GTA5, en ajoutant la segmentation et les cartes de profondeur évaluées — deux facettes qui pourraient potentiellement être fournies directement par un moteur de jeu simplifié. Source: https://www.youtube.com/watch?v=P1IcaBn3ej0

Le système Intel améliore un cadre entièrement terminé et rendu de GTA5, en ajoutant la segmentation et les cartes de profondeur évaluées — deux facettes qui pourraient potentiellement être fournies directement par un moteur de jeu simplifié. Source: https://www.youtube.com/watch?v=P1IcaBn3ej0

L’approche de rendu neuronal d’Intel implique l’analyse de cadres entièrement rendus à partir des tampons GTA5, et le système neuronal a la charge supplémentaire de créer à la fois les cartes de profondeur et les cartes de segmentation. Puisque les cartes de profondeur sont implicitement disponibles dans les pipelines 3D traditionnels (et sont moins exigeantes à générer que la texture, le ray-tracing ou l’éclairage global), il pourrait être plus judicieux d’utiliser les ressources pour laisser le moteur de jeu les gérer.

Entrée simplifiée pour un moteur de rendu neuronal

La mise en œuvre actuelle du réseau d’amélioration d’image Intel peut donc impliquer un grand nombre de cycles de calcul redondants, car le moteur de jeu génère des textures et des éclairages coûteux en termes de calcul que le moteur de rendu neuronal n’a pas vraiment besoin. Le système semble avoir été conçu de cette manière non pas parce que c’est nécessairement une approche optimale, mais parce qu’il est plus facile d’adapter un moteur de rendu neuronal à un pipeline existant qu’à créer un nouveau moteur de jeu optimisé pour une approche de rendu neuronal.

L’utilisation la plus économique des ressources dans un système de jeu de ce type pourrait être la prise en charge complète de la GPU par le système de rendu neuronal, avec l’entrée de proxy simplifiée gérée par le CPU.

De plus, le moteur de jeu pourrait facilement produire des cartes de segmentation représentatives lui-même, en désactivant tout ombrage et éclairage dans sa sortie. De plus, il pourrait fournir une vidéo à une résolution beaucoup plus basse que celle qui est normalement requise, puisque la vidéo n’aurait besoin d’être que largement représentative du contenu, avec des détails de haute résolution gérés par le moteur neuronal, libérant ainsi les ressources de calcul locales.

Travail antérieur d’Intel ISL sur la segmentation > image

La traduction directe de la segmentation en vidéo photoréaliste est loin d’être hypothétique. En 2017, Intel ISL, créateurs de l’effervescence d’hier, ont publié des recherches capables de réaliser une synthèse de vidéo urbaine directement à partir de la segmentation sémantique.

Intel ISL - segmentation en image

Travail d’Intel ISL sur la segmentation en image de 2017. Source: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

En effet, ce pipeline initial de 2017 n’a été que prolongé pour s’adapter à la sortie entièrement rendue de GTA5.

Rendu neuronal dans les effets visuels

Le rendu neuronal à partir de cartes de segmentation artificielles semble également être une technologie prometteuse pour les effets visuels, avec la possibilité de traduire directement des vidéogrammes très basiques en images de finis visuelles, en générant des ensembles de données spécifiques au domaine à partir de modèles ou d’images synthétiques (CGI).

Un système de rendu neuronal hypothétique, où une couverture exhaustive de chaque objet cible est abstraite en un ensemble de données contributif, et où des cartes de segmentation artificielles sont utilisées comme base pour une sortie photoréaliste à résolution complète. Source: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Un système de rendu neuronal hypothétique, où une couverture exhaustive de chaque objet cible est abstraite en un ensemble de données contributif, et où des cartes de segmentation artificielles sont utilisées comme base pour une sortie photoréaliste à résolution complète. Source: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Le développement et l’adoption de tels systèmes déplaceraient le centre d’effort artistique d’un flux de travail interprétatif vers un flux de travail représentatif, et élèveraient la collecte de données dirigée par le domaine d’un rôle de soutien à un rôle central dans les arts visuels.

Article mis à jour à 16h55 pour ajouter des informations sur les recherches d’Intel ISL en 2017.

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]