Η γωνία του Anderson

Προς τον Πραγματικό Χρόνο Ανθρώπων του AI με Rendering Neural Lumigraph

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Neural Lumigraph Rendering

Παρά την τρέχουσα έξαρση ενδιαφέροντος για τα Νευρωνικά Πεδία Ραδιότητας (NeRF), μια τεχνολογία που μπορεί να δημιουργήσει περιβάλλοντα και αντικείμενα 3D που παράγονται από το AI, αυτή η νέα προσέγγιση της τεχνολογίας σύνθεσης εικόνας vẫn απαιτεί πολύ χρόνο εκπαίδευσης και δεν έχει μια εφαρμογή που να επιτρέπει διεπαφές σε πραγματικό χρόνο και υψηλής απόκρισης.

Ωστόσο, μια συνεργασία μεταξύ ονομάτων που εντυπωσιάζουν στην βιομηχανία και την ακαδημία προσφέρει μια νέα ματιά σε αυτή την πρόκληση (γενικά γνωστή ως Νέα Προοπτική Σύνθεση, ή NVS).

Η έρευνα άρθρο, με τίτλο Neural Lumigraph Rendering, ισχυρίζεται ότι υπάρχει μια βελτίωση της κατάστασης της τέχνης περίπου δύο τάξεις μεγέθους, που αντιπροσωπεύει αρκετά βήματα προς την απόδοση CG σε πραγματικό χρόνο μέσω των πιπελίνων της μηχανικής μάθησης.

Neural Lumigraph Rendering (right) προσφέρει καλύτερη ανάλυση των αρτηριακών αρτηριών και βελτιωμένη αντιμετώπιση της οκλουζίας σε σχέση με τις προηγούμενες μεθόδους. Source: https://www.youtube.com/watch?v=maVF-7x9644

Neural Lumigraph Rendering (right) προσφέρει καλύτερη ανάλυση των αρτηριακών αρτηριών και βελτιωμένη αντιμετώπιση της οκλουζίας σε σχέση με τις προηγούμενες μεθόδους. Source.

Хотя τα πιστωτικά για το έγγραφο αναφέρουν μόνο το Πανεπιστήμιο του Στάνφορντ και την εταιρεία τεχνολογίας ολογραφικών εμφανίσεων Raxium (η οποία λειτουργεί σήμερα σε κρυφό τρόπο), οι συντελεστές περιλαμβάνουν έναν αρχιτέκτονα μηχανικής μάθησης στο Google, έναν επιστήμονα υπολογιστών στην Adobe και τον Διευθύνοντα Σύμβουλο της StoryFile (η οποία έκανε τα πρωτοσέλιδα πρόσφατα με μια εκδοχή του AI του William Shatner).

Σχετικά με την πρόσφατη δημοσιότητα του Shatner, η StoryFile φαίνεται να χρησιμοποιεί την NLR στη νέα της διαδικασία για τη δημιουργία διαδραστικών οντοτήτων που παράγονται από το AI με βάση τα χαρακτηριστικά και τις αφηγήσεις των ατόμων.

Η StoryFile οραματίζεται τη χρήση αυτής της τεχνολογίας σε εκθέσεις μουσείων, διαδραστικές αφηγήσεις στο διαδίκτυο, ολογραφικές εμφανίσεις, επαυξημένη πραγματικότητα (AR) και τεκμηρίωση κληρονομιάς – και φαίνεται επίσης να εξετάζει πιθανές νέες εφαρμογές της NLR σε συνεντεύξεις πρόσληψης και εφαρμογές εικονικών ραντεβού:

Προτεινόμενες χρήσεις από ένα διαδικτυακό βίντεο της StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Προτεινόμενες χρήσεις από ένα διαδικτυακό βίντεο της StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Τρισδιάστατη Καταγραφή για Νέα Προοπτική Σύνθεση Διεπαφών και Βίντεο

Η αρχή της τρισδιάστατης καταγραφής, σε όλο το εύρος των εγγράφων που συσσωρεύονται στο θέμα, είναι η ιδέα της λήψης στατικών εικόνων ή βίντεο ενός αντικειμένου και της χρήσης της μηχανικής μάθησης για να «γεμίσουμε» τις απόψεις που δεν καλύπτονται από την αρχική σειρά των καμερών.

Πηγή: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Πηγή: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Στην εικόνα παραπάνω, που έχει ληφθεί από την έρευνα του Facebook για το AI το 2019 (βλέπε παρακάτω), βλέπουμε τα τέσσερα στάδια της τρισδιάστατης καταγραφής: πολλές κάμερες λαμβάνουν εικόνες/βίντεο. η αρχιτεκτονική encoder/decoder (ή άλλες αρχιτεκτονικές) υπολογίζει και συνδυάζει τη σχετικότητα των απόψεων. αλγόριθμοι ray-marching υπολογίζουν τα voxels (ή άλλα μονάδες χωρικής γεωμετρίας XYZ) κάθε σημείου στο τρισδιάστατο χώρο. και (σε πιο πρόσφατα έγγραφα) η εκπαίδευση πραγματοποιείται για τη σύνθεση ενός πλήρους οντότητας που μπορεί να χειριστεί σε πραγματικό χρόνο.

Είναι αυτή η συχνά εκτεταμένη και δεδομένα-βαρέα φάση εκπαίδευσης που, μέχρι σήμερα, έχει κρατήσει τη νέα προοπτική σύνθεση έξω από το πεδίο του πραγματικού χρόνου ή της υψηλής απόκρισης.

Το γεγονός ότι η Νέα Προοπτική Σύνθεση δημιουργεί ένα πλήρες 3D χάρτη ενός τρισδιάστατου χώρου σημαίνει ότι είναι σχετικά εύκολο να συνδέσει αυτά τα σημεία μαζί σε ένα παραδοσιακό υπολογιστικό πλέγμα, αποτελεσματικά κατεβάζοντας και артикуλιруя ένα CGI άνθρωπο (ή οποιοδήποτε άλλο σχετικά οριοθετημένο αντικείμενο) στην πτήση.

Οι προσεγγίσεις που χρησιμοποιούν NeRF βασίζονται σε σημειακές νεφελές και χάρτες βάθους για να παράγουν τις διασυνδέσεις μεταξύ των σπάνιων σημείων-θεάσεων των συσκευών καταγραφής:

Το NeRF μπορεί να παράγει τρισδιάστατο βάθος μέσω του υπολογισμού των χαρτών βάθους, αντί του υπολογισμού των CG πλεγμάτων. Πηγή: https://www.youtube.com/watch?v=JuH79E8rdKc

Το NeRF μπορεί να παράγει τρισδιάστατο βάθος μέσω του υπολογισμού των χαρτών βάθους, αντί του υπολογισμού των CG πλεγμάτων. Πηγή: https://www.youtube.com/watch?v=JuH79E8rdKc

Αν και το NeRF είναι ικανό να υπολογίζει πλέγματα, οι περισσότερες εφαρμογές δεν χρησιμοποιούν αυτό για να παράγουν τρισδιάστατα σκηνικά.

Αντίθετα, η προσεγγίση του Implicit Differentiable Renderer (IDR), που δημοσιεύθηκε από το Ινστιτούτο Επιστημών Weizmann τον Οκτώβριο του 2020, βασίζεται στην εκμετάλλευση των πληροφοριών 3D πλέγματος που παράγονται αυτόματα από τις σειρές καταγραφής:

Παραδείγματα IDR που μετατρέπονται σε διαδραστικά CGI πλέγματα. Πηγή: https://www.youtube.com/watch?v=C55y7RhJ1fE

Παραδείγματα IDR που μετατρέπονται σε διαδραστικά CGI πλέγματα. Πηγή: https://www.youtube.com/watch?v=C55y7RhJ1fE

Ενώ το NeRF δεν έχει την ικανότητα του IDR για εκτίμηση σχήματος, το IDR δεν μπορεί να ταιριάξει την ποιότητα εικόνας του NeRF, και και τα δύο απαιτούν εκτεταμένα πόρους για εκπαίδευση και συλλογή (αν και πρόσφατες καινοτομίες στο NeRF ξεκινάνε να αντιμετωπίσουν αυτό).

Η NLR χρησιμοποιεί μια ειδική κάμερα με 16 GoPro HERO7 και 6 κεντρικές κάμερες Back-Bone H7PRO. Για την απόδοση σε πραγματικό χρόνο, αυτές λειτουργούν με ελάχιστη ταχύτητα 60fps. Πηγή: https://arxiv.org/pdf/2103.11571.pdf

Η NLR χρησιμοποιεί μια ειδική κάμερα με 16 GoPro HERO7 και 6 κεντρικές κάμερες Back-Bone H7PRO. Για την απόδοση σε πραγματικό χρόνο, αυτές λειτουργούν με ελάχιστη ταχύτητα 60fps. Πηγή: https://arxiv.org/pdf/2103.11571.pdf

Αντίθετα, η Neural Lumigraph Rendering χρησιμοποιεί SIREN (Δίκτυα Παράστασης Σινουσιδικών) για να ενσωματώσει τα πλεονεκτήματα κάθε προσεγγίσεως στην δική της πλαισιοποίηση, η οποία έχει ως στόχο να παράγει εξόδους που είναι άμεσα χρησιμές στις υφιστάμενες γραμμικές γραφικές πιπελίνες.

Το SIREN έχει χρησιμοποιηθεί για παρόμοιες εφαρμογές κατά το τελευταίο έτος, και τώρα αντιπροσωπεύει μια πопуляр API κλήση για hobbyist Colabs στις κοινότητες σύνθεσης εικόνας. ωστόσο, η καινοτομία της NLR είναι να εφαρμόσει SIRENs σε δισδιάστατη πολλαπλή εποπτική εποπτεία, η οποία είναι προβληματική λόγω του βαθμού στον οποίο το SIREN παράγει υπερ-προσαρμοσμένα αντί για γενικευμένα εξόδους.

Μετά την εξαγωγή του CGI πλέγματος από τις εικόνες της σειράς, το πλέγμα rasterize μέσω του OpenGL, και οι θέσεις των κορυφών του πλέγματος αντιστοιχούν στα αντίστοιχα pixels, μετά από αυτό η συγχώνευση των verschiedenen συνεισφερόντων χαρτών υπολογίζεται.

Το αποτελεσματικό πλέγμα είναι πιο γενικευμένο και αντιπροσωπευτικό από το NeRF (βλέπε εικόνα παρακάτω), απαιτεί λιγότερο υπολογισμό, και δεν εφαρμόζει υπερβολική λεπτομέρεια σε περιοχές (όπως λείες προσώπων) που δεν μπορούν να επωφεληθούν από αυτό:

Πηγή: https://arxiv.org/pdf/2103.11571.pdf

Πηγή: https://arxiv.org/pdf/2103.11571.pdf

Στην αρνητική πλευρά, η NLR δεν έχει ακόμη την ικανότητα για δυναμική φωτισμό ή relighting, και η έξοδος περιορίζεται σε χάρτες σκιών και άλλες σκέψεις φωτισμού που λαμβάνονται κατά την время της καταγραφής. Οι ερευνητές σκοπεύουν να αντιμετωπίσουν αυτό σε μελλοντική εργασία.

Επιπλέον, το έγγραφο παραδέχεται ότι τα σχήματα που παράγονται από την NLR δεν είναι τόσο ακριβή όσο κάποιες εναλλακτικές προσεγγίσεις, όπως Pixelwise View Selection for Unstructured Multi-View Stereo, ή η έρευνα του Ινστιτούτου Weizmann που αναφέρθηκε νωρίτερα.

Η Άνοδος της Τρισδιάστατης Σύνθεσης Εικόνας

Η ιδέα της δημιουργίας 3D οντοτήτων από μια περιορισμένη σειρά φωτογραφιών με νευρωνικά δίκτυα προηγήθηκε του NeRF, με οραματικές εργασίες που χρονολογούνται από το 2007 ή νωρίτερα. Το 2019, το τμήμα έρευνας του Facebook για το AI παρήγαγε μια σεμιναλική έρευνα, Νευρωνικά Όγκοι: Μάθηση Δυναμικών Renderable Όγκων από Εικόνες, η οποία πρώτα επέτρεψε τη δημιουργία αντιδραστικών διεπαφών για συνθετικά ανθρώπους που παράγονται από την τρισδιάστατη καταγραφή με βάση τη μηχανική μάθηση.

Η έρευνα του Facebook για το AI το 2019 επέτρεψε τη δημιουργία μιας αντιδραστικής διεπαφής για ένα τρισδιάστατο άνθρωπο. Πηγή: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Η έρευνα του Facebook για το AI το 2019 επέτρεψε τη δημιουργία μιας αντιδραστικής διεπαφής για ένα τρισδιάστατο άνθρωπο. Πηγή: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai