Η γωνία του Anderson

Το NeRF Κάνει Άλλο Ένα Βήμα Πιο Κοντά στο Να Αντικαταστήσει το CGI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές στο MIT και στο Google έχουν κάνει ένα μεγάλο βήμα στην επίλυση ενός από τα πιο θεμελιώδη εμπόδια για μια αναδυόμενη τεχνολογία που οδηγείται από το AI, η οποία μπορεί τελικά να αντικαταστήσει το CGI – το να χωρίσει τις εικόνες του νευρωνικού πεδίου ακτινοβολίας (NeRF) σε leurs συνιστώσες οπτικές συνιστώσες, ώστε οι εικόνες να μπορούν να ξανα-υποβαλλθούν σε κείμενο και φωτισμό.

Η νέα προσέγγιση, που ονομάζεται NeRFactor, χωρίζει αποτελεσματικά τις εικόνες που έχουν συλληφθεί σε αντικειμενικά κανονικά (στα οποία μπορούν να ανατεθούν κείμενα), ορατότητα φωτός, αλμπέδο (το ποσοστό του περιστατικού φωτός που αντανακλάται μακριά από μια επιφάνεια) και διπλής ανακλαστικής διανομής (BRDFs).

Με αυτές τις πτυχές απομονωμένες, είναι δυνατό όχι μόνο να ανταλλάξουν κείμενα για μεμονωμένα αντικείμενα ή ομάδες αντικειμένων, αλλά επίσης να προσθέσουν νέες και μοναδικές πηγές φωτός και υλοποιήσεις σκιών, αγνοώντας αυτές που συλλέγονται από τις πολλαπλές κάμερες που παράγουν είσοδο για εικόνες NeRF.

Νορμάλ, ορατότητα, αλμπέδο και BRDF分离 υπό NeRFactor. Πηγή: https://www.youtube.com/watch?v=UUVSPJlwhPg

Νορμάλ, ορατότητα, αλμπέδο και BRDF分离 υπό NeRFactor. Πηγή: https://www.youtube.com/watch?v=UUVSPJlwhPg

Το μοντέλο υποστηρίζει μαλακές ή σκληρές σκιές από αυθαίρετες, οριζόμενες από τον χρήστη πηγές φωτός και χωρίζει τις τέσσερις πτυχές των συλληφθέντων βίντεο προγραμματικά, χρησιμοποιώντας μια ανακατασκευαστική απώλεια, δεδομένα από προηγούμενες υπολογίσεις του BRDF και βασική απλή κανονικοποίηση λείων.

Η ροή εργασίας του NeRFactor, εξαγωγής ξεχωριστών ενεργών πτυχών των εικόνων που προέρχονται από πολλαπλές κάμερες. Πηγή: https://arxiv.org/pdf/2106.01970.pdf

Ο NeRFactor χρησιμοποιεί μια υψηλής δυναμικής εύρος φωτογραφική σonda, μια καλά καθιερωμένη προσέγγιση που έχει διαπεράσει την οπτική βιομηχανική και καλλιτεχνική σκηνή από την εισαγωγή της το 1998, για να αξιολογήσει δυνατές διαδρομές για ακτίνες, το οποίο επιτρέπει αυθαίρετο φωτισμό.既然 αυτό δημιουργεί ένα μη ελεγχόμενο αριθμό πιθανών παραμέτρων, η φωτογραφική σonda φιλτράρεται μέσω ενός multi-στιβαδίου perceptron (MLP), το οποίο χαρτογραφεί την αντερευνήμενη γεωμετρία στην σonda χωρίς να προσπαθήσει να υπολογίσει ένα πλήρες χάρτη φωτισμού για τον χώρο του μοντέλου.

Δύο νευρωνικά πεδία ακτινοβολίας μοντέλων χρησιμοποιούνται για να δείξουν πέντε μοντέλα φωτισμού που είναι δυνατά υπό NeRFactor. Κάντε κλικ στην εικόνα για υψηλότερη ανάλυση.

Αιτία Για Αναστοχασμό

Η νέα έρευνα είναι ίσως πιο σημαντική στο να χωρίσει τους.layers των συλληφθέντων εικόνων που ελέγχουν την αντανακλάση. Αυτό παραμένει ένα από τα μεγαλύτερα εμπόδια για τις εικόνες του νευρωνικού πεδίου ακτινοβολίας,既然 μια真正τικά καινούρια και ευέλικτη NeRF система θα χρειαζόταν όχι μόνο να αντικαταστήσει κείμενα, αλλά επίσης να αντανακλάσει κινητά αντικείμενα (εκτός από τα γενικά σταθερά περιβάλλοντα) που θα λογίζονταν σε μια ροή CGI.

Το ζήτημα αυτό σημειώθηκε πρόσφατα σε σχέση με την εντυπωσιακή νέα έρευνα της Intel για μετατροπή βίντεο παιχνιδιών σε φωτορεαλιστικά βίντεο μέσω συνελικτικών νευρωνικών δικτύων. Σε τέτοιες ροές εργασίας, πολλά “ψημένα” аспектς του πηγαίου υλικού θα χρειαζόταν να γίνουν διακριτά και ανταλλάξιμα, και αυτό είναι επιχειρήσιμο να λυθεί για την ανασύνθεση φωτισμού (ο οποίος είναι μια συνάρτηση της γεωμετρίας που αποδίδεται στο NeRF) παρά για τις αντανακλάσεις (οι οποίες χρησιμοποιούν “εξω-οθόνη” γεωμετρία που είναι完全 έξω από το πεδίο του μοντέλου).

Επομένως, η απομόνωση των στρωμάτων στις εικόνες NeRF που διευκολύνουν την αντανακλάση φέρνει το NeRF ένα βήμα πιο κοντά στο να λύσει την “προκλήση αντανακλάσεως”.

Η χρήση μιας υψηλής δυναμικής εύρος φωτογραφικής σonda ήδη λύνει το ζήτημα της δημιουργίας αντανακλάσεων του περιβάλλοντος κόσμου (δηλαδή ουρανού, τοπίων και άλλων “σταθερών” περιβαλλόντων παραγόντων), αλλά νέες προσεγγίσεις θα χρειαστούν για να εισαγάγουν κινητές και δυναμικές αντανακλάσεις.

Φωτογραμμετρία Με NeRF

Οι εικόνες του νευρωνικού πεδίου ακτινοβολίας χρησιμοποιούν ανάλυση μηχανικής μάθησης για να αναπτύξουν έναν完全 volumetric χώρο από μια σκηνή ή αντικείμενο που έχει συλληφθεί από πολλές γωνίες.

Διάφορες NeRF-βασισμένες σχήματα που έχουν εμφανιστεί τον τελευταίο χρόνο έχουν χρησιμοποιήσει ένα διαφορετικό αριθμό συσκευών κάμερας που συμβάλλουν· ορισμένες χρησιμοποιούν 16 ή περισσότερες κάμερες, άλλες τόσο λίγες όσο μία ή δύο. Σε όλες τις περιπτώσεις, οι ενδιάμεσες απόψεις “γεμίζονται” (δηλαδή ερμηνεύονται) ώστε η σκηνή ή το αντικείμενο να μπορεί να ναυτιázei ρευστά.

Το αποτέλεσμα είναι ένας完全 volumetric χώρος, με μια εγγενή τρισδιάστατη κατανόηση που μπορεί να εκμεταλλευτεί πολλές τρόπους, συμπεριλαμβανομένης της ικανότητας να παράγει παραδοσιακά CGI πλέγματα από την 3D-παρσμένη σύνοψη των εισοδικών εικόνων.

NeRF Στο Πλαίσιο Μιας ‘Νέας CGI’

Οι εικόνες του νευρωνικού πεδίου ακτινοβολίας είναι σχεδιασμένες απευθείας από εικόνες του πραγματικού κόσμου, συμπεριλαμβανομένων κινούμενων εικόνων ανθρώπων, αντικειμένων και σκηνών. Σε αντίθεση, μια CGI μεθοδολογία “μελετά” και ερμηνεύει τον κόσμο, απαιτώντας εξειδικευμένους εργαζόμενους να χτίσουν πλέγματα, ρίγες και κείμενα που χρησιμοποιούν πραγματικές εικόνες (δηλαδή συλλήψεις προσώπου και περιβάλλοντος).

Επιπλέον, η CGI έχει είχε συνεχείς προβλήματα με την “ακαδημαϊκή κοιλάδα” επίδραση στις προσπάθειές της να αναπαράγει ανθρώπινες ομοιότητες, το οποίο δεν αποτελεί κανένα περιορισμό για μια NeRF-οδηγούμενη προσέγγιση, η οποία απλά συλλαμβάνει βίντεο ή εικόνες πραγματικών ανθρώπων και τις χειρίζεται.

Παραπέρα, το NeRF μπορεί να παράγει παραδοσιακά CGI-στυλ γεωμετρικά πλέγματα απευθείας από φωτογραφίες όταν χρειάζεται, και μπορεί να αντικαταστήσει πολλές από τις χειροκίνητες διαδικασίες που έχουν πάντα χρειαζόταν στην υπολογιστική γραφική απεικόνιση.

Προκλήσεις Για NeRF

Αυτή η τελευταία έρευνα από το MIT και το Google έρχεται στο πλαίσιο μιας πραγματικής πλημμύρας NeRF εγγράφων τον τελευταίο χρόνο, πολλά από τα οποία έχουν προσφέρει λύσεις στα διάφορα εμπόδια που έχουν ανακύψει από το αρχικό έγγραφο του 2020.

Τον Απρίλιο, μια καινοτομία από ένα κινεζικό ερευνητικό σύνδεσμο παρείχε έναν τρόπο να ξεχωρίσει διακριτά τις μεμονωμένες χρονολογίες των πτυχών σε μια NeRF σκηνή, συμπεριλαμβανομένων ανθρώπων.

ST-NeRF

Η κινεζική έρευνα επιτρέπει στους τελικούς χρήστες να ανταλλάξουν, να κολλήσουν και να μετεξελίξουν συλληφθείσες στοιχεία, αποσυνδέοντάς τα από τη γραμμική χρονολογική σειρά του αρχικού πηγαίου βίντεο. Πηγή: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Αυτή η προσέγγιση δεν μόνο επιτρέπει την ανασύνθεση της σκηνής από οποιαδήποτε γωνία που συλλαμβάνεται από την κάμερα array (και όχι μόνο από την ενιαία άποψη που αντιπροσωπεύεται σε một τυπική βίντεο συλλήψη), αλλά επίσης επιτρέπει την ευέλικτη σύνθεση – και ακόμη και την ικανότητα να αντιπροσωπεύει δύο πτυχές από το ίδιο βίντεο που τρέχουν στις δικές τους μεμονωμένες χρονολογικές σειρές (ή ακόμη και τρέχουν ανάποδα, όπως χρειάζεται).

Δύο ξεχωριστές NeRF πτυχές τρέχουν σε διαφορετικές ταχύτητες στην ίδια σκηνή. Πηγή: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Η κινεζική έρευνα επιτρέπει στους τελικούς χρήστες να ανταλλάξουν, να κολλήσουν και να μετεξελίξουν συλληφθείσες στοιχεία, αποσυνδέοντάς τα από τη γραμμική χρονολογική σειρά του αρχικού πηγαίου βίντεο. Πηγή: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Ένα από τα μεγαλύτερα εμπόδια για το NeRF είναι η μείωση των σημαντικών πόρων που χρειάζονται για την εκπαίδευση μιας σκηνής, και αυτό έχει αντιμετωπιστεί σε πολλά πρόσφατα έγγραφα. Για παράδειγμα, το Ινστιτούτο Max Planck για τα Ευφυή Συστήματα εισήγαγε πρόσφατα το KiloNeRF, το οποίο όχι μόνο επιταχύνει τους χρόνους απόδοσης κατά einen παράγοντα 1000, αλλά επίσης επιτρέπει στο NeRF να λειτουργεί διαδραστικά.

KiloNeRF τρέχει μια διαδραστική περιβάλλον σε 50fps σε ένα GTX 1080ti. Πηγή: https://github.com/creiser/kilonerf

KiloNeRF τρέχει μια διαδραστική περιβάλλον σε 50fps σε ένα GTX 1080ti. Πηγή: https://github.com/creiser/kilonerf

Ωστόσο, η καινοτομία του NeRF που πραγματικά κατέλαβε την φαντασία των ερευνητών και του κοινού το 2021 ήταν η PlenOctrees συνεργασία, η οποία οδηγείται από το UC Berkeley, και προσφέρει πραγματικό χρόνο απόδοση των Νευρωνικών Πεδίων Ακτινοβολίας:

Η επίδραση των διαδραστικών ικανοτήτων του PlenOctrees έχει αναπαραχθεί σε μια ζωντανή, διαδικτυακή διεπαφή.

Ζωντανή διαδραστική κίνηση ενός αντικειμένου PlenOctrees στο Firefox (η κίνηση είναι ομαλότερη και πιο δυναμική από αυτό το GIF).

Ζωντανή διαδραστική κίνηση ενός αντικειμένου PlenOctrees στο Firefox (η κίνηση είναι ομαλότερη και πιο δυναμική από αυτό το GIF). Πηγή: http://alexyu.net/plenoctrees/demo/

Επιπλέον, η Recursive-NeRF (από ένα έγγραφο του Μαΐου 2021 από ερευνητές στο Tsinghua University) προσφέρει υψηλής ποιότητας αναδρομική απόδοση κατόπιν ζήτησης. Αντί να υποχρεώνει τον χρήστη να αποδώσει ολόκληρες σκηνές, συμπεριλαμβανομένων μερών που μπορεί να μην είναι ορατά, η Recursive-NeRF προσφέρει κάτι που μοιάζει με τη συμπίεση JPEG, και μπορεί να παράγει διακριτά υπο-NeRFs για να χειριστεί επιπλέον εικόνες κατόπιν ζήτησης – επιτυγχάνοντας μια τεράστια εξοικονόμηση σε υπολογιστικούς πόρους.

Διατήρηση λεπτομερειών ενώ απορρίπτει ненужные υπολογισμούς απόδοσης με Recursive-NeRF. Πηγή: https://arxiv.org/pdf/2105.09103.pdf

Διατήρηση λεπτομερειών ενώ απορρίπτει ненужные υπολογισμούς απόδοσης με Recursive-NeRF. Κάντε κλικ στην εικόνα για υψηλότερη ανάλυση. Πηγή: https://arxiv.org/pdf/2105.09103.pdf

Άλλες προσεγγίσεις περιλαμβάνουν το FastNeRF, το οποίο ισχυρίζεται ότι επιτυγχάνει υψηλής πιστότητας νευρωνική απόδοση σε 200fps.

Έχει σημειωθεί ότι πολλές από τις βελτιώσεις του NeRF περιλαμβάνουν την “ψήσιμο” της σκηνής, με την υποχρέωση σε аспектς που επιθυμούνται να αποδοθούν και την απόρριψη άλλων πτυχών, το οποίο περιορίζει την εξερεύνηση αλλά επιταχύνει σημαντικά την διαδραστικότητα.

Το μειονέκτημα αυτού είναι ότι η πίεση μεταφέρεται από την GPU στη μνήμη, επειδή “ψημένα” σκηνικά απαιτούν ένα ακατέργαστο ποσό δισκοχωρητικότητας· μέχρι ένα σημείο, αυτό μπορεί να μετριαστεί με την υποδείγματος των “ψημένων” δεδομένων, αν και αυτό επίσης περιλαμβάνει μια ορισμένη υποχρέωση, σε όρους κλεισίματος των οδών εξερεύνησης ή διαδραστικότητας.

Σχετικά με την κίνηση και το ρίγκινγκ, μια νέα προσέγγιση από τα πανεπιστήμια Zheijang και Cornell, αποκαλύφθηκε τον Μάιο, πρόσφερε μια μέθοδο για να αναπαράγει ανθρώπους με blend weight πεδία και σκελετικές δομές που ερμηνεύονται από εισοδικά βίντεο:

Παραγόμενο σκελετικό πλαίσιο σε Animatable NeRF. Πηγή: https://www.youtube.com/watch?v=eWOSWbmfJo4

Παραγόμενο σκελετικό πλαίσιο σε Animatable NeRF. Πηγή: https://www.youtube.com/watch?v=eWOSWbmfJo4

Πότε Θα Έχει Το NeRF Τη ‘Jurassic Park’ Στιγμή;

Παρά την ταχεία πρόοδο με τη σύνθεση εικόνων μέσω νευρωνικών πεδίων ακτινοβολίας, είναι μόνο σε αυτή τη περίοδο που οποιοδήποτε είδος “νόμου της θερμοδυναμικής” θα καθοριστεί για το πώς μπορεί να αναπτυχθεί το NeRF. Σε όρους χρονολογικής γραμμής της ιστορίας της CGI, το NeRF βρίσκεται αυτή τη στιγμή στο 1973, λίγο πριν από την πρώτη χρήση της CGI στο Westworld.

Αυτό δεν σημαίνει ότι το NeRF θα χρειαστεί να περιμένει εννέα χρόνια για την αντίστοιχη εποχή Wrath Of Khan, ή δεκαετίες για τις αντίστοιχες επιτεύξεις που η CGI πέτυχε υπό την ενθουσιώδη προστασία του James Cameron στο The Abyss του 1989 ή στο Terminator 2 του 1991 – και στη συνέχεια, η πραγματικά επαναστατική момент έξαρσης στο Jurassic Park του 1993.

Η σκηνή της εικόνας έχει αλλάξει πολύ από την μακρά περίοδο της στασιμότητας για φωτοχημικές οπτικές εφέ, η οποία κυριάρχησε στην παραγωγή ταινιών και τηλεόρασης από τη γέννηση του κινηματογράφου μέχρι τις αρχές της δεκαετίας του 1990. Η έλευση της επανάστασης των προσωπικών υπολογιστών και η επιτάχυνση του νόμου του Moore οδήγησαν στην επανάσταση της CGI, η οποία θα μπορούσε να είχε συμβεί τόσο sớm όσο τη δεκαετία του 1960.

Παραμένει να δούμε εάν υπάρχει κάποιο εμπόδιο τόσο ακαταχώρητο που θα μπορούσε να κρατήσει την πρόοδο του NeRF για τόσο καιρό – και εάν οι μελλοντικές καινοτομίες στην υπολογιστική όραση δεν θα μπορούσαν να ξεπεράσουν εντελώς το NeRF ως τον βασικό διεκδικητή του στέμματος της CGI, χαρακτηρίζοντας τα νευρωνικά πεδία ακτινοβολίας ως το “φαξ μηχάνημα” της νευρωνικής σύνθεσης εικόνων.

Μέχρι τώρα, το NeRF δεν έχει χρησιμοποιηθεί σε κανένα контέκστ εκτός από την ακαδημαϊκή έρευνα· αλλά είναι αξιοσημείωτο ότι μεγάλοι παίκτες όπως η Google Research και πολλά από τα πιο εξέχοντα ερευνητικά εργαστήρια υπολογιστικής όρασης ανταγωνίζονται για την τελευταία καινοτομία του NeRF.

Πολλοί από τους μεγαλύτερους εμποδιστές του NeRF έχουν αρχίσει να αντιμετωπίζονται απευθείας φέτος· εάν η μελλοντική έρευνα προσφέρει μια λύση στο ζήτημα της “αντανακλάσεως” και οι πολλές πτυχές της ερευνητικής βελτίωσης του NeRF συνδυαστούν σε μια αποφασιστική λύση στις σημαντικές απαιτήσεις επεξεργασίας και/ή αποθήκευσης της τεχνολογίας, το NeRF πραγματικά έχει μια ευκαιρία να γίνει “η νέα CGI” μέσα στις επόμενες πέντε χρόνια.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai