Η γωνία του Anderson

Νευρωνική Απόδοση: Το NeRF Κάνει μια Βόλτα στον Φρέσκο Αέρα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια συνεργασία μεταξύ του Google Research και του Πανεπιστημίου Harvard ανέπτυξε μια νέα μέθοδο για τη δημιουργία 360‑μοίρου νευρωνικού βίντεο πλήρων σκηνών χρησιμοποιώντας Neural Radiance Fields (NeRF). Η καινοτόμος προσέγγιση φέρνει το NeRF ένα βήμα πιο κοντά στη χαλαρή αφηρημένη χρήση σε οποιοδήποτε περιβάλλον, χωρίς να περιορίζεται σε μοντέλα επιτραπέζιου τύπου ή κλειστές εσωτερικές σκηνές.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Δείτε το τέλος του άρθρου για το πλήρες βίντεο. Πηγή: https://www.youtube.com/watch?v=zBSH-k9GbV4

Το Mip-NeRF 360 μπορεί να διαχειριστεί εκτεταμένα παρασκήνια και «άπειρα» αντικείμενα όπως ο ουρανός, επειδή, σε αντίθεση με τις περισσότερες προηγούμενες εκδοχές, θέτει όρια στον τρόπο ερμηνείας των ακτίνων φωτός και δημιουργεί όρια προσοχής που εξηγούν τις διαφορετικά μεγάλες χρονικές διάρκειες εκπαίδευσης. Δείτε το νέο συνοδευτικό βίντεο ενσωματωμένο στο τέλος του άρθρου για περισσότερα παραδείγματα και μια εκτενή ματιά στη διαδικασία.

Το νέο άρθρο έχει τίτλο Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields και είναι υπό την ηγεσία του Senior Staff Research Scientist στο Google Research, Jon Barron.

Για να κατανοήσουμε την πρόοδο, είναι απαραίτητη μια βασική κατανόηση του τρόπου λειτουργίας της σύνθεσης εικόνας βάσει νευρωνικών πεδίων ακτινοβολίας.

Τι είναι το NeRF;

Είναι προβληματικό να περιγράψουμε ένα δίκτυο NeRF με την έννοια «βίντεο», καθώς είναι πιο κοντά σε ένα πλήρως τρισδιάστατο, αλλά AI‑βασισμένο, εικονικό περιβάλλον, όπου πολλαπλά σημεία θέασης από μεμονωμένες φωτογραφίες (συμπεριλαμβανομένων πλαισίων βίντεο) χρησιμοποιούνται για να συνθέσουν μια σκηνή που τεχνικά υπάρχει μόνο στο λανθάνων χώρο ενός αλγορίθμου μηχανικής μάθησης – αλλά από την οποία μπορούν να εξαχθούν εξαιρετικά πολλά σημεία θέασης και βίντεο κατά βούληση.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Μια απεικόνιση των πολλαπλών σημείων λήψης κάμερας που παρέχουν τα δεδομένα που το NeRF συναρμολογεί σε μια νευρωνική σκηνή (δεξιά εικόνα).

Οι πληροφορίες που προέρχονται από τις συμβάλλουσες φωτογραφίες εκπαιδεύονται σε έναν πίνακα παρόμοιο με το παραδοσιακό voxel grid σε ροές CGI, με την έννοια ότι κάθε σημείο στον τρισδιάστατο χώρο καταλήγει με μια τιμή, καθιστώντας τη σκηνή πλοηγήσιμη.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Ένας παραδοσιακός πίνακας voxel τοποθετεί πληροφορίες pixel (που συνήθως υπάρχουν σε 2Δ πλαίσιο, όπως το πλέγμα pixel ενός αρχείου JPEG) σε τρισδιάστατο χώρο. Πηγή: ResearchGate

Αφού υπολογιστεί ο ενδιάμεσος χώρος μεταξύ των φωτογραφιών (εφόσον χρειάζεται), η διαδρομή κάθε πιθανής pixel κάθε συμβάλλουσας φωτογραφίας ουσιαστικά «ακτινοβολείται» και της αποδίδεται μια τιμή χρώματος, συμπεριλαμβανομένης μιας τιμής διαφάνειας (χωρίς την οποία ο νευρωνικός πίνακας θα ήταν εντελώς αδιαφανής ή εντελώς κενός).

Όπως τα voxel grids, και αντίθετα με το 3Δ χώρο συντεταγμένων CGI, το «εσωτερικό» ενός «κλειστού» αντικειμένου δεν υπάρχει σε έναν πίνακα NeRF. Μπορείτε να ανοίξετε ένα CGI drum kit και να κοιτάξετε μέσα, αν θέλετε· αλλά, όσον αφορά το NeRF, η ύπαρξη του drum kit λήγει όταν η τιμή αδιαφάνειας της επιφάνειάς του ισούται με «1».

Μια Πιο Ευρεία Άποψη ενός Pixel

Το Mip-NeRF 360 είναι μια επέκταση της έρευνας από Μάρτιο 2021, η οποία εισήγαγε αποτελεσματικά αποδοτικό anti‑aliasing στο NeRF χωρίς εξαντλητικό supersampling.

Το NeRF παραδοσιακά υπολογίζει μόνο μία διαδρομή pixel, η οποία τείνει να παράγει το είδος των κοτσαρισμάτων που χαρακτήριζαν τις πρώιμες μορφές εικόνας στο διαδίκτυο, καθώς και τα προηγούμενα συστήματα παιχνιδιών. Αυτά τα κοτσαρίσματα λύθηκαν με διάφορες μεθόδους, συνήθως περιλαμβάνοντας δειγματοληψία γειτονικών pixels και εύρεση μιας μέσης αναπαράστασης.

Επειδή το παραδοσιακό NeRF δειγματοληπτεί μόνο αυτή τη μία διαδρομή pixel, το Mip‑NeRF εισήγαγε μια «κωνική» περιοχή σύλληψης, σαν ένα ευρύ‑δίκτυο φακού, που παρέχει αρκετές πληροφορίες για τα γειτονικά pixels ώστε να παράγει οικονομικό anti‑aliasing με βελτιωμένη λεπτομέρεια.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Η κωνική περιοχή σύλληψης που χρησιμοποιεί το Mip‑NeRF χωρίζεται σε κωνικά τμήματα (παρακάτω), τα οποία «θολώνουν» περαιτέρω για να δημιουργήσουν ασαφή γκαουσιανή περιοχή που μπορεί να χρησιμοποιηθεί για τον υπολογισμό της ακρίβειας και του aliasing ενός pixel. Πηγή: https://www.youtube.com/watch?v=EpH175PY1A0

Η βελτίωση σε σχέση με μια τυπική υλοποίηση NeRF ήταν αξιοσημείωτη:

Mip-NeRF (right), released in Μάρτιος 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Το Mip‑NeRF (δεξιά), που κυκλοφόρησε τον Μάρτιο 2021, προσφέρει βελτιωμένη λεπτομέρεια μέσω μιας πιο ολοκληρωμένης αλλά οικονομικής αλυσίδας aliasing, αντί απλώς του «θολώματος» των pixels για την αποφυγή κοτσαρισμένων άκρων. Πηγή: https://jonbarron.info/mipnerf/

NeRF χωρίς Όρια

Το άρθρο του Μαρτίου άφησε τρία προβλήματα άλυτα σχετικά με τη χρήση του Mip‑NeRF σε αχανείς περιβάλλοντες που μπορεί να περιλαμβάνουν πολύ απομακρυσμένα αντικείμενα, όπως ουρανούς. Το νέο άρθρο λύνει αυτό εφαρμόζοντας μια πρόσληψη τύπου Kalman στα Gaussian του Mip‑NeRF.

Δεύτερον, μεγαλύτερες σκηνές απαιτούν μεγαλύτερη υπολογιστική ισχύ και παρατεταμένες χρονικές διάρκειες εκπαίδευσης, κάτι που το Mip‑NeRF 360 λύνει «αποσυμπυκνώνοντας» τη γεωμετρία της σκηνής με ένα μικρό «πρόταση» πολυεπίπεδο αντιληπτικό δίκτυο (MLP), το οποίο προ‑οριοθετεί τη γεωμετρία που προβλέπει ένα μεγάλο τυπικό MLP NeRF. Αυτό επιταχύνει την εκπαίδευση τριπλά.

Τέλος, μεγαλύτερες σκηνές τείνουν να κάνουν τη διακριτοποίηση της ερμηνευόμενης γεωμετρίας ασαφή, με αποτέλεσμα τα είδη των τεχνουργημάτων που οι παίκτες μπορεί να έχουν δει όταν η έξοδος του παιχνιδιού «σπάει». Το νέο άρθρο αντιμετωπίζει αυτό δημιουργώντας έναν νέο κανονικοποιητή για τα διαστήματα ακτίνων του Mip‑NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Στα δεξιά, βλέπουμε ανεπιθύμητα τεχνουργήματα στο Mip‑NeRF λόγω της δυσκολίας περιορισμού μιας τόσο μεγάλης σκηνής. Στα αριστερά, βλέπουμε ότι ο νέος κανονικοποιητής έχει βελτιστοποιήσει τη σκηνή επαρκώς ώστε να αφαιρέσει αυτές τις διαταραχές.

Για να μάθετε περισσότερα σχετικά με το νέο άρθρο, δείτε το βίντεο παρακάτω, καθώς και την εισαγωγική βίντεο του Μαρτίου 2021 για το Mip‑NeRF. Μπορείτε επίσης να ενημερωθείτε περαιτέρω για την έρευνα NeRF εξετάζοντας την κάλυψή μας μέχρι τώρα.

Αρχικά δημοσιεύτηκε 25 Νοεμβρίου 2021
21 Δεκεμβρίου 2021, 12:25 μ.μ. – Αντικαταστάθηκε το νεκρό βίντεο. – MA

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai