Η γωνία του Anderson

ST-NeRF: Συνθέσεις και Επεξεργασία για Συνολική σύνθεση βίντεο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
ST-NeRF

Ένα κινεζικό ερευνητικό συνδικάτο έχει αναπτύξει τεχνικές για να φέρει ικανότητες επεξεργασίας και σύνθεσης σε einen από τους πιο καυτούς τομείς έρευνας σύνθεσης εικόνων του τελευταίου έτους – Νευρωνικά Πεδία Ραδιότητας (NeRF). Το σύστημα ονομάζεται ST-NeRF (Χωροχρονικά Συνεχή Νευρωνικό Πεδίο Ραδιότητας).

Αυτό που φαίνεται να είναι μια φυσική κίνηση κάμερας στην εικόνα παρακάτω είναι στην πραγματικότητα μόνο ένας χρήστης που “σερφάρει” μέσα από οπτικές γωνίες σε βίντεο που υπάρχει σε einen 4-διάστατο χώρο. Η οπτική γωνία δεν είναι κλειδωμένη στην απόδοση των ατόμων που απεικονίζονται στο βίντεο, των οποίων οι κινήσεις μπορούν να θεωρηθούν από οποιοδήποτε μέρος eines 180-βαθμού ακτίνας.

ST-NeRF

Κάθε πτυχή μέσα στο βίντεο είναι ένας διακριτά αποτυπωμένος παράγοντας, συνθεμένος μαζί σε einen συνεκτικό σκηνικό που μπορεί να εξερευνηθεί δυναμικά.

Οι πτυχές μπορούν να αναπαραχθούν ελεύθερα μέσα στο σκηνικό, ή να αναδιασταθούν:

ST-NeRF

Επιπλέον, η χρονική συμπεριφορά κάθε πτυχής μπορεί να τροποποιηθεί εύκολα, να επιβραδύνεται, να τρέχει ανάποδα, ή να χειρίζεται με οποιοδήποτε άλλο τρόπο, ανοίγοντας τον δρόμο για αρχιτεκτονικές φίλτρων και έναν εξαιρετικά υψηλό βαθμό ερμηνείας.

Δύο ξεχωριστές πτυχές NeRF τρέχουν σε διαφορετικές ταχύτητες στο ίδιο σκηνικό. Πηγή: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Δύο ξεχωριστές πτυχές NeRF τρέχουν σε διαφορετικές ταχύτητες στο ίδιο σκηνικό. Πηγή: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Δεν υπάρχει ανάγκη να γίνει rotoscoping των εκτελεστών ή των περιβαλλόντων, ή να έχουν οι εκτελεστές να εκτελούν τις κινήσεις τους τυφλά και εκτός του πλαισίου της προτεινόμενης σκηνής. Αντίθετα, η λήψη γίνεται φυσικά μέσω eines πλέγματος 16 βίντεο καμερών που καλύπτουν 180 μοίρες:

16 κάμερες ST-NeRF

Τα τρία στοιχεία που απεικονίζονται παραπάνω, τα δύο άτομα και το περιβάλλον, είναι ξεχωριστά και περιγραμμένα μόνο για εικονογραφικούς σκοπούς. Κάθε ένα μπορεί να αντικατασταθεί, και κάθε ένα μπορεί να εισαχθεί στη σκηνή σε ένα προηγούμενο ή μεταγενέστερο σημείο της ατομικής χρονολογίας λήψης.

Τα τρία στοιχεία που απεικονίζονται παραπάνω, τα δύο άτομα και το περιβάλλον, είναι ξεχωριστά και περιγραμμένα μόνο για εικονογραφικούς σκοπούς. Κάθε ένα μπορεί να αντικατασταθεί, και κάθε ένα μπορεί να εισαχθεί στη σκηνή σε ένα προηγούμενο ή μεταγενέστερο σημείο της ατομικής χρονολογίας λήψης.

ST-NeRF είναι μια καινοτομία στην έρευνα των Νευρωνικών Πεδίων Ραδιότητας (NeRF), ενός πλαισίου μηχανικής μάθησης με το οποίο πολλές οπτικές γωνίες συνθέτουν einen ναυτιλιακό εικονικό χώρο μέσω εκτεταμένης εκπαίδευσης (αν και η λήψη από μια οπτική γωνία είναι επίσης ένας υποτομέας της έρευνας NeRF).

Τα Νευρωνικά Πεδία Ραδιότητας λειτουργούν συλλέγοντας πολλές οπτικές γωνίες σε einen συνεκτικό και ναυτιλιακό 3-διάστατο χώρο, με τα κενά μεταξύ της κάλυψης να εκτιμώνται και να αποδίδονται από einen νευρωνικό δικτύο. Όπου χρησιμοποιείται βίντεο (αντί για στατικές εικόνες), οι πόρους απόδοσης που απαιτούνται είναι συχνά σημαντικοί. Πηγή: https://www.matthewtancik.com/nerf

Τα Νευρωνικά Πεδία Ραδιότητας λειτουργούν συλλέγοντας πολλές οπτικές γωνίες σε einen συνεκτικό και ναυτιλιακό 3-διάστατο χώρο, με τα κενά μεταξύ της κάλυψης να εκτιμώνται και να αποδίδονται από einen νευρωνικό δικτύο. Όπου χρησιμοποιείται βίντεο (αντί για στατικές εικόνες), οι πόρους απόδοσης που απαιτούνται είναι συχνά σημαντικοί. Πηγή: https://www.matthewtancik.com/nerf

Το ενδιαφέρον για τα NeRF έχει γίνει έντονο τους τελευταίους εννέα μήνες, και ένας κατάλογος που διατηρείται από το Reddit λίστα από παραγόμενα ή εξερευνητικά έγγραφα NeRF目前 liệt kê εξήντα έργα.

 

Μόνο quelques από τα πολλά παραγόμενα του αρχικού εγγράφου NeRF. Πηγή: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Μόνο quelques από τα πολλά παραγόμενα του αρχικού εγγράφου NeRF. Πηγή: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Ευκατάστατη Εκπαίδευση

Το έγγραφο είναι μια συνεργασία μεταξύ ερευνητών στο Πανεπιστήμιο Shanghai Tech και DGene Digital Technology, και έχει γίνει δεκτό με κάποια ενθουσιασμό στο Open Review.

ST-NeRF προσφέρει μια σειρά καινοτομιών πάνω στις προηγούμενες πρωτοβουλίες στις ML-παράγουσες ναυτιλιακές βίντεο χώρους. Όχι τουλάχιστον, επιτυγχάνει ένα υψηλό επίπεδο ρεαλισμού με μόνο 16 κάμερες. Αν και το DyNeRF της Facebook χρησιμοποιεί μόνο δύο κάμερες περισσότερες από αυτό, προσφέρει ένα πολύ πιο περιορισμένο ναυτιλιακό τόξο.

Ένα παράδειγμα του περιβάλλοντος DyNeRF της Facebook, με ένα πιο περιορισμένο πεδίο κίνησης, και περισσότερες κάμερες ανά τετραγωνικό πόδι που απαιτούνται για την ανακατασκευή της σκηνής. Πηγή: https://neural-3d-video.github.io

Ένα παράδειγμα του περιβάλλοντος DyNeRF της Facebook, με ένα πιο περιορισμένο πεδίο κίνησης, και περισσότερες κάμερες ανά τετραγωνικό πόδι που απαιτούνται για την ανακατασκευή της σκηνής. Πηγή: https://neural-3d-video.github.io

Εκτός από το γεγονός ότι δεν έχει την ικανότητα να επεξεργαστεί και να συνθέσει jednotlivé πτυχές, το DyNeRF είναι ιδιαίτερα ακριβό σε όρους υπολογιστικών πόρων. Αντίθετα, οι κινεζικοί ερευνητές δηλώνουν ότι το κόστος εκπαίδευσης για τα δεδομένα τους είναι κάπου μεταξύ $900-$3,000, σε σύγκριση με τα $30,000 για το state-of-the-art μοντέλο γεννήτριας βίντεο DVDGAN, και εντατικές συστήματα όπως το DyNeRF.

Οι κριτές έχουν επίσης σημειώσει ότι το ST-NeRF κάνει μια σημαντική καινοτομία στην αποσύνδεση της διαδικασίας της μάθησης της κίνησης από τη διαδικασία της σύνθεσης εικόνας. Αυτή η αποσύνδεση είναι ότι επιτρέπει την επεξεργασία και τη σύνθεση, με τις προηγούμενες προσεγγίσεις περιοριστικές και γραμμικές σε σύγκριση.

Αν και 16 κάμερες είναι ένα πολύ περιορισμένο πλέγμα για ένα τέτοιο πλήρες ημικύκλιο προβολής, οι ερευνητές ελπίζουν να μειώσουν αυτόν τον αριθμό περαιτέρω σε μελλοντική εργασία μέσω της χρήσης proxy προ-σκαναρισμένων στατικών υποβάθρων, και περισσότερων δεδομένων-κίνητων προσεγγίσεων μοντελοποίησης σκηνής. Ελπίζουν επίσης να ενσωματώσουν ικανότητες επανα-φωτισμού, μια πρόσφατη καινοτομία στην έρευνα NeRF.

Αντιμετώπιση των Περιορισμών του ST-NeRF

Στο πλαίσιο των ακαδημαϊκών εγγράφων CS που έχουν την τάση να απορρίπτουν την πραγματική χρησιμότητα ενός νέου συστήματος σε ένα ρίπιο τελικό παράγραφο, ακόμη και οι περιορισμοί που οι ερευνητές αναγνωρίζουν για το ST-NeRF είναι ασυνήθιστοι.

Παρατηρούν ότι το σύστημα δεν μπορεί目前 να ξεχωρίσει και να αποδώσει ξεχωριστά αντικείμενα σε μια σκηνή, επειδή τα άτομα στο βίντεο διαχωρίζονται σε ξεχωριστά οντότητα μέσω eines συστήματος που σχεδιάστηκε για να αναγνωρίζει ανθρώπους και όχι αντικείμενα – ένα πρόβλημα που φαίνεται να λύνεται εύκολα με YOLO και παρόμοια πλαισιά.

Αν και οι ερευνητές σημειώνουν ότι δεν είναι δυνατόν να παραχθεί αργή κίνηση, φαίνεται ότι δεν υπάρχει τίποτα που να εμποδίζει την εφαρμογή αυτής της καινοτομίας χρησιμοποιώντας υπάρχουσες καινοτομίες στην interpolation πλαισίων όπως DAIN και RIFE.

Όπως και με όλες τις εφαρμογές NeRF, και σε πολλά άλλα τομείς της έρευνας υπολογιστικής όρασης, το ST-NeRF μπορεί να αποτύχει σε περιπτώσεις σοβαρής οκλουζίας, όπου το αντικείμενο είναι προσωρινά αποκρυμμένο από ένα άλλο άτομο ή αντικείμενο, και μπορεί να είναι δύσκολο να συνεχιστεί η παρακολούθηση ή να ανακτηθεί ακριβώς μετά. Όπως και αλλού, αυτή η δυσκολία μπορεί να πρέπει να περιμένει λύσεις από उचώτερα επίπεδα. Εν τω μεταξύ, οι ερευνητές παραδέχονται ότι χρειάζεται χειροκίνητη επέμβαση σε αυτές τις οκλουζίες.

Τέλος, οι ερευνητές παρατηρούν ότι οι διαδικασίες ανθρώπινης διαχωρίσεως που χρησιμοποιούνται目前 βασίζονται σε διαφορές χρωμάτων, οι οποίες θα μπορούσαν να οδηγήσουν σε ακούσιας συλλογής δύο ατόμων σε ένα μπλοκ διαχωρισμού – ένα εμπόδιο που δεν είναι περιορισμένο στο ST-NeRF, αλλά είναι εγγενές στη βιβλιοθήκη που χρησιμοποιείται, και το οποίο θα μπορούσε να λυθεί με την ανάλυση οπτικού ροής και άλλες αναδυόμενες τεχνικές.

Πρώτη δημοσίευση 7ης Μαΐου 2021.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai