Η γωνία του Anderson

Μετατροπή LiDAR σε Φωτο-Πραγματικά Εικόνες με ένα Γεννητικό Ανταγωνιστικό Δίκτυο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Νωρίτερα αυτή την εβδομάδα, βίντεο κυκλοφόρησε εκδόθηκε που δείχνει ένα σύστημα αυτόματου πιλότου Tesla να συντρίβεται直接 στο πλευρό ενός σταματημένου οχήματος σε μια αυτοκινητόδρομο τον Ιούνιο του 2021. Το γεγονός ότι το αυτοκίνητο ήταν σκούρο και δύσκολο να διακριθεί έχει προκαλέσει συζήτηση για τους περιορισμούς της εξάρτησης από την υπολογιστική όραση σε σενάρια αυτόνομης οδήγησης.

Βίντεο που κυκλοφόρησε τον Δεκέμβριο του 2021 δείχνει τη στιγμή της σύγκρουσης. Πηγή: https://twitter.com/greentheonly/status/1473307236952940548

Βίντεο που κυκλοφόρησε τον Δεκέμβριο του 2021 δείχνει τη στιγμή της σύγκρουσης. Πηγή: https://twitter.com/greentheonly/status/1473307236952940548

Αν και η συμπίεση βίντεο στο ευρέως-μοιραζόμενο βίντεο δίνει μια ελαφρώς υπερβολική εντύπωση για το πόσο γρήγορα το ακινητοποιημένο φορτηγό ‘έπιασε’ τον οδηγό σε αυτή την περίπτωση, ένα υψηλότερης ποιότητας βίντεο του ίδιου γεγονότος δείχνει ότι ένας πλήρως ενημερωμένος οδηγός θα είχε επίσης δυσκολευτεί να ανταποκριθεί με τίποτα άλλο παρά με μια καθυστερημένη στροφή ή ημι-αποτελεσματική φρένα.

Το βίντεο προσθέτει στην tranhάρα γύρω από την απόφαση της Tesla να αφαιρέσει αισθητήρες ραντάρ για το Autopilot, ανακοινωμένη τον Μάιο του 2021, και τη στάση της για την προτίμηση σε συστήματα που βασίζονται στην όραση над άλλες τεχνολογίες ηχο-τοποθέτησης, όπως το LiDAR.

Με σύμπτωση, μια νέα έρευνα από το Ισραήλ αυτή την εβδομάδα προσφέρει μια προσέγγιση για να συνδυάσει τις τομείς LiDAR και υπολογιστικής όρασης, μετατρέποντας LiDAR σημεία νεφών σε φωτο-πραγματικές εικόνες με τη χρήση ενός Γεννητικού Ανταγωνιστικού Δικτύου (GAN).

Στο νέο πρότζεκτ από το Ισραήλ, μαύρα αυτοκίνητα που αναγνωρίζονται σε LiDAR βίντεο μετατρέπονται σε 'ημερήσια' σκηνή για αναλύσεις που βασίζονται στην όραση, παρόμοια με την προσέγγιση που ακολουθεί η Tesla για την ανάπτυξη του συστήματος Autopilot. Πηγή: https://arxiv.org/pdf/2112.11245.pdf

Στο νέο πρότζεκτ από το Ισραήλ, μαύρα αυτοκίνητα που αναγνωρίζονται σε LiDAR βίντεο μετατρέπονται σε ‘ημερήσια’ σκηνή για αναλύσεις που βασίζονται στην όραση, παρόμοια με την προσέγγιση που ακολουθεί η Tesla για την ανάπτυξη του συστήματος Autopilot. Πηγή: https://arxiv.org/pdf/2112.11245.pdf

Οι συγγραφείς δηλώνουν:

‘Τα μοντέλα μας έμαθαν πώς να προβλέπουν πραγματικά εικόνες από απλά σημεία νεφών, ακόμη και εικόνες με μαύρα αυτοκίνητα.

‘Τα μαύρα αυτοκίνητα είναι δύσκολο να ανιχνευθούν直接 από σημεία νεφών λόγω του χαμηλού επιπέδου ανακλαστικότητας. Αυτή η προσέγγιση μπορεί να χρησιμοποιηθεί στο μέλλον για να thực hiện αναγνώριση αντικειμένων σε φωτο-πραγματικές εικόνες που παράγονται από LiDAR σημεία νεφών.’

Φωτο-Πραγματικά, LiDAR-Βάσει Ροές Εικόνων

Το νέο έγγραφο έχει τον τίτλο Γεννήτριες Φωτο-Πραγματικών Εικόνων από LiDAR Σημεία Νεφών με Γεννητικά Ανταγωνιστικά Δίκτυα, και προέρχεται από επτά ερευνητές σε τρεις ισραηλινές ακαδημαϊκές σχολές, μαζί με έξι ερευνητές από την Innoviz Technologies.

Οι ερευνητές έθεσαν ως στόχο να ανακαλύψουν αν η GAN-βασισμένη συνθετική εικόνα θα μπορούσε να παραχθεί σε κατάλληλο ρυθμό από τα σημεία νεφών που παράγονται από συστήματα LiDAR, ώστε η επόμενη ροή εικόνων να μπορεί να χρησιμοποιηθεί σε εργασίες αναγνώρισης αντικειμένων και σεμαντικής τομής.

Δεδομένα

Η κεντρική ιδέα, όπως και σε πολλά νέα [x]>[x] εικόνα transliteration projects, είναι να εκπαιδεύσετε einen αλγόριθμο σε ζευγαρωμένα δεδομένα, όπου LiDAR σημεία νεφών εικόνων (τα οποία βασίζονται σε συσκευές-εκπεμπόμενες φωτός) εκπαιδεύονται ενάντια σε một matching πλαίσιο από μια πρόσθια κάμερα.

Καθώς το βίντεο ήταν πάρθηκε κατά τη διάρκεια της ημέρας, όπου ένα σύστημα υπολογιστικής όρασης μπορεί να individuate ένα αλλιώς-ελusive all-μαύρο όχημα (όπως αυτό που η Tesla συντρίβηκε τον Ιούνιο), αυτή η εκπαίδευση θα πρέπει να παρέχει μια κεντρική αλήθεια που είναι πιο ανθεκτική σε σκοτεινές συνθήκες.

Τα δεδομένα συλλέχθηκαν με ένα αισθητήρα LiDAR InnovizOne, ο οποίος προσφέρει einen 10fps ή 15fps ρυθμό συλλογής, ανάλογα με το μοντέλο.

Δεδομένα LiDAR που συλλέχθηκαν με μια συσκευή Innoviz. Πηγή: https://www.youtube.com/watch?v=wmcaf_VpsQI

Δεδομένα LiDAR που συλλέχθηκαν με μια συσκευή Innoviz. Πηγή: https://www.youtube.com/watch?v=wmcaf_VpsQI

Το αποτέλεσμα του συνόλου δεδομένων περιείχε περίπου 30.000 εικόνες και 200.000 συλλεγμένα 3D σημεία. Οι ερευνητές διεξήγαγαν δύο πειράματα: ένα στο οποίο τα δεδομένα νεφών σημείων μεταφέρονταν μόνο πληροφορίες ανακλαστικότητας; και ένα δεύτερο, στο οποίο τα δεδομένα νεφών σημείων είχαν δύο κανάλια, ένα για ανακλαστικότητα και ένα για απόσταση.

Για το πρώτο πείραμα, η GAN εκπαιδεύτηκε για 50 εποχές, πέρα από τις οποίες η υπερ-προσαρμογή ήταν ένα ζήτημα.

GAN-δημιουργημένες εικόνες από το πρώτο πείραμα. Στα αριστερά, δεδομένα νεφών σημείων; στο κέντρο, πραγματικές καρέ από συλλεγμένο βίντεο, χρησιμοποιημένα ως αλήθεια; δεξιά, οι συνθετικές αναπαραστάσεις που δημιουργήθηκαν από το Γεννητικό Ανταγωνιστικό Δίκτυο.

GAN-δημιουργημένες εικόνες από το πρώτο πείραμα. Στα αριστερά, δεδομένα νεφών σημείων; στο κέντρο, πραγματικές καρέ από συλλεγμένο βίντεο, χρησιμοποιημένα ως αλήθεια; δεξιά, οι συνθετικές αναπαραστάσεις που δημιουργήθηκαν από το Γεννητικό Ανταγωνιστικό Δίκτυο.

Οι συγγραφείς σχολιάζουν:

‘Το σύνολο δοκιμής είναι μια πλήρως νέα ηχογράφηση που τα GANs δεν έχουν δει ποτέ πριν από τη δοκιμή. Αυτό προβλέφθηκε χρησιμοποιώντας μόνο πληροφορίες ανακλαστικότητας από τα δεδομένα νεφών σημείων.

‘Επιλέξαμε να δείξουμε καρέ με μαύρα αυτοκίνητα γιατί τα μαύρα αυτοκίνητα είναι συνήθως δύσκολο να ανιχνευθούν από LiDAR. Μπορούμε να δούμε ότι ο γεννήτωρ έμαθε να γεννήσει μαύρα αυτοκίνητα, πιθανώς από контекстικές πληροφορίες, λόγω του γεγονότος ότι τα χρώματα και οι ακριβείς μορφές αντικειμένων στις προβλεπόμενες εικόνες δεν είναι идентичны με τις πραγματικές εικόνες.’

Για το δεύτερο πείραμα, οι συγγραφείς εκπαίδευσαν την GAN για 40 εποχές με batch size 1, με αποτέλεσμα μια παρόμοια παρουσίαση ‘παραστατικών’ μαύρων αυτοκινήτων που λήφθηκαν κυρίως από контекστικές πληροφορίες. Αυτή η διαμόρφωση χρησιμοποιήθηκε επίσης για να γεννήσει ένα βίντεο που δείχνει τις GAN-γεννημένες εικόνες (εικονιζόμενο πάνω, στην εικόνα παρακάτω) μαζί με τις αληθινές εικόνες.

Αξιολόγηση

Η συνήθης διαδικασία αξιολόγησης και σύγκρισης με υπάρχουσες κρατάει-της-τέχνης δεν ήταν δυνατή με αυτό το πρότζεκτ, λόγω της μοναδικής φύσης του. Αντίθετα, οι ερευνητές σχεδίασαν einen προσαρμοσμένο μετρητή σχετικά με το βαθμό στον οποίο τα αυτοκίνητα (λεπτά και εφήμερα μέρη του πηγαίου βίντεο) αντιπροσωπεύονται στις εξοδοτικές εικόνες.

Επιλέξανε 100 ζευγάρια LiDAR/Γεννημένων εικόνων από κάθε σύνολο και διέλυσαν τον αριθμό των εικόνων αυτοκινήτων που παρουσιάζονται στο πηγαίο βίντεο με τον αριθμό που παρουσιάζεται στις συνθετικές δεδομένα που παράγονται, παράγοντας einen μετρητή κλίμακας από 0 έως 1.

Οι συγγραφείς δηλώνουν:

‘Το σκορ και στα δύο πειράματα ήταν μεταξύ 0,7 και 0,8. Λαμβάνοντας υπόψη το γεγονός ότι η γενική ποιότητα των προβλεπόμενων εικόνων είναι χαμηλότερη από τις αληθινές εικόνες (είναι πιο δύσκολο γενικά να ανιχνεύσετε αντικείμενα σε χαμηλότερης ποιότητας εικόνες), αυτό το σκορ δείχνει ότι η πλειοψηφία των αυτοκινήτων που παρουσιάζονται στο πηγαίο βίντεο παρουσιάζονται στις προβλεπόμενες εικόνες.’

Οι ερευνητές κατέληξαν στο συμπέρασμα ότι η ανίχνευση μαύρων οχημάτων, η οποία είναι ένα πρόβλημα και για τα συστήματα που βασίζονται στην όραση και για το LiDAR, μπορεί να γίνει αντιληπτή αναγνωρίζοντας eine έλλειψη δεδομένων για τμήματα της εικόνας:

‘Το γεγονός ότι στις προβλεπόμενες εικόνες, χρωματικές πληροφορίες και ακριβείς μορφές αντικειμένων δεν είναι идентичны με τις αληθινές εικόνες, υποδηλώνει ότι η πρόβλεψη μαύρων αυτοκινήτων είναι κυρίως παραγμένη από контекστικές πληροφορίες και όχι από την ανακλαστικότητα των LiDAR σημείων.

‘Συστήνουμε ότι, εκτός από το συμβατικό σύστημα LiDAR, ένα δεύτερο σύστημα που γεννά φωτο-πραγματικές εικόνες από LiDAR σημεία νεφών θα τρέχει παράλληλα για αναγνώριση αντικειμένων σε πραγματικό χρόνο.’

Οι ερευνητές σκοπεύουν να αναπτύξουν το έργο στο μέλλον, με μεγαλύτερα σύνολα δεδομένων.

Καθυστέρηση, και το Πλήρες Στάδιο Επεξεργασίας SDV

Ένας σχολιαστής στο πολύ-μοιραζόμενο ανέβασμα του Twitter της σύγκρουσης του Autopilot εκτίμησε ότι, ταξιδεύοντας με περίπου 75mph (110 πόδια το δευτερόλεπτο), μια βίντεο ροή που λειτουργεί σε 20fps θα καλύπτει μόνο 5,5 πόδια ανά καρέ. Ωστόσο, αν το όχημα ήταν να τρέξει την τελευταία апаратного και λογισμικού της Tesla, ο ρυθμός καρέ θα ήταν 36fps (για την κύρια κάμερα), ο οποίος θέτει τον ρυθμό αξιολόγησης στο 110 πόδια το δευτερόλεπτο (τρία πόδια ανά καρέ).

Εκτός από το κόστος και την εргονομία, το πρόβλημα με τη χρήση του LiDAR ως συμπληρωματικής ροής δεδομένων είναι το τεράστιο μέγεθος της πληροφοριακής ‘αποφράξεως’ της εισόδου δεδομένων στο στάδιο επεξεργασίας SDV. Σε συνδυασμό με τη κρίσιμη φύση της εργασίας, αυτό φαίνεται να έχει εξαναγκάσει το ραντάρ και το LiDAR έξω από το στάδιο Autopilot υπέρ μεθόδων αξιολόγησης που βασίζονται στην εικόνα.

Έτσι, φαίνεται απίθανο ότι ένα σύστημα που χρησιμοποιεί LiDAR – το οποίο από μόνο του θα πρόσθετε σε einen processing μποττλνεκ στο Autopilot – για να infer φωτο-πραγματικές εικόνες είναι εφικτό από την πλευρά της Tesla.

Ο ιδρυτής της Tesla, Elon Musk, δεν είναι ένας απλός κριτικός του LiDAR, το οποίο υπογραμμίζει ότι χρησιμοποιείται από την SpaceX για διαδικασίες докαρίσματος, αλλά θεωρεί ότι η τεχνολογία είναι ‘άχρηστη’ για αυτοκίνητα χωρίς οδηγό. Ο Musk προτείνει ότι ένας διεισδυτικός μηχανισμός, όπως η ~4mm ακρίβεια ραντάρ, θα ήταν πιο χρήσιμος.

Ωστόσο, από τον Ιούνιο του 2021, τα οχήματα της Tesla δεν είναι εξοπλισμένα με ραντάρ. Δεν υπάρχουν πολλά πρότζεκτ που σχεδιάζονται για να γεννήσουν ροές εικόνων από ραντάρ με τον ίδιο τρόπο όπως το τρέχον ισραηλινό πρότζεκτ (αν και το Υπουργείο Ενέργειας των ΗΠΑ χορήγησε μια προσπάθεια για ραντάρ-πηγή GAN εικόνων το 2018).

 

Πρώτη δημοσίευση 23ης Δεκεμβρίου 2021.

 

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai