Η γωνία του Anderson

Συνθετικά Δεδομένα: Γέφυρα του Χάσματος της Ολικής Κατανόησης της Σκηνής με το Grand Theft Auto

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές στο Πανεπιστήμιο του Ιλινόις έχουν δημιουργήσει μια νέα βάση δεδομένων οπτικής αναγνώρισης που χρησιμοποιεί συνθετική εικόνα που παράγεται από το μηχανισμό του παιχνιδιού Grand Theft Auto για να βοηθήσει στην επίλυση ενός από τα πιο δύσκολα προβλήματα της σεμαντικής αναγνώρισης – την αναγνώριση αντικειμένων που είναι μόνο μερικώς ορατά στις πηγαίες εικόνες και βίντεο.

Για αυτό, όπως περιγράφεται στο το έγγραφο, οι ερευνητές έχουν χρησιμοποιήσει το μηχανισμό του παιχνιδιού GTA-V για να δημιουργήσουν μια συνθετική βάση δεδομένων που όχι μόνο διαθέτει ένα ρεκόρ αριθμού περιπτώσεων ολικής καλυψής, αλλά και διαθέτει τέλεια σεμαντική αναγνώριση και ετικέτα, και λαμβάνει υπόψη την χρονική πληροφορία με τρόπο που δεν αντιμετωπίζεται από παρόμοιες ανοιχτές βάσεις δεδομένων.

Πλήρης Κατανόηση της Σκηνής

Το βίντεο παρακάτω, που δημοσιεύθηκε ως υλικό υποστήριξης για την έρευνα, αναπαριστά τα πλεονεκτήματα μιας πλήρης κατανόησης της σκηνής, με την οποία τα κρυμμένα αντικείμενα είναι γνωστά και εκτίθενται σε όλες τις περιπτώσεις, επιτρέποντας στο σύστημα να μάθει να συνδέει μερικώς καλυμμένες προβολές με το ολόκληρο (ετικεταρισμένο) αντικείμενο.

Πηγή: http://sailvos.web.illinois.edu/_site/index.html

Η αποτελούμενη βάση δεδομένων, που ονομάζεται SAIL-VOS 3D, ισχυρίζεται από τους συγγραφείς ότι είναι η πρώτη συνθετική βάση δεδομένων βίντεο με πλαισιακή ανά σημείο ετικέτα, ετικέτα αντικειμένου, βάθος σκηνής και 2D ετικέτες που οριοθετούνται από ορθογώνιες περιοχές.

Πηγή (Κάντε κλικ για μεγέθυνση)

Οι ετικέτες της SAIL-VOS 3D περιλαμβάνουν βάθος, ετικέτα αντικειμένου, σεμαντική ετικέτα και 3D πλέγματα. Τα δεδομένα περιλαμβάνουν 484 βίντεο που αποτελούνται από 237.611 πλαισιακά στοιχεία σε ανάλυση 1280×800, συμπεριλαμβανομένων μεταβάσεων.

Πάνω, τα αρχικά πλαισιακά CGI; δεύτερη σειρά, ετικέτα αντικειμένου; τρίτη σειρά, αμοδική ετικέτα, που αναπαριστά το βάθος της κατανόησης της σκηνής και τη διαφάνεια που είναι διαθέσιμη στα δεδομένα. Πηγή

Πάνω, τα αρχικά πλαισιακά CGI; δεύτερη σειρά, ετικέτα αντικειμένου; τρίτη σειρά, αμοδική ετικέτα, που αναπαριστά το βάθος της κατανόησης της σκηνής και τη διαφάνεια που είναι διαθέσιμη στα δεδομένα. Πηγή (Κάντε κλικ για μεγέθυνση)

Η βάση δεδομένων χωρίζεται σε 6.807 κλιπ με μέσο όρο 34,6 πλαισιακά στοιχεία το καθένα, και τα δεδομένα ετικετώνονται με 3.460.213 περιπτώσεις αντικειμένων που προέρχονται από 3.576 μοντέλα πλέγματος στο μηχανισμό του παιχνιδιού GTA-V. Αυτά αντιστοιχούν σε συνολικά 178 σεμαντικές κατηγορίες.

Ανακατασκευή Πλέγματος και Αυτοματοποιημένη Ετικέτα

Καθώς η μελλοντική έρευνα της βάσης δεδομένων είναι πιθανό να πραγματοποιηθεί σε πραγματικά δεδομένα, τα πλέγματα στη SAIL-VOS 3D παράγονται από το πλαίσιο μηχανικής μάθησης και όχι από το μηχανισμό του παιχνιδιού GTA-V.

Με μια προγραμματική και ουσιαστικά 'ολογραφική' κατανόηση της ολόκληρης αναπαράστασης της σκηνής, η SAIL-VOS 3D μπορεί να συνθέσει αναπαραστάσεις αντικειμένων που συνήθως κρύβονται από ολική κάλυψη, όπως ο μακρινός βραχίονας του χαρακτήρα που γυρίζει εδώ, με τρόπο που θα εξαρτόταν από πολλά αντιπροσωπευτικά παραδείγματα σε πραγματικά δεδομένα. Πηγή: https://arxiv.org/pdf/2105.08612.pdf

Με μια προγραμματική και ουσιαστικά ‘ολογραφική’ κατανόηση της ολόκληρης αναπαράστασης της σκηνής, η SAIL-VOS 3D μπορεί να συνθέσει αναπαραστάσεις αντικειμένων που συνήθως κρύβονται από ολική κάλυψη, όπως ο μακρινός βραχίονας του χαρακτήρα που γυρίζει εδώ, με τρόπο που θα εξαρτόταν από πολλά αντιπροσωπευτικά παραδείγματα σε πραγματικά δεδομένα. (Κάντε κλικ για μεγέθυνση) Πηγή: https://arxiv.org/pdf/2105.08612.pdf

Καθώς κάθε αντικείμενο στο κόσμο του GTA-V περιέχει một μοναδικό αναγνωριστικό, η SAIL-VOS ανακτά αυτά από το μηχανισμό απόδοσης χρησιμοποιώντας τη βιβλιοθήκη hook του GTA-V. Αυτό λύνει το πρόβλημα της επανακατάκτησης του αντικειμένου εάν αυτό εξαφανιστεί προσωρινά από το πεδίο όρασης, καθώς η ετικέτα είναι σταθερή και αξιόπιστη. Υπάρχουν 162 αντικείμενα διαθέσιμα στο περιβάλλον, τα οποία οι ερευνητές χαρτογράφησαν σε αντίστοιχες κατηγορίες.

Μια Ποικιλία Σκηνών και Αντικειμένων

Πολλά από τα αντικείμενα στο μηχανισμό του παιχνιδιού GTA-V είναι κοινά στη φύση, και επομένως η SAIL-VOS περιλαμβάνει μια τυχερή 60% των κατηγοριών που υπάρχουν στη συχνά χρησιμοποιούμενη βάση δεδομένων MS-COCO του 2014.

Η SAIL-VOS περιλαμβάνει μια μεγάλη ποικιλία εσωτερικών και εξωτερικών σκηνών υπό διαφορετικές καιρικές συνθήκες, με χαρακτήρες που φορούν ποικίλες ενδυμασίες.

Η SAIL-VOS περιλαμβάνει μια μεγάλη ποικιλία εσωτερικών και εξωτερικών σκηνών υπό διαφορετικές καιρικές συνθήκες, με χαρακτήρες που φορούν ποικίλες ενδυμασίες. (Κάντε κλικ για μεγέθυνση)

Εφαρμοσιμότητα

Για να διασφαλιστεί η συμβατότητα με την γενική έρευνα σε αυτήν την περιοχή, και για να επιβεβαιωθεί ότι αυτή η συνθετική προσέγγιση μπορεί να ωφελήσει μη συνθετικά έργα, οι ερευνητές αξιολόγησαν τη βάση δεδομένων χρησιμοποιώντας την προσέγγιση ανίχνευσης με βάση το πλαισιακό που χρησιμοποιείται για το MS-COCO και το 2012 Ανταγωνισμό Αντικειμένων Οπτικής του PASCAL, με μέσο όρο ακρίβειας ως μετρική.

Οι ερευνητές βρήκαν ότι η προ-εκπαίδευση στη βάση δεδομένων SAIL-VOS βελτιώνει την απόδοση της τομής πάνω από την ένωση (IoU) κατά 19%, με αντίστοιχη βελτίωση στην απόδοση VideoMatch, από 55% σε 74% σε μη προβλεπόμενα δεδομένα.

Ωστόσο, σε περιπτώσεις ακραίας ολικής κάλυψης, υπήρξαν περιπτώσεις όπου όλες οι παλαιότερες μεθόδους παρέμειναν ανίκανοι να αναγνωρίσουν ένα αντικείμενο ή πρόσωπο, αν και οι ερευνητές προβλέπουν ότι αυτό θα μπορούσε να επιλυθεί στο μέλλον εξετάζοντας τα γειτονικά πλαισιακά για να καθορίσουν το λόγο για την αμοδική μάσκα.

Στις δύο δεξιές εικόνες, οι παραδοσιακές αλγόριθμοι τομής απέτυχαν να αναγνωρίσουν τη γυναικεία μορφή από το πολύ περιορισμένο τμήμα του κεφαλιού της που είναι ορατό. Μεταγενέστερες καινοτομίες με αξιολόγηση οπτικού ροή μπορεί να βελτιώσουν αυτά τα αποτελέσματα.

Στις δύο δεξιές εικόνες, οι παραδοσιακές αλγόριθμοι τομής απέτυχαν να αναγνωρίσουν τη γυναικεία μορφή από το πολύ περιορισμένο τμήμα του κεφαλιού της που είναι ορατό. Μεταγενέστερες καινοτομίες με αξιολόγηση οπτικού ροή μπορεί να βελτιώσουν αυτά τα αποτελέσματα. (Κάντε κλικ για μεγέθυνση)

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai