Μοντέλα και πλατφόρμες AI

Πώς Λειτουργεί η Ανακατασκευή 3D από Μια Μονή Όψη;

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Παραδοσιακά, τα μοντέλα για ανακατασκευή αντικειμένων από μια μονή όψη, που βασίζονται σε συνελικτικές νευρωνικές δικτυώσεις, έχουν δείξει εξαιρετική απόδοση σε εργασίες ανακατασκευής. Τα τελευταία χρόνια, η ανακατασκευή 3D από μια μονή όψη έχει αναδειχθεί ως一个 δημοφιλής ερευνητικός τομέας στην κοινότητα του AI. Ανεξάρτητα από τη συγκεκριμένη μεθοδολογία που χρησιμοποιείται, όλα τα μοντέλα ανακατασκευής 3D από μια μονή όψη μοιράζονται την κοινή προσέγγιση της ενσωμάτωσης ενός δικτύου κωδικοποιητή-αποκωδικοποιητή στο πλαίσιο τους. Αυτό το δίκτυο thựcεί πολύπλοκες συλλογιστικές για τη 3D δομή στο χώρο εξόδου.

Σε αυτό το άρθρο, θα εξερευνήσουμε πώς λειτουργεί η ανακατασκευή 3D από μια μονή όψη σε πραγματικό χρόνο και τις τρέχουσες προκλήσεις που αντιμετωπίζουν αυτά τα πλαίσια στις εργασίες ανακατασκευής. Θα συζητήσουμε διάφορους βασικούς компонέντες και μεθόδους που χρησιμοποιούνται από τα μοντέλα ανακατασκευής 3D από μια μονή όψη και θα εξετάσουμε στρατηγικές που θα μπορούσαν να βελτιώσουν την απόδοση αυτών των πλαισίων. Επιπλέον, θα αναλύσουμε τα αποτελέσματα που παράγονται από τα πιο προηγμένα πλαίσια που χρησιμοποιούν μεθόδους κωδικοποιητή-αποκωδικοποιητή. Ας το δούμε.

Ανακατασκευή 3D Αντικειμένων από Μια Μονή Όψη

Η ανακατασκευή 3D αντικειμένων από μια μονή όψη περιλαμβάνει τη δημιουργία eines 3D μοντέλου ενός αντικειμένου από μια μονή όψη, ή σε απλούστερους όρους, από μια εικόνα. Για παράδειγμα, η εξαγωγή της 3D δομής ενός αντικειμένου, όπως ένα μοτοσικλέτα από μια εικόνα, είναι ένας πολύπλοκος процесс. Συνδυάζει γνώσεις για τη δομή των μερών, χαμηλού επιπέδου εικόνας και υψηλού επιπέδου σημασιολογικής πληροφορίας. Αυτό το φάσμα περιλαμβάνει δύο κύρια μέρη: ανακατασκευή και αναγνώριση. Η διαδικασία ανακατασκευής διακρίνει τη 3D δομή της εισόδου εικόνας χρησιμοποιώντας ενδείξεις όπως σκιάνσεις, υφή και οπτικά εφέ. Αντίθετα, η διαδικασία αναγνώρισης ταξινομεί την εισόδου εικόνα και ανακτά ένα κατάλληλο 3D μοντέλο από μια βάση δεδομένων.

Τα τρέχοντα μοντέλα ανακατασκευής 3D αντικειμένων από μια μονή όψη μπορεί να διαφέρουν στην αρχιτεκτονική, αλλά είναι ενωμένα από την ενσωμάτωση μιας δομής κωδικοποιητή-αποκωδικοποιητή στο πλαίσιο τους. Σε αυτή τη δομή, ο κωδικοποιητής χαρτογραφεί την εισόδου εικόνα σε μια 潜在τική αναπαράσταση, ενώ ο αποκωδικοποιητής πραγματοποιεί πολύπλοκες συλλογιστικές για τη 3D δομή του χώρου εξόδου. Για να εκτελεστεί με επιτυχία αυτή η εργασία, το δίκτυο πρέπει να ενσωματώσει τόσο υψηλού επιπέδου όσο και χαμηλού επιπέδου πληροφορίες. Επιπλέον, πολλά προηγμένα μοντέλα κωδικοποιητή-αποκωδικοποιητή βασίζονται στην αναγνώριση για εργασίες ανακατασκευής 3D από μια μονή όψη, το οποίο περιορίζει τις ικανότητές τους ανακατασκευής. Επιπλέον, η απόδοση των σύγχρονων συνελικτικών νευρωνικών δικτυών στην ανακατασκευή 3D αντικειμένων από μια μονή όψη μπορεί να υπερβεί χωρίς να κάνει ρητή ανάθεση της 3D δομής του αντικειμένου. Ωστόσο, η κυριαρχία της αναγνώρισης στις συνελικτικές νευρωνικές δικτυώσεις στις εργασίες ανακατασκευής αντικειμένων από μια μονή όψη επηρεάζεται από διάφορες πειραματικές διαδικασίες, συμπεριλαμβανομένων πρωτοκόλλων αξιολόγησης και σύνθεσης δεδομένων. Τέτοιες παράμετροι επιτρέπουν στο πλαίσιο να βρει μια λύση-συντόμευση, σε αυτή την περίπτωση, την αναγνώριση εικόνας.

Παραδοσιακά, τα πλαίσια ανακατασκευής 3D αντικειμένων από μια μονή όψη προσεγγίζουν τις εργασίες ανακατασκευής χρησιμοποιώντας την προσέγγιση του σχήματος από τη σκιάνση, με την υφή και τη διάθλαση να λειτουργούν ως εξωτικές όψεις για τις εργασίες ανακατασκευής.既然 αυτές οι τεχνικές χρησιμοποιούν μια seule βάθους ενδειξη, είναι ικανές να παρέχουν συλλογιστικές για τα ορατά μέρη μιας επιφάνειας. Επιπλέον, πολλά πλαίσια ανακατασκευής 3D από μια μονή όψη χρησιμοποιούν πολλαπλές ενδείξεις μαζί με δομική γνώση για την εκτίμηση του βάθους από μια μονή μονοοπτική εικόνα, μια συνδυασμένη που επιτρέπει στα πλαίσια να προβλέψουν το βάθος των ορατών επιφανειών. Πιο πρόσφατα πλαίσια εκτίμησης βάθους αναπτύσσουν συνελικτικές νευρωνικές δικτυώσεις για την εξαγωγή του βάθους από μια μονοοπτική εικόνα.

Ωστόσο, για αποτελεσματική ανακατασκευή 3D από μια μονή όψη, τα μοντέλα δεν πρέπει μόνο να κάνουν συλλογιστικές για τη 3D δομή των ορατών αντικειμένων στην εικόνα, αλλά πρέπει επίσης να φανταστούν τα αόρατα μέρη στην εικόνα χρησιμοποιώντας ορισμένες προηγμένες γνώσεις που έχουν μάθει από τα δεδομένα. Για να το επιτύχουν, η πλειοψηφία των μοντέλων χρησιμοποιεί εκπαιδευμένες συνελικτικές νευρωνικές δικτυώσεις για να χαρτογραφήσουν 2D εικόνες σε 3D σχήματα χρησιμοποιώντας άμεση 3D επιτήρηση, ενώ πολλά άλλα πλαίσια χρησιμοποιούν μια voxel-παράσταση του 3D σχήματος και χρησιμοποιούν μια 潜在τική αναπαράσταση για να παράγουν 3D up-convolutions. Ορισμένα πλαίσια επίσης διαμερίζουν τον χώρο εξόδου ιεραρχικά για να βελτιώσουν την υπολογιστική και μνημονική αποτελεσματικότητα, που επιτρέπει στο μοντέλο να προβλέψει υψηλότερη ανάλυση 3D σχήματα. Πρόσφατη έρευνα επικεντρώνεται στην χρήση слабότερων μορφών επιτήρησης για προβλέψεις 3D σχήματος χρησιμοποιώντας συνελικτικές νευρωνικές δικτυώσεις, είτε συγκρίνοντας προβλεπόμενα σχήματα και τις ground-truth προβλέψεις για να εκπαιδεύσουν shape regressors είτε χρησιμοποιώντας πολλαπλά σήματα μάθησης για να εκπαιδεύσουν mean σχήματα που βοηθούν το μοντέλο να προβλέψει παραμορφώσεις. Ένας άλλος λόγος πίσω από τις περιορισμένες προόδους στην ανακατασκευή 3D από μια μονή όψη είναι η περιορισμένη ποσότητα εκπαιδευτικών δεδομένων που είναι διαθέσιμα για την εργασία.

Συνεχίζοντας, η ανακατασκευή 3D από μια μονή όψη είναι μια πολύπλοκη εργασία καθώς δεν μόνο ερμηνεύει οπτικά δεδομένα γεωμετρικά, αλλά και σημασιολογικά. Αν και δεν είναι完全 διαφορετικά, καλύπτουν διαφορετικά φάσματα από γεωμετρική ανακατασκευή σε σημασιολογική αναγνώριση. Οι εργασίες ανακατασκευής απαιτούν per-pixel συλλογιστικές για τη 3D δομή του αντικειμένου στην εικόνα. Οι εργασίες ανακατασκευής δεν απαιτούν σημασιολογική κατανόηση του περιεχομένου της εικόνας και μπορεί να επιτευχθεί χρησιμοποιώντας χαμηλού επιπέδου εικόνας ενδείξεις, συμπεριλαμβανομένης της υφής, του χρώματος, της σκιάνσης, των σκιών, της προοπτικής και του εστιασμού. Η αναγνώριση, από την άλλη πλευρά, είναι μια ακραία περίπτωση χρήσης σημασιολογίας εικόνας, επειδή οι εργασίες αναγνώρισης χρησιμοποιούν ολόκληρα αντικείμενα και ισοδυναμούν με την ταξινόμηση του αντικειμένου στην είσοδο και την ανάκτηση του αντίστοιχου σχήματος από μια βάση δεδομένων.

Αν και οι εργασίες αναγνώρισης και ανακατασκευής μπορεί να διαφέρουν σημαντικά μεταξύ τους, και οι δύο έχουν την τάση να αγνοούν寶贵ες πληροφορίες που περιέχονται στην είσοδο εικόνας. Είναι συμφέρον να χρησιμοποιηθούν και οι δύο εργασίες σε συνδυασμό για να ληφθούν τα καλύτερα δυνατά αποτελέσματα, και ακριβή 3D σχήματα για ανακατασκευή αντικειμένων, δηλαδή για βέλτιστη ανακατασκευή 3D από μια μονή όψη, το μοντέλο πρέπει να χρησιμοποιήσει δομική γνώση, χαμηλού επιπέδου εικόνας ενδείξεις και υψηλού επιπέδου κατανόηση του αντικειμένου.

Ανακατασκευή 3D από Μια Μονή Όψη: Συμβατική Ρύθμιση

Για να εξηγήσουμε τη συμβατική ρύθμιση και να αναλύσουμε τη ρύθμιση ενός πλαισίου ανακατασκευής 3D από μια μονή όψη, θα χρησιμοποιήσουμε μια τυπική ρύθμιση για την εκτίμηση του 3D σχήματος χρησιμοποιώντας μια μονή όψη ή εικόνα του αντικειμένου. Το σύνολο δεδομένων που χρησιμοποιείται για εκπαιδευτικούς σκοπούς είναι το σύνολο δεδομένων ShapeNet και αξιολογεί την απόδοση σε 13 κατηγορίες, που επιτρέπει στο μοντέλο να κατανοήσει πώς ο αριθμός των κατηγοριών σε ένα σύνολο δεδομένων καθορίζει την απόδοση εκτίμησης σχήματος του μοντέλου.

Η πλειοψηφία των σύγχρονων συνελικτικών νευρωνικών δικτυών χρησιμοποιεί μια εικόνα για να προβλέψει υψηλής ανάλυσης 3D μοντέλα, και αυτά τα πλαίσια μπορούν να κατηγοριοποιηθούν με βάση την αναπαράσταση της εξόδου: χάρτες βάθους, σημειακές νεφώσεις και voxel πλέγματα. Το μοντέλο χρησιμοποιεί OGN ή Octree Generating Networks ως την αντιπροσωπευτική μεθοδολογία, η οποία ιστορικά έχει υπερβεί την προσέγγιση voxel πλέγματος και/ή μπορεί να καλύψει τις κυρίαρχες αναπαραστάσεις εξόδου. Σε αντίθεση με τις υπάρχουσες μεθόδους που χρησιμοποιούν αναπαραστάσεις εξόδου, η προσέγγιση OGN επιτρέπει στο μοντέλο να προβλέψει υψηλής ανάλυσης σχήματα και χρησιμοποιεί octrees για να αντιπροσωπεύσει αποτελεσματικά τον κατειλημμένο χώρο.

Βασικές Γραμμές

Για να αξιολογήσουμε τα αποτελέσματα, το μοντέλο χρησιμοποιεί δύο βασικές γραμμές που θεωρούν το πρόβλημα ως μια καθαρή εργασία αναγνώρισης. Η πρώτη βασική γραμμή βασίζεται στην ομαδοποίηση, ενώ η δεύτερη βασική γραμμή εκτελεί ανάκτηση βάσης δεδομένων.

Ομαδοποίηση

Στην ομαδοποίηση, το μοντέλο χρησιμοποιεί τον αλγόριθμο K-Means για να ομαδοποιήσει ή να συσπειρώσει τα εκπαιδευτικά σχήματα σε K υποκατηγορίες και εκτελεί τον αλγόριθμο σε 32*32*32 voxelizations που έχουν πεπλατυρθεί σε einen διανυσμα. Μετά την καθορισμό των ομαδοποιήσεων, το μοντέλο επιστρέφει στην εργασία με μοντέλα υψηλότερης ανάλυσης. Το μοντέλο υπολογίζει το μέσο σχήμα μέσα σε κάθε ομαδοποίηση και καθορίζει το μέσο σχήμα όπου η βέλτιστη τιμή υπολογίζεται με τη μέγιστη μέση IoU ή Intersection over Union πάνω από τα μοντέλα.既然 το μοντέλο γνωρίζει τη σχέση μεταξύ των 3D σχημάτων και των εικόνων μέσα στα εκπαιδευτικά δεδομένα, το μοντέλο μπορεί να αντιστοιχίσει την εικόνα με την αντίστοιχη ομαδοποίηση.

Άντληση

Η βασική γραμμή ανάκτησης μαθαίνει να ενσωματώνει σχήματα και εικόνες σε ένα κοινό χώρο. Το μοντέλο θεωρεί την ζευγαρωτή ομοιότητα 3D πινάκων σχημάτων στο σύνολο εκπαιδευτικών δεδομένων για να κατασκευάσει τον χώρο ενσωμάτωσης. Το μοντέλο επιτυγχάνει αυτό χρησιμοποιώντας την προσέγγιση Multi-Dimensional Scaling με Sammon mapping για να συμπιέσει κάθε γραμμή στο πίνακα σε μια χαμηλής διαστάσεων περιγραφή. Επιπλέον, για να υπολογίσει την ομοιότητα μεταξύ δύο τυχαίων σχημάτων, το μοντέλο χρησιμοποιεί τον light field descriptor. Επιπλέον, το μοντέλο εκπαιδεύει μια συνελικτική νευρωνική δικτυωση για να χαρτογραφήσει εικόνες σε μια περιγραφή για να ενσωματώσει τις εικόνες στον χώρο.

Ανάλυση

Τα μοντέλα ανακατασκευής 3D από μια μονή όψη ακολουθούν διαφορετικές στρατηγικές, ως αποτέλεσμα του οποίου υπερβαίνουν άλλα μοντέλα σε ορισμένες περιοχές, ενώ σε άλλες περιοχές είναι κατώτερα. Για να συγκρίνουμε διαφορετικά πλαίσια και να αξιολογήσουμε την απόδοσή τους, έχουμε διαφορετικά μετρητικά, ένα από τα οποία είναι ο μέσος IoU βαθμός.

Όπως φαίνεται στην παραπάνω εικόνα, παρά την ύπαρξη διαφορετικών αρχιτεκτονικών, τα τρέχοντα state-of-the-art μοντέλα ανακατασκευής 3D παράγουν σχεδόν παρόμοια απόδοση. Ωστόσο, είναι ενδιαφέρον να σημειωθεί ότι παρά το γεγονός ότι είναι μια καθαρή μέθοδος αναγνώρισης, το πλαίσιο ανάκτησης υπερβαίνει άλλα μοντέλα σε σχέση με τους μέσους και μεσοστέους IoU βαθμούς. Το πλαίσιο ομαδοποίησης παράγει στερεά αποτελέσματα, υπερβαίνοντας το AtlasNet, το OGN και το Matryoshka. Ωστόσο, το πιο απροσδόκητο αποτέλεσμα αυτής της ανάλυσης παραμένει το Oracle (ORCL ) NN που υπερβαίνει όλα τα άλλα μέθοδος, παρά το γεγονός ότι χρησιμοποιεί μια τέλεια αρχιτεκτονική ανάκτησης. Αν και ο υπολογισμός του μέσου IoU βαθμού βοηθά στην σύγκριση, δεν παρέχει πλήρη εικόνα, επειδή η διακύμανση των αποτελεσμάτων είναι υψηλή, ανεξάρτητα από το μοντέλο.

Κοινές Μετρητικές Αξιολόγησης

Τα μοντέλα ανακατασκευής 3D από μια μονή όψη συχνά χρησιμοποιούν διαφορετικές μετρητικές αξιολόγησης για να αναλύσουν την απόδοσή τους σε eine σειρά από εργασίες. Ακολουθούν ορισμένες από τις κοινές μετρητικές αξιολόγησης.

Διατομή Υπερκάλυψης

Ο μέσος της Διατομής Υπερκάλυψης είναι μια μετρητική που χρησιμοποιείται ως ποσοτική μέτρηση για να χρησιμεύσει ως αναφορά για μοντέλα ανακατασκευής 3D από μια μονή όψη. Αν και η IoU παρέχει κάποια εικόνα για την απόδοση του μοντέλου, δεν θεωρείται ως η μόνη μετρητική για να αξιολογήσει μια μέθοδο, επειδή υποδεικνύει την ποιότητα του προβλεπόμενου σχήματος μόνο εάν οι τιμές είναι αρκετά υψηλές με μια σημαντική απόκλιση που παρατηρείται μεταξύ των χαμηλών και μεσαίων βαθμών για δύο δεδομένα σχήματα.

Απόσταση Chamfer

Η Απόσταση Chamfer ορίζεται σε σημειακές νεφώσεις και έχει σχεδιαστεί για να εφαρμοστεί σε διαφορετικές αναπαραστάσεις 3D. Ωστόσο, η μετρητική αξιολόγησης Απόστασης Chamfer είναι πολύ ευαίσθητη σε outliers, που την καθιστά προβληματική μέτρηση για να αξιολογήσει την απόδοση του μοντέλου, με την απόσταση του outlier από το αναφορά σχήμα να καθορίζει σημαντικά την ποιότητα της γεννήτριας.

Βαθμός F

Ο Βαθμός F είναι μια κοινή μετρητική αξιολόγησης που χρησιμοποιείται από πολλά μοντέλα ανακατασκευής 3D. Ο Βαθμός F ορίζεται ως η αρμονική μέση μεταξύ ανακλησείας και ακρίβειας και αξιολογεί την απόσταση μεταξύ των επιφανειών των αντικειμένων ρητά. Η ακρίβεια μετρά το ποσοστό των ανακατασκευασμένων σημείων που βρίσκονται μέσα σε μια προκαθορισμένη απόσταση από το ground truth, για να μετρήσει την ακρίβεια της ανακατασκευής. Η ανακλησεία μετρά το ποσοστό των σημείων στο ground truth που βρίσκονται μέσα σε μια προκαθορισμένη απόσταση από την ανακατασκευή, για να μετρήσει την πληρότητα της ανακατασκευής. Επιπλέον, μεταβάλλοντας την απόσταση του κατώφλιου, οι dévelopers μπορούν να ελέγξουν τη στενότητα του Βαθμού F.

Περί-Κατηγορία Ανάλυση

Η ομοιότητα στην απόδοση που παράγουν τα παραπάνω πλαίσια δεν μπορεί να είναι αποτέλεσμα μεθόδων που τρέχουν σε διαφορετικά υποσύνολα κατηγοριών, και το ακόλουθο σχήμα δείχνει την σταθερή σχετική απόδοση σε διαφορετικές κατηγορίες, με την ανάκτηση Oracle NN να επιτυγχάνει το καλύτερο αποτέλεσμα, και όλα τα μέθοδος να παρατηρούν υψηλή διακύμανση για όλες τις κατηγορίες.

Επιπλέον, ο αριθμός των εκπαιδευτικών δειγμάτων που είναι διαθέσιμα για μια κατηγορία μπορεί να οδηγήσει κάποιον να υποθέσει ότι επηρεάζει την απόδοση ανά κατηγορία. Ωστόσο, όπως φαίνεται στο ακόλουθο σχήμα, ο αριθμός των εκπαιδευτικών δειγμάτων που είναι διαθέσιμα για μια κατηγορία δεν επηρεάζει την απόδοση ανά κατηγορία, και ο αριθμός των δειγμάτων σε μια κατηγορία και ο μέσος IoU βαθμός δεν είναι συσχετισμένοι.

Ποιοτική Ανάλυση

Τα ποσοτικά αποτελέσματα που συζητήθηκαν στην παραπάνω ενότητα υποστηρίζονται από ποιοτικά αποτελέσματα, όπως φαίνεται στην ακόλουθη εικόνα.

Για την πλειοψηφία των κατηγοριών, δεν υπάρχει σημαντική διαφορά μεταξύ της ομαδοποίησης και των προβλέψεων που γίνονται από τις μεθόδους αποκωδικοποιητή. Η ομαδοποίηση αποτυγχάνει να παράγει αποτελέσματα όταν η απόσταση μεταξύ του δείγματος και του μέσου σχήματος της ομαδοποίησης είναι υψηλή, ή σε περιπτώσεις όπου το μέσο σχήμα δεν μπορεί να περιγράψει την ομαδοποίηση αρκετά καλά. Από την άλλη πλευρά, τα πλαίσια που χρησιμοποιούν μεθόδους αποκωδικοποιητή και αρχιτεκτονική ανάκτησης παράγουν τα πιο ακριβή και ελκυστικά αποτελέσματα, επειδή είναι σε θέση να περιλαμβάνουν λεπτές λεπτομέρειες στο παραγόμενο 3D μοντέλο.

Ανακατασκευή 3D από Μια Μονή Όψη: Τελικές Σκέψεις

Σε αυτό το άρθρο, έχουμε συζητήσει την ανακατασκευή 3D αντικειμένων από μια μονή όψη και πώς λειτουργεί, και έχουμε συζητήσει δύο βασικές γραμμές: ανάκτηση και ομαδοποίηση, με την ανάκτηση να υπερβαίνει τα τρέχοντα state-of-the-art μοντέλα. Τέλος, αν και η ανακατασκευή 3D αντικειμένων από μια μονή όψη είναι ένα από τα πιο热τικά θέματα και πιο ερευνημένα θέματα στην κοινότητα του AI, και παρά το γεγονός ότι έχει κάνει σημαντική πρόοδο τα τελευταία χρόνια, η ανακατασκευή 3D αντικειμένων από μια μονή όψη είναι ακόμα μακριά από το να είναι τέλεια, με σημαντικά εμπόδια να υπερβεί τα επόμενα χρόνια.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.