Μοντέλα και πλατφόρμες AI

data2vec: Ένα Ορόσημο στη Μάθηση Αυτο-Επιβλέπουσα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Τα μοντέλα μηχανικής μάθησης βασίζονταν έντονα σε δεδομένα με ετικέτες για εκπαίδευση, και παραδοσιακά, η εκπαίδευση μοντέλων με δεδομένα με ετικέτες παρέχει ακριβή αποτελέσματα. Ωστόσο, ο κύριος μειονέκτης της χρήσης δεδομένων με ετικέτες είναι το υψηλό κόστος αναγνώρισης που αυξάνεται με την αύξηση του μεγέθους των δεδομένων εκπαίδευσης. Τα υψηλά κόστη αναγνώρισης είναι ένα μεγάλο εμπόδιο για τους développers, ιδιαίτερα όταν εργάζονται σε ένα μεγάλο проект με σημαντικές ποσότητες δεδομένων εκπαίδευσης.

Για να αντιμετωπίσουν το ζήτημα της αναγνώρισης, οι développers ανέπτυξαν την έννοια της Μάθησης Αυτο-Επιβλέπουσα (SSL). Η Μάθηση Αυτο-Επιβλέπουσα είναι μια διαδικασία μηχανικής μάθησης στην οποία το μοντέλο εκπαιδεύεται να μάθει ένα τμήμα της εισόδου από ένα άλλο τμήμα της εισόδου. Ένα μοντέλο Μάθησης Αυτο-Επιβλέπουσας στοχεύει να εκμεταλλευτεί τη σχέση μεταξύ των δεδομένων αντί να χρησιμοποιεί τις ετικέτες των δεδομένων με εποπτεία.

Εκτός από τη Μάθηση Αυτο-Επιβλέπουσα, υπάρχουν διάφορες άλλες μεθόδοι και μοντέλα για την εκπαίδευση μοντέλων μηχανικής μάθησης χωρίς τη χρήση δεδομένων με ετικέτες. Ωστόσο, τα περισσότερα από αυτά τα μοντέλα έχουν δύο σημαντικά προβλήματα

  1. Είναι συχνά εξειδικευμένα για μια seule modality, όπως μια εικόνα ή κείμενο.
  2. Απαιτούν υψηλή ποσότητα υπολογιστικής ισχύος.

Αυτά τα προβλήματα είναι ένα σημαντικό ζήτημα γιατί ο μέσος ανθρώπινος νους είναι σε θέση να μάθει από ένα seul τύπο δεδομένων πολύ πιο αποτελεσματικά σε σύγκριση με ένα μοντέλο AI που βασίζεται σε ξεχωριστά μοντέλα και δεδομένα εκπαίδευσης για να διακρίνει μεταξύ μιας εικόνας, κειμένου και ομιλίας.

Για να αντιμετωπίσουν το ζήτημα της seule modality, η Meta AI κυκλοφόρησε το data2vec, το πρώτο του είδους, αυτο-επιβλεπόμενο αλγόριθμο υψηλής απόδοσης για να μάθει πληροφορίες από τρεις διαφορετικές modalities: εικόνα, κείμενο και ομιλία. Με την εφαρμογή του αλγορίθμου data2vec, η κατανόηση κειμένου μπορεί να εφαρμοστεί σε ένα πρόβλημα διαχωρισμού εικόνας ή μπορεί να αναπτυχθεί σε μια εργασία αναγνώρισης ομιλίας.

Σε αυτό το άρθρο, θα μιλήσουμε για το μοντέλο data2vec σε βάθος. Θα συζητήσουμε την επισκόπηση της μεθόδου, τη σχετική εργασία, την αρχιτεκτονική και τα αποτελέσματα του μοντέλου με μεγαλύτερη λεπτομέρεια, ώστε να έχετε μια σαφή κατανόηση του αλγορίθμου data2vec.

Εισαγωγή στο Data2vec: Η Κεντρική Ιδέα

Αν και η θεμελιώδης έννοια της Μάθησης Αυτο-Επιβλέπουσας εφαρμόζεται σε όλες τις modalities, τα πραγματικά αντικείμενα και αλγόριθμοι διαφέρουν μεταξύ τους επειδή σχεδιάστηκαν με σεβασμό σε μια seule modality. Ο σχεδιασμός ενός μοντέλου για μια seule modality είναι ο λόγος για τον οποίο ο ίδιος αλγόριθμος αυτο-επιβλέπουσας δεν μπορεί να λειτουργήσει αποτελεσματικά σε διαφορετικά είδη δεδομένων εκπαίδευσης.

Για να υπερβεί την πρόκληση που παρουσιάζουν τα μοντέλα και οι αλγόριθμοι seule modality, η Meta AI κυκλοφόρησε το data2vec, ένα αλγόριθμο που χρησιμοποιεί την ίδια μεθοδολογία για είτε την όραση υπολογιστή, είτε την NLP ή την ομιλία.

Η κεντρική ιδέα πίσω από τον αλγόριθμο data2vec είναι να χρησιμοποιήσει την προβολή της εισόδου με μάσκα για να προβλέψει τις.latent αναπαραστάσεις των πλήρων δεδομένων εισόδου σε ένα σύστημα αυτο-απόσταξης με τη βοήθεια του стандαρτ αρχιτεκτονικής Transformer. Έτσι, αντί για modality-ειδικά αντικείμενα όπως εικόνες, κείμενο ή φωνή που είναι τοπικά στη φύση, ο αλγόριθμος data2vec προβλέπει τις.latent αναπαραστάσεις με πληροφορίες από τα πλήρη δεδομένα εκπαίδευσης ή εισόδου.

Γιατί η Βιομηχανία AI Χρειάζεται τον Αλγόριθμο Data2Vec;

Τα μοντέλα Μάθησης Αυτο-Επιβλέπουσας κατασκευάζουν αναπαραστάσεις των δεδομένων εκπαίδευσης χρησιμοποιώντας ετικέτες με εποπτεία από ανθρώπους, και είναι ένας από τους κύριους λόγους για την πρόοδο της NLP ή της Φυσικής Γλώσσας και της Τεχνολογίας Όρασης Υπολογιστή.

Μέχρι τώρα, αυτές οι αναπαραστάσεις αυτο-επιβλέπουσας μάθησης εστιάζουν σε ατομικές modalities, με αποτέλεσμα να προκύψουν προκαταλήψεις και ειδικές σχεδιάσεις στα μοντέλα.

Για παράδειγμα, υπάρχουν λεξιλόγια μονάδων ομιλίας στη επεξεργασία ομιλίας που μπορούν να ορίσουν μια εργασία αυτο-επιβλέπουσας μάθησης στη NLP. Παρόμοια, στην όραση υπολογιστή, οι développers μπορούν είτε να ανακτήσουν την είσοδο, να μάθουν διακριτές οπτικές μονάδες, είτε να μάθουν αναπαραστάσεις που είναι ανεξάρτητες από την αυξομείωση δεδομένων.

Ο αλγόριθμος data2vec είναι ένα σημαντικό ορόσημο στη βιομηχανία αυτο-επιβλέπουσας μάθησης, καθώς στοχεύει στην βελτίωση πολλών modalities αντί για μια seule. Επιπλέον, ο αλγόριθμος data2vec δεν βασίζεται στην ανακατασκευή της εισόδου ή την αντίθετη μάθηση.

Έτσι, ο λόγος για τον οποίο ο κόσμος χρειάζεται το data2vec είναι ότι ο αλγόριθμος data2vec έχει τη δυνατότητα να επιταχύνει την πρόοδο στην AI και συμβάλλει στην ανάπτυξη μοντέλων AI που μπορούν να μάθουν για διάφορα аспектs του περιβάλλοντος τους χωρίς προβλήματα.

Τι είναι ο Αλγόριθμος Data2Vec;

Το data2vec είναι ένα ενοποιημένο πλαίσιο που στοχεύει στην εφαρμογή της αυτο-επιβλέπουσας μηχανικής μάθησης σε διάφορες modalities δεδομένων, συμπεριλαμβανομένων εικόνων, ομιλίας και κειμένου.

Ο αλγόριθμος data2vec στοχεύει στην ανάπτυξη μοντέλων ML που μπορούν να μάθουν τις γενικές προτύπους στο περιβάλλον πολύ καλύτερα, διατηρώντας το αντικείμενο μάθησης ομοιόμορφο σε διάφορες modalities. Το μοντέλο data2vec ενοποιεί τον αλγόριθμο μάθησης, αλλά vẫn μάθει τις αναπαραστάσεις για κάθε modality ατομικά.

Με την εισαγωγή του αλγορίθμου data2vec, η Meta AI ελπίζει ότι θα κάνει τη μάθηση πολλών modalities αποτελεσματική και πολύ πιο απλή.

Πώς Λειτουργεί ο Αλγόριθμος Data2Vec;

Ο αλγόριθμος data2vec συνδυάζει τις γνώσεις των.latent αναπαραστάσεων με προβλέψεις με μάσκα, αν και χρησιμοποιεί πολλαπλά δίκτυα ως στόχους για να γενικεύσει τις.latent αναπαραστάσεις. Το μοντέλο εκπαιδεύει ένα αυτο-υπολογιστικό δίκτυο Transformer που χρησιμοποιείται είτε στη διδασκαλία ή στη μαθητεία.

Στη διδασκαλία, το μοντέλο πρώτα κατασκευάζει τις αναπαραστάσεις των δεδομένων εισόδου που χρησιμεύουν ως στόχοι στην εργασία μάθησης. Στη μαθητεία, το μοντέλο κωδικοποιεί μια μασκαρμένη εκδοχή των δεδομένων εισόδου που χρησιμοποιείται για να κάνει προβλέψεις για πλήρεις αναπαραστάσεις δεδομένων.

Η παραπάνω εικόνα αντιπροσωπεύει πώς το μοντέλο data2vec χρησιμοποιεί την ίδια διαδικασία μάθησης για διαφορετικές modalities. Στο πρώτο βήμα, το μοντέλο παράγει αναπαραστάσεις των δεδομένων εισόδου (διδασκαλία). Το μοντέλο στη συνέχεια ανακτά αυτές τις αναπαραστάσεις με βάση μια μασκαρμένη εκδοχή των δεδομένων εισόδου.

Επιπλέον, καθώς ο αλγόριθμος data2vec χρησιμοποιεί.latent αναπαραστάσεις των δεδομένων εισόδου, μπορεί να θεωρηθεί ως μια απλοποιημένη εκδοχή των modality-ειδικών σχεδιασμών όπως η δημιουργία κατάλληλων στόχων με τη normalization της εισόδου ή η μάθηση ενός σταθερού συνόλου οπτικών μονάδων.

Μέθοδος του Μοντέλου Data2vec

Το μοντέλο data2vec εκπαιδεύεται με την πρόβλεψη των αναπαραστάσεων του μοντέλου των δεδομένων εισόδου με βάση μια μερική προβολή της εισόδου. Όπως μπορείτε να δείτε στη δοσμένη εικόνα, το πρόσωπο του σκύλου είναι μασκαρμένο, ένα συγκεκριμένο τμήμα της φωνής είναι μασκαρμένο και η λέξη “με” είναι μασκαρμένη στο κείμενο.

Το μοντέλο πρώτα κωδικοποιεί μια μασκαρμένη εκδοχή του δείγματος εκπαίδευσης (μαθητεία), και στη συνέχεια κωδικοποιεί την αμάσκαρη εκδοχή της εισόδου για να κατασκευάσει στόχους εκπαίδευσης με το ίδιο μοντέλο, αλλά μόνο όταν είναι παραμετροποιημένο ως η εκθετική μέση των βαρών του μοντέλου.

Αρχιτεκτονική του Μοντέλου

Το μοντέλο data2vec χρησιμοποιεί μια τυπική αρχιτεκτονική Transformer με modality-ειδική κωδικοποίηση των δεδομένων εισόδου. Για εργασίες που σχετίζονται με την όραση υπολογιστή, το μοντέλο χρησιμοποιεί την στρατηγική ViT για να κωδικοποιήσει μια εικόνα ως eine ακολουθία από τμήματα όπου κάθε εικόνα καλύπτει 16×16 pixels, και τροφοδοτείται ως μια γραμμική μετασχηματισμός.

Επιπλέον, για την αναγνώριση ομιλίας, το μοντέλο κωδικοποιεί τα δεδομένα χρησιμοποιώντας ένα πολυσχέδιο 1-D συνελικτικό νευρωνικό δίκτυο που χαρτογραφεί τα 16 kHz waveforms σε 50 Hz αναπαραστάσεις. Για την επεξεργασία των δεδομένων κειμένου, το μοντέλο προεπεξεργάζεται τα δεδομένα για να εξαγάγει υπο-μονάδες, και στη συνέχεια ενσωματώνει τα δεδομένα σε διανομής χώρο μέσω διανυσμάτων ενσωμάτωσης.

Μάσκα

Μόλις το μοντέλο ενσωματώσει τα δεδομένα εισόδου ως μια ακολουθία από μονάδες, το μοντέλο μάσκαρει τμήματα αυτών των μονάδων αντικαθιστώντας τες με μια μονάδα ενσωμάτωσης, και στη συνέχεια τροφοδοτεί την ακολουθία στο δίκτυο Transformer. Για την όραση υπολογιστή, το μοντέλο εφαρμόζει μια στρατηγική μάσκαρης μπλοκ με γειτονικές μάσκες.

Στόχοι Εκπαίδευσης

Το μοντέλο data2vec στοχεύει στην πρόβλεψη των αναπαραστάσεων του μοντέλου των αμάσκαρων δειγμάτων εκπαίδευσης με βάση μια κωδικοποίηση της μασκαρημένης δειγμάτων. Το μοντέλο προβλέπει τις αναπαραστάσεις μόνο για τις μασκαρημένες χρονικές στιγμές.

Το μοντέλο προβλέπει αναπαραστάσεις που περιέχουν όχι μόνο την τρέχουσα χρονική στιγμή, αλλά και άλλες πληροφορίες από το δείγμα, επειδή χρησιμοποιεί την αυτο-προσοχή στο δίκτυο Transformer.

Εδώ είναι πώς το μοντέλο data2vec παραμετροποιεί τη διδασκαλία για να προβλέψει τις αναπαραστάσεις του δικτύου που στη συνέχεια χρησιμεύουν ως στόχοι.

Διδακτική Παραμετροποίηση

Το μοντέλο data2vec παραμετροποιεί την κωδικοποίηση του αμάσκαρου δείγματος εκπαίδευσης με τη χρήση EMA ή Εκθετικής Κινητής Μέσης των παραμέτρων του μοντέλου (θ) όπου τα βάρη του μοντέλου στη διδασκαλία (△) είναι τα ακόλουθα

                                           ∆ ← τ∆ + (1 − τ ) θ

 

Επιπλέον, το μοντέλο προγραμματίζει για τ που αυξάνεται γραμμικά το παράμετρο από  τ0 σε τe (στόχος τιμή) σε течение των πρώτων τn ενημερώσεων. Μετά από αυτές τις ενημερώσεις, το μοντέλο διατηρεί την τιμή σταθερή μέχρι το τέλος της εκπαίδευσης.

Τα αποτελέσματα δείχνουν ότι το μοντέλο είναι πιο αποτελεσματικό και ακριβές όταν μοιράζεται τις παραμέτρους του κωδικοποιητή και του κωδικοποιητή θέσης μεταξύ της μαθητείας και της διδασκαλίας.

Στόχοι

Η κατασκευή των στόχων εκπαίδευσης εξαρτάται από την έξοδο του επάνω K μπλοκ του δικτύου διδασκαλίας για χρονικές στιγμές που είναι μασκαρημένες στη μαθητεία. Η έξοδος του μπλοκ l σε οποιαδήποτε χρονική στιγμή t σημειώνεται ως alt. Το μοντέλο στη συνέχεια εφαρμόζει normalization σε κάθε μπλοκ για να λάβει alt πριν από το να μέσο των ανώτερων K μπλοκ 

  

 

για να λάβει τον στόχο εκπαίδευσης yt για χρονική στιγμή t για ένα δίκτυο με L μπλοκ συνολικά. 

Δημιουργεί στόχους εκπαίδευσης που το μοντέλο ανακτά όταν είναι στη μαθητεία. Στις αρχικές πειραματικές δοκιμές, το μοντέλο data2vec εκτέλεσε καλά στην πρόβλεψη κάθε μπλοκ ξεχωριστά με μια αφοσιωμένη προβολή, και ήταν πολύ πιο αποτελεσματικό.

Επιπλέον, η normalization των στόχων επιτρέπει στο μοντέλο data2vec να μην καταρρέει σε σταθερές αναπαραστάσεις για χρονικές στιγμές, και να αποτρέπει τα στρώματα με υψηλή normalization να κυριαρχούν στις λειτουργίες στο σύνολο δεδομένων. Για την αναγνώριση ομιλίας, το μοντέλο χρησιμοποιεί instance normalization πάνω στο τρέχον δείγμα εισόδου χωρίς κανένα μάθημα παράμετρο.

Επιπλέον, οι ερευνητές βρήκαν ότι όταν εργάζονται με την όραση υπολογιστή και την NLP, η normalization χωρίς παράμετρο κάνει τη δουλειά επαρκώς. Το πρόβλημα μπορεί επίσης να λυθεί με Κανονικοποίηση-Αλλαγή-Συσχέτιση κανονικοποίηση, αλλά η στρατηγική που αναφέρθηκε παραπάνω εκτελείται επαρκώς, και δεν απαιτεί πρόσθετες παραμέτρους.

Αντικείμενο

Για τις αναπαραστάσεις στόχων yt, το μοντέλο χρησιμοποιεί μια Λείες L1 απώλεια για να ανακτήσει τους στόχους όπως αναφέρεται παρακάτω

Εδώ, β είναι υπεύθυνος για τη μετάβαση από μια τετραγωνική απώλεια σε μια L1 απώλεια, και εξαρτάται βαθιά από το μέγεθος του κενού μεταξύ της πρόβλεψης του μοντέλου ft(x) στη χρονική στιγμή t. Το πλεονέκτημα αυτής της απώλειας είναι ότι είναι σχετικά λιγότερο ευαίσθητο στα outliers, με την ανάγκη να ρυθμίσετε την ρύθμιση του β

Πειραματική Ρύθμιση

Το μοντέλο data2vec πειραματίζεται με δύο μεγέθη μοντέλων: data2vec Large και data2vec Base. Για την αριθμητική σταθερότητα, οι ενημερώσεις EMA γίνονται σε fp32, και τα μοντέλα περιέχουν L= 12 ή L= 24 μπλοκ Transformer με κρυφές διαστάσεις (H) = 768 ή H= 1024. 

Όραση Υπολογιστή

Το μοντέλο data2vec ενσωματώνει εικόνες 224×224 pixels ως τμήματα 16×16 pixels. Κάθε ένα από αυτά τα τμήματα μετατρέπεται γραμμικά, και μια ακολουθία με 196 αναπαραστάσεις τροφοδοτείται στο τυπικό δίκτυο Transformer. 

Το μοντέλο ακολουθεί BEiT για να μάσκαρει μπλοκ με γειτονικές μάσκες με κάθε μπλοκ που έχει τουλάχιστον 16 τμήματα με μια τυχαία αναλογία. Ωστόσο, αντί να μάσκαρει 40% του τμήματος όπως αρχικά στο μοντέλο BEiT, το μοντέλο data2vec μάσκαρει 60% του τμήματος για καλύτερη ακρίβεια. 

Επιπλέον, το μοντέλο τυχαία αναδιατάσσει τις εικόνες, αναστρέφει οριζόντια, και χρωματική παραμόρφωση. Τέλος, το μοντέλο data2vec χρησιμοποιεί την ίδια τροποποιημένη εικόνα και στη διδασκαλία και στη μαθητεία. 

Τα μοντέλα ViT-B προ-εκπαιδεύονται για 800 επαναλήψεις, και το μοντέλο data2vec χρησιμοποιεί το μέγεθος δείγματος 8,192 για το μοντέλο ViT-L, και 2,048 για το μοντέλο ViT-B. Το μοντέλο data2vec χρησιμοποιεί επίσης μια κοσμική και μια Adam πρόγραμμα με einen seul κύκλο για να θερμάνει την ταχύτητα μάθησης για 80 επαναλήψεις σε 0.001 για ViT-L, και για 40 επαναλήψεις σε 0.001 για ViT-B. 

Για cả ViT-B και ViT-L, το μοντέλο data2vec χρησιμοποιεί β = 2, K = 6 και τ = 0.9998 ως σταθερή χωρίς πρόγραμμα. Το μοντέλο χρησιμοποιεί επίσης τη στατιστική βάθους 0.2. 

Επιπλέον, για ViT-L, το μοντέλο εκπαιδεύεται για 1,600 επαναλήψεις όπου οι πρώτες 800 επαναλήψεις έχουν μια ταχύτητα μάθησης 0.9998, και στη συνέχεια το μοντέλο επαναφέρεται το πρόγραμμα ταχύτητας μάθησης, και συνεχίζει για τις επόμενες 800 επαναλήψεις με ταχύτητα μάθησης 0.9999. 

Για την ταξινόμηση εικόνων, το μοντέλο χρησιμοποιεί το μέσο-πool της έξοδου του τελευταίου μπλοκ Transformer, και τροφοδοτείται σε einen seul κλασificador με ετικέτα. Το μοντέλο στη συνέχεια προ-εκπαιδεύει το ViT-L για 50 επαναλήψεις, και ViT-B για 100 επαναλήψεις χρησιμοποιώντας την κοσμική και την Adam για να θερμάνει την ταχύτητα μάθησης. 

Επεξεργασία Ομιλίας

Για την επεξεργασία ομιλίας, το μοντέλο data2vec χρησιμοποιεί το Fairseq, ένα σετ μοντέλων για την εκπαίδευση μοντέλων για περίληψη, μετάφραση, και γενεσιουργό κειμένου. Το μοντέλο λαμβάνει 16 kHz waveform ως είσοδο που επεξεργάζεται χρησιμοποιώντας einen κωδικοποιητή χαρακτηριστικών, και περιέχει χρονικές συσχετίσεις με 512 κανάλια, πλάτος (10,3,3,3,3,2,2), και βήματα (5,2,2,2,2,2,2). 

Τα παραπάνω αποτελέσματα στην έξοδο του κωδικοποιητή είναι 50 Hz, και έχει ένα βήμα 20ms μεταξύ κάθε δείγματος. Το πεδίο λήψης του κωδικοποιητή αποτελείται από 400 εισοδικά δείγματα ή 25 ms ηχητικών δεδομένων. Η сырой waveform που τροφοδοτείται στο κωδικοποιητή είναι κανονικοποιημένη σε μονάδα διακύμανσης και μηδενική μέση τιμή

Η στρατηγική μάσκαρης που χρησιμοποιεί το μοντέλο data2vec για το μοντέλο Base μοιάζει με το πλαίσιο Baevski για την αυτο-επιβλέπουσα μάθηση στην αναγνώριση ομιλίας. Το μοντέλο δείγμα p = 0.065 για όλες τις χρονικές στιγμές για να αρχίσει τις μάσκες, και στη συνέχεια σημειώνει τις επόμενες δέκα χρονικές στιγμές. Για ένα τυπικό δείγμα εκπαίδευσης, η διαδικασία επιτρέπει σχεδόν 49% των συνολικών χρονικών στιγμών να μασκαρευτούν. 

Κατά τη διάρκεια της εκπαίδευσης, το μοντέλο data2vec γραμμικά anneals τ χρησιμοποιώντας τo = 0.999, τe = 0.9999, και τn = 30,000. Το μοντέλο data2vec χρησιμοποιεί τον Adam βελτιστοποιητή με το μέγιστο ρυθμό μάθησης 5×10-4 για το μοντέλο Base. Επιπλέον, το μοντέλο Base χρησιμοποιεί einen τρι-στάδιο πρόγραμμα που θερμαίνει τον ρυθμό μάθησης γραμμικά για το πρώτο 3% των ενημερώσεων, διατηρεί το για το επόμενο 90%, και στη συνέχεια μειώνει το για το υπόλοιπο 7%. 

Φυσική Γλώσσα

Το μοντέλο data2vec χρησιμοποιεί την κωδικοποίηση byte-pair 50K τύπων για να κωδικοποιήσει την είσοδο, και το μοντέλο στη συνέχεια μαθαίνει eine ενσωμάτωση για κάθε τύπο. Μετά την κωδικοποίηση, το μοντέλο εφαρμόζει τη στρατηγική μάσκαρης BERT σε 15% των ομοιόμορφως επιλεγμένων token, όπου 80% αντικαθίστανται από μάθημα μάσκες, 10% αντικαθίστανται από τυχαία λεξικό token, και το υπόλοιπο 10% παραμένει αμετάβλητο. 

Κατά τη διάρκεια της προ-εκπαίδευσης, το μοντέλο χρησιμοποιεί τo = 0.999, τe = 0.9999, και τn = 100,000, K= 10, και β = 4. Το μοντέλο χρησιμοποιεί τον Adam βελτιστοποιητή με einen τρι-στάδιο πρόγραμμα ταχύτητας μάθησης που θερμαίνει την ταχύτητα μάθησης γραμμικά για το πρώτο 5% των ενημερώσεων, διατηρεί το για το επόμενο 80%, και στη συνέχεια μειώνει το για το υπόλοιπο 15%, με το μέγιστο ρυθμό μάθησης 2×10-4

Επιπλέον, το μοντέλο εκπαιδεύεται σε 16 GPU με ένα μέγεθος δείγματος 256 ακολουθιών, και κάθε ακολουθία περιέχει περίπου 512 token. Για την NLP, το μοντέλο προ-εκπαιδεύεται για τέσσερις διαφορετικές ταχύτητες μάθησης: 1×10-4, 2×10-4, 3×10-4, 4×10-4, και η καλύτερη από αυτές επιλέγεται για περαιτέρω NLP εργασίες. 

Αποτελέσματα

Ας δούμε πώς το μοντέλο data2vec εκτελείται όταν εφαρμόζει τις στρατηγικές που αναφέρθηκαν παραπάνω για διαφορετικές modalities. 

Όραση Υπολογιστή

Για να αξιολογήσει τα αποτελέσματα για την όραση υπολογιστή, το μοντέλο data2vec προ-εκπαιδεύεται στις εικόνες από το ImageNet-1K σύνολο δεδομένων. Το αποτέλεσμα μοντέλο είναι προ-εκπαιδευμένο χρησιμοποιώντας τα δεδομένα ετικετών του ίδιου βENCHMARK. Σύμφωνα με την τυπική πρακτική, το μοντέλο αξιολογείται σε σχέση με top-1 ακρίβεια σε δεδομένα επαλήθευσης. 

Τα αποτελέσματα είναι στη συνέχεια διαφοροποιημένα με βάση ένα seul αυτο-επιβλεπόμενο μοντέλο, και την εκπαίδευση ενός ξεχωριστού οπτικού κωδικοποιητή σε πρόσθετα δεδομένα, ή άλλα μοντέλα αυτο-επιβλέπουσας μάθησης. 

Το παρακάτω πίνακας συγκρίνει την απόδοση του μοντέλου data2vec για την όραση υπολογιστή, και άλλα υπάρχοντα μοντέλα: ViT-L, και ViT-B. 

Τα αποτελέσματα από τον παραπάνω πίνακα μπορούν να συνοψισθούν ως εξής. 

  • Το μοντέλο data2vec υπερέχει την προηγούμενη εργασία με cả τα μοντέλα ViT-L, και ViT-B σε μοντέλο seul. 
  • Η ρύθμιση πρόβλεψης με μάσκα που χρησιμοποιείται στο αλγόριθμο data2vec για να προβλέψει αναπαραστάσεις που περιέχουν καλύτερα όταν συγκρίνεται με μεθόδους που προβλέπουν τοπικές στόχους όπως η μηχανική των οπτικών χαρακτηριστικών, τα pixel εισόδου, ή οι οπτικές μονάδες. 
  • Το μοντέλο data2vec υπερέχει επίσης τις μεθόδους αυτο-απόσταξης που ανακτά τις αναπαραστάσεις του τελικού στρώματος του μοντέλου μαθητή ενώ λαμβάνει δύο διαφορετικές αυξομειώσεις μιας εικόνας ως εισόδους. 

Ήχος και Ομιλία

Για την επεξεργασία ομιλίας, το μοντέλο data2vec εκπαιδεύεται σε περίπου 960 ώρες ήχου δεδομένων από το Librispeech(LS-960) σύνολο δεδομένων. Το σύνολο δεδομένων περιέχει καθαρό ήχο ομιλίας από ηχητικά βιβλία στην αγγλική γλώσσα, και αντιμετωπίζεται ως ένα τυπικό βENCHMARK στην βιομηχανία επεξεργασίας ομιλίας. 

Για να αναλύσει την απόδοση του μοντέλου σε διαφορετικές ρυθμίσεις πόρων, οι ερευνητές έχουν προ-εκπαιδεύσει το μοντέλο data2vec για να χρησιμοποιήσει διαφορετικές ποσότητες δεδομένων ετικετών (από λίγα λεπτά έως几 ώρες) για την αυτόματη αναγνώριση ομιλίας. Για να αναλύσει την απόδοση του μοντέλου, το data2vec συγκρίνεται με HuBERT και wav2vec 2.0, δύο από τους πιο δημοφιλείς αλγόριθμους για την εκμάθηση αναπαραστάσεων ομιλίας που βασίζονται σε διακριτές μονάδες ομιλίας. 

Ο παραπάνω πίνακας συγκρίνει την απόδοση του data2vec σε σχέση με τον ρυθμό λέξεων για αναγνώριση ομιλίας με άλλα υπάρχοντα μοντέλα. LM παραστάσεις το μοντέλο γλώσσας που χρησιμοποιείται για αποκωδικοποίηση. Τα αποτελέσματα μπορούν να συνοψισθούν ως εξής. 

  • Το μοντέλο data2vec δείχνει βελτιώσεις για τις περισσότερες ρυθμίσεις δεδομένων ετικετών με τη μεγαλύτερη κέρδη των 10 λεπτών δεδομένων ετικετών για το μοντέλο Base. 
  • Όταν πρόκειται για μεγάλα μοντέλα, το μοντέλο εκτελείται σημαντικά καλύτερα σε μικρές ρυθμίσεις δεδομένων ετικετών, και η απόδοση είναι συγκρίσιμη σε πλούσιες ρυθμίσεις δεδομένων ετικετών με πάνω από 100 και 960 ώρες δεδομένων ετικετών. Αυτό είναι επειδή η απόδοση γενικά κορυφώνεται σε πλούσιες ρυθμίσεις δεδομένων ετικετών για τα περισσότερα μοντέλα. 
  • Μετά την ανάλυση της απόδοσης, μπορεί να συναχθεί ότι όταν το μοντέλο χρησιμοποιεί πλούσιες αναπαραστάσεις στόχων, δεν είναι απαραίτητο να μάθει διακριτές μονάδες. 
  • Η μάθηση αναπαραστάσεων που περιέχουν κατά τη διάρκεια της εκπαίδευσης βοηθά στην βελτίωση της συνολικής απόδοσης σημαντικά. 

Επιπλέον, για να επικυρώσει την προσέγγιση του data2vec για αναγνώριση ομιλίας, το μοντέλο εκπαιδεύεται επίσης στο AudioSet βENCHMARK. Αν και η ρύθμιση προ-εκπαίδευσης για το AudioSet είναι παρόμοια με το Librispeech, το μοντέλο εκπαιδεύεται για K= 12, και για πάνω από 200K ενημερώσεις, όπου το μέγεθος κάθε δείγματος είναι 94.5 λεπτά. 

Το μοντέλο εφαρμόζει στη συνέχεια το DeepNorm πλαίσιο, και στρώμα normalization στα στόχους για να βοηθήσει στη σταθεροποίηση της εκπαίδευσης. Επιπλέον, το μοντέλο προ-εκπαιδεύεται σε ισορροπημένα υποσύνολα με μέγεθος δείγματος 21.3 λεπτά πάνω από 13k ενημερώσεις. Το μοντέλο χρησιμοποιεί επίσης Γραμμική Softmax Pooling και mixup με μια πιθανότητα 0.7. Το μοντέλο στη συνέχεια προσθέτει eine seule γραμμική προβολή σε 527 μοναδικές κατηγορίες ήχου, και ορίζει την ταχύτητα μάθησης της προβολής σε 2e-4. 

Επιπλέον, οι προ-εκπαιδευμένες παραμέτρους έχουν μια ταχύτητα μάθησης 3e-5, και το μοντέλο χρησιμοποιεί τεχνικές μάσκαρης για την προ-εκπαίδευση του συνόλου δεδομένων. Ο παρακάτω πίνακας συνοψίζει τα αποτελέσματα, και μπορεί να δει ότι το μοντέλο data2vec είναι ικανό να υπερέχει μια συγκρίσιμη ρύθμιση με την ίδια προ-εκπαίδευση και δεδομένα. 

Φυσική Γλώσσα

Για να αναλύσει την απόδοση του data2vec στο κείμενο, το μοντέλο ακολουθεί την ίδια ρύθμιση προ-εκπαίδευσης όπως το BERT και προ-εκπαιδεύει το μοντέλο στο αγγλικό σύνολο δεδομένων Wikipedia με πάνω από 1M ενημερώσεις, και μέγεθος δείγματος 256 ακολουθιών. Το μοντέλο αξιολογείται στο GLUE ή Γενική Αξιολόγηση Κατανόησης Γλώσσας βENCHMARK που περιλαμβάνει φυσική γλώσσα inference εργασίες (MNLI ή Πολυ-Γένη Φυσική Γλώσσα Inference), ομοιότητα προτάσεων (QQP ή Quora Question Pairs benchmark, MRPC ή Microsoft (MSFT ) Research Paragraph Corpus, και STS-B ή Σημαντική Τεκμηρίωση Ομοιότητας), ανάλυση συναισθήματος (SST-2 ή Stanford Sentiment Treebank), και γραμματικά (CoLA). 

Επιπλέον, για να προ-εκπαιδεύσει το μοντέλο data2vec, τα δεδομένα ετικετών παρέχονται από κάθε εργασία, και η μέση ακρίβεια αναφέρεται στα σύνολα επαλήθευσης με 5 προ-εκπαιδεύσεις. Ο παρακάτω πίνακας συνοψίζει την απόδοση του μοντέλου data2vec για εργασίες NLP, και τη συγκρίνει με άλλα μοντέλα. 

  • Ο παραπάνω πίνακας δείχνει ότι το μοντέλο data2vec υπερέχει το βασικό μοντέλο RoBERTa, καθώς η στρατηγική στο data2vec δεν χρησιμοποιεί τυχαίους στόχους. 
  • Το μοντέλο data2vec είναι το πρώτο επιτυχημένο προ-εκπαιδευμένο μοντέλο NLP που δεν χρησιμοποιεί διακριτές μονάδες όπως χαρακτήρες, λέξεις ή υπο-λέξεις ως στόχους εκπαίδευσης. Αντίθετα, το πλαίσιο data2vec προβλέπει αναπαραστάσεις που περιέχουν πάνω από την πλήρη αμάσκαρη ακολουθία κειμένου. 
  • Βοηθά στην δημιουργία μιας εργασίας μάθησης στην οποία το μοντέλο απαιτείται να προβλέψει στόχους με συγκεκριμένες ιδιότητες από την τρέχουσα ακολουθία αντί να προβλέψει αναπαραστάσεις που είναι γενικές για κάθε μονάδα κειμένου με συγκεκριμένη διακριτική. 
  • Επιπλέον, το σύνολο στόχων δεν είναι σταθερό, και το μοντέλο είναι ελεύθερο να ορίσει νέους στόχους, και είναι ανοιχτό σε ρυθμίσεις λεξικού. 

Αφαίρεση του Data2Vec

Η αφαίρεση είναι ένας όρος που χρησιμοποιείται για να ορίσει την αφαίρεση ενός компонента στο AI και ML συστήματα. Μια μελέτη αφαίρεσης χρησιμοποιείται για να ερευνήσει ή να αναλύσει την απόδοση ενός AI ή ML μοντέλου με την αφαίρεση ορισμένων κρίσιμων компонентів από το μοντέλο που επιτρέπει στους ερευνητές να κατανοήσουν τη συμβολή του компонента στο συνολικό σύστημα. 

Στόχοι με Μέσο

Μια σημαντική διαφορά μεταξύ data2vec και άλλων μοντέλων αυτο-επιβλέπουσας μάθησης είναι ότι το data2vec χρησιμοποιεί στόχους που βασίζονται στο μέσο πολλαπλών στρωμάτων από το δίκτυο διδασκαλίας. Η ιδέα προέρχεται από το γεγονός ότι τα πάνω πάνω στρώματα του wav2vec 2.0 μοντέλου δεν εκτελούνται καλά για εργασίες επαλήθευσης όταν συγκρίνονται με τα μεσαία στρώματα του μοντέλου. 

Στην ακόλουθη πειραματική δοκιμή, η απόδοση όλων των τριών modalities μετράται με το μέσο K= 1, 2, …, 12 στρώματα όπου K= 1 προβλέπει μόνο το πάνω στρώμα. Ωστόσο, για να εξαγάγει γρηγορότερη επιστροφή, το data2vec εκπαιδεύει το μοντέλο Base με 12 στρώματα συνολικά. Για αναγνώριση ομιλίας, το μοντέλο προ-εκπαιδεύεται σε πάνω από 200 χιλιάδες ενημερώσεις στο Librispeech, και στη συνέχεια προ-εκπαιδεύεται σε ένα 10 ωρών δεδομένων ετικετών. Για NLP, το μοντέλο αναφέρει τη μέση GLUE σκορ για το σύνολο επαλήθευσης, και προ-εκπαιδεύει το μοντέλο για 300 επαναλήψεις για την όραση υπολογιστή και στη συνέχεια αναφέρει την top-1 ακρίβεια που λαμβάνεται στο ImageNet σύνολο δεδομένων. 

Ο παραπάνω πίνακας δείχνει ότι στόχοι που βασίζονται σε πολλαπλά στρώματα γενικά βελτιώνουν όταν μόνο το πάνω στρώμα K=1 χρησιμοποιείται για όλες τις modalities. Η χρήση όλων των διαθέσιμων στρωμάτων είναι μια καλή πρακτική, καθώς τα νευρωνικά δίκτυα χτίζουν χαρακτηριστικά πάνω από διαφορετικά είδη χαρακτηριστικών, και πολλά στρώματα που εξάγονται ως στρώματα χαρακτηριστικών. 

Η χρήση χαρακτηριστικών από πολλαπλά στρώματα βοηθά στην ενίσχυση της ακρίβειας, και εμπλουτίζει τη διαδικασία αυτο-επιβλέπουσας μάθησης. 

Τύπος Στόχου

Τα μπλοκ Transformer στο μοντέλο data2vec έχουν πολλά στρώματα που μπορούν όλα να χρησιμεύσουν ως στόχοι. Για να αναλύσει πώς διαφορετικά στρώματα επηρεάζουν την απόδοση, το μοντέλο προ-εκπαιδεύεται σε μοντέλα ομιλίας Librispeech που χρησιμοποιούν διαφορετικά στρώματα ως στόχους. 

Ο παρακάτω πίνακας δείχνει σαφώς ότι η έξοδος του feed forward network ή του FFN λειτουργεί ιδανικά, ενώ η έξοδος των μπλοκ αυτο-προσοχής δεν οδηγεί σε ένα χρηστικό μοντέλο. 

Στόχοι που Περιέχουν

Οι αναπαραστάσεις διδασκαλίας στο μοντέλο data2vec χρησιμοποιούν αυτο-προσοχή σε όλη την είσοδο για να παράγουν στόχους που περιέχουν. Αυτό είναι αυτό που διακρίνει το data2vec από άλλα μοντέλα αυτο-επιβλέπουσας μάθησης που κατασκευάζουν μια εργασία μάθησης ανακατασκευάζοντας ή προβλέποντας τοπικά τμήματα της εισόδου. Αυτό θέτει το ερώτημα: χρειάζεται το data2vec στόχους που περιέχουν για να λειτουργήσει καλά; 

Για να απαντήσει στο ερώτημα, οι ερευνητές κατασκευάζουν στόχους που δεν έχουν πρόσβαση σε όλη την είσοδο, αλλά μόνο σε ένα τμήμα της που προκαθορίζεται. Το μοντέλο στη συνέχεια περιορίζει την αυτο-προσοχή του διδασκαλίας που επιτρέπει να έχει πρόσβαση μόνο σε ένα τμήμα του περιβάλλοντος εισόδου. Μετά την εκπαίδευση, το μοντέλο προ-εκπαιδεύεται για να έχει πρόσβαση σε πλήρη περιβάλλον μεγέθους. 

Ο παρακάτω πίνακας δείχνει ότι μεγαλύτερα μεγέθη περιβάλλοντος συχνά οδηγούν σε καλύτερη απόδοση, και όταν όλη η είσοδος είναι ορατή, αποδίδει την καλύτερη ακρίβεια. Αυτό αποδεικνύει ότι πλούσιες αναπαραστάσεις στόχων μπορούν να οδηγήσουν σε καλύτερη απόδοση. 

Ειδικοί Χαρακτηρισμοί και Μάσκα

Ο κύριος στόχος του data2vec είναι να σχεδιάσει μια απλή διαδικασία μάθησης που μπορεί να λειτουργήσει με διαφορετικές modalities. Αυτό είναι επειδή, αν και τα τρέχοντα μοντέλα και πλαίσια έχουν μια ενοποιημένη διαδικασία μάθησης, vẫn χρησιμοποιούν ειδικούς χαρακτηρισμοί και μάσκες. 

Είναι λογικό ότι τα πλαίσια λειτουργούν κυρίως με μια seule modality, δεδομένου του χαρακτήρα της εισόδου που διαφέρει πολύ από το ένα στο άλλο. Για παράδειγμα, μοντέλα αναγνώρισης ομιλίας χρησιμοποιούν υψηλής ανάλυσης είσοδο (όπως 10 kHz waveform) που συνήθως έχουν χιλιάδες δείγματα. Η waveform στη συνέχεια επεξεργάζεται από το πλαίσιο χρησιμοποιώντας ένα πολυσχέδιο 1-D συνελικτικό νευρωνικό δίκτυο για να λάβει ακολουθίες χαρακτηριστικών 50 Hz. 

Δομημένοι και Στόχοι που Περιέχουν

Ο κύριος διαφορετικός σημείο μεταξύ του data2vec και άλλων μοντέλων πρόβλεψης με μάσκα είναι ότι στο data2vec, τα χαρακτηριστικά των στόχων εκπαίδευσης είναι αναπαραστάσεις που περιέχουν. Αυτές οι αναπαραστάσεις χτίζονται χρησιμοποιώντας αυτο-προσοχή σε όλη την μασκαρημένη είσοδο στη διδασκαλία. 

Άλλα πλαίσια όπως BYOL (Bootstrap Your Own Latent) ή DINO επίσης χρησιμοποιούν αναπαραστάσεις που περιέχουν όπως το data2vec, αλλά ο κύριος στόχος τους είναι να μάθουν αναπαραστάσεις που είναι ανεξάρτητες από μετασχηματισμούς. 

Τελικές Σκέψεις

Πρόσφατη εργασία στη βιομηχανία AI και ML έχει δείξει ότι ενοποιημένες αρχιτεκτονικές μοντέλων possono να είναι μια αποτελεσματική προσέγγιση για την αντιμετώπιση πολλών modalities. Το μοντέλο data2vec χρησιμοποιεί μια αυτο-επιβλεπόμενη προσέγγιση για να λειτουργήσει με τρεις modalities: ομιλία, εικόνες και γλώσσα. 

Η κεντρική ιδέα πίσω από το μοντέλο data2vec είναι να χρησιμοποιήσει μια μερική προβολή της εισόδου για να ανακτήσει πληροφορίες που περιέχουν ή εισόδου. Η προσέγγιση που χρησιμοποιείται από το data2vec είναι αποτελεσματική, καθώς το μοντέλο εκτελείται καλύτερα από προηγούμενα μοντέλα αυτο-επιβλέπουσας μάθησης στο ImageNet-1K σύνολο δεδομένων για cả τα μοντέλα ViT-B και ViT-L. 

Το data2vec είναι πραγματικά ένα ορόσημο στη βιομηχανία αυτο-επιβλέπουσας μάθησης, καθώς αποδεικνύει ότι μια seule μέθοδος μάθησης για πολλές modalities μπορεί να κάνει πιο εύκολη για τα μοντέλα να μάθουν σε διαφορετικές modalities. 

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.