Μοντέλα και πλατφόρμες AI

SEER: Μια Επανάσταση στις Αυτο-Επιβλεπόμενες Μονάδες Máy Vision

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
SEER Framework for Self Supervised Learning

Τις τελευταίες δεκαετίες, η Τεχνητή Νοημοσύνη (AI) και η Μηχανική Μάθηση (ML) έχουν καταγράψει τεράστια πρόοδο. Σήμερα, είναι πιο ακριβείς, αποτελεσματικές και ικανές από ποτέ. Τα σύγχρονα μοντέλα AI και ML μπορούν να αναγνωρίσουν αντικείμενα σε εικόνες ή αρχεία βίντεο με ακρίβεια. Επιπλέον, μπορούν να παράγουν κείμενο και ομιλία που μοιάζει με την ανθρώπινη νοημοσύνη.

Τα μοντέλα AI και ML της εποχής μας βασίζονται σε μεγάλο βαθμό στην εκπαίδευση σε δεδομένα που έχουν ετικέτες που τους διδάσκουν πώς να ερμηνεύουν ένα μπλοκ κειμένου, να αναγνωρίζουν αντικείμενα σε μια εικόνα ή καρέ βίντεο και πολλά άλλα.

Παρά τις ικανότητές τους, τα μοντέλα AI και ML δεν είναι τέλεια, και οι επιστήμονες εργάζονται για την κατασκευή μοντέλων που μπορούν να μάθουν από τις πληροφορίες που τους δίνονται, χωρίς να βασίζονται σε ετικέτες ή δεδομένα που έχουν αναλυθεί. Αυτή η προσέγγιση ονομάζεται αυτο-επιβλεπόμενη μάθηση, και είναι μια από τις πιο αποτελεσματικές μεθόδους για την κατασκευή μοντέλων ML και AI που έχουν το “κοινό σENSE” ή γνώσεις για να λύσουν προβλήματα που είναι πέρα από τις δυνατότητες των μοντέλων AI σήμερα.

Η αυτο-επιβλεπόμενη μάθηση έχει ήδη δείξει τα αποτελέσματα της σε φυσική επεξεργασία γλώσσας, καθώς έχει επιτρέψει στους développers να εκπαιδεύσουν μεγάλα μοντέλα που μπορούν να δουλέψουν με τεράστιο όγκο δεδομένων και έχει οδηγήσει σε πολλές επαναστάσεις σε πεδία όπως η φυσική απόδοση, η μηχανική μετάφραση και η απάντηση σε ερωτήσεις.

Το μοντέλο SEER από την Facebook (META ) AI στοχεύει στο να μεγιστοποιήσει τις ικανότητες της αυτο-επιβλεπόμενης μάθησης στον τομέα της όρασης υπολογιστή. SEER ή SElf SupERvised είναι ένα αυτο-επιβλεπόμενο μοντέλο μάθησης όρασης υπολογιστή που έχει πάνω από 1 δισεκατομμύριο παραμέτρους, και είναι ικανό να ανακαλύπτει μοτίβα ή να μαθαίνει ακόμη και από μια τυχαία ομάδα εικόνων που βρέθηκαν στο διαδίκτυο χωρίς σωστές ετικέτες ή ετικέτες.

Η Ανάγκη για Αυτο-Επιβλεπόμενη Μάθηση στην Όραση Υπολογιστή

Η ετικέτα δεδομένων ή η ετικέτα δεδομένων είναι ένα στάδιο προ-επεξεργασίας στην ανάπτυξη μοντέλων μηχανικής μάθησης και τεχνητής νοημοσύνης. Η διαδικασία ετικέτας δεδομένων αναγνωρίζει τα сыρα δεδομένα όπως εικόνες ή καρέ βίντεο και στη συνέχεια προσθέτει ετικέτες στα δεδομένα για να ορίσει το контекст των δεδομένων για το μοντέλο. Αυτές οι ετικέτες επιτρέπουν στο μοντέλο να κάνει ακριβείς προβλέψεις στα δεδομένα.

Ένα από τα μεγαλύτερα εμπόδια που αντιμετωπίζουν οι développers όταν εργάζονται σε μοντέλα όρασης υπολογιστή είναι η αναζήτηση υψηλής ποιότητας ετικετών δεδομένων. Όραση Υπολογιστή μοντέλα σήμερα βασίζονται σε αυτά τα δεδομένα με ετικέτες για να μάθουν τα μοτίβα που τους επιτρέπουν να αναγνωρίσουν αντικείμενα σε μια εικόνα.

Η ετικέτα δεδομένων και η χρήση της σε μοντέλα όρασης υπολογιστή θέτουν τα ακόλουθα προβλήματα:

Διαχείριση Συνεπούς Ποιότητας Δεδομένων

Πιθανότατα το μεγαλύτερο εμπόδιο που αντιμετωπίζουν οι développers είναι να αποκτήσουν πρόσβαση σε υψηλής ποιότητας δεδομένα συνεχώς, επειδή υψηλής ποιότητας δεδομένα με σωστές ετικέτες και σαφείς εικόνες οδηγούν σε καλύτερη μάθηση και ακριβή μοντέλα. Ωστόσο, η πρόσβαση σε υψηλής ποιότητας δεδομένα συνεχώς έχει τα δικά της προβλήματα.

Διαχείριση Εργατικού Δυναμικού

Η ετικέτα δεδομένων συχνά συνοδεύεται από προβλήματα διαχείρισης εργατικού δυναμικού, κυρίως επειδή ένας μεγάλος αριθμός εργαζομένων απαιτείται για την επεξεργασία και ετικέτα μεγάλων ποσοτήτων μη δομημένων και μη ετικετών δεδομένων, ενώ διασφαλίζεται η ποιότητα. Έτσι, είναι απαραίτητο για τους développers να βρουν μια ισορροπία μεταξύ ποιότητας και ποσότητας όταν πρόκειται για ετικέτα δεδομένων.

Οικονομικοί Περιορισμοί

Πιθανότατα το μεγαλύτερο εμπόδιο είναι οι οικονομικοί περιορισμοί που συνοδεύουν τη διαδικασία ετικέτας δεδομένων, και συχνά το κόστος ετικέτας δεδομένων είναι ένα σημαντικό ποσοστό του συνολικού κόστους του έργου.

Όπως μπορείτε να δείτε, η ετικέτα δεδομένων είναι ένα σημαντικό εμπόδιο στην ανάπτυξη προηγμένων μοντέλων όρασης υπολογιστή, ιδιαίτερα όταν πρόκειται για την ανάπτυξη σύνθετων μοντέλων που αντιμετωπίζουν μεγάλο όγκο δεδομένων. Είναι ο λόγος για τον οποίο η βιομηχανία όρασης υπολογιστή χρειάζεται αυτο-επιβλεπόμενη μάθηση για να αναπτύξει σύνθετα και προηγμένα μοντέλα όρασης υπολογιστή που είναι ικανά να αντιμετωπίσουν εργασίες που είναι πέρα από τις δυνατότητες των τρεχοντων μοντέλων.

Με αυτά τα λεγόμενα, υπάρχουν ήδη πολλά μοντέλα αυτο-επιβλεπόμενης μάθησης που έχουν επιδείξει καλά αποτελέσματα σε ελεγχόμενο περιβάλλον, και κυρίως στο σύνολο δεδομένων ImageNet. Αν και αυτά τα μοντέλα μπορεί να κάνουν καλή δουλειά, δεν ικανοποιούν την πρωταρχική προϋπόθεση της αυτο-επιβλεπόμενης μάθησης στην όραση υπολογιστή: να μάθουν από οποιοδήποτε μη ελεγχόμενο σύνολο δεδομένων ή τυχαία εικόνα, και όχι μόνο από ένα καλά ορισμένο σύνολο δεδομένων. Όταν εφαρμόζεται ιδανικά, η αυτο-επιβλεπόμενη μάθηση μπορεί να βοηθήσει στην ανάπτυξη πιο ακριβών και ικανών μοντέλων όρασης υπολογιστή που είναι οικονομικά και βιώσιμα.

SEER ή SElf-supERvised Μοντέλο: Eine Εισαγωγή

Οι πρόσφατες τάσεις στη βιομηχανία AI και ML έχουν δείξει ότι οι προσεγγίσεις προ-εκπαίδευσης όπως η ημι-εποπτική, η ασθενώς εποπτική και η αυτο-επιβλεπόμενη μάθηση μπορούν να βελτιώσουν σημαντικά την απόδοση για τα περισσότερα μοντέλα μηχανικής μάθησης για εργασίες μετά-μετατόπισης.

Υπάρχουν δύο βασικοί παράγοντες που έχουν συνεισφέρει σημαντικά στην αύξηση της απόδοσης αυτών των μοντέλων μηχανικής μάθησης.

Προ-Εκπαίδευση σε Μεγάλους Συνόλους Δεδομένων

Η προ-εκπαίδευση σε μεγάλους συνόλους δεδομένων συνήθως οδηγεί σε καλύτερη ακρίβεια και απόδοση, επειδή εκθέτει το μοντέλο σε ένα ευρύ φάσμα δεδομένων. Ένα μεγάλο σύνολο δεδομένων επιτρέπει στα μοντέλα να κατανοήσουν τα μοτίβα στα δεδομένα καλύτερα, και τελικά οδηγεί σε καλύτερη απόδοση σε πραγματικές συνθήκες.

Nieka από τα καλύτερα μοντέλα, όπως το GPT-3 και το Wav2vec 2.0, εκπαιδεύονται σε μεγάλους συνόλους δεδομένων. Το μοντέλο GPT-3 χρησιμοποιεί ένα σύνολο προ-εκπαίδευσης με πάνω από 300 δισεκατομμύρια λέξεις, ενώ το μοντέλο Wav2vec 2.0 για αναγνώριση ομιλίας χρησιμοποιεί ένα σύνολο δεδομένων με πάνω από 53 χιλιάδες ώρες ήχου.

Μοντέλα Με Μεγάλες Ικανότητες

Μοντέλα με μεγαλύτερο αριθμό παραμέτρων συχνά οδηγούν σε ακριβή αποτελέσματα, επειδή ένας μεγαλύτερος αριθμός παραμέτρων επιτρέπει στο μοντέλο να εστιάσει μόνο στα αντικείμενα στα δεδομένα που είναι απαραίτητα, αντί να εστιάσει στα εμπόδια ή θόρυβο στα δεδομένα.

Οι développers στο παρελθόν έχουν κάνει προσπάθειες να εκπαιδεύσουν μοντέλα αυτο-επιβλεπόμενης μάθησης σε μη ετικετών και μη ελεγχόμενα δεδομένα, αλλά με μικρότερα συνόλους δεδομένων που περιείχαν μόνο quelques εκατομμύρια εικόνες. Αλλά μπορούν τα μοντέλα αυτο-επιβλεπόμενης μάθησης να οδηγήσουν σε υψηλή ακρίβεια όταν εκπαιδεύονται σε μεγάλο όγκο μη ετικετών και μη ελεγχόμενων δεδομένων; Đây είναι ακριβώς το ερώτημα που το μοντέλο SEER στοχεύει να απαντήσει.

Το SEER μοντέλο είναι ένα πλαίσιο μηχανικής μάθησης που στοχεύει να καταγράψει εικόνες διαθέσιμες στο διαδίκτυο ανεξάρτητα από ελεγχόμενα ή ετικετών δεδομένα. Το SEER πλαίσιο επιτρέπει στους développers να εκπαιδεύουν μεγάλα και σύνθετα μοντέλα ML σε τυχαία δεδομένα χωρίς εποπτεία, δηλαδή το μοντέλο αναλύει τα δεδομένα και μαθαίνει τα μοτίβα ή τις πληροφορίες με δική του πρωτοβουλία, χωρίς καμία προκαταρκτική ανθρώπινη εισαγωγή.

Ο τελικός στόχος του μοντέλου SEER είναι να βοηθήσει στην ανάπτυξη στρατηγικών για τη διαδικασία προ-εκπαίδευσης που χρησιμοποιούν μη ελεγχόμενα δεδομένα για να παραδώσουν κορυφαία απόδοση μετατόπισης. Επιπλέον, το SEER μοντέλο στοχεύει επίσης στη δημιουργία συστημάτων που μπορούν να μάθουν συνεχώς από ένα ατελείωτο ρεύμα δεδομένων με αυτο-επιβλεπόμενο τρόπο.

Το SEER πλαίσιο εκπαιδεύει μοντέλα υψηλής ικανότητας σε δισεκατομμύρια τυχαίες και μη ελεγχόμενες εικόνες που εξαγονται από το διαδίκτυο. Τα μοντέλα που εκπαιδεύονται σε αυτές τις εικόνες δεν βασίζονται στις ετικέτες ή τις ετικέτες εικόνας για να εκπαιδεύσουν το μοντέλο, ή να φιλτράρουν τα δεδομένα. Σε πρόσφατο χρόνο, η αυτο-επιβλεπόμενη μάθηση έχει δείξει υψηλό δυναμικό ως εκπαίδευση μοντέλων σε μη ελεγχόμενα δεδομένα έχει οδηγήσει σε καλύτερα αποτελέσματα όταν συγκρίνεται με προ-εκπαιδευμένα μοντέλα για εργασίες μετά-μετατόπισης.

SEER Πλαίσιο και RegNet: Ποια είναι η Σύνδεση;

Για να αναλύσουμε το SEER μοντέλο, επικεντρωνόμαστε στο RegNet αρχιτεκτονική με πάνω από 700 εκατομμύρια παραμέτρους που συμφωνούν με τον στόχο του SEER για αυτο-επιβλεπόμενη μάθηση σε μη ελεγχόμενα δεδομένα για δύο βασικούς λόγους:

  1. Προσφέρουν μια ιδανική ισορροπία μεταξύ απόδοσης και αποτελεσματικότητας.
  2. Είναι πολύ ευέλικτα και μπορούν να χρησιμοποιηθούν για να κλιμακωθούν για έναν αριθμό παραμέτρων.

SEER Πλαίσιο: Προηγούμενη Εργασία από Διαφορετικές Περιοχές

Το SEER πλαίσιο στοχεύει να εξερευνήσει τα όρια της εκπαίδευσης μεγάλων αρχιτεκτονικών μοντέλων σε μη ελεγχόμενα ή μη ετικετών δεδομένα χρησιμοποιώντας αυτο-επιβλεπόμενη μάθηση, και το μοντέλο αναζητά έμπνευση από προηγούμενη εργασία στο πεδίο.

Ανεπόπτη Προ-Εκπαίδευση Οπτικών Ιδιοτήτων

Η αυτο-επιβλεπόμενη μάθηση έχει εφαρμοστεί στην όραση υπολογιστή για κάποιο χρόνο τώρα με μεθόδους που χρησιμοποιούν αυτο-εγκωδώσεις, διακρίσεις επιπέδου экземпляρ, ή συσσωμάτωση. Σε πρόσφατο χρόνο, μεθόδους που χρησιμοποιούν αντιθετική μάθηση έχουν δείξει ότι η προ-εκπαίδευση μοντέλων χρησιμοποιώντας ανεπόπτη μάθηση για εργασίες μετά-μετατόπισης μπορεί να επιτύχει καλύτερα αποτελέσματα από μια εποπτική προσέγγιση.

Η κύρια λήψη από την ανεπόπτη μάθηση οπτικών ιδιοτήτων είναι ότι όσο είστε εκπαιδεύοντας σε φιλτραρισμένα δεδομένα, εποπτικές ετικέτες δεν απαιτούνται. Το SEER μοντέλο στοχεύει να εξερευνήσει αν το μοντέλο μπορεί να μάθει ακριβείς αναπαραστάσεις όταν μεγάλες αρχιτεκτονικές μοντέλων εκπαιδεύονται σε μεγάλο όγκο μη ελεγχόμενων, μη ετικετών και τυχαίων εικόνων.

Μάθηση Οπτικών Ιδιοτήτων σε Κλίμακα

Προηγούμενα μοντέλα έχουν επωφεληθεί από την προ-εκπαίδευση των μοντέλων σε μεγάλα ετικετών συνόλους δεδομένων με ασθενώς εποπτική μάθηση, εποπτική μάθηση και ημι-εποπτική μάθηση σε εκατομμύρια φιλτραρισμένες εικόνες. Επιπλέον, ανάλυση μοντέλων έχει επίσης δείξει ότι η προ-εκπαίδευση του μοντέλου σε δισεκατομμύρια εικόνες συχνά οδηγεί σε καλύτερη ακρίβεια όταν συγκρίνεται με την εκπαίδευση του μοντέλου από την αρχή.

Επιπλέον, η εκπαίδευση του μοντέλου σε μεγάλη κλίμακα συνήθως βασίζεται σε βήματα φιλτραρίσματος δεδομένων για να κάνουν τις εικόνες να ταιριάζουν με τους στόχους εννοιών. Αυτά τα βήματα φιλτραρίσματος είτε χρησιμοποιούν προβλέψεις από ένα προ-εκπαιδευμένο ταξινομητή, είτε χρησιμοποιούν hashtags που είναι συχνά συστήματα των ImageNet κατηγοριών. Το SEER μοντέλο λειτουργεί διαφορετικά, καθώς στοχεύει να μάθει ιδιότητες σε οποιαδήποτε τυχαία εικόνα, και επομένως τα δεδομένα εκπαίδευσης για το SEER μοντέλο δεν είναι ελεγχόμενα για να ταιριάζουν σε ένα προκαθορισμένο σύνολο ιδιοτήτων ή εννοιών.

Κλιμάκωση Αρχιτεκτονικών για Αναγνώριση Εικόνων

Μοντέλα συνήθως επωφελούνται από την εκπαίδευση μεγάλων αρχιτεκτονικών σε καλύτερη ποιότητα οπτικών ιδιοτήτων. Είναι απαραίτητο να εκπαιδεύσετε μεγάλες αρχιτεκτονικές όταν η προ-εκπαίδευση σε μεγάλο σύνολο δεδομένων είναι σημαντική, επειδή ένα μοντέλο με περιορισμένη ικανότητα θα συχνά υπο-ανταποκριθεί. Έχει ακόμη μεγαλύτερη σημασία όταν η προ-εκπαίδευση γίνεται μαζί με αντιθετική μάθηση, επειδή σε τέτοιες περιπτώσεις, το μοντέλο πρέπει να μάθει πώς να διακρίνει μεταξύ στιγμιότυπων του συνόλου δεδομένων, ώστε να μάθει καλύτερες οπτικές αναπαραστάσεις.

Ωστόσο, για την αναγνώριση εικόνων, η κλιμάκωση αρχιτεκτονικής περιλαμβάνει πολύ περισσότερα από το να αλλάξει το βάθος και το πλάτος του μοντέλου, και για να κατασκευάσετε ένα μοντέλο με υψηλή ικανότητα, χρειάζεται πολλή βιβλιογραφία. Το SEER μοντέλο δείχνει τα οφέλη της χρήσης της RegNets οικογένειας μοντέλων για την ανάπτυξη αυτο-επιβλεπόμενης μάθησης σε μεγάλη κλίμακα.

SEER: Μέθοδοι και Συνιστώσες Χρήσης

Το SEER πλαίσιο χρησιμοποιεί eine ποικιλία μεθόδων και συνιστωσών για να προ-εκπαιδεύσει το μοντέλο να μάθει οπτικές αναπαραστάσεις. Nieka από τις κύριες μέθοδοι και συνιστώσες που χρησιμοποιούνται από το SEER πλαίσιο είναι: RegNet, και SwAV. Ας αναλύσουμε τις μέθοδοι και συνιστώσες που χρησιμοποιούνται στο SEER πλαίσιο συνοπτικά.

Αυτο-Επιβλεπόμενη Προ-Εκπαίδευση με SwAV

Το SEER πλαίσιο προ-εκπαιδεύεται με SwAV, μια αυτο-επιβλεπόμενη μάθηση προσέγγιση online. SwAV είναι μια μεθοδος online συσσωμάτωσης που χρησιμοποιείται για να εκπαιδεύσει convnets πλαίσιο χωρίς ετικέτες. Το SwAV πλαίσιο λειτουργεί εκπαιδεύοντας μια εμβυθύτητα που παράγει αναθέσεις cluster συνεχώς μεταξύ διαφορετικών προβολών της ίδιας εικόνας. Το σύστημα στη συνέχεια μαθαίνει σημασιολογικές αναπαραστάσεις εξορύσσοντας clusters που είναι αμετάβλητες ως προς τις διακρίσεις δεδομένων.

Στην πράξη, το SwAV πλαίσιο συγκρίνει τα χαρακτηριστικά των διαφορετικών προβολών μιας εικόνας χρησιμοποιώντας τις ανεξάρτητες αναθέσεις cluster. Αν αυτές οι αναθέσεις συλλαμβάνουν τα ίδια ή παρόμοια χαρακτηριστικά, είναι δυνατό να προβλεφθεί η ανάθεση μιας εικόνας χρησιμοποιώντας την αναπαράσταση χαρακτηριστικών μιας άλλης προβολής.

Το SEER μοντέλο θεωρεί ένα σύνολο K clusters, και κάθε cluster είναι συσχετισμένο με μια μαθητέα d-διαστατική διανυσματική vk. Για μια παρτίδα B εικόνων, κάθε εικόνα i μετατρέπεται σε δύο διαφορετικές προβολές: xi1 , και xi2. Οι προβολές στη συνέχεια αναπαρίστανται με την βοήθεια ενός convnet, και το αποτέλεσμα είναι δύο σύνολα χαρακτηριστικών: (f11, …, fB2), και (f12, … , fB2). Κάθε σύνολο χαρακτηριστικών αναθέτει ανεξάρτητα σε cluster prototypes με την βοήθεια ενός Optimal Transport λυτή.

Ο Optimal Transport λυτής διασφαλίζει ότι τα χαρακτηριστικά χωρίζονται ισομερώς μεταξύ των clusters, και βοηθά στην αποφυγή εύκολων λύσεων όπου όλες οι αναπαραστάσεις χαρτογραφούνται σε ένα μόνο πρωτότυπο. Η ανταπόκριση που προκύπτει στη συνέχεια ανταλλάσσεται μεταξύ δύο συνόλων: η ανάθεση cluster yi1 της προβολής xi1 χρειάζεται να προβλεφθεί χρησιμοποιώντας την αναπαράσταση χαρακτηριστικών fi2 της προβολής xi2, και αντίστροφα.

Τα βάρη πρωτοτύπου και convnet εκπαιδεύονται για να ελαχιστοποιήσουν την απώλεια για όλα τα παραδείγματα. Η απώλεια προβλέψεως cluster l είναι ουσιαστικά η διακρίνουσα εντροπία μεταξύ μιας softmax του dot προϊόντος f, και ανάθεσης cluster.

RegNetY: Κλιμάκωση Ικανότητας Μοντέλου

Η κλιμάκωση ικανότητας μοντέλου και δεδομένων απαιτεί αρχιτεκτονικές που είναι αποτελεσματικές όχι μόνο σε όρους μνήμης, αλλά και σε όρους χρόνου εκτέλεσης και το RegNets πλαίσιο είναι μια οικογένεια μοντέλων που σχεδιάστηκε ειδικά για αυτόν τον σκοπό.

Η RegNet οικογένεια αρχιτεκτονικής ορίζεται από ένα χώρο σχεδίασης convnets με 4 στάδια όπου κάθε στάδιο περιέχει μια σειρά ταυτόσημων μπλοκ ενώ διασφαλίζει ότι η δομή του μπλοκ παραμένει σταθερή, κυρίως το残ικό μπουκάλι.

Το SEER πλαίσιο επικεντρώνεται στο RegNetY αρχιτεκτονική και προσθέτει μια Squeeze-and-Excitation στην τυπική RegNets αρχιτεκτονική σε μια προσπάθεια να βελτιώσει την απόδοσή τους. Επιπλέον, το RegNetY μοντέλο έχει 5 παραμέτρους που βοηθούν στην αναζήτηση καλών στιγμιοτύπων με einen σταθερό αριθμό FLOPs που καταναλώνουν εύλογες πόρους. Το SEER μοντέλο στοχεύει να βελτιώσει τα αποτελέσματά του εφαρμόζοντας την RegNetY αρχιτεκτονική απευθείας στην αυτο-επιβλεπόμενη προ-εκπαίδευση.

Η RegNetY 256GF Αρχιτεκτονική: Το SEER μοντέλο επικεντρώνεται κυρίως στην RegNetY 256GF αρχιτεκτονική στην RegNetY οικογένεια, και οι παραμέτρους της χρησιμοποιούν τον κανόνα κλιμάκωσης της RegNets αρχιτεκτονικής. Οι παραμέτρους περιγράφονται ως εξής.

Η RegNetY 256GF αρχιτεκτονική έχει 4 στάδια με πλάτος σταδίου (528, 1056, 2904, 7392), και βάθος σταδίου (2,7,17,1) που προστίθενται σε πάνω από 696 εκατομμύρια παραμέτρους. Όταν εκπαιδεύεται σε 512 V100 32GB NVIDIA GPUs, κάθε επανάληψη διαρκεί περίπου 6125ms για μια παρτίδα 8,704 εικόνων. Η εκπαίδευση του μοντέλου σε ένα σύνολο δεδομένων με πάνω από 1 δισεκατομμύριο εικόνες, με μια παρτίδα 8,704 εικόνων σε πάνω από 512 GPUs, απαιτεί 114,890 επαναλήψεις, και η εκπαίδευση διαρκεί περίπου 8 ημέρες.

Βελτιστοποίηση και Εκπαίδευση σε Κλίμακα

Το SEER μοντέλο προτείνει beberapa προσαρμογές για να εκπαιδεύσει αυτο-επιβλεπόμενες μεθόδους και να τις προσαρμόσει σε μεγάλη κλίμακα. Αυτές οι μεθόδους είναι:

  1. Χρονοδιάγραμμα ταχύτητας μάθησης.
  2. Μείωση κατανάλωσης μνήμης ανά GPU.
  3. Βελτιστοποίηση ταχύτητας εκπαίδευσης.
  4. Προ-εκπαίδευση δεδομένων σε μεγάλη κλίμακα.

Ας αναλύσουμε αυτά τα σημεία συνοπτικά.

Χρονοδιάγραμμα Ταχύτητας Μάθησης

Το SEER μοντέλο εξερευνά την πιθανότητα χρήσης δύο χρονοδιαγραμμάτων ταχύτητας μάθησης: το χρονοδιάγραμμα ταχύτητας μάθησης cosine wave, και το σταθερό χρονοδιάγραμμα ταχύτητας μάθησης.

Το χρονοδιάγραμμα ταχύτητας μάθησης cosine wave χρησιμοποιείται για την σύγκριση διαφορετικών μοντέλων δίκαια, καθώς προσαρμόζεται στον αριθμό των ενημερώσεων. Ωστόσο, το χρονοδιάγραμμα ταχύτητας μάθησης cosine wave δεν προσαρμόζεται σε μια μεγάλη κλίμακα εκπαίδευσης, κυρίως επειδή ζυγίζει τις εικόνες διαφορετικά με βάση το πότε εμφανίζονται κατά την εκπαίδευση, και επίσης χρησιμοποιεί πλήρεις ενημερώσεις για χρονοδιαγράμματα.

Το σταθερό χρονοδιάγραμμα ταχύτητας μάθησης διατηρεί την ταχύτητα μάθησης σταθερή μέχρι την απώλεια να μην είναι αυξανόμενη, και στη συνέχεια η ταχύτητα μάθησης διαιρείται με 2. Η ανάλυση δείχνει ότι το σταθερό χρονοδιάγραμμα ταχύτητας μάθησης λειτουργεί καλύτερα, καθώς έχει χώρο για να κάνει την εκπαίδευση πιο ευέλικτη. Ωστόσο, επειδή το μοντέλο εκπαιδεύεται μόνο σε 1 δισεκατομμύριο εικόνες, χρησιμοποιεί το χρονοδιάγραμμα ταχύτητας μάθησης cosine wave για την εκπαίδευση του μεγαλύτερου μοντέλου, το RegNet 256GF.

Μείωση Κατανάλωσης Μνήμης ανά GPU

Το μοντέλο στοχεύει επίσης στη μείωση της ποσότητας GPU που απαιτείται κατά την περίοδο εκπαίδευσης, χρησιμοποιώντας μεικτή ακρίβεια και checkpointing. Το μοντέλο χρησιμοποιεί την NVIDIA Apex Library’s O1 Optimization level για να εκτελέσει λειτουργίες όπως convolutions και GEMMs σε 16-bit floating point ακρίβεια. Το μοντέλο χρησιμοποιεί επίσης την υλοποίηση gradient checkpointing του PyTorch, η οποία ανταλλάσσει υπολογιστές για μνήμη.

Επιπλέον, το μοντέλο απορρίπτει οποιαδήποτε ενδιάμεση ενεργοποίηση που γίνεται κατά την εμπρόσθια διαδρομή, και κατά την οπίσθια διαδρομή, επαναλαμβάνει αυτές τις ενεργοποιήσεις.

Βελτιστοποίηση Ταχύτητας Εκπαίδευσης

Η χρήση μεικτής ακρίβειας για την βελτιστοποίηση της μνήμης έχει επιπλέον οφέλη, καθώς οι επιταχυντές επωφελούνται από τη μείωση του μεγέθους FP16 σε σύγκριση με το FP32. Βοηθά στην ταχύτητα της εκπαίδευσης, βελτιώνοντας το μνήμη-εύρος ζώνης.

Το SEER μοντέλο συγχρονίζει επίσης το BatchNorm στρώμα σε όλα τα GPUs για να δημιουργήσει ομάδες διαδικασίας αντί για τη χρήση της καθολικής συγχρονισμού, η οποία συνήθως διαρκεί περισσότερο χρόνο. Τέλος, ο data loader που χρησιμοποιείται στο SEER μοντέλο προ-φόρτωση περισσότερων εκπαιδευτικών παρτίδων, οδηγώντας σε μεγαλύτερη ποσότητα δεδομένων που περνάει από το σύστημα.

Προ-Εκπαίδευση Δεδομένων σε Μεγάλη Κλίμακα

Το SEER μοντέλο χρησιμοποιεί πάνω από 1 δισεκατομμύριο εικόνες κατά την προ-εκπαίδευση, και θεωρεί έναν data loader που δειγματολήπτει τυχαίες εικόνες απευθείας από το διαδίκτυο και το Instagram. Επειδή το SEER μοντέλο εκπαιδεύει αυτές τις εικόνες στο wild και online, δεν εφαρμόζει καμία προ-επεξεργασία σε αυτές τις εικόνες ούτε τις φιλτράρει χρησιμοποιώντας διαδικασίες όπως απαλοιφή διπλοτύπων ή φιλτράρισμα hashtags.

Αξίζει να σημειωθεί ότι το σύνολο δεδομένων δεν είναι στατικό, και οι εικόνες στο σύνολο δεδομένων ανανεώνονται κάθε τρεις μήνες. Ωστόσο, η ανανέωση του συνόλου δεδομένων δεν επηρεάζει την απόδοση του μοντέλου.

SEER Μοντέλο Υλοποίηση

Το SEER μοντέλο προ-εκπαιδεύει ένα RegNetY 256GF με SwAV χρησιμοποιώντας έξι crops ανά εικόνα, με κάθε εικόνα να έχει ανάλυση 2×224 + 4×96. Κατά την προ-εκπαίδευση, το μοντέλο χρησιμοποιεί ένα 3-στρώματο MLP ή Multi-Layer Perceptron με projection heads των διαστάσεων 10444×8192, 8192×8192, και 8192×256.

Αντί να χρησιμοποιήσει στρώματα BatchNorm στο κεφάλι, το SEER μοντέλο χρησιμοποιεί 16 χιλιάδες πρωτότυπα με τη θερμοκρασία t ορισμένη σε 0.1. Το Sinkhorn κανονικοποίηση παραμέτρου ορίζεται σε 0.05, και εκτελεί 10 επαναλήψεις του αλγορίθμου. Το μοντέλο συγχρονίζει επίσης τα στατιστικά BatchNorm σε όλα τα GPUs, και δημιουργεί πολλές ομάδες διαδικασίας με μέγεθος 64 για συγχρονισμό.

Επιπλέον, το μοντέλο χρησιμοποιεί έναν LARS ή Layer-wise Adaptive Rate Scaling βελτιστοποιητή, μια απώλεια βάρους 10-5, ενεργοποίηση checkpoints, και O1 μεικτή ακρίβεια βελτιστοποίηση. Το μοντέλο εκπαιδεύεται στη συνέχεια με στοχαστική καθοδική γραμμική με μια παρτίδα 8192 τυχαίων εικόνων που διανέμονται σε 512 NVIDIA GPUs, οδηγώντας σε 16 εικόνες ανά GPU.

Η ταχύτητα μάθησης αυξάνεται γραμμικά από 0.15 σε 9.6 για τις πρώτες 8 χιλιάδες εκπαιδευτικές επαναλήψεις. Μετά το ζέσταμα, το μοντέλο ακολουθεί ένα χρονοδιάγραμμα ταχύτητας μάθησης cosine που εκτείνεται σε μια τελική τιμή 0.0096. Συνολικά, το SEER μοντέλο εκπαιδεύεται σε πάνω από 1 δισεκατομμύριο εικόνες σε 122 χιλιάδες επαναλήψεις.

SEER Πλαίσιο: Αποτελέσματα

Η ποιότητα των αναπαραστάσεων που παράγονται από την αυτο-επιβλεπόμενη προ-εκπαίδευση μεθοδολογία μελετάται και αναλύεται σε eine ποικιλία προτύπων και εργασιών μετά-μετατόπισης. Το μοντέλο επίσης θεωρεί μια ρύθμιση με περιορισμένη πρόσβαση σε εικόνες και ετικέτες για εργασίες μετά-μετατόπισης.

Βελτιστοποίηση Μεγάλων Προ-Εκπαιδευμένων Μοντέλων

Μετράει την ποιότητα των μοντέλων που προ-εκπαιδεύονται σε τυχαία δεδομένα μεταφέροντας τα στο ImageNet πρότυπο για ταξινόμηση αντικειμένων. Τα αποτελέσματα της βελτιστοποίησης μεγάλων προ-εκπαιδευμένων μοντέλων καθορίζονται από τις ακόλουθες παραμέτρους.

Πειραματικές Ρυθμίσεις

Το μοντέλο προ-εκπαιδεύει 6 RegNet αρχιτεκτονικές με διαφορετικές ικανότητες, δηλαδή RegNetY- {8,16,32,64,128,256}GF, σε πάνω από 1 δισεκατομμύριο τυχαίες και δημόσιες εικόνες Instagram με SwAV. Τα μοντέλα στη συνέχεια βελτιστοποιούνται για την ταξινόμηση εικόνων στο ImageNet που χρησιμοποιεί πάνω από 1,28 εκατομμύριο τυπικά εκπαιδευτικά εικόνες με σωστές ετικέτες, και έχει ένα τυπικό σύνολο επαλήθευσης με πάνω από 50 χιλιάδες εικόνες για αξιολόγηση.

Το μοντέλο εφαρμόζει τις ίδιες τεχνικές aumento δεδομένων όπως στο SwAV, και βελτιστοποιεί για 35 επαναλήψεις με τον βελτιστοποιητή SGD ή Stochastic Gradient Descent με μια παρτίδα 256, και μια ταχύτητα μάθησης 0.0125 που μειώνεται με einen παράγοντα 10 μετά από 30 επαναλήψεις, ορμή 0.9, και απώλεια βάρους 10-4. Το μοντέλο αναφέρει την ακρίβεια top-1 στο σύνολο επαλήθευσης χρησιμοποιώντας την κεντρική corp 224×224.

Σύγκριση με Άλλες Αυτο-Επιβλεπόμενες Προ-Εκπαιδευτικές Προσεγγίσεις

Στον ακόλουθο πίνακα, το μεγαλύτερο προ-εκπαιδευμένο μοντέλο στο RegNetY-256GF συγκρίνεται με υπάρχοντα προ-εκπαιδευμένα μοντέλα που χρησιμοποιούν την αυτο-επιβλεπόμενη μάθηση προσέγγιση.

Όπως μπορείτε να δείτε, το SEER μοντέλο επιστρέφει μια ακρίβεια top-1 84.2% στο ImageNet, και ξεπερνά το SimCLRv2, το καλύτερο υπάρχον προ-εκπαιδευμένο μοντέλο κατά 1%.

Επιπλέον, ο ακόλουθος πίνακας συγκρίνει το SEER πλαίσιο με μοντέλα διαφορετικών ικανότητας. Όπως μπορείτε να δείτε, ανεξάρτητα από την ικανότητα του μοντέλου, η συνδυασμένη RegNet αρχιτεκτονική με SwAV οδηγεί σε ακριβή αποτελέσματα κατά την προ-εκπαίδευση.

Το SEER μοντέλο είναι προ-εκπαιδευμένο σε τυχαίες εικόνες, και έχουν την RegNet αρχιτεκτονική με την αυτο-επιβλεπόμενη μάθηση μεθοδολογία SwAV. Το SEER μοντέλο συγκρίνεται με το SimCLRv2 και τα ViT μοντέλα με διαφορετικές αρχιτεκτονικές. Τέλος, το μοντέλο βελτιστοποιείται στο ImageNet σύνολο δεδομένων, και η ακρίβεια top-1 αναφέρεται.

Επίδραση της Ικανότητας του Μοντέλου

Η ικανότητα του μοντέλου έχει σημαντική επίδραση στην απόδοση του μοντέλου κατά την προ-εκπαίδευση, και ο ακόλουθος πίνακας συγκρίνει αυτή την επίδραση όταν η εκπαίδευση γίνεται από την αρχή.

Μπορεί να παρατηρηθεί ότι η ακρίβεια top-1 του προ-εκπαιδευμένου μοντέλου είναι υψηλότερη από τα μοντέλα που εκπαιδεύονται από την αρχή, και η διαφορά γίνεται μεγαλύτερη καθώς ο αριθμός των παραμέτρων αυξάνεται.

Μια πιθανή αιτία για την οποία η εκπαίδευση ενός μοντέλου από την αρχή μπορεί να υπερ-ανταποκριθεί όταν εκπαιδεύεται στο ImageNet σύνολο δεδομένων είναι ότι το σύνολο δεδομένων είναι μικρό.

Μάθηση με Λίγες Εικόνες

Η μάθηση με λίγες εικόνες αναφέρεται στην αξιολόγηση της απόδοσης του SEER μοντέλου σε μια ρύθμιση με λίγες εικόνες, δηλαδή χρησιμοποιώντας μόνο ένα τμήμα του συνόλου δεδομένων κατά την εκτέλεση εργασιών μετά-μετατόπισης.

Πειραματικές Ρυθμίσεις

Το SEER πλαίσιο χρησιμοποιεί δύο συνόλους δεδομένων για μάθηση με λίγες εικόνες, δηλαδή Places205 και ImageNet. Επιπλέον, το μοντέλο υποθέτει ότι έχει περιορισμένη πρόσβαση στο σύνολο δεδομένων κατά την μετατόπιση, και σε όρους εικόνων και ετικετών. Αυτή η ρύθμιση είναι διαφορετική από τις τυπικές ρυθμίσεις που χρησιμοποιούνται για αυτο-επιβλεπόμενη μάθηση, όπου το μοντέλο έχει πρόσβαση στο σύνολο δεδομένων, και μόνο η πρόσβαση στις ετικέτες εικόνας είναι περιορισμένη.

Αποτελέσματα στο Places205 Σύνολο Δεδομένων

Ο ακόλουθος πίνακας δείχνει την επίδραση της προ-εκπαίδευσης του μοντέλου σε διαφορετικά τμήματα του Places205 συνόλου δεδομένων.

Η προσέγγιση που χρησιμοποιείται συγκρίνεται με την προ-εκπαίδευση του μοντέλου στο ImageNet σύνολο δεδομένων με την ίδια RegNetY-128 GF αρχιτεκτονική. Τα αποτελέσματα από τη σύγκριση είναι εντυπωσιακά, καθώς μπορεί να παρατηρηθεί ότι υπάρχει μια σταθερή κέρδος της τάξης του 2.5% στην ακρίβεια top-1, ανεξάρτητα από το τμήμα του συνόλου δεδομένων που είναι διαθέσιμο για βελτιστοποίηση στο Places205 σύνολο δεδομένων.

Η διαφορά που παρατηρείται μεταξύ της εποπτικής και της αυτο-επιβλεπόμενης προ-εκπαίδευσης μπορεί να εξηγηθεί με βάση τη διαφορά στη φύση των δεδομένων εκπαίδευσης, καθώς οι ιδιότητες που μαθαίνει το μοντέλο από τυχαίες εικόνες στο wild μπορεί να είναι πιο κατάλληλες για την ταξινόμηση σκηνών. Επιπλέον, μια μη ομοιόμορφη κατανομή των υποκείμενων εννοιών μπορεί να αποδειχθεί ένα πλεονέκτημα για την προ-εκπαίδευση σε ένα μη ισορροπημένο σύνολο δεδομένων όπως το Places205.

Αποτελέσματα στο ImageNet

Ο ακόλουθος πίνακας συγκρίνει την προσέγγιση του SEER μοντέλου με αυτο-επιβλεπόμενες προ-εκπαιδευτικές προσεγγίσεις και ημι-εποπτικές προσεγγίσεις σε μάθηση με λίγες εικόνες.

Αξίζει να σημειωθεί ότι όλες αυτές οι μεθόδους χρησιμοποιούν όλα τα 1,2 εκατομμύρια εικόνες στο ImageNet σύνολο δεδομένων για προ-εκπαίδευση, και μόνο η πρόσβαση στις ετικέτες περιορίζεται. Από την άλλη πλευρά, η προσέγγιση που χρησιμοποιείται στο SEER μοντέλο επιτρέπει στο μοντέλο να δει μόνο 1 έως 10% του συνόλου δεδομένων.

Όπως μπορείτε να δείτε, αν και το SEER μοντέλο δεν χρησιμοποιεί μετα-δεδομένα κατά την προ-εκπαίδευση, η ακρίβεια του είναι συγκρίσιμη με τα μοντέλα που χρησιμοποιούν μετα-δεδομένα για προ-εκπαίδευση.

Επίδραση της Ικανότητας του Μοντέλου

Ο ακόλουθος πίνακας αναλύει την επίδραση της ικανότητας του μοντέλου στη μάθηση με λίγες εικόνες: στο 1%, 10%, και 100% του ImageNet συνόλου δεδομένων.

Μπορεί να παρατηρηθεί ότι η αύξηση της ικανότητας του μοντέλου μπορεί να βελτιώσει την ακρίβεια του μοντέλου, καθώς μειώνεται η πρόσβαση και στις εικόνες και στις ετικέτες του συνόλου δεδομένων.

Μεταφορά σε Άλλα Πρότυπα

Για να αξιολογήσει το SEER μοντέλο περαιτέρω, και να αναλύσει την απόδοσή του, οι προ-εκπαιδευμένες αναπαραστάσεις μεταφέρονται σε άλλες εργασίες μετά-μετατόπισης.

Γραμμική Αξιολόγηση Ταξινόμησης Εικόνων

Ο ακόλουθος πίνακας συγκρίνει τις αναπαραστάσεις από το SEER μοντέλο με τις αναπαραστάσεις από το ImageNet σύνολο δεδομένων με την ίδια αρχιτεκτονική με και χωρίς εποπτική.

Αναγνώριση και Σημείωση

Ο ακόλουθος πίνακας συγκρίνει τις προ-εκπαιδευμένες αναπαραστάσεις σε αναγνώριση και σημείωση, και τις αξιολογεί.

Το SEER πλαίσιο εκπαιδεύει ένα Mask-RCNN μοντέλο στο COCO πρότυπο με προ-εκπαιδευμένα RegNetY-64GF και RegNetY-128GF ως τα βασικά στοιχεία. Για cả τις αρχιτεκτονικές και τις εργασίες μετά-μετατόπισης, η αυτο-επιβλεπόμενη προ-εκπαίδευση του SEER μοντέλου ξεπερνά την εποπτική εκπαίδευση κατά 1.5 έως 2 AP σημεία.

Σύγκριση με Ασθενώς Εποπτική Προ-Εκπαίδευση

Οι περισσότερες εικόνες που είναι διαθέσιμες στο διαδίκτυο έχουν συνήθως μια μετα-περιγραφή ή ένα alt κείμενο, ή περιγραφές, ή γεω-τοποθεσίες που μπορούν να παρέχουν πλεονέκτημα κατά την προ-εκπαίδευση. Προηγούμενη εργασία έχει δείξει ότι η πρόβλεψη ενός ελεγχόμενου ή ετικετών συνόλου hashtags μπορεί να βελτιώσει την ποιότητα της πρόβλεψης των οπτικών αναπαραστάσεων. Ωστόσο, αυτή η προσέγγιση απαιτεί να φιλτράρετε εικόνες, και λειτουργεί καλύτερα μόνο όταν υπάρχει κείμενο μετα-δεδομένων.

Ο ακόλουθος πίνακας συγκρίνει την προ-εκπαίδευση του ResNetXt101-32dx8d αρχιτεκτονικής σε τυχαίες εικόνες με την ίδια αρχιτεκτονική που εκπαιδεύεται σε ετικετών εικόνες με hashtags και μετα-δεδομένα, και αναφέρει την ακρίβεια top-1 για cả τις δύο.

Μπορεί να παρατηρηθεί ότι αν και το SEER μοντέλο δεν χρησιμοποιεί μετα-δεδομένα κατά την προ-εκπαίδευση, η ακρίβεια του είναι συγκρίσιμη με τα μοντέλα που χρησιμοποιούν μετα-δεδομένα για προ-εκπαίδευση.

Αφαίρεση

Μια αφαίρεση μελέτης πραγματοποιείται για να αναλύσει την επίδραση ενός συγκεκριμένου συνιστωσού στην συνολική απόδοση του μοντέλου. Μια αφαίρεση μελέτης πραγματοποιείται αφαιρώντας τον συνιστώσα από το μοντέλο εντελώς, και κατανοώντας πώς το μοντέλο εκτελείται. Αυτό παρέχει στους développers μια σύντομη επισκόπηση της επίδρασης του συνιστωσού στην απόδοση του μοντέλου.

Επίδραση της Αρχιτεκτονικής του Μοντέλου

Η αρχιτεκτονική του μοντέλου έχει σημαντική επίδραση στην απόδοση του μοντέλου, ιδιαίτερα όταν το μοντέλο κλιμακώνεται, ή οι προδιαγραφές των δεδομένων προ-εκπαίδευσης τροποποιούνται.

Ο ακόλουθος πίνακας αναλύει την επίδραση της αλλαγής της αρχιτεκτονικής στην ποιότητα των προ-εκπαιδευμένων αναπαραστάσεων, με την αξιολόγηση της γραμμικής του ImageNet.

Μπορεί να παρατηρηθεί ότι για τις ResNeXts και τις ResNet αρχιτεκτονικές, οι αναπαραστάσεις που λαμβάνονται από το penultimate στρώμα λειτουργούν καλύτερα με τις τρέχουσες ρυθμίσεις. Από την άλλη πλευρά, η RegNet αρχιτεκτονική ξεπερνά τις άλλες αρχιτεκτονικές.

Συνολικά, μπορεί να συναχθεί ότι η αύξηση της ικανότητας του μοντέλου έχει θετική επίδραση στην ποιότητα των αναπαραστάσεων, και υπάρχει μια λογαριθμική αύξηση της απόδοσης του μοντέλου.

Κλιμάκωση των Δεδομένων Προ-Εκπαίδευσης

Υπάρχουν δύο βασικοί λόγοι για τους οποίους η εκπαίδευση του μοντέλου σε ένα μεγαλύτερο σύνολο δεδομένων μπορεί να βελτιώσει την ποιότητα των οπτικών αναπαραστάσεων που μαθαίνει το μοντέλο: περισσότερες μοναδικές εικόνες, και περισσότερες παραμέτρους. Ας δούμε πώς αυτοί οι λόγοι επηρεάζουν την απόδοση του μοντέλου.

Αύξηση του Αριθμού των Μοναδικών Εικόνων

Ο ακόλουθος πίνακας συγκρίνει δύο διαφορετικές αρχιτεκτονικές, την RegNet8 και την RegNet16, που έχουν τον ίδιο αριθμό παραμέτρων, αλλά εκπαιδεύονται σε διαφορετικό αριθμό μοναδικών εικόνων. Το SEER μοντέλο εκπαιδεύει τα μοντέλα για επαναλήψεις που αντιστοιχούν σε 1 επανάληψη για 1 δισεκατομμύριο εικόνων, ή 32 επαναλήψεις για 32 μοναδικές εικόνες, και με μια ημι-κυκλική ταχύτητα μάθησης.

Μπορεί να παρατηρηθεί ότι για το μοντέλο να εκτελεστεί καλά, ο αριθμός των μοναδικών εικόνων που τροφοδοτούν το μοντέλο πρέπει να είναι μεγαλύτερος. Σε αυτή την περίπτωση, το μοντέλο εκτελείται καλά όταν τροφοδοτείται με μοναδικές εικόνες μεγαλύτερες από τις εικόνες που υπάρχουν στο ImageNet.

Περισσότερες Παραμέτρους

Ο ακόλουθος πίνακας δείχνει την απόδοση του μοντέλου όταν εκπαιδεύεται σε 1 δισεκατομμύριο εικόνες χρησιμοποιώντας την RegNet-128GF αρχιτεκτονική.

Αυτο-Επιβλεπόμενη Όραση Υπολογιστή στον Πραγματικό Κόσμο

Μέχρι τώρα, abbiamo συζητήσει πώς η αυτο-επιβλεπόμενη μάθηση και το SEER μοντέλο για όραση υπολογιστή λειτουργούν στην θεωρία. Τώρα, ας δούμε πώς η αυτο-επιβλεπόμενη όραση υπολογιστή λειτουργεί σε πραγματικές συνθήκες, και γιατί το SEER είναι το μέλλον της αυτο-επιβλεπόμενης όρασης υπολογιστή.

Το SEER μοντέλο αντιτάχθηκε στο έργο που έχει γίνει στη φυσική επεξεργασία γλώσσας, όπου υψηλής ποιότητας μοντέλα χρησιμοποιούν τρισεκατομμύρια δεδομένα και παραμέτρους, μαζί με τρισεκατομμύρια λέξεις κειμένου κατά την προ-εκπαίδευση του μοντέλου. Η απόδοση σε εργασίες μετά-μετατόπισης γενικά αυξάνεται με την αύξηση του αριθμού των δεδομένων εισόδου για την εκπαίδευση του μοντέλου, και το ίδιο ισχύει και για εργασίες όρασης υπολογιστή.

Αλλά η χρήση της αυτο-επιβλεπόμενης μάθησης για φυσική επεξεργασία γλώσσας είναι διαφορετική από την χρήση της αυτο-επιβλεπόμενης μάθησης για όραση υπολογιστή. Είναι επειδή όταν αντιμετωπίζουμε κείμενο, οι σημασιολογικές έννοιες συνήθως διασπώνται σε διακριτά λόγια, αλλά όταν αντιμετωπίζουμε εικόνες, το μοντέλο πρέπει να αποφασίσει ποιο πίξελ ανήκει σε ποια έννοια.

Επιπλέον, διαφορετικές εικόνες έχουν διαφορετικές προβολές, και ακόμη και αν πολλές εικόνες έχουν το ίδιο αντικείμενο, η έννοια μπορεί να διαφέρει σημαντικά. Για παράδειγμα, θεωρήστε ένα σύνολο δεδομένων με εικόνες μιας γάτας. Αν και το κύριο αντικείμενο, η γάτα, είναι κοινό σε όλες τις εικόνες, η έννοια μπορεί να διαφέρει σημαντικά, καθώς η γάτα μπορεί να είναι στάση σε μια εικόνα, ενώ μπορεί να παίζει με μια μπάλα σε μια άλλη εικόνα, και così καθεξής. Επειδή οι εικόνες συχνά έχουν διαφορετικές έννοιες, είναι απαραίτητο για το μοντέλο να δει ένα σημαντικό αριθμό εικόνων για να κατανοήσει τις διαφορές γύρω από την ίδια έννοια.

Η κλιμάκωση του μοντέλου με επιτυχία, ώστε να λειτουργεί αποτελεσματικά με υψηλο-διαστατικά και σύνθετα δεδομένα εικόνων, απαιτεί δύο συνιστώσες:

  1. Ένα convnet που είναι αρκετά μεγάλο για να καταγράψει και να μάθει τις οπτικές έννοιες από ένα πολύ μεγάλο σύνολο δεδομένων εικόνων.
  2. Ένα αλγόριθμο που μπορεί να μάθει τα μοτίβα από ένα μεγάλο όγκο εικόνων χωρίς ετικέτες, αναθέσεις ή μετα-δεδομένα.

Το SEER μοντέλο στοχεύει να εφαρμόσει αυτές τις συνιστώσες στον τομέα της όρασης υπολογιστή. Το SEER μοντέλο στοχεύει να εκμεταλλευτεί τις προόδους που έχουν γίνει από το SwAV, μια αυτο-επιβλεπόμενη μάθηση αρχιτεκτονική που χρησιμοποιεί online συσσωμάτωση για να ομαδοποιήσει ή να ζευγαρώσει εικόνες με παράλληλες οπτικές έννοιες, και να εκμεταλλευτεί αυτές τις ομοιότητες για να ανακαλύψει μοτίβα.

Με την SwAV αρχιτεκτονική, το SEER μοντέλο είναι σε θέση να κάνει την χρήση της αυτο-επιβλεπόμενης μάθησης στην όραση υπολογιστή πολύ πιο αποτελεσματική, και να μειώσει τον χρόνο εκπαίδευσης έως και 6 φορές.

Επιπλέον, η εκπαίδευση μοντέλων σε μεγάλη κλίμακα, σε αυτή την κλίμακα, πάνω από 1 δισεκατομμύριο εικόνες, απαιτεί μια αρχιτεκτονική μοντέλου που είναι αποτελεσματική όχι μόνο σε όρους χρόνου εκτέλεσης και μνήμης, αλλά και σε ακρίβεια. Αυτό είναι όπου τα RegNets μοντέλα έρχονται στο παιχνίδι, καθώς αυτά τα RegNets μοντέλα είναι ConvNets μοντέλα που μπορούν να κλιμακωθούν σε τρισεκατομμύρια παραμέτρους, και μπορούν να βελτιστοποιηθούν σύμφωνα με τις ανάγκες για να συμμορφωθούν με τους περιορισμούς μνήμης και χρόνου εκτέλεσης.

Συμπέρασμα: Ένα Αυτο-Επιβλεπόμενο Μέλλον

Η αυτο-επιβλεπόμενη μάθηση έχει sido ένα σημαντικό σημείο συζήτησης στη βιομηχανία AI και ML για κάποιο χρόνο τώρα, επειδή επιτρέπει στα μοντέλα AI να μαθαίνουν πληροφορίες απευθείας από ένα μεγάλο όγκο δεδομένων που είναι διαθέσιμων τυχαία στο διαδίκτυο, αντί να βασίζονται σε προσεκτικά ελεγχόμενα και ετικετών δεδομένα που έχουν ως σκοπό την εκπαίδευση μοντέλων AI.

Η αυτο-επιβλεπόμενη μάθηση είναι ένα ζωτικό концепτό για το μέλλον της AI και ML, επειδή έχει το δυναμικό να επιτρέψει στους développers να δημιουργήσουν μοντέλα AI που προσαρμόζονται καλά σε πραγματικές συνθήκες, και έχουν πολλές χρήσεις αντί να έχουν ένα συγκεκριμένο σκοπό, και το SEER είναι ένα ορόσημο στην εφαρμογή της αυτο-επιβλεπόμενης μάθησης στην βιομηχανία όρασης υπολογιστή.

Το SEER μοντέλο κάνει το πρώτο βήμα στη μεταμόρφωση της βιομηχανίας όρασης υπολογιστή, και μειώνει την εξάρτησή μας από ετικετών δεδομένα. Το SEER μοντέλο στοχεύει να εξαλείψει την ανάγκη για ετικέτα δεδομένων, που θα επιτρέψει στους développers να εργαστούν με μια ποικιλία και μεγάλο όγκο δεδομένων. Η εφαρμογή του SEER είναι ιδιαίτερα χρήσιμη για développers που εργάζονται σε μοντέλα που ασχολούνται με περιοχές που έχουν περιορισμένες εικόνες ή μετα-δεδομένα, όπως η ιατρική βιομηχανία.

Επιπλέον, η εξάλειψη των ανθρώπινων ετικετών θα επιτρέψει στους développers να αναπτύξουν και να αναπτύξουν το μοντέλο γρηγορότερα, που θα τους επιτρέψει να ανταποκριθούν σε ταχέως εξελισσόμενες καταστάσεις γρηγορότερα και με μεγαλύτερη ακρίβεια.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.