Μοντέλα και πλατφόρμες AI
Ερευνητές Ανακαλύπτουν Υψηλά Αποτελεσματικά Υποδίκτυα Μέσα σε Νευρωνικά Δίκτυα Βαθιάς Μάθησης
Τα νευρωνικά δίκτυα βαθιάς μάθησης είναι συχνά τεράστια και απαιτούν τεράστιες ποσότητες υπολογιστικής δύναμης, αλλά μια νέα ανακάλυψη δείχνει πώς αυτό μπορεί να μειωθεί για να ολοκληρώσει τις εργασίες μεgreater αποτελεσματικότητα. Ο Jonathan Frankle και η ομάδα του από το MIT έχουν αναπτύξει την “υπόθεση του λαχνού”, η οποία δείχνει πώς υπάρχουν πιο λεπτά υποδίκτυα μέσα στα μεγαλύτερα νευρωνικά δίκτυα. Αυτά τα υποδίκτυα μπορούν να ολοκληρώσουν την εργασία που έχει ανατεθεί με μεγαλύτερη αποτελεσματικότητα και με λιγότερη απαιτούμενη υπολογιστική δύναμη, με одну από τις μεγαλύτερες προκλήσεις να είναι να βρεθούν αυτά τα υποδίκτυα, ή τα κερδισμένα λαχνά, όπως τα ονομάζει η ομάδα.
Η ομάδα ανακάλυψε αυτά τα υποδίκτυα μέσα στο BERT, την κορυφαία τεχνική μηχανικής μάθησης για την επεξεργασία φυσικής γλώσσας (NLP). Η NLP, η οποία είναι υποπεδίο της τεχνητής νοημοσύνης (AI), είναι υπεύθυνη για την αποκωδικοποίηση και την ανάλυση της ανθρώπινης γλώσσας και χρησιμοποιείται για εφαρμογές όπως η προβλεπτική δημιουργία κειμένου και τα chatbots.
Ωστόσο, το BERT είναι μεγάλο και απαιτεί υπολογιστική δύναμη σούπερ υπολογιστή, η οποία είναι απρόσιτη για τους περισσότερους χρήστες. Με την νέα ανακάλυψη αυτών των υποδικτύων, αυτό θα μπορούσε να ανοίξει την πρόσβαση, επιτρέποντας σε περισσότερους χρήστες να χρησιμοποιήσουν την τεχνολογία για την ανάπτυξη εργαλείων NLP.
«Φτάνουμε στο σημείο όπου θα πρέπει να κάνουμε αυτά τα μοντέλα πιο λεπτά και αποτελεσματικά», λέει ο Frankle.
Σύμφωνα με τον Frankle, αυτή η εξέλιξη θα μπορούσε «να μειώσει τους φραγμούς εισόδου» για την NLP.
BERT – “Απίστευτα Πολύティμο”
Το BERT είναι θεμελιώδες για πράγματα όπως η μηχανή αναζήτησης του Google και έχει λάβει πολλή προσοχή από τότε που το Google το κυκλοφόρησε το 2018. Είναι μια μέθοδος για τη δημιουργία νευρωνικών δικτύων και εκπαιδεύεται προσπαθώντας πολλές φορές να συμπληρώσει τα κενά σε περικοπές γραπτών. Một από τα πιο εντυπωσιακά χαρακτηριστικά του BERT είναι το τεράστιο αρχικό σύνολο δεδομένων εκπαίδευσης.
Στη συνέχεια, μπορεί να ρυθμιστεί από τους χρήστες για συγκεκριμένες εργασίες, όπως τα chatbots εξυπηρέτησης πελατών, αλλά και πάλι, απαιτεί τεράστιες ποσότητες υπολογιστικής δύναμης, με τη δυνατότητα παραμέτρων να φτάνει το 1 δισεκατομμύριο.
«Ένα τυπικό μοντέλο BERT αυτών των ημερών – το συνηθισμένο – έχει 340 εκατομμύρια παραμέτρους», λέει ο Frankle. «Αυτό είναι απίστευτα πολύτιμο. Αυτό είναι πολύ πέρα από την υπολογιστική ικανότητα σας ή μου».
Σύμφωνα με τον κύριο συγγραφέα Tianlong Chen από το Πανεπιστήμιο του Τέξας στο Όστιν, μοντέλα όπως το BERT «πλήττονται από τεράστιο μέγεθος δικτύου», αλλά χάρη στην νέα έρευνα, «η υπόθεση του λαχνού φαίνεται να είναι μια λύση».
Αποτελεσματικά Υποδίκτυα
Ο Chen και η ομάδα του αναζήτησαν ένα μικρότερο μοντέλο μέσα στο BERT και σύγκριναν την απόδοση των ανακαλυφθέντων υποδικτύων με το αρχικό μοντέλο BERT. Αυτό δοκιμάστηκε σε eine ποικιλία διαφορετικών εργασιών NLP, συμπεριλαμβανομένης της απάντησης σε ερωτήσεις και της συμπλήρωσης κενών σε μια πρόταση.
Η ομάδα ανακάλυψε επιτυχημένα υποδίκτυα που ήταν εντυπωσιακά 40 έως 90% πιο λεπτά από το αρχικό μοντέλο BERT, με το πραγματικό ποσοστό να εξαρτάται από την εργασία. Επιπλέον, μπορούσαν να τα αναγνωρίσουν πριν από την εξειδικευμένη εκπαίδευση, που οδηγεί σε ακόμη μικρότερη υπολογιστική κόστος. Ένα άλλο πλεονέκτημα ήταν ότι κάποια από τα υποδίκτυα που επιλέχθηκαν για μια συγκεκριμένη εργασία θα μπορούσαν να ξαναχρησιμοποιηθούν για μια άλλη.
«Ήμουν κάπως σοκαρισμένος που αυτό δούλεψε», λέει ο Frankle. «Δεν ήταν κάτι που έπαιρνα ως δεδομένο. Περιέμενε ένα πολύ πιο ακατάστατο αποτέλεσμα από αυτό που πήραμε».
Σύμφωνα με τον Ari Morcos, επιστήμονα στην Facebook (META ) AI Research, αυτή η ανακάλυψη είναι «πείθουσα» και «Αυτά τα μοντέλα γίνονται ολοένα και πιο διαδεδομένα. Έτσι, είναι σημαντικό να κατανοήσουμε αν η υπόθεση του λαχνού ισχύει».
Ο Morcos λέει επίσης ότι αν αυτά τα υποδίκτυα θα μπορούσαν να τρέξουν με δραστικά λιγότερη υπολογιστική δύναμη, τότε αυτό θα «ήταν πολύ επηρεσμένο, δεδομένου ότι αυτά τα εξαιρετικά μεγάλα μοντέλα είναι τώρα πολύ ακριβά για να τρέξουν».
«Δεν ξέρω πόσο μεγαλύτερα μπορούμε να πάμε με αυτές τις υπολογιστικές υπολογιστικές», προσθέτει ο Frankle. «Θα πρέπει να μειώσουμε τον φραγμό εισόδου».
«Η ελπίδα είναι ότι αυτό θα μειώσει το κόστος, ότι αυτό θα το κάνει πιο προσιτό σε όλους…στις μικρές εταιρείες που έχουν μόνο ένα λάπτοπ», συμπεραίνει.
Η έρευνα πρόκειται να παρουσιαστεί στη Διάσκεψη για την Επεξεργασία Νευρωνικών Πληροφοριών.












