Μοντέλα και πλατφόρμες AI

Η Google κάνει την εκπαίδευση του AI 28% ταχύτερη χρησιμοποιώντας SLMs ως δασκάλους

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η εκπαίδευση μεγάλων γλωσσικών μοντέλων (LLMs) έχει γίνει απρόσιτη για την πλειονότητα των οργανισμών. Με κόστη που φτάνουν σε εκατομμύρια και απαιτήσεις υπολογισμού που θα κάνουν έναν υπερυπολογιστή να ιδρώσει, η ανάπτυξη του AI έχει παραμείνει κλειδωμένη πίσω από τις πόρτες των τεχνολογικών γιγάντων. Nhưng η Google (GOOGL ) μόλις ανατράπηκε αυτή την ιστορία με μια προσέγγιση τόσο απλή που θα σας κάνει να αναρωτηθείτε γιατί κανείς δεν σκέφτηκε να το κάνει νωρίτερα: χρησιμοποιώντας μικρότερα μοντέλα AI ως δασκάλους.

Πώς λειτουργεί το SALT: Μια νέα προσέγγιση για την εκπαίδευση μοντέλων AI

Σε μια πρόσφατη έρευνα με τίτλο “Μια μικρή βοήθεια πάει μακρύ δρόμο: Αποδοτική εκπαίδευση LLM με τη χρήση μικρών LM,” η Google Research και η DeepMind εισήγαγαν το SALT (Small model Aided Large model Training). Αυτή είναι η νέα μέθοδος που προκλήθηκε η παραδοσιακή μας προσέγγιση για την εκπαίδευση LLMs.

Γιατί αυτή η έρευνα είναι σημαντική; Hiện, η εκπαίδευση μεγάλων μοντέλων AI είναι σαν να προσπαθείς να διδάξεις κάποιον όλα όσα χρειάζεται να ξέρει για ένα θέμα όλα μαζί – είναι ανεφάρμοστη, ακριβή και συχνά περιορισμένη σε οργανισμούς με τεράστιους υπολογιστικούς πόρους. Το SALT ακολουθεί einen διαφορετικό δρόμο, εισάγοντας μια διφασική διαδικασία εκπαίδευσης που είναι καινοτόμα και πρακτική.

Αναλύοντας πώς λειτουργεί πραγματικά το SALT:

Στάδιο 1: Απόσταξη Γνώσης

  • Ένα μικρότερο γλωσσικό μοντέλο (SLM) ενεργεί ως δάσκαλος, μοιράζοντας την κατανόησή του με το μεγαλύτερο μοντέλο
  • Το μικρότερο μοντέλο επικεντρώνεται στη μεταφορά της “μαθημένης γνώσης” του μέσω αυτού που οι ερευνητές ονομάζουν “μαλακά etiquettes”
  • Σκεφτείτε το σαν ένα βοηθό δάσκαλο που χειρίζεται θεμελιώδεις έννοιες πριν ένας μαθητής προχωρήσει σε προηγμένα θέματα
  • Αυτό το στάδιο είναι ιδιαίτερα αποτελεσματικό σε “εύκολες” περιοχές της μάθησης – περιοχές όπου το μικρότερο μοντέλο έχει ισχυρή προβλεπτική εμπιστοσύνη

Στάδιο 2: Αυτο-επιτηρούμενη Μάθηση

  • Το μεγαλύτερο μοντέλο μεταβαίνει σε ανεξάρτητη μάθηση
  • Επικεντρώνεται στη διέλευση σύνθετων προτύπων και απαιτητικών εργασιών
  • Αυτό είναι το σημείο όπου το μοντέλο αναπτύσσει ικανότητες πέρα από αυτά που θα μπορούσε να προσφέρει ο “δάσκαλος” του
  • Η μετάβαση μεταξύ των σταδίων χρησιμοποιεί προσεκτικά σχεδιασμένες στρατηγικές, συμπεριλαμβανομένης της γραμμικής μείωσης και της γραμμικής αναλογικής μείωσης του βάρους της απόσταξης

Σε μη τεχνικούς όρους, φανταστείτε το μικρότερο μοντέλο AI σαν ένα χρήσιμο βοηθό που οδηγεί το μεγαλύτερο μοντέλο στις αρχικές φάσεις της εκπαίδευσης. Αυτός ο βοηθός παρέχει επιπλέον πληροφορίες μαζί με τις απαντήσεις του, υποδεικνύοντας πόσο βέβαιο είναι για κάθε απάντηση. Αυτές οι επιπλέον πληροφορίες, γνωστές ως “μαλακά etiquettes”, βοηθούν το μεγαλύτερο μοντέλο να μάθει πιο γρήγορα και αποτελεσματικά.

Τώρα, καθώς το μεγαλύτερο μοντέλο AI γίνεται πιο ικανό, χρειάζεται να μεταβεί από την εξάρτησή του από τον βοηθό στην ανεξάρτητη μάθηση. Αυτό είναι το σημείο όπου η “γραμμική μείωση” και η “γραμμική αναλογική μείωση” έρχονται στο παιχνίδι.
Σκεφτείτε αυτές τις τεχνικές σαν τη σταδιακή μείωση της επιρροής του βοηθού με τον καιρό:
  • Γραμμική Μείωση: Είναι σαν να μειώνετε σιγά-σιγά την ένταση της φωνής του βοηθού. Η οδηγία του βοηθού γίνεται λιγότερο προεξέχουσα με κάθε βήμα, επιτρέποντας στο μεγαλύτερο μοντέλο να επικεντρωθεί περισσότερο στη μάθηση από τα ακατέργαστα δεδομένα.
  • Γραμμική Αναλογική Μείωση: Αυτή είναι σαν να điều chỉnhετε την ισορροπία μεταξύ της συμβουλής του βοηθού και της αρχικής εργασίας. Καθώς η εκπαίδευση προχωρά, η έμφαση μεταφέρεται περισσότερο στην αρχική εργασία, ενώ η εισφορά του βοηθού γίνεται λιγότερο κυρίαρχη.
Ο στόχος και των δύο τεχνικών είναι να εξασφαλίσουν μια ομαλή μετάβαση για το μεγαλύτερο μοντέλο AI, αποτρέποντας οποιαδήποτε απότομη αλλαγή στη συμπεριφορά της μάθησής του.

Τα αποτελέσματα είναι εντυπωσιακά. Όταν οι ερευνητές της Google ε-tested το SALT χρησιμοποιώντας ένα SLM 1,5 δισεκατομμυρίων παραμέτρων για την εκπαίδευση ενός LLM 2,8 δισεκατομμυρίων παραμέτρων στο dataset Pile, είδαν:

  • Μια μείωση 28% στο χρόνο εκπαίδευσης σε σύγκριση με τις παραδοσιακές μεθόδους
  • Σημαντικές βελτιώσεις στην απόδοση μετά την εκπαίδευση:
    • Η ακρίβεια των μαθηματικών προβλημάτων αυξήθηκε στο 34,87% (σε σύγκριση με 31,84% baseline)
    • Η κατανόηση ανάγνωσης έφτασε σε ακρίβεια 67% (από 63,7%)

Αλλά τι κάνει το SALT πραγματικά καινοτόμο είναι το θεωρητικό του πλαίσιο. Οι ερευνητές ανακάλυψαν ότι ακόμη και ένα “αδύναμο” μοντέλο δασκάλου μπορεί να ενισχύσει την απόδοση του μαθητή επιτυγχάνοντας αυτό που ονομάζουν “ευνοϊκή ανταλλαγή βίας-μεταβλητότητας”. Σε απλούστερους όρους, το μικρότερο μοντέλο βοηθά το μεγαλύτερο να μάθει θεμελιώδεις προτύπους πιο αποτελεσματικά, δημιουργώντας μια ισχυρότερη βάση για προηγμένη μάθηση.

Γιατί το SALT μπορεί να αναμορφώσει το πεδίο ανάπτυξης του AI

Θυμάστε όταν η υπολογιστική στο cloud μετέβαλε ποιος μπορούσε να ξεκινήσει μια τεχνολογική εταιρεία; Το SALT μπορεί να κάνει το ίδιο για την ανάπτυξη του AI.

Έχω ακολουθήσει τις καινοτομίες της εκπαίδευσης του AI για χρόνια, και οι περισσότερες ανακαλύψεις έχουν ωφελήσει κυρίως τους τεχνολογικούς γίγαντες. Nhưng το SALT είναι διαφορετικό.

Αυτή είναι η σημασία του για το μέλλον:

Για τους Οργανισμούς με Περιορισμένους Πόρους:

  • Μожет να μην χρειάζεστε πλέον τεράστιους υπολογιστικούς πόρους για την ανάπτυξη ικανοποιητικών μοντέλων AI
  • Μικρότεροι ερευνητικοί σταθμοί και εταιρείες θα μπορούσαν να πειραματιστούν με την ανάπτυξη προσαρμοσμένων μοντέλων
  • Η μείωση 28% στο χρόνο εκπαίδευσης μεταφράζεται απευθείας σε χαμηλότερους υπολογιστικούς κόστους
  • Περισσότερο, θα μπορούσατε να ξεκινήσετε με μετριοπαθείς υπολογιστικούς πόρους και να επιτύχετε ακόμα επαγγελματικά αποτελέσματα

Για το Τοπίο Ανάπτυξης του AI:

  • Περισσότεροι παίκτες θα μπορούσαν να εισέλθουν στο πεδίο, οδηγώντας σε περισσότερες ποικιλόμορφες και εξειδικευμένες λύσεις AI
  • Πανεπιστήμια και ερευνητικά ιδρύματα θα μπορούσαν να διεξάγουν περισσότερα πειράματα με τους υπάρχοντες πόρους
  • Το εμπόδιο εισόδου για την έρευνα του AI μειώνεται σημαντικά
  • Μπορούμε να δούμε νέες εφαρμογές σε πεδία που προηγουμένως δεν μπορούσαν να αντέξουν την ανάπτυξη του AI

Αυτό που σημαίνει για το μέλλον

Χρησιμοποιώντας μικρότερα μοντέλα ως δασκάλους, δεν κάνουμε μόνο την εκπαίδευση του AI πιο αποτελεσματική – αλλά αλλάζουμε επίσης θεμελιωδώς ποιος συμμετέχει στην ανάπτυξη του AI. Οι επιπτώσεις φτάνουν πολύ πέρα από τις τεχνικές βελτιώσεις.

Κύριες σημειώσεις να θυμάστε:

  • Η μείωση 28% στο χρόνο εκπαίδευσης είναι η διαφορά μεταξύ της έναρξης ενός προγράμματος AI και της σκέψης ότι είναι απρόσιτο
  • Οι βελτιώσεις στην απόδοση (34,87% στα μαθηματικά, 67% στην ανάγνωση) δείχνουν ότι η προσιτότητα δεν σημαίνει πάντα συμβιβασμό στην ποιότητα
  • Η προσέγγιση του SALT αποδεικνύει ότι μερικές φορές οι καλύτερες λύσεις προέρχονται από την επανεξέταση των θεμελίων αντί να προσθέτουν περισσότερη υπολογιστική δύναμη

Τι να παρακολουθήσετε:

  1. Παρακολουθήστε μικρότερους οργανισμούς που ξεκινούν να αναπτύσσουν προσαρμοσμένα μοντέλα AI
  2. Παρακολουθήστε νέες εφαρμογές σε πεδία που προηγουμένως δεν μπορούσαν να αντέξουν την ανάπτυξη του AI
  3. Παρακολουθήστε καινοτομίες στο πώς τα μικρότερα μοντέλα χρησιμοποιούνται για εξειδικευμένες εργασίες

Θυμάστε: Η πραγματική αξία του SALT είναι στο πώς μπορεί να αναμορφώσει ποιος θα καινοτομήσει στο AI. Ανεξάρτητα από το αν είστε διευθυντής ερευνητικού σταθμού, διαχειριστής τεχνολογικής ομάδας ή απλά ενδιαφερόμενος για την ανάπτυξη του AI, αυτή είναι η種 καινοτομίας που θα μπορούσε να κάνει την επόμενη μεγάλη ιδέα σας δυνατή.

Μожет να ξεκινήσετε να σκέφτεστε εκείνο το πρόγραμμα AI που νομίζατε ότι ήταν απρόσιτο. Μπορεί να είναι πιο δυνατό από ό,τι φανταζόσαστε.

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.