Μοντέλα και πλατφόρμες AI

Μπορείτε να κατασκευάσετε μεγάλους μοντέλους γλωσσικών μοντέλων όπως το ChatGPT με μειωμένο κόστος;

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μεγάλους Γλωσσικούς Μοντέλους (LLMs) όπως το GPT-3 και το ChatGPT έχουν επανακαθορίσει την τεχνητή νοημοσύνη με την προσφορά φυσικής κατανόησης γλώσσας και ικανοτήτων δημιουργίας περιεχομένου. Ωστόσο, η ανάπτυξή τους έχει ένα υψηλό κόστος, που περιορίζει τη πρόσβαση και την περαιτέρω έρευνα. Οι ερευνητές εκτιμούν ότι η εκπαίδευση του GPT-3 κόστισε στην OpenAI περίπου $5 εκατομμύρια. Παρόλα αυτά, η Microsoft (MSFT ) αναγνώρισε το потенシャル και επένδυσε $1 δισεκατομμύριο το 2019 και $10 δισεκατομμύρια το 2023 στην επένδυση του OpenAI για το GPT-3 και το ChatGPT.

Οι LLMs είναι μοντέλα μηχανικής μάθησης που εκπαιδεύονται σε εκτενείς δεδομένα κειμένου για εφαρμογές NLP. Βασίζονται στην αρχιτεκτονική μετασχηματισμού και χρησιμοποιούν μηχανισμούς προσοχής για εργασίες NLP όπως η απάντηση σε ερωτήσεις, η μετάφραση μηχανής, η ανάλυση συναισθήματος κ.λπ.

Η ερώτηση που προκύπτει είναι: μπορεί η αποτελεσματικότητα αυτών των μεγάλων μοντέλων να αυξηθεί ενώ ταυτόχρονα μειώνεται ο υπολογιστικός κόστος και ο χρόνος εκπαίδευσης;

Πολλές προσεγγίσεις, όπως τα Προοδευτικά Νευρωνικά Δίκτυα, Μορφισμός Δικτύου, παράλληλη μοντελοποίηση εντός στρώσεων, κληρονομιά γνώσης, κ.λπ., έχουν αναπτυχθεί για να μειώσουν το υπολογιστικό κόστος της εκπαίδευσης νευρωνικών δικτύων. Η καινοτόμος προσεγγίση LiGO (Linear Growth Operator) που θα συζητήσουμε μειώνει το υπολογιστικό κόστος της εκπαίδευσης LLMs κατά 50%.

Πριν συζητήσουμε αυτήν την τεχνική, είναι απαραίτητο να εξεταστούν οι παράγοντες που συμβάλλουν στο υψηλό κόστος της δημιουργίας LLMs.

Κόστος Κατασκευής Μεγάλων Γλωσσικών Μοντέλων

Τρεις κύριες δαπάνες για την ανάπτυξη LLMs είναι οι ακόλουθες:

1. Υπολογιστικοί Πόροι

Η κατασκευή LLMs απαιτεί τεράστιους υπολογιστικούς πόρους για να εκπαιδευτούν σε μεγάλες βάσεις δεδομένων. Πρέπει να επεξεργαστούν δισεκατομμύρια παραμέτρους και να μάθουν σύνθετα μοτίβα από εκτενείς δεδομένα κειμένου.

Η επένδυση σε εξειδικευμένο υλικό όπως Graphics Processing Units (GPUs) και Tensor Processing Units (TPUs) είναι απαραίτητη για την κατασκευή και την εκπαίδευση LLMs για την επίτευξη κορυφαίων επιδόσεων.

Για παράδειγμα, το GPT-3 εκπαιδεύτηκε σε ένα υπεραποκαταστροφέα με 10000 επιχειρηματικά GPUs (H100 και A100) και 285.000 πυρήνες CPU.

2. Κατανάλωση Ενέργειας

Οι εντατικές υπολογιστικοί πόροι που απαιτούνται για την κατασκευή LLMs οδηγούν σε σημαντική κατανάλωση ενέργειας. Για παράδειγμα, η εκπαίδευση 175 δισεκατομμυρίων παραμέτρων GPT-3 πήρε 14,8 ημέρες χρησιμοποιώντας 10.000 V100 GPUs, tương đương με 3,55 εκατομμύρια ώρες GPU. Ένας τόσο υψηλός βαθμός κατανάλωσης ενέργειας έχει σημαντικές περιβαλλοντικές επιπτώσεις.

3. Αποθήκευση και Διαχείριση Δεδομένων

Τα LLMs εκπαιδεύονται σε μεγάλες βάσεις δεδομένων. Για παράδειγμα, το GPT-3 εκπαιδεύτηκε σε một τεράστια βάση δεδομένων κειμένου, συμπεριλαμβανομένων Common Crawl, WebText2, Books1, Books2 και Wikipedia, μεταξύ άλλων. Η σημαντική επένδυση σε υποδομή απαιτείται για τη συλλογή, την επιμέλεια και την αποθήκευση αυτών των δεδομένων.

Επιπλέον, η αποθήκευση cloud απαιτείται για την αποθήκευση δεδομένων και η ανθρώπινη εμπειρία για την επεξεργασία δεδομένων και τον έλεγχο εκδόσεων. Επιπλέον, η διασφάλιση ότι η στρατηγική δεδομένων σας συμμορφώνεται με κανονισμούς όπως ο GDPR προσθέτει στο κόστος.

Τεχνική LiGO: Μειώστε το Κόστος Κατασκευής Μεγάλων Γλωσσικών Μοντέλων στο Μισό

Η τεχνική LiGO (Linear Growth Operator) είναι μια καινοτόμος τεχνική που αναπτύχθηκε από ερευνητές στο MIT για να μειώσει το υπολογιστικό κόστος της εκπαίδευσης LLMs κατά 50%. Η μέθοδος περιλαμβάνει την αρχικοποίηση των βαρών μεγαλύτερων μοντέλων από αυτά μικρότερων προ-εκπαιδευμένων μοντέλων, επιτρέποντας την αποτελεσματική κλιμάκωση νευρωνικών δικτύων.

Yoon Kim, ο senior συγγραφέας του εγγράφου, λέει:

“Είναι εκτιμώμενο ότι η εκπαίδευση μοντέλων σε κλίμακα με το ChatGPT θα μπορούσε να πάρει εκατομμύρια δολάρια μόνο για μια seule εκπαίδευση. Μπορούμε να βελτιώσουμε την αποτελεσματικότητα αυτών των μεθόδων εκπαίδευσης, ώστε να μπορούμε να πάρουμε καλά μοντέλα σε λιγότερο χρόνο και με λιγότερα χρήματα; Προτείνουμε να το κάνουμε αυτό με την αξιοποίηση μικρότερων γλωσσικών μοντέλων που έχουν προηγουμένως εκπαιδευτεί.”

Αυτή η μέθοδος διατηρεί τα οφέλη απόδοσης των μεγαλύτερων μοντέλων με μειωμένο υπολογιστικό κόστος και χρόνο εκπαίδευσης σε σύγκριση με την εκπαίδευση ενός μεγάλου μοντέλου από το μηδέν. Η τεχνική LiGO χρησιμοποιεί einen δεδομενο-ελεγχόμενο γραμμικό χειριστή που συνδυάζει τους χειριστές βάθους και πλάτους για βέλτιστη απόδοση.

Το έγγραφο χρησιμοποίησε διάφορες βάσεις δεδομένων για να διεξαγάγει πειράματα βασισμένα σε κείμενο, συμπεριλαμβανομένης της αγγλικής Βικιπαίδειας για την εκπαίδευση μοντέλων BERT και RoBERTa και της βάσης δεδομένων C4 για την εκπαίδευση μοντέλου GPT2.

Η πειραματική τεχνική LiGO περιελάμβανε την ανάπτυξη του BERT-Small σε BERT-Base, του BERT-Base σε BERT-Large, του RoBERTa-Small σε RoBERTa-Base, του GPT2-Base σε GPT2-Medium και του CaiT-XS σε CaiT-S.

Οι ερευνητές σύγκριναν την προσέγγισή τους με διάφορες άλλες βάσεις, συμπεριλαμβανομένης της εκπαίδευσης από το μηδέν, της προοδευτικής εκπαίδευσης, του bert2BERT και του KI.

Η τεχνική LiGO προσέφερε 44,7% εξοικονόμηση σε FLOPs (πλωτές-point operations per second) και 40,7% εξοικονόμηση σε χρόνο τοίχου σε σύγκριση με την εκπαίδευση του BERT-Base από το μηδέν με την επαναχρησιμοποίηση του μοντέλου BERT-Small. Ο χειριστής ανάπτυξης LiGO υπερέβη τον StackBERT, τον MSLT, τον bert2BERT και τον KI στην αποτελεσματική εκπαίδευση.

Ωφέλη από την Χρήση μιας Τεχνικής Βελτίωσης Εκπαίδευσης όπως η LiGO

Η τεχνική LiGO είναι μια αποτελεσματική μέθοδος εκπαίδευσης νευρωνικών δικτύων που έχει διάφορα οφέλη που αναφέρονται παρακάτω:

1. Ταχύτερη Εκπαίδευση

Όπως αναφέρθηκε νωρίτερα, η ταχύτερη εκπαίδευση είναι το κύριο πλεονέκτημα της τεχνικής LiGO. Εκπαιδεύει LLMs στο μισό χρόνο, αυξάνοντας την παραγωγικότητα και μειώνοντας τα κόστη.

2. Αποτελεσματικότητα Πόρων

Η τεχνική LiGO είναι αποτελεσματική σε πόρους, поскольку ελαττώνει τον χρόνο τοίχου και τις FLOPs, οδηγώντας σε μια πιο οικονομική και φιλική προς το περιβάλλον προσέγγιση για την εκπαίδευση μεγάλων μοντέλων μετασχηματισμού.

3. Γενίκευση

Η τεχνική LiGO έχει βελτιώσει την απόδοση και των γλωσσικών και των οπτικών μετασχηματιστών, υποδεικνύοντας ότι είναι μια γενίκευση τεχνική που μπορεί να εφαρμοστεί σε διάφορες εργασίες.

Η κατασκευή εμπορικών προϊόντων AI είναι μόνο ένας από τους παράγοντες που συνεισφέρουν στα συνολικά έξοδα που σχετίζονται με τα συστήματα AI. Ένας άλλος σημαντικός παράγοντας του κόστους προέρχεται από τις ημερήσιες λειτουργίες. Για παράδειγμα, κοστίζει στην OpenAI περίπου $700.000 κάθε μέρα για να απαντήσει σε ερωτήσεις χρησιμοποιώντας το ChatGPT. Οι ερευνητές αναμένεται να συνεχίσουν να εξερευνούν προσεγγίσεις που κάνουν τα LLMs οικονομικά αποτελεσματικά κατά την εκπαίδευση και πιο προσιτά κατά την εκτέλεση.

Για περισσότερο περιεχόμενο σχετικό με την τεχνητή νοημοσύνη, επισκεφθείτε unite.ai.

Haziqa είναι ένας Επιστήμονας Δεδομένων με εκτεταμένη εμπειρία στη συγγραφή τεχνικού περιεχομένου για εταιρείες AI και SaaS.