Μοντέλα και πλατφόρμες AI
MPT-30B: Η MosaicML Υπερβαίνει το GPT-3 Με Ένα Νέο LLM Για Την Προώθηση των Ορίων της NLP
MosaicML είναι μια εταιρεία γεννητικής AI που παρέχει λύσεις ανάπτυξης και κλιμάκωσης AI. Το τελευταίο μεγάλο μοντέλο γλώσσας (LLM) MPT-30B κάνει κύματα στην κοινότητα της AI.
Η πορεία της MosaicML στα LLM ξεκίνησε με την κυκλοφορία του MPT-7B (Mosaic Pretrained Transformer) τον Μάιο του 2023, το οποίο ήρθε με τρεις παραλλαγές:
- MPT-7B-StoryWriter-65k+ (για τη δημιουργία ιστοριών μεγάλου μήκους)
- MPT-7B-Instruct (για την εκτέλεση εντολών μικρού μήκους)
- MPT-7B-Chat (για τη δημιουργία διαλόγων)
Τα μοντέλα αυτά είχαν τεράστια επιτυχία στην κοινότητα ML λόγω της ανοικτής φύσης τους, της εμπορικής τους उपयσιμότητας και της εξαιρετικής ικανότητάς τους να χειρίζονται επεκτάσεις παραθύρων контекстου.
Πιο σημαντικά, το μοντέλο ήταν στο ίδιο επίπεδο και, σε ορισμένες περιπτώσεις, ξεπέρασε άλλα συγκρίσιμα μοντέλα (LLaMA-7B, StableLM 7B, κ.λπ.). Μέχρι τον Ιούνιο, η σειρά MPT-7B είχε κατεβαστεί πάνω από 3 εκατομμύρια φορές. Στις 22 Ιουνίου, η MosaicML κυκλοφόρησε το MPT-30B, το οποίο ανέβασε τον πήχη ακόμη περισσότερο για τα ανοικτά μοντέλα θεμελιώδους βάσης.
Το MPT-30B: Ένα Ισχυρό LLM που Ξεπερνά το GPT-3
Το MPT-30B είναι ένα ανοικτό και εμπορικά αδειοδοτημένο μοντέλο LLM που είναι πιο ισχυρό από το GPT-3-175B με μόνο 17% των παραμέτρων του GPT-3, δηλαδή 30B. Ξεπερνά το GPT-3 σε πολλές εργασίες. Εδώ είναι μια σύγκριση μεταξύ MPT-30B και GPT-3.
Το MPT-30B βασίζεται στο προηγούμενο μοντέλο MPT-7B. Είναι υπολογιστικά αποτελεσματικό για εκπαίδευση σε σύγκριση με μοντέλα παρόμοιου μεγέθους. Για παράδειγμα, το LLaMA-30B χρησιμοποίησε περίπου 1,44 φορές περισσότερο προϋπολογισμό FLOPs από το MPT-30B, ενώ το Falcon-40B είχε 1,27 φορές υψηλότερο προϋπολογισμό FLOPs από το MPT-30B. Εδώ είναι μια εικονογράφηση της βελτίωσης του MPT-30B σε διάφορες εργασίες σε σχέση με τον προκάτοχό του.
Ορισμένα đặcικά χαρακτηριστικά του MPT-30B είναι τα ακόλουθα:
8k Token Context Window
Το παράθυρο контекστου σε LLM αναφέρεται στο εύρος των token που το μοντέλο μπορεί να λάβει υπόψη πριν από τη δημιουργία της έξοδου. Το MPT-30B είχε ένα παράθυρο контекστου 8000 token κατά την εκπαίδευση. Εκπαιδεύτηκε πρώτα σε 1T token χρησιμοποιώντας ακολουθίες 2k token και στη συνέχεια σε 50B token ακολουθιών 8k token (περίπου 6000 λέξεις).
ALiBi Support
Για να εξηγήσουμε αυτή τη λειτουργία, ας εξετάσουμε μια ερώτηση:
Πώς μπορεί το MPT-30B να κατανοήσει και να κάνει προβλέψεις για μεγαλύτερες ακολουθίες από ότι εκπαιδεύτηκε;
Το MPT-30B χρησιμοποιεί μια τεχνική Προσοχής με Γραμμικές Προκαταβολές (ALiBi) για να κατανοήσει μεγαλύτερες ακολουθίες και να επεκτείνει το παράθυρο контекστου πέρα από 8k token κατά τη διάρκεια της εκπαίδευσης ή της εκτέλεσης.
Αντί να υπολογίζει ενθυλακώσεις θέσης, στις οποίες αναθέτουμε einen διανυσμα σε κάθε λέξη της ακολουθίας, το ALiBi υπολογίζει βαθμολογίες προσοχής μεταξύ key και query token. Όταν τα key και query token είναι κοντά, η ποινή είναι χαμηλή, αλλά υψηλότερη αλλιώς. Ως αποτέλεσμα, η υποκείμενη αρχιτεκτονική μετασχηματιστή μπορεί να εξαπλώσει σε εισόδους μεγάλου μήκους.
ΕυICIENT Inference & Training Performance via FlashAttention
Η προσοχή, δηλαδή η εστίαση στα σχετικά μέρη της εισοδικής ακολουθίας, είναι ένα κρίσιμο στοιχείο των μετασχηματιστών, αλλά μπορεί να είναι αργή και απαιτητική σε μνήμη, ιδιαίτερα κατά την επεξεργασία μεγάλων ακολουθιών κειμένου.
Το FlashAttention είναι μια προσέγγιση που προτάθηκε από ερευνητές στο Πανεπιστήμιο Κορνέλ που αντιμετωπίζει αυτό το πρόβλημα για το MPT-30B. Χρησιμοποιώντας μια τεχνική που ονομάζεται tiling, το FlashAttention μειώνει τον αριθμό των φορών που το μοντέλο πρέπει να διαβάσει από ή να γράψει στη μνήμη, επιταχύνοντας την επεξεργασία. Έτσι, το μοντέλο χρησιμοποιεί την τεχνική FlashAttention και τη βιβλιοθήκη βελτιστοποίησης FasterTransformer της NVIDIA (NVDA ) για αποτελεσματική εκπαίδευση και εκτέλεση.
Ευκολία Εκπαίδευσης & Αναπτύξεως
Οι dévelopπερ possono εκπαιδεύσει το MPT-30B από την αρχή ή χρησιμοποιήσουν τα σημεία του MosaicML για ταχύτερες αναπτύξεις. Επίσης, μπορεί να εξειδικευτεί για domain-ειδικές περιπτώσεις σε ένα συγκεκριμένο σύνολο δεδομένων.
Το μέγεθος του μοντέλου επιλέχθηκε για να επιτρέψει την άνετη αναπτύξη σε ένα單ικό GPU, συγκεκριμένα 1xA100-80GB σε 16-bit ακρίβεια ή 1xA100-40GB σε 8-bit ακρίβεια. Αυτό σημαίνει ότι το μοντέλο σχεδιάστηκε για να ταιριάζει μέσα στις περιορισμούς μνήμης αυτών των GPU.
Ικανότητες Προγραμματισμού
Το MPT-30B παρέχει εξαιρετικές ικανότητες προγραμματισμού. HumanEval είναι ένα σύνολο δεδομένων που κυκλοφόρησε η OpenAI και περιέχει 164 χειροκίνητα προγραμματισμένα προβλήματα. Στο σύνολο δεδομένων HumanEval, το μοντέλο ξεπερνάει μοντέλα LLM που έχουν σχεδιαστεί ειδικά για προγραμματισμό, όπως η σειρά StarCoder.
Εξειδικευμένες Παραλλαγές: MPT-30B-Instruct & MPT-30B-Chat
MPT-30B-Instruct
Τα LLM χρησιμοποιούνται κυρίως για εντολές, όπως απαντήσεις σε ερωτήσεις, περίληψη κειμένου, μετάφραση γλώσσας, κ.λπ. Το MPT-30B-Instruct είναι μια εμπορικά χρησιμοποιήσιμη (διατηρεί εμπορική άδεια CC-By-SA-3.0) παραλλαγή του MPT-30B που έχει εξειδικευτεί ειδικά για εργασίες που ακολουθούν εντολές. Για την εξειδίκευση, χρησιμοποιήθηκαν τα ακόλουθα σύνολα δεδομένων:
- FLAN
- P3
- Alpaca
- Dolly-15k
Το σύνολο δεδομένων Dolly εμπλουτίστηκε με το σύνολο δεδομένων Helpful and Harmless της Anthropic για την εξειδίκευση εντολών. Επιπλέον, χρησιμοποιήθηκε μια ποικιλία συνόλων δεδομένων για την επέκταση δεδομένων, τα οποία είναι τα ακόλουθα:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
Το MPT-30B-Chat είναι μια εξειδικευμένη έκδοση του MPT-30B για τη δημιουργία διαλόγων. Είναι ένα ερευνητικό έργο που κυκλοφορεί με άδεια CC-By-NC-SA-4.0, επιτρέποντας μόνο μη εμπορική χρήση. Το μοντέλο εξειδικεύτηκε χρησιμοποιώντας διάφορα γλωσσικά σύνολα δεδομένων, συμπεριλαμβανομένων:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
Τα LLM μοιράζονται ένα μεγάλο μέρος της αγοράς γεννητικής AI που αξιολογείται σε δισεκατομμύρια δολάρια και έχει καταγράψει τεράστια ανάπτυξη σε σύντομο χρονικό διάστημα μετά την επανάσταση του ChatGPT την προηγούμενη χρονιά. Η οικογένεια MPT είναι ένα θεμελιώδες μέρος αυτής της επανάστασης. Στο κοντινό μέλλον, μπορούμε να περιμένουμε να δούμε εμπορικά διαθέσιμα ανοικτά μοντέλα που είναι πολύ πιο ισχυρά και αποτελεσματικά από την οικογένεια MPT.
Για τις τελευταίες ειδήσεις AI, επισκεφθείτε unite.ai.















