Μοντέλα και πλατφόρμες AI

Ai2 κυκλοφορεί το Olmo-Core 3, ανοιχτό σύνολο εκπαίδευσης για MoE τρισεκατομμυρίων παραμέτρων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Το Allen Institute for AI κυκλοφόρησε το Olmo-core 3 στις 1 Οκτωβρίου 2026, μια αναβάθμιση του πλαισίου ανάπτυξης μεγάλων γλωσσικών μοντέλων που βασίζεται σε ένα επανασχεδιασμένο ανοιχτό σύστημα εκπαίδευσης με μίξη-εμπειρογνωμόνων το οποίο η Ai2 δήλωσε ότι το έχει δοκιμάσει με περισσότερους από ένα τρισεκατομμύρια συνολικές παραμέτρους.

Η Ai2 δήλωσε ότι το Olmo-core 3 έχει σχεδιαστεί για να κλιμακώνει την εκπαίδευση MoE στην κλίμακα τρισεκατομμυρίων παραμέτρων διατηρώντας την υπολογιστική αποδοτικότητα, και το περιέγραψε ως ένα από τα βασικά συστήματα πίσω από την επόμενη γενιά του Olmo. Η κυκλοφορία συνοδεύεται από ένα τεχνικό έγγραφο, μια διαδραστική επίδειξη και ανοικτό κώδικα.

Τα μοντέλα MoE μπορούν να περιέχουν πολύ περισσότερες παραμέτρους χωρίς να απαιτείται κάθε είσοδος να τις χρησιμοποιεί όλες, αλλά το πλήρες μοντέλο πρέπει ακόμη να αποθηκευτεί σε όλη τη μνήμη GPU και να ενημερώνεται κατά τη διάρκεια της εκπαίδευσης, ενώ η δρομολόγηση των εισόδων στους κατάλληλους εμπειρογνώμονες σε ένα σύμπλεγμα δημιουργεί δικά της κόστη επικοινωνίας και συντονισμού. Η Ai2 δήλωσε ότι αυτά τα κόστη μπορούν να διαβρώσουν μεγάλο μέρος του υπολογιστικού πλεονεκτήματος καθώς τα MoE μεγαλώνουν, και ότι το Olmo-core 3 έχει σχεδιαστεί για να κλείσει αυτό το χάσμα. Σε ένα benchmark της Ai2, η ομάδα εμπειρογνωμόνων αυξήθηκε από 8 σε 128 ενώ εξακολουθούσε να επιλέγει τέσσερις εμπειρογνώμονες ανά token, διατηρώντας τις ενεργές παραμέτρους περίπου στα 3,2 δισεκατομμύρια, ενώ η συνολική χωρητικότητα παραμέτρων αυξήθηκε από 4,6 δισεκατομμύρια σε 47 δισεκατομμύρια, με τη ροή εκπαίδευσης να μειώνεται λιγότερο από 5%.

Από το FSDP σε ένα σύστημα εκπαίδευσης βασισμένο σε DDP

Η προηγούμενη υλοποίηση MoE της Ai2 στο Olmo-core χρησιμοποιούσε πλήρως κατακερματισμένο παράλληλο δεδομένων (fully sharded data parallelism), ρυθμισμένη για τη συλλογή και επανακατανομή βαρών μοντέλου για κάθε μικρή παρτίδα δεδομένων εκπαίδευσης. Το Olmo-core 3 μεταβαίνει σε ένα σύστημα βασισμένο σε κατανεμημένο παράλληλο δεδομένων που διατηρεί τους εμπειρογνώμονες σε GPU και δρομολογεί τα σχετικά δεδομένα σε αυτούς, αποφεύγοντας την επαναλαμβανόμενη συλλογή βαρών. Σε μια προκαταρκτική δοκιμή με οκτώ NVIDIA B300 GPU, η Ai2 αναφέρει ότι ένα MoE 47 δισεκατομμυρίων παραμέτρων επεξεργάστηκε 52.000 tokens ανά δευτερόλεπτο ανά GPU με το νέο σύστημα, σε σύγκριση με 19.400 χρησιμοποιώντας την προηγούμενη υλοποίηση, κάτι που η Ai2 περιγράφει ως περίπου 2,7 φορές μεγαλύτερη ροή.

Η εργασία της Ai2 σε αραιά μοντέλα ξεκινά από το OlmoE, που χρησιμοποίησε μια αρχιτεκτονική MoE με 64 δρομολογημένους εμπειρογνώμονες, ενώ το Olmo 3 χρησιμοποίησε μια πυκνή αρχιτεκτονική στην οποία σχεδόν όλο το μοντέλο ήταν ενεργό για κάθε token. Το Olmo-core 3 επεκτείνει το πλαίσιο με ένα σύστημα εκπαίδευσης σχεδιασμένο για πολύ μεγαλύτερα μοντέλα MoE. Η Ai2 σημείωσε ότι το Megatron-Core της NVIDIA αποτελεί μια καθιερωμένη επιλογή για την εκπαίδευση μεγάλων MoE, και περιέγραψε το Olmo-core 3 ως την προσθήκη ενός ολοκληρωμένου στοίβας εκπαίδευσης MoE στο πλαίσιο πίσω από το Olmo.

Παραλληλισμός, Ακρίβεια και Τεχνικές Μνήμης

Τρεις τεχνικές καθορίζουν πώς το μοντέλο και η κατάσταση εκπαίδευσής του διαμοιράζονται μεταξύ του υλικού: ο παράλληλος εμπειρογνώμονας (expert parallelism) διανέμει τους εμπειρογνώμονες σε GPU, ο παράλληλος αγωγός (pipeline parallelism) χωρίζει τα στρώματα του μοντέλου σε ομάδες GPU, και ένας κατανεμημένος βελτιστοποιητής (distributed optimizer) διανέμει την κατάσταση του βελτιστοποιητή σε GPU αντί να αποθηκεύει πλήρη αντίγραφο σε κάθε GPU. Το Olmo-core 3 μειώνει επίσης το κόστος δρομολόγησης δεδομένων στους σωστούς εμπειρογνώμονες: η παράλληλη δρομολόγηση κατά σειρά (rowwise expert parallelism) τοποθετεί τα δρομολογημένα δεδομένα απευθείας σε buffers εισόδου των εμπειρογνωμόνων, η δρομολόγηση που διαμένει σε GPU διατηρεί τα μεταδεδομένα δρομολόγησης στα GPU ώστε η CPU να μπορεί να προγραμματίσει εργασίες χωρίς να περιμένει την αντιγραφή πίσω, και η ομαδοποιημένη GEMM συνδυάζει πολλές μικρές υπολογιστικές εργασίες των εμπειρογνωμόνων ώστε τα GPU να τις εκτελούν πιο αποδοτικά. Το τεχνικό έγγραφο περιγράφει ένα σχεδιασμό rowwise expert parallelism βασισμένο σε NVSHMEM που γράφει κάθε token απευθείας στο buffer του αντίστοιχου εμπειρογνώμονα, με ομαδοποιημένους πολλαπλασιασμούς πινάκων προγραμματισμένους από τη συσκευή, που καθιστούν τον παράλληλο εμπειρογνώμονα εντελώς χωρίς συγχρονισμό.

Το Olmo-core 3 υποστηρίζει το MXFP8, μια μορφή αριθμού χαμηλότερης ακρίβειας. Σε ένα ελεγχόμενο benchmark με τέσσερα NVIDIA B300 GPU, όπου η εργασία διανεμήθηκε ομοιόμορφα μεταξύ των εμπειρογνωμόνων, η Ai2 αναφέρει ότι η ροή εκπαίδευσης ήταν περίπου 21% υψηλότερη από τη βάση BF16, ενώ η μέγιστη ενεργή μνήμη μειώθηκε από 103 GiB σε 95 GiB, με το μεγαλύτερο μέρος του κέρδους να προέρχεται από τον υπολογισμό feed-forward και τη μετακίνηση δεδομένων μεταξύ των εμπειρογνωμόνων. Η αναφορά προσθέτει ότι τα σημεία ελέγχου ανεξάρτητα από την τοπολογία καταγράφουν παγκόσμιους τανυστές FP32 ανεξάρτητα από τη παράλληλη διάταξη, ώστε μια εκτέλεση να μπορεί να συνεχιστεί σε διαφορετική τοπολογία, και ότι στη ελεγχόμενη σύγκριση η επαναϋπολογισμός ενεργοποιήσεων αφαίρεσε σχεδόν τα δύο τρίτα της μνήμης ενεργοποιήσεων και μείωσε τη μέγιστη μνήμη κατά περίπου ένα τέταρτο με κόστος περίπου το ένα πέμπτο της ροής.

Δοκιμές τρισεκατομμυρίων παραμέτρων και δηλωμένοι περιορισμοί

Η Ai2 δήλωσε ότι έπραξε benchmark του Olmo-core 3 σε μια σειρά ρυθμίσεων σε NVIDIA B300 GPU, συμπεριλαμβανομένου ενός μοντέλου 1,2 τρισεκατομμυρίων παραμέτρων με 58,36 δισεκατομμύρια ενεργές παραμέτρους ανά token σε 512 GPU, όπου η υψηλότερη παρατηρηθείσα ροή ήταν 858 TFLOP/s ανά GPU. Η Ai2 ανέφερε ότι αυτές οι δοκιμές χρησιμοποίησαν τυχαία δρομολόγηση για τη μέτρηση της απόδοσης του συστήματος αντί για την ποιότητα ενός εκπαιδευμένου μοντέλου. Το τεχνικό έγγραφο παραθέτει τα μετρημένα σημεία λειτουργίας από ένα μοντέλο 12,9 δισεκατομμυρίων παραμέτρων σε 16 GPU έως το μοντέλο 1,2 τρισεκατομμυρίων παραμέτρων σε 512, και δηλώνει ότι τα κύρια ποσοστά είναι αναφορές συστήματος μετρημένες υπό τυχαία δρομολόγηση, όχι μια ελεγχόμενη καμπύλη κλιμάκωσης ή αξίωση χρόνου-προς-ποιότητα.

Ai2 επίσης πειραματίστηκε με το DeepEP v2, ένα εναλλακτικό backend για επικοινωνία μεταξύ ειδικών σε διαφορετικές GPU, φθάνοντας σε μια διαμόρφωση με 2.38 trillion συνολικούς παραμέτρους. Η Ai2 περιγράφει αυτό το αποτέλεσμα ως μια δοκιμή μικρής χωρητικότητας που δείχνει την κλίμακα που μπορεί να φτάσει το Olmo-core 3, αντί για διαρκή απόδοση εκπαίδευσης. Η τεχνική έκθεση, με τίτλο “Supercharging Olmo-core for Efficient and Scalable MoE Training”, είναι ημερομηνίας Οκτωβρίου 2026· οι συγγραφείς προέρχονται από το Allen Institute for AI και το University of Washington, με τον Tianhua Tao να αναφέρεται ως κύριος συγγραφέας και κύριος προγραμματιστής.

Καταγεγραμμένα Ευρήματα και Σχέδια για την Επόμενη Γενιά Olmo

Η έκθεση καταγράφει ένα πρότυπο αποτυχίας που η Ai2 ονομάζει token gerrymandering, στο οποίο ένας δείκτης που προορίζεται να ενθαρρύνει ισορροπημένη δρομολόγηση μπορεί να βελτιώνεται ακόμη και όταν το πραγματικό φορτίο εργασίας γίνεται λιγότερο ισορροπημένο. Άλλα καταγεγραμμένα ευρήματα περιλαμβάνουν: η μείωση των ρυθμών μάθησης των ειδικών επειδή επεξεργάζονται λιγότερα tokens δεν βελτίωσε τα αποτελέσματα στην οικογένεια μοντέλων που δοκιμάστηκε· οι υπολογισμοί GPU χρειάστηκαν διαφορετικό χρόνο όταν οι τιμές που επεξεργάζονταν άλλαζαν, ακόμη και με τις ίδιες διαστάσεις πίνακα· και η ταυτόχρονη επικοινωνία και υπολογισμός σε ξεχωριστά ρεύματα GPU δεν έκανε πάντα την εκπαίδευση ταχύτερη και σε ορισμένες δοκιμές επιβράδυνε την εκτέλεση από άκρη σε άκρη. Η έκθεση επίσης περιγράφει προσεγγίσεις που δοκιμάστηκαν αλλά δεν υιοθετήθηκαν, συμπεριλαμβανομένης της εκφόρτωσης CPU των ενεργοποιήσεων που ο κεντρικός σύνδεσμος δεν μπορούσε να μεταφέρει και δύο σχήματα επικάλυψης που ανταγωνίζονταν με τον υπολογισμό των ειδικών για πόρους GPU.

Η Ai2 δήλωσε ότι η επόμενη γενιά Olmo θα χρησιμοποιήσει αρχιτεκτονική MoE και στοχεύει να είναι η πιο ικανή Olmo μέχρι τώρα, εκπαιδευμένη στο μεγαλύτερο σύνολο δεδομένων της και με το μεγαλύτερο παράθυρο συμφραζομένων. Ο οργανισμός ανέφερε ότι το Olmo-core 3 είναι πλήρως ανοιχτό, ώστε ερευνητές και προγραμματιστές να μπορούν να το χρησιμοποιήσουν για την εκπαίδευση των δικών τους MoE, να το προσαρμόσουν σε διαφορετικό υλικό και να πειραματιστούν με δρομολόγηση, παράλληλοτητα και άλλα μέρη του συστήματος. Το αποθετήριο Olmo-core στο GitHub περιγράφει το έργο ως δομικά στοιχεία PyTorch για το οικοσύστημα OLMo, φέρει άδεια Apache-2.0 και μπορεί να εγκατασταθεί από πηγή ή από το PyPI ως ai2-olmo-core.

Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στην Unite.AI, εστιάζοντας στην γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τα θεωρητικά θεμέλια της μηχανικής νοημοσύνης. Η δουλειά του διερευνά πώς η μάθηση, η λογική, η μνήμη και η αφαίρεση εμφανίζονται τόσο σε βιολογικά όσο και σε τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ των σύγχρονων αρχιτεκτονικών AI και των μακροχρόνιων ερωτήσεων στην γνωστική επιστήμη και τη φιλοσοφία του νου.

Με μια εννοιολογική και στοχαστική προσέγγιση, ο Jonas εξετάζει πλαίσια όπως μοντέλα λογικής, συστήματα πράκτορα, αναδυόμενη γνωστική λειτουργία και θεωρία ευθυγράμμισης, με στόχο να διευκρινίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI — και τι δεν σημαίνει. Αντί να κυνηγά χρονοδιαγράμματα ή υπερβολές, δίνει έμφαση στις πρώτες αρχές, στην εννοιολογική αυστηρότητα και στα όρια των τρεχουσών μοντέλων.

Τα άρθρα που συντάσσει ο Jonas Reeve δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση των προχωρημένων εννοιών AI.