Μοντέλα και πλατφόρμες AI

Η Cerebras Αναφέρει 5× Αύξηση της Απόδοσης Εξαγωγής από τη Διασπορά

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Cerebras Systems δήλωσε στις 1 Οκτωβρίου 2026 ότι αύξησε την απόδοση εξαγωγής κατά 5× σε αρχικά αποτελέσματα χρησιμοποιώντας μια τεχνική που ονομάζεται διασπορά, με τον ίδιο αριθμό συστημάτων Cerebras και χωρίς απώλεια στην ταχύτητα δημιουργίας token. Η ανακοίνωση εμφανίστηκε στο Διασπασμένη Εξαγωγή από το Μηδέν, μια ανάρτηση στο εταιρικό blog από τους Isaac Tai και Zhenwei Gao που ανοίγει μια προγραμματισμένη σειρά για το θέμα.

Η ανάρτηση θέτει τη σειρά για αναγνώστες που έχουν ακούσει τον όρο διασπορά ή την αξίωση ότι η προγέμιση είναι περιορισμένη από την υπολογιστική ισχύ και η αποκωδικοποίηση περιορίζεται από τη μνήμη, και αναρωτιούνται τι σημαίνει πραγματικά το καθένα. Αναπτύσσει την εξήγηση από το μηδέν, ξεκινώντας από το πώς οι επιταχυντές ισορροπούν την αριθμητική με τη μετακίνηση δεδομένων.

Η Προγέμιση και η Αποκωδικοποίηση Θέτουν Διαφορετικές Απαιτήσεις στο Υλικό

Η ανάρτηση ορίζει την ένταση αριθμητικών πράξεων ως τον αριθμό των πράξεων κινητής υποδιαστολής διαιρεμένο με τον αριθμό των byte που μεταφέρονται μεταξύ μνήμης και των μονάδων υπολογισμού ενός επιταχυντή. Σε ένα από τα παραδείγματα, η πρόσθεση δύο πινάκων εκτελεί 1 FLOP για κάθε 6 byte που μετακινούνται, με ένταση αριθμητικών πράξεων 0,167 FLOP ανά byte, και αυτός ο λόγος παραμένει σταθερός καθώς οι πίνακες μεγαλώνουν. Ο πολλαπλασιασμός πινάκων συμπεριφέρεται διαφορετικά: κάθε τιμή εξόδου κατασκευάζεται από ολόκληρη σειρά ενός εισόδου και ολόκληρη στήλη του άλλου, έτσι οι φορτωμένες τιμές συμβάλλουν σε περισσότερες εξόδους και η ένταση αριθμητικών πράξεων αυξάνεται με το μέγεθος της εισόδου.

Η εξαγωγή, εξηγεί η ανάρτηση, είναι μια αλυσίδα τέτοιων πολλαπλασιασμών πινάκων μεταξύ των σταθερών βαρών ενός μοντέλου και των token εισόδου, και εκτελείται σε δύο φάσεις με διαφορετικά προφίλ έντασης. Κατά τη διάρκεια της προγέμισης, ολόκληρο το prompt επεξεργάζεται παράλληλα ως μια μεγάλη λειτουργία πινάκων, και τα πραγματικά prompts μπορούν να περιέχουν χιλιάδες ή ακόμη και εκατοντάδες χιλιάδες token. Κατά τη διάρκεια της αποκωδικοποίησης, τα token δημιουργούνται ένα προς ένα, και το μοντέλο βασίζεται στην κρυφή μνήμη KV, η οποία αποθηκεύει κλειδιά και τιμές που υπολογίστηκαν για προηγούμενα token ώστε να επαναχρησιμοποιηθούν αντί να υπολογιστούν ξανά.

Και οι δύο φάσεις πρέπει ακόμη να μεταφέρουν όλα τα βάρη του μοντέλου, ενδεχομένως εκατοντάδες gigabyte ή terabyte, στις μονάδες υπολογισμού για κάθε παραγόμενο token. Η ανάρτηση δείχνει ότι η κίνηση μνήμης παραμένει σχεδόν σταθερή ενώ η ένταση αριθμητικών πράξεων μειώνεται μετά την προγέμιση, και αναφέρει ότι αυτό το κενό είναι ο λόγος που η προσθήκη ακατέργαστης υπολογιστικής ισχύος δεν οδηγεί απαραίτητα σε ταχύτερη άφιξη των token κατά την αποκωδικοποίηση.

Η Διασπορά Διαχωρίζει την Εξαγωγή σε Ξεχωριστές Ομάδες

Σε παραγωγικό περιβάλλον, ένας διακομιστής εξαγωγής συνήθως διαχειρίζεται πολλές αιτήσεις ταυτόχρονα, και όταν η προγέμιση και η αποκωδικοποίηση εκτελούνται στο ίδιο υλικό, η υπολογιστικά απαιτητική προγέμιση μπορεί να καθυστερήσει ενεργές αιτήσεις αποκωδικοποίησης. Οι προγραμματιστές πρέπει τότε να επιλέξουν μεταξύ του να εξυπηρετούν γρήγορα τις νέες αιτήσεις μέχρι το πρώτο token, να διατηρούν τις ενεργές απαντήσεις σε ομαλή ροή, και να μεγιστοποιούν τη συνολική απόδοση. Η ομαδοποίηση επιτρέπει στις ταυτόχρονες αιτήσεις να μοιράζονται το έργο της ανάγνωσης των βαρών του μοντέλου, αλλά μεγαλύτερα batch μπορούν να κάνουν κάθε βήμα αποκωδικοποίησης πιο αργό, έτσι η συνολική απόδοση μπορεί να αυξηθεί ενώ κάθε χρήστης λαμβάνει τα token πιο αργά.

Η ανάρτηση περιγράφει τη διασπορά ως ένα πρότυπο σχεδίασης συστημάτων που εκτελεί τις δύο φάσεις σε ξεχωριστές ομάδες υλικού. Μόλις οι φάσεις διαχωριστούν, οι διαχειριστές μπορούν να κατανείμουν υλικό, να ορίσουν πολιτικές ομαδοποίησης και να δώσουν προτεραιότητα στη λανθάνουσα ή στην απόδοση για κάθε φάση ανεξάρτητα: ένα σύστημα με αυστηρούς στόχους χρόνου-πρώτου-token μπορεί να διατηρήσει περισσότερη χωρητικότητα για την προγέμιση, ενώ ένα που έχει σχεδιαστεί για ομαλή ροή μπορεί να δώσει στην αποκωδικοποίηση μια μεγαλύτερη ή πιο στενά προγραμματισμένη ομάδα. Οι ομάδες μπορούν επίσης να κλιμακωθούν ξεχωριστά.

Ο διαχωρισμός εισάγει μια νέα απαίτηση. Μετά την προγέμιση, η δημιουργία της κρυφής μνήμης KV απαιτεί η κατάσταση που αφορά συγκεκριμένο αίτημα να μεταφερθεί στην ομάδα αποκωδικοποίησης, όπου φορτώνεται στη μνήμη πριν συνεχιστεί η παραγωγή, ενώ τα βάρη του μοντέλου είναι ήδη φορτωμένα και στις δύο ομάδες. Η ανάρτηση σημειώνει ότι η μεταβίβαση προσθέτει επιπλέον κόστος δικτύου και συντονισμού, ότι οποιαδήποτε ομάδα μπορεί να παραμείνει αδρανής εάν οι χωρητικότητες δεν ταιριάζουν με τη ζήτηση, και ότι η πρόσθετη καθυστέρηση εξαρτάται από το αν η κρυφή μνήμη μετακινείται μεταξύ συν-τοποθετημένων μηχανών ή μεταξύ περιοχών. Υποστηρίζει ότι η διασπορά είναι πιο ελκυστική σε μεγάλη κλίμακα, όπου τα κέρδη από την ανεξάρτητη διάσταση και προγραμματισμό των ομάδων μπορούν να υπερβαίνουν τα κόστη μεταφοράς και λειτουργίας, και ότι αλλάζει το διεπαφή ελέγχου του συστήματος εξυπηρέτησης αντί μόνο να λειαίνει τη ροή.

Ασυμμετρικό Υλικό, Πρώιμα Αποτελέσματα και Συνεργασίες

Η Cerebras δήλωσε ότι ηγείται της ανάπτυξης ασυμμετρικής διασποράς, συνδυάζοντας πολλαπλούς τύπους τσιπ σε ένα σύστημα εξαγωγής και αναθέτοντας διαφορετικό υλικό στα τμήματα που είναι περιορισμένα από τη μνήμη ή από τον υπολογισμό. Η ανάρτηση συγκρίνει το σχεδιασμό wafer-scale της εταιρείας, το οποίο διανέμει SRAM παράλληλα με την υπολογιστική ισχύ σε όλο το wafer, με τις GPU, οι οποίες προετοιμάζουν τα δεδομένα του μοντέλου από μνήμη υψηλού εύρους ζώνης μέσω μικρότερων ενσωματωμένων μνημών και κρυφών μνημών.

Ένα διάγραμμα δημοσιευμένου μέγιστου εύρους ζώνης μνήμης στην ανάρτηση, ημερομηνίας 10 Σεπτεμβρίου 2026, καταγράφει το ενσωματωμένο SRAM του Cerebras WSE-3 με 21.000 TB/s ανά wafer, μαζί με έναν ανώνυμο επιταχυντή ενσωματωμένου SRAM με 150 TB/s και τις GPU HBM4 με 23,3 και 22 TB/s. Το διάγραμμα προειδοποιεί ότι οι τιμές SRAM αθροίζουν το τοπικό εύρος ζώνης μνήμης σε όλο τον επεξεργαστή, ενώ οι τιμές HBM μετρούν την κίνηση από μνήμη εκτός τσιπ, έτσι οι αριθμοί περιγράφουν διαφορετικά επίπεδα μνήμης αντί για μετρημένες ταχύτητες token.

Η ανάρτηση επίσης αναπαράγει δεδομένα Artificial Analysis από τις 10 Σεπτεμβρίου 2026 για το GPT-oss-120B που εκτελεί υψηλή λογική με 10,000 εισαγόμενα διακριτικά. Αναφέρει το Cerebras στα 1,669 διακριτικά εξόδου ανά δευτερόλεπτο, το SambaNova στα 708, το Groq στα 475, το Microsoft Azure στα 319, το Nebius στα 294 και το Baseten στα 293.

Η Cerebras δήλωσε ότι σε ένα παραδοσιακό ενοποιημένο σύστημα, η αύξηση της χωρητικότητας σήμαινε την ανάπτυξη περισσότερου υλικού, και ότι αξιοποιώντας τους επιταχυντές συνεργατών για τη διαχείριση της επεξεργασίας προτροπών, αύξησε τη χωρητικότητα κατά 5× σε πρώιμες δοκιμές με το ίδιο αποτύπωμα WSE. Η εταιρεία ανέφερε ότι έχει ανακοινώσει συνεργασίες με πολλούς προμηθευτές υλικού για να φέρει στην αγορά περισσότερα υπεργρήγορα διακριτικά, και ένα διάγραμμα στην ανάρτηση δείχνει τα συστήματα AWS Trainium και AMD Helios Instinct GPU μεταξύ των επιλογών υλικού προγέμισης που τροφοδοτούν μια δεξαμενή αποκωδικοποίησης Cerebras.

Η ανάρτηση αναγνωρίζει τις εφαρμογές πράκτορα ως ιδανική προσαρμογή για την ετερογενή αποσυσκευασία, καθώς συχνά περιλαμβάνουν μακροχρόνιες, πολυβήματικές ροές εργασίας όπου το συμφραζόμενο αυξάνεται μεταξύ κλήσεων μοντέλου και οι καθυστερήσεις σε κάθε βήμα συντίθενται. Η Cerebras δήλωσε ότι οι επόμενες ενότητες θα καλύψουν τις εμπλεκόμενες στοίβες υλικού και λογισμικού και τις οικονομικές ανταλλαγές του κόστους κατά την υλοποίηση αποσυσκευασμένη επαγωγή σε κλίμακα.

Theo Nash είναι ένας ειδικός που δημιουργείται με τεχνητή νοημοσύνη στη Unite.AI, καλύπτοντας την υποδομή AI, τον υπολογισμό και τα συστήματα υλικού που τροφοδοτούν τη σύγχρονη τεχνητή νοημοσύνη. Η δουλειά του εστιάζει στις τεχνικές βάσεις πίσω από τις μεγάλης κλίμακας εργασίες AI, συμπεριλαμβανομένων των κέντρων δεδομένων, των επιταχυντών, των δικτύων και των στοίβων λογισμικού που τα συνδέουν.

Με μια αναλυτική και μηχανική προοπτική, ο Theo εξετάζει πώς οι εξελίξεις στις GPU, το προσαρμοσμένο πυρίτιο, τις αρχιτεκτονικές μνήμης και τα κατανεμημένα συστήματα επιτρέπουν νέες γενιές μοντέλων AI. Δίνει ιδιαίτερη προσοχή στις ανταλλαγές απόδοσης, την ενεργειακή αποδοτικότητα, την κλιμακωσιμότητα και τους πρακτικούς περιορισμούς που διαμορφώνουν την πραγματική υλοποίηση της υποδομής AI.

Τα άρθρα που συντάσσει ο Theo Nash δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών του Unite.AI για να διασφαλίσουν τεχνική ακρίβεια, σαφήνεια και υπεύθυνη κάλυψη του ταχέως εξελισσόμενου τοπίου υπολογισμού AI.