Μοντέλα και πλατφόρμες AI

Z.ai παρουσιάζει το GLM-5.3-Flash Inference σε 100.000 κινεζικά τσιπ

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Z.ai στις 17 Σεπτεμβρίου 2026 δημοσίευσε μια τεχνική αναφορά που περιγράφει πώς δημιούργησε μια πλήρη υπηρεσία inferencing παραγωγικής ποιότητας για το μοντέλο GLM-5.3-Flash από το μηδέν σε ένα σύμπλεγμα άνω των 100.000 κινεζικών AI επιταχυντών. Σύμφωνα με την εταιρεία, το μεγαλύτερο μέρος της εργασίας πραγματοποιήθηκε από έναν Infra Agent που τροφοδοτείται από το GLM-5.3 αντί από μόνοι τους τους μηχανικούς υποδομής, και όλο το παραγωγικό inference για το GLM-5.3-Flash εκτελείται στο σύστημα.

Η Z.ai δήλωσε ότι κανείς δεν είχε προηγουμένως λειτουργήσει σύμπλεγμα κινεζικών επιταχυντών σε αυτή την κλίμακα. Η εταιρεία ανέφερε σχετικά περιορισμένη χωρητικότητα μνήμης εντός τσιπ και εύρος ζώνης, μια νέα αρχιτεκτονική μοντέλου, ένα παράθυρο συμφραζομένων 1M-token, και πολυμορφικές αιτήσεις, μαζί με ένα ανεπαρκές οικοσύστημα όπου η υποστήριξη πυρήνων ήταν ελλιπής και οι μηχανικοί έπρεπε να εικάζουν τη συμπεριφορά που έπρεπε να είχε τεκμηριωθεί.

Το GLM-5.3-Flash εκκινήθηκε στις 26 Αυγούστου 2026 ως το πρώτο εγγενώς πολυμορφικό μοντέλο στη σειρά GLM-5, με 320 δισεκατομμύρια συνολικές παραμέτρους και 18 δισεκατομμύρια ενεργές παραμέτρους υπό μια υβριδική αρχιτεκτονική που συνδυάζει σπάνιες και γραμμικές προσοχές. Πριν από την κυκλοφορία, η Z.ai έλεγξε το μοντέλο ανώνυμα ως ox-alpha στο OpenCode και στο OpenRouter, και η εταιρεία δήλωσε ότι έγινε το πιο χρησιμοποιημένο μοντέλο και στις δύο πλατφόρμες εντός μιας εβδομάδας από την εκκίνηση, επεξεργαζόμενη πάνω από 62 τρισεκατομμύρια tokens σε έξι ημέρες.

Η Μέθοδος Πυκνής Ανατροφοδότησης

Στον πυρήνα της αναφοράς βρίσκεται ένα πρόβλημα συστημάτων: οι μετρικές από άκρη σε άκρη μπορούν να ενημερώσουν έναν πράκτορα ότι τα αποτελέσματα χειροτέρεψαν, αλλά όχι γιατί. Μια αποτυχημένη δοκιμή αριθμητικής ακρίβειας, μια αύξηση 30% του χρόνου μέχρι το πρώτο token, ή μια μείωση 20% της απόδοσης εξόδου δεν δείχνει ποιο στρώμα είναι υπεύθυνο ή τι πρέπει να δοκιμαστεί στη συνέχεια. Η απάντηση της Z.ai, που ονομάζει πυκνή ανατροφοδότηση, ενσωματώνει δοκιμές ορθότητας, καταγραφές χρόνου εκτέλεσης, ίχνη εκτέλεσης, συμβάντα χρόνου εκτέλεσης, μικρο-δοκιμές και μετρικές από άκρη σε άκρη σε επαναλήψιμες ροές εργασίας που επιτρέπουν στον πράκτορα να επικυρώνει κάθε υπόθεση τοπικά αντί να περιμένει μια πλήρη ανάπτυξη και δοκιμή φορτίου μετά από κάθε αλλαγή.

Η εταιρεία ορίζει τρεις απαιτούμενες ιδιότητες για μια τέτοια ανατροφοδότηση. Πρέπει να είναι τοπική, συνδεδεμένη όπου είναι δυνατόν με συγκεκριμένες παραμέτρους εκκίνησης, αλλαγές κώδικα, πυρήνες, συνθήκες εισόδου, νήματα, διαστήματα εκτέλεσης ή διαδρομές κώδικα. Πρέπει να είναι οικονομική και έγκαιρη στην απόκτηση. Και πρέπει να υποστηρίζει αντικειμενική επαλήθευση μέσω αναφοράς υλοποιήσεων και ελεγχόμενων πειραμάτων, επειδή οι παρατηρηθείσες συσχετίσεις από μόνες τους δεν αποδεικνύουν την αιτία.

Στο βρόχο εκκίνησης που περιγράφεται στην αναφορά, οι μηχανικοί καθόρισαν στόχους και όρια συστήματος και εξέτασαν κρίσιμες αλλαγές που αφορούσαν αριθμητική σημασιολογία, συμπεριφορά ταυτόχρονης εκτέλεσης και κίνδυνο παραγωγής, ενώ ο πράκτορας ανέλαβε την ανάλυση, τις υποθέσεις και τις αλλαγές κώδικα. Η στοίβα που βελτιστοποίησαν από κοινού συνδύαζε εσωτερική παράλληλη επεξεργασία τανυστών για γραμμική προσοχή και το LM Head, ReplaySSM, ποσοτικοποίηση W8A8, ποσοτικοποίηση μιγμένης ακρίβειας INT8/FP8/BF16 στην κρυφή μνήμη, και Layer Split, υπό μια αρχιτεκτονική διαχωρισμένη Encode-Prefill-Decode.

Τρία Μηχανικά Παραδείγματα

Η πρώτη περίπτωση αφορά την αριθμητική ορθότητα. Η επικύρωση που συνέκρινε τα διαμερισμένα και αδιαμερισμένα μονοπάτια εκτέλεσης πυρήνων αποκάλυψε πρόβλημα ακρίβειας στη διαδρομή Context Parallelism του πυρήνα KDA: η λειτουργία tl.dot προεπιλεγόταν σε υπολογισμό TF32 ακόμη και όταν οι είσοδοι ήταν FP32, οπότε τα σφάλματα συσσωρεύονταν κατά τη συγχώνευση κατάστασης και εντείνονταν καθώς αυξανόταν το μήκος του συμφραζομένου. Η διόρθωση ορίζει ρητά την ακρίβεια εισόδου σε tf32x3, η οποία χρησιμοποιεί τρεις λειτουργίες TF32 Tensor Core για να παράγει αποτέλεσμα υψηλότερης ακρίβειας.

Σύμφωνα με την αναφορά, οι διορθώσεις συγχωνεύτηκαν ανωδρότως στο Flash Linear Attention. Η αίτηση έλξης, που ανοίχθηκε και συγχωνεύτηκε στις 27 Αυγούστου 2026, εφαρμόζει την αλυσίδα tf32x3 affine στους πυρήνες ενημέρωσης κατάστασης και συγχώνευσης μετασχηματισμών ως προαιρετική διαδρομή ακρίβειας, προσθέτει δοκιμές Context Parallelism, και επιστρέφει ρητά στην ακρίβεια ieee σε πλατφόρμες χωρίς υποστήριξη tf32 (AMD, NPUs και NVIDIA GPUs κάτω από δυνατότητα υπολογισμού 8.0).

Το δεύτερο σενάριο αφορά ένα ζυγό συμφόρησης μεταφοράς KV. Σύμφωνα με τον λογαριασμό, οι μηχανικοί καθόρισαν ένα κριτήριο αποδοχής που, υπό το ίδιο φορτίο εργασίας, η Prefill συν KV Transfer πρέπει να εκτελείται εντός 5 % της βάσης Prefill‑only. Ο πράκτορας εντόπισε κενά που ξεπερνούσαν το 20 % σε ορισμένα σενάρια και τα συνέδεσε με το DeepEP v1.2.1, στο οποίο ούτε η intranodedispatch ούτε η intranodecombine κλήση απελευθέρωναν ρητά το Python GIL. Εφόσον αυτές οι κλήσεις κρατούσαν το κλείδωμα, το νήμα Python της Moonwalk Transfer στην ίδια διεργασία δεν μπορούσε να αποκτήσει το GIL έγκαιρα, οπότε ο προγραμματισμός και η υποβολή των εργασιών μεταφοράς καθυστέρησαν και η επικάλυψη με την εκτέλεση υποχώρησε. Ο λογαριασμός σημειώνει ότι η internode_dispatch στην ίδια έκδοση είχε ήδη απελευθερώσει το GIL, με ένα σχόλιο κώδικα που ανέφερε ότι ο σκοπός ήταν η αποφυγή φραγής της KV Transfer σε άλλα νήματα ενώ η CPU περίμενε. Μετά τη διόρθωση που απελευθέρωσε το GIL κατά τα σχετικά διαστήματα εκτέλεσης C++, σύμφωνα με τον λογαριασμό, το κενό έπεσε κάτω από 1 % υπό τις ίδιες συνθήκες δοκιμής.

Η τρίτη περίπτωση αφορά την απόδοση του πυρήνα. Η Z.ai είχε τον πράκτορα να εξάγει τεχνικές από χειρόγραφα kernels σε έργα όπως SGLang, Flash Linear Attention και DeepGEMM, δημιουργώντας επαναχρησιμοποιήσιμα σκελετάκια βελτιστοποίησης που περιλαμβάνουν συνθήκες εφαρμοσιμότητας, μεθόδους μετασχηματισμού, περιορισμούς πόρων και αποδείξεις επικύρωσης. Σε ένα αντιπροσωπευτικό kernel KDA Decode, η εταιρεία αναφέρει ότι η βελτιστοποίηση διαίρεσης του πράκτορα μείωσε τον χρόνο εκτέλεσης κατά 9,6 %. Μετά από ανατροφοδότηση που εντόπισε τον υπολογισμό ως κύριο εμπόδιο, ο πράκτορας συγχώνευσε τα πλακίδια της διάστασης V του kernel, τα οποία επαναλάμβαναν την ίδια κανονικοποίηση FP32 και τις λειτουργίες ελέγχου τέσσερις φορές, σε ένα ενιαίο μπλοκ νήματος με ενδιάμεσα αποτελέσματα που διαμένουν σε καταχωρητές και μία μείωση σε επίπεδο warp, παράγοντας ό,τι η εταιρεία αναφέρει ως επιτάχυνση 1,71× σε σχέση με την προηγούμενη έκδοση.

Δηλωμένα Αποτελέσματα και Αναδρομική Αυτο-Βελτίωση

Η Z.ai αναφέρει ότι το GLM-5.3-Flash προχώρησε από την αρχική προσαρμογή του μοντέλου στην ετοιμότητα παραγωγής σε λιγότερο από δύο εβδομάδες, με τη συνολική απόδοση να τριπλασιάζεται τελικά σε σχέση με το αρχικό baseline. Η εταιρεία δήλωσε επίσης ότι η αποδοτικότητα χρήσης του υλικού και το κόστος ανά token έφτασαν σε επίπεδα συγκρίσιμα με τα κυρίαρχα GPU της NVIDIA.

Η εταιρεία παρουσιάζει την προσπάθεια ως ένα πρώιμο παράδειγμα αναδρομικής αυτο-βελτίωσης, σημειώνοντας ότι το μοντέλο συμμετείχε στη βελτιστοποίηση του συστήματος εκτέλεσης inference στο οποίο λειτουργεί. Ταυτόχρονα, η Z.ai δηλώνει ότι δεν έχει ακόμη φτάσει στην αναδρομική αυτο-βελτίωση, και ότι η επιλογή στόχων, ο καθορισμός ορίων και η αξιολόγηση κινδύνου παραμένουν ανθρώπινες ευθύνες που, κατά την άποψή της, πρέπει να συνεχίσουν να αναλαμβάνονται από ανθρώπους.

Ο Theo Nash είναι ένας ειδικός που δημιουργήθηκε από AI στο Unite.AI, που καλύπτει την υποδομή AI, τον υπολογισμό και τα συστήματα υλικού που τροφοδοτούν την σύγχρονη τεχνητή νοημοσύνη. Το έργο του επικεντρώνεται στις τεχνικές βάσεις πίσω από τις μεγάλες εργασίες AI, συμπεριλαμβανομένων των κέντρων δεδομένων, των επιταχυντών, των δικτύων και των στοιχείων λογισμικού που τα συνδέουν.
Με μια αναλυτική και μηχανική προοπτική, ο Theo εξετάζει πώς οι προόδους στις GPU, το εξειδικευμένο σιλικόνιο, τις αρχιτεκτονικές μνήμης και τα κατανεμημένα συστήματα επιτρέπουν новые γενιές μοντέλων AI. Δίνει ιδιαίτερη προσοχή στις ανταλλαγές απόδοσης, την ενεργειακή αποτελεσματικότητα, την κλιμακωσιμότητα και τις πρακτικές περιορισμοί που διαμορφώνουν την ανάπτυξη της υποδομής AI στον πραγματικό κόσμο.
Οι άρθρα που γράφονται από τον Theo Nash δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα του Unite.AI για να διασφαλίσουν την τεχνική ακρίβεια, τη σαφήνεια και την υπεύθυνη κάλυψη του ταχέως εξελισσόμενου τοπίου υπολογισμού AI.