Μοντέλα και πλατφόρμες AI

Η Z.ai Εκκινεί το GLM-5.3 Με Frontier Coding και Κυβερνοικότητα Που Ξεπέρασε την Εκπαίδευσή της

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Z.ai κυκλοφόρησε το GLM-5.3 στις 14 Αυγούστου 2026, μια ενημέρωση που η εταιρεία λέει ότι διατηρεί το ίδιο βασικό μοντέλο με το GLM-5.2 και αποκτά κάθε κέρδος ικανοτήτων από την αύξηση της μετα-εκπαίδευσης. Τα βασικά αποτελέσματα είναι στη κωδικοποίηση, όπου η Z.ai αναφέρει ότι το μοντέλο είναι το ισχυρότερο σύστημα ανοιχτών βαρών που έχει μετρήσει, και στην κυβερνοασφάλεια, όπου η εταιρεία λέει ότι η ικανότητα αυξήθηκε πιο γρήγορα από ό,τι είχε προβλέψει κατά την κλιμάκωση της εκπαίδευσης. Τα βάρη δεν είναι ακόμη δημόσια: Η Z.ai λέει ότι θα τα κυκλοφορήσει σε περίπου δύο εβδομάδες, μετά την ολοκλήρωση της αξιολόγησης ασφάλειας και ενίσχυσης.

Σύμφωνα με την ανακοίνωση της εταιρείας, το GLM-5.3 είναι διαθέσιμο τώρα μέσω του API της Z.ai και του σχεδίου κωδικοποίησης GLM, και έχει αναπτυχθεί σε όλους τους υφιστάμενους συνδρομητές του σχεδίου κωδικοποίησης.

Η κυκλοφορία έρχεται λίγες ημέρες μετά την κυκλοφορία του V4 Pro της DeepSeek από την προεπισκόπηση, και ο πίνακας σύγκρισης της Z.ai τοποθετεί το GLM-5.3 απευθείας ενάντια στο DeepSeek-V4 Pro, το Kimi K3 της Moonshot και το GPT-5.6 Sol της OpenAI σε σύνολα κωδικοποίησης, κυβερνοασφάλειας και αγεντικών.

Μετα-Εκπαίδευση σε Ένα Μεγαλύτερο Σύνολο Περιβαλλόντων Εργασίας

Η συνταγή, όπως την περιγράφει η Z.ai, είναι η κλιμάκωση του περιβάλλοντος και όχι η αλλαγή της αρχιτεκτονικής. Το GLM-5.2 εισήγαγε το σταθμό εκπαίδευσης (μια τεχνική μακράς контекστοποίησης που ονομάζεται IndexShare, μια μέθοδος ενίσχυσης μάθησης για μακροχρόνιες εργασίες που ονομάζεται SAO, και slime, ένα ανοιχτό framework για μεγάλης κλίμακας ασύγχρονη ενίσχυση μάθησης) και η εταιρεία λέει ότι το GLM-5.3 προέκυψε από την αύξηση της υπολογιστικής ισχύος σε περισσότερα και πιο διαφορετικά περιβάλλοντα εργασίας που βασίζονται σε αυτό το σταθμό.

Αυτά τα περιβάλλοντα κατασκευάζονται για να μοιάζουν με μονάδες επαγγελματικής εργασίας και όχι με ασκήσεις κωδικοποίησης. Σε ένα παράδειγμα που δίνει η εταιρεία, ένα μοντέλο τοποθετείται στο περιβάλλον εργασίας ενός μηχανικού υποδομής ML, με πρόσβαση σε клаusters υπολογιστών, εσωτερική τεκμηρίωση, базές κώδικα και αποτελέσματα πειραμάτων, και πρέπει να διαγνώσει φιλτράρισμα, να εφαρμόσει βελτιώσεις και να παραδώσει einen μετρήσιμο συνολικό αυξήσεων. Ορισμένες εργασίες, λέει η Z.ai, αντιπροσωπεύουν कई ημέρες εργασίας για έναν έμπειρο μηχανικό. Για να παράγει περιβάλλοντα σε όγκο, η Z.ai κατασκεύασε pipelines όπου πράκτορες έρευνας μετατρέπουν μοτίβα εργασιών από πραγματική εργασία σε εκτελέσιμα περιβάλλοντα μακροχρόνιων ορίζοντων, ένας δικαστής πράκτορας επικυρώνει κάθε εργασία που είναι πραγματικά λύσιμη, και οι επικυρωτές συνθέτουν χωρίς πρόσβαση στη λύση αναφοράς. Το σήμα ανταμοιβής είναι αυτόματα παραγόμενο για ένα υποσύνολο εργασιών, με τη χρήση τραjectoriών λύσης για να κλείσει τις συντομεύσεις ανταμοιβής. Η Z.ai σημειώνει ότι τα pipelines εξακολουθούν να απαιτούν σημαντική εργασία ανθρώπων στο βρόχο.

Τα αναφερθέντα αποτελέσματα ακολουθούν το μοτίβο που θα προέκυπτε από αυτή τη συνταγή: οι μεγαλύτερες αυξήσεις βρίσκονται στις μακροχρόνιες αξιολογήσεις. Στο Terminal-Bench 3.0, το GLM-5.3 μετακινείται από 4.6 σε 28.3 έναντι του GLM-5.2, στο DeepSWE v1.1 από 46.2 σε 66.9, και στο Agents’ Last Exam’s CLI variant από 23.8 σε 28.5. Όλα τα νούμερα είναι αναφερθέντα από τον προμηθευτή, με σημειώσεις μεθοδολογίας στην ανακοίνωση που καλύπτουν το χάρνη, το μήκος контекστοποίησης και τις ρυθμίσεις δειγματοληψίας για κάθε βENCHMARK.

Ενάντια σε άλλα μοντέλα, η εικόνα είναι μεικτή. Στο εσωτερικό Z.ai Code Bench, η εταιρεία αναφέρει μια βελτίωση 50% έναντι του GLM-5.2 και λέει ότι το μοντέλο υπερβαίνει το Claude Opus 4.8 με συγκρίσιμο κόπο ενώ καταναλώνει λιγότερους output tokens (31.4% σε περίπου 50.000 output tokens ανά εργασία έναντι 29.5% σε 120.000) ενώ παραμένει πίσω από το Anthropic’s Claude Fable 5, το οποίο φτάνει στο 39.5% με μέγιστο κόπο. Σε δημόσιους συνόλους, το GLM-5.3 παραμένει πίσω από το GPT-5.6 Sol και το Fable 5 σε几 harder κωδικοποίηση αξιολογήσεων, συμπεριλαμβανομένου του Terminal-Bench 3.0 και του DeepSWE. Jako ιδιωτικό βENCHMARK, η εταιρεία επιχειρηματολογεί ότι το Z.ai Code Bench μειώνει τον κίνδυνο μόλυνσης από δημόσιους συνόλους ελέγχου.

Το Κυβερνοαποτέλεσμα που η Z.ai Λέει ότι Δεν Had Planned

Το δεύτερο βασικό αποτέλεσμα είναι αυτό που η Z.ai herself σημειώνει ως απρόοπτο. Η εταιρεία εισήγαγε δεδομένα ανακάλυψης ευπαθειών και περιβάλλοντα στην μετα-εκπαίδευση, αναμένοντας ότι το μοντέλο θα γίνει καλύτερο στο να βρει και να συλλογιστεί για μεμονωμένες ευπάθειες. Αντίθετα, λέει ότι η ικανότητα συνέχισε να αυξάνεται καθώς η εκπαίδευση κλιμακωνόταν, και το μοντέλο άρχισε να συλλογίζεται σε πολλαπλά στάδια εκμετάλλευσης, σχηματίζοντας συνεκτικές σχέδια για πλήρη αλυσίδες εκμετάλλευσης αντί για μεμονωμένες αναζητήσεις σφαλμάτων.

Τα αναφερθέντα νούμερα ακολουθούν αυτή την αξίωση. Στο CyberGym, το οποίο ελέγχει εάν ένα μοντέλο μπορεί να αναγνωρίσει και να επικυρώσει ευπάθειες από λευκό-κουτί κώδικα, το GLM-5.3 σκοράρει 84.5%, αυξημένο από το 77.2% του GLM-5.2 και μπροστά από κάθε μοντέλο στο σύνολο σύγκρισης της Z.ai. Στο ExploitBench, το οποίο απαιτεί βαθύτερη σκέψη για πραγματικές ευπάθειες και την εκμετάλλευσή τους, το GLM-5.3 διπλασιάζει τον προκάτοχό του, 54.4% σε 24.4%. Στο ExploitGym, το οποίο μετράει τις εργασίες εκμετάλλευσης που ολοκληρώνονται σε χρονικά προϋπολογισμένα, το GLM-5.3 ολοκληρώνει 105 εργασίες σε δύο ώρες και 130 σε έξι, έναντι 29 και 39 για το GLM-5.2. Η Z.ai συνοψίζει το μοτίβο ως εξής: όσο πιο ψηλά στην αλυσίδα εκμετάλλευσης βρίσκεται ένα βENCHMARK, τόσο μεγαλύτερη είναι η αύξηση από το GLM-5.2, και τόσο μεγαλύτερη είναι η υπόλοιπη απόσταση μέχρι τα κλειστά μοντέλα μεθορίου, με το Mythos 5 να ολοκληρώνει 181 και 247 εργασίες ExploitGym με τους ίδιους προϋπολογισμούς.

Η Z.ai αναφέρει επίσης ότι έχει δοκιμάσει τη μεταφορά πέρα από ελεγχόμενα βENCHMARK. Συνεργαζόμενη με αρκετές ομάδες ασφαλείας στην Κίνα, η εταιρεία λέει ότι τα μοντέλα της έχουν αναγνωρίσει 2.436 ευπάθειες σε 269 ανοιχτά προγράμματα από το GLM-5.2, συμπεριλαμβανομένων 1.097 που αξιολογούνται ως κρίσιμες ή υψηλής σοβαρότητας, που καλύπτουν πυρήνες συστήματος, λειτουργικά συστήματα, μηχανές προώθησης και πρωτόκολλα δικτύου. Πολλές από αυτές τις ευπάθειες είχαν παραμείνει απαρατήρητες για χρόνια, η παλαιότερη από τις οποίες, λέει η εταιρεία, είχε εισαχθεί το 1981.

Τα ευρήματα τροφοδοτούν ένα δημόσιο Z.ai Security Disclosure Ledger, το οποίο παρακολουθεί κάθε ζήτημα μέσω της διαδικασίας αποκάλυψης: 53 δημόσια αποκαλύψεις με CVEs που έχουν ανατεθεί στην κυκλοφορία, 2.383 ακόμη υπό embargo. Πρόσφατες εγγραφές περιλαμβάνουν μια χρήση-μετά-ελευθέρωση στο Λinux kernel, μια αδυναμία χειρισμού μνήμης WebKit που επηρεάζει το Apple Safari, και μια αδυναμία επικύρωσης παραμέτρων στο FreeBSD.

Για το API, το GLM-5.3 υποστηρίζει τρία επίπεδα προσπάθειας σκέψης (χαμηλή, υψηλή και μέγιστη) και δεν επιτρέπει πλέον την απενεργοποίηση της σκέψης, μια αλλαγή που σπάει την εφαρμογή για τις εφαρμογές που προηγουμένως εκτελούνταν με την σκέψη απενεργοποιημένη.

Τι Αφήνει Ανοιχτό η Κυκλοφορία των Ανοιχτών Βαρών

Ο δυοεβδομαδιαίος χρονικός διάστημα μεταξύ της ανακοίνωσης και της κυκλοφορίας των βαρών κάνει δουλειά σε αυτή την κυκλοφορία. Η Z.ai συνδέει την καθυστέρηση ρητά με την αξιολόγηση ασφάλειας και την ενίσχυση, και το πράγμα που ενισχύεται είναι ένα μοντέλο που η εταιρεία περιγράφει ως έχοντας αναπτύξει επιθετική ικανότητα ασφαλείας πιο γρήγορα από ό,τι είχε προβλέψει, με τις μεγαλύτερες αυξήσεις στην πλευρά εκμετάλλευσης της αλυσίδας. Η Z.ai λέει ότι τα βάρη θα είναι διαθέσιμα για κατέβασμα από οποιονδήποτε μετά από τον δυοεβδομαδιαίο χρόνο αξιολόγησης ασφάλειας και ενίσχυσης.

Τα κυβερνοαποτελέσματα έρχονται επίσης σε μια εβδομάδα όπου τα εργαστήρια μεθορίου δημόσια επίδειξαν τι μπορούν να κάνουν τα αγεντικά μοντέλα στην υποδομή: η OpenAI περιέγραψε πρόσφατα τα δικά της μοντέλα δοκιμής που παραβίασαν το Hugging Face σε μια άσκηση κόκκινου ομίχλης. Το Z.ai Security Disclosure Ledger είναι η κατασκευαστική αντίστοιχη ικανότητα: η ίδια δεξιότητα που αλυσίδες εκμετάλλευσης επίσης επιφάνειες σφαλμάτων δεκαετιών για σφράγισμα, και 1.097 κρίσιμες και υψηλής σοβαρότητας ευπάθειες τώρα κινούνται μέσω συντονισμένης αποκάλυψης.

Εάν οι ανεξάρτητοι αξιολογητές αναπαράγουν τα νούμερα του GLM-5.3 (ιδιαίτερα τα αποτελέσματα του εσωτερικού Code Bench και τα κυβερνοαποτελέσματα που έτρεξε η Z.ai στις δικές της ρυθμίσεις χάρνη) θα καθορίσουν πόσο από αυτή την κυκλοφορία είναι ένα γνήσιο βήμα για τα ανοιχτά μοντέλα κωδικοποίησης βαρών και πόσο είναι επιλογή αξιολόγησης. Η κυκλοφορία των βαρών, που αναμένεται γύρω στο τέλος Αυγούστου 2026, είναι όταν αρχίζει αυτή η δοκιμή.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.