Μοντέλα και πλατφόρμες AI
Τα μοντέλα Granite 4.2 της IBM μαθαίνουν να σκέφτονται και να ενεργούν μέσα σε περιβάλλοντα

Η IBM κυκλοφόρησε το Granite 4.2, την πρώτη της οικογένεια πυκνών, μοντέλων γλώσσας μόνο με αποκωδικοποιητή για λογική, σε τρία μεγέθη: 3B, 8B, και 30B παραμέτρους. Ανακοινώθηκε στις 25 Αυγούστου 2026 με τα βάρη να δημοσιεύονται υπό την άδεια Apache 2.0, η κυκλοφορία παρέχει σε κάθε μοντέλο Granite λειτουργία εναλλασσόμενης σκέψης και στέλνει τα δύο μεγαλύτερα μεγέθη μέσω ενισχυτικής μάθησης σε πραγματικά περιβάλλοντα λογισμικού, τερματικού και αναζήτησης στο web.
Σε έναν τεχνικό οδηγό της κατασκευής, η ομάδα Granite της IBM περιγράφει μια αλυσίδα εργασιών που ξεκινά με προ-εκπαίδευση από το μηδέν σε περίπου 15 τρισεκατομμύρια διακριτικά, με χρονοδιάγραμμα πέντε φάσεων που επεκτείνει το παράθυρο συμφραζομένων σε 512K διακριτικά. Ακολουθεί εποπτευόμενη λεπτομερή ρύθμιση σε περίπου 7,2 εκατομμύρια δείγματα αλυσίδας σκέψης, λογικής και δεδομένων διαδρομής πρακτόρων. Το κεντρικό σημείο της κυκλοφορίας, ωστόσο, είναι αυτό που ακολουθεί: μια πολυεπίπεδη αλυσίδα ενισχυτικής μάθησης, στην οποία κάθε στάδιο είναι μια ξεχωριστή εκπαίδευση που στοχεύει σε μία δυνατότητα, ξεκινώντας από το σημείο ελέγχου του προηγούμενου σταδίου.
Όλα τα τρία μεγέθη εκτελούν βασική ενισχυτική μάθηση με επαληθεύσιμα βραβεία — μαθηματικά προβλήματα με ελέγξιμες απαντήσεις, κώδικα που αξιολογείται από κρυφές μονάδες δοκιμών, εργασίες ακολούθησης οδηγιών με ελεγκτές μορφής — συν μικρά “ενισχυτικά” στάδια για συγκεκριμένες δεξιότητες. Μόνο τα μοντέλα 8B και 30B προχωρούν στο μπλοκ πρακτόρων: τρία στάδια όπου το μοντέλο ενεργεί μέσα σε ζωντανό περιβάλλον και ανταμείβεται ανάλογα με το αν η εργασία λύθηκε πραγματικά. Στο στάδιο λογισμικού, υπό την καθοδήγηση του OpenHands, το μοντέλο επεξεργάζεται πραγματικά αποθετήρια και περνά μόνο εάν η κρυφή σειρά δοκιμών περάσει. Το στάδιο τερματικού τοποθετεί το μοντέλο σε ζωντανό κέλυφος με έως 64 γύρους περιβάλλοντος ανά εκτέλεση. Το στάδιο αναζήτησης το κάνει να απαντά ερωτήσεις πολλαπλών βημάτων μέσω ζωντανών κλήσεων αναζήτησης στο web, αξιολογημένες από κριτή LLM.
Κάθε μοντέλο ολοκληρώνεται στη συνέχεια με RLHF για προτίμηση και ασφάλεια, το οποίο εφαρμόζει επίσης ποινή στο μήκος της λογικής ώστε να αποθαρρύνει τις εκτενείς αλυσίδες που μπορούν να δημιουργήσουν τα πρώτα στάδια.
Πώς φαίνεται η εναλλασσόμενη σκέψη στην πράξη
Κάθε μοντέλο Granite 4.2 εκθέτει τρεις λειτουργικές λειτουργίες μέσω του προτύπου συνομιλίας του. Η λειτουργία σκέψης, η προεπιλογή, παράγει μια πλήρη αλυσίδα σκέψης μέσα σε ειδικές ετικέτες πριν από την τελική απάντηση. Η λειτουργία μη-σκέψης απαντά άμεσα. Μια ρύθμιση χαμηλής προσπάθειας βρίσκεται μεταξύ των δύο, δαπανώντας έναν σύντομο προϋπολογισμό λογικής σε εύκολες ερωτήσεις. Σε συνομιλίες πολλαπλών γύρων, η σκέψη των προηγούμενων γύρων αφαιρείται εξ ορισμού για εξοικονόμηση συμφραζομένων.
Η ενσωματωμένη κλήση εργαλείων είναι ενσωματωμένη στο ίδιο πρότυπο: το μοντέλο λογίζει ποιο εργαλείο να καλέσει και γιατί πριν εκδώσει την κλήση, με τη μορφή κλήσης λειτουργίας του OpenAI, ώστε να ενσωματώνεται σε πρακτόρων που εξυπηρετούνται μέσω vLLM ή SGLang χωρίς πρόσθετους προσαρμογείς. Σύμφωνα με τη συλλογή μοντέλων Granite 4.2, όλα τα τρία βάρη είναι διαθέσιμα για δημόσια λήψη, και η κάρτα του μοντέλου 30B επιβεβαιώνει ότι το κορυφαίο μοντέλο εκπαιδεύτηκε περαιτέρω από τη βάση Granite 4.1 30B. Τα μοντέλα δοκιμάζονται σε 12 γλώσσες, συμπεριλαμβανομένων των Αγγλικών, Γερμανικών, Ιαπωνικών, Αραβικών, Κορεατικών και Κινέζικων.
Οι Αριθμοί που Αναφέρει η IBM
Η IBM αξιολόγησε την οικογένεια σε πρακτικό προγραμματισμό, γενική χρήση εργαλείων, λογική, συνομιλία και μεγάλο πλαίσιο συμφραζομένων, χρησιμοποιώντας ένα πλαίσιο βασισμένο στο NeMo Evaluator SDK. Οι παρακάτω βαθμολογίες είναι τα δικά της αναφερόμενα νούμερα.
- SWE-Bench Verified: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)
Το μοτίβο ταιριάζει με το σχεδιασμό της εκπαίδευσης. Οι βαθμολογίες αυξάνονται σταθερά με το μέγεθος σε μαθηματικά, επιστήμη και λογική κώδικα, και τα benchmarks πρακτικού προγραμματισμού που εξαρτώνται από το αποκλειστικό μπλοκ agentic‑RL των μοντέλων 8B και 30B δείχνουν τη μεγαλύτερη διαφορά μεταξύ των μεγεθών. Το μοντέλο 3B, το οποίο δεν εκτελεί κανένα από τα στάδια περιβάλλοντος, δεν αναφέρεται καθόλου στις σειρές SWE‑Bench ή Terminal‑Bench.
Εκπαίδευση Πρακτόρων Χωρίς Δίκτυο Αξίας
Η μηχανική της ενισχυτικής μάθησης αξίζει μια πιο προσεκτική ματιά, επειδή είναι εκεί που συγκεντρώνεται η πλειονότητα της μηχανικής της κυκλοφορίας. Κάθε στάδιο εκπαιδεύεται με ασύγχρονο GRPO, μια μέθοδο βελτιστοποίησης πολιτικής σχετική με την ομάδα που βαθμολογεί κάθε απόκριση σε σχέση με τη μέση ανταμοιβή των άλλων δειγμάτων που λήφθηκαν για την ίδια προτροπή, εξαλείφοντας το ξεχωριστό δίκτυο αξίας που απαιτούν πολλές αλυσίδες RL. Η δημιουργία και η εκπαίδευση εκτελούνται σε ξεχωριστές δεξαμενές GPU που ποτέ δεν μπλοκάρουν η μία την άλλη: οι εργαζόμενοι συνεχίζουν να δειγματοληπτούν διαδρομές σε κοινή μνήμη, και ο εκπαιδευτής μεταδίδει ενημερωμένα βάρη εν μέσω εκτέλεσης. Ένα σύστημα ασφαλείας αποτρέπει τους δημιουργούς από το να απομακρυνθούν περισσότερο από μία ενημέρωση, και η περικομμένη δειγματοληψία σημαντικότητας περιορίζει την επίδραση των παλαιών διακριτικών.
Τα περιβάλλοντα συνδέονται μέσω του NeMo‑Gym, το οποίο προσφέρει επαληθευτές, εργαλεία και αμυντικούς χώρους πίσω από μια ενιαία διεπαφή, ενώ το NeMo‑RL καθοδηγεί τον βρόχο εκπαίδευσης στο Megatron‑Core με δημιουργία vLLM. Η πρακτική συνέπεια είναι ότι ένας ελεγκτής μαθηματικών βάσει κανόνων και ένας πλήρης αμυντικός χώρος αποθετηρίου φαίνονται πανομοιότυπα στον βρόχο εκπαίδευσης, κάτι που καθιστά εφικτό το σταδιακό πρόγραμμα. Η IBM εκπαίδευσε τα μοντέλα σε ένα σύμπλεγμα NVIDIA GB200 NVL72 που φιλοξενείται από την CoreWeave, με ένα τομέα 72‑GPU NVLink και υφασμάτωση InfiniBand 400 Gb/s.
Η IBM επίσης κυκλοφόρησε ποσοτικοποιημένες παραλλαγές της οικογένειας: FP8 χωρίς βαθμονόμηση, NVFP4 και MXFP4 βαθμονομημένα σε 2 000 δείγματα από το σύνολο δεδομένων SFT, και δεκατέσσερις μορφές GGUF μέσω του llama.cpp για ανάπτυξη με μειωμένη μνήμη.
Πού Τοποθετείται το Granite 4.2 στη Γραμμή της IBM
Η κυκλοφορία συνεχίζει μια σκόπιμη κατανομή εργασιών στη στρατηγική ανοικτών μοντέλων της IBM. Οι προηγούμενες γενιές Granite τοποθετήθηκαν ως ισχυροί βοηθοί ακολούθησης οδηγιών· η εταιρεία παρουσίασε το Granite Speech 5.0, που κυκλοφόρησε την ίδια ημέρα, σε ξεχωριστή ανακοίνωση εστιασμένη στην ταχύτητα μεταγραφής. Το Granite 4.2 είναι η σειρά της γραμμής μοντέλων γλώσσας για ρητή λογική, και έρχεται με τη πλήρη συνταγή εκπαίδευσης, τις αναλογίες ανάμειξης δεδομένων και τις υπερπαραμέτρους ανά στάδιο, δημοσιευμένες μαζί με τα βάρη.
Όλα τα τρία μοντέλα, οι ποσοτικοποιημένες παραλλαγές, το αποθετήριο GitHub και η τεκμηρίωση είναι διαθέσιμα υπό την άδεια Apache 2.0, με το κορυφαίο 30B σχεδιασμένο για έναν ενιαίο κόμβο εξυπηρέτησης πολλαπλών GPU και το 3B προορισμένο για ελαφρύτερες υλοποιήσεις όπου η εναλλασσόμενη λειτουργία σκέψης εξακολουθεί να ισχύει.












