Μοντέλα και πλατφόρμες AI

Reflection AI παρουσιάζει το Beam, ένα μοντέλο ανοιχτού βάρους με 501 δισεκατομμύρια παραμέτρους

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Reflection AI παρουσίασε Beam στις 5 Οκτωβρίου 2026, το πρώτο της μοντέλο ανοιχτού βάρους: ένα αραιό σύστημα Μίξης Εμπειρογνωμόνων με συνολικά 501 δισεκατομμύρια παραμέτρους και 23 δισεκατομμύρια ενεργές, σχεδιασμένο για προγραμματισμό, λογική και εργασίες με πράκτορες.

Το Beam βρίσκεται σε τελική φάση red‑teaming και αξιολογήσεων, και μια πρώιμη έκδοση προσφέρεται σε μια επιλεγμένη ομάδα χρηστών μέσω λίστας αναμονής. Η Reflection περιέγραψε το Beam ως το πρώτο μοντέλο σε μια σειρά και δήλωσε ότι ήδη εκπαιδεύει το επόμενο στάδιο.

Διεκδικήσεις για τις Δυνατότητες και την Αποδοτικότητα

Η Reflection δήλωσε ότι εκπαίδεψε το Beam με ιδιαίτερη έμφαση στην απόδοση προγραμματισμού και εργασιών με πράκτορες. Η εταιρεία περιέγραψε το μοντέλο ως ανταγωνιστικό με μεγαλύτερα ανοιχτά μοντέλα όπως το GLM 5.2 και ως προσεγγίζοντα το Qwen 3.8‑Max σε εργασίες προγραμματισμού και πράκτορα, ενώ παραδέχτηκε ότι το Kimi K3 παραμένει μπροστά σε ακατέργαστη ικανότητα· χαρακτήρισε το πλεονέκτημα του Beam ως αποδοτικότητα κατά το χρόνο επαγωγής και δήλωσε ότι το μοντέλο προωθεί ό,τι αποκαλεί το δυτικό όριο ανοιχτού βάρους.

Οι βαθμολογίες που ανέφερε η Reflection από το σύνολο αξιολόγησής της περιλαμβάνουν 80,1 στο Terminal Bench v2.1, 80,9 στο SWEBench Verified, 77,2 στο SWE Bench Pro v2‑Hard, 97,8 στο AIME 2026, 36,2 στο Humanity’s Last Exam χωρίς εργαλεία και 90,5 στο GPQA Diamond.

Σε ό,τι αφορά την αποδοτικότητα, η εταιρεία ανέφερε ότι το Beam επιτυγχάνει βαθμολογίες συγκρίσιμες με το GLM‑5.2 σε εξελιγμένα benchmarks λογικής, ενώ χρησιμοποιεί τριπλά έως τετραπλά λιγότερους υπολογιστικούς πόρους επαγωγής, με μεγαλύτερα κέρδη έναντι μοντέλων με πάνω από δύο τρισεκατομμύρια παραμέτρους, όπως το Qwen 3.8‑Max. Σύμφωνα με την ανάρτηση, οι εκτιμήσεις βασίζονται σε δεδομένα Artificial Analysis και DataCurve και προσεγγίζουν το κόστος παραγωγής ως το διπλάσιο του αριθμού των ενεργών παραμέτρων πολλαπλασιασμένο με το μέσο αριθμό παραγόμενων token ανά προσπάθεια· επειδή οι αριθμοί εξαιρούν την προφόρτωση του prompt, τις λειτουργίες προσοχής και το κόστος εξυπηρέτησης, η Reflection τα περιέγραψε ως κατά προσέγγιση σύγκριση υπολογισμού αντί για μετρημένο κόστος επαγωγής.

Η Reflection δήλωσε ότι εκπαίδεψε επίσης το Beam με ένα ελεγχόμενο penalty μήκους που ανταμείβει τις επιτυχημένες λύσεις ενώ αποθαρρύνει τα περιττά token, και ότι μια παράμετρος προσπάθειας λογικής προσβάσιμη στους χρήστες επιτρέπει την ανταλλαγή χρήσης token ενάντια στην απόδοση, με χαμηλότερες ρυθμίσεις να προτιμούν πιο σύντομες απαντήσεις και υψηλότερες ρυθμίσεις να επιτρέπουν πιο εκτενή λογική σε απαιτητικές εργασίες.

Η ανακοίνωση αναφέρει ότι οι δυνατότητες γενικεύτηκαν πέρα από το μείγμα εκπαίδευσης: κατά τη διάρκεια της ενισχυτικής μάθησης σε λογική, μηχανική λογισμικού και τελικές εργασίες, η απόδοση περιήγησης βελτιώθηκε παρά την έλλειψη εργασιών περιήγησης, και με πρόσβαση στο web το μοντέλο έμαθε από μόνο του να ερωτά άλλα μεγάλα μοντέλα γλώσσας και να χρησιμοποιεί API OCR για την ανάγνωση εγγράφων. Οι επιδείξεις περιλαμβάνουν έναν ζωντανά ενημερωνόμενο χάρτη του μετρό της Νέας Υόρκης, χτισμένο από δημόσια δεδομένα MTA, ένα τρισδιάστατο παιχνίδι αστροναύτη γραμμένο σε p5.js, και ένα παζλ γης‑ή‑νερού όπου το Beam ταξινόμησε σημεία σε ένα παγκόσμιο πλέγμα 16.200 σημείων με κάλυψη 95,5 %, αποτέλεσμα που το άρθρο τοποθετεί μεταξύ του Opus 5 με 92,5 % και του Fable 5 με 97,8 %. Σε μια τέταρτη επίδειξη, το Beam δημιούργησε ένα σημειωματάριο που βελτιώνει το μικρότερο μοντέλο Gemma‑4 σε εργασία Text2SQL, το οποίο, σύμφωνα με τη Reflection, αύξηση την ακρίβεια του δοκιμαστικού σετ του Gemma κατά 66,5 %.

Διαδικασία Εκπαίδευσης

Προεκπαίδευση και Καθαρισμός Δεδομένων

Η Reflection δήλωσε ότι προεκπαίδεψε το Beam με 23,8 τρισεκατομμύρια token που προέρχονται από το διαδίκτυο, δημόσιες πηγές και ιδιόκτητες αδειοδοτημένες βάσεις δεδομένων, ολοκληρώνοντας τη διαδικασία από άκρη σε άκρη σε λιγότερο από τέσσερις εβδομάδες σε 6.144 NVIDIA GB300 NVL72 GPU. Η εταιρεία ανέφερε εννέα ημι‑αυτόματες επαναφορές, αποδοχούμενες σε αιχμές του gradient‑norm ή υποψία σιωπηλής διαφθοράς δεδομένων, και δήλωσε ότι το goodput, ορισμένο ως το ποσοστό του πραγματικού χρόνου που δαπανάται σε βήματα εκπαίδευσης που διατηρούνται στο τελικό μοντέλο, έφτασε το 92,3 %.

Η γραμμή δεδομένων εξάλειψε περίπου το 95 % των ακατέργαστων token του διαδικτύου μέσω ανάλυσης, αποπλεονασμού και επιμέλειας, ενώ η Reflection ανέφερε ότι οι συμβατικές τεχνικές φιλτραρίσματος θα είχαν χάσει περίπου 1,8 τρισεκατομμύρια υψηλής ποιότητας token που διατήρησε, συμπεριλαμβανομένου του 87 % των επιμελημένων token κώδικα ιστού. Μια ξεχωριστή γραμμή επεξεργάστηκε αρχεία PDF χρησιμοποιώντας μοντέλο OCR όρασης‑γλώσσας με εσωτερικούς ταξινομητές ποιότητας σε χιλιάδες GPU, και ένα ενδιάμεσο στάδιο εκπαίδευσης επέκτεινε το αποτελεσματικό μήκος συμφραζομένων του Beam σε ένα εκατομμύριο token.

Η ανάρτηση περιγράφει μια αρχιτεκτονική που συνδυάζει εναλλασσόμενη τοπική και παγκόσμια προσοχή, εξειδικευμένους δρομολογημένους ειδικούς, και εξισορρόπηση φορτίου χωρίς βοηθητικές απώλειες με αποσβέση συνημιτόνου των ενημερώσεων προκατάληψης ειδικών, μαζί με κλιμάκωση υπολειμμάτων βάσει βάθους, SandwichNorm, πύλη προσοχής στοιχειώδους επιπέδου και συσσώρευση υπολειμμάτων FP32. Η Reflection ανέφερε σχεδόν ομοιόμορφη αξιοποίηση των ειδικών, με το φορτίο του πιο απασχολημένου ειδικού να ισούται κατά μέσο όρο με 1,04 φορές το μέσο στο τέλος της προεκπαίδευσης, και περιορισμένα πρότυπα ροής υπολειμμάτων σε όλα τα 52 επίπεδα.

Ενισχυτική Μάθηση Υψηλής Υπολογιστικής Ισχύος

Η εκστρατεία ενισχυτικής μάθησης δημιούργησε πάνω από 100 εκατομμύρια rollouts σε 10.500 GPU NVIDIA GB300 κατά τη διάρκεια τεσσάρων εβδομάδων, με μέγιστο μήκος συμφραζομένων 256.000 token και περίπου 1,3 δισεκατομμύριο sandboxes που χρησιμοποιήθηκαν για εκπαίδευση και αξιολόγηση. Η Reflection δήλωσε ότι αντλήθηκε σχεδόν ένα εκατομμύριο περιβάλλον προγραμματισμού, εργασιών με πράκτορες και STEM, κυρίως μέσω συνθετικά δεδομένα pipelines, και περιέγραψε την προσπάθεια ως μία από τις μεγαλύτερες εκτελέσεις RL που έχει διεξαχθεί μέχρι σήμερα από ένα ανοιχτό εργαστήριο.

Η εταιρεία ανέφερε ότι διατηρεί έναν μέσο όρο 110.000 ταυτόχρονων rollout και έως 170.000 ταυτόχρονων sandbox, με περισσότερα από ένα δισεκατομμύριο αιτήματα δημιουργίας sandbox να επεξεργάζονται σε περισσότερα από 20 clusters, δύο σύννεφα και τέσσερις περιοχές. Τα νέα βάρη έφτασαν στο στόλο συμπερασμάτων με διάμεσο περίπου 12 δευτερόλεπτα, 71 περιστατικά συμπερασμού αντιμετωπίστηκαν χωρίς να τερματιστεί η εργασία εκπαίδευσης, και η δυναμική συσκευασία κράτησε τις παρτίδες εκπαίδευσης κατά μέσο όρο 99,99 % γεμάτες. Η Reflection δήλωσε ότι το ασύγχρονο σύστημα παρέμεινε σταθερό ακόμη και όταν μάθαινε από δείγματα έως 107 εκδόσεις βαρών, περίπου μία ημέρα, πίσω από την τρέχουσα πολιτική.

Ασφάλεια και Συμφωνία

Για τη συμφωνία, η Reflection εκπαίδευσε ένα δεύτερο μοντέλο από το ίδιο προεκπαιδευμένο σημείο ελέγχου χρησιμοποιώντας μια ξεχωριστή επιβλεπόμενη λεπτομερή ρύθμιση και αγωγό RL που στοχεύει στις αρχές συμπεριφοράς, και στη συνέχεια το συγχώνευσε με τον μεγάλης κλίμακας δάσκαλο RL μέσω πολυ‑δασκάλου on‑policy αποσταθμίσεων. Οι αρχές οργανώνονται σε τρία επίπεδα: κανόνες που το μοντέλο δεν πρέπει να παραβιάσει, ποιότητες που πρέπει να ικανοποιεί σταθερά και ένα προεπιλεγμένο στυλ αλληλεπίδρασης.

Το σύνολο δεδομένων ασφαλείας δημιουργήθηκε αδερβιακά και επαναληπτικά, με τις επιτυχείς επιθέσεις κάθε γύρου να ενσωματώνονται στον επόμενο γύρο εκπαίδευσης, και το RL ασφαλείας κάλυπτε σενάρια μονού γύρου, πολλαπλών γύρων, jailbreak και πράκτορα, στα οποία ένας προσομοιωμένος αντίπαλος πιέζει ένα μοντέλο που χρησιμοποιεί εργαλεία. Η Reflection δήλωσε ότι μπορεί να προβλέψει τα κέρδη RL καλύτερα από ένα μόνο όριο Best‑of‑N, αναφέροντας συσχέτιση 0,79 έναντι 0,46 για το όριο. Η εταιρεία ανακοίνωσε ότι θα δημοσιεύσει τα αποτελέσματα της αξιολόγησης ασφαλείας στην τεχνική αναφορά του Beam και θα ανοίξει κώδικα τις εσωτερικές αξιολογήσεις ασφαλείας που ανέπτυξε.

Διαθεσιμότητα και Συνεργασίες

Στη σελίδα πληροφοριών, η Reflection περιγράφει τις δεσμεύσεις της για την κυκλοφορία βαρών μοντέλου, τη δημοσίευση της έρευνάς της και το άνοιγμα κώδικα λογισμικού, συμπεριλαμβανομένων εργαλείων και περιβαλλόντων ενισχυτικής μάθησης. Η σελίδα δηλώνει ότι η Reflection έχει επικυρωθεί στο Dell AI Factory με NVIDIA, ότι είναι πιστοποιημένο μέλος κοινοπραξίας της Αποστολής Genesis του Υπουργείου Ενέργειας, εξυπηρετώντας τα 17 εθνικά εργαστήρια των ΗΠΑ με τα ανοιχτά βάρη μοντέλων της, και ότι κατασκευάζει ένα κυρίαρχο AI σύννεφο 250 μεγαβάτ στη Νότια Κορέα με τη Shinsegae, με την υποστήριξη των κυβερνήσεων των ΗΠΑ και της Κορέας.

Η Reflection δήλωσε ότι θα κυκλοφορήσει τα βάρη του Beam υπό άδεια Apache 2.0 αργότερα τον Οκτώβριο του 2026, συνοδευόμενα από τεχνική αναφορά, κάρτα μοντέλου, τεκμηρίωση και πλήρη στοίβα για την εκτέλεση, αξιολόγηση και λεπτομερή ρύθμιση του μοντέλου, με προγραμματισμένους συνεργάτες διανομής και ενσωματώσεις με ανοιχτές βιβλιοθήκες και εργαλεία εκκίνησης.

Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στην Unite.AI, εστιάζοντας στην γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τα θεωρητικά θεμέλια της μηχανικής νοημοσύνης. Η δουλειά του διερευνά πώς η μάθηση, η λογική, η μνήμη και η αφαίρεση εμφανίζονται τόσο σε βιολογικά όσο και σε τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ των σύγχρονων αρχιτεκτονικών AI και των μακροχρόνιων ερωτήσεων στην γνωστική επιστήμη και τη φιλοσοφία του νου.

Με μια εννοιολογική και στοχαστική προσέγγιση, ο Jonas εξετάζει πλαίσια όπως μοντέλα λογικής, συστήματα πράκτορα, αναδυόμενη γνωστική λειτουργία και θεωρία ευθυγράμμισης, με στόχο να διευκρινίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI — και τι δεν σημαίνει. Αντί να κυνηγά χρονοδιαγράμματα ή υπερβολές, δίνει έμφαση στις πρώτες αρχές, στην εννοιολογική αυστηρότητα και στα όρια των τρεχουσών μοντέλων.

Τα άρθρα που συντάσσει ο Jonas Reeve δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση των προχωρημένων εννοιών AI.