KI-Modelle und Plattformen

Reflection AI präsentiert Beam, ein 501‑Milliarden‑Parameter‑Open‑Weight‑Modell

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Reflection AI führte Beam ein am 5. Oktober 2026, sein erstes Open‑Weight‑Modell: ein spärliches Mixture-of-Experts‑System mit insgesamt 501 Milliarden Parametern und 23 Milliarden aktiven, entwickelt für Codierung, logisches Schließen und agentenbasierte Arbeitslasten.

Beam befindet sich in der abschließenden Red‑Team‑ und Evaluierungsphase, und eine frühe Version wird einer ausgewählten Nutzergruppe über eine Warteliste angeboten. Reflection beschrieb Beam als das erste Modell einer Reihe und sagte, dass bereits das nächste Modell trainiert wird.

Ansprüche an Fähigkeiten und Effizienz

Reflection sagte, dass Beam mit besonderem Fokus auf Codierung und agentenbasierte Leistung trainiert wurde. Das Unternehmen beschrieb das Modell als konkurrenzfähig zu größeren offenen Modellen wie GLM 5.2 und als annähernd an Qwen 3.8‑Max bei Codierungs‑ und agentenbezogenen Aufgaben, während anerkannt wird, dass Kimi K3 in roher Leistungsfähigkeit voraus bleibt; es charakterisierte den Vorteil von Beam als Effizienz zur Inferenzzeit und erklärte, dass das Modell das, was es die westliche Open‑Weight‑Frontier nennt, vorantreibt.

Die von Reflection gemeldeten Werte aus seiner Bewertungssuite umfassen 80,1 bei Terminal Bench v2.1, 80,9 bei SWEBench Verified, 77,2 bei SWE Bench Pro v2‑Hard, 97,8 bei AIME 2026, 36,2 bei Humanity’s Last Exam ohne Werkzeuge und 90,5 bei GPQA Diamond.

Zur Effizienz berichtete das Unternehmen, dass Beam vergleichbare Werte zu GLM‑5.2 bei fortgeschrittenen Reasoning‑Benchmarks erzielt, dabei jedoch das Drei‑ bis Vier‑fache weniger Inferenz‑Rechenleistung verbraucht, mit größeren Vorteilen gegenüber Modellen mit mehr als zwei Billionen Parametern, wie etwa Qwen 3.8‑Max. Laut dem Beitrag basieren die Schätzungen auf Daten von Artificial Analysis und DataCurve und approximieren die Generierungs‑Rechenleistung als das Doppelte der aktiven Parameterzahl multipliziert mit der durchschnittlichen Token‑Anzahl pro Versuch; da die Zahlen das Prompt‑Prefill, Aufmerksamkeits‑Operationen und den Service‑Overhead ausschließen, beschrieb Reflection sie als ungefähren Rechenvergleich statt gemessene Inferenzkosten.

Reflection sagte zudem, dass Beam mit einer steuerbaren Längenstrafe trainiert wurde, die erfolgreiche Lösungen belohnt und gleichzeitig unnötige Tokens entmutigt, und dass ein benutzerseitiger Reasoning‑Effort‑Parameter es Nutzern ermöglicht, den Token‑Verbrauch gegen die Leistung abzuwägen, wobei niedrigere Einstellungen kürzere Antworten begünstigen und höhere Einstellungen längeres Schließen bei anspruchsvollen Aufgaben zulassen.

Die Ankündigung berichtet, dass die Fähigkeiten über die Trainingsmischung hinaus verallgemeinert wurden: Während des Reinforcement‑Learning für Reasoning, Software‑Engineering und Terminal‑Aufgaben verbesserte sich die Browsing‑Leistung trotz fehlender Browsing‑Aufgaben, und mit Web‑Zugriff lernte das Modell eigenständig, andere große Sprachmodelle abzufragen und OCR‑APIs zum Lesen von Dokumenten zu nutzen. Demonstrationen umfassen eine in Echtzeit aktualisierende U‑Bahn‑Karte von New York City, erstellt aus öffentlichen MTA‑Daten, ein 3‑D‑Astronauten‑Spiel geschrieben in p5.js und ein Land‑oder‑Wasser‑Puzzle, bei dem Beam Punkte auf einem globalen Koordinatengitter mit 16 200 Punkten mit 95,5 % Abdeckung klassifizierte – ein Ergebnis, das der Beitrag zwischen Opus 5 mit 92,5 % und Fable 5 mit 97,8 % einordnet. In einer vierten Demonstration erzeugte Beam ein Notebook, das das kleinste Gemma‑4‑Modell für eine Text2SQL‑Aufgabe feinabstimmt, wobei Reflection angab, dass die gehaltene Testgenauigkeit von Gemma um 66,5 % gesteigert wurde.

Trainingspipeline

Vortraining und Datenkuratierung

Reflection sagte, dass Beam auf 23,8 Billionen Tokens aus dem Web, öffentlichen Quellen und proprietären lizenzierten Datensätzen vortrainiert wurde und der Durchlauf in weniger als vier Wochen auf 6 144 NVIDIA GB300 NVL72-GPUs von Anfang bis Ende abgeschlossen wurde. Das Unternehmen meldete neun halbautomatische Rückläufe, die auf Gradient‑Norm‑Spitzen oder vermutete stille Datenkorruption zurückzuführen seien, und gab an, dass der Goodput, definiert als der Anteil der Echtzeit, der für Trainingsschritte aufgewendet wird und im finalen Modell erhalten bleibt, 92,3 % erreichte.

Die Datenpipeline eliminierte etwa 95 % der rohen Internet‑Tokens durch Parsen, Duplikationsentfernung und Kuratierung, während Reflection sagte, dass konventionelle Filtertechniken ungefähr 1,8 Billionen hochwertige Tokens, die es behielt, übersehen hätten, einschließlich 87 % seiner kuratierten Web‑Code‑Tokens. Eine separate Pipeline verarbeitete PDF‑Artefakte mittels eines Vision‑Language‑OCR‑Modells mit internen Qualitätsklassifikatoren über Tausende von GPUs, und eine Mittel‑Training‑Phase erweiterte die effektive Kontextlänge von Beam auf eine Million Tokens.

Der Beitrag beschreibt eine Architektur, die verschachtelte lokale und globale Aufmerksamkeit, fein abgestimmte geroutete Experten und eine hilfslose Verlust‑freie Lastenbalancierung mit Kosinus‑Abnahme der Experten‑Bias‑Updates kombiniert, zusammen mit tiefenbasierter Residual‑Skalierung, SandwichNorm, elementweiser Aufmerksamkeitsgating und FP32‑Residual‑Akkumulation. Reflection berichtete von nahezu einheitlicher Expert‑Auslastung, wobei die Last des am stärksten beanspruchten Experten am Ende des Vortrainings das 1,04‑fache des Mittels betrug, und von begrenzten Residual‑Stream‑Normen über alle 52 Schichten hinweg.

Hoch‑Rechen‑Reinforcement‑Learning

Die Reinforcement‑Learning‑Kampagne erzeugte mehr als 100 Millionen Rollouts auf 10 500 NVIDIA GB300‑GPUs über vier Wochen, mit einer maximalen Kontextlänge von 256 000 Tokens und etwa 1,3 Milliarden Sandboxes, die für Training und Bewertung verwendet wurden. Reflection sagte, dass sie fast eine Million Coding‑, agentenbasierte und MINT‑Umgebungen bezogen habe, hauptsächlich über synthetische Daten-Pipelines, und beschrieb den Aufwand als das, was sie für einen der größten RL‑Durchläufe hält, die jemals von einem offenen Labor durchgeführt wurden.

Das Unternehmen berichtete, dass es im Durchschnitt 110.000 gleichzeitige Rollouts und bis zu 170.000 gleichzeitige Sandboxes aufrechterhielt, wobei mehr als eine Milliarde Anfragen zur Sandbox-Erstellung über mehr als 20 Cluster, zwei Clouds und vier Regionen verarbeitet wurden. Neue Gewichte erreichten die Inferenzflotte in einem Median von etwa 12 Sekunden, 71 Inferenzvorfälle wurden bearbeitet, ohne den Trainingsjob zu beenden, und dynamisches Packing hielt die Trainingsbatches im Durchschnitt zu 99,99 % voll. Reflection sagte, dass das asynchrone System stabil blieb, selbst wenn es aus Proben von bis zu 107 Gewichtsversionen lernte, was etwa einem Tag entspricht, hinter der aktuellen Richtlinie.

Sicherheit und Ausrichtung

Für die Ausrichtung trainierte Reflection ein zweites Modell aus demselben vortrainierten Checkpoint mittels einer separaten überwachten Feinabstimmung und RL‑Pipeline, die auf Verhaltensprinzipien abzielt, und fusionierte es anschließend durch Multi‑Teacher‑On‑Policy‑Distillation mit dem großskaligen RL‑Lehrermodell. Die Prinzipien sind in drei Ebenen organisiert: Regeln, die das Modell nicht verletzen darf, Qualitäten, die es konsequent erfüllen sollte, und ein Standard‑Interaktionsstil.

Der Sicherheits‑Datensatz wurde adversarial und iterativ erstellt, wobei die erfolgreichen Angriffe jeder Runde in die nächste Trainingsrunde zurückgeführt wurden, und das Sicherheits‑RL umfasste Einzelschritt‑, Mehrschritt‑, Jailbreak‑ und agentische Szenarien, in denen ein simulierter Gegner ein modell‑nutzendes Werkzeug unter Druck setzt. Reflection sagte, dass es RL‑Gewinne besser vorhersagen könne als allein eine Best‑of‑N‑Obergrenze, und berichtete eine Korrelation von 0,79 gegenüber 0,46 für die Obergrenze. Das Unternehmen erklärte, dass es die Ergebnisse seiner Sicherheitsbewertung im technischen Bericht zu Beam veröffentlichen und die internen Sicherheitsbewertungen, die es entwickelt hat, Open‑Source stellen werde.

Verfügbarkeit und Partnerschaften

Auf seiner Über‑Seite skizziert Reflection Verpflichtungen zur Veröffentlichung von Modellgewichten, zur Publikation seiner Forschung und zur Open‑Source‑Stellung von Software, einschließlich Reinforcement‑Learning‑Tools und -Umgebungen. Die Seite gibt an, dass Reflection auf Dell AI Factory mit NVIDIA validiert ist, dass es ein zertifiziertes Konsortiummitglied der Genesis‑Mission des Department of Energy ist, das die 17 US‑National Laboratories mit seinen Open‑Weight‑Modellen bedient, und dass es eine 250‑Megawatt‑sovereign‑AI‑Cloud in Südkorea zusammen mit Shinsegae aufbaut, unterstützt von den Regierungen der USA und Koreas.

Reflection sagte, dass es die Gewichte von Beam später im Oktober 2026 unter einer Apache‑2.0‑Lizenz veröffentlichen werde, begleitet von einem technischen Bericht, einem Model‑Card, Dokumentationen und dem vollständigen Stack zum Ausführen, Evaluieren und Feinabstimmen des Modells, wobei Vertriebspartner und Integrationen mit Open‑Source‑Bibliotheken und Harnesses für den Start geplant sind.

Jonas Reeve ist ein KI-generierter Analyst bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.