KI-Modelle und Plattformen

Ai2 veröffentlicht Olmo-Core 3, offenen Trainings‑Stack für Billionen‑Parameter‑MoEs

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Das Allen Institute for AI veröffentlichte Olmo-core 3 am 1. Oktober 2026, ein Upgrade seines Frameworks zur Entwicklung großer Sprachmodelle, das auf einem neu gestalteten offenen Mixture-of-Experts‑Trainingssystem basiert, das Ai2 zufolge mit mehr als einer Billion Gesamtparameter benchmarkte.

Ai2 erklärte, dass Olmo-core 3 dafür konzipiert ist, das MoE‑Training in den Billionen‑Parameter‑Bereich zu skalieren und dabei die Recheneffizienz zu bewahren, und bezeichnete es als eines der Kernsysteme hinter der nächsten Generation von Olmo. Die Veröffentlichung wird von einem technischen Bericht, einer interaktiven Demo und offenem Code begleitet.

MoE‑Modelle können viel mehr Parameter enthalten, ohne dass jede Eingabe alle davon nutzt, doch das vollständige Modell muss nach wie vor über GPU‑Speicher verteilt und während des Trainings aktualisiert werden, und das Weiterleiten von Eingaben zu den richtigen Experten über einen Cluster verursacht eigene Kommunikations‑ und Koordinationskosten. Ai2 erklärte, dass diese Kosten einen Großteil des rechnerischen Vorteils bei wachsendem MoE‑Umfang aufzehren können und dass Olmo-core 3 entwickelt wurde, um diese Lücke zu schließen. In einem Ai2‑Benchmark wuchs der Expert‑Pool von 8 auf 128, während weiterhin vier Experten pro Token ausgewählt wurden, wobei die aktiven Parameter etwa bei 3,2 Milliarden blieben, während die Gesamtkapazität von 4,6 Milliarden auf 47 Milliarden anstieg, wobei der Training‑Durchsatz um weniger als 5 % sank.

Von FSDP zu einem DDP‑basierten Trainings‑Stack

Die frühere MoE‑Implementierung von Ai2 in Olmo-core nutzte Fully Sharded Data Parallelism, das so konfiguriert war, dass Modellgewichte für jede kleine Trainingscharge gesammelt und erneut aufgeteilt wurden. Olmo-core 3 wechselt zu einem System, das auf Distributed Data Parallelism basiert und Experten auf GPUs resident hält und die relevanten Daten zu ihnen routet, wodurch das wiederholte Sammeln von Gewichten vermieden wird. In einem Vorversuch mit acht NVIDIA B300 GPUs berichtet Ai2, dass ein 47‑Milliarden‑Parameter‑MoE mit dem neuen Stack 52.000 Tokens pro Sekunde pro GPU verarbeitete, verglichen mit 19.400 bei der früheren Implementierung, was Ai2 als etwa das 2,7‑fache des Durchsatzes beschreibt.

Ai2s Arbeit an spärlichen Modellen reicht zurück zu OlmoE, das eine MoE‑Architektur mit 64 gerouteten Experten nutzte, während Olmo 3 eine dichte Architektur verwendete, bei der nahezu das gesamte Modell für jeden Token aktiv war. Olmo-core 3 erweitert das Framework um ein Trainingssystem, das für wesentlich größere MoE‑Modelle konzipiert ist. Ai2 bemerkte, dass NVIDIA‑s Megatron-Core eine etablierte Option für das Training großer MoEs ist, und beschrieb Olmo-core 3 als die Integration eines MoE‑Trainings‑Stacks in das Framework hinter Olmo.

Parallelismus, Präzision und Speichertechniken

Drei Techniken bestimmen, wie das Modell und sein Trainingszustand über die Hardware verteilt werden: Expert‑Parallelismus verteilt Experten über GPUs, Pipeline‑Parallelismus teilt die Schichten des Modells über GPU‑Gruppen auf, und ein verteilter Optimierer verteilt den Optimierer‑Status über GPUs, anstatt auf jeder GPU eine vollständige Kopie zu speichern. Olmo-core 3 reduziert zudem die Kosten für das Routing von Daten zu den richtigen Experten: Zeilenweiser Expert‑Parallelismus legt geroutete Daten direkt in die Eingabepuffer der Experten, GPU‑residentes Routing hält Routing‑Metadaten auf den GPUs, sodass die CPU Aufgaben einreihen kann, ohne auf das Zurückkopieren warten zu müssen, und gruppierte GEMM‑Operationen kombinieren viele kleine Experten‑Berechnungen, sodass GPUs sie effizienter ausführen können. Der technische Bericht beschreibt ein auf NVSHMEM basierendes Design des zeilenweisen Expert‑Parallelismus, das jedes Token direkt in den Puffer des jeweiligen Experten schreibt, mit gerätegeplanten gruppierten Matrixmultiplikationen, die den Expert‑Parallelismus vollständig synchronisationsfrei machen.

Olmo-core 3 unterstützt MXFP8, ein niederpräzises Zahlenformat. In einem kontrollierten Benchmark auf vier NVIDIA B300 GPUs, bei dem die Arbeit gleichmäßig über die Experten verteilt wurde, berichtet Ai2, dass der Training‑Durchsatz etwa 21 % höher liegt als bei der BF16‑Basislinie, während der maximale aktive Speicher von 103 GiB auf 95 GiB sank, wobei der größte Teil des Gewinns auf die Feed‑Forward‑Berechnung und das Verschieben von Daten zwischen den Experten zurückzuführen ist. Der Bericht ergänzt, dass topologie‑agnostische Checkpoints globale FP32‑Tensoren unabhängig vom Parallel‑Layout aufzeichnen, sodass ein Lauf auf einer anderen Topologie fortgesetzt werden kann, und dass in seinem kontrollierten Vergleich die Aktivierungs‑Rekomputation fast zwei Drittel des Aktivierungsspeichers entfernte und den Spitzen‑Speicher um etwa ein Viertel reduzierte, jedoch auf Kosten von etwa einem Fünftel des Durchsatzes.

Billionen‑Parameter‑Benchmarks und angegebene Grenzen

Ai2 gab an, dass es Olmo-core 3 über ein Spektrum von Konfigurationen auf NVIDIA B300 GPUs benchmarkte, darunter ein 1,2‑Billion‑Parameter‑Modell mit 58,36 Milliarden aktiven Parametern pro Token auf 512 GPUs, wobei der höchste beobachtete Durchsatz 858 TFLOP/s pro GPU betrug. Ai2 erklärte, dass diese Tests zufälliges Routing nutzten, um die Systemleistung zu messen, und nicht die Qualität eines trainierten Modells. Der technische Bericht listet gemessene Betriebspunkte von einem 12,9‑Milliarden‑Parameter‑Modell auf 16 GPUs bis hin zum 1,2‑Billion‑Parameter‑Modell auf 512 GPUs auf und stellt fest, dass die angegebenen Spitzenraten Systemreferenzen sind, die unter zufälligem Routing gemessen wurden, nicht jedoch eine kontrollierte Skalierungskurve oder ein Zeit‑bis‑Qualität‑Anspruch.

Ai2 experimentierte außerdem mit DeepEP v2, einem alternativen Backend für die Kommunikation zwischen Experten über GPUs hinweg, und erreichte eine Konfiguration mit 2,38 Billionen Gesamtparametern. Ai2 beschreibt dieses Ergebnis als einen Kurzzeit‑Kapazitätstest, der die Skalierbarkeit von Olmo-core 3 demonstriert, jedoch nicht die nachhaltige Trainingsleistung. Der technische Bericht mit dem Titel „Supercharging Olmo-core for Efficient and Scalable MoE Training“ ist datiert auf Oktober 2026; seine Autoren stammen vom Allen Institute for AI und der University of Washington, wobei Tianhua Tao als Hauptautor und primärer Entwickler aufgeführt ist.

Dokumentierte Erkenntnisse und Pläne für die nächste Generation von Olmo

Der Bericht dokumentiert ein Fehlermuster, das Ai2 als Token‑Gerrymandering bezeichnet, bei dem ein Score, der eine ausgewogene Weiterleitung fördern soll, sich verbessern konnte, obwohl die tatsächliche Arbeitslast weniger ausgewogen wurde. Weitere dokumentierte Erkenntnisse umfassen: Das Senken der Lernraten der Experten, weil sie weniger Tokens verarbeiten, verbesserte die Ergebnisse in der getesteten Modellfamilie nicht; GPU‑Berechnungen benötigten unterschiedliche Zeiten, wenn sich die zu verarbeitenden Werte änderten, selbst bei identischen Matrixdimensionen; und das Überlagern von Kommunikation und Berechnung auf separaten GPU‑Streams führte nicht immer zu schnellerem Training und verlangsamte in einigen Tests die End‑zu‑Ende‑Ausführung. Der Bericht beschreibt zudem getestete, aber nicht adoptierte Ansätze, darunter das Auslagern von Aktivierungen auf die CPU, das die Host‑Verbindung nicht tragen konnte, sowie zwei Überlappungs‑Schemen, die um GPU‑Ressourcen mit der Experten‑Berechnung konkurrierten.

Ai2 erklärte, dass die nächste Generation von Olmo eine MoE‑Architektur verwenden wird und dass sie darauf abzielt, das bislang leistungsfähigste Olmo zu werden, trainiert auf dem größten Datensatz und mit dem längsten Kontextfenster. Die Organisation gab an, dass Olmo-core 3 vollständig offen ist, sodass Forschende und Entwickler*innen es nutzen können, um eigene MoEs zu trainieren, es an unterschiedliche Hardware anzupassen und mit Routing, Parallelität und anderen Systemkomponenten zu experimentieren. Das Olmo-core-Repository auf GitHub beschreibt das Projekt als PyTorch‑Bausteine für das OLMo‑Ökosystem, trägt eine Apache‑2.0‑Lizenz und kann aus dem Quellcode oder über PyPI als ai2-olmo-core installiert werden.

Jonas Reeve ist ein KI-generierter Analyst bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.