Modèles et plateformes d’IA
Ai2 publie Olmo-Core 3, pile d’entraînement ouverte pour les MoE d’un trillion de paramètres

L’Allen Institute for AI a publié Olmo-core 3 le 1er octobre 2026, une mise à jour de son cadre de développement de grands modèles de langage construit autour d’un système d’entraînement open mixture-of-experts repensé que Ai2 a indiqué avoir évalué à plus d’un trillion de paramètres au total.
Ai2 a indiqué que Olmo-core 3 est conçu pour faire évoluer la formation des MoE dans la gamme du trillion de paramètres tout en préservant l’efficacité computationnelle, et l’a décrit comme l’un des systèmes centraux de la prochaine génération d’Olmo. La publication est accompagnée d’un rapport technique, d’une démo interactive et du code ouvert.
Les modèles MoE peuvent contenir beaucoup plus de paramètres sans exiger que chaque entrée utilise tous ces paramètres, mais le modèle complet doit néanmoins être stocké sur la mémoire GPU et mis à jour pendant l’entraînement, et le routage des entrées vers les bons experts au sein d’un cluster engendre ses propres coûts de communication et de coordination. Ai2 a déclaré que ces coûts peuvent éroder une grande partie de l’avantage computationnel à mesure que les MoE se développent, et que Olmo-core 3 a été conçu pour combler cet écart. Dans un benchmark d’Ai2, le pool d’experts est passé de 8 à 128 tout en sélectionnant toujours quatre experts par token, maintenant les paramètres actifs à peu près fixes autour de 3,2 milliard, tandis que la capacité totale en paramètres est passée de 4,6 milliard à 47 milliard, avec un débit d’entraînement diminuant de moins de 5 %.
Du FSDP à une pile d’entraînement basée sur le DDP
L’implémentation MoE antérieure d’Ai2 dans Olmo-core utilisait le parallélisme de données entièrement fragmenté (fully sharded data parallelism), configuré pour rassembler et refragmenter les poids du modèle pour chaque petit lot de données d’entraînement. Olmo-core 3 passe à un système basé sur le parallélisme de données distribué qui maintient les experts résidents sur les GPU et dirige les données pertinentes vers eux, évitant ainsi la collecte répétée des poids. Dans un test préliminaire sur huit GPU NVIDIA B300, Ai2 rapporte qu’un MoE de 47 milliards de paramètres a traité 52 000 tokens par seconde et par GPU avec la nouvelle pile, contre 19 400 avec l’implémentation précédente, ce qu’Ai2 décrit comme environ 2,7 fois le débit.
Les travaux d’Ai2 sur les modèles parcimonieux remontent à OlmoE, qui utilisait une architecture MoE avec 64 experts routés, tandis qu’Olmo 3 employait une architecture dense dans laquelle presque tout le modèle était actif pour chaque token. Olmo-core 3 étend le cadre avec un système d’entraînement conçu pour des MoE beaucoup plus grands. Ai2 a noté que le Megatron-Core de NVIDIA est une option établie pour entraîner de grands MoE, et a décrit Olmo-core 3 comme apportant une pile d’entraînement MoE intégrée au cadre derrière Olmo.
Parallélisme, précision et techniques de mémoire
Trois techniques déterminent la façon dont le modèle et son état d’entraînement sont répartis sur le matériel : le parallélisme d’experts répartit les experts sur les GPU, le parallélisme en pipeline divise les couches du modèle entre des groupes de GPU, et un optimiseur distribué répartit l’état de l’optimiseur sur les GPU au lieu de stocker une copie complète sur chaque GPU. Olmo-core 3 réduit également le coût du routage des données vers les bons experts : le parallélisme d’experts ligne par ligne place les données routées directement dans les tampons d’entrée des experts, le routage résidant sur les GPU conserve les métadonnées de routage sur les GPU afin que le CPU puisse mettre en file d’attente le travail sans attendre qu’il soit recopié, et le GEMM groupé combine de nombreux petits calculs d’experts afin que les GPU puissent les exécuter plus efficacement. Le rapport technique décrit une conception de parallélisme d’experts ligne par ligne basée sur NVSHMEM qui écrit chaque token directement dans le tampon de son expert, avec des multiplications matricielles groupées planifiées par le dispositif qui rendent le parallélisme d’experts entièrement sans synchronisation.
Olmo-core 3 prend en charge MXFP8, un format numérique à précision réduite. Dans un benchmark contrôlé sur quatre GPU NVIDIA B300 avec le travail distribué uniformément entre les experts, Ai2 rapporte un débit d’entraînement environ 21 % supérieur à celui de la référence BF16, tandis que la mémoire active maximale est passée de 103 GiB à 95 GiB, la majeure partie du gain provenant du calcul en avant et du déplacement des données entre les experts. Le rapport ajoute que les points de contrôle indépendants de la topologie enregistrent les tenseurs FP32 globaux indépendamment de la disposition parallèle, de sorte qu’une exécution puisse reprendre sur une topologie différente, et que dans sa comparaison contrôlée, la recomputation d’activation a éliminé près des deux tiers de la mémoire d’activation et réduit la mémoire maximale d’environ un quart au prix d’environ un cinquième du débit.
Benchmarks à un trillion de paramètres et limites déclarées
Ai2 a indiqué avoir évalué Olmo-core 3 sur une gamme de configurations avec des GPU NVIDIA B300, y compris un modèle de 1,2 trillion de paramètres avec 58,36 milliards de paramètres actifs par token sur 512 GPU, où le débit le plus élevé observé était de 858 TFLOP/s par GPU. Ai2 a précisé que ces tests utilisaient un routage aléatoire pour mesurer les performances du système plutôt que la qualité d’un modèle entraîné. Le rapport technique répertorie les points de fonctionnement mesurés d’un modèle de 12,9 milliards de paramètres sur 16 GPU jusqu’au modèle de 1,2 trillion de paramètres sur 512, et indique que les taux annoncés sont des références système mesurées sous routage aléatoire, et non une courbe d’échelle contrôlée ou une affirmation de temps‑à‑qualité.
Ai2 a également expérimenté DeepEP v2, un backend alternatif pour la communication entre experts sur plusieurs GPU, atteignant une configuration avec 2,38 trillion de paramètres au total. Ai2 décrit ce résultat comme un test de capacité limitée démontrant l’échelle que Olmo-core 3 peut atteindre plutôt qu’une performance d’entraînement soutenue. Le rapport technique, intitulé « Supercharging Olmo-core for Efficient and Scalable MoE Training », est daté d’octobre 2026 ; ses auteurs proviennent de l’Allen Institute for AI et de l’Université de Washington, Tianhua Tao étant indiqué comme auteur principal et développeur principal.
Constatations documentées et plans pour la prochaine génération d’Olmo
Le rapport documente un mode d’échec qu’Ai2 appelle « gerrymandering de tokens », dans lequel un score destiné à encourager un routage équilibré pouvait s’améliorer alors que la charge de travail réelle devenait moins équilibrée. Parmi les autres constatations documentées : réduire le taux d’apprentissage des experts parce qu’ils traitent moins de tokens n’a pas amélioré les résultats dans la famille de modèles testée ; les calculs GPU prenaient des durées différentes lorsque les valeurs traitées changeaient, même avec les mêmes dimensions de matrice ; et le chevauchement de la communication et du calcul sur des flux GPU séparés n’accélérait pas toujours l’entraînement et, dans certains tests, ralentissait l’exécution de bout en bout. Le rapport décrit également des approches testées mais non adoptées, notamment le déchargement CPU des activations que le lien hôte ne pouvait pas transporter et deux schémas de chevauchement qui entraient en concurrence avec le calcul des experts pour les ressources GPU.
Ai2 a déclaré que sa prochaine génération d’Olmo utilisera une architecture MoE, et qu’elle vise à être son Olmo le plus performant à ce jour, entraîné sur son plus grand jeu de données et avec la plus longue fenêtre de contexte. L’organisation a indiqué qu’Olmo-core 3 est entièrement ouvert, de sorte que les chercheurs et les développeurs peuvent l’utiliser pour entraîner leurs propres MoE, l’adapter à différents matériels et expérimenter le routage, le parallélisme et d’autres parties du système. Le dépôt GitHub Olmo-core décrit le projet comme des blocs de construction PyTorch pour l’écosystème OLMo, est sous licence Apache‑2.0 et peut être installé à partir des sources ou depuis PyPI sous le nom ai2-olmo-core.












