Modelos y plataformas de IA
Ai2 lanza Olmo-Core 3, pila de entrenamiento abierta para MoEs de un billón de parámetros

El Allen Institute for AI lanzó Olmo-core 3 el 1 de octubre de 2026, una actualización de su marco de desarrollo de modelos de lenguaje grande construido alrededor de un sistema de entrenamiento de mezcla de expertos rediseñado, que Ai2 dijo haber evaluado con más de un billón de parámetros totales.
Ai2 dijo que Olmo-core 3 está diseñado para escalar el entrenamiento de MoE al rango de un billón de parámetros mientras preserva la eficiencia computacional, y lo describió como uno de los sistemas centrales detrás de la próxima generación de Olmo. El lanzamiento va acompañado de un informe técnico, una demostración interactiva y código abierto.
Los modelos MoE pueden contener muchos más parámetros sin requerir que cada entrada los utilice todos, pero el modelo completo aún debe almacenarse en memoria GPU y actualizarse durante el entrenamiento, y enrutar las entradas a los expertos correctos a través de un clúster genera sus propios costos de comunicación y coordinación. Ai2 dijo que esos costos pueden erosionar gran parte de la ventaja computacional a medida que los MoE crecen, y que Olmo-core 3 está construido para cerrar esa brecha. En una prueba de Ai2, el conjunto de expertos pasó de 8 a 128 manteniendo la selección de cuatro expertos por token, manteniendo los parámetros activos aproximadamente fijos en alrededor de 3.2 mil millones, mientras la capacidad total de parámetros aumentó de 4.6 mil millones a 47 mil millones, con la velocidad de entrenamiento disminuyendo menos del 5 %.
De FSDP a una pila de entrenamiento basada en DDP
La implementación anterior de MoE de Ai2 en Olmo-core utilizó paralelismo de datos totalmente fragmentado, configurado para recopilar y volver a fragmentar los pesos del modelo para cada pequeño lote de datos de entrenamiento. Olmo-core 3 cambia a un sistema basado en paralelismo de datos distribuido que mantiene a los expertos residentes en GPUs y dirige los datos relevantes a ellos, evitando esa recopilación repetida de pesos. En una prueba preliminar con ocho GPUs NVIDIA B300, Ai2 informa que un MoE de 47 mil millones de parámetros procesó 52 000 tokens por segundo por GPU con la nueva pila, en comparación con 19 400 usando la implementación anterior, lo que Ai2 describe como aproximadamente 2.7 veces mayor rendimiento.
El trabajo de Ai2 en modelos escasos se remonta a OlmoE, que utilizó una arquitectura MoE con 64 expertos enrutados, mientras que Olmo 3 empleó una arquitectura densa en la que casi todo el modelo estaba activo para cada token. Olmo-core 3 amplía el marco con un sistema de entrenamiento diseñado para modelos MoE mucho más grandes. Ai2 señaló que Megatron-Core de NVIDIA es una opción consolidada para entrenar MoE de gran escala, y describió Olmo-core 3 como la incorporación de una pila de entrenamiento MoE integrada al marco detrás de Olmo.
Paralelismo, precisión y técnicas de memoria
Tres técnicas determinan cómo se divide el modelo y su estado de entrenamiento entre el hardware: el paralelismo de expertos distribuye a los expertos entre GPUs, el paralelismo de tubería divide las capas del modelo entre grupos de GPUs, y un optimizador distribuido reparte el estado del optimizador entre GPUs en lugar de almacenar una copia completa en cada GPU. Olmo-core 3 también reduce el costo de enrutar datos a los expertos correctos: el paralelismo de expertos fila a fila coloca los datos enrutados directamente en los búferes de entrada de los expertos, el enrutamiento residente en GPU mantiene los metadatos de enrutamiento en las GPUs para que la CPU pueda programar trabajo sin esperar a que se copie de vuelta, y el GEMM agrupado combina muchas computaciones pequeñas de expertos para que las GPUs las ejecuten de forma más eficiente. El informe técnico describe un diseño de paralelismo de expertos fila a fila basado en NVSHMEM que escribe cada token directamente en el búfer de su experto, con multiplicaciones de matrices agrupadas programadas por el dispositivo que hacen que el paralelismo de expertos sea completamente libre de sincronizaciones.
Olmo-core 3 admite MXFP8, un formato numérico de menor precisión. En una prueba controlada con cuatro GPUs NVIDIA B300 con trabajo distribuido uniformemente entre los expertos, Ai2 informa que el rendimiento de entrenamiento es aproximadamente un 21 % superior al de la referencia BF16, mientras que la memoria activa máxima disminuyó de 103 GiB a 95 GiB, con la mayor parte de la ganancia proveniente del cálculo feed‑forward y del traslado de datos entre expertos. El informe añade que los puntos de control agnósticos a la topología registran tensores FP32 globales independientemente de la distribución paralela, de modo que una ejecución puede reanudarse en una topología diferente, y que en su comparación controlada la recomputación de activaciones eliminó casi dos tercios de la memoria de activación y redujo la memoria máxima en aproximadamente una cuarta parte a costa de alrededor de una quinta parte del rendimiento.
Puntos de referencia de un billón de parámetros y límites declarados
Ai2 dijo que evaluó Olmo-core 3 en una variedad de configuraciones con GPUs NVIDIA B300, incluyendo un modelo de 1.2 billones de parámetros con 58.36 mil millones de parámetros activos por token en 512 GPUs, donde el rendimiento máximo observado fue de 858 TFLOP/s por GPU. Ai2 afirmó que estas pruebas usaron enrutamiento aleatorio para medir el rendimiento del sistema en lugar de la calidad de un modelo entrenado. El informe técnico enumera puntos de operación medidos desde un modelo de 12.9 mil millones de parámetros en 16 GPUs hasta el modelo de 1.2 billones de parámetros en 512, y señala que las tasas principales son referencias de sistemas medidas bajo enrutamiento aleatorio, no una curva de escalado controlada ni una afirmación de tiempo‑a‑calidad.
Ai2 también experimentó con DeepEP v2, un backend alternativo para la comunicación entre expertos a través de GPUs, alcanzando una configuración con 2,38 billones de parámetros totales. Ai2 describe ese resultado como una prueba de capacidad limitada que demuestra la escala que Olmo-core 3 puede alcanzar, más que un rendimiento sostenido de entrenamiento. El informe técnico, titulado “Supercharging Olmo-core for Efficient and Scalable MoE Training”, está fechado en octubre de 2026; sus autores provienen del Allen Institute for AI y la University of Washington, con Tianhua Tao listado como autor principal y desarrollador principal.
Hallazgos Documentados y Planes para la Próxima Generación de Olmo
El informe documenta un patrón de falla que Ai2 denomina manipulación de tokens (token gerrymandering), en el que una puntuación destinada a fomentar un enrutamiento equilibrado podría mejorar aun cuando la carga de trabajo real se volviera menos equilibrada. Otros hallazgos documentados incluyen: reducir las tasas de aprendizaje de los expertos porque procesan menos tokens no mejoró los resultados en la familia de modelos probada; los cálculos en GPU tomaron diferentes cantidades de tiempo cuando los valores procesados cambiaron, incluso con las mismas dimensiones de matriz; y la superposición de comunicación y cómputo en flujos de GPU separados no siempre aceleró el entrenamiento y, en algunas pruebas, ralentizó la ejecución de extremo a extremo. El informe también describe enfoques probados pero no adoptados, incluyendo la descarga a CPU de activaciones que el enlace host no pudo transportar y dos esquemas de superposición que competían con el cómputo de los expertos por recursos de GPU.
Ai2 dijo que su Olmo de próxima generación utilizará una arquitectura MoE, y que apunta a que sea su Olmo más capaz hasta la fecha, entrenado con su conjunto de datos más grande y con su ventana de contexto más larga. La organización afirmó que Olmo-core 3 es totalmente abierto, de modo que investigadores y desarrolladores pueden usarlo para entrenar sus propios MoEs, adaptarlo a diferentes hardware y experimentar con el enrutamiento, el paralelismo y otras partes del sistema. El repositorio Olmo-core de GitHub describe el proyecto como bloques de construcción PyTorch para el ecosistema OLMo, lleva una licencia Apache-2.0 y puede instalarse desde el código fuente o desde PyPI como ai2-olmo-core.












