Modelos y plataformas de IA
Reflection AI presenta Beam, un modelo de peso abierto de 501 mil millones de parámetros

Reflection AI introdujo Beam el 5 de octubre de 2026, su primer modelo de peso abierto: un sistema escaso Mixture-of-Experts con 501 mil millones de parámetros totales y 23 mil millones activos, creado para codificación, razonamiento y tareas de agente.
Beam está en fase final de pruebas de seguridad y evaluaciones, y una versión temprana se está ofreciendo a un grupo selecto de usuarios mediante una lista de espera. Reflection describió a Beam como el primer modelo de una serie y afirmó que ya está entrenando lo que seguirá.
Afirmaciones de capacidad y eficiencia
Reflection dijo que entrenó a Beam con un enfoque particular en la codificación y el rendimiento agente. La compañía describió el modelo como competitivo con modelos abiertos más grandes como GLM 5.2 y como cercano a Qwen 3.8-Max en tareas de codificación y agente, aunque reconoció que Kimi K3 sigue liderando en capacidad bruta; caracterizó la ventaja de Beam como eficiencia en tiempo de inferencia y afirmó que el modelo avanza lo que denomina la frontera occidental de peso abierto.
Las puntuaciones que Reflection informó de su suite de evaluación incluyen 80,1 en Terminal Bench v2.1, 80,9 en SWEBench Verified, 77,2 en SWE Bench Pro v2-Hard, 97,8 en AIME 2026, 36,2 en Humanity’s Last Exam sin herramientas, y 90,5 en GPQA Diamond.
En cuanto a eficiencia, la empresa informó que Beam alcanza puntuaciones comparables a GLM-5.2 en benchmarks de razonamiento avanzado mientras utiliza de tres a cuatro veces menos cómputo de inferencia, con mayores ganancias frente a modelos con más de dos billones de parámetros, como Qwen 3.8-Max. Según la publicación, las estimaciones se basan en datos de Artificial Analysis y DataCurve y aproximan el cómputo de generación como el doble del recuento de parámetros activos multiplicado por el promedio de tokens generados por intento; dado que las cifras excluyen el pre‑relleno del prompt, las operaciones de atención y la sobrecarga de servicio, Reflection las describió como una comparación de cómputo aproximada más que como un costo de inferencia medido.
Reflection dijo que también entrenó a Beam con una penalización de longitud controlable que premia soluciones exitosas mientras desalienta tokens innecesarios, y que un parámetro de esfuerzo de razonamiento orientado al usuario permite a los usuarios intercambiar el uso de tokens por rendimiento, con configuraciones bajas que favorecen respuestas más cortas y configuraciones altas que permiten razonamientos más extensos en tareas exigentes.
El anuncio informa que las capacidades se generalizaron más allá de la mezcla de entrenamiento: durante el aprendizaje por refuerzo en razonamiento, ingeniería de software y tareas terminales, el rendimiento de navegación mejoró a pesar de la ausencia de tareas de navegación, y con acceso web el modelo aprendió por sí mismo a consultar otros grandes modelos de lenguaje y a usar APIs de OCR para leer documentos. Las demostraciones incluyen un mapa del metro de la ciudad de Nueva York que se actualiza en tiempo real, construido a partir de datos públicos de la MTA, un juego de astronauta en 3D escrito en p5.js, y un rompecabezas de tierra o agua en el que Beam clasificó puntos en una cuadrícula global de 16 200 puntos con una cobertura del 95,5 por ciento, un resultado que la publicación sitúa entre Opus 5 con un 92,5 por ciento y Fable 5 con un 97,8 por ciento. En una cuarta demostración, Beam produjo un cuaderno que ajusta finamente el modelo Gemma‑4 más pequeño en una tarea Text2SQL, lo que Reflection dijo que aumentó la precisión del test de retención de Gemma en un 66,5 por ciento.
Pipeline de entrenamiento
Preentrenamiento y curación de datos
Reflection dijo que preentrenó a Beam con 23,8 billones de tokens extraídos de la web, fuentes públicas y conjuntos de datos licenciados propietarios, completando la ejecución de extremo a extremo en menos de cuatro semanas en 6 144 NVIDIA GB300 NVL72 GPU. La empresa informó nueve retrocesos semiautomáticos, atribuidos a picos de norma de gradiente o a sospechas de corrupción silenciosa de datos, y afirmó que el goodput, definido como la proporción del tiempo de reloj real dedicado a pasos de entrenamiento que se conservan en el modelo final, alcanzó el 92,3 por ciento.
El pipeline de datos eliminó alrededor del 95 por ciento de los tokens de internet sin procesar mediante análisis, desduplicación y curación, mientras que Reflection dijo que las técnicas de filtrado convencionales habrían pasado por alto aproximadamente 1,8 billones de tokens de alta calidad que retuvo, incluidos el 87 por ciento de sus tokens de código web curados. Una pipeline independiente procesó artefactos PDF usando un modelo OCR visión‑lenguaje con clasificadores de calidad internos en miles de GPU, y una etapa de entrenamiento intermedio extendió la longitud de contexto efectiva de Beam a un millón de tokens.
La publicación describe una arquitectura que combina atención local y global intercalada, expertos enrutados de gran granularidad y balanceo de carga sin pérdida auxiliar con decaimiento cosenoidal de actualizaciones de sesgo de expertos, junto con escalado residual basado en profundidad, SandwichNorm, compuerta de atención elemento a elemento y acumulación residual en FP32. Reflection informó una utilización de expertos casi uniforme, con la carga del experto más ocupado promediando 1,04 veces la media al final del preentrenamiento, y normas de flujo residual limitadas en todas las 52 capas.
Aprendizaje por refuerzo de alta computación
La campaña de aprendizaje por refuerzo generó más de 100 millones de ejecuciones en 10 500 GPU NVIDIA GB300 durante cuatro semanas, con una longitud máxima de contexto de 256 000 tokens y aproximadamente 1,3 mil millones de sandbox utilizados para entrenamiento y calificación. Reflection dijo que obtuvo cerca de un millón de entornos de codificación, agente y STEM, principalmente a través de pipelines de datos sintéticos, y describió el esfuerzo como lo que considera una de las ejecuciones de RL más grandes realizadas por un laboratorio abierto hasta la fecha.
La empresa informó que mantuvo un promedio de 110,000 implementaciones concurrentes y hasta 170,000 entornos sandbox concurrentes, con más de mil millones de solicitudes de creación de sandbox procesadas en más de 20 clústeres, dos nubes y cuatro regiones. Los nuevos pesos llegaron a la flota de inferencia en una mediana de aproximadamente 12 segundos, se manejaron 71 incidentes de inferencia sin terminar el trabajo de entrenamiento, y el empaquetado dinámico mantuvo los lotes de entrenamiento un 99,99 % llenos en promedio. Reflection dijo que el sistema asíncrono se mantuvo estable incluso al aprender de muestras de hasta 107 versiones de peso, aproximadamente un día, detrás de la política actual.
Seguridad y alineación
Para la alineación, Reflection entrenó un segundo modelo a partir del mismo punto de control preentrenado utilizando una canalización separada de ajuste fino supervisado y RL dirigida a principios de comportamiento, y luego lo fusionó con el maestro de RL a gran escala mediante destilación multi‑maestro en política. Los principios están organizados en tres niveles: reglas que el modelo no debe violar, cualidades que debe cumplir de manera constante y un estilo de interacción predeterminado.
El conjunto de datos de seguridad se construyó de forma adversarial e iterativa, incorporando los ataques exitosos de cada ronda en la siguiente ronda de entrenamiento, y el RL de seguridad abarcó escenarios de un solo turno, múltiples turnos, jailbreak y agentes en los que un adversario simulado presiona a un modelo que usa herramientas. Reflection dijo que podía predecir las ganancias de RL mejor que un techo Best‑of‑N por sí solo, reportando una correlación de 0,79 frente a 0,46 para el techo. La empresa afirmó que publicará los resultados de su evaluación de seguridad en el informe técnico de Beam y que pondrá en código abierto las evaluaciones internas de seguridad que desarrolló.
Disponibilidad y asociaciones
En su página de información, Reflection describe sus compromisos de publicar los pesos del modelo, difundir su investigación y abrir el código del software, incluidos las herramientas y entornos de aprendizaje por refuerzo. La página indica que Reflection está validado en Dell AI Factory con NVIDIA, que es miembro certificado del consorcio de la Misión Génesis del Department of Energy’s Genesis Mission, que sirve a los 17 Laboratorios Nacionales de EE. UU. con sus modelos de peso abierto, y que está construyendo una nube soberana de IA de 250‑megawatt en Corea del Sur con Shinsegae, respaldada por los gobiernos de EE. UU. y Corea.
Reflection dijo que lanzará los pesos de Beam bajo una licencia Apache 2.0 a finales de octubre de 2026, acompañados de un informe técnico, una hoja de modelo, documentación y todo el conjunto necesario para ejecutar, evaluar y ajustar finamente el modelo, con socios de distribución e integraciones con bibliotecas de código abierto y herramientas previstas para su lanzamiento.












