Модели и платформы ИИ
Reflection AI представляет Beam, модель с открытыми весами и 501 млрд параметров

Reflection AI представила Beam 5 октября 2026 года, свою первую модель с открытыми весами: разреженную систему Mixture-of-Experts с общим числом параметров 501 млрд и 23 млрд активных, предназначенную для программирования, рассуждения и агентных нагрузок.
Beam проходит финальное тестирование на безопасность и оценку, а ранняя версия предлагается ограниченной группе пользователей через список ожидания. Reflection описала Beam как первую модель в серии и заявила, что уже обучает следующую версию.
Утверждения о возможностях и эффективности
Reflection заявила, что обучала Beam с особым акцентом на программирование и агентную производительность. Компания охарактеризовала модель как конкурентоспособную с более крупными открытыми моделями, такими как GLM 5.2, и приближающуюся к Qwen 3.8‑Max по задачам программирования и агентных задач, при этом отметив, что Kimi K3 остаётся лидером по чистой мощности; она описала преимущество Beam как эффективность во время вывода и заявила, что модель продвигает то, что она называет западным фронтом открытых весов.
Оценки, о которых сообщила Reflection в своей оценочной серии, включают 80,1 по Terminal Bench v2.1, 80,9 по SWEBench Verified, 77,2 по SWE Bench Pro v2‑Hard, 97,8 по AIME 2026, 36,2 по Humanity’s Last Exam без инструментов и 90,5 по GPQA Diamond.
Что касается эффективности, компания сообщила, что Beam достигает результатов, сопоставимых с GLM‑5.2 по продвинутым бенчмарк‑тестам рассуждения, используя в три‑четыре раза меньше вычислительных ресурсов для вывода, при этом достигая более значительных преимуществ по сравнению с моделями, содержащими более двух триллионов параметров, такими как Qwen 3.8‑Max. По данным поста, оценки основаны на данных Artificial Analysis и DataCurve и приближённо рассчитывают вычисления генерации как удвоенное количество активных параметров, умноженное на среднее число сгенерированных токенов за попытку; поскольку в цифрах не учитываются предварительное заполнение подсказки, операции внимания и накладные расходы обслуживания, Reflection охарактеризовала их как приблизительное сравнение вычислительных затрат, а не измеренную стоимость вывода.
Reflection сообщила, что также обучала Beam с регулируемым штрафом за длину, который вознаграждает успешные решения и препятствует использованию лишних токенов, а также что параметр усилия рассуждения, доступный пользователю, позволяет обменивать количество токенов на производительность: более низкие настройки предпочтительнее для коротких ответов, а более высокие — позволяют более длительные рассуждения в сложных задачах.
В объявлении сообщается, что возможности обобщились за пределы обучающей смеси: во время обучения с подкреплением на задачах рассуждения, программной инженерии и терминальных задач, производительность в режиме браузинга улучшилась, несмотря на отсутствие задач браузинга, а при наличии веб‑доступа модель самостоятельно научилась запрашивать другие крупные языковые модели и использовать OCR‑API для чтения документов. Демонстрации включают интерактивную карту метро Нью‑Йорка, обновляющуюся в реальном времени и построенную на публичных данных MTA, 3‑D игру‑астронавта, написанную на p5.js, и головоломку «земля‑или‑вода», в которой Beam классифицировал точки на глобальной координатной сетке из 16 200 точек с покрытием 95,5 процента, результат, который пост размещает между Opus 5 с 92,5 процентами и Fable 5 с 97,8 процентами. В четвёртой демонстрации Beam создал ноутбук, дообучающий самую маленькую модель Gemma‑4 по задаче Text2SQL, что, по словам Reflection, повысило точность Gemma на отложенном тесте на 66,5 процента.
Конвейер обучения
Предобучение и отбор данных
Reflection заявила, что предобучила Beam на 23,8 триллиона токенов, полученных из интернета, публичных источников и проприетарных лицензированных наборов данных, завершив процесс полностью менее чем за четыре недели на 6 144 NVIDIA GB300 NVL72 GPU. Компания сообщила о девяти полуавтоматических откатах, вызванных всплесками нормы градиента или подозрением на скрытую порчу данных, и отметила, что goodput, определяемый как доля реального времени, затраченного на шаги обучения, сохранённые в окончательной модели, достиг 92,3 процента.
Конвейер данных удалил около 95 процентов необработанных интернет‑токенов с помощью парсинга, дедупликации и курирования, в то время как Reflection отметила, что традиционные методы фильтрации упустили бы примерно 1,8 триллиона высококачественных токенов, которые она сохранила, включая 87 процентов её отобранных токенов веб‑кода. Отдельный конвейер обрабатывал PDF‑артефакты с помощью модели зрительно‑языкового OCR и внутренних классификаторов качества на тысячах GPU, а промежуточный этап обучения увеличил эффективную длину контекста Beam до одного миллиона токенов.
В посте описана архитектура, объединяющая чередующийся локальный и глобальный механизм внимания, детализированных маршрутизируемых экспертов и балансировку нагрузки без вспомогательных потерь с косинусным затуханием обновлений смещения экспертов, а также масштабирование остаточных сигналов по глубине, SandwichNorm, поэлементное гейтуинг‑внимание и накопление остаточных значений в FP32. Reflection сообщила о почти равномерном использовании экспертов: нагрузка самого загруженного эксперта в среднем составляла 1,04 раз от среднего к концу предобучения, а нормы остаточного потока оставались ограниченными во всех 52 слоях.
Обучение с подкреплением высокой вычислительной нагрузки
Кампания обучения с подкреплением сгенерировала более 100 млн прогонов на 10 500 NVIDIA GB300 GPU в течение четырёх недель, с максимальной длиной контекста 256 000 токенов и примерно 1,3 млрд песочниц, использованных для обучения и оценки. Reflection заявила, что собрала почти один миллион сред для программирования, агентных задач и STEM, в основном через синтетические данные‑потоки, и охарактеризовала эту работу как, по её мнению, одну из крупнейших RL‑операций, проведённых открытой лабораторией на сегодняшний день.
Компания сообщила, что поддерживает в среднем 110 000 одновременных развертываний и до 170 000 одновременных песочниц, при этом более одного миллиарда запросов на создание песочниц было обработано в более чем 20 кластерах, двух облаках и четырёх регионах. Новые веса достигали инференс‑флота за медиану примерно 12 секунд, 71 инцидент инференса был обработан без прекращения обучения, а динамическая упаковка поддерживала обучающие батчи в среднем заполненными на 99,99 %. Reflection заявила, что асинхронная система оставалась стабильной даже при обучении на образцах до 107 версий весов, что примерно соответствует одному дню, отставая от текущей политики.
Безопасность и согласованность
Для согласованности Reflection обучила вторую модель из того же предварительно обученного чекпоинта, используя отдельный конвейер контролируемой доработки и RL, ориентированный на поведенческие принципы, а затем объединила её с крупномасштабным учителем RL посредством многопреподавательской on‑policy дистилляции. Принципы организованы в три уровня: правила, которые модель не должна нарушать, качества, которые она должна постоянно удовлетворять, и стиль взаимодействия по умолчанию.
Набор данных по безопасности был построен враждебно и итеративно, при этом успешные атаки каждого раунда возвращались в следующий раунд обучения, а безопасность RL охватывала односторонние, многослойные, jailbreak‑ и агентные сценарии, в которых симулированный противник оказывает давление на модель, использующую инструменты. Reflection заявила, что может предсказывать приросты RL лучше, чем только потолок Best‑of‑N, сообщив корреляцию 0,79 против 0,46 для потолка. Компания заявила, что опубликует результаты оценки безопасности в техническом отчёте Beam и откроет исходный код внутренних оценок безопасности, которые она разработала.
Доступность и партнёрства
На своей страница «О компании» Reflection излагает обязательства по выпуску весов модели, публикации своих исследований и открытию программного обеспечения, включая инструменты и среды обучения с подкреплением. На странице указано, что Reflection прошла валидацию на Dell AI Factory совместно с NVIDIA, что она является сертифицированным членом консорциума миссии Genesis Министерства энергетики США, обслуживая 17 национальных лабораторий США своими открытыми весами, а также что она строит суверенный AI‑облако мощностью 250 мегаватт в Южной Корее совместно с Shinsegae при поддержке правительств США и Кореи.
Reflection заявила, что выпустит веса Beam под лицензией Apache 2.0 позже в октябре 2026 года, сопровождая их техническим отчётом, карточкой модели, документацией и полным стеком для запуска, оценки и доработки модели, при этом планируются дистрибьюторы и интеграции с открытыми библиотеками и обвязками для запуска.












