Моделі та платформи ШІ

Reflection AI презентує Beam, модель з 501 млрд параметрів відкритих ваг

mm
Додайте Unite.AI до бажаних джерел у Google

Reflection AI представив Beam 5 жовтня 2026 року, свою першу модель відкритих ваг: розріджена система Mixture-of-Experts з 501 мільярдом загальних параметрів і 23 мільярдами активних, створена для завдань кодування, розуміння та агентних навантажень.

Beam проходить фінальне червоне тестування та оцінювання, а ранню версію пропонують обмеженій групі користувачів через список очікування. Reflection описав Beam як першу модель у серії та зазначив, що вже навчає наступне.

Твердження щодо можливостей та ефективності

Reflection зазначив, що навчав Beam з особливим акцентом на продуктивність у кодуванні та агентних завданнях. Компанія охарактеризувала модель як конкурентоспроможну зі значно більшими відкритими моделями, такими як GLM 5.2, і як наближаючуся до Qwen 3.8-Max у кодуванні та агентних завданнях, при цьому визнаючи, що Kimi K3 залишається попереду за чистою потужністю; вона описала перевагу Beam як ефективність під час інференсу і заявила, що модель просуває те, що вона називає західним фронтиром відкритих ваг.

За результатами оцінювального набору Reflection, модель отримала 80,1 у Terminal Bench v2.1, 80,9 у SWEBench Verified, 77,2 у SWE Bench Pro v2-Hard, 97,8 у AIME 2026, 36,2 у Humanity’s Last Exam без інструментів та 90,5 у GPQA Diamond.

Щодо ефективності, компанія повідомила, що Beam досягає результатів, порівнянних з GLM-5.2 у складних тестах на розумовий аналіз, використовуючи при цьому в три‑чотири рази менше обчислювальних ресурсів під час інференсу, а переваги ще більші порівняно з моделями, що мають понад два трильйони параметрів, такими як Qwen 3.8-Max. За даними допису, оцінки базуються на даних Artificial Analysis та DataCurve і приблизно розраховують обчислення генерації як подвоєну кількість активних параметрів, помножену на середню кількість згенерованих токенів за спробу; оскільки у цифрах не враховано заповнення підказки, операції уваги та накладні витрати на обслуговування, Reflection описала їх як орієнтовне порівняння обчислювальної потужності, а не виміряну вартість інференсу.

Reflection зазначив, що також навчав Beam з керованим штрафом за довжину, який винагороджує успішні рішення, одночасно стримуючи зайві токени, а параметр зусиль розумової діяльності, доступний користувачеві, дозволяє обмінювати використання токенів на продуктивність: нижчі налаштування сприяють коротшим відповідям, а вищі — довшому міркуванню у складних завданнях.

У повідомленні зазначається, що можливості узагальнилися поза межами навчальної суміші: під час підкріплювального навчання на розумінні, розробці програмного забезпечення та термінальних завданнях продуктивність у перегляді покращилася, незважаючи на відсутність завдань з перегляду, а при доступі до інтернету модель сама навчилася запитувати інші великі мовні моделі та використовувати OCR‑API для читання документів. Демонстрації включають карту метро Нью‑Йорка в режимі реального часу, створену на основі відкритих даних MTA, 3D‑гру про астронавта, написану у p5.js, та головоломку «земля‑або‑вода», у якій Beam класифікував точки на глобальній координатній сітці з 16 200 точок, досягнувши 95,5 % покриття; цей результат розташовано між Opus 5 (92,5 %) і Fable 5 (97,8 %). У четвертій демонстрації Beam створив ноутбук, що тонко налаштовує найменшу модель Gemma‑4 на завданні Text2SQL, що, за словами Reflection, підвищило точність тесту Gemma на 66,5 %.

Конвеєр навчання

Попереднє навчання та підготовка даних

Reflection повідомив, що попередньо навчив Beam на 23,8 трильйона токенів, отриманих з вебу, публічних джерел та власних ліцензованих наборів даних, завершивши процес за менш ніж чотири тижні на 6 144 NVIDIA GB300 NVL72 GPU. Компанія зазначила, що відбулося дев’ять напівавтоматичних перезапусків, пов’язаних зі сплесками градієнтної норми або підозрюваною безшумною пошкодженням даних, і повідомила, що goodput, визначений як частка реального часу, витраченого на кроки навчання, збережених у остаточній моделі, склав 92,3 %.

Конвеєр даних усунув близько 95 % сирих інтернет‑токенів за допомогою парсингу, дедуплікації та кураторства, тоді як Reflection зазначив, що традиційні методи фільтрації пропустили б приблизно 1,8 трильйона високоякісних токенів, які залишились, включаючи 87 % його кураторованих веб‑кодових токенів. Окремий конвеєр обробляв PDF‑артефакти за допомогою моделі зору‑мова OCR з внутрішніми класифікаторами якості на тисячах GPU, а проміжний етап навчання розширив ефективну довжину контексту Beam до одного мільйона токенів.

У дописі описується архітектура, що поєднує черговану локальну та глобальну увагу, детально маршрутизованих експертів та балансування навантаження без допоміжних втрат із косинусним згасанням оновлень зміщення експертів, разом із масштабуванням залишкових сигналів за глибиною, SandwichNorm, поелементним гейтом уваги та акумуляцією залишкових значень у FP32. Reflection повідомив про майже рівномірне використання експертів, при цьому навантаження найзайнятішого експерта в середньому становило 1,04 × від середнього наприкінці попереднього навчання, а норми залишкових потоків залишалися в межах у всіх 52 шарах.

Високопродуктивне підкріплювальне навчання

Кампанія підкріплювального навчання згенерувала понад 100 мільйонів прогонів на 10 500 GPU NVIDIA GB300 протягом чотирьох тижнів, з максимальною довжиною контексту 256 000 токенів і приблизно 1,3 мільярдами «пісочниць», використаних для навчання та оцінювання. Reflection зазначив, що отримав майже мільйон середовищ для кодування, агентних та STEM‑завдань, переважно через синтетичні дані‑потоки, і охарактеризував цей процес як один із найбільших запусків RL, проведених відкритою лабораторією на сьогодні.

Компанія повідомила, що підтримувала в середньому 110 000 одночасних розгортань і до 170 000 одночасних пісочниць, при цьому оброблено понад один мільярд запитів на створення пісочниць у більш ніж 20 кластерах, двох хмарах і чотирьох регіонах. Нові ваги досягали інференційного флоту за медіанний час приблизно 12 секунд, 71 інференційний інцидент був оброблений без завершення навчального завдання, а динамічне пакування підтримувало навчальні батчі в середньому заповненими на 99,99 відсотка. Reflection зазначила, що асинхронна система залишалася стабільною навіть при навчанні на зразках до 107 версій ваг, що приблизно дорівнює одному дню, відстаючи від поточної політики.

Безпека та вирівнювання

Для вирівнювання Reflection навчила другу модель з того ж попередньо навченого чекпоінту, використовуючи окремий конвеєр супервізованого тонкого налаштування та підкріплювального навчання, орієнтований на поведінкові принципи, а потім об’єднала її з великим RL‑вчителем за допомогою багатовчителя on‑policy дистиляції. Принципи організовані у три рівні: правила, які модель не повинна порушувати, якості, які вона повинна постійно задовольняти, і стиль взаємодії за замовчуванням.

Набір даних безпеки був створений у ворожому та ітеративному режимі, причому успішні атаки кожного раунду включалися у наступний раунд навчання, а безпекове RL охоплювало одно- та багатокрокові, jailbreak‑ та агентські сценарії, у яких змодельований противник тисне на модель, що використовує інструменти. Reflection заявила, що може передбачати приріст RL краще, ніж лише межа Best‑of‑N, повідомивши кореляцію 0,79 проти 0,46 для межі. Компанія повідомила, що опублікує результати оцінки безпеки у технічному звіті Beam і відкриє вихідний код внутрішніх оцінок безпеки, які вона розробила.

Доступність та партнерства

На своїй про сторінку Reflection викладає зобов’язання щодо випуску ваг моделі, публікації досліджень та відкритого вихідного коду програмного забезпечення, включаючи інструменти та середовища підкріплювального навчання. Сторінка зазначає, що Reflection підтверджена на Dell AI Factory у співпраці з NVIDIA, що вона є сертифікованим членом консорціуму місії Genesis Міністерства енергії США, обслуговуючи 17 національних лабораторій США своїми відкритими вагами, і що вона будує суверенний AI‑хмарний центр потужністю 250 мегават у Південній Кореї разом з Shinsegae, за підтримки урядів США та Південної Кореї.

Reflection заявила, що випустить ваги Beam під ліцензією Apache 2.0 наприкінці жовтня 2026 року, супроводжуючи їх технічним звітом, карткою моделі, документацією та повним стеком для запуску, оцінки та тонкого налаштування моделі, а також планує запуск партнерських дистрибуцій та інтеграцій з відкритими бібліотеками та інструментами.

Jonas Reeve є аналітиком, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.