Модели и платформы ИИ

Модели Granite 4.2 от IBM учатся мыслить и действовать внутри сред

mm
Добавьте Unite.AI в избранные источники в Google

IBM выпустила Granite 4.2, первую семью плотных языковых моделей с выводом‑только‑декодером для рассуждений, в трёх размерах: 3 млрд, 8 млрд и 30 млрд параметров. Объявленная 25 августа 2026 года, с весами, опубликованными под лицензией Apache 2.0, эта версия предоставляет каждой модели Granite переключаемый режим мышления и отправляет две большие модели в обучение с подкреплением внутри реальных сред программной инженерии, терминала и веб‑поиска.

В техническом обзоре сборки команда Granite в IBM описывает конвейер, который начинается с предобучения с нуля на примерно 15 триллионах токенов, с пятифазовым расписанием, расширяющим окно контекста до 512 К токенов. Затем следует контролируемая донастройка на около 7,2 млн образцов данных цепочек мыслей, рассуждений и агентных траекторий. Однако центр тяжести релиза — это то, что происходит дальше: многоэтапный конвейер обучения с подкреплением, где каждый этап представляет собой отдельный тренировочный запуск, нацеленный на одну способность, и начинается с весов предыдущего этапа.

Все три размера выполняют базовое обучение с подкреплением на проверяемых вознаграждениях — математические задачи с проверяемыми ответами, код, оцениваемый скрытыми юнит‑тестами, задачи следования инструкциям с проверкой формата — плюс короткие «усилительные» этапы для конкретных навыков. Только модели 8 B и 30 B продолжают работу в агентном блоке: три этапа, где модель действует внутри живой среды и получает награду в зависимости от того, решена ли задача. На этапе программной инженерии, управляемом системой OpenHands, модель редактирует реальные репозитории и проходит только если скрытый набор тестов проходит. На терминальном этапе её помещают в живую оболочку с до 64 ходами среды за один запуск. На этапе поиска она отвечает на многократные вопросы через живые веб‑поисковые запросы, оцениваемые судьёй‑LLM.

Затем каждая модель завершается обучением с подкреплением от человеческой обратной связи (RLHF) для предпочтений и безопасности, что также накладывает штраф за длину рассуждений, чтобы не допустить избыточных цепочек, которые могут появиться на ранних этапах.

Как выглядит переключаемое мышление на практике

Каждая модель Granite 4.2 предоставляет три режима работы через свой шаблон чата. Режим мышления, используемый по умолчанию, генерирует полную цепочку мыслей внутри специальных тегов перед окончательным ответом. Режим без мышления отвечает напрямую. Низко‑затратный режим находится между ними, тратя небольшой бюджет рассуждений на простые вопросы. В многовопросных диалогах мышление предыдущих ходов по умолчанию удаляется, чтобы экономить контекст.

Встроенный вызов инструментов реализован в том же шаблоне: модель рассуждает, какой инструмент вызвать и почему, прежде чем сформировать вызов, в формате функции OpenAI, поэтому её можно подключать к агентным обвязкам, обслуживаемым через vLLM или SGLang без дополнительных адаптеров. Согласно коллекции моделей Granite 4.2, все три набора весов доступны для публичного скачивания, а карточка модели 30 B подтверждает, что флагман был дообучен от базовой модели Granite 4.1 30 B. Модели протестированы на 12 языках, включая английский, немецкий, японский, арабский, корейский и китайский.

Цифры, сообщённые IBM

IBM оценивала семью моделей по агентному программированию, общему использованию инструментов, рассуждениям, чату и работе с длинным контекстом, используя фреймворк, построенный на NeMo Evaluator SDK. Ниже приведённые оценки — собственные цифры компании.

  • SWE-Bench проверено: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 математика: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA наука: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER длинный контекст при 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

Эта закономерность соответствует дизайну обучения. Оценки стабильно растут с увеличением размера модели в областях математики, науки и рассуждений по коду, а агентные кодовые бенчмарки, зависящие от эксклюзивного агентного RL‑блока моделей 8 B и 30 B, демонстрируют наибольший разрыв между размерами. Модель 3 B, которая не проходит ни одного из этапов среды, полностью отсутствует в результатах SWE‑Bench и Terminal‑Bench.

Обучение агентов без сети ценностей

Механизм RL заслуживает более пристального рассмотрения, поскольку именно здесь сосредоточена большая часть инженерных решений релиза. Каждый этап обучается с асинхронным GRPO — методом групповой относительной оптимизации политики, который оценивает каждый ответ относительно среднего вознаграждения остальных образцов, полученных для того же запроса, устраняя необходимость отдельной сети ценностей, требуемой во многих RL‑конвейерах. Генерация и обучение работают на отдельных пулах GPU, которые никогда не блокируют друг друга: рабочие продолжают отбирать траектории в общий буфер, а тренер передаёт обновлённые веса в процессе выполнения. Ограничитель не позволяет генераторам отставать более чем на одно обновление, а усечённая важностная выборка ограничивает влияние устаревших токенов.

Среды подключаются через NeMo‑Gym, который предоставляет проверяющие модули, инструменты и песочницы через единый интерфейс, в то время как NeMo‑RL управляет тренировочным циклом на Megatron‑Core с генерацией vLLM. Практический результат — правило‑основанный проверщик математики и полноценная песочница репозитория выглядят одинаково для тренировочного цикла, что делает возможным поэтапную учебную программу. IBM обучала модели на кластере NVIDIA GB200 NVL72, размещённом у CoreWeave, с доменом из 72 GPU, соединённых NVLink, и инфинит-каналом 400 Гб/с InfiniBand.

IBM также выпустила квантизированные варианты семейства: FP8 без калибровки, NVFP4 и MXFP4, откалиброванные на 2 000 образцах из набора данных SFT, а также четырнадцать форматов GGUF через llama.cpp для развертывания с уменьшенным потреблением памяти.

Где Granite 4.2 вписывается в линейку IBM

Этот релиз продолжает продуманное распределение задач в стратегии открытых моделей IBM. Ранние поколения Granite позиционировались как мощные помощники, следящие за инструкциями; компания также представила Granite Speech 5.0, выпущенную в тот же день, в отдельном анонсе, сосредоточенном на скорости транскрипции. Granite 4.2 — это шаг линейки языковых моделей к явному рассуждению, и она поставляется с полным рецептом обучения, пропорциями смеси данных и гиперпараметрами каждого этапа, опубликованными вместе с весами.

Все три модели, квантизированные варианты, репозиторий GitHub и документация доступны под лицензией Apache 2.0, при этом флагманская модель 30 B рассчитана на один мног GPU‑узел обслуживания, а модель 3 B предназначена для более лёгких развертываний, где всё ещё применим переключаемый режим мышления.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.