AI 模型与平台

IBM 的 Granite 4.2 模型学会在环境中思考与行动

mm
将 Unite.AI 添加到您在 Google 上的首选来源

IBM 已发布 Granite 4.2,这是其首个密集的仅解码器推理语言模型系列,提供 3B、8B 和 30B 参数三种规模。该版本于 2026 年 8 月 25 日宣布,权重在 Apache 2.0 许可证下发布,为每个 Granite 模型提供可切换的思考模式,并对两种更大规模的模型在真实的软件工程、终端和网络搜索环境中进行强化学习。

在一篇技术构建 walkthrough中,IBM 的 Granite 团队描述了一个从头预训练约 15 万亿 token 的流水线,采用五阶段计划将上下文窗口扩展至 512K token。随后在约 720 万条链式思考、推理和代理轨迹数据上进行监督微调。发布的核心重心在于随后进行的多阶段强化学习流水线,每个阶段都是针对单一能力的独立训练运行,并从前一阶段的检查点热启动。

所有三种规模均在可验证奖励上进行基础 RL——包括有可检查答案的数学题、通过隐藏单元测试评估的代码、以及带格式检查器的指令遵循任务——并附加针对特定技能的短“助推”阶段。仅 8B 和 30B 模型会继续进入代理块:三个阶段中模型在真实环境中行动,并根据任务是否真正解决来获得奖励。在软件工程阶段,借助 OpenHands 框架,模型编辑真实代码库,仅当隐藏测试套件通过时才算成功。终端阶段将模型放入实时 shell,每次 rollout 最多 64 次环境交互。搜索阶段让模型通过实时网络搜索调用回答多跳问题,由 LLM 判官评分。

随后每个模型都会进行 RLHF,以实现偏好对齐和安全性,同时对推理长度施加惩罚,抑制早期阶段可能产生的冗长链式思考。

可切换思考模式在实践中的表现

每个 Granite 4.2 模型通过其聊天模板公开三种运行模式。思考模式为默认模式,会在专用标签中生成完整的思考链后给出最终答案。非思考模式直接给出答案。低消耗模式介于两者之间,对简单问题使用短暂的推理预算。在多轮对话中,默认会剥离前几轮的思考内容以节省上下文。

原生工具调用内置于同一模板中:模型先推理应调用哪个工具以及原因,然后以 OpenAI 函数调用格式输出调用指令,因而可无额外适配器直接接入通过 vLLM 或 SGLang 提供的代理框架。根据Granite 4.2 模型集合,三套权重均可公开下载,且30B 模型卡确认旗舰模型是基于 Granite 4.1 30B 基础模型进行后训练的。模型已在包括英语、德语、日语、阿拉伯语、韩语和中文在内的 12 种语言上进行测试。

IBM 报告的数字

IBM 使用基于 NeMo Evaluator SDK 构建的框架,对该系列在代理编码、通用工具使用、推理、聊天和长上下文等方面进行评估。以下分数为公司自行报告的数值。

  • SWE-Bench 验证: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 数学: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA 科学: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER 长上下文 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

这一模式与训练设计相符。分数随模型规模在数学、科学和代码推理上持续提升,而依赖 8B 与 30B 模型专属代理 RL 块的代理编码基准显示出规模间最大的差距。未参与任何环境阶段的 3B 模型在 SWE-Bench 与 Terminal-Bench 套件中未有报告。

在没有价值网络的情况下训练代理

RL 机制值得深入探讨,因为它承载了本次发布的大部分工程实现。每个阶段均使用异步 GRPO(组相对策略优化)进行训练,该方法将每个响应的得分与同一提示下其他样本的平均奖励进行比较,从而省去许多 RL 流水线所需的独立价值网络。生成与训练在不同的 GPU 池上并行运行,互不阻塞:工作进程持续将轨迹采样到共享缓冲区,训练器在 rollout 中途流式返回更新的权重。守护机制防止生成器落后超过一次更新,截断重要性采样限制陈旧 token 的影响。

这些环境通过 NeMo-Gym 接入,统一接口后提供验证器、工具和沙箱,而 NeMo-RL 在 Megatron-Core 上配合 vLLM 进行训练循环。实际效果是,基于规则的数学检查器和完整的代码库沙箱在训练循环中表现一致,这使得分阶段课程的可行性得以实现。IBM 在 CoreWeave 托管的 NVIDIA GB200 NVL72 集群上训练模型,拥有 72 GPU NVLink 域和 400 Gb/s InfiniBand 网络。

IBM 还发布了该系列的量化变体:未校准的 FP8、在 2,000 条 SFT 数据样本上校准的 NVFP4 与 MXFP4,以及通过 llama.cpp 提供的十四种 GGUF 格式,以支持低内存部署。

Granite 4.2 在 IBM 产品线中的定位

此发布延续了 IBM 开放模型策略中有意的职责划分。早期的 Granite 代系定位为强大的指令遵循助理;同一天公司还发布了 Granite Speech 5.0,在单独公告中强调其转录速度。Granite 4.2 则是语言模型系列在显式推理方向的尝试,并随附完整的训练配方、数据混合比例以及每阶段超参数,均与权重一同公开。

所有三种模型、量化变体、GitHub 仓库以及文档均在 Apache 2.0 许可证下提供,30B 旗舰模型面向单节点多 GPU 部署,3B 模型面向轻量化部署,仍可使用思考开关。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。