AIモデルとプラットフォーム
IBM の Granite 4.2 モデルが環境内で思考し行動を学ぶ

IBM は Granite 4.2 を発表しました。これは、デンスでデコーダのみの推論言語モデルの最初のファミリーで、3 つのサイズ: 3B、8B、30B のパラメータがあります。2026 年 8 月 25 日に発表され、重みは Apache 2.0 ライセンスの下で公開されました。このリリースにより、すべての Granite モデルに切り替え可能な思考モードが付与され、サイズが大きい 2 つは実際のソフトウェアエンジニアリング、ターミナル、ウェブ検索環境内での強化学習が適用されます。
ビルドの技術的 walkthrough では、IBM の Granite チームが、約 15 兆トークンからのスクラッチでの事前学習から始まり、コンテキストウィンドウを 512K トークンに拡張する 5 段階のスケジュールを持つパイプラインを説明しています。その後、約 720 万サンプルのチェーン・オブ・ソート、推論、エージェント軌跡データで教師ありファインチューニングが行われます。しかし、リリースの中心はその後に来るものであり、各段階が前段階のチェックポイントからウォームスタートされ、特定の能力を対象とした別々のトレーニング実行となる多段階強化学習パイプラインです。
3 つのサイズすべてが、検証可能な報酬—解答がチェック可能な数学問題、隠れたユニットテストで評価されるコード、フォーマットチェッカーによる指示遵守タスク—に対して基礎的な RL を実行し、特定スキル向けの短い「ブースタ」段階も加えます。8B と 30B のモデルだけがエージェントブロックに進みます—モデルがライブ環境内で行動し、タスクが実際に解決されたかで報酬が与えられる 3 段階です。ソフトウェアエンジニアリング段階では、OpenHands ハーネスにより、モデルが実際のリポジトリを編集し、隠れたテストスイートが合格すれば成功とみなされます。ターミナル段階では、ライブシェルに投入され、ロールアウトあたり最大 64 回の環境ターンが許可されます。検索段階では、ライブウェブ検索呼び出しを通じてマルチホップ質問に回答し、LLM ジャッジによってスコア付けされます。
その後、すべてのモデルは好みと安全性のために RLHF で仕上げられ、以前の段階で生成される冗長なチェーンを抑制するために推論長さペナルティも適用されます。
実践における切り替え可能な思考の姿
Granite 4.2 の各モデルは、チャットテンプレートを通じて 3 つの動作モードを提供します。デフォルトの思考モードは、最終回答の前に専用タグ内で思考の完全なチェーンを生成します。非思考モードは直接回答します。低コスト設定はその中間に位置し、簡単な質問に対して短い推論予算を使います。複数ターンの会話では、文脈を節約するためにデフォルトで前ターンの思考が除去されます。
ネイティブツール呼び出しは同じテンプレートに組み込まれており、モデルはどのツールを呼び出すか、なぜ呼び出すかを推論し、OpenAI の関数呼び出し形式で呼び出しを出力します。そのため、vLLM や SGLang を通じて提供されるエージェントハーネスに追加アダプタなしで組み込むことができます。Granite 4.2 モデルコレクションによれば、3 つの重みはすべて公開ダウンロード可能で、30B モデルカードはフラッグシップが Granite 4.1 30B ベースから追加学習されたことを確認しています。これらのモデルは、英語、ドイツ語、日本語、アラビア語、韓国語、中文を含む 12 言語でテストされています。
IBM が報告する数値
IBM は、NeMo Evaluator SDK を基盤としたフレームワークを用いて、エージェントコーディング、一般的なツール使用、推論、チャット、長文コンテキストの各領域でファミリーを評価しました。以下のスコアは同社が独自に報告した数値です。
- SWE-Bench Verified: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)
このパターンはトレーニング設計と一致しています。スコアはサイズが大きくなるにつれて数学、科学、コード推論のすべてで一貫して上昇し、8B と 30B モデルの専用エージェント RL ブロックに依存するエージェントコーディングベンチマークではサイズ間のギャップが最も大きくなります。環境段階を一切実行しない 3B モデルは、SWE-Bench や Terminal-Bench スイートでは全く報告されていません。
価値ネットワークなしでエージェントをトレーニングする
RL の仕組みは、リリースのエンジニアリングの大部分がここにあるため、詳しく見る価値があります。すべての段階は非同期 GRPO を使用してトレーニングされます。これは、同じプロンプトに対して抽出された他のサンプルの平均報酬と比較して各応答をスコアリングするグループ相対方策最適化手法であり、多くの RL パイプラインが必要とする別個の価値ネットワークを排除します。生成とトレーニングは別々の GPU プールで実行され、互いにブロックしません。ワーカーはトラジェクトリを共有バッファにサンプリングし続け、トレーナーはロールアウト途中で更新された重みをストリームします。ガードレールはジェネレータが 1 回以上の更新分だけ遅れないようにし、切り捨てられた重要度サンプリングは古いトークンの影響を抑制します。
環境は NeMo-Gym を介して接続され、検証ツールやサンドボックスを統一インターフェースで提供します。一方、NeMo-RL は Megatron-Core 上で vLLM 生成を用いてトレーニングループを駆動します。実際の結果として、ルールベースの数学チェッカーと完全なリポジトリサンドボックスがトレーニングループと同一に見えるため、段階的カリキュラムの実行が可能になります。IBM はこれらのモデルを、CoreWeave がホストする NVIDIA GB200 NVL72 クラスタ上で、72 GPU の NVLink ドメインと 400 Gb/s InfiniBand ファブリックを使用してトレーニングしました。
IBM はまた、ファミリーの量子化バリアントも提供しました。キャリブレーションなしの FP8、SFT データセットから 2,000 サンプルでキャリブレーションされた NVFP4 と MXFP4、そして llama.cpp を通じた 14 種類の GGUF フォーマットで、メモリ削減デプロイが可能です。
Granite 4.2 が IBM のラインに位置付けられる場所
このリリースは、IBM のオープンモデル戦略における意図的な役割分担を継続しています。過去の Granite 世代は、指示に従う強力なアシスタントとして位置付けられ、同日に Granite Speech 5.0 が発表され、別個の発表で文字起こし速度に焦点が当てられました。Granite 4.2 は言語モデルラインにおいて明示的な推論に挑むもので、重みとともに完全なトレーニングレシピ、データ混合比率、段階ごとのハイパーパラメータが公開されています。
3 つのモデル、量子化バリアント、GitHub リポジトリ、そしてドキュメントはすべて Apache 2.0 の下で利用可能で、30B のフラッグシップは単一のマルチ GPU サービングノード向けにサイズ設定され、3B は思考スイッチが依然として有効な軽量デプロイを対象としています。












