AI 모델 및 플랫폼
IBM의 Granite 4.2 모델이 환경 내에서 사고하고 행동을 학습

IBM은 3B, 8B, 30B 파라미터의 세 가지 크기로, 밀집형 디코더 전용 추론 언어 모델인 Granite 4.2 패밀리를 출시했습니다. 2026년 8월 25일에 발표되었으며, 가중치는 Apache 2.0 라이선스로 공개되었습니다. 이번 릴리스는 모든 Granite 모델에 전환 가능한 사고 모드를 제공하고, 두 대형 모델을 실제 소프트웨어 엔지니어링, 터미널, 웹 검색 환경에서 강화 학습을 수행하도록 합니다.
IBM의 Granite 팀은 구축에 대한 기술 안내에서 약 15조 토큰을 대상으로 처음부터 사전 학습을 시작하고, 컨텍스트 윈도우를 512K 토큰으로 확장하는 5단계 일정의 파이프라인을 설명합니다. 이후 약 720만 개의 사고 흐름, 추론, 에이전트 궤적 데이터에 대해 감독된 미세 조정이 진행됩니다. 하지만 이번 릴리스의 핵심은 그 이후에 오는 다단계 강화 학습 파이프라인으로, 각 단계가 하나의 능력을 목표로 하는 별도의 학습 실행이며, 이전 단계의 체크포인트에서 워밍 스타트됩니다.
세 모델 모두 검증 가능한 보상에 대한 기본 강화 학습을 수행합니다 — 정답이 확인 가능한 수학 문제, 숨겨진 단위 테스트로 채점되는 코드, 형식 검사기가 있는 명령 수행 과제 — 그리고 특정 기술을 위한 짧은 “부스터” 단계가 추가됩니다. 8B와 30B 모델만이 에이전트 블록으로 진행되며, 여기서는 모델이 실시간 환경에서 행동하고 과제가 실제로 해결되었는지에 따라 보상을 받는 세 단계가 있습니다. 소프트웨어 엔지니어링 단계에서는 OpenHands 하네스를 통해 모델이 실제 저장소를 편집하고, 숨겨진 테스트 스위트를 통과해야만 성공합니다. 터미널 단계에서는 모델을 실시간 셸에 투입하여 롤아웃당 최대 64번의 환경 턴을 수행합니다. 검색 단계에서는 실시간 웹 검색 호출을 통해 다중 홉 질문에 답변하고, LLM 심판이 점수를 매깁니다.
각 모델은 이후 선호도와 안전성을 위한 RLHF를 수행하며, 이는 이전 단계에서 생성될 수 있는 과도한 사고 사슬을 억제하기 위해 추론 길이 페널티도 적용합니다.
실제 적용에서 전환 가능한 사고가 어떻게 보이는가
각 Granite 4.2 모델은 채팅 템플릿을 통해 세 가지 운영 모드를 제공합니다. 기본값인 사고 모드는 최종 답변 전에 전용 태그 안에 전체 사고 흐름을 생성합니다. 비사고 모드는 바로 답변을 제공합니다. 낮은 노력 설정은 두 모드 사이에 위치하며, 쉬운 질문에 짧은 추론 예산을 사용합니다. 다중 턴 대화에서는 기본적으로 이전 턴의 사고 흐름을 제거하여 컨텍스트를 절약합니다.
네이티브 도구 호출은 동일한 템플릿에 내장되어 있습니다. 모델은 호출할 도구와 그 이유를 추론한 뒤 OpenAI 함수 호출 형식으로 호출을 생성하므로, vLLM이나 SGLang을 통해 제공되는 에이전트 하네스에 별도의 어댑터 없이 연결됩니다. Granite 4.2 모델 컬렉션에 따르면, 세 가지 가중치 모두 공개적으로 다운로드 가능하며, 30B 모델 카드에서는 플래그십 모델이 Granite 4.1 30B 베이스에서 추가 학습된 것을 확인합니다. 이 모델들은 영어, 독일어, 일본어, 아랍어, 한국어, 중국어 등을 포함한 12개 언어에 대해 테스트되었습니다.
IBM이 보고한 수치
IBM은 NeMo Evaluator SDK를 기반으로 한 프레임워크를 사용하여 에이전트 코딩, 일반 도구 사용, 추론, 채팅, 장기 컨텍스트 등에서 이 패밀리를 평가했습니다. 아래 점수는 회사가 자체 보고한 수치입니다.
- SWE-Bench 검증: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 수학: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA 과학: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER 장기 컨텍스트 (128K): 81.38 (30B), 71.41 (8B), 55.30 (3B)
이 패턴은 훈련 설계와 일치합니다. 수학, 과학, 코드 추론에서 점수는 모델 크기에 따라 일관되게 상승하며, 8B와 30B 모델의 전용 에이전트 RL 블록에 의존하는 에이전트 코딩 벤치마크는 규모 간 차이가 가장 크게 나타납니다. 환경 단계가 전혀 수행되지 않는 3B 모델은 SWE-Bench 및 Terminal-Bench 스위트에 전혀 보고되지 않았습니다.
가치 네트워크 없이 에이전트 훈련하기
RL 메커니즘은 이번 릴리스 엔지니어링의 대부분이 집중된 부분이므로 자세히 살펴볼 가치가 있습니다. 모든 단계는 비동기 GRPO(그룹 상대 정책 최적화) 방식으로 학습되며, 이는 동일 프롬프트에 대해 추출된 다른 샘플들의 평균 보상에 대비해 각 응답을 평가함으로써 많은 RL 파이프라인이 필요로 하는 별도의 가치 네트워크를 없앱니다. 생성과 학습은 서로 차단되지 않는 별도의 GPU 풀에서 실행되며, 작업자는 궤적을 공유 버퍼에 계속 샘플링하고, 트레이너는 롤아웃 중간에 업데이트된 가중치를 스트리밍합니다. 가드레일은 생성기가 한 번 이상의 업데이트 뒤처지는 것을 방지하고, 잘린 중요도 샘플링은 오래된 토큰의 영향을 제한합니다.
환경은 NeMo-Gym을 통해 연결되며, 검증기, 도구, 샌드박스를 일관된 인터페이스 뒤에 제공합니다. 동시에 NeMo-RL은 vLLM 생성을 사용해 Megatron-Core에서 학습 루프를 구동합니다. 실질적인 결과는 규칙 기반 수학 검사기와 전체 저장소 샌드박스가 학습 루프와 동일하게 보이게 되어 단계적 커리큘럼을 실행 가능하게 만든다는 점입니다. IBM은 CoreWeave가 호스팅하는 NVIDIA GB200 NVL72 클러스터에서 모델을 학습했으며, 72개의 GPU NVLink 도메인과 400 Gb/s InfiniBand 패브릭을 사용했습니다.
IBM은 또한 패밀리의 양자화 변형도 제공했는데, 보정 없이 FP8, SFT 데이터셋에서 2,000개 샘플로 보정된 NVFP4와 MXFP4, 그리고 메모리 사용량을 줄이기 위해 llama.cpp를 통한 14가지 GGUF 포맷이 포함됩니다.
Granite 4.2가 IBM 라인에서 차지하는 위치
이번 릴리스는 IBM의 오픈 모델 전략에서 의도적인 역할 분담을 이어갑니다. 이전 Granite 세대는 강력한 명령 수행 어시스턴트로 자리매김했으며, IBM은 같은 날 별도 발표에서 Granite Speech 5.0을 발표해 전사 속도에 초점을 맞춘 별도 발표를 진행했습니다. Granite 4.2는 언어 모델 라인에서 명시적 추론을 담당하며, 전체 학습 레시피, 데이터 혼합 비율, 단계별 하이퍼파라미터가 가중치와 함께 공개되었습니다.
세 모델 모두, 양자화 변형, GitHub 저장소 및 문서는 Apache 2.0 라이선스로 제공되며, 30B 플래그십 모델은 단일 다중 GPU 서빙 노드에 맞춰졌고, 3B 모델은 사고 전환이 여전히 적용되는 경량 배포를 목표로 합니다.












