Modelos e plataformas de IA
Modelos Granite 4.2 da IBM Aprendem a Pensar e Agir em Ambientes

A IBM lançou o Granite 4.2, sua primeira família de modelos de linguagem densos, apenas decodificador, para raciocínio, em três tamanhos: 3B, 8B, e 30B parâmetros. Anunciado em 25 de agosto de 2026 com os pesos publicados sob a licença Apache 2.0, o lançamento oferece a cada modelo Granite um modo de pensamento alternável e submete os dois tamanhos maiores ao aprendizado por reforço em ambientes reais de engenharia de software, terminal e busca na web.
Em um tutorial técnico da construção, a equipe Granite da IBM descreve um pipeline que começa com pré-treinamento do zero em cerca de 15 trilhões de tokens, com um cronograma de cinco fases que amplia a janela de contexto para 512K tokens. O ajuste fino supervisionado segue em cerca de 7,2 milhões de amostras de cadeias de pensamento, raciocínio e dados de trajetória agente. O ponto central do lançamento, porém, está no que vem depois: um pipeline de aprendizado por reforço em múltiplas etapas, em que cada etapa é uma execução de treinamento separada focada em uma capacidade, iniciada a partir do checkpoint da etapa anterior.
Todos os três tamanhos executam RL fundamental sobre recompensas verificáveis — problemas matemáticos com respostas conferíveis, código avaliado por testes unitários ocultos, tarefas de seguir instruções com verificadores de formato — além de curtas etapas “booster” para habilidades específicas. Apenas os modelos de 8B e 30B avançam para o bloco agente: três etapas nas quais o modelo atua dentro de um ambiente ao vivo e recebe recompensa conforme a tarefa foi realmente resolvida. Na etapa de engenharia de software, impulsionada pela estrutura OpenHands, o modelo edita repositórios reais e só passa se a suíte de testes ocultos for aprovada. A etapa de terminal o coloca em um shell ao vivo com até 64 turnos de ambiente por execução. A etapa de busca faz com que ele responda a perguntas de múltiplas etapas por meio de chamadas de busca na web ao vivo, avaliadas por um juiz LLM.
Cada modelo termina então com RLHF para preferência e segurança, que também aplica uma penalidade ao comprimento do raciocínio para desencorajar as cadeias verbosas que as etapas anteriores podem gerar.
Como o Pensamento Alternável se Apresenta na Prática
Cada modelo Granite 4.2 expõe três modos de operação por meio de seu modelo de chat. O modo de pensamento, padrão, gera uma cadeia completa de raciocínio dentro de tags dedicadas antes da resposta final. O modo sem pensamento responde diretamente. Uma configuração de baixo esforço situa-se entre os dois, gastando um pequeno orçamento de raciocínio em perguntas fáceis. Em conversas de múltiplas trocas, o pensamento das trocas anteriores é removido por padrão para conservar o contexto.
A chamada nativa de ferramentas está incorporada ao mesmo modelo: o modelo raciocina sobre qual ferramenta chamar e por quê antes de emitir a chamada, no formato de chamada de função da OpenAI, de modo que se conecta a estruturas agentes servidas via vLLM ou SGLang sem adaptadores adicionais. Segundo a coleção de modelos Granite 4.2, todos os três pesos estão disponíveis para download público, e o cartão do modelo 30B confirma que o modelo principal foi pós-treinado a partir da base Granite 4.1 30B. Os modelos foram testados em 12 idiomas, incluindo inglês, alemão, japonês, árabe, coreano e chinês.
Os Números Reportados pela IBM
A IBM avaliou a família em codificação agente, uso geral de ferramentas, raciocínio, chat e contexto longo, usando uma estrutura construída sobre o NeMo Evaluator SDK. As pontuações abaixo são os números reportados pela própria empresa.
- SWE-Bench Verificado: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 matemática: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA ciência: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER contexto longo em 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)
O padrão corresponde ao desenho do treinamento. As pontuações aumentam consistentemente com o tamanho em matemática, ciência e raciocínio de código, e os benchmarks de codificação agente que dependem do bloco exclusivo de RL agente dos modelos de 8B e 30B mostram a maior diferença entre os tamanhos. O modelo de 3B, que não executa nenhuma das etapas de ambiente, não tem pontuação nas suítes SWE-Bench ou Terminal-Bench.
Treinando Agentes sem uma Rede de Valor
A mecânica de RL merece um exame mais detalhado porque é onde reside a maior parte da engenharia do lançamento. Cada etapa treina com GRPO assíncrono, um método de otimização de política relativo ao grupo que pontua cada resposta contra a recompensa média das outras amostras geradas para o mesmo prompt, eliminando a necessidade de uma rede de valor separada que muitos pipelines de RL exigem. Geração e treinamento rodam em pools de GPU separados que nunca bloqueiam um ao outro: os workers continuam amostrando trajetórias em um buffer compartilhado, e o treinador transmite pesos atualizados durante a execução. Uma salvaguarda impede que os geradores se desviem mais de uma atualização, e a amostragem de importância truncada limita o efeito de tokens obsoletos.
Os ambientes se conectam via NeMo-Gym, que apresenta verificadores, ferramentas e sandboxes por trás de uma interface uniforme, enquanto o NeMo-RL conduz o loop de treinamento no Megatron-Core com geração vLLM. A consequência prática é que um verificador de matemática baseado em regras e um sandbox de repositório completo parecem idênticos ao loop de treinamento, o que torna viável a execução do currículo em etapas. A IBM treinou os modelos em um cluster NVIDIA GB200 NVL72 hospedado pela CoreWeave, com um domínio NVLink de 72 GPUs e uma malha InfiniBand de 400 Gb/s.
A IBM também disponibilizou variantes quantizadas da família: FP8 sem calibração, NVFP4 e MXFP4 calibrados em 2.000 amostras do conjunto de dados SFT, e quatorze formatos GGUF via llama.cpp para implantação com memória reduzida.
Onde o Granite 4.2 se Encaixa na Linha da IBM
O lançamento continua uma divisão deliberada de trabalho na estratégia de modelos abertos da IBM. Gerações anteriores do Granite foram posicionadas como assistentes fortes de seguir instruções; a empresa também apresentou o Granite Speech 5.0, lançado no mesmo dia, em um anúncio separado focado na velocidade de transcrição. O Granite 4.2 representa a vez da linha de modelos de linguagem em raciocínio explícito, e chega com a receita completa de treinamento, proporções de mistura de dados e hiperparâmetros por etapa publicados ao lado dos pesos.
Todos os três modelos, as variantes quantizadas, o repositório GitHub e a documentação estão disponíveis sob a licença Apache 2.0, com o modelo principal de 30B dimensionado para um único nó de serviço multi-GPU e o de 3B voltado para implantações mais leves onde o interruptor de pensamento ainda se aplica.












