Modelos y plataformas de IA
Los modelos Granite 4.2 de IBM aprenden a pensar y actuar dentro de entornos

IBM ha lanzado Granite 4.2, su primera familia de modelos de lenguaje densos y solo decodificador para razonamiento, en tres tamaños: 3B, 8B y 30B parámetros. Anunciado el 25 de agosto de 2026 con los pesos publicados bajo la licencia Apache 2.0, el lanzamiento otorga a cada modelo Granite un modo de pensamiento conmutable y somete a los dos tamaños mayores a aprendizaje por refuerzo dentro de entornos reales de ingeniería de software, terminal y búsqueda web.
En una guía técnica de la construcción, el Equipo Granite de IBM describe una canalización que comienza con preentrenamiento desde cero sobre aproximadamente 15 billones de tokens, con un programa de cinco fases que amplía la ventana de contexto a 512 K tokens. Luego sigue un ajuste fino supervisado con alrededor de 7,2 millones de muestras de datos de cadena de pensamiento, razonamiento y trayectoria agente. Sin embargo, el eje central del lanzamiento es lo que ocurre después: una canalización de aprendizaje por refuerzo de múltiples etapas en la que cada etapa es una ejecución de entrenamiento independiente dirigida a una capacidad, iniciada a partir del punto de control de la etapa anterior.
Los tres tamaños ejecutan RL fundamental sobre recompensas verificables — problemas matemáticos con respuestas comprobables, código evaluado mediante pruebas unitarias ocultas, tareas de seguimiento de instrucciones con verificadores de formato — además de breves etapas de “refuerzo” para habilidades específicas. Solo los modelos de 8B y 30B continúan en el bloque agente: tres etapas en las que el modelo actúa dentro de un entorno en vivo y recibe recompensas según si la tarea se resolvió realmente. En la etapa de ingeniería de software, impulsada por el arnés OpenHands, el modelo edita repositorios reales y solo pasa si la suite de pruebas ocultas se supera. La etapa de terminal lo introduce en una consola en vivo con hasta 64 turnos de entorno por ejecución. La etapa de búsqueda lo hace responder preguntas de varios saltos mediante llamadas de búsqueda web en tiempo real, evaluadas por un juez LLM.
Cada modelo finaliza luego con RLHF para preferencias y seguridad, lo que también aplica una penalización por longitud de razonamiento para desalentar las cadenas verbosas que pueden generar las etapas anteriores.
Cómo se ve el Pensamiento conmutable en la práctica
Cada modelo Granite 4.2 expone tres modos de operación mediante su plantilla de chat. El modo de pensamiento, predeterminado, genera una cadena completa de razonamiento dentro de etiquetas dedicadas antes de la respuesta final. El modo sin pensamiento responde directamente. Un ajuste de bajo esfuerzo se sitúa entre ambos, dedicando un breve presupuesto de razonamiento a preguntas sencillas. En conversaciones de varios turnos, el razonamiento de turnos anteriores se elimina por defecto para conservar el contexto.
La invocación nativa de herramientas está integrada en la misma plantilla: el modelo razona sobre qué herramienta llamar y por qué antes de emitir la llamada, en el formato de llamadas a funciones de OpenAI, de modo que se conecta a arneses agentes servidos a través de vLLM o SGLang sin adaptadores adicionales. Según la colección de modelos Granite 4.2, los tres pesos están disponibles para descarga pública, y la ficha del modelo de 30B confirma que el buque insignia se entrenó posteriormente a partir de la base Granite 4.1 de 30B. Los modelos se probaron en 12 idiomas, incluidos inglés, alemán, japonés, árabe, coreano y chino.
Las cifras que IBM informa
IBM evaluó la familia en codificación agente, uso general de herramientas, razonamiento, chat y contexto largo, utilizando un marco construido sobre el SDK NeMo Evaluator. Las puntuaciones siguientes son las cifras reportadas por la propia empresa.
- SWE-Bench Verified: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)
El patrón coincide con el diseño del entrenamiento. Las puntuaciones aumentan de forma constante con el tamaño en matemáticas, ciencia y razonamiento de código, y los benchmarks de codificación agente que dependen del bloque exclusivo de RL agente de los modelos de 8B y 30B muestran la mayor brecha entre tamaños. El modelo de 3B, que no ejecuta ninguna de las etapas de entorno, no se reporta en los conjuntos SWE-Bench ni Terminal-Bench.
Entrenando agentes sin una red de valor
La maquinaria de RL merece una mirada más profunda porque es donde se concentra la mayor parte de la ingeniería del lanzamiento. Cada etapa se entrena con GRPO asíncrono, un método de optimización de políticas relativo al grupo que evalúa cada respuesta contra la recompensa media de las demás muestras generadas para el mismo prompt, eliminando la red de valor separada que muchos pipelines de RL requieren. La generación y el entrenamiento se ejecutan en pools de GPU independientes que nunca se bloquean entre sí: los trabajadores continúan muestreando trayectorias en un búfer compartido, y el entrenador transmite pesos actualizados durante la ejecución. Una barrera de seguridad evita que los generadores se desvíen más de una actualización, y el muestreo de importancia truncado limita el efecto de tokens obsoletos.
Los entornos se conectan a través de NeMo-Gym, que ofrece verificadores, herramientas y sandbox bajo una interfaz uniforme, mientras que NeMo-RL impulsa el bucle de entrenamiento en Megatron-Core con generación vLLM. La consecuencia práctica es que un verificador matemático basado en reglas y un sandbox de repositorio completo aparecen idénticos al bucle de entrenamiento, lo que permite ejecutar el currículo por etapas. IBM entrenó los modelos en un clúster NVIDIA GB200 NVL72 alojado por CoreWeave, con un dominio NVLink de 72 GPU y una arquitectura InfiniBand de 400 Gb/s.
IBM también lanzó variantes cuantizadas de la familia: FP8 sin calibración, NVFP4 y MXFP4 calibradas con 2 000 muestras del conjunto de datos SFT, y catorce formatos GGUF mediante llama.cpp para implementaciones con memoria reducida.
Dónde encaja Granite 4.2 en la línea de IBM
El lanzamiento continúa una división deliberada del trabajo en la estrategia de modelos abiertos de IBM. Las generaciones anteriores de Granite se posicionaron como asistentes fuertes en el seguimiento de instrucciones; la compañía también presentó Granite Speech 5.0, lanzado el mismo día, en un anuncio separado centrado en la velocidad de transcripción. Granite 4.2 representa el turno de la línea de modelos de lenguaje en razonamiento explícito, y llega con la receta completa de entrenamiento, proporciones de mezcla de datos y hiperparámetros por etapa publicados junto con los pesos.
Los tres modelos, las variantes cuantizadas, el repositorio de GitHub y la documentación están disponibles bajo Apache 2.0, con el modelo insignia de 30B dimensionado para un único nodo de servicio multi-GPU y el de 3B orientado a implementaciones más ligeras donde aún se aplica el conmutador de pensamiento.












