Modèles et plateformes d’IA

Les modèles Granite 4.2 d’IBM apprennent à penser et à agir dans des environnements

mm
Ajouter Unite.AI à vos sources préférées sur Google

IBM a publié Granite 4.2, sa première famille de modèles de langage denses, uniquement décodeur, capables de raisonnement, disponible en trois tailles: 3 B, 8 B et 30 B de paramètres. Annoncée le 25 août 2026 avec des poids publiés sous licence Apache 2.0, la version offre à chaque modèle Granite un mode de pensée commutable et soumet les deux tailles supérieures à un apprentissage par renforcement dans de véritables environnements d’ingénierie logicielle, de terminal et de recherche Web.

Dans un guide technique de la construction, l’équipe Granite d’IBM décrit un pipeline qui débute par un pré‑entraînement à partir de zéro sur environ 15 trillions de jetons, avec un calendrier en cinq phases qui étend la fenêtre de contexte à 512 K jetons. Un ajustement supervisé suit, sur environ 7,2 millions d’échantillons de chaînes de pensée, de raisonnement et de trajectoires d’agents. Le centre de gravité de la version, toutefois, se trouve dans ce qui suit: un pipeline d’apprentissage par renforcement à plusieurs étapes où chaque étape est un entraînement distinct ciblant une capacité, démarré à chaud depuis le point de contrôle de l’étape précédente.

Les trois tailles exécutent un RL de base sur des récompenses vérifiables — problèmes mathématiques avec réponses vérifiables, code évalué par des tests unitaires cachés, tâches suivant des instructions avec des vérificateurs de format — ainsi que de courtes étapes « booster » pour des compétences spécifiques. Seuls les modèles 8 B et 30 B poursuivent dans le bloc agentique: trois étapes où le modèle agit dans un environnement en direct et est récompensé en fonction de la résolution réelle de la tâche. Dans l’étape d’ingénierie logicielle, pilotée par le cadre OpenHands, le modèle modifie de vrais dépôts et ne réussit que si la suite de tests cachés passe. L’étape terminal le place dans un shell en direct avec jusqu’à 64 tours d’environnement par exécution. L’étape de recherche le fait répondre à des questions à plusieurs sauts via des appels de recherche Web en direct, évalués par un juge LLM.

Chaque modèle se termine ensuite par un RLHF pour les préférences et la sécurité, qui applique également une pénalité de longueur de raisonnement afin de décourager les chaînes verbeuses que les étapes précédentes peuvent générer.

À quoi ressemble la pensée commutable en pratique

Chaque modèle Granite 4.2 propose trois modes de fonctionnement via son modèle de chat. Le mode de pensée, par défaut, génère une chaîne de pensée complète à l’intérieur de balises dédiées avant la réponse finale. Le mode non‑pensée répond directement. Un réglage à faible effort se situe entre les deux, consacrant un court budget de raisonnement aux questions simples. Dans les conversations à plusieurs tours, la pensée des tours précédents est supprimée par défaut afin de conserver le contexte.

L’appel natif d’outils est intégré au même modèle: le modèle raisonne sur l’outil à appeler et pourquoi avant d’émettre l’appel, au format d’appel de fonction OpenAI, ce qui lui permet de se brancher aux cadres agentiques servis via vLLM ou SGLang sans adaptateurs supplémentaires. Selon la collection de modèles Granite 4.2, les trois poids sont téléchargeables publiquement, et la fiche du modèle 30 B confirme que le modèle phare a été post‑entraîné à partir de la base Granite 4.1 30 B. Les modèles sont testés dans 12 langues, dont l’anglais, l’allemand, le japonais, l’arabe, le coréen et le chinois.

Les chiffres rapportés par IBM

IBM a évalué la famille sur le codage agentique, l’utilisation générale d’outils, le raisonnement, le chat et le long contexte, en utilisant un cadre construit sur le SDK NeMo Evaluator. Les scores ci‑dessous sont les chiffres rapportés par l’entreprise.

  • SWE-Bench vérifié: 57,00 (30B), 47,67 (8B)
  • Terminal-Bench 2.1: 29,24 (30B), 20,56 (8B)
  • AIME25 math: 89,17 (30B), 86,67 (8B), 78,33 (3B)
  • GPQA science: 66,41 (30B), 64,14 (8B), 54,80 (3B)
  • RULER contexte long à 128K: 81,38 (30B), 71,41 (8B), 55,30 (3B)

Le schéma correspond à la conception de l’entraînement. Les scores augmentent de façon constante avec la taille pour les mathématiques, les sciences et le raisonnement de code, et les benchmarks de codage agentique qui dépendent du bloc RL agentique exclusif des modèles 8 B et 30 B montrent l’écart le plus important entre les tailles. Le modèle 3 B, qui n’exécute aucune des étapes d’environnement, n’est pas du tout répertorié dans les suites SWE‑Bench ou Terminal‑Bench.

Entraîner des agents sans réseau de valeur

L’infrastructure RL mérite une attention particulière car c’est là que réside la majeure partie de l’ingénierie de la version. Chaque étape s’entraîne avec le GRPO asynchrone, une méthode d’optimisation de politique relative à un groupe qui évalue chaque réponse par rapport à la récompense moyenne des autres échantillons tirés pour le même prompt, éliminant ainsi le réseau de valeur séparé que de nombreux pipelines RL exigent. La génération et l’entraînement s’exécutent sur des pools GPU distincts qui ne se bloquent jamais: les travailleurs continuent d’échantillonner des trajectoires dans un tampon partagé, et le formateur diffuse les poids mis à jour en cours de déroulement. Une garde-fou empêche les générateurs de dériver de plus d’une mise à jour, et l’échantillonnage d’importance tronqué limite l’effet des jetons obsolètes.

Les environnements se connectent via NeMo‑Gym, qui propose des vérificateurs, des outils et des sandbox derrière une interface uniforme, tandis que NeMo‑RL pilote la boucle d’entraînement sur Megatron‑Core avec génération vLLM. La conséquence pratique est qu’un vérificateur mathématique basé sur des règles et un sandbox de dépôt complet apparaissent identiques pour la boucle d’entraînement, ce qui rend le curriculum par étapes réalisable. IBM a entraîné les modèles sur un cluster NVIDIA GB200 NVL72 hébergé par CoreWeave, avec un domaine NVLink de 72 GPU et un tissu InfiniBand de 400 Gb/s.

IBM a également fourni des variantes quantifiées de la famille: FP8 sans calibration, NVFP4 et MXFP4 calibrés sur 2 000 échantillons du jeu de données SFT, ainsi que quatorze formats GGUF via llama.cpp pour des déploiements à mémoire réduite.

Où Granite 4.2 s’insère dans la gamme d’IBM

La version poursuit une division délibérée du travail dans la stratégie de modèles ouverts d’IBM. Les générations précédentes de Granite étaient présentées comme de puissants assistants suivant les instructions ; l’entreprise a couvert Granite Speech 5.0, publié le même jour, dans une annonce distincte axée sur la vitesse de transcription. Granite 4.2 représente le tour de la gamme de modèles de langage pour le raisonnement explicite, et il arrive avec la recette d’entraînement complète, les proportions du mélange de données et les hyperparamètres par étape publiés aux côtés des poids.

Les trois modèles, les variantes quantifiées, le dépôt GitHub et la documentation sont disponibles sous licence Apache 2.0, le modèle phare 30 B étant dimensionné pour un seul nœud de service multi‑GPU et le modèle 3 B destiné à des déploiements plus légers où le commutateur de pensée reste applicable.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.