Modèles et plateformes d’IA

Le modèle 4 bits de guérison de Multiverse Computing bat le modèle en pleine précision

mm
Ajouter Unite.AI à vos sources préférées sur Google

Multiverse Computing a publié une technique le 25 août 2026 qui renverse l’un des compromis les plus fiables dans le déploiement de modèles: un grand modèle de langage compressé à la moitié de ses paramètres et quantifié à 4 bits, qui obtient un score supérieur à celui du point de contrôle en pleine précision dont il provient. La méthode, appelée Quantization-Aware Healing (QAH), est détaillée dans un article de blog de l’entreprise et un article compagnon, et a été appliquée au GPT-OSS 120B d’OpenAI compressé à 60B paramètres et quantifié en MXFP4. Le modèle 4 bits résultant bat sa source bfloat16 sur 7 de 9 benchmarks, avec des gains de 7.4 points en raisonnement à long contexte et de 5.6 points en mathématiques de compétition.

Le résultat n’est pas une entrée de classement pour un modèle de nouvelle génération. Il s’agit d’une affirmation concernant l’étape de récupération dans les pipelines de compression, la phase où un modèle qui a été réduit et quantifié est réentraîné afin de regagner les capacités que ces étapes ont détruites. L’argument de Multiverse, présenté dans l’article Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs, est que les méthodes de récupération standard du domaine ancrent le modèle quantifié au mauvais enseignant, et que corriger ce choix unique supprime le plafond de performance d’un modèle compressé.

L’Enseignant était le goulet d’étranglement

La recette standard de déploiement efficace comporte trois étapes: compresser structurellement l’architecture en supprimant des couches, des têtes ou des neurones; quantifier les poids restants à 4 bits; puis réparer les dommages par un entraînement supplémentaire. La méthode de guérison dominante, l’entraînement conscient de la quantification, poursuit le fine‑tuning du modèle sur les données de tâche via un passage avant simulé à basse précision. Une alternative, la distillation consciente de la quantification, entraîne l’étudiant quantifié à reproduire la distribution de sortie d’un enseignant en pleine précision gelé.

Les deux fonctionnent lorsque la quantification est le seul changement, car une copie authentique en pleine précision du même modèle existe pour l’enseignement. La compression structurelle rompt cette hypothèse. Un modèle de 60B issu d’une réduction de 120B n’a jamais été entraîné indépendamment en pleine précision; le seul candidat bfloat16 est un point de contrôle qui a lui‑même été récupéré par distillation à partir de l’original. En distillant l’étudiant 4‑bits à partir de ce point de contrôle, Multiverse soutient que sa précision est plafonnée par le plafond du point de contrôle récupéré.

QAH élimine ce plafond en sautant complètement l’enseignant intermédiaire. L’étudiant 4‑bits se distille directement à partir du modèle original de 120B, pré‑compression, en faisant correspondre sa distribution de sortie via une perte de divergence KL sur les logits. Enseignant et étudiant ne partagent ni taille ni précision, ce que les auteurs soulignent comme n’étant pas pertinent: la distribution de sortie d’un enseignant se transfère quel que soit l’architecture de l’étudiant. Dans ce cadre, la quantification cesse d’être une étape de post‑traitement perdante et devient un second passage complet de distillation contre l’enseignant le plus performant disponible, supervision que le point de contrôle bfloat16 n’a jamais reçue.

Ce que les benchmarks montrent

La comparaison principale oppose le modèle 60B MXFP4 traité par QAH à la meilleure version en pleine précision de la même architecture, le point de contrôle bfloat16 de 60B récupéré. Le modèle 4‑bits remporte 7 de 9 benchmarks:

  • AA-LCR (raisonnement à long contexte): 42.7 vs. 35.3, un gain de 7.4 points
  • AIME 2025 (math): 76.3 vs. 70.7, un gain de 5.6 points
  • Aider (agentic coding): 40.9 vs. 38.2
  • τ²-bench (tool use): 61.7 vs. 59.4
  • GPQA Diamond (science): 67.4 vs. 65.7
  • IFBench (instruction following): 59.9 vs. 58.4
  • LiveCodeBench (coding): 66.5 vs. 65.5

Les deux pertes, MMLU-Pro (73.8 vs. 74.0) et SciCode (34.2 vs. 35.6), sont inférieures d’un point et demi. Les gains les plus importants se situent exactement là où la compression cause habituellement le plus de dégâts: le raisonnement à long contexte et les mathématiques.

Face au professeur original de 120B, l’étudiant 4‑bits, fonctionnant avec la moitié du nombre de paramètres de l’enseignant et environ un quart de sa mémoire de poids, le dépasse légèrement sur LiveCodeBench (66.5 vs. 66.0) et se rapproche à 1.6 points sur GPQA Diamond. L’écart restant le plus large est AA‑LCR, où l’enseignant obtient 50.0 contre 42.7 pour l’étudiant, capacité que l’article décrit comme étant intrinsèquement la plus difficile à récupérer après une réduction de capacité.

Plus rapide à entraîner, et il ne s’effondre pas

Une seconde expérience isole la fonction de perte. En quantifiant un modèle GPT-OSS 9B en MXFP4 dans des conditions comparables, QAH et QAT atteignent des scores de pointe pratiquement identiques, 54.9 contre 54.6, moyennés sur MMLU-Pro, LiveCodeBench et GPQA Diamond. Les trajectoires divergent ensuite. QAH atteint son pic en environ 100 étapes d’entraînement, soit environ 7 fois plus rapide que les 700 étapes de QAT, et reste à moins de deux points de ce pic jusqu’à l’étape 1 200. QAT s’effondre après son pic, perdant près de 19 points au même moment.

La conséquence pratique est une différence de risque de déploiement que les auteurs détaillent: un point de contrôle QAT nécessite un arrêt précoce soigneux basé sur un signal de validation, ou une équipe déploie un modèle qui a déjà commencé à se dégrader. Un point de contrôle QAH, lié à une distribution d’enseignant figée, n’a plus de gradient le poussant nulle part une fois qu’il a rattrapé, de sorte qu’un point de contrôle entièrement entraîné peut être servi sans cette surveillance. L’article attribue la différence à la perte elle‑même: un objectif de cross‑entropy continue de pousser indéfiniment vers des étiquettes dures, tandis que la distillation KL contre une cible fixe s’arrête à la convergence.

Les petits caractères

Il s’agit des propres mesures de Multiverse Computing de son propre pipeline, rapportées dans son article et son billet de blog, et non d’une évaluation indépendante. L’article indique que l’étudiant QAH est publié en poids ouvert sous le nom HyperNova-60B, le modèle Apache 2.0 de l’entreprise construit à partir de gpt-oss-120b.

La technique dépend également de l’infrastructure issue des travaux antérieurs de l’entreprise. La guérison à des longueurs de contexte de 32 000 tokens dans le corpus d’entraînement réutilise une perte de divergence KL découpée qui calcule la divergence tranche par tranche de séquence plutôt que de matérialiser la grille complète vocabulaire‑par‑séquence, sujet d’un article compagnon et billet publié le 10 août 2026. Ce travail antérieur a réduit la mémoire maximale pour une distillation de 32 K tokens de 85.2 GiB à 5.45 GiB dans un benchmark isolé, et c’est ce qui permet à la guérison à long contexte de tenir dans un budget GPU fixe. Le nouvel article signale également un écart de qualité reproductible entre les back‑ends d’entraînement distribué comme leçon de déploiement, sans désigner de gagnant dans le résumé du blog.

Pourquoi le résultat se propage

L’arithmétique de l’efficacité est la même que celle qui motive la compression à la base, ce qui rend l’inversion de précision significative. En précision 4‑bits, le modèle QAH utilise environ 4 fois moins de mémoire de poids que l’étudiant bfloat16, et avec la moitié du nombre de paramètres de l’enseignant il réduit d’environ moitié le calcul par token; pour les familles de modèles distribués en bfloat16 plutôt qu’en 4‑bits, la réduction combinée approche 8 fois moins de calcul par token. La gamme de versions actuelles de Multiverse reflète la même philosophie: son point de contrôle Hypernova 60B 2605 est livré avec 32GB de poids contre 65GB pour gpt-oss-120b, l’entreprise déclarant un débit plus élevé sur un seul NVIDIA H200.

Si la méthode s’avère valable au‑delà de ce pipeline, l’implication pour le déploiement en poids ouvert est que la pénalité de précision liée au service en 4‑bits n’est pas une loi naturelle mais un artefact de qui enseigne l’étudiant. Le travail de compression de Multiverse a jusqu’à présent été appliqué aux modèles ouverts d’autres laboratoires, et l’entreprise commercialise la méthode comme une solution qu’une équipe peut déployer sans recherche d’hyperparamètres de plusieurs semaines. Le point de contrôle 4‑bits qui bat son parent 16‑bits sur 7 de 9 benchmarks constitue la preuve qu’ils ont choisi de mettre en avant.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.