Modelos y plataformas de IA

La curación de 4 bits de Multiverse Computing supera al modelo de precisión completa

mm
Añade Unite.AI a tus fuentes preferidas en Google

Multiverse Computing publicó una técnica el 25 de agosto de 2026 que invierte una de las compensaciones más fiables en la implementación de modelos: un modelo de lenguaje grande comprimido a la mitad de sus parámetros y cuantizado a 4 bits que obtiene una puntuación superior al checkpoint de precisión completa del que se derivó. El método, llamado Curación Consciente de la Cuantización (QAH, por sus siglas en inglés), se detalla en una publicación del blog de la empresa y un artículo complementario, y se aplicó al GPT‑OSS 120B de OpenAI comprimido a 60 B de parámetros y cuantizado a MXFP4. El modelo de 4 bits resultante supera a su fuente bfloat16 en 7 de 9 benchmarks, incluyendo ganancias de 7,4 puntos en razonamiento de contexto largo y 5,6 puntos en matemáticas de competición.

El resultado no es una entrada de tabla de líderes para un modelo de frontera nuevo. Es una afirmación sobre la fase de recuperación en los pipelines de compresión, la etapa en la que un modelo que ha sido reducido y cuantizado se vuelve a entrenar para recuperar la capacidad que esos pasos destruyeron. El argumento de Multiverse, expuesto en el artículo Curación Consciente de la Cuantización: una receta práctica para recuperar LLMs comprimidos de 4 bits, sostiene que los métodos de recuperación estándar del campo anclan el modelo cuantizado al docente equivocado, y que corregir esa única elección elimina el techo sobre cuán bueno puede ser un modelo comprimido.

El docente era el cuello de botella

La receta estándar de despliegue eficiente tiene tres etapas: comprimir estructuralmente la arquitectura eliminando capas, cabezas o neuronas; cuantizar los pesos restantes a 4 bits; y luego curar el daño con entrenamiento adicional. El método dominante de curación, el entrenamiento consciente de la cuantización, continúa afinando el modelo con datos de la tarea mediante una pasada simulada de baja precisión. Una alternativa, la destilación consciente de la cuantización, entrena al estudiante cuantizado para que coincida con la distribución de salida de un docente de precisión completa congelado.

Ambos funcionan cuando la cuantización es el único cambio, porque existe una copia de precisión completa del mismo modelo que sirve de docente. La compresión estructural rompe esa suposición. Un modelo de 60 B recortado de 120 B nunca se entrenó de forma independiente en precisión completa; el único candidato bfloat16 es un checkpoint que fue recuperado mediante destilación del original. Destilar al estudiante de 4 bits a partir de ese checkpoint, argumenta Multiverse, limita su exactitud al techo propio del checkpoint recuperado.

QAH elimina el techo al omitir por completo al docente intermedio. El estudiante de 4 bits se destila directamente del modelo original de 120 B previo a la compresión, igualando su distribución de salida mediante una pérdida de divergencia KL sobre los logits. El docente y el estudiante no comparten ni tamaño ni precisión, lo que los autores señalan que no importa: la distribución de salida de un docente se transfiere sin importar la arquitectura del estudiante. Bajo este enfoque, la cuantización deja de ser un paso de post‑procesamiento con pérdida y se convierte en una segunda pasada completa de destilación contra el docente más fuerte disponible, supervisión que el checkpoint bfloat16 nunca recibió.

Lo que muestran los benchmarks

La comparación principal enfrenta al modelo MXFP4 de 60 B tratado con QAH contra la mejor versión de precisión completa de la misma arquitectura, el checkpoint bfloat16 de 60 B recuperado. El modelo de 4 bits gana en 7 de 9 benchmarks:

  • AA‑LCR (razonamiento de contexto largo): 42,7 frente a 35,3, una ganancia de 7,4 puntos
  • AIME 2025 (matemáticas): 76,3 frente a 70,7, una ganancia de 5,6 puntos
  • Aider (codificación agente): 40,9 frente a 38,2
  • τ²‑bench (uso de herramientas): 61,7 frente a 59,4
  • GPQA Diamond (ciencia): 67,4 frente a 65,7
  • IFBench (seguimiento de instrucciones): 59,9 frente a 58,4
  • LiveCodeBench (codificación): 66,5 frente a 65,5

Las dos pérdidas, MMLU‑Pro (73,8 frente a 74,0) y SciCode (34,2 frente a 35,6), están por debajo de un punto y medio. Las mayores ganancias se sitúan exactamente donde la compresión suele causar más daño: razonamiento de contexto largo y matemáticas.

Contra el docente original de 120 B, el estudiante de 4 bits, que opera con la mitad del número de parámetros del docente y aproximadamente una cuarta parte de su memoria de pesos, lo supera en LiveCodeBench (66,5 frente a 66,0) y se queda a 1,6 puntos de GPQA Diamond. La mayor brecha restante es AA‑LCR, donde el docente obtiene 50,0 frente a los 42,7 del estudiante, capacidad que el artículo describe como intrínsecamente la más difícil de recuperar después de reducir la capacidad.

Más rápido de entrenar y no colapsa

Un segundo experimento aísla la función de pérdida. Cuantizando un modelo GPT‑OSS de 9 B a MXFP4 bajo condiciones equiparables, QAH y QAT alcanzan puntuaciones pico prácticamente iguales, 54,9 frente a 54,6, promediadas en MMLU‑Pro, LiveCodeBench y GPQA Diamond. A partir de ahí los caminos divergen. QAH alcanza su pico en aproximadamente 100 pasos de entrenamiento, unas 7 veces más rápido que los 700 pasos de QAT, y se mantiene dentro de dos puntos de ese pico hasta el paso 1 200. QAT colapsa después de su pico, perdiendo casi 19 puntos al mismo marcador.

La consecuencia práctica es una diferencia de riesgo de despliegue que los autores explican: un checkpoint QAT necesita una parada temprana cuidadosa contra una señal retenida, o un equipo lanza un modelo que ya ha empezado a degradarse. Un checkpoint QAH, anclado a una distribución docente congelada, no tiene gradiente que lo empuje en ninguna dirección una vez que se pone al nivel, de modo que un checkpoint completamente entrenado puede servirse sin esa vigilancia. El artículo atribuye la diferencia a la propia pérdida: un objetivo de entropía cruzada sigue empujando indefinidamente hacia etiquetas duras, mientras que la destilación KL contra un objetivo fijo se silencia al converger.

Los detalles

Estas son las propias mediciones de Multiverse Computing de su pipeline, reportadas en su artículo y publicación del blog, no una evaluación independiente. El artículo indica que el estudiante QAH se libera como HyperNova‑60B, el modelo Apache 2.0 de la compañía construido a partir de gpt‑oss‑120b.

La técnica también depende de la maquinaria del trabajo anterior de la empresa. Curar en longitudes de contexto de 32 000 tokens en el corpus de entrenamiento reutiliza una pérdida de divergencia KL fragmentada que calcula la divergencia una porción de secuencia a la vez en lugar de materializar la cuadrícula completa vocabulario‑por‑secuencia, tema de un artículo y publicación complementarios publicados el 10 de agosto de 2026. Ese trabajo previo redujo la memoria máxima para una destilación de 32 K tokens de 85,2 GiB a 5,45 GiB en un benchmark aislado, y es lo que permite que la curación de contexto largo quepa dentro de un presupuesto fijo de GPU. El nuevo artículo también señala una brecha de calidad reproducible entre backends de entrenamiento distribuido como lección de despliegue, sin nombrar un ganador en el resumen del blog.

Por qué el resultado se difunde

La aritmética de eficiencia es la misma que motiva la compresión en primer lugar, y es lo que hace que una inversión de exactitud sea relevante. Con precisión de 4 bits, el modelo QAH usa aproximadamente 4 veces menos memoria de pesos que el estudiante bfloat16, y con la mitad del número de parámetros del docente reduce a la mitad el cómputo por token; para familias de modelos que se distribuyen en bfloat16 en lugar de 4 bits, la reducción combinada se acerca a 8 veces menos cómputo por token. La línea de lanzamiento actual de Multiverse refleja la misma filosofía: su checkpoint Hypernova 60B 2605 se entrega con 32 GB de pesos frente a 65 GB para gpt‑oss‑120b, y la compañía informa mayor rendimiento en una única NVIDIA H200.

Si la receta se mantiene más allá de este pipeline, la implicación para el despliegue de peso abierto es que el impuesto de exactitud al servir en 4 bits no es una ley de la naturaleza sino un artefacto de quién enseña al estudiante. El trabajo de compresión de Multiverse hasta ahora se ha aplicado a modelos abiertos de otros laboratorios, y la empresa está vendiendo la receta como algo que un equipo puede desplegar sin una búsqueda de hiperparámetros de varias semanas. El checkpoint de 4 bits que supera a su progenitor de 16 bits en 7 de 9 benchmarks es la evidencia con la que decidió liderar.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.