Модели и платформы ИИ

4‑битовое исцеление от Multiverse Computing опережает модель полной точности

mm
Добавьте Unite.AI в избранные источники в Google

Multiverse Computing опубликовала методику 25 августа 2026 года, который меняет один из самых надёжных компромиссов в развертывании моделей: крупная языковая модель, сжатая до половины количества параметров и квантизированная до 4 бит, показывает более высокий результат, чем исходный чекпоинт полной точности, из которого она была построена. Метод, названный Quantization‑Aware Healing (QAH), подробно описан в сообщении в блоге компании и сопутствующей статье, и был применён к GPT‑OSS 120B от OpenAI, сжатой до 60 B параметров и квантизированной до MXFP4. Получившаяся 4‑битовая модель обыгрывает свой собственный bfloat16‑источник в 7 из 9 тестов, включая прирост в 7,4 балла в задаче длительного контекстного рассуждения и 5,6 балла в математических конкурсах.

Это не запись в таблице лидеров новой передовой модели. Это утверждение о этапе восстановления в конвейерах сжатия, когда модель, уже уменьшенную и квантизированную, переобучается, чтобы вернуть возможности, утраченные этими шагами. Аргумент Multiverse, изложенный в статье Quantization‑Aware Healing: A Practical Recipe for Recovering Compressed, 4‑Bit LLMs, состоит в том, что стандартные методы восстановления привязывают квантизированную модель к неверному учителю, и что исправление этого единственного выбора снимает потолок качества сжатой модели.

Учитель был узким местом

Стандартный рецепт эффективного развертывания состоит из трёх этапов: структурное сжатие архитектуры путём удаления слоёв, голов или нейронов; квантизация оставшихся весов до 4 бит; затем «исцеление» повреждений дальнейшим обучением. Доминирующий метод исцеления — обучение с учётом квантизации (quantization‑aware training) — продолжает дообучать модель на задачных данных через имитацию низкоточной прямой передачи. Альтернатива, дистилляция с учётом квантизации, обучает квантизированного студента подгонять распределение выходов замороженного учителя полной точности.

Оба подхода работают, когда квантизация — единственное изменение, поскольку существует подлинная копия полной точности той же модели, от которой можно учиться. Структурное сжатие разрушает это предположение. Модель в 60 B, полученная из 120 B, никогда не обучалась независимо в полной точности; единственный кандидат bfloat16 — это чекпоинт, который сам был восстановлен дистилляцией из оригинала. По мнению Multiverse, дистилляция 4‑битового студента из этого чекпоинта ограничивает его точность потолком восстановленного чекпоинта.

QAH снимает этот потолок, полностью исключив промежуточного учителя. 4‑битовый студент дистиллируется напрямую от оригинальной, предсжатой модели 120 B, подгоняя её распределение выходов через KL‑дивергенцию по логитам. Учитель и студент не совпадают ни по размеру, ни по точности, что, по словам авторов, не имеет значения: распределение выходов учителя передаётся независимо от архитектуры студента. В таком представлении квантизация перестаёт быть потерянным постобработкой и превращается во второй полный проход дистилляции против самого сильного доступного учителя, надзор, который чекпоинт bfloat16 никогда не получал.

Что показывают тесты

Главное сравнение ставит модель QAH‑обработанную 60 B MXFP4 против лучшей полной‑точной версии той же архитектуры, восстановленного чекпоинта 60 B bfloat16. 4‑битовая модель выигрывает в 7 из 9 тестов:

  • AA‑LCR (длинный контекст): 42,7 против 35,3, прирост 7,4 балла
  • AIME 2025 (математика): 76,3 против 70,7, прирост 5,6 балла
  • Aider (агентное программирование): 40,9 против 38,2
  • τ²‑bench (использование инструментов): 61,7 против 59,4
  • GPQA Diamond (наука): 67,4 против 65,7
  • IFBench (следование инструкциям): 59,9 против 58,4
  • LiveCodeBench (программирование): 66,5 против 65,5

Два падения — MMLU‑Pro (73,8 против 74,0) и SciCode (34,2 против 35,6) — составляют менее полутора баллов. Наибольшие приросты приходятся именно на те задачи, где сжатие обычно наносит самый большой урон: длинный контекст и математика.

Против оригинального учителя в 120 B 4‑битовый студент, использующий вдвое меньше параметров учителя и примерно в четверть меньше памяти под веса, обгоняет его в LiveCodeBench (66,5 против 66,0) и отстаёт лишь на 1,6 балла в GPQA Diamond. Самый большой оставшийся разрыв — в AA‑LCR, где учитель набирает 50,0, а студент 42,7; именно эту способность, по статье, считается самой сложной для восстановления после сокращения ёмкости.

Быстрее обучается и не рушится

Во втором эксперименте изолируется функция потерь. Квантизируя модель GPT‑OSS 9 B до MXFP4 при сопоставимых условиях, QAH и QAT достигают практически одинаковых пиковых результатов: 54,9 против 54,6 в среднем по MMLU‑Pro, LiveCodeBench и GPQA Diamond. Дальше пути расходятся. QAH достигает пика примерно за 100 шагов обучения, что в 7 раз быстрее, чем 700 шагов у QAT, и остаётся в пределах двух баллов от этого пика до шага 1 200. QAT же падает после пика, теряя почти 19 баллов к тому же моменту.

Практический вывод — разница в риске развертывания, которую авторы формулируют так: чекпоинт QAT требует тщательной ранней остановки по отложенному сигналу, иначе команда выпускает модель, уже начинающую деградировать. Чекпоинт QAH, привязанный к замороженному распределению учителя, больше не получает градиент, толкающий его куда‑либо после того, как догонит учителя, поэтому полностью обученный чекпоинт можно обслуживать без дополнительного контроля. Авторы объясняют различие самой функцией потерь: кросс‑энтропийная цель продолжает подгонять модель к жёстким меткам бесконечно, тогда как KL‑дистилляция к фиксированной цели замолкает при сходимости.

Мелкие детали

Это измерения Multiverse Computing собственной конвейерной системы, представленные в их статье и блоге, а не независимая оценка. В статье указано, что студент QAH выпускается как открытый вес под названием HyperNova‑60B, модель компании по лицензии Apache 2.0, построенная из gpt‑oss‑120b.

Техника также опирается на инструменты из более ранних работ компании. Исцеление при контекстных длинах в 32 000 токенов в обучающем корпусе переиспользует кусочный KL‑дивергенционный лосс, который вычисляет дивергенцию по одной последовательности за раз, а не материализует полную матрицу «словарь‑по‑последовательности». Об этом говорится в сопутствующей статье и посте, опубликованных 10 августа 2026 года. Эта работа сократила пиковую память для дистилляции 32K‑токенов с 85,2 GiB до 5,45 GiB в изолированном бенчмарке, и именно это делает исцеление длительного контекста возможным в рамках фиксированного GPU‑бюджета. Новая статья также отмечает воспроизводимый разрыв качества между распределёнными бекэндами обучения как урок для развертывания, не указывая победителя в блоге.

Почему результат имеет значение

Арифметика эффективности — это та же арифметика, которая изначально мотивирует сжатие, и именно она делает инверсию точности значимой. При 4‑битовой точности модель QAH использует примерно в 4 раза меньше памяти под веса, чем студент bfloat16, а при половине количества параметров учителя почти вдвое сокращает вычисления на токен; для семейств моделей, которые поставляются в bfloat16, а не в 4 бит, суммарное сокращение приближается к 8‑кратному уменьшению вычислений на токен. Текущая линейка выпусков Multiverse отражает ту же философию: её чекпоинт Hypernova 60B 2605 занимает 32 GB весов против 65 GB у gpt‑oss‑120b, при этом компания сообщает о более высокой пропускной способности на одной NVIDIA H200.

Если рецепт работает и за пределами этого конвейера, то для открытого развертывания это означает, что налог на точность при 4‑битовом обслуживании не является законом природы, а следствием того, кто обучает студента. Сжатие Multiverse до сих пор применялось к открытым моделям других лабораторий, и компания продаёт рецепт как решение, которое команда может внедрить без многонедельного подбора гиперпараметров. 4‑битовый чекпоинт, обгоняющий своего 16‑битового предка в 7 из 9 тестов, служит доказательством, выбранным ими в качестве главного аргумента.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.