AIモデルとプラットフォーム
Multiverse Computing の 4 ビットヒーリングがフル精度モデルを上回る

Multiverse Computing は 2026 年 8 月 25 日に、モデル展開における最も信頼性の高いトレードオフの一つを逆転させる手法を発表しました。パラメータ数を半分に圧縮し、4 ビットに量子化した大規模言語モデルが、元となったフル精度チェックポイントよりも高いスコアを記録します。この手法は Quantization‑Aware Healing(QAH)と呼ばれ、会社ブログ記事 と同行論文で詳述されており、OpenAI の GPT‑OSS 120B を 60B パラメータに圧縮し MXFP4 に量子化したものに適用されました。得られた 4 ビットモデルは、9 つのベンチマークのうち 7 つで元の bfloat16 ソースを上回り、長文コンテキスト推論で 7.4 ポイント、競技数学で 5.6 ポイントの向上を示しました。
この結果は新しいフロンティアモデルのリーダーボードエントリーではありません。圧縮パイプラインにおけるリカバリ段階、すなわち縮小・量子化されたモデルが失われた能力を取り戻すために再学習される段階に関する主張です。Multiverse の論文 Quantization‑Aware Healing: A Practical Recipe for Recovering Compressed, 4‑Bit LLMs では、従来のリカバリ手法が量子化モデルを誤った教師に固定していることが、圧縮モデルの性能上限を生む原因であると指摘しています。
教師がボトルネックだった
標準的な効率的展開レシピは 3 段階で構成されます。アーキテクチャを層・ヘッド・ニューロン単位で構造的に圧縮し、残存する重みを 4 ビットに量子化し、最後にさらなる学習でダメージを回復させます。支配的な回復手法である量子化認識トレーニングは、シミュレートされた低精度フォワードパスを通じてタスクデータ上でファインチューニングを続けます。一方、量子化認識蒸留は、量子化された学生モデルが凍結されたフル精度教師の出力分布に合わせるように学習させます。
量子化が唯一の変更である場合は両者とも機能します。なぜなら、同一モデルのフル精度コピーが教師として存在するからです。構造的圧縮はこの前提を崩します。120B から圧縮された 60B モデルは、フル精度で独立に学習されたことがなく、唯一の bfloat16 候補は元モデルから蒸留されたチェックポイントです。そのチェックポイントから 4 ビット学生を蒸留すると、Multiverse はその精度が回復されたチェックポイントの上限に抑えられると主張します。
QAH は中間教師を完全に省くことで上限を取り除きます。4 ビット学生は、圧縮前のオリジナル 120B モデルから直接蒸留され、ロジット上の KL ダイバージェンス損失で出力分布を合わせます。教師と学生はサイズも精度も共有せず、著者らは「教師の出力分布は学生のアーキテクチャに関係なく転送できる」ことを指摘しています。この枠組みでは、量子化はロスのある後処理ステップではなく、最強教師に対する第二の蒸留パスとなり、bfloat16 チェックポイントが受けていなかった監督を提供します。
ベンチマークが示すもの
見出し比較では、QAH 処理された 60B MXFP4 モデルと同一アーキテクチャの最高フル精度版である回復済み 60B bfloat16 チェックポイントが対決します。4 ビットモデルは 9 つのベンチマークのうち 7 つで勝利します:
- AA‑LCR(長文コンテキスト推論):42.7 対 35.3、7.4 ポイントの上昇
- AIME 2025(数学):76.3 対 70.7、5.6 ポイントの上昇
- Aider(エージェントコーディング):40.9 対 38.2
- τ²‑bench(ツール使用):61.7 対 59.4
- GPQA Diamond(科学):67.4 対 65.7
- IFBench(指示遵守):59.9 対 58.4
- LiveCodeBench(コーディング):66.5 対 65.5
敗北は MMLU‑Pro(73.8 対 74.0)と SciCode(34.2 対 35.6)で、いずれも 1.5 点未満の差です。最大の伸びは、圧縮が最もダメージを与えるとされる長文コンテキスト推論と数学で確認されました。
元の 120B 教師と比較すると、4 ビット学生は教師のパラメータ数の半分、重みメモリの約 1/4 でありながら、LiveCodeBench(66.5 対 66.0)で僅かに上回り、GPQA Diamond でも 1.6 ポイント差に迫ります。残る最大のギャップは AA‑LCR で、教師は 50.0、学生は 42.7 と、論文が「容量削減後に回復が最も困難」だと述べる領域です。
学習が速く、崩壊しない理由
第 2 の実験では損失関数だけを切り離しています。条件を揃えて GPT‑OSS 9B を MXFP4 に量子化した場合、QAH と QAT は実質的に同等のピークスコア(54.9 対 54.6)を示します(MMLU‑Pro、LiveCodeBench、GPQA Diamond の平均)。そこから経路が分かれます。QAH は約 100 ステップでピークに到達し、QAT の 700 ステップの約 7 倍の速度で収束し、ステップ 1,200 までピークから 2 ポイント以内に維持します。一方 QAT はピークを超えると急激に劣化し、同時点で約 19 ポイントもスコアを失います。
実務的な影響は、著者らが指摘するデプロイリスクの違いです。QAT のチェックポイントは早期停止を慎重に行う必要があるのに対し、QAH のチェックポイントは凍結された教師分布に固定されているため、追いついた後に勾配が働かず、完全に学習された状態でそのまま提供できます。論文はこの差を損失関数自体に帰しています。クロスエントロピーはハードラベルへ無限にプッシュし続けるのに対し、固定ターゲットへの KL 蒸留は収束時に静止します。
細部の注意点
これらは Multiverse Computing が自らのパイプラインで測定した結果であり、論文とブログ記事に記載されたもので、独立した評価ではありません。論文では QAH 学生が HyperNova‑60B としてオープンウェイトで公開されていると述べられています。これは同社が Apache 2.0 ライセンスで提供する、gpt‑oss‑120b から構築されたモデルです。
この手法は同社の過去の研究にも依存しています。トレーニングコーパスの 32,000 トークンコンテキスト長でのヒーリングは、シーケンススライスごとにダイバージェンスを計算し、語彙‑シーケンス全体のグリッドを実体化しないチャンク化 KL ダイバージェンス損失を再利用しています。この手法は 同行論文と投稿(2026 年 8 月 10 日)で紹介され、32K トークン蒸留のピークメモリを 85.2 GiB から 5.45 GiB に削減したことがベンチマークで示されています。これにより長文コンテキストのヒーリングが固定 GPU 予算内で可能になっています。新しい論文は、分散学習バックエンド間の再現可能な品質差をデプロイ上の教訓として指摘していますが、ブログ要約ではどちらが優れているかは明言していません。
結果が広がる理由
効率性の算術は、圧縮を最初に動機付けた算術と同じであり、精度の逆転が意味を持つ根拠です。4 ビット精度の QAH モデルは bfloat16 学生に比べて約 4 倍少ない重みメモリを使用し、教師のパラメータ数の半分でトークンあたりの計算量もほぼ半減します。bfloat16 で提供されるモデルファミリーに対し 4 ビットで提供すると、トークンあたりの計算量は最大で約 8 倍削減されます。Multiverse の現在のリリースラインは同様の哲学を反映しており、Hypernova 60B 2605 チェックポイント は重みが 32 GB、gpt‑oss‑120b は 65 GB で、同社は単一 NVIDIA H200 上でのスループットが向上したと報告しています。
このレシピがパイプラインを超えて有効であるなら、オープンウェイトでのデプロイにおける 4 ビット提供時の精度負担は自然法則ではなく、誰が学生を教えるかという選択の産物であることを示唆します。Multiverse の圧縮技術はこれまで他の研究所のオープンモデルにも適用されており、同社はマルチウィークのハイパーパラメータ探索を必要とせずにチームが展開できるレシピとして販売しています。9 つのベンチマークのうち 7 つで 16 ビット親モデルを上回った 4 ビットチェックポイントは、同社が選んだ証拠です。












