AI 모델 및 플랫폼
Multiverse Computing의 4비트 힐링이 풀프리시전 모델을 제치다

Multiverse Computing은 2026년 8월 25일에 모델 배포에서 가장 신뢰받는 트레이드오프 중 하나를 뒤집는 기술을 발표했습니다: 파라미터가 절반으로 압축되고 4비트 양자화된 대형 언어 모델이 원래의 풀프리시전 체크포인트보다 높은 점수를 기록합니다. 이 방법은 Quantization-Aware Healing(QAH)이라고 불리며, 회사 블로그 게시물과 동반 논문에 자세히 설명되어 있으며, OpenAI의 GPT-OSS 120B를 60B 파라미터로 압축하고 MXFP4로 양자화하는 데 적용되었습니다. 결과 4비트 모델은 9개 벤치마크 중 7개에서 자체 bfloat16 원본을 앞서며, 장기 컨텍스트 추론에서 7.4점, 경쟁 수학에서 5.6점의 향상을 보였습니다.
이 결과는 새로운 최첨단 모델에 대한 리더보드 항목이 아닙니다. 이는 압축 파이프라인에서 복구 단계에 관한 주장으로, 축소되고 양자화된 모델이 그 단계에서 파괴된 능력을 되찾기 위해 재학습되는 단계입니다. Multiverse의 주장은 Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs 논문에 제시된 바와 같이, 기존의 표준 복구 방법이 양자화된 모델을 잘못된 교사에 고정시키고, 그 단일 선택을 수정하면 압축 모델이 가질 수 있는 성능 상한을 없앨 수 있다는 것입니다.
교사는 병목 현상이었다
표준 효율적 배포 레시피는 세 단계로 구성됩니다: 레이어, 헤드 또는 뉴런을 제거하여 구조적으로 아키텍처를 압축하고, 남은 가중치를 4비트로 양자화한 뒤, 추가 학습으로 손상을 복구합니다. 주된 복구 방법인 quantization-aware training은 시뮬레이션된 저정밀도 포워드 패스를 통해 작업 데이터에 모델을 미세조정합니다. 대안인 quantization-aware distillation은 양자화된 학생 모델이 고정된 풀프리시전 교사의 출력 분포와 일치하도록 학습합니다.
양자화만이 유일한 변경일 때는 두 방법 모두 작동합니다. 이는 동일 모델의 진정한 풀프리시전 복제본이 존재해 교사가 될 수 있기 때문입니다. 구조적 압축은 이 가정을 깨뜨립니다. 120B에서 절반으로 줄인 60B 모델은 풀프리시전으로 독립 학습된 적이 없으며, 유일한 bfloat16 후보는 원본으로부터 distillation을 통해 복구된 체크포인트입니다. Multiverse는 그 체크포인트에서 4비트 학생을 distill하면 정확도가 해당 복구된 체크포인트의 상한에 제한된다고 주장합니다.
QAH는 중간 교사를 완전히 생략함으로써 상한을 없앱니다. 4비트 학생은 압축 전 120B 원본 모델에서 직접 distill되며, 로짓에 대한 KL-다이버전스 손실을 통해 출력 분포를 맞춥니다. 교사와 학생은 크기와 정밀도 모두 공유하지 않으며, 저자들은 이는 중요하지 않다고 지적합니다: 교사의 출력 분포는 학생의 아키텍처와 무관하게 전달됩니다. 이러한 관점에서 양자화는 손실이 있는 후처리 단계가 아니라 가장 강력한 교사에 대한 두 번째 완전한 distillation 단계가 되며, bfloat16 체크포인트가 한 번도 받지 못한 감독을 제공합니다.
벤치마크가 보여주는 것
주요 비교에서는 QAH 처리된 60B MXFP4 모델을 동일 아키텍처의 최고 풀프리시전 버전인 복구된 60B bfloat16 체크포인트와 비교합니다. 4비트 모델이 9개 벤치마크 중 7개에서 승리합니다:
- AA-LCR (장기 컨텍스트 추론): 42.7 vs. 35.3, 7.4점 상승
- AIME 2025 (수학): 76.3 vs. 70.7, 5.6점 상승
- Aider (에이전트 코딩): 40.9 vs. 38.2
- τ²-bench (툴 사용): 61.7 vs. 59.4
- GPQA Diamond (과학): 67.4 vs. 65.7
- IFBench (명령 따르기): 59.9 vs. 58.4
- LiveCodeBench (코딩): 66.5 vs. 65.5
두 개의 손실 지표인 MMLU-Pro(73.8 vs. 74.0)와 SciCode(34.2 vs. 35.6)는 1.5점 이하 차이로 나타났습니다. 가장 큰 향상은 압축이 보통 가장 큰 손상을 입히는 영역인 장기 컨텍스트 추론과 수학에서 나타났습니다.
원본 120B 교사와 비교했을 때, 4비트 학생은 교사의 파라미터 수의 절반, 메모리 사용량은 약 1/4 수준이지만 LiveCodeBench에서(66.5 vs. 66.0) 교사를 살짝 앞서고, GPQA Diamond에서는 1.6점 차이로 근접합니다. 남은 가장 큰 격차는 AA-LCR으로, 교사는 50.0점, 학생은 42.7점을 기록했으며, 논문에서는 용량이 감소된 후 회복하기 가장 어려운 능력이라고 설명합니다.
학습 속도는 빠르고, 붕괴되지 않는다
두 번째 실험에서는 손실 함수를 고립시켰습니다. 동일 조건에서 GPT-OSS 9B 모델을 MXFP4로 양자화했을 때, QAH와 QAT는 MMLU-Pro, LiveCodeBench, GPQA Diamond를 평균한 결과 54.9 대 54.6으로 실질적으로 동등한 최고 점수를 기록했습니다. 그 이후 경로가 갈라집니다. QAH는 약 100번의 학습 단계에서 정점을 찍으며 QAT의 700단계보다 약 7배 빠르고, 1,200단계까지 정점에서 2점 이내를 유지합니다. 반면 QAT는 정점 이후 붕괴하여 동일 시점에서 거의 19점이 감소합니다.
실질적인 결과는 저자들이 설명한 배포 위험 차이입니다: QAT 체크포인트는 별도 검증 신호에 대한 신중한 조기 중단이 필요하거나, 팀이 이미 성능 저하가 시작된 모델을 배포할 위험이 있습니다. QAH 체크포인트는 고정된 교사 분포에 묶여 있어 일단 따라잡으면 더 이상 그래디언트가 작용하지 않으므로 완전 학습된 체크포인트를 별도 감시 없이 제공할 수 있습니다. 논문은 이 차이를 손실 자체에 돌립니다: 교차 엔트로피 목표는 하드 라벨을 무한히 추구하는 반면, 고정된 목표에 대한 KL distillation은 수렴 시 멈춥니다.
세부 사항
이 수치는 Multiverse Computing이 자체 파이프라인에 대해 자체적으로 측정한 것이며, 논문과 블로그 게시물에 보고된 것이지 독립적인 평가가 아닙니다. 논문에 따르면 QAH 학생 모델은 HyperNova-60B라는 이름으로 오픈 웨이트 형태로 공개되며, 이는 gpt-oss-120b를 기반으로 만든 회사의 Apache 2.0 모델입니다.
이 기술은 회사의 이전 작업에서 사용된 메커니즘에도 의존합니다. 훈련 코퍼스에서 32,000 토큰 컨텍스트 길이에서의 힐링은 전체 어휘-시퀀스 그리드를 실현하지 않고 시퀀스 조각별로 다이버전스를 계산하는 청크형 KL-다이버전스 손실을 재사용하는데, 이는 2026년 8월 10일에 발표된 동반 논문 및 포스트의 주제입니다. 해당 이전 작업은 32K 토큰 distillation의 피크 메모리를 85.2 GiB에서 5.45 GiB로 감소시켰으며, 이는 장기 컨텍스트 힐링을 고정된 GPU 예산 내에 맞출 수 있게 합니다. 새로운 논문은 또한 분산 학습 백엔드 간 재현 가능한 품질 격차를 배포 교훈으로 지적하지만, 블로그 요약에서는 승자를 명시하지 않았습니다.
왜 이 결과가 확산되는가
효율성 계산은 압축을 처음 동기화하게 만든 동일한 계산이며, 이는 정확도 역전이 의미를 갖게 합니다. 4비트 정밀도에서 QAH 모델은 bfloat16 학생에 비해 약 4배 적은 가중치 메모리를 사용하고, 교사의 파라미터 수의 절반이므로 토큰당 연산량도 대략 절반이 됩니다; bfloat16 대신 4비트로 제공되는 모델군에서는 이 두 효과가 합쳐져 토큰당 연산량이 약 8배 감소합니다. Multiverse의 현재 릴리스 라인은 동일한 철학을 반영합니다: Hypernova 60B 2605 체크포인트는 gpt-oss-120b의 65 GB에 비해 32 GB의 가중치만을 사용하며, 회사는 단일 NVIDIA H200에서 더 높은 처리량을 보고했습니다.
이 레시피가 파이프라인을 넘어 적용될 경우, 오픈 웨이트 배포에 대한 의미는 4비트 서빙에서의 정확도 비용이 자연법칙이 아니라 학생을 가르치는 교사의 선택에 따른 부수 현상이라는 것입니다. Multiverse의 압축 작업은 지금까지 다른 연구소의 오픈 모델에 적용되었으며, 회사는 다주간 하이퍼파라미터 탐색 없이 팀이 배포할 수 있는 레시피를 판매하고 있습니다. 9개 벤치마크 중 7개에서 16비트 원본을 앞선 4비트 체크포인트가 바로 그들이 앞세운 증거입니다.












