โมเดลและแพลตฟอร์ม AI
การบำบัด 4 บิตของ Multiverse Computing แซงโมเดลความแม่นยำเต็มรูปแบบ

Multiverse Computing เผยเทคนิคเมื่อวันที่ 25 สิงหาคม 2026 ที่พลิกกลับหนึ่งในการแลกเปลี่ยนที่เชื่อถือได้ที่สุดในการปรับใช้โมเดล: โมเดลภาษาขนาดใหญ่ที่ถูกบีบอัดให้มีพารามิเตอร์ครึ่งหนึ่งและควอนตาไลซ์เป็น 4 บิตซึ่งให้คะแนนสูงกว่าชุดตรวจสอบความแม่นยำเต็มรูปแบบที่สร้างขึ้นจากมัน วิธีการนี้เรียกว่า Quantization-Aware Healing (QAH) ซึ่งอธิบายรายละเอียดใน โพสต์บล็อกของบริษัท และเอกสารแนบ และได้ถูกนำไปใช้กับ GPT-OSS 120B ของ OpenAI ที่ถูกบีบอัดลงเป็น 60B พารามิเตอร์และควอนตาไลซ์เป็น MXFP4 โมเดล 4‑บิตที่ได้เหนือกแหล่งข้อมูล bfloat16 ของมันเองใน 7 จาก 9 เกณฑ์ประเมิน รวมถึงการเพิ่มขึ้น 7.4 คะแนนในการให้เหตุผลบริบทยาวและ 5.6 คะแนนในคณิตศาสตร์การแข่งขัน
ผลลัพธ์นี้ไม่ใช่รายการบนกระดานผู้นำสำหรับโมเดลแนวหน้าใหม่ แต่เป็นการอ้างอิงถึงขั้นตอนการกู้คืนในสายงานบีบอัด ซึ่งเป็นขั้นตอนที่โมเดลที่ถูกย่อขนาดและควอนตาไลซ์ได้รับการฝึกใหม่เพื่อดึงคืนความสามารถที่ขั้นตอนเหล่านั้นทำลายไป ข้อโต้แย้งของ Multiverse ซึ่งอธิบายไว้ในเอกสาร Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs คือ วิธีการกู้คืนมาตรฐานในวงการยึดโมเดลที่ควอนตาไลซ์กับครูที่ไม่ถูกต้อง และการแก้ไขการเลือกเดียวนี้จะขจัดขีดจำกัดของความดีของโมเดลที่บีบอัด
ครูเป็นคอขวด
สูตรการปรับใช้ที่มีประสิทธิภาพมาตรฐานประกอบด้วยสามขั้นตอน: บีบอัดสถาปัตยกรรมโดยการลบเลเยอร์, หัว, หรือประสาท; ควอนตาไลซ์น้ำหนักที่เหลือเป็น 4 บิต; แล้วทำการบำบัดความเสียหายด้วยการฝึกต่อ วิธีบำบัดที่โดดเด่นคือการฝึกแบบ Quantization-Aware Training ที่ทำการปรับจูนโมเดลต่อบนข้อมูลงานผ่านการส่งผ่านแบบจำลองความแม่นยำต่ำที่จำลองขึ้น ทางเลือกอื่นคือ Quantization-Aware Distillation ซึ่งฝึกนักเรียนที่ควอนตาไลซ์ให้ตรงกับการกระจายผลลัพธ์ของครูเต็มรูปแบบที่ถูกแช่แข็ง
ทั้งสองวิธีทำงานได้เมื่อการควอนตาไลซ์เป็นการเปลี่ยนแปลงเดียว เนื่องจากมีสำเนาเต็มรูปแบบที่แท้จริงของโมเดลเดียวกันเพื่อใช้เป็นครู การบีบอัดเชิงโครงสร้างทำลายสมมติฐานนี้ โมเดล 60B ที่ถูกตัดจาก 120B ไม่เคยได้รับการฝึกแยกที่ความแม่นยำเต็มรูปแบบ; ตัวเลือก bfloat16 เพียงตัวเดียวคือชุดตรวจสอบที่ได้รับการกู้คืนโดยการทำ distillation จากต้นฉบับ การทำ distillation นักเรียน 4‑บิตจากชุดตรวจสอบนั้นตามที่ Multiverse กล่าว จะจำกัดความแม่นยำของมันที่ขีดจำกัดของชุดตรวจสอบที่กู้คืน
QAH ขจัดขีดจำกัดโดยข้ามครูระดับกลางโดยสิ้นเชิง นักเรียน 4‑บิตทำการ distill โดยตรงจากโมเดล 120B ดั้งเดิมก่อนการบีบอัด โดยทำให้การกระจายผลลัพธ์ตรงกันผ่านการสูญเสีย KL‑divergence บน logits ครูและนักเรียนไม่มีขนาดหรือความแม่นยำที่เหมือนกัน ซึ่งผู้เขียนระบุว่าไม่สำคัญ: การกระจายผลลัพธ์ของครูจะถ่ายทอดไม่ว่าสถาปัตยกรรมของนักเรียนจะเป็นอย่างไร ภายใต้กรอบนี้ การควอนตาไลซ์หยุดเป็นขั้นตอนการประมวลผลหลังที่สูญเสียข้อมูลและกลายเป็นการทำ distillation รอบที่สองเต็มรูปแบบต่อครูที่แข็งแกร่งที่สุดที่มีอยู่ การกำกับดูแลที่ชุดตรวจสอบ bfloat16 เองไม่เคยได้รับ
สิ่งที่เกณฑ์ประเมินแสดง
การเปรียบเทียบหลักนำโมเดล 60B MXFP4 ที่ผ่านการรักษาด้วย QAH มาเทียบกับรุ่นเต็มรูปแบบที่ดีที่สุดของสถาปัตยกรรมเดียวกัน คือชุดตรวจสอบ bfloat16 60B ที่กู้คืน โมเดล 4‑บิตชนะ 7 จาก 9 เกณฑ์ประเมิน:
- AA-LCR (การให้เหตุผลบริบทยาว): 42.7 เทียบกับ 35.3, เพิ่มขึ้น 7.4 คะแนน
- AIME 2025 (คณิตศาสตร์): 76.3 เทียบกับ 70.7, เพิ่มขึ้น 5.6 คะแนน
- Aider (การเขียนโค้ดแบบเอเจนต์): 40.9 เทียบกับ 38.2
- τ²-bench (การใช้เครื่องมือ): 61.7 เทียบกับ 59.4
- GPQA Diamond (วิทยาศาสตร์): 67.4 เทียบกับ 65.7
- IFBench (การปฏิบัติตามคำสั่ง): 59.9 เทียบกับ 58.4
- LiveCodeBench (การเขียนโค้ด): 66.5 เทียบกับ 65.5
สองคะแนนที่ต่ำกว่า คือ MMLU-Pro (73.8 เทียบกับ 74.0) และ SciCode (34.2 เทียบกับ 35.6) อยู่ห่างกันน้อยกว่าหนึ่งคะแนนครึ่ง ส่วนการเพิ่มขึ้นที่มากที่สุดอยู่ที่จุดที่การบีบอัดมักทำความเสียหายมากที่สุด: การให้เหตุผลบริบทยาวและคณิตศาสตร์
เมื่อเทียบกับครู 120B ดั้งเดิม นักเรียน 4‑บิตที่ทำงานด้วยจำนวนพารามิเตอร์ครึ่งหนึ่งของครูและใช้หน่วยความจำน้ำหนักประมาณหนึ่งในสี่ของครู แซงครูใน LiveCodeBench (66.5 เทียบกับ 66.0) และห่างเพียง 1.6 คะแนนใน GPQA Diamond ช่องว่างที่กว้างที่สุดที่เหลือคือ AA‑LCR ซึ่งครูได้คะแนน 50.0 เทียบกับนักเรียน 42.7 ความสามารถนี้ตามที่เอกสารอธิบายว่าเป็นสิ่งที่ยากที่สุดในการกู้คืนหลังจากที่ความจุถูกลดลง
ฝึกเร็วขึ้นและไม่ล่ม
การทดลองที่สองแยกฟังก์ชันการสูญเสียออกมา การควอนตาไลซ์โมเดล GPT-OSS 9B ให้เป็น MXFP4 ภายใต้เงื่อนไขที่เท่าเทียม QAH และ QAT ได้คะแนนสูงสุดที่เกือบเท่ากัน คือ 54.9 เทียบกับ 54.6 เมื่อเฉลี่ยจาก MMLU‑Pro, LiveCodeBench, และ GPQA Diamond จากนั้นเส้นทางจะแยกออก QAH ถึงจุดสูงสุดประมาณ 100 ขั้นตอนการฝึก ซึ่งเร็วกว่า QAT ที่ต้องใช้ 700 ขั้นตอนประมาณ 7 เท่า และคงระดับใกล้เคียงภายในสองคะแนนของจุดสูงสุดนั้นจนถึงขั้นตอนที่ 1,200 ส่วน QAT ล่มหลังจากจุดสูงสุดโดยสูญเสียเกือบ 19 คะแนนที่จุดเดียวกัน
ผลที่ตามมาทางปฏิบัติคือความเสี่ยงต่อการปรับใช้ที่ผู้เขียนอธิบายไว้: ชุดตรวจสอบ QAT ต้องการการหยุดต้นแบบอย่างระมัดระวังต่อสัญญาณที่เก็บไว้ หรือทีมอาจปล่อยโมเดลที่เริ่มเสื่อมสภาพแล้ว ชุดตรวจสอบ QAH ที่เชื่อมโยงกับการกระจายของครูที่แช่แข็งไม่มีการไล่เกรเดียนต์ใด ๆ หลังจากที่ตามทันแล้ว ดังนั้นชุดตรวจสอบที่ฝึกเต็มที่สามารถให้บริการได้โดยไม่ต้องเฝ้าติดตาม เอกสารอธิบายความแตกต่างนี้ว่าเกิดจากฟังก์ชันการสูญเสียเอง: วัตถุประสงค์ cross‑entropy จะผลักดันไปสู่ป้ายกำกับที่ยากอย่างต่อเนื่อง ในขณะที่ KL distillation ต่อเป้าหมายคงที่จะเงียบเมื่อถึงการบรรจบ
เงื่อนไขละเอียด
นี่คือการวัดผลของ Multiverse Computing เองสำหรับสายงานของตนเองที่รายงานในเอกสารและโพสต์บล็อกของบริษัท ไม่ใช่การประเมินอิสระ เอกสารระบุว่านักเรียน QAH ถูกปล่อยเป็นแบบเปิดน้ำหนักเป็น HyperNova-60B ซึ่งเป็นโมเดล Apache 2.0 ของบริษัทที่สร้างจาก gpt‑oss‑120b
เทคนิคนี้ยังอาศัยเครื่องมือจากงานก่อนหน้าของบริษัท การบำบัดที่ความยาวบริบท 32,000 โทเคนในชุดข้อมูลการฝึกใช้การสูญเสีย KL‑divergence แบบแบ่งชิ้นที่คำนวณความแตกต่างหนึ่งส่วนของลำดับต่อครั้ง แทนการสร้างตารางพจนานุกรม‑ต่อ‑ลำดับเต็มรูปแบบ ซึ่งเป็นหัวข้อของ เอกสารและโพสต์แนบ ที่เผยแพร่เมื่อ 10 สิงหาคม 2026 งานก่อนหน้านี้ลดหน่วยความจำสูงสุดสำหรับการทำ distillation 32K‑โทเคนจาก 85.2 GiB เหลือ 5.45 GiB ในการทดสอบแยกส่วน และเป็นสิ่งที่ทำให้การบำบัดบริบทยาวสามารถทำได้ภายในงบประมาณ GPU ที่กำหนด เอกสารใหม่ยังชี้ให้เห็นช่องว่างคุณภาพที่ทำซ้ำได้ระหว่างแบ็กเอนด์การฝึกแบบกระจายเป็นบทเรียนการปรับใช้ โดยไม่ได้ระบุผู้ชนะในสรุปบล็อก
ทำไมผลลัพธ์นี้จึงแพร่หลาย
สูตรคณิตศาสตร์ของประสิทธิภาพเป็นสูตรเดียวกับที่เป็นแรงจูงใจให้เกิดการบีบอัดตั้งแต่แรก ซึ่งทำให้การกลับด้านความแม่นยำมีความสำคัญ ที่ความแม่นยำ 4‑บิต โมเดล QAH ใช้หน่วยความจำน้ำหนักประมาณ 4 เท่าต่ำกว่านักเรียน bfloat16 และที่พารามิเตอร์ครึ่งหนึ่งของครูก็ทำให้การคำนวณต่อโทเคนลดลงประมาณครึ่งหนึ่ง; สำหรับตระกูลโมเดลที่จัดจำหน่ายในรูปแบบ bfloat16 แทน 4‑บิต การลดลงรวมกันจะใกล้เคียงกับการคำนวณต่อโทเคนที่ลดลง 8 เท่า เส้นผลิตภัณฑ์ที่เปิดตัวในปัจจุบันของ Multiverse สะท้อนปรัชญาเดียวกัน: Hypernova 60B 2605 checkpoint มีน้ำหนัก 32 GB เทียบกับ 65 GB ของ gpt‑oss‑120b โดยบริษัทรายงานอัตราการประมวลผลที่สูงขึ้นบน NVIDIA H200 ตัวเดียว
หากสูตรนี้ใช้ได้ต่อเนื่องนอกเหนือจากสายงานนี้ ผลสรุปสำหรับการปรับใช้แบบเปิดน้ำหนักคือ ภาษีความแม่นยำในการให้บริการ 4‑บิตไม่ได้เป็นกฎของธรรมชาติแต่เป็นผลของผู้ที่สอนนักเรียน งานบีบอัดของ Multiverse จนถึงตอนนี้ได้ถูกนำไปใช้กับโมเดลเปิดของห้องทดลองอื่น ๆ และบริษัทกำลังขายสูตรนี้ให้ทีมสามารถปรับใช้ได้โดยไม่ต้องทำการค้นหา hyperparameter หลายสัปดาห์ ชุดตรวจสอบ 4‑บิตที่เอาชนะรุ่นพาเรนท์ 16‑บิตใน 7 จาก 9 เกณฑ์ประเมินเป็นหลักฐานที่บริษัทเลือกนำเสนอเป็นจุดเด่น












