نماذج ومنصات الذكاء الاصطناعي
تقنية الشفاء 4‑بت من Multiverse Computing تتفوق على النموذج بدقة كاملة

نشرت شركة Multiverse Computing تقنية في 25 أغسطس 2026 تعكس أحد أكثر المقايضات موثوقية في نشر النماذج: نموذج لغة كبير يُضغط إلى نصف عدد معلماته ويُكمّـن إلى 4 بت، ويتفوق في الدرجات على نقطة التفتيش ذات الدقة الكاملة التي بُني منها. تُسمّى الطريقة “الشفاء المدرك للكمّـنة” (Quantization-Aware Healing أو QAH) وتُفصّل في مقالة مدونة الشركة وورقة مرافقة، وقد طُبّقت على نموذج GPT‑OSS 120B من OpenAI بعد ضغطه إلى 60B معلمة وتكمينه إلى MXFP4. النموذج الناتج بــ 4‑بت يتفوق على مصدره bfloat16 في 7 من 9 معايير، بما في ذلك تحسين قدره 7.4 نقطة في الاستدلال بسياق طويل و5.6 نقطة في الرياضيات التنافسية.
النتيجة ليست مجرد إدخال على لوحة المتصدرين لنموذج جديد في حدود غير مستكشفة. إنها ادعاء حول خطوة الاستعادة في خطوط ضغط النماذج، المرحلة التي يُعاد فيها تدريب نموذج مُقلص ومكمّن لاستعادة القدرة التي أُزيلت خلال هاتين الخطوتين. تجادل Multiverse في الورقة Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs بأن طرق الاستعادة القياسية في المجال تُثبّت النموذج المكمّن على معلم غير مناسب، وأن تعديل هذا الاختيار الوحيد يزيل السقف الذي يحدّ من جودة النموذج المضغوط.
المعلم هو عنق الزجاجة
وصفة النشر الفعّال القياسية تتضمن ثلاث مراحل: ضغط هيكلي للمعمارية بإزالة طبقات أو رؤوس أو خلايا؛ كَمّـن الأوزان المتبقية إلى 4 بت؛ ثم شفاء الضرر عبر تدريب إضافي. الطريقة السائدة للشفاء هي التدريب المدرك للكمّـنة، حيث يُستكمل تحسين النموذج على بيانات المهمة من خلال تمرير أمامي منخفض الدقة مُحاكى. بديلٌ لذلك هو التقطير المدرك للكمّـنة، حيث يُدرب الطالب المكمّن على مطابقة توزيع مخرجات معلم بدقة كاملة مُجمد.
كلا الطريقتين تعملان عندما تكون الكمّـنة هي التغيير الوحيد، لأن نسخة بدقة كاملة من النموذج نفسه موجودة لتعليم الطالب. يُعطّل الضغط الهيكلي هذا الافتراض. نموذج 60B المقتطع من 120B لم يُدرّب مطلقًا بدقة كاملة؛ والمرشح bfloat16 الوحيد هو نقطة تفتيش تم استعادتها عبر التقطير من الأصل. عندما يُقطّر الطالب بــ 4‑بت من تلك النقطة، تجادل Multiverse أن دقته تُقيد بسقف نقطة التفتيش المستعادة نفسها.
يقضي QAH على هذا السقف بتجاوز المعلم الوسيط تمامًا. يقطّر الطالب بــ 4‑بت مباشرةً من النموذج الأصلي قبل الضغط، وهو نموذج 120B، عبر مطابقة توزيعه باستخدام خسارة KL‑Divergence على القيم اللوجيتية. لا يشترك المعلم والطالب في الحجم ولا الدقة، وهو ما يشير المؤلفون إلى أنه لا يهم: توزيع مخرجات المعلم يُنقل بغض النظر عن بنية الطالب. بهذه النظرة، تتوقف الكمّـنة عن كونها خطوة ما بعد المعالجة ذات فقدان وتصبح مرحلة ثانية من التقطير ضد أقوى معلم متاح، إشراف لم يحصل عليه نقطة التفتيش bfloat16 أصلاً.
ما تُظهره المعايير
المقارنة الرئيسية تضع نموذج MXFP4 بــ 60B المعالج بـ QAH مقابل أفضل نسخة بدقة كاملة من نفس المعمارية، وهي نقطة التفتيش bfloat16 المستعادة بــ 60B. يفوز النموذج بــ 4‑بت في 7 من 9 معايير:
- AA-LCR (الاستدلال بسياق طويل): 42.7 مقابل 35.3، زيادة قدرها 7.4 نقطة
- AIME 2025 (الرياضيات): 76.3 مقابل 70.7، زيادة قدرها 5.6 نقطة
- Aider (البرمجة الوكّالية): 40.9 مقابل 38.2
- τ²-bench (استخدام الأدوات): 61.7 مقابل 59.4
- GPQA Diamond (العلوم): 67.4 مقابل 65.7
- IFBench (اتباع التعليمات): 59.9 مقابل 58.4
- LiveCodeBench (البرمجة): 66.5 مقابل 65.5
الخسارتان، MMLU‑Pro (73.8 مقابل 74.0) وSciCode (34.2 مقابل 35.6)، تقل عن نقطة ونصف. أكبر الزيادات تحدث تمامًا حيث يُحدث الضغط عادةً أكبر ضرر: الاستدلال بسياق طويل والرياضيات.
مقارنةً بالمعلم الأصلي بــ 120B، يتفوق الطالب بــ 4‑بت، الذي يعمل بنصف عدد معلمات المعلم وحوالي ربع ذاكرة الوزن، على LiveCodeBench (66.5 مقابل 66.0) ويقارب بفارق 1.6 نقطة على GPQA Diamond. أوسع فجوة متبقية هي AA‑LCR، حيث يسجل المعلم 50.0 مقابل 42.7 للطالب، وهي القدرة التي تصفها الورقة بأنها الأصعب استعادةً بعد تقليص السعة.
أسرع في التدريب، ولا ينهار
تجربة ثانية تعزل وظيفة الخسارة. عند كَمّـن نموذج GPT‑OSS 9B إلى MXFP4 تحت ظروف متطابقة، يصل كل من QAH وQAT إلى درجات قصوى متقاربة، 54.9 مقابل 54.6، متوسطًا عبر MMLU‑Pro وLiveCodeBench وGPQA Diamond. ثم تنقسم المسارات. يصل QAH إلى ذروته خلال حوالي 100 خطوة تدريب، أي أسرع سبع مرات من QAT الذي يحتاج 700 خطوة، ويحافظ على فرق لا يتجاوز نقطتين عن تلك الذروة حتى الخطوة 1,200. بينما ينهار QAT بعد ذروته، مسقطًا ما يقرب من 19 نقطة عند نفس العلامة.
العاقبة العملية هي فرق في مخاطر النشر يوضحها المؤلفون: نقطة تفتيش QAT تحتاج إلى إيقاف مبكر دقيق مقابل إشارة محجوزة، أو قد يُصدر فريق نموذجًا بدأ يتدهور. نقطة تفتيش QAH، المرتبطة بتوزيع معلم مُجمد، لا تتلقى أي تدرج يدفعها بعيدًا بمجرد اللحاق بالمعلم، لذا يمكن خدمة نقطة تفتيش مُدربة بالكامل دون تلك المراقبة. تُعزى الورقة الفرق إلى الخسارة نفسها: هدف الانتروبي المتقاطع يواصل الدفع نحو العلامات الصعبة إلى ما لا نهاية، بينما التقطير باستخدام KL ضد هدف ثابت يتوقف عند التقارب.
الشروط الدقيقة
هذه قياسات Multiverse Computing الخاصة بخط أنابيبها، مذكورة في ورقتها ومدونة الشركة، وليست تقييمًا مستقلاً. تُشير الورقة إلى أن الطالب QAH يُصدر كوزن مفتوح باسم HyperNova-60B، وهو نموذج الشركة تحت رخصة Apache 2.0 مبني من gpt‑oss‑120b.
تعتمد التقنية أيضًا على آليات من أعمال الشركة السابقة. الشفاء عند أطوال سياق 32,000 رمز في مجموعة التدريب يعيد استخدام خسارة KL‑Divergence مجزأة تحسب الانحراف شريحةً شريحةً بدلاً من إنشاء شبكة المفردات‑بالسلسلة الكاملة، وهو موضوع ورقة ومقالة مرافقة نُشرت في 10 أغسطس 2026. تلك الأعمال السابقة خفضت الذاكرة القصوى لتقطير 32K‑رمز من 85.2 GiB إلى 5.45 GiB في اختبار منفصل، وهو ما يجعل الشفاء بسياق طويل يتناسب مع ميزانية GPU ثابتة. تشير الورقة الجديدة أيضًا إلى فجوة جودة قابلة لإعادة الإنتاج بين أنظمة التدريب الموزعة كدرس نشر، دون تسمية فائز في ملخص المدونة.
لماذا ينتقل هذا الإنجاز
حساب الكفاءة هو نفسه الحساب الذي يدفع الضغط في المقام الأول، وهو ما يجعل عكس الدقة مهمًا. بدقة 4‑بت يستخدم نموذج QAH ذاكرة وزن أقل بنحو 4 أضعاف مقارنةً بالطالب bfloat16، ومع نصف عدد معلمات المعلم يقلّ الحساب لكل رمز تقريبًا إلى النصف؛ بالنسبة لعائلات النماذج التي تُشحن بـ bfloat16 بدلاً من 4‑بت، يقترب التخفيض المشترك إلى 8 أضعاف أقل حساب لكل رمز. تعكس خط إنتاج Multiverse الحالي نفس الفلسفة: نقطة تفتيش Hypernova 60B 2605 تُوزّع بوزن 32 GB مقابل 65 GB لـ gpt‑oss‑120b، وتُظهر الشركة معدلات نقل أعلى على وحدة NVIDIA H200 واحدة.
إذا استمرّت الوصفة خارج هذا الخط الأنبوبي، فإن ما يعنيه ذلك للنشر بوزن مفتوح هو أن الضريبة على الدقة عند الخدمة بــ 4‑بت ليست قانونًا طبيعيًا بل نتاج من “من يُعلّم الطالب”. حتى الآن طُبّقت أعمال ضغط Multiverse على نماذج مفتوحة من مختبرات أخرى، وتبيع الشركة الوصفة كحل يمكن لفريقٍ نشره دون بحث متعدد الأسابيع عن معلمات الضبط. نقطة التفتيش بــ 4‑بت التي تتفوق على أصلها بــ 16‑بت في 7 من 9 معايير هي الدليل الذي اختاروا إبرازَه.












