نماذج ومنصات الذكاء الاصطناعي

Qwen3.8-Flash-Next يعرض بنية Qwen4 مع 6B من المعلمات النشطة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

Qwen3.8-Flash-Next يعرض بنية Qwen4 مع الانتباه الهجين و6B من المعلمات النشطة

أصدرت فريق Qwen التابع لـ Alibaba نموذج Qwen3.8-Flash-Next في 26 أغسطس 2026، وهو نموذج تجريبي مفتوح الوزن يعرض البنية المقصودة لتدعيم Qwen4. يحمل النموذج 125 مليار معلمة لكنه ينشط فقط 6 مليارات لكل رمز، وهو تكوين تصفه الفريق كخطوة نحو ما يسمونه الكفاءة القصوى من حيث التكلفة.

يُعد هذا الإصدار أول نموذج عام مبني على هذا التصميم. تُصِف بطاقة نموذج Qwen3.8-Flash-Next النموذج بأنه نموذج لغوي سببي مع مُشفّر بصري، تم تدريبه عبر كلٍ من ما قبل التدريب وما بعد التدريب، وتُشير إلى طول سياق أصلي قدره 262,144 رمزًا يمكن توسيعه إلى مليون رمز. تُظهر البطاقة النموذج كخطوة ملموسة نحو الكفاءة بدلاً من أن يكون رائدًا في القدرات: القلق المعلن للفريق هو كيف تؤثر خيارات البنية على تكلفة الاستدلال على نطاق واسع، خصوصًا مع تحول أحمال العمل الوكيلة ذات السياقات الطويلة إلى الاستخدام السائد.

الانتباه الهجين، المتبقيات المتحكم فيها، وتضمينات N-جرام

تعتمد البنية على أربعة تغييرات مذكورة. الأولى هي إعادة تصميم مخطط الانتباه الهجين. كانت نماذج Qwen الهجينة السابقة تجمع بين Gated DeltaNet و Gated Attention؛ يستبدل Qwen3.8-Flash-Next الأخير بـ Qwen Sparse Attention، أو QSA، الذي يعمل على مستوى الميكرو‑بلوك بدلاً من اختيار الرموز الفردية. تدعي البطاقة أن هذا يقلل بشكل كبير من زمن الاستجابة للسياقات الطويلة. ينظم النموذج طبقاته الـ 48 في نمط متكرر: ثلاث كتل من Gated DeltaNet تغذي طبقة مزيج من الخبراء، تليها كتلة واحدة من QSA تغذي طبقة مزيج من الخبراء، ويتكرر ذلك اثني عشر مرة.

التغيير الثاني هو آلية المتبقي المتحكم فيها التي تعدل المعلومات المتدفقة عبر تدفقات المتبقي الموسعة باستخدام بوابة قراءة عنصرية تعتمد على البيانات وبوابة كتابة عددية لكل فرع. تُظهر البطاقة هذا كطريقة للحصول على تعبير أكثر دقة عبر الطبقات مع الحفاظ على استقرار التدريب وتقليل عبء الاستدلال.

الثالث هو طبقة تضمين n‑جرام. بدلاً من توسيع المعلمات عبر خبراء إضافيين، يضيف النموذج 51 مليار معلمة في تضمين منفصل مفهرس بواسطة ثنائيات وثلاثيات قصيرة في الطبقة الثانية. يصف الفريق ذلك كمحور لتوسيع المعلمات يتطلب حسابًا أقل من مزيج الخبراء وهو أكثر قابلية للتحميل إلى المعجلات ذات الذاكرة المحدودة. تشير البطاقة أيضًا إلى طبقة توقع متعددة الرموز بعدد 4 مليارات معلمة تم تدريبها بخطوات متعددة.

الرابع هو طريقة التدريب نفسها. تُطبق مُحسِّنات Muon و AdamW على فئات أوزان محددة، ويذكر الفريق أن ذلك ألغى عمليات الإحماء التقليدية لحجم الدفعة لصالح البدء مباشرةً بحجم الدفعة المستهدف، مسترشداً بقوانين التحجيم المعاد ضبطها. تقول البطاقة إن هذا يقلل بشكل كبير من إجمالي خطوات المُحسّن مع دعم معدلات تعلم أعلى.

المقاييس المبلغ عنها من قبل البائعين وما تقيسه

تُبلغ البطاقة عن نتائج المقاييس التي تقارن Qwen3.8-Flash-Next مع Qwen3.8-27B، Qwen3.7-Plus، DeepSeek-V4-Flash-0731، وClaude-Opus-4.6 (Max). هذه أرقام مُبلغ عنها من قبل البائعين، تم تقييمها على أطر الفريق الخاصة، ويجب قراءتها على هذا الأساس. في مجال الترميز الوكائي، تسرد البطاقة درجة DeepSWE 1.1 بقيمة 58.7 مقابل 42.2 لـ Qwen3.8-27B و54.4 لـ DeepSeek‑V4‑Flash، مع إشارة إلى أن DeepSWE تم تشغيله باستخدام إطارين (Claude Code و mini‑SWE‑agent) وتم الإبلاغ عن أعلى درجة بينهما. في اختبار SWE‑bench Pro، يحصل Qwen3.8‑Flash‑Next على 62.5، متفوقًا على Qwen3.8‑27B بـ 61.7 و Qwen3.7‑Plus بـ 55.8، مع إعادة تقييم جميع النماذج على نسخة محسنة من المقياس بعد أن صحّح الفريق ما يسمونه المهام الإشكالية.

النمط المهم هو ادعاء الكفاءة، وليس أي رقم منفرد. تُدرج البطاقة 125 مليار معلمة إجمالية مع تنشيط 6 مليارات، مقابل 397 مليار إجمالي و17 مليار مُنشط لـ Qwen3.7-Plus. من جانب المعرفة العامة، يُظهر النموذج درجة GPQA Diamond قدرها 91.7، ودرجة LiveCodeBench v6 قدرها 91.9، ودرجة HLE قدرها 35.9 تم تقييمها بواسطة GPT‑4o بدلاً من المقيم الافتراضي للمقياس. تُظهر البطاقة شفافية بشأن هذه الاختيارات، وهو ما يفوق ما تقدمه العديد من الإصدارات، لكنها تظل اختيارات قام بها البائع.

التوافر والطريق إلى Qwen4

يتوفر Qwen3.8-Flash-Next الآن على Hugging Face تحت ترخيص qwen‑community‑1.0، مع أوزان بصيغة BF16 يبلغ مجموعها تقريبًا 180 مليار معلمة تشمل نموذج اللغة، وتضمين n‑جرام، وطبقة التنبؤ المتعدد الرموز. توصي البطاقة بالنشر عبر SGLang أو vLLM أو TokenSpeed، وتُشير إلى أن Qwen3.8‑Flash — النسخة الموجهة للإنتاج المبنية على هذا العرض المسبق مع سياق افتراضي يبلغ مليون رمز وأدوات مدمجة رسمية — هي النسخة المقصودة للاستخدام عبر واجهة برمجة التطبيقات المدارة من خلال Qwen Cloud.

علامة “Next” هي الدليل. يوضح الفريق صراحةً أن هذا عرض تجريبي للمعمارية التي ستدعم Qwen4، مما يضعه في نفس فئة الإصدارات السابقة من Qwen التي اختبرت اتجاهات التصميم قبل دورة الرائد. سواء أصبح هذا التصميم المحدد أساسًا لـ Qwen4 أو فرعًا يتخلى عنه الفريق لاحقًا، توثق الإصدارة المكان الذي يضع فيه أحد المختبرات الكبرى رهاناته على الكفاءة.

يُعد Jonas Reeve وكيلاً للبحث مولَّدًا بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي، والذكاء العام الاصطناعي (AGI)، والأسس النظرية للذكاء الآلي. يستكشف عمله كيفية ظهور التعلم، والتفكير، والذاكرة، والتجريد في كل من الأنظمة البيولوجية والاصطناعية، ربطًا بين بنى الذكاء الاصطناعي الحديثة والأسئلة القديمة في علم النفس الإدراكي وفلسفة العقل.

من خلال نهجٍ مفاهيميٍ وتأملي، يفحص Jonas أطرًا مثل نماذج التفكير، والأنظمة الوكيلة، والإدراك الناشئ، ونظرية التوافق، سعيًا لتوضيح ما يعنيه التقدم نحو الـAGI فعليًا—وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الضجيج، يركز على المبادئ الأولى، والصرامة المفاهيمية، وحدود النماذج الحالية.

المقالات التي كتبها Jonas Reeve مُولَّدة بالذكاء الاصطناعي وتُراجع من قبل فريق التحرير في Unite.AI لضمان الدقة والوضوح والنقاش المسؤول حول مفاهيم الذكاء الاصطناعي المتقدمة.