نماذج ومنصات الذكاء الاصطناعي
Baseten تضيف DeepSeek-V4.1-Flash إلى واجهات برمجة التطبيقات للنماذج بسياق 1M‑رمز

DeepSeek-V4.1-Flash متاح الآن على واجهات برمجة تطبيقات نماذج Baseten، Baseten أعلن في 11 سبتمبر 2026، جالبًا نموذجًا متعدد الوسائط من نوع mixture-of-experts (MoE) يحتوي على 552 مليار معلمة، يجمع بين 8 مليارات معلمة نشطة للتعبئة المسبقة و16 مليار للتفكيك عبر نافذة سياق بطول 1M‑رمز، إلى منصة مزود الاستدلال.
أصدرت DeepSeek الأوزان المفتوحة للنموذج على Hugging Face، وإعلان DeepSeek الخاص مؤرخ في 9 سبتمبر 2026. يقبل النموذج مدخلات نصية وصورية ويولد مخرجات نصية، وبطاقة النموذج تشير إلى أن المستودع والأوزان مرخصة تحت رخصة MIT. تصف Baseten V4.1-Flash بأنه الإصدار الثالث للـ flash المفتوح الوزن من DeepSeek لعام 2026 وكأنه النموذج الوحيد من هذا الحجم الذي يستخدم ما تسميه DeepSeek بنية Encoder-Decoder السببى. وفقًا للشركة، سيأتي دعم منتج التدريب Loops من Baseten قريبًا.
نتائج المعايير المبلغ عنها
تشير بطاقة النموذج إلى نتائج نموذج التعليم عند إعداد أقصى جهد استدلال وهو 100: يحقق V4.1-Flash درجة 90.6 على Terminal-Bench 2.1، مقارنةً بـ 82.7 لـ V4-Flash و87.9 لـ V4-Pro؛ و74.2 على DeepSWE v1.1، مقارنةً بـ 54.4 و62.7؛ و54.8 على AutomationBench، مقارنةً بـ 37.7 و43.2. أبرزت Baseten نفس أرقام الترميز والوكيل، قائلة إن V4.1-Flash يتفوق على V4-Pro مع ما يقرب من ثلث إجمالي المعلمات، مع التحذير من أن 54.8 على AutomationBench يعني أن النموذج يفشل في نحو نصف سير العمل المعقد ونصحت الفرق بالحفاظ على وجود إنسان في الحلقة لخطوط أنابيب الوكلاء.
في مقارنة البطاقة مع نماذج الحدودية عند أقصى جهد، يسجل V4.1-Flash 90.9 على GPQA Diamond، وتقييم Codeforces يبلغ 3471، و63.9 على HLE مع الأدوات. تقول Baseten إن V4.1-Flash هو أول نموذج غير تجريبي من DeepSeek يدعم إدخال الصور أصليًا، وهي قدرة كانت مقصورة سابقًا على النموذج التجريبي V4-Flash-Vision-Exp؛ وتظهر جدوله 78.9 على Chartography و49 على ZeroBench للنموذج الجديد، مقارنةً بـ 64.3 و35 للنموذج التجريبي.
بنية Encoder-Decoder السببى
وفقًا لبطاقة النموذج، ينظم V4.1-Flash محولًا مكوّنًا من 40 طبقة كـ 20 طبقة مشفر سببى يتبعها 20 طبقة مفكك، حيث يتم إسقاط ذاكرة التخزين المؤقت العالمية للمفاتيح والقيم (KV) للمفكك من الحالات المخفية النهائية للمشفر بدلاً من اشتقاقها من الحالات المخفية لكل طبقة من طبقات المفكك. يفعّل التصميم 8 مليارات معلمة لكل رمز أثناء التعبئة المسبقة و16 مليار أثناء التفكيك؛ تقارن Baseten ذلك بـ V4-Flash، الذي يفعّل 13 مليار للخطوتين، معتبرةً التغيير تبادل تفكيك أثقل بأكثر تعبئة مسبقة خفيفة، وهو إعداد تقول Baseten إنّه يعزز كفاءة التكلفة لوكلاء الترميز الذين تولد حلقاتهم الوكيلة رموز تعبئة مسبقة أكثر بكثير من رموز التفكيك.
تشير البطاقة إلى أن آلية Compressed Sparse Attention 2 في النموذج تُعيّن لكل طبقة انتباه واحدة من ثلاثة أوضاع ثابتة (Full أو Reindex أو Reuse)، مع مُفهرس هرمي متفرق في المفكك يحدّ من تكلفة الفهرسة العميقة بشكل مستقل عن طول السياق. وبالاشتراك مع تخزين KV الرئيسي FP4، تقلل هذه التصاميم ذاكرة KV العالمية إلى 890 بايت لكل رمز، أي ما يقرب من ربع حجم V4-Flash، وفقًا للبطاقة. آلية منفصلة تُدعى SWA Bounded Replay تعيد بناء حالات KV للانتباه المتزلج الناقصة عن طريق إعادة تشغيل الرموز الأحدث فقط، مما يقلل البصمة الدائمة للـ KV إلى ما يقرب من ثُمن V4-Flash. يضع إعلان DeepSeek التوفير عند ربع سعة الذاكرة HBM وثمن سعة تخزين SSD للجيل السابق.
كل طبقة MoE تستخدم خبيرًا مشتركًا واحدًا و384 خبيرًا موجهًا مع ستة خبراء موجهين نشطين لكل رمز، ويضيف النموذج ذاكرة شرطية Engram بـ 196 مليار معلمة إلى جانب فك تشفير DSpark التخميني، وفقًا للبطاقة. دربت DeepSeek النموذج من الصفر على مجموعة بيانات متعددة الوسائط بحجم 45 تريليون رمز، ودربت انتباهه المتفرق بطول تسلسل 64 ألف، ووسعت السياق إلى 1 مليون رمز عند 34 تريليون رمز. يتبع ما بعد التدريب تحسينًا قياسيًا تحت إشراف، التعلم المعزز، وتسلسل تقطير على السياسة، مع تركيز التغييرات الجوهرية على تركيب آلي واسع النطاق لمهام الوكلاء والبيئات، ويكشف النموذج عن إعداد جهد استدلال يمكن التحكم فيه باستمرار من 1 إلى 100.
تحول واجهة برمجة تطبيقات DeepSeek وخدمات Baseten
توضح DeepSeek أن V4-Flash وV4-Flash-Vision-Exp تم إيقافهما على منصتها، مع توجيه أسماء نماذج API القديمة مؤقتًا إلى V4.1-Flash للتوافق. سُريًّة الأسعار الجديدة لواجهة API سارية اعتبارًا من 04:00 بتوقيت UTC في 10 سبتمبر 2026، مع تحديد أسعار الفترات غير الذروة عند 50٪ من أسعار الذروة، وتُسمي DeepSeek الشركاء الرسميين WorkBuddy (بما في ذلك CodeBuddy) وOpenCode كداعمين بالكامل لـ V4.1-Flash.
قالت Baseten إن مجموعة الاستدلال الخاصة بها تخدم النموذج باستخدام NVIDIA Dynamo مع توجيه واعٍ لذاكرة KV المؤقتة، موجهة كل طلب إلى النسخة المكررة التي تحتفظ بالفعل بمقدمه بدلاً من أي نسخة متاحة. يُقدم النموذج عبر مكتبة النماذج الخاصة بـ Baseten، مع نشرات مخصصة متاحة للفرق التي تحتاج إلى سعة محجوزة.
بدءًا من 04:00 بتوقيت UTC في 14 سبتمبر 2026، سيتم توجيه جميع طلبات deepseek-v4-pro إلى V4.1-Flash بأسعار V4.1-Flash، وهو ترتيب تقول DeepSeek إنه سيستمر حتى إطلاق V4.1-Pro؛ وذكر المختبر أن الاختبارات التي أجراها عدة أطراف وضعت V4.1-Flash متفوقًا على V4-Pro من حيث الأداء والتكلفة والسرعة وإجمالي زمن التشغيل.












