نماذج ومنصات الذكاء الاصطناعي

تطلق Liquid AI LFM2.5-DSpark لتسريع الاستدلال حتى 3.2×

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أصدرت Liquid AI نقاط تفتيش مسودة فك الترميز التخميني لثلاث نماذج من عائلة LFM2.5 في 20 أغسطس 2026، مُبلغًةً عن تحسينات في الإنتاجية تصل إلى 3.18× على وحدة معالجة رسومات H100 واحدة وإلى 2.87× على جهاز MacBook بمعالج Apple‑silicon، دون أي تغيير في مخرجات النموذج. إصدار LFM2.5-DSpark يغطي مسودات لـ LFM2.5-1.2B-Instruct، LFM2.5-2.6B، والنموذج المختلط الخبرات LFM2.5-8B-A1B، كل منها يضيف نحو 300 مليون معلمة كعبء مسودة فوق النموذج الهدف.

تُوزَّع نقاط التفتيش بصيغتي Safetensors وGGUF مع دعم فوري في llama.cpp وSGLang، وقد ساهم كلا التكاملين في قواعد الشيفرة الرسمية. وبما أن فك الترميز التخميني يُصدر رموزًا فقط بعد أن يتحقق النموذج الهدف منها، تُصرّح الشركة أن النص المُولَّد مطابق تمامًا لما كان سيولده النموذج الهدف بمفرده تحت فك الترميز الجشع، لذا لم تتغير دقة الاختبار.

قاسات Liquid AI، التي أُجريت بحجم دفعة 1 ودرجة حرارة 0 عبر خمس مجموعات بيانات، أظهرت متوسط تسارع قدره 2.67× لنموذج LFM2.5-2.6B على H100 (من 323 إلى 864 رمزًا في الثانية) و2.27× على M4 Max MacBook Pro (من 61 إلى 139 رمزًا في الثانية). أكبر نتيجة فردية جاءت من LFM2.5-8B-A1B على مجموعة MATH500، حيث ارتفعت الإنتاجية على H100 إلى 3.18×، من 428 إلى 1,362 رمزًا في الثانية. كما تُبلغ الشركة أن DSpark خفّض زمن استدعاء الوظائف بنسبة 57 % في المتوسط لنموذج LFM2.5-2.6B عبر سيناريوهات الأدوات المتعددة، وهو النتيجة البارزة لأعباء العمل الوكيلة على الجهاز التي تستهدفها سلسلة LFM2.5.

كيف يسرّع DSpark عملية فك الترميز

مرحلة فك الترميز في استدلال نماذج اللغة الكبيرة مقيدة بالذاكرة: معظم زمن الانتظار يأتي من تدفق الأوزان من الذاكرة العشوائية إلى الذاكرة داخل الشريحة بدلاً من الحساب نفسه، وهو السبب في أن أصبحت اقتصاديات الاستدلال هي المشكلة الهندسية المركزية في المجال. يهاجم فك الترميز التخميني ذلك من خلال جعل نموذج مسودة صغير يقترح كتلة من الرموز المرشحة، ثم يتحقق من الكتلة بأكملها في تمريرة أمامية واحدة للنموذج الهدف، موزعًا تكلفة تحميل الأوزان على كل رمز يتم فحصه.

تم تقديم DSpark في ورقة يوليو 2026 من قبل باحثي DeepSeek ونُشر في نظام خدمة DeepSeek‑V4 الخاص بالشركة، وهو يجمع بين ثلاثة مكوّنات: عمودًا موازياً ينتج الحالات المخفية لجميع رموز المسودة في تمريرة واحدة، رأسًا تسلسليًا خفيفًا يُنمّذج الاعتمادات بين الرموز المتجاورة للحفاظ على معدلات القبول من الانخفاض في أواخر الكتلة، ومُحققًا مجدولًا بالثقة يزيل اللاحقات ذات الثقة المنخفضة عندما يكون التحقق منها مكلفًا أكثر من ما يوفره. في نشر DeepSeek الإنتاجي، تُظهر الورقة تسارعات توليد للمستخدم تتراوح بين 60 % إلى 85 % مقارنةً بالخط الأساسي MTP‑1 عند معدلات إنتاجية مماثلة.

تتبع مسودات Liquid AI هذه الوصفة بتصميم مبسط يعتمد فقط على الانتباه: خمس طبقات، حجم كتلة من تسعة رموز مسودة لكل خطوة، ورأس ماركوف على مفردات تبلغ 128,000 رمز، وفقًا لـ بطاقة نموذج LFM2.5-2.6B-DSpark. تم تدريب كل مسودة لمدة 15 دورة على مزيج من الضبط الخاضع للإشراف، والدردشة، والشفرة، وبيانات استدعاء الوظائف، مع اختيار نقطة التفتيش بناءً على أعلى معدل قبول بدلاً من أقل خسارة. يضمن الضمان الدقة في الجودة: “فك الترميز التخميني دقيق: النموذج الهدف يتحقق من كل رمز مقترح، لذا يساوي الإخراج الجشع ما ينتجه النموذج الهدف وحده”، كما تُوضح بطاقة نموذج GGUF، مع توقيتات لكل استجابة تُظهر عدد الرموز المسودة المقترحة والمقبولة.

LFM2.5-DSpark بالأرقام

  • 3.18× — أفضل تسريع تم الإبلاغ عنه على وحدة معالجة الرسومات (LFM2.5-8B-A1B، MATH500، H100: 428 → 1,362 رمز/ثانية)
  • 2.87× — أفضل تسريع تم الإبلاغ عنه على الجهاز (LFM2.5-1.2B-Instruct، HumanEval، M4 Max: 136 → 389 رمز/ثانية)
  • 2.67× / 2.27× — متوسط تسارعات H100 / M4 Max لنموذج LFM2.5-2.6B عبر خمس مجموعات بيانات
  • 57% : متوسط تقليل زمن استدعاء الوظائف لنموذج LFM2.5-2.6B في سيناريوهات الأدوات المتعددة
  • 295.7M–327.7M (معلمات نموذج المسودة، مقارنة بالأهداف من 1.2B إلى 8B)
  • 4.81 من 10، متوسط الرموز المسودة المقبولة لكل خطوة لنموذج LFM2.5-2.6B بحجم كتلة 9

أين تتقلص التسارعات المبلغ عنها

تُظهر جداول Liquid AI الخاصة أن المكاسب غير متساوية، وتوضح الشركة أسباب ذلك. بالنسبة لنموذج LFM2.5-8B-A1B، يبلغ متوسط التحسين على الجهاز 1.18× فقط رغم أعلى معدلات القبول بين النماذج الثلاثة، وتُعزى الفجوة إلى تنفيذ خلط الخبرات الحالي في الواجهة الخلفية Metal لـ llama.cpp وإلى حركة الوزن الإضافية التي يُفعّلها التحقق من كتلة الرموز عبر الخبرات. أما بالنسبة لنموذج LFM2.5-1.2B-Instruct، فتتفاوت معدلات القبول حسب مجموعة البيانات بحيث يتقلب التسارع حتى 52 % اعتمادًا على توزيع النص، من 1.66× على MT‑Bench إلى 2.56× على MATH500 على H100.

جميع الأرقام مُبلَّغ عنها من البائع استنادًا إلى منصة الاختبار الخاصة بـ Liquid AI: SGLang على H100 سعة 80 GB في صيغة BF16 لأرقام GPU، وllama.cpp مع نوى Metal تجريبية على M4 Max بأوزان FP16 GGUF لأرقام على الجهاز، مع حد أقصى 256 رمزًا مُخرجًا. يتطلب مسار SGLang بناءً يدعم DSpark لأهداف LFM2، ويتطلب مسار llama.cpp البناء المقابل، لذا تعتمد التسارعات على تلك التكاملات بدلاً من أن تكون متوفرة في إصدار ثابت من أيٍ من المحركين.

دفع Liquid AI على الجهاز حتى الآن

يُعد إصدار DSpark هو التحديث الثالث لعائلة LFM2.5 خلال أقل من أسبوع. في 12 أغسطس 2026، أطلقت الشركة LFM2.5-VL-3B، نموذج رؤية‑لغة للهوامش، وفي 19 أغسطس 2026 نشرت نقاط تفتيش مصغرة مدركة للتكميم Q4_0 للعائلة. الخط المستمر هو نفسه: تقول الشركة إن تسريع DSpark لنموذج 2.6B على MacBook يدفع التفاعلية إلى ما وراء الإنتاجية التي تقدمها معظم نماذج السحابة المملوكة، والتي تُقدّر بحوالي 140 رمزًا في الثانية.

جميع المسودات الثلاثة متاحة الآن على Hugging Face: LFM2.5-1.2B-Instruct-DSpark، LFM2.5-2.6B-DSpark، وLFM2.5-8B-A1B-DSpark، مع بنى GGUF موازية لتوزيعات llama.cpp.

جوناس ريف هو محلل منشأ بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي والذكاء الاصطناعي العام (AGI) والأسس النظرية للذكاء الآلي. يعمل على كيفية ظهور التعلم والاستدلال والذاكرة والاستخراج في الأنظمة البيولوجية والاصطناعية، ورسم الصلات بين هياكل الذكاء الاصطناعي الحديثة والأسئلة القديمة في العلوم الإدراكية وفلسفة العقل.
مع نهج概念ي واعٍ، يبحث جوناس في الإطارات مثل نماذج الاستدلال والأنظمة الوكيلية والاعتراف الناشئ ونظرية التوجيه، بهدف توضيح ما يعنيه التقدم نحو AGI بالفعل - وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الهياج، يؤكد على المبادئ الأولى والصقل المفاهيمي وحدود النماذج الحالية.
المقالات التي كتبها جوناس ريف هي منشأة بالذكاء الاصطناعي ومراجعة بواسطة فريق تحرير Unite.AI لضمان الدقة والوضوح والمناقشة المسؤولة للمفاهيم المتقدمة للذكاء الاصطناعي.