نماذج ومنصات الذكاء الاصطناعي

Cerebras تُعلن عن زيادة في إنتاجية الاستدلال بمقدار 5X نتيجة التفكيك

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قالت Cerebras Systems في 1 أكتوبر 2026 إنها زادت إنتاجية الاستدلال بمقدار 5 أضعاف في النتائج الأولية باستخدام تقنية تُسمى التفكيك، مع نفس عدد أنظمة Cerebras ودون أي خسارة في سرعات توليد الرموز. جاء الكشف في الاستدلال المفكك من الأساس، وهو منشور مدونة الشركة من تأليف Isaac Tai و Zhenwei Gao يفتتح سلسلة مخطط لها حول هذا الموضوع.

يُحدد المنشور السلسلة للقراء الذين سمعوا مصطلح التفكيك، أو الادعاء بأن مرحلة الملء المسبق (prefill) مقيدة بالحوسبة ومرحلة فك الترميز (decode) مقيدة بالذاكرة، وتساءلوا عما يعنيه كل منهما فعليًا. يبني الشرح من الأساس، بدءًا من كيفية موازنة المعجلات بين العمليات الحسابية وحركة البيانات.

تضع كل من مرحلة الملء المسبق ومرحلة فك الترميز متطلبات مختلفة على العتاد

يعرف المنشور شدة الحسابية بأنها عدد عمليات الفاصلة العائمة مقسومة على عدد البايتات التي تُنقل بين الذاكرة ووحدات الحوسبة في المعجل. في أحد أمثلتها، يضيف جمع مصفوفتين عملية FLOP واحدة لكل 6 بايتات من النقل، أي شدة حسابية تبلغ 0.167 FLOP لكل بايت، وتظل هذه النسبة ثابتة مع نمو المصفوفات. أما ضرب المصفوفات فيسلك مسارًا مختلفًا: كل قيمة ناتجة تُبنى من صف كامل لإحدى المدخلات وعمود كامل للآخر، لذا تُساهم القيم المحملة في مخرجات أكثر وتزداد الشدة الحسابية مع حجم الإدخال.

يشرح المنشور أن الاستدلال هو سلسلة من مثل هذه عمليات ضرب المصفوفات بين أوزان النموذج الثابت ورموز الإدخال، ويعمل في مرحلتين بملفات شدة مختلفة. أثناء مرحلة الملء المسبق، يُعالج كامل النص الموجه بالتوازي كعملية مصفوفية كبيرة، ويمكن أن تحتوي النصوص الواقعية على آلاف أو حتى مئات الآلاف من الرموز. أثناء مرحلة فك الترميز، تُولد الرموز واحدة تلو الأخرى، ويعتمد النموذج على ذاكرة KV المؤقتة التي تخزن المفاتيح والقيم المحسوبة للرموز السابقة لتُعاد استخدامها بدلاً من إعادة حسابها.

يجب على المرحلتين مع ذلك نقل جميع أوزان النموذج، والتي قد تصل إلى مئات الجيجابايت أو التيرابايت، إلى وحدات الحوسبة لكل رمز يُولد. يُظهر المنشور أن حركة الذاكرة تظل شبه ثابتة بينما تنخفض الشدة الحسابية بعد مرحلة الملء المسبق، ويشير إلى هذه الفجوة كسبب أن إضافة سعة حوسبة خام لا تضمن بالضرورة وصول الرموز بشكل أسرع أثناء مرحلة فك الترميز.

التفكيك يقسّم الاستدلال إلى مجموعات منفصلة

في بيئات الإنتاج، عادةً ما يتعامل خادم الاستدلال مع العديد من الطلبات في وقت واحد، وعندما تُنفّذ مرحلتا الملء المسبق وفك الترميز على نفس العتاد، يمكن للملء المسبق المكثف حسابيًا أن يعرقل طلبات فك الترميز النشطة. ثم يتعين على المجدولين الاختيار بين إيصال الطلبات الجديدة إلى الرمز الأول بسرعة، والحفاظ على تدفق الاستجابات النشطة بسلاسة، وتعظيم إجمالي الإنتاجية. يسمح التجميع (Batching) للطلبات المتزامنة بمشاركة عمل قراءة أوزان النموذج، لكن الدفعات الأكبر قد تجعل كل خطوة فك ترميز تستغرق وقتًا أطول، وبالتالي قد ترتفع الإنتاجية الكلية بينما يتلقى كل مستخدم الرموز ببطء أكبر.

يصف المنشور التفكيك كنمط تصميم نظامي يُشغل المرحلتين في مجموعات عتادية منفصلة. بمجرد فصل المرحلتين، يمكن للمشغلين تخصيص العتاد، وضبط سياسات التجميع، وإعطاء الأولوية للكمون أو الإنتاجية لكل مرحلة على حدة: يمكن للنظام الذي يضع أهدافًا صارمة للوقت حتى أول رمز أن يخصص سعة أكبر للملء المسبق، بينما يمكن للنظام المصمم لتدفق سلس أن يمنح فك الترميز مجموعة أكبر أو مجدولة بشكل أكثر دقة. ويمكن أيضًا توسيع حجم المجموعات بشكل فردي.

يُدخل الفصل متطلبًا جديدًا. بعد أن يبني الملء المسبق ذاكرة KV المؤقتة، يجب نقل حالة الطلب المحددة إلى مجموعة فك الترميز، حيث تُحمَّل في الذاكرة قبل أن تستأنف عملية التوليد، بينما تكون أوزان النموذج مُحمَّلة بالفعل في كلا المجموعتين. يشير المنشور إلى أن عملية التسليم تضيف عبءً شبكيًا وتنسيقيًا، وأن أي مجموعة قد تظل خاملة إذا لم تتطابق السعات مع الطلب، وأن الكمون الإضافي يعتمد على ما إذا كانت الذاكرة تنتقل عبر آلات متجاورة أو عبر مناطق. يجادل بأن التفكيك يصبح أكثر إقناعًا على نطاق واسع، حيث يمكن أن تفوق المكاسب الناتجة عن تحديد حجم وجدولة المجموعات بشكل مستقل تكاليف النقل والتشغيل، وأنه يغيّر واجهة التحكم في نظام الخدمة بدلاً من مجرد تحسين التدفق.

العتاد المتنوع، النتائج المبكرة، والشراكات

قالت Cerebras إنها تتصدر تطوير التفكيك المتنوع، حيث تجمع بين أنواع متعددة من الشرائح في نظام استدلال واحد وتخصص عتادًا مختلفًا للقطاعات التي تكون مقيدة بالذاكرة أو مقيدة بالحوسبة. يقارن المنشور تصميم الشركة على مستوى الرقاقة (wafer-scale) الذي يوزع SRAM جنبًا إلى جنب مع الحوسبة عبر كامل الرقاقة، مع وحدات معالجة الرسوميات (GPUs) التي تنقل بيانات النموذج من الذاكرة ذات النطاق العريض عبر ذواكر داخلية أصغر وذاكرات تخزين مؤقتة.

تُظهر مخطط عرض نطاق الذاكرة القُمية المنشور في المقال، المؤرخ في 10 سبتمبر 2026، أن SRAM المدمج على رقاقة Cerebras WSE-3 يصل إلى 21,000 تيرابايت/ثانية لكل رقاقة، إلى جانب مسرّع SRAM مدمج غير مسمى بسعة 150 تيرابايت/ثانية ومعالجات GPU من نوع HBM4 بسعات 23.3 و22 تيرابايت/ثانية. يحذر المخطط من أن أرقام SRAM تجمع عرض نطاق الذاكرة المحلي عبر المعالج بينما تقيس أرقام HBM حركة المرور من الذاكرة الخارجية، لذا فإن هذه الأرقام تصف طبقات ذاكرة مختلفة بدلاً من سرعات الرموز المقاسة.

يعيد المنشور أيضًا إنتاج بيانات التحليل الاصطناعي من 10 سبتمبر 2026 لـ GPT-oss-120B التي تعمل على التفكير المتقدم باستخدام 10,000 رمز إدخال. ويذكر أن Cerebras ينتج 1,669 رمزًا ناتجًا في الثانية، بينما تنتج SambaNova 708، وGroq 475، وMicrosoft Azure 319، وNebius 294، وBaseten 293.

قالت Cerebras إن النظام التقليدي المتجمع يتطلب زيادة السعة عبر نشر المزيد من الأجهزة، وأنه من خلال الاستفادة من مسرعات الشركاء لمعالجة الطلبات زادت السعة بمقدار 5 أضعاف في الاختبارات الأولية مع نفس مساحة WSE. وأفادت الشركة بأنها أعلنت عن شراكات مع عدة شركاء في مجال الأجهزة لتقديم رموز فائقة السرعة إلى السوق، وتظهر مخطط في المنشور أن أنظمة AWS Trainium وAMD Helios Instinct GPU تُعد من خيارات الأجهزة المسبقة التي تغذي مجموعة فك تشفير Cerebras.

يحدد المنشور التطبيقات الوكيلة كملاءمة جذابة للتفكيك غير المتجانس، لأنها غالبًا ما تتضمن سير عمل طويل ومتعدد الجولات حيث يتزايد السياق عبر استدعاءات النموذج وتزداد التأخيرات في كل خطوة. وقالت Cerebras إن الإصدارات القادمة ستغطي مكدسات الأجهزة والبرمجيات المتضمنة والمقايضات الاقتصادية لنشر الاستدلال غير المتجمع على نطاق واسع.

Theo Nash هو متخصص مولَّد بالذكاء الاصطناعي في Unite.AI، يغطي بنية تحتية للذكاء الاصطناعي، الحوسبة، والأنظمة المادية التي تشغّل الذكاء الاصطناعي الحديث. يتركّز عمله على الأسس التقنية وراء أحمال العمل الضخمة للذكاء الاصطناعي، بما في ذلك مراكز البيانات، المعجّلات، الشبكات، ومجموعات البرمجيات التي تربط بينها.

مع منظور تحليلي ومُستند إلى الهندسة، يفحص Theo كيف تُتيح التقدّمات في وحدات معالجة الرسوميات (GPUs)، السيليكون المخصَّص، بنى الذاكرة، والأنظمة الموزَّعة أجيالًا جديدةً من نماذج الذكاء الاصطناعي. يولي اهتمامًا خاصًا للمقايضات في الأداء، كفاءة الطاقة، القابلية للتوسع، والقيود العملية التي تُشكّل نشر البنية التحتية للذكاء الاصطناعي في الواقع.

المقالات التي يكتبها Theo Nash مُولَّدة بالذكاء الاصطناعي وتُراجَع من قِبل فريق التحرير في Unite.AI لضمان الدقة التقنية، الوضوح، وتغطية مسؤولة للمشهد المتطور سريعًا في حوسبة الذكاء الاصطناعي.