نماذج ومنصات الذكاء الاصطناعي

Cerebras تشغّل GPT-5.6 Sol من OpenAI بسرعة 750 رمزًا في الثانية في الفئة الجديدة Ultrafast

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تُشغّل Cerebras (CBRS ) الآن النموذج الرئيسي لـ OpenAI بسرعة لم يسبق لأي سحابة GPU أن حققها علنًا. في 13 أغسطس 2026، أعلن صانع الرقائق على نطاق الوافر أعلنت أنه يُزوّد GPT-5.6 Sol على فئة خدمة جديدة من OpenAI تُدعى Ultrafast، مُقدِّمًا ما يصل إلى 750 رمزًا مُنتجًا في الثانية، ووفقًا حسب OpenAI، يُشغّل النموذج أسرع حتى 14× من المعالجة القياسية. تُطلق Ultrafast أولاً في واجهة برمجة تطبيقات OpenAI كمعاينة محدودة لمجموعة مختارة من العملاء، مع توسيع الوصول مع زيادة السعة.

الادعاء المركزي هو ادعاء محدد: ذكاء حدودي دون عقبة السرعة. يُعد GPT-5.6 Sol أكثر نماذج OpenAI قدرة، وعلى رقاقة Cerebras ينتج الرموز بسرعة تكفي لتضمينه في منتجات الوقت الحقيقي بدلاً من أن يكون خلف مهمة دفعة ليلية. تصف الشركتان الفئة بأنها تُزيل الموازنة بين نموذج ذكي بما يكفي للعمل عالي المخاطر وآخر سريع بما يكفي للاستخدام أثناء استمرار العمل.

أرقام السرعة وراء Ultrafast

الرقم البالغ 750 رمزًا مُنتجًا في الثانية هو العنوان الرئيسي، لكن المقارنات الأكثر إيضاحًا هي الاختبارات المباشرة التي نشرتها Cerebras. مقارنةً بسرعات الإخراج التي أوردتها Artificial Analysis، تقول الشركة إن GPT-5.6 Sol على Ultrafast يعمل أسرع بـ 11× من Claude Fable 5 وأسرع بـ 5× من Opus 4.8 في وضع Fast.

وضعت Cerebras الفئة أيضًا تحت اختبار كامل لامتحان Humanity’s Last Exam، وهو معيار مكوّن من 2,500 سؤال بمستوى صعوبة درجة الدكتوراه. أجاب GPT-5.6 Sol على Ultrafast على جميع الأسئلة الـ 2,500 خلال 11 ساعة و11 دقيقة؛ بينما احتاج Claude Fable 5 إلى 78 ساعة و27 دقيقة للوصول إلى استنتاجات مماثلة: أي أبطأ بنحو 7× تقريبًا، وفقًا لتقارير Cerebras. وفي اختبار GDP-Val، وهو معيار للعمل المعرفي ذو القيمة الاقتصادية، تُبلغ الشركة عن تسريع قدره 5.6× من الطرف إلى الطرف مقارنةً بالمعالجة القياسية دون أي تدهور في الجودة.

هذه تقييمات تُجرى من قبل البائع، وتوضح Cerebras ذلك صراحةً: تم قياس مقارنة Humanity’s Last Exam من قبل Cerebras في 10 يوليو و13–15 يوليو 2026، وتأتي أرقام GDP-Val من اختبارها الخاص في 31 يوليو 2026. اعتبرها قياسات الشركة نفسها، وليست نتائج مستقلة.

لماذا تفوز رقاقة النطاق الوافر في زمن الاستجابة

الآلية مهمة هنا، لأنها توضح لماذا شركة رقاقة صغيرة نسبيًا تُقدّم أكبر نموذج لـ OpenAI بسرعات لم يحققها منافسو GPU. يُعد الاستدلال السريع على نموذج كبير أساسًا مشكلة نقل بيانات: في وحدات GPU، يجب نقل أوزان النموذج مرارًا بين الذاكرة على الرقاقة والتخزين خارج الرقاقة لتوليد كل رمز متتابع، وتصبح عرض النطاق الترددي للذاكرة عنق الزجاجة.

إجابة Cerebras هي القضاء على هذا النقل. يدمج محرك Wafer-Scale Engine 44 جيجابايت من SRAM على رقاقة واحدة بحجم الوافر، بحيث تبقى أوزان النموذج على الرقاقة وتنتقل الرموز عبر الطبقات المتسلسلة عبر الوافرات دون انقطاع. نظرًا لأن الأوزان لا تغادر السليكون أبدًا، فإن النهج يتوسع مع حجم النموذج — وهو ما تُبرزه الشركة كدليل على أن ميزة السرعة تستمر مع نمو النماذج الحدودية. من منظور اقتصاد الاستدلال، هذه هي القضية بأكملها: تُهيمن تكلفة وزمن استجابة خدمة النموذج على مدى سرعة تغذية الأوزان إلى الحوسبة، والحفاظ على 44 جيجابايت مقيمة على رقاقة واحدة يهاجم ذلك مباشرة.

شراكة بقيمة 10 مليارات دولار تصل إلى النموذج الرئيسي

يُعد Ultrafast أكثر المنتجات وضوحًا حتى الآن في علاقة استمرت لأشهر. اختارت OpenAI Cerebras لتوفير حوسبة منخفضة زمن الاستجابة بقيمة $10 billion في وقت سابق من عام 2026، وتضع هذه الإطلاق تلك السعة خلف النموذج الأعلى للشركة بدلاً من نموذج أصغر أو متخصص. تصف OpenAI Ultrafast بأنه “الخطوة التالية” في الشراكة لجلب استدلال فائق الانخفاض في زمن الاستجابة إلى منصتها.

بالنسبة لـ Cerebras، هذا الموقع ذو أهمية. فقد جادلت الشركة الناشئة منذ زمن طويل أن بنية النطاق الوافر هي الشكل المناسب للاستدلال حتى مع تمركز مركز وزن السوق لدى موردي GPU — وهو صراع يتجلى عبر أعمال المسرّعات بينما ينتقل اللاعبون الحاليون إلى دمج النماذج مباشرة في سيليكونهم. يمنح وضع طبقة الخدمة للنموذج الرئيسي لـ OpenAI شركة Cerebras حسابًا مرجعيًا للإنتاج في صدارة السوق. يربط النموذج نفسه عائلة GPT-5.6 التي أطلقتها OpenAI (Sol كنموذج رئيسي، إلى جانب Terra المتوازن وLuna الفعّال من حيث التكلفة)، لذا يربط Ultrafast شركة Cerebras بواجهة تلك السلسلة.

من سيحصل عليه وما هو الغرض منه

تُصوّر OpenAI الفئة على أنها مخصصة للأعمال الحساسة للوقت وعالية المخاطر: الاستجابة للحوادث أثناء استمرار الانقطاع، البحوث المالية أثناء تغير ظروف السوق، دعم العملاء والصوت في الوقت الحقيقي، التجارة، وحلقات البحث الحي التي كانت تُجرى طوال الليل. تم منح الوصول المبكر لشركات في مجالات البرمجة، التجارة، والمالية، بما في ذلك Jane Street وPodium وBasis وRogo.

“الزيادة في السرعة التي جلبتها Cerebras مثيرة للإعجاب”، قال جون كريبزي، مساعدي الذكاء الاصطناعي في Jane Street، في إعلان OpenAI. “إنها تتيح طرقًا مختلفة لاستخدام النماذج، وتجعله عمليًا للمطورين للعمل بطريقة أكثر تركيزًا وإنتاجية إلى جانبها.”

تُبقي OpenAI النشر محدودًا عن قصد. تقول الشركة إنها تستخدم فترة المعاينة لتحديد أين يُحدث تغيير السرعة بأمرٍ من مرتبة إلى أخرى أكبر قيمة، وستوسع الوصول مع نمو السعة. كلا من OpenAI وCerebras يجذبان المشتركين للحصول على التحديثات مع توسع المعاينة.

ماذا سيحدث لاحقًا

الملاحظة القريبة المدى هي السعة، وليس القدرة. يُعد Ultrafast معاينة محدودة، وتربط كلتا الشركتين أي توسيع أوسع للتوافر بنمو السعة بدلاً من تاريخ ثابت — لذا فإن وتيرة التوسع هي ما يجب مراقبته. السؤال الأبعد هو ما إذا كانت ميزة الذاكرة على الرقاقة لدى Cerebras ستستمر مع توسع نماذج OpenAI، وهو بالضبط الرهان الذي بُنيت عليه بنية النطاق الوافر.

ثيو ناش هو خبير في مجال الذكاء الاصطناعي في Unite.AI ، ويهتم ببنية تحتية للذكاء الاصطناعي والحوسبة والأنظمة المادية التي تعمل بالذكاء الاصطناعي الحديث. يركز عمله على الأسس الفنية خلف حمولات الذكاء الاصطناعي على نطاق واسع ، بما في ذلك مراكز البيانات والمسرعات والشبكات وبرامج التطبيقات التي تربطها معًا.
بمنظور تحليلي ومهندس مدفوع ، يفحص ثيو كيف تتيح التطورات في وحدات معالجة الرسومات والصمامات المخصصة وعمليات الذاكرة والأنظمة الموزعة لأجيال جديدة من نماذج الذكاء الاصطناعي. يهتم بشكل خاص بالتضحيات في الأداء والكفاءة في استهلاك الطاقة وال قابلية للتوسيع والقيود العملية التي تشكل النشر الفعلي للبنية التحتية للذكاء الاصطناعي.
المقالات التي كتبها ثيو ناش يتم إنشاؤها بواسطة الذكاء الاصطناعي ومراجعتها بواسطة فريق التحرير في Unite.AI لضمان الدقة الفنية والوضوح والتغطية المسؤولة للمناظر الحوسبية للذكاء الاصطناعي التي تتطور بسرعة.