نماذج ومنصات الذكاء الاصطناعي
WEKA تطلق NeuralMesh 6 و WEKApod 3 مع تحول البنية التحتية للذكاء الاصطناعي نحو الاستدلال

WEKA قد أطلاق تحديثًا متناسقًا للبرمجيات والأجهزة يهدف إلى واحد من أكثر المشاكل التى تظهر فى صناعة الذكاء الاصطناعى وتكلفة: الحفاظ على إنتاجية وحدات معالجة الرسومات (GPUs) عند انتقال النماذج من التدريب إلى الاستدلال المستمر والكبير النطاق.
تشمل الإعلانات NeuralMesh 6، وهو تحديث كبير لمنصة البيانات والذاكرة التابعة للشركة، إلى جانب أجهزة WEKApod من الجيل الثالث المصممة لخدمات السحابة الاصطناعية، ومطوري النماذج، والمنظمات البحثية، والشركات التي تعمل على بنية تحتية للوحدات الرسومية.
تعكس هذه الإعلانات تغييرًا أوسع في تصميم البنية التحتية للذكاء الاصطناعي، حيث تتطور التخزين من مستودع سلبي إلى طبقة ذاكرة ومعلومات نشطة.
دفع موحد إلى الإنتاج الاصطناعي
تختلف متطلبات البنية التحتية للاستدلال الاصطناعي بشكل كبير عن متطلبات التدريب. تعمل مهام التدريب عادةً على مجموعات بيانات كبيرة من خلال خطوط أنابيب متوقعة. يجب على أنظمة الذكاء الاصطناعي، والاستدلال المعزز، وأنظمة التفكير بالسياق الطويل الوصول إلى بيانات متغيرة، والحفاظ على السياق عبر التفاعلات المتكررة، ودعم العديد من المستخدمين المتزامنين دون ترك وحدات معالجة الرسومات باهظة الثمن في انتظار المعلومات.
استجابة WEKA هي معاملة التخزين، وامتداد الذاكرة، ووصول الملفات، ووصول الكائنات، وحركة البيانات كأجزاء من نفس المنصة. تم تصميم NeuralMesh لتقديم أساس بيانات مشترك للتدريب، والاستدلال، وعمليات الحوسبة عالية الأداء عبر البيئات المحلية، والخدمات السحابية، والتنسيقات الهجينة.
يتوسع الإصدار الجديد في هذه الهندسة مع الائتمان المتعدد، والتخزين الكائني الأصيل، والذاكرة الموزعة، والاختزال التلقائي للبيانات، وعمليات Kubernetes، والرصد المركزي.
بدلاً من وضع إعلانات البرمجيات والأجهزة كتحديثات غير متعلقة، تقدم الشركة هذه الإعلانات كجزءين من نفس النظام. يتحكم NeuralMesh 6 في كيفية تخزين البيانات، وحركتها، وفرزها، وتسليمها، بينما توفر أجهزة WEKApod 3 أجهزة مصممة حول هذه الوظائف.
NeuralMesh 6 يوحّد حمولة الملفات والكائنات
أحد الإضافات الأكثر أهمية في NeuralMesh 6 هو تنفيذ S3 الأصيل الذي يعمل على تخزين NVMe.
يمكن الوصول إلى نفس كتل البيانات الأساسية من خلال بروتوكولات S3 للكائنات وواجهات نظام الملفات أو الشبكة دون الحاجة إلى نسخ منفصلة.
هذا الأمر مهم لأن أنابيب الذكاء الاصطناعي غالبًا ما تنقل المعلومات بين تخزين الكائنات، وأنظمة الملفات عالية الأداء، وبيئات التدريب، ومراكز الاستدلال. كل نسخة تستهلك سعة، وتقدم تأخيرات، وتعقيد الحوكمة. قد يسمح مساحة اسم موحدة بتمكين البيانات التي تم إنشاؤها من خلال بروتوكول لتصبح متاحة على الفور من خلال بروتوكول آخر.
يؤكد WEKA أن تنفيذه يدعم ما بين 2000 و5000 اتصال S3 متزامن لكل عقدة. كما يدعم S3 عبر Remote Direct Memory Access، مما يسمح بحركة البيانات نحو ذاكرة وحدات معالجة الرسومات بدون اتباع المسار التقليدي عبر طبقات متعددة من المعالجات المركزية ونظام التشغيل.
يقدم النظام مستويين من الائتمان المتعدد. يخصص кластерات القوام الخاصة موارد معالج، وذاكرة، وتخزين مخصصة لكل مستأجر، بينما يوفر الائتمان المتعدد الافتراضي عزل الشبكة، والتشفير المستقل، والتحقق من المستأجر، وضوابط جودة الخدمة لكل مستأجر.
يمكن للبيئات الافتراضية دعم أكثر من 1000 مستأجر معزول لكل кластер، وفقًا للشركة. يمكن أن يسمح الجمع بين النماذج المادية والافتراضية لمشغل بنية تحتية كبيرة بدعم عشرات الآلاف من العملاء المنطقيين المنفصلين دون نشر кластер تخزين مستقل لكل واحد.
نقل البيانات إلى أي مكان تتوفر فيه وحدات معالجة الرسومات
كما يقدم NeuralMesh 6 أيضًا تكرار البيانات الأولي والذاكرة الموزعة عن بعد لتحميلات العمل الاصطناعي الموزعة عبر مراكز البيانات، والخدمات السحابية، والمناطق الجغرافية.
يتطلب التكرار التقليدي عادةً نسخ مجموعة البيانات كاملة قبل بدء التحميل. بينما يجعل NeuralMesh البيانات الوصفية للوجهة ظاهرة على الفور، ثم ينقل البيانات الأساسية كما هو مطلوب.
هذا قد يسمح للمشغلين بنقل الوظائف نحو القدرة على وحدات معالجة الرسومات المتاحة دون الحاجة إلى تكرار كل ملف مرتبط بالمشروع أولاً. يهدف هذا النهج إلى دعم انفجار السحابة، والبنية التحتية الاصطناعية الموزعة، والتعاون بين فرق البحث أو الهندسة المنفصلة جغرافيًا.
كما يمثل خطوة أولى نحو نموذج مساحة اسم عالمي حيث يمكن عنونة البيانات بانتظام بغض النظر عن مكان تخزينها الأصلي.
تطبيق آخر للخوارزمية، وهاش المتشابه، والاختزال، والضغط بشكل مستمر بدلاً من معاملته كعملية خلفية اختيارية.
يزعم WEKA أن NeuralMesh 6 يمكن أن يوفر توفيرات سعة تصل إلى ستة أضعاف في بيانات التدريب الاصطناعي مع أقل من 5٪ من عبء الكتابة. ستعتمد الانخفاضات الفعلية على مجموعة البيانات. يمكن أن تحتوي نقاط التأكيد، وطبقات الحاويات، وأصدارات النموذج، وبيانات التدريب التكرارية على تكرار كبير، بينما قد تقلل أنواع البيانات الأخرى بشكل أقل فعالية.
تحويل التخزين إلى طبقة ذاكرة اصطناعية موسعة
كما يدمج NeuralMesh WEKA’s Augmented Memory Grid، الذي يستخدم تخزين NVMe كتوسيع مستمر لذاكرة وحدات معالجة الرسومات للاستدلال.
تخلق نماذج اللغة الكبيرة مخزن قيم ключية يحتوي على المعلومات المحسوبة من سؤال أو محادثة. بالنسبة للسياقات الطويلة وأنظمة العمل الاصطناعي، يمكن أن يصبح هذا المخزن كبيرًا جدًا. عندما لا يمكن أن يبقى في ذاكرة وحدات معالجة الرسومات عالية السعة، قد تحتاج الأنظمة إلى التخلص منه، أو إعادة حسابه، أو نقله إلى بنية تحتية أبطأ.
يخزن Augmented Memory Grid هذا المخزن في طبقة دائمة مدعومة بتخزين NVMe ويستخدم Remote Direct Memory Access وGPUDirect Storage لنقلها مرة أخرى إلى وحدات معالجة الرسومات.
الهدف هو الحفاظ على السياق القابل لإعادة الاستخدام وتقليل حسابات التمهيد المتكررة، واحدة من المراحل الأكثر استهلاكًا للموارد في الاستدلال بالسياق الطويل.
يؤكد WEKA أن الاختبارات على منصة Oracle Cloud Infrastructure باستخدام وحدات معالجة الرسومات H100 أنتجت عشرة أضعاف زيادة في إنتاجية الرموز، و عشرة أضعاف زيادة في عدد المستخدمين المتزامنين، وسبعة أضعاف زيادة في الرموز لكل وحدة معالجة رسومات.
هذه الأرقام هي معايير أداء محددة بالتحميل وليست توقعات أداء عالمية، ولكنها توضح لماذا أصبحت إدارة الذاكرة المستدامة جزءًا مهمًا من تصميم البنية التحتية للاستدلال.
WEKApod 3 يتحكم في طبقة الأجهزة
في حين أن أنظمة WEKApod السابقة جمعت بين برمجيات WEKA وبنية تحتية مسبقة التحقق، يتحرك الجيل الثالث إلى تصميم نظام متكامل رأسيًا.
صمم WEKA هيكل الشاسيه الجديد، ووصلات الأقراص، وهندسة التبريد، وأقسام الفشل، ونظام الخدمة. تستخدم الأجهزة PCIe Gen 6 داخليًا وشبكات NVIDIA (NVDA ) ConnectX للاتصال ببنية تحتية Ethernet Spectrum-X.
تتكون عائلة WEKApod الآن من ثلاثة أنظمة قابلة للتكوين. يتم تحسين Nitro للاستدلال شديد الحساسية للنطاق الترددي والتحميلات الاصطناعية لمصنع الذكاء الاصطناعي. يجمع Prime بين خلايا ثلاثية المستوى ورباعية المستوى للفلاش لتحقيق توازن بين الأداء والسعة. يركز Prime Max على كثافة التخزين القصوى، حيث يمكن وضع ما يصل إلى 70 قرصًا NVMe في شاسيه من两个 وحدة.
في نهاية المطاف، يمكن أن توفر Prime Max 441.5 بيتابايت من السعة الخام و1.1 إكسابايت من السعة الفعالة بعد اختزال البيانات بواسطة NeuralMesh. يتم تصنيف نظام الشاسيه على أنه يصل إلى 10.2 تيرابايت في الثانية من خلالput و210 مليون عملية ввод/إخراج في الثانية.
الفرق بين السعة الخام والفعالة مهم. يعتمد رقم الإكسابايت على الانخفاض الذي يمكن تحقيقه عبر البيانات المخزنة وينبغي عدم تفسيره على أنه أكثر من إكسابايت من الفلاش المادي.
مصمم للمراكز التحتية المقيدة
كما تتمثل الأنظمة الجديدة في معالجة القيود الفيزيائية التي تشكل بشكل متزايد مشاريع البنية التحتية للذكاء الاصطناعي.
تتطلب مجموعات وحدات معالجة الرسومات كميات كبيرة من الكهرباء، والتبريد، والشبكات، والمساحة الأرضية. يمكن أن تقلل أنظمة التخزين التي تستهلك هذه الموارد بشكل غير فعال من عدد وحدات المعالجة التي يمكن لدائرة معالجة الرسومات دعمها.
يزعم WEKA أن الأنظمة الجديدة توفر كثافة سعة فعالة أكبر بنسبة 267٪ وكثافة أداء أكبر بنسبة 114٪ من أفضل بديل متاح بشكل عام في فئاتهما.
كما صمم الشركة الأنظمة للعمل في درجات حرارة غرفة تصل إلى 35 درجة مئوية. يهدف التحكم البرمجي في الطاقة إلى تقليل الأداء تدريجيًا خلال الإجهاد الحراري بدلاً من تشغيل إيقاف التشغيل.
تصميم الشاسيه بدون لوحة خلفية يخلق أقسام فشل أصغر، بينما يتم توجيه إجراءات استبدال الأقراص القابلة للفك و إجراءات الاستبدال لمتقلصين لتحسين وقت الصيانة. يمكن للعملاء تكوين نوع الشاسيه، والذاكرة، وسعة القرص، وعدد الأقراص، مع توزيعات تتراوح من أقل من بيتابايت واحد إلى أكثر من 100 بيتابايت.
بناء نظام بيئي حول مصانع الذكاء الاصطناعي
تشير الإعلانات الشريكة إلى أن المنصة ستوفر للعملاء من خلال مشغلين البنية التحتية، ومزودي الخدمات السحابية، وشركات تنسيق الذكاء الاصطناعي.
Spectro Cloud يضع NeuralMesh كطبقة بيانات يمكن دمجها مع PaletteAI لتنفيذ وتشغيل مصانع الذكاء الاصطناعي للمؤسسات. تخطط World Wide Technology وComputacenter لدمج الأنظمة في مشاريع بنية تحتية أوسع، بينما أشار Glocomp إلى الطلب المتزايد من العملاء على أداء أفضل للذكاء الاصطناعي وتكلفة بنية تحتية أكثر تحديدا.
هذه استراتيجية النظام البيئي مهمة لأن معظم المنظمات لا تجميع بيئات الإنتاج الاصطناعي من مورد واحد.
يمكن أن يتضمن التوزيع النموذجي وحدات معالجة الرسومات، والشبكات، والتخزين، وKubernetes، وبرمجيات الخدمة، والرصد، والأمان، والحوكمة من موردين متعددين. يمكن أن تقلل التكوينات المعتمدة بشكل مشترك من عمل التكامل، على الرغم من أن العملاء سيظلون بحاجة إلى اختبار الأداء باستخدام نماذجهم، و مجموعات بياناتهم، وشبكاتهم، ومتطلبات التزامن الخاصة بهم.
ما يعنيه هذا للبنية التحتية للذكاء الاصطناعي
الجوانب الأكثر أهمية في الإعلان ليس أي رقم سعة أو سرعة معين. إنها التلاشي المتزايد لتخزين البيانات، والذاكرة الموزعة، وإدارة الذاكرة، وحركة البيانات، وعزل المستأجر.
随着 احتفاظ وكلاء الذكاء الاصطناعي بتاريخ أطول، ووصول المزيد من المعلومات المؤسسية، والعمل بشكل مستمر، ستحدد البنية التحتية المحيطة بوحدات معالجة الرسومات بشكل متزايد تكلفة كل استجابة مفيدة.
إضافة المزيد من وحدات المعالجة لن تحل انسدادات CAUSED بواسطة معالجة السياق المتكررة، أو حركة البيانات البطيئة، أو بروتوكولات متجزئة، أو سعة تخزين غير مستخدمة. سيت phụ thuộc الطور التالي من البنية التحتية للذكاء الاصطناعي على تغذية وحدات معالجة الرسومات بشكل فعال وكفء كما يعتمد على زيادة الحوسبة الخام.
NeuralMesh 6 من المقرر أن يصبح متاحًا بشكل عام خلال النصف الثاني من عام 2026، مع أهلية العملاء الحاليين للترقية من خلال القناة البرمجية العادية. الأنظمة الجديدة WEKApod Nitro، وPrime، وPrime Max متاحة للطلب، ومن المتوقع أن تبدأ التسليمات في خريف 2026.












