نماذج ومنصات الذكاء الاصطناعي

AWS تكشف عن طبقة التحكم المفتوحة المصدر HyperPod InstantStart للعمليات الوكيلية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قامت Amazon Web Services بتفصيل HyperPod InstantStart، وهي طبقة تحكم مفتوحة المصدر تجمع بين تنسيق Amazon EKS وقدرات Amazon SageMaker HyperPod المدارة، في منشور مدونة AWS لتعلم الآلة نُشر في 4 سبتمبر 2026. يربط المشروع واجهة ويب مع وكيل ذكاء اصطناعي يخطط وينفذ عمليات مجموعة متعددة المراحل عبر أدوات Model Context Protocol.

يعمل InstantStart كحاوية إدارة منفصلة داخل حساب AWS للمستخدم، حيث يستدعي واجهات برمجة تطبيقات خدمات AWS وواجهة برمجة تطبيقات Kubernetes دون أن يكون في مسار بيانات وظائف التدريب أو طلبات الاستدلال. كل مورد يُنشئه هو كائن قياسي من AWS أو Kubernetes يظل قابلاً للفحص عبر واجهة سطر أوامر AWS وkubectl. واجهة الويب، وواجهة برمجة تطبيقات REST، وأدوات MCP التي يستخدمها الوكيل هي ثلاث وجوه لنفس الحاوية، لذا تدخل كلتا الواجهتين عبر نظام خلفي واحد وتخضع لنفس عمليات التحقق.

نظام خلفي واحد خلف واجهتين

الحجة التصميمية المركزية في المقال هي أن أدوات MCP تغلف واجهات برمجة تطبيقات REST الخاصة بطبقة التحكم نفسها بدلاً من CLI أو SDK الخاص بـ AWS، وبالتالي حماية واحدة تُضاف تحمي المتصفح والوكيل على حد سواء. في واجهة الويب، إنشاء مجموعة مع تثبيت الاعتمادات، وتفعيل استعادة العقد تلقائيًا، وربط التخزين يُظهر كاستمارة ولوحة تقدم؛ وفي الطرفية، يُعبّر عنه بجملة واحدة بلغة طبيعية إلى تكوين الوكيل المسمى hypd-inst-agent، مبني لـ Kiro CLI. ثم يُرتّب الوكيل العمل: إنشاء طبقة تحكم EKS، اختيار مجموعة نشطة، تصالح الاعتمادات، إنشاء مجموعة HyperPod، وإعداد التخزين. تقول AWS إن إنشاء طبقة تحكم EKS يكتمل تقريبًا خلال 8 إلى 12 دقيقة، وكل مرحلة لاحقة تسجّل حالتها الخاصة ويمكن إعادة محاولتها بشكل مستقل.

ثلاث قواعد سير عمل مُشفّرة في مهارات الوكيل الخاصة بالمشروع، والتي يصفها المقال كدفاتر تشغيل markdown مُصدّرة في المستودع. الوكيل يراقب كل عملية طويلة الأمد حتى تصل إلى حالة نهائية بدلاً من الإبلاغ عن طلب مُقدَّم. يطرح فقط أسئلة من مستوى اتخاذ القرار، مثل منطقة التوفر، نوع المثيل، ونوع السعة، بينما يتعامل مع CIDR الشبكات الفرعية، جداول التوجيه، ومجموعات الأمان كعمل طبقة تحكم. كما أنه يفحص قبل الإنشاء، مُدرجًا المجموعات الموجودة ومستفسرًا عن المناطق والأنواع الصالحة قبل تقديم الخيارات.

القدرات المدارة كحالة متصالحة

ينشئ InstantStart مجموعات HyperPod مع تمكين استعادة العقد تلقائيًا، حيث يمكن لـ HyperPod إعادة تشغيل أو استبدال العقد المعيبة بناءً على وكيل مراقبة الصحة، وفحوصات الصحة الأساسية، وفحوصات الصحة المتعمقة الاختيارية التي تختبر إجهاد وحدات معالجة الرسوميات واتصال Elastic Fabric Adapter قبل أن تقبل العقد العمل. عندما يضيف المستخدم مجموعة مثيلات، يتم تسوية نوع السعة، وضع واجهة الشبكة، وموقع الشبكة الفرعية كعملية إنشاء واحدة؛ يُثبت نوع السعة ووضع الواجهة EFA‑only طوال عمر المجموعة. يوجه نظام التحكم كل مسار سعة عبر دالة واحدة تُوفر شبكات فرعية حسابية بحجم /20 لأساطيل مسرعات كبيرة.

تقرر آلية التحجيم التلقائي للـ Karpenter المُدارة على HyperPod مقدار السعة التي تعمل في أي لحظة، مع تشغيل AWS لمدير Karpenter نفسه وإطلاق العقد من مجموعات مثيلات HyperPod التي تُوسع من الصفر. يلاحظ المقال حدًا واحدًا في النطاق: Karpenter المُدار يدير مجموعات مثيلات HyperPod، وليس سعة Amazon EC2 العامة.

تُظهر لوحة “الميزات المتقدمة” القدرات المدارة لـ HyperPod، بما في ذلك مشغّل التدريب، مشغّل الاستدلال، حفظ النقاط المتدرجة المُدار، والتحجيم التلقائي المُدار، حيث يُربط كل زر تشغيل بعملية خلفية واعية بالاعتمادات. تمكين حفظ النقاط المتدرجة يُنشئ سلسلة هوية تمتد عبر حساب خدمة Kubernetes، ودور وسياسة IAM، وعلاقة ثقة OpenID Connect، وتعليقة الربط، وتعطيله يزيل السلسلة نفسها. يصف المقال أيضًا عقدة “explicit‑diff” التي تم اعتمادها بعد عطل مبكر: الواجهة تُرسل فقط الحقول التي غيرها المستخدم فعليًا، والنظام الخلفي يقرأ حالة المجموعة الفعلية ولا يُنفّذ أي عملية عندما تكون الحالة المطلوبة مطابقة للحالة الحالية.

مسارات التدريب والاستدلال

للتدريب، يقدم InstantStart مسارين للإرسال. مشغّل التدريب لـ HyperPod، المُثبت كملحق EKS، يضيف استعادة أخطاء على مستوى العملية، واكتشاف تعطل الوظائف عبر مراقبة نمط السجلات، واكتشاف القيم المتطرفة، مع إرسال العمل كموارد HyperPodPyTorchJob تحمل ميزانية استعادة مرئية. المسار الثاني هو KubeRay القياسي، موجه لأعباء عمل Ray الأصلية مثل التعلم التعزيزي. فوق كلا المسارين توجد طبقة وصفة للسكربتات البسيطة لـ PyTorch، وLLaMA‑Factory، وMS‑Swift، وVERL للتعلم التعزيزي، جميعها تشترك في عقدة بيانات واحدة حيث يُركّب نفس دلو Amazon S3 في بيئة التطوير وداخل الحاويات. تُبث سجلات الوظائف إلى المتصفح عبر WebSocket، ويمكن للوصفات الإبلاغ عن مقاييس مثل معدل التدريب إلى MLflow المُدار على Amazon SageMaker AI.

الاستدلال يتبع أيضًا مسارين. المسار المُدار يُسلم دورة الحياة إلى مشغّل الاستدلال لـ HyperPod، مع تخزين مؤقت KV متدرج مُدار واستراتيجيات توجيه ذكية تُعلن جنبًا إلى جنب مع نقطة النهاية. المسار ذاتي‑الإدارة ينشر حاوية خدمة من اختيار المستخدم، مثل vLLM أو SGLang، كنشر قياسي على Kubernetes، مع أشكال خدمة تشمل موازن تحميل خارجي، خدمة داخلية للمجموعة، ومجموعة نماذج من عمال GPU الدافئين يمكن إعادة تعيينهم بتغيير تسمية. لخدمة SGLang متعددة النسخ، يمكن لنظام التحكم نشر موجه SGLang مع توجيه واعٍ بالذاكرة المؤقتة وتحفيز التحجيم التلقائي عبر Kubernetes Event‑driven Autoscaling.

أدوات الوكيل والحدود

ينشر خادم MCP 38 أداةً تغطي دورة حياة المجموعة، مجموعات المثيلات، الميزات المدارة، التخزين، تنزيل النماذج، نشر الاستدلال، الوظائف، وعمليات العقد، وفقًا للمقال. كل أداة تعديل تُسمي أداة الحالة التي تحدد الانتهاء، وتُحافظ العمليات على مرحلتها قبل بدء الاستطلاع بحيث لا يمكن لإعادة محاولة الوكيل إعادة تشغيل تعديل. يصف مستودع GitHub الخاص بالمشروع المنصة بأنها نظام متكامل للتدريب والاستدلال مبني على SageMaker HyperPod وتنسيق EKS القياسي، وتوضح وثيقة README أن أدوات MCP تغلف واجهات برمجة تطبيقات الخلفية للمشروع لضمان الامتثال لأفضل الممارسات بينما تُنسق مهارات الوكيل سير عمل شامل دون أي إعداد محلي بخلاف الوكيل.

يستخلص المقال حدودًا تشغيلية صريحة. تُجري مهارات التشخيص المدمجة لـ NCCL، وصحة العقد، وفشل إنشاء المجموعات تحقيقًا للقراءة فقط بشكل مستقل، وتعرض أوامر تغيير الحالة كاقتراحات، وتتصاعد بالترتيب: تحقق، ثم إعادة تشغيل، ثم استبدال. تظل IAM، وتفويض Kubernetes، وضوابط الشبكة، والتحقق الخلفي هي الحدود الأمنية الفعلية؛ يوسع الوكيل الوصول إلى طبقة التحكم دون توسيع صلاحياته. كما تُشير AWS إلى أن التدريب المرن حاليًا يستثني مثيلات Spot، وحفظ النقاط المتدرجة المُدار، والتدريب بدون نقاط حفظ، وأن حصص استخدام مجموعات SageMaker HyperPod وحجوزات خطط التدريب لأنواع GPU المتقدمة تحتاج إلى ترتيب قبل إنشاء أول مجموعة.

يبدأ النشر من قالب CloudFormation يُنشئ بيئة الإدارة، ودلو S3 مشترك، وأدوار IAM داعمة، مع تقديم واجهة الويب من الحاوية على المنفذ 3099 والوصول إليها عبر جلسة توجيه منفذ من AWS Systems Manager.

ثيو ناش هو خبير في مجال الذكاء الاصطناعي في Unite.AI ، ويهتم ببنية تحتية للذكاء الاصطناعي والحوسبة والأنظمة المادية التي تعمل بالذكاء الاصطناعي الحديث. يركز عمله على الأسس الفنية خلف حمولات الذكاء الاصطناعي على نطاق واسع ، بما في ذلك مراكز البيانات والمسرعات والشبكات وبرامج التطبيقات التي تربطها معًا.
بمنظور تحليلي ومهندس مدفوع ، يفحص ثيو كيف تتيح التطورات في وحدات معالجة الرسومات والصمامات المخصصة وعمليات الذاكرة والأنظمة الموزعة لأجيال جديدة من نماذج الذكاء الاصطناعي. يهتم بشكل خاص بالتضحيات في الأداء والكفاءة في استهلاك الطاقة وال قابلية للتوسيع والقيود العملية التي تشكل النشر الفعلي للبنية التحتية للذكاء الاصطناعي.
المقالات التي كتبها ثيو ناش يتم إنشاؤها بواسطة الذكاء الاصطناعي ومراجعتها بواسطة فريق التحرير في Unite.AI لضمان الدقة الفنية والوضوح والتغطية المسؤولة للمناظر الحوسبية للذكاء الاصطناعي التي تتطور بسرعة.