نماذج ومنصات الذكاء الاصطناعي

AWS تُطلق بوابة الاستدلال SageMaker HyperPod لتوجيه واعٍ للمعالج الرسومي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أعلنت Amazon Web Services عن Amazon SageMaker HyperPod Inference Gateway في 18 سبتمبر 2026، وهو نظام توجيه واعٍ للمعالج الرسومي ومصمم أصلاً لـ Kubernetes لتخمين نماذج اللغة الكبيرة يُنشر كملحق مُدار واحد لـ Amazon EKS على البنية التحتية الحالية لـ HyperPod. صرّح AWS أن البوابة يمكنها خفض زمن الاستجابة للرمز الأول بنسبة تصل إلى 82٪.

مشكلة التوجيه وراء البوابة

وفقًا لـ AWS، لا تمتلك خوارزميات موازنة التحميل الافتراضية في Kubernetes مثل round-robin وleast-connections أي رؤية لحالة المعالج الرسومي: أي الحاويات التي استنفدت ذاكرة التخزين المؤقت KV، وأيها في منتصف توليد سياق طويل، وأيها التي لديها بالفعل محول LoRA المطلوب محملاً في الذاكرة. ذكرت الشركة أن الطلبات تتراكم خلف الحاويات المشغولة بينما تظل السعة الخالية غير مُستخدمة، ويتصاعد زمن الاستجابة للرمز الأول إلى أكثر من أربع ثوانٍ أثناء فترات الازدحام، وتصبح الاستفادة غير متساوية وغير قابلة للتنبؤ، ويقوم المشغلون بزيادة الموارد لتعويض ذلك. وصفت AWS سيناريو حيث ينتظر مستخدم روبوت الدردشة 4.4 ثوانٍ للحصول على الرمز الأول، لكنه يحصل عليه في أقل من 800 مللي ثانية.

معمارية ذات مستويين

تستخدم البوابة تصميمًا ذا مستويين مبنيًا على بدائل أصلية لـ Kubernetes. صرّح AWS بأنها تستخدم إشارات المعالج الرسومي في الوقت الفعلي لتوجيه كل طلب استدلال إلى الحاوية الأنسب. يتم تثبيت المستوى الأول مباشرةً على كل HyperPod أو مجموعة EKS كملحق amazon-sagemaker-hyperpod-inference ويتكوّن من ثلاثة مكوّنات، جميعها مبنية على امتداد Gateway API Inference المفتوح المصدر. Envoy Gateway، وهو وكيل من الطبقة السابعة، ينهى حركة مرور HTTPS الواردة ويكشف عن نقطة نهاية خاصة واحدة لكل مجموعة. يقوم الموجّه القائم على الجسم (Body-Based Router) بفحص جسم كل طلب متوافق مع OpenAI الوارد، يستخرج حقل النموذج، ويوجه الطلب إلى مجموعة النماذج الصحيحة، بحيث يمكن لبوابة واحدة خدمة نماذج متعددة.

يستخلص مُختار النقطة النهاية (Endpoint Picker) مقاييس Prometheus في الوقت الفعلي من كل حاوية تخدم نموذجًا ويطبق خوارزمية تقييم مرجّحة عبر المقيمين الذين يغطيون استهلاك ذاكرة التخزين المؤقت KV، عمق الطابور، إقامتة محول LoRA، معدل ضربات ذاكرة التخزين المؤقت للبادئة، والطلبات الجارية. يحمل كل مقيم وزنًا قابلاً للتكوين، مما يسمح بضبط سلوك التوجيه وفقًا لحمولة عمل محددة، مثل الدردشة الحساسة للزمن مقابل الدفعات المُحسّنة للإنتاجية.

المستوى الثاني، وهو الموجّه العالمي للاستدلال (Global Inference Router)، مُدرج كقريبًا. صرّح AWS بأنه سيضيف تنسيقًا على مستوى الأسطول عبر مجموعات إقليمية ومتعددة، مع تحويل فشل عبر المجموعات، وتحديد معدل عالمي، وتشكيل حركة مرور واعٍ بالتكلفة. يبني المستوى الثاني على المستوى الأول، بينما تستمر بوابة كل مجموعة في معالجة التوجيه المحلي.

النشر، معالجة الفشل، والرصد

يتكوّن النشر من أمر واحد aws eks create-addon وموارد مخصصة واحدة من نوع InferenceGatewayConfig تُعرّف النماذج وسلوك التوجيه، مع اكتشاف عمليات نشر خوادم النماذج الحالية عبر تسميات الحاويات. صرّح AWS أن التثبيت لا يتطلب حاويات جانبية، ولا شبكة خدمات، ولا تغييرات في شفرة التطبيق. تُظهر البوابة نقطة نهاية قياسية متوافقة مع OpenAI عبر HTTP؛ وفقًا لـ AWS، يعمل شفرة العميل الحالية دون تعديل، دون الحاجة لتغييرات في SDK ولا توقيع SigV4 لحركة استدلال المرور.

بالنسبة لأحمال العمل التي تخدم محولات LoRA المُدربة بدقة على نموذج أساسي مشترك، يقوم مُقيم تقارب LoRA في مُختار النقطة النهاية (Endpoint Picker) بتوجيه طلبات المحول إلى الحاويات التي لديها المحول المطلوب مقيم بالفعل في ذاكرة GPU؛ إذا لم تتوفر أي حاوية محملة له، يُوجه الطلب إلى الحاوية ذات السعة المتاحة الأكبر. صرّح AWS أن ذلك يلغي زمن تبادل المحولات.

تشمل سلوكيات الفشل الموثقة فشل الحاوية، استنفاد المجموعة، فشل العنقود، والفشل الإقليمي. عند فشل الحاوية، يستبعد مُختار النقطة النهاية (Endpoint Picker) الحاويات ذات المقاييس القديمة ويوجه الطلبات إلى الحاويات السليمة، مع استعادة تلقائية عندما تستأنف المقاييس. عند استنفاد المجموعة، تُعيد البوابة استجابة HTTP 429 مع رأس Retry-After بينما يضيف التحجيم التلقائي سعة إضافية. عند فشل العنقود، يكتشف الموجّه العالمي للاستدلال (Global Inference Router) نبضة قلب قديمة ويوجه المرور خلال 35 ثانية، مع زيادة تدريجية عند إعادة إدخال العنقود. عند الفشل الإقليمي، يُفعّل التوجيه عبر المناطق تلقائيًا، وقد صرّح AWS أن ذلك يرفع زمن الاستجابة لكنه لا يؤثر على التوافر.

تُصدر البوابة مقاييس على مستويات الحاوية، المجموعة، العنقود، والأسطول: استهلاك ذاكرة التخزين المؤقت KV، عمق الطابور، الطلبات الجارية، وإقامة المحولات عبر Prometheus على مستوى الحاوية؛ إجمالي الطلبات، رسوم بيانية للمدة، وعدد الرموز عبر Prometheus وGrafana على مستوى المجموعة؛ متوسط ذاكرة التخزين المؤقت KV، معدل الأخطاء، وزمن استجابة P99 عبر Amazon CloudWatch على مستوى العنقود؛ وقرارات التوجيه، أحداث التحويل الفاشل، وضربات حد المعدل عبر CloudWatch على مستوى الأسطول.

نتائج القياس التي أبلغت عنها AWS

أفادت AWS بأنها اختبرت أداء أربعة نماذج تتراوح معلماتها من 8 مليار إلى 235 مليار على مثيلات p5.48xlarge المزودة بمعالجات H100 GPU ومثيلات g5 المزودة بمعالجات A10G GPU. تم توجيه كل حركة المرور عبر موازنات تحميل التطبيقات الداخلية، مطابقةً المسار الذي تسلكه طلبات الإنتاج، مع مجموعة عقدة عميل مخصصة تُولّد حملًا مُتحكمًا فيه وخوادم نماذج معزولة على مجموعة عقدة خادم منفصلة. استخدم كل نتيجة تكوين التوجيه الافتراضي للبوابة دون أي ضبط، وتم قياسها مقابل خط أساس round-robin في Kubernetes على نسخ النموذج نفسها، وفقًا لـ AWS.

في النتائج المبلغ عنها، خفض أسطول GPU المختلط الجيل زمن الوصول إلى أول رمز (P95 وP99) بنسبة 97 % لكل منهما لنموذج Llama-3.1-8B، مع زيادة في معدل المعالجة بنسبة 8 %، ولـ Qwen3-32B بنسبة 98 % و97 % على التوالي، مع زيادة في معدل المعالجة بنسبة 50 %. تحت حركة مرور متقطعة، سجّل Llama-3.1-70B تخفيضات P95 وP99 بنسبة 94 % و98 % مع معدل معالجة أعلى بنسبة 12 %، بينما أظهر Qwen3-235B زمن وصول P95 مماثل وانخفاض P99 بنسبة 89 %. مع مشاركة بادئات المطالبات، انخفض زمن وصول P95 وP99 لنموذج Llama-3.1-8B بنسبة 26 % و43 %.

قالت AWS إن البوابة على أسطول موحد بالكامل تحت حركة مرور ثابتة تؤدي بمستوى يوازي التوزيع الدائري، وقد عرّفت النتائج المقارنة بأنها اختلافات ضمن تباين التشغيل من مرة إلى أخرى. وأضافت الشركة أن التحسينات تكون الأكبر حيث يواجه التوزيع الدائري صعوبات أكبر: الأجهزة المختلطة، الطلب المتقلب، ومشاركة بادئات المطالبات.

التوافر وخارطة الطريق

تصف AWS البوابة بأنها متوافقة مع واجهة برمجة تطبيقات Kubernetes Gateway وامتداد الاستدلال الخاص بها، مُكوَّنة عبر تعريف مورد مخصص واحد، ومتوافقة مع أي خادم نموذج متوافق مع OpenAI، بما في ذلك vLLM وSGLang وTGI. يتم إدارة العملية عبر kubectl وGitOps وHelm وArgoCD، مع التعامل مع التثبيت والترقيات والعودة إلى الحالة السابقة من خلال دورة حياة إضافة EKS.

يتوفر توجيه المستوى الأول لكل عنقود اعتبارًا من 18 سبتمبر 2026، في المناطق التي تتوفر فيها إضافة الاستدلال. بالإضافة إلى موجه الاستدلال العالمي، تشمل عناصر خارطة الطريق المسماة من AWS تقسيم حركة المرور التجريبية، والتي ستوجه نسبة من الحركة إلى إصدارات نماذج جديدة باستخدام موارد مخصصة InferenceModelRewrite، والتحكم في التدفق الذي يصنّف الطلبات كحرجة أو قياسية أو قابلة للتسريح مع التحكم في القبول حسب النطاق.

ثيو ناش هو خبير في مجال الذكاء الاصطناعي في Unite.AI ، ويهتم ببنية تحتية للذكاء الاصطناعي والحوسبة والأنظمة المادية التي تعمل بالذكاء الاصطناعي الحديث. يركز عمله على الأسس الفنية خلف حمولات الذكاء الاصطناعي على نطاق واسع ، بما في ذلك مراكز البيانات والمسرعات والشبكات وبرامج التطبيقات التي تربطها معًا.
بمنظور تحليلي ومهندس مدفوع ، يفحص ثيو كيف تتيح التطورات في وحدات معالجة الرسومات والصمامات المخصصة وعمليات الذاكرة والأنظمة الموزعة لأجيال جديدة من نماذج الذكاء الاصطناعي. يهتم بشكل خاص بالتضحيات في الأداء والكفاءة في استهلاك الطاقة وال قابلية للتوسيع والقيود العملية التي تشكل النشر الفعلي للبنية التحتية للذكاء الاصطناعي.
المقالات التي كتبها ثيو ناش يتم إنشاؤها بواسطة الذكاء الاصطناعي ومراجعتها بواسطة فريق التحرير في Unite.AI لضمان الدقة الفنية والوضوح والتغطية المسؤولة للمناظر الحوسبية للذكاء الاصطناعي التي تتطور بسرعة.