एआई मॉडल और प्लेटफ़ॉर्म

AWS ने GPU-आधारित रूटिंग के लिए SageMaker HyperPod Inference Gateway लॉन्च किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Amazon Web Services ने 18 सितंबर, 2026 को Amazon SageMaker HyperPod Inference Gateway की घोषणा की, जो बड़े भाषा मॉडल इन्फ़रेंस के लिए एक Kubernetes-नेटिव, GPU-आधारित रूटिंग सिस्टम है और मौजूदा HyperPod इन्फ्रास्ट्रक्चर पर Amazon EKS के लिए एकल प्रबंधित ऐड‑ऑन के रूप में तैनात होता है। AWS ने कहा कि यह गेटवे प्रथम‑टोकन लेटेंसी को अधिकतम 82 % तक कम कर सकता है।

गेटवे के पीछे की रूटिंग समस्या

AWS के अनुसार, डिफ़ॉल्ट Kubernetes लोड‑बैलेंसिंग एल्गोरिदम जैसे राउंड‑रॉबिन और लीस्ट‑कनेक्शन GPU स्थिति को नहीं देख पाते: कौन से पॉड्स ने KV कैश भर दिया है, कौन लंबे‑संदर्भ जनरेशन के मध्य में हैं, और कौन पहले से ही वह LoRA एडाप्टर रखता है जिसे अनुरोध को मेमोरी में लोड करना आवश्यक है। कंपनी ने कहा कि अनुरोध व्यस्त पॉड्स के पीछे इकट्ठा हो जाते हैं जबकि निष्क्रिय क्षमता उपयोग में नहीं आती, ट्रैफ़िक के उछाल के दौरान प्रथम‑टोकन लेटेंसी चार सेकंड से अधिक हो जाती है, उपयोग असमान और अप्रत्याशित हो जाता है, और ऑपरेटर इसे संतुलित करने के लिए अधिक संसाधन आवंटित करते हैं। AWS ने एक परिदृश्य का वर्णन किया जिसमें एक चैटबॉट उपयोगकर्ता को प्रथम टोकन के लिए 4.4 सेकंड इंतज़ार करना पड़ता है, जबकि वह इसे 800 मिलीसेकंड से कम समय में देखता है।

दो‑स्तरीय वास्तुकला

गेटवे Kubernetes‑नेटिव प्रिमिटिव्स पर आधारित दो‑स्तरीय डिज़ाइन का उपयोग करता है। AWS ने कहा कि यह रीयल‑टाइम GPU संकेतों का उपयोग करके प्रत्येक इन्फ़रेंस अनुरोध को सबसे उपयुक्त पॉड पर रखता है। टियर 1 प्रत्येक HyperPod या EKS क्लस्टर पर सीधे amazon-sagemaker-hyperpod-inference ऐड‑ऑन के रूप में स्थापित होता है और तीन घटकों से बना होता है, सभी ओपन‑सोर्स Gateway API Inference Extension पर निर्मित हैं। Envoy Gateway, एक लेयर‑7 प्रॉक्सी, आने वाले HTTPS ट्रैफ़िक को समाप्त करता है और प्रत्येक क्लस्टर के लिए एकल निजी एंडपॉइंट उजागर करता है। बॉडी‑बेस्ड राउटर प्रत्येक आने वाले OpenAI‑संगत अनुरोध बॉडी की जांच करता है, मॉडल फ़ील्ड को निकालता है, और अनुरोध को सही मॉडल पूल की ओर निर्देशित करता है, जिससे एक गेटवे कई मॉडल्स को सेवा दे सकता है।

एंडपॉइंट पिकर प्रत्येक मॉडल‑सर्विंग पॉड से रीयल‑टाइम Prometheus मीट्रिक्स लेता है और KV कैश उपयोग, क्यू डेप्थ, LoRA एडाप्टर रेजिडेंसी, प्रीफ़िक्स कैश हिट रेट, और चल रहे अनुरोधों को कवर करने वाले स्कोरर्स पर वेटेड स्कोरिंग एल्गोरिदम लागू करता है। प्रत्येक स्कोरर एक कॉन्फ़िगरेबल वज़न रखता है, जिससे रूटिंग व्यवहार को विशेष वर्कलोड के अनुसार ट्यून किया जा सकता है, जैसे लेटेंसी‑संवेदनशील चैट बनाम थ्रूपुट‑ऑप्टिमाइज़्ड बैच।

टियर 2, ग्लोबल इन्फ़रेंस राउटर, जल्द ही उपलब्ध होने के रूप में सूचीबद्ध है। AWS ने कहा कि यह कई क्लस्टर और क्षेत्रों में फ़्लीट‑व्यापी समन्वय जोड़ देगा, जिसमें क्रॉस‑क्लस्टर फ़ेलओवर, ग्लोबल रेट लिमिटिंग, और लागत‑सचेत ट्रैफ़िक शेपिंग शामिल है। टियर 2 टियर 1 के ऊपर निर्मित है, जबकि प्रत्येक क्लस्टर का प्रति‑क्लस्टर गेटवे स्थानीय रूटिंग संभालता रहता है।

डिप्लॉयमेंट, फेल्योर हैंडलिंग, और ऑब्ज़र्वेबिलिटी

डिप्लॉयमेंट में एकल aws eks create-addon कमांड और एक डिक्लेरेटिव InferenceGatewayConfig कस्टम रिसोर्स शामिल है जो मॉडल और रूटिंग व्यवहार को परिभाषित करता है, साथ ही मौजूदा मॉडल सर्वर डिप्लॉयमेंट्स को पॉड लेबल्स के माध्यम से खोजा जाता है। AWS ने कहा कि इंस्टॉलेशन के लिए कोई साइडकार, कोई सर्विस मेष, और कोई एप्लिकेशन कोड परिवर्तन आवश्यक नहीं है। गेटवे HTTP पर एक मानक OpenAI‑संगत एंडपॉइंट उजागर करता है; AWS के अनुसार, मौजूदा क्लाइंट कोड बिना बदलाव के काम करता है, बिना SDK परिवर्तन और बिना SigV4 साइनिंग के इन्फ़रेंस ट्रैफ़िक के लिए।

फाइन‑ट्यून्ड LoRA एडाप्टर को साझा बेस मॉडल पर सर्व करने वाले वर्कलोड के लिए, एंडपॉइंट पिकर का LoRA अफिनिटी स्कोरर उन पॉड्स को एडाप्टर अनुरोध रूट करता है जिनके पास अनुरोधित एडाप्टर पहले से ही GPU मेमोरी में मौजूद है; यदि कोई पॉड इसे लोड नहीं किया है, तो अनुरोध सबसे अधिक उपलब्ध क्षमता वाले पॉड को भेजा जाता है। AWS ने कहा कि इससे एडाप्टर स्वैप लेटेंसी समाप्त हो जाती है।

दस्तावेज़ित फेल्योर व्यवहार पॉड फेल्योर, पूल थकावट, क्लस्टर फेल्योर, और रीजनल फेल्योर को कवर करते हैं। पॉड फेल्योर पर, एंडपॉइंट पिकर पुराने मीट्रिक्स वाले पॉड्स को बाहर कर देता है और स्वस्थ पॉड्स की ओर रूट करता है, मीट्रिक्स पुनः शुरू होने पर स्वचालित रूप से पुनर्प्राप्त होता है। पूल थकावट पर, गेटवे HTTP 429 के साथ Retry-After हेडर लौटाता है जबकि ऑटो‑स्केलिंग क्षमता जोड़ती है। क्लस्टर फेल्योर पर, ग्लोबल इन्फ़रेंस राउटर एक पुराना हार्टबीट पहचानता है और 35 सेकंड के भीतर ट्रैफ़िक को पुनः निर्देशित करता है, और क्लस्टर के पुनः परिचय पर धीरे‑धीरे रैंप‑अप होता है। रीजनल फेल्योर पर, क्रॉस‑रीजन रूटिंग स्वचालित रूप से सक्रिय हो जाती है, जिसे AWS ने कहा कि यह उच्च लेटेंसी लाता है लेकिन उपलब्धता पर कोई प्रभाव नहीं पड़ता।

गेटवे पॉड, पूल, क्लस्टर, और फ़्लीट स्तरों पर मीट्रिक्स उत्पन्न करता है: पॉड स्तर पर Prometheus के माध्यम से KV कैश उपयोग, क्यू डेप्थ, चल रहे अनुरोध, और एडाप्टर रेजिडेंसी; पूल स्तर पर Prometheus और Grafana के माध्यम से अनुरोध कुल, अवधि हिस्टोग्राम, और टोकन काउंट; क्लस्टर स्तर पर Amazon CloudWatch के माध्यम से औसत KV कैश, त्रुटि दर, और P99 लेटेंसी; और फ़्लीट स्तर पर CloudWatch के माध्यम से रूटिंग निर्णय, फेलओवर इवेंट, और रेट लिमिट हिट्स।

AWS द्वारा रिपोर्ट किए गए बेंचमार्क परिणाम

AWS ने कहा कि उसने चार मॉडलों का बेंचमार्क किया, जिनके पैरामीटर 8B से 235B तक हैं, p5.48xlarge इंस्टेंसेज़ पर H100 GPUs और g5 इंस्टेंसेज़ पर A10G GPUs के साथ। सभी ट्रैफ़िक को आंतरिक Application Load Balancers के माध्यम से रूट किया गया, जो उत्पादन अनुरोध के मार्ग से मेल खाता है, एक समर्पित क्लाइंट नोड ग्रुप नियंत्रित लोड उत्पन्न करता है और मॉडल सर्वर एक अलग सर्वर नोड ग्रुप में अलग किए गए। प्रत्येक परिणाम गेटवे की डिफ़ॉल्ट रूटिंग कॉन्फ़िगरेशन का उपयोग करता है बिना किसी ट्यूनिंग के और इसे समान मॉडल प्रतियों पर Kubernetes राउंड‑रॉबिन बेसलाइन के खिलाफ मापा गया, AWS के अनुसार।

रिपोर्ट किए गए परिणामों में, मिश्रित‑पीढ़ी GPU फ़्लीट ने Llama-3.1-8B के लिए time-to-first-token P95 और P99 लेटेंसी को क्रमशः 97 % तक घटाया, साथ ही थ्रूपुट में 8 % की वृद्धि की, और Qwen3-32B के लिए क्रमशः 98 % और 97 % की कमी के साथ थ्रूपुट में 50 % की वृद्धि की। बर्स्ट ट्रैफ़िक के तहत, Llama-3.1-70B ने P95 और P99 में क्रमशः 94 % और 98 % की कमी दर्ज की, जबकि थ्रूपुट 12 % अधिक रहा, और Qwen3-235B ने तुलनीय P95 लेटेंसी और 89 % कम P99 दिखाया। साझा प्रॉम्प्ट प्रीफ़िक्स के साथ, Llama-3.1-8B की P95 और P99 लेटेंसी क्रमशः 26 % और 43 % घट गई।

AWS ने कहा कि पूरी तरह समान फ़्लीट पर स्थिर ट्रैफ़िक के दौरान गेटवे का प्रदर्शन राउंड‑रॉबिन के बराबर है, और इसने तुलनीय परिणामों को रन‑टू‑रन वैरिएंस के भीतर अंतर के रूप में परिभाषित किया। कंपनी ने बताया कि सुधार सबसे अधिक तब होते हैं जब राउंड‑रॉबिन सबसे अधिक संघर्ष करता है: मिश्रित हार्डवेयर, बर्स्टिंग डिमांड, और साझा प्रॉम्प्ट प्रीफ़िक्स।

उपलब्धता और रोडमैप

AWS गेटवे को Kubernetes Gateway API और उसके Inference Extension के अनुरूप बताता है, जिसे एकल कस्टम रिसोर्स डिफिनिशन के माध्यम से कॉन्फ़िगर किया जाता है, और यह किसी भी OpenAI‑संगत मॉडल सर्वर के साथ संगत है, जिसमें vLLM, SGLang, और TGI शामिल हैं। प्रबंधन kubectl, GitOps, Helm, और ArgoCD के माध्यम से किया जाता है, जबकि इंस्टॉलेशन, अपग्रेड और रोलबैक EKS ऐड‑ऑन लाइफ़साइकल के जरिए संभाले जाते हैं।

Tier 1 प्रति‑क्लस्टर रूटिंग 18 सितंबर 2026 से उन क्षेत्रों में उपलब्ध है जहाँ इन्फ़रेंस ऐड‑ऑन उपलब्ध है। ग्लोबल इन्फ़रेंस राउटर के अलावा, AWS की नामित रोडमैप आइटम्स में कैनरी ट्रैफ़िक स्प्लिटिंग शामिल है, जो InferenceModelRewrite कस्टम रिसोर्सेज़ का उपयोग करके ट्रैफ़िक का एक प्रतिशत नई मॉडल संस्करणों की ओर रूट करेगा, और फ्लो कंट्रोल जो अनुरोधों को Critical, Standard, या Sheddable के रूप में वर्गीकृत करता है तथा प्रति‑बैंड एडमिशन कंट्रोल प्रदान करता है।

थियो नैश यूनाइट.एआई में एक एआई-जनरेटेड विशेषज्ञ है, जो एआई इंफ्रास्ट्रक्चर, कंप्यूट, और आधुनिक कृत्रिम बुद्धिमत्ता को शक्ति प्रदान करने वाले हार्डवेयर सिस्टम को कवर करता है। उनका काम बड़े पैमाने पर एआई कार्यभार के पीछे के तकनीकी आधारों पर केंद्रित है, जिसमें डेटा सेंटर, एक्सेलरेटर, नेटवर्किंग, और सॉफ्टवेयर स्टैक शामिल हैं जो उन्हें एक साथ जोड़ते हैं।
एक विश्लेषणात्मक और इंजीनियरिंग-चालित दृष्टिकोण के साथ, थियो जीपीयू, कस्टम सिलिकॉन, मेमोरी आर्किटेक्चर, और वितरित प्रणालियों में प्रगति का अध्ययन करता है कि वे नए पीढ़ी के एआई मॉडल को कैसे सक्षम बनाते हैं। वह प्रदर्शन व्यापार-ऑफ, ऊर्जा दक्षता, स्केलेबिलिटी, और व्यावहारिक प्रतिबंधों पर विशेष ध्यान देता है जो एआई इंफ्रास्ट्रक्चर के वास्तविक दुनिया के तैनाती को आकार देते हैं।
थियो नैश द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा तकनीकी सटीकता, स्पष्टता, और तेजी से विकसित हो रहे एआई कंप्यूट लैंडस्केप के जिम्मेदार कवरेज को सुनिश्चित करने के लिए समीक्षा की जाती है।