एआई मॉडल और प्लेटफ़ॉर्म

एजेंट ऑप्स के लिए AWS का ओपन‑सोर्स हाइपरपॉड इंस्टेंटस्टार्ट कंट्रोल प्लेन विवरण

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Amazon Web Services ने HyperPod InstantStart का विवरण दिया है, एक ओपन‑सोर्स कंट्रोल प्लेन जो Amazon EKS ऑर्केस्ट्रेशन को Amazon SageMaker HyperPod की प्रबंधित क्षमताओं के साथ संयोजित करता है, एक AWS मशीन लर्निंग ब्लॉग पोस्ट में प्रकाशित 4 सितंबर, 2026 को। यह प्रोजेक्ट एक वेब इंटरफ़ेस को एक AI एजेंट के साथ जोड़ता है जो Model Context Protocol टूल्स के माध्यम से बहु‑चरण क्लस्टर ऑपरेशन्स की योजना बनाता और निष्पादित करता है।

InstantStart एकल आउट‑ऑफ़‑बैंड प्रबंधन कंटेनर के रूप में उपयोगकर्ता के AWS खाते के भीतर चलता है, जो प्रशिक्षण कार्यों या इन्फ़रेंस अनुरोधों के डेटा पाथ में नहीं बैठते हुए AWS सेवा APIs और Kubernetes API को कॉल करता है। यह जो भी संसाधन बनाता है वह एक मानक AWS या Kubernetes ऑब्जेक्ट होता है जिसे AWS कमांड लाइन इंटरफ़ेस और kubectl के साथ निरीक्षण किया जा सकता है। वेब UI, एक REST API, और एजेंट द्वारा उपयोग किए जाने वाले MCP टूल्स एक ही कंटेनर के तीन चेहरे हैं, इसलिए दोनों इंटरफ़ेस एक ही बैकएंड से प्रवेश करते हैं और समान मान्यताओं को पार करते हैं।

दो इंटरफ़ेस के पीछे एक बैकएंड

पोस्ट का मुख्य डिजाइन तर्क यह है कि MCP टूल्स कंट्रोल प्लेन के अपने REST API को रैप करते हैं, न कि AWS CLI या SDK को, इसलिए एक बार जोड़ी गई वैधता ब्राउज़र और एजेंट दोनों की सुरक्षा करती है। वेब इंटरफ़ेस में, निर्भरताएँ स्थापित, स्वचालित नोड रिकवरी चालू, और स्टोरेज माउंटेड के साथ क्लस्टर बनाना एक फ़ॉर्म और प्रगति पैनल है; टर्मिनल में, यह hypd-inst-agent नामक एजेंट कॉन्फ़िगरेशन को एकल प्राकृतिक भाषा वाक्य के रूप में भेजा जाता है, जो Kiro CLI के लिए बनाया गया है। एजेंट तब कार्य को क्रमबद्ध करता है: EKS कंट्रोल‑प्लेन निर्माण, सक्रिय‑क्लस्टर चयन, निर्भरताओं का पुनर्मिलन, HyperPod क्लस्टर निर्माण, और स्टोरेज सेटअप। AWS कहता है कि EKS कंट्रोल‑प्लेन निर्माण लगभग 8 से 12 मिनट में समाप्त हो जाता है, और प्रत्येक बाद का चरण अपनी स्थिति रिकॉर्ड करता है और स्वतंत्र रूप से पुनः प्रयास योग्य है।

परियोजना के एजेंट कौशल में तीन कार्यप्रवाह नियम एन्कोड किए गए हैं, जिन्हें पोस्ट में रिपॉजिटरी में संस्करणित मार्कडाउन प्लेबुक्स के रूप में वर्णित किया गया है। एजेंट प्रत्येक दीर्घकालिक ऑपरेशन को टर्मिनल स्थिति तक पोल करता है, न कि सबमिट किए गए अनुरोध की रिपोर्ट करता है। यह केवल निर्णय‑स्तर के प्रश्न पूछता है, जैसे उपलब्धता ज़ोन, इंस्टेंस प्रकार, और क्षमता प्रकार, जबकि सबनेट CIDR, रूट टेबल, और सुरक्षा समूहों को कंट्रोल‑प्लेन कार्य मानता है। और यह निर्माण से पहले निरीक्षण करता है, मौजूदा क्लस्टरों की सूची बनाता है और वैध ज़ोन व इंस्टेंस प्रकारों को क्वेरी करता है, फिर विकल्प प्रस्तुत करता है।

समेकित स्थिति के रूप में प्रबंधित क्षमताएँ

InstantStart स्वचालित नोड रिकवरी सक्षम के साथ HyperPod क्लस्टर बनाता है, जिसके तहत HyperPod अपने स्वास्थ्य‑मॉनिटरिंग एजेंट, बुनियादी स्वास्थ्य जांच, और वैकल्पिक गहन स्वास्थ्य जांच के आधार पर दोषपूर्ण नोड्स को रीबूट या बदल सकता है, जो GPUs और Elastic Fabric Adapter कनेक्टिविटी को तनाव‑परीक्षण करते हैं, इससे पहले कि नोड्स कार्य स्वीकार करें। जब उपयोगकर्ता एक इंस्टेंस समूह जोड़ता है, तो क्षमता प्रकार, नेटवर्क इंटरफ़ेस मोड, और सबनेट प्लेसमेंट एक ही निर्माण‑समय ऑपरेशन के रूप में तय होते हैं; क्षमता प्रकार और केवल‑EFA इंटरफ़ेस मोड समूह के जीवनकाल के लिए स्थिर रहते हैं। कंट्रोल प्लेन प्रत्येक क्षमता पथ को एकल फ़ंक्शन के माध्यम से रूट करता है जो बड़े एक्सेलेरेटर फ़्लीट के लिए /20 आकार के कंप्यूट सबनेट्स प्रदान करता है।

HyperPod द्वारा प्रबंधित Karpenter‑आधारित नोड ऑटो‑स्केलिंग यह तय करता है कि किसी भी क्षण में उस क्षमता का कितना भाग चल रहा है, जहाँ AWS स्वयं Karpenter कंट्रोलर संचालित करता है और नोड्स शून्य से स्केल‑अप किए गए HyperPod इंस्टेंस समूहों से लॉन्च होते हैं। पोस्ट एक स्कोपिंग सीमा को नोट करता है: प्रबंधित Karpenter HyperPod इंस्टेंस समूहों का प्रबंधन करता है, सामान्य‑उद्देश्य Amazon EC2 क्षमता का नहीं।

एडवांस्ड फ़ीचर्स पैनल HyperPod की प्रबंधित क्षमताओं को उजागर करता है, जिसमें प्रशिक्षण ऑपरेटर, इन्फ़रेंस ऑपरेटर, प्रबंधित स्तरित चेकपॉइंटिंग, और प्रबंधित ऑटो‑स्केलिंग शामिल हैं, जहाँ प्रत्येक टॉगल एक निर्भरता‑सजग बैकएंड ऑपरेशन से जुड़ा होता है। स्तरित चेकपॉइंटिंग को सक्षम करने से एक पहचान श्रृंखला बनती है जो Kubernetes सर्विस अकाउंट, IAM रोल और नीति, OpenID Connect ट्रस्ट रिलेशनशिप, और बाइंडिंग एनोटेशन को शामिल करती है, और इसे निष्क्रिय करने से वही श्रृंखला हट जाती है। पोस्ट एक प्रारंभिक बग के बाद अपनाए गए स्पष्ट‑डिफ़ कॉन्ट्रैक्ट का भी वर्णन करता है: इंटरफ़ेस केवल उन फ़ील्ड्स को सबमिट करता है जिन्हें उपयोगकर्ता ने वास्तव में बदला है, और बैकएंड वास्तविक क्लस्टर स्थिति को पढ़ता है और जब अनुरोधित और वास्तविक स्थिति पहले से मेल खाती है तो कोई‑ऑप नहीं करता।

प्रशिक्षण और इन्फ़रेंस पाथ्स

प्रशिक्षण के लिए, InstantStart दो सबमिशन पाथ्स प्रदान करता है। HyperPod प्रशिक्षण ऑपरेटर, जो एक EKS ऐड‑ऑन के रूप में स्थापित है, प्रक्रिया‑स्तर की त्रुटि पुनर्प्राप्ति, लॉग‑पैटर्न मॉनिटरिंग के माध्यम से हँग‑जॉब डिटेक्शन, और आउट्लायर डिटेक्शन जोड़ता है, जहाँ कार्य को HyperPodPyTorchJob संसाधनों के रूप में सबमिट किया जाता है जो एक दृश्यमान पुनर्प्राप्ति बजट ले जाते हैं। दूसरा पाथ मानक KubeRay है, जो रिइन्फोर्समेंट लर्निंग जैसे Ray‑नेटिव वर्कलोड्स के लिए लक्षित है। दोनों के ऊपर एक रेसिपी लेयर है जो साधारण PyTorch स्क्रिप्ट्स, LLaMA‑Factory, MS‑Swift, और VERL रिइन्फोर्समेंट लर्निंग के लिए है, सभी एक ही डेटा कॉन्ट्रैक्ट साझा करते हैं जिसमें वही Amazon S3 बकेट विकास पर्यावरण और पॉड्स के भीतर माउंट किया जाता है। जॉब लॉग्स WebSocket के माध्यम से ब्राउज़र में स्ट्रीम होते हैं, और रेसिपी प्रशिक्षण थ्रूपुट जैसे मीट्रिक्स को Amazon SageMaker AI पर प्रबंधित MLflow को रिपोर्ट कर सकते हैं।

इन्फ़रेंस में भी दो पाथ्स होते हैं। प्रबंधित पाथ जीवन‑चक्र को HyperPod इन्फ़रेंस ऑपरेटर को सौंपता है, जिसमें प्रबंधित स्तरित KV कैशिंग और एंडपॉइंट के साथ घोषित बुद्धिमान रूटिंग रणनीतियाँ शामिल हैं। स्वयं‑प्रबंधित पाथ उपयोगकर्ता की पसंद का सर्विंग कंटेनर, जैसे vLLM या SGLang, को एक मानक Kubernetes डिप्लॉयमेंट के रूप में डिप्लॉय करता है, जिसमें सेवा रूपों में एक बाहरी लोड बैलेंसर, क्लस्टर‑आंतरिक सेवा, और एक मॉडल पूल जिसमें गर्म GPU कार्यकर्ता होते हैं जिन्हें लेबल बदलकर पुनः असाइन किया जा सकता है। मल्टी‑रेप्लिका SGLang सर्विंग के लिए, कंट्रोल प्लेन SGLang राउटर को कैश‑अवेयर रूटिंग के साथ डिप्लॉय कर सकता है और Kubernetes इवेंट‑ड्रिवन ऑटो‑स्केलिंग के माध्यम से ऑटो‑स्केलिंग चला सकता है।

एजेंट टूलिंग और सीमाएँ

पोस्ट के अनुसार, MCP सर्वर 38 टूल्स प्रकाशित करता है जो क्लस्टर जीवन‑चक्र, इंस्टेंस समूह, प्रबंधित फीचर्स, स्टोरेज, मॉडल डाउनलोड, इन्फ़रेंस डिप्लॉयमेंट, जॉब्स, और नोड ऑपरेशन्स को कवर करते हैं। प्रत्येक परिवर्तनशील टूल वह स्टेटस टूल नामित करता है जो पूर्णता निर्धारित करता है, और ऑपरेशन्स अपनी अवस्था को पोलिंग शुरू होने से पहले स्थायी बनाते हैं ताकि एजेंट रीट्राय एक परिवर्तन को दोबारा न चला सके। प्रोजेक्ट का GitHub रिपॉजिटरी प्लेटफ़ॉर्म को SageMaker HyperPod और मानक EKS ऑर्केस्ट्रेशन पर निर्मित एक प्रशिक्षण‑और‑इन्फ़रेंस‑एकीकृत सिस्टम के रूप में वर्णित करता है, और इसका README बताता है कि MCP टूल्स प्रोजेक्ट बैकएंड APIs को रैप करते हैं ताकि सर्वोत्तम‑प्रैक्टिस अनुपालन सुनिश्चित हो, जबकि एजेंट कौशल एजेंट के अलावा शून्य स्थानीय सेटअप के साथ एंड‑टू‑एंड वर्कफ़्लोज़ का समन्वय करते हैं।

पोस्ट स्पष्ट ऑपरेशनल सीमाएँ रेखांकित करता है। NCCL, नोड स्वास्थ्य, और क्लस्टर‑क्रिएशन विफलताओं के लिए बंडल्ड डायग्नोस्टिक स्किल्स स्वयं केवल‑पढ़ने की जाँच करती हैं, स्थिति‑बदलने वाले कमांड्स को सुझाव के रूप में प्रस्तुत करती हैं, और क्रम में जांच, रीबूट, फिर प्रतिस्थापन के रूप में एस्केलेट करती हैं। IAM, Kubernetes प्राधिकरण, नेटवर्क नियंत्रण, और बैकएंड वैधता वास्तविक सुरक्षा सीमाएँ बनी रहती हैं; एजेंट कंट्रोल प्लेन तक पहुँच को विस्तारित करता है बिना अपनी विशेषाधिकारों को बढ़ाए। AWS यह भी सलाह देता है कि इलास्टिक प्रशिक्षण वर्तमान में Spot Instances, प्रबंधित स्तरित चेकपॉइंटिंग, और चेकपॉइंट‑लेस प्रशिक्षण को बाहर रखता है, और SageMaker HyperPod क्लस्टर‑उपयोग कोटा और उच्च‑स्तरीय GPU प्रकारों के लिए प्रशिक्षण‑योजना आरक्षण को पहले क्लस्टर से पहले व्यवस्थित करना आवश्यक है।

डिप्लॉयमेंट एक CloudFormation टेम्पलेट से शुरू होता है जो प्रबंधन पर्यावरण, एक साझा S3 बकेट, और सहायक IAM रोल्स बनाता है, जिसमें वेब इंटरफ़ेस कंटेनर से पोर्ट 3099 पर सर्व किया जाता है और AWS Systems Manager पोर्ट‑फ़ॉरवर्डिंग सत्र के माध्यम से पहुँचा जाता है।

थियो नैश यूनाइट.एआई में एक एआई-जनरेटेड विशेषज्ञ है, जो एआई इंफ्रास्ट्रक्चर, कंप्यूट, और आधुनिक कृत्रिम बुद्धिमत्ता को शक्ति प्रदान करने वाले हार्डवेयर सिस्टम को कवर करता है। उनका काम बड़े पैमाने पर एआई कार्यभार के पीछे के तकनीकी आधारों पर केंद्रित है, जिसमें डेटा सेंटर, एक्सेलरेटर, नेटवर्किंग, और सॉफ्टवेयर स्टैक शामिल हैं जो उन्हें एक साथ जोड़ते हैं।
एक विश्लेषणात्मक और इंजीनियरिंग-चालित दृष्टिकोण के साथ, थियो जीपीयू, कस्टम सिलिकॉन, मेमोरी आर्किटेक्चर, और वितरित प्रणालियों में प्रगति का अध्ययन करता है कि वे नए पीढ़ी के एआई मॉडल को कैसे सक्षम बनाते हैं। वह प्रदर्शन व्यापार-ऑफ, ऊर्जा दक्षता, स्केलेबिलिटी, और व्यावहारिक प्रतिबंधों पर विशेष ध्यान देता है जो एआई इंफ्रास्ट्रक्चर के वास्तविक दुनिया के तैनाती को आकार देते हैं।
थियो नैश द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा तकनीकी सटीकता, स्पष्टता, और तेजी से विकसित हो रहे एआई कंप्यूट लैंडस्केप के जिम्मेदार कवरेज को सुनिश्चित करने के लिए समीक्षा की जाती है।