โมเดลและแพลตฟอร์ม AI
AWS รายละเอียดแผนควบคุม HyperPod InstantStart แบบโอเพนซอร์สสำหรับการดำเนินงานของเอเจนต์

Amazon Web Services ได้อธิบายรายละเอียด HyperPod InstantStart ซึ่งเป็นแผนควบคุมแบบโอเพนซอร์สที่ผสานการจัดการของ Amazon EKS กับความสามารถที่จัดการของ Amazon SageMaker HyperPod ใน บทความบล็อก AWS Machine Learning ที่เผยแพร่เมื่อ 4 กันยายน 2026 โครงการนี้จับคู่อินเทอร์เฟซเว็บกับเอเจนต์ AI ที่วางแผนและดำเนินการคลัสเตอร์หลายขั้นตอนผ่านเครื่องมือ Model Context Protocol.
InstantStart ทำงานเป็นคอนเทนเนอร์การจัดการแบบ out-of-band เพียงหนึ่งตัวภายในบัญชี AWS ของผู้ใช้ โดยเรียกใช้ API ของบริการ AWS และ API ของ Kubernetes โดยไม่อยู่ในเส้นทางข้อมูลของงานฝึกหรือคำขอสรุปผล ทุกทรัพยากรที่สร้างขึ้นเป็นวัตถุมาตรฐานของ AWS หรือ Kubernetes ซึ่งสามารถตรวจสอบได้ด้วย AWS Command Line Interface และ kubectl อินเทอร์เฟซเว็บ, REST API, และเครื่องมือ MCP ที่เอเจนต์ใช้เป็นสามหน้าตาของคอนเทนเนอร์เดียวกัน ดังนั้นทั้งสองอินเทอร์เฟซจึงเข้าผ่านแบ็กเอนด์เดียวและผ่านการตรวจสอบเดียวกัน.
หนึ่งแบ็กเอนด์เบื้องหลังสองอินเทอร์เฟซ
ข้อโต้แย้งการออกแบบหลักของบทความคือเครื่องมือ MCP จะห่อหุ้ม REST API ของแผนควบคุมเอง แทนการใช้ AWS CLI หรือ SDK ดังนั้นการตรวจสอบที่เพิ่มครั้งเดียวจะปกป้องทั้งเบราว์เซอร์และเอเจนต์ในเวลาเดียวกัน ในอินเทอร์เฟซเว็บ การสร้างคลัสเตอร์พร้อมติดตั้งการพึ่งพา, เปิดการกู้คืนโหนดอัตโนมัติ, และเมานท์สตอเรจจะปรากฏเป็นแบบฟอร์มและแผงความคืบหน้า; ในเทอร์มินัล จะเป็นประโยคภาษาแบบธรรมชาติเดียวที่ส่งให้กับการกำหนดค่าเอเจนต์ที่เรียกว่า hypd-inst-agent ซึ่งสร้างขึ้นสำหรับ Kiro CLI จากนั้นเอเจนต์จะจัดลำดับงาน: การสร้างแผนควบคุม EKS, การเลือกคลัสเตอร์ที่ใช้งาน, การประสานความพึ่งพา, การสร้างคลัสเตอร์ HyperPod, และการตั้งค่าสตอเรจ AWS ระบุว่าการสร้างแผนควบคุม EKS เสร็จสิ้นประมาณ 8 ถึง 12 นาที และแต่ละขั้นตอนต่อมาจะบันทึกสถานะของตนเองและสามารถลองใหม่ได้อย่างอิสระ.
กฎการทำงานสามข้อถูกเข้ารหัสไว้ในทักษะของเอเจนต์ในโครงการ ซึ่งบทความอธิบายว่าเป็น playbook แบบ markdown ที่เวอร์ชันในที่เก็บข้อมูล เอเจนต์จะสำรวจทุกการดำเนินการที่ใช้เวลานานจนถึงสถานะเทอร์มินัลแทนการรายงานคำขอที่ส่งไป มันจะถามเฉพาะคำถามระดับการตัดสินใจ เช่น Availability Zone, ประเภทอินสแตนซ์, และประเภทความจุ ในขณะที่ถือว่า CIDR ของซับเน็ต, ตารางเส้นทาง, และกลุ่มความปลอดภัยเป็นงานของแผนควบคุม และมันจะตรวจสอบก่อนสร้าง โดยแสดงรายการคลัสเตอร์ที่มีอยู่และสอบถามโซนและประเภทอินสแตนซ์ที่ถูกต้องก่อนเสนอทางเลือก.
ความสามารถที่จัดการเป็นสถานะที่ประสานกัน
InstantStart สร้างคลัสเตอร์ HyperPod พร้อมเปิดการกู้คืนโหนดอัตโนมัติ ซึ่งทำให้ HyperPod สามารถรีบูตหรือแทนที่โหนดที่มีข้อบกพร่องได้โดยอาศัยเอเจนต์ตรวจสุขภาพ, การตรวจสุขภาพพื้นฐาน, และการตรวจสุขภาพเชิงลึกแบบเลือกที่ทำการทดสอบความทนทานของ GPU และการเชื่อมต่อ Elastic Fabric Adapter ก่อนที่โหนดจะรับงาน เมื่อผู้ใช้เพิ่มกลุ่มอินสแตนซ์ ประเภทความจุ โหมดอินเทอร์เฟซเครือข่าย และตำแหน่งซับเน็ตจะถูกสรุปเป็นการดำเนินการสร้างครั้งเดียว; ประเภทความจุและโหมดอินเทอร์เฟซเฉพาะ EFA จะคงที่ตลอดอายุของกลุ่ม แผนควบคุมจะส่งเส้นทางความจุทั้งหมดผ่านฟังก์ชันเดียวที่จัดสรรซับเน็ตคอมพิวต์ขนาด /20 สำหรับฟลีตเร่งความเร็วขนาดใหญ่.
การปรับขนาดอัตโนมัติโหนดที่จัดการโดย Karpenter บน HyperPod จะตัดสินใจว่าความจุส่วนใดทำงานในแต่ละช่วงเวลา โดย AWS ดูแลตัวควบคุม Karpenter เองและโหนดจะเปิดตัวจากกลุ่มอินสแตนซ์ HyperPod ที่ขยายจากศูนย์ บทความระบุขอบเขตหนึ่ง: Karpenter ที่จัดการจะดูแลกลุ่มอินสแตนซ์ HyperPod เท่านั้น ไม่ใช่ความจุ Amazon EC2 ทั่วไป.
แผง Advanced Features เปิดเผยความสามารถที่จัดการของ HyperPod รวมถึงผู้ดำเนินการฝึกอบรม, ผู้ดำเนินการสรุปผล, การทำ checkpoint แบบหลายระดับที่จัดการ, และการปรับขนาดอัตโนมัติที่จัดการ โดยแต่ละสวิตช์จะเชื่อมโยงกับการดำเนินการแบ็กเอนด์ที่รับรู้การพึ่งพา การเปิดใช้งานการทำ checkpoint แบบหลายระดับจะจัดหาโซ่ตัวตนที่ครอบคลุมบัญชีบริการ Kubernetes, บทบาทและนโยบาย IAM, ความสัมพันธ์ความเชื่อมั่น OpenID Connect, และคำอธิบายการผูกมัด; การปิดใช้งานจะลบโซ่เดียวกันบทความยังอธิบายสัญญา explicit-diff ที่นำมาใช้หลังจากบั๊กแรก: อินเทอร์เฟซจะส่งเฉพาะฟิลด์ที่ผู้ใช้เปลี่ยนจริง และแบ็กเอนด์จะอ่านสถานะคลัสเตอร์จริงและไม่ทำอะไรเมื่อสถานะที่ร้องขอและสถานะจริงตรงกัน.
เส้นทางการฝึกและการสรุปผล
สำหรับการฝึก InstantStart มีสองเส้นทางการส่งงาน ผู้ดำเนินการฝึก HyperPod ที่ติดตั้งเป็น add-on ของ EKS เพิ่มการกู้คืนข้อผิดพลาดระดับกระบวนการ, การตรวจจับงานค้างผ่านการตรวจสอบรูปแบบล็อก, และการตรวจจับค่าผิดปกติ โดยงานจะส่งเป็นทรัพยากร HyperPodPyTorchJob ที่มีงบประมาณการกู้คืนที่มองเห็นได้ เส้นทางที่สองคือ KubeRay มาตรฐานที่มุ่งเน้นงานที่เป็นของ Ray เช่นการเรียนรู้แบบเสริมแรง ด้านบนของทั้งสองมีชั้นสูตรสำหรับสคริปต์ PyTorch ธรรมดา, LLaMA-Factory, MS‑Swift, และ VERL reinforcement learning ซึ่งทั้งหมดใช้สัญญาข้อมูลเดียวกันโดยที่บัคเก็ต Amazon S3 เดียวกันถูกเมานท์ในสภาพแวดล้อมการพัฒนาและภายในพ็อด บันทึกงานจะสตรีมไปยังเบราว์เซอร์ผ่าน WebSocket และสูตรสามารถรายงานเมตริกเช่นอัตราผลิตการฝึกให้กับ MLflow ที่จัดการบน Amazon SageMaker AI.
การสรุปผลก็มีสองเส้นทางเช่นกัน เส้นทางที่จัดการมอบวงจรชีวิตให้กับผู้ดำเนินการสรุปผล HyperPod พร้อมการแคช KV แบบหลายระดับที่จัดการและกลยุทธ์การกำหนดเส้นทางอัจฉริยะที่ประกาศพร้อมกับปลายทาง เส้นทางที่ผู้ใช้จัดการเองจะปรับใช้คอนเทนเนอร์ให้บริการตามที่ผู้ใช้เลือก เช่น vLLM หรือ SGLang เป็นการปรับใช้ Kubernetes มาตรฐาน โดยรูปแบบบริการรวมถึงโหลดบาลานเซอร์ภายนอก, บริการภายในคลัสเตอร์, และพูลโมเดลของโหนด GPU ที่อุ่นพร้อมที่สามารถมอบหมายใหม่โดยเปลี่ยนป้ายกำกับ สำหรับการให้บริการ SGLang แบบหลายสำเนา แผนควบคุมสามารถปรับใช้เร้าเตอร์ SGLang พร้อมการกำหนดเส้นทางที่รับรู้แคชและขับเคลื่อนการปรับขนาดอัตโนมัติผ่าน Kubernetes Event‑driven Autoscaling.
เครื่องมือเอเจนต์และขอบเขต
เซิร์ฟเวอร์ MCP เผยแพร่เครื่องมือทั้งหมด 38 รายการ ครอบคลุมวงจรชีวิตคลัสเตอร์, กลุ่มอินสแตนซ์, คุณลักษณะที่จัดการ, สตอเรจ, การดาวน์โหลดโมเดล, การปรับใช้สรุปผล, งาน, และการดำเนินการโหนด ตามบทความ ทุกเครื่องมือที่ทำการเปลี่ยนแปลงจะระบุเครื่องมือสถานะที่กำหนดการเสร็จสิ้น และการดำเนินการจะบันทึกเฟสของตนก่อนการสำรวจเริ่มต้นเพื่อให้การลองใหม่ของเอเจนต์ไม่สามารถทำซ้ำการเปลี่ยนแปลงได้ ที่เก็บโค้ดบน GitHub ของโครงการ อธิบายแพลตฟอร์มว่าเป็นระบบที่รวมการฝึกและสรุปผลสร้างบน SageMaker HyperPod และการจัดการ EKS มาตรฐาน และ README ระบุว่าเครื่องมือ MCP จะห่อหุ้ม API แบ็กเอนด์ของโครงการเพื่อให้สอดคล้องกับแนวปฏิบัติที่ดีที่สุดในขณะที่ทักษะเอเจนต์จัดระเบียบเวิร์กโฟลว์แบบต้นจนจบโดยไม่มีการตั้งค่าท้องถิ่นใด ๆ นอกจากเอเจนต์.
บทความระบุขอบเขตการดำเนินงานอย่างชัดเจน ทักษะการวินิจฉัยที่บรรจุสำหรับ NCCL, สุขภาพโหนด, และความล้มเหลวในการสร้างคลัสเตอร์จะตรวจสอบแบบอ่านอย่างเดียวโดยอิสระ นำเสนอคำสั่งที่เปลี่ยนสถานะเป็นข้อเสนอแนะ และเพิ่มระดับตามลำดับ การตรวจสอบ, รีบูต, แล้วแทนที่ IAM, การอนุญาตของ Kubernetes, การควบคุมเครือข่าย, และการตรวจสอบแบ็กเอนด์ยังคงเป็นขอบเขตความปลอดภัยจริง; เอเจนต์ขยายการเข้าถึงแผนควบคุมโดยไม่ขยายสิทธิ์ของตนเอง AWS ยังให้คำแนะนำว่าการฝึกแบบยืดหยุ่นในขณะนี้ยกเว้น Spot Instances, การทำ checkpoint แบบหลายระดับที่จัดการ, และการฝึกแบบไม่มี checkpoint, และว่าโควต้าการใช้คลัสเตอร์ SageMaker HyperPod และการจองแผนการฝึกสำหรับประเภท GPU ระดับสูงต้องจัดเตรียมก่อนคลัสเตอร์แรก.
การปรับใช้เริ่มจากเทมเพลต CloudFormation ที่สร้างสภาพแวดล้อมการจัดการ, บัคเก็ต S3 ที่ใช้ร่วมกัน, และบทบาท IAM ที่สนับสนุน โดยอินเทอร์เฟซเว็บจะให้บริการจากคอนเทนเนอร์บนพอร์ต 3099 และเข้าถึงผ่านเซสชันการส่งต่อพอร์ตของ AWS Systems Manager.












