Mô hình và nền tảng AI
Chi Tiết AWS Về Mặt Phẳng Điều Khiển Mã Nguồn Mở HyperPod InstantStart cho Các Tác Nhân Ops

Amazon Web Services đã công bố chi tiết HyperPod InstantStart, một mặt phẳng điều khiển mã nguồn mở kết hợp việc điều phối Amazon EKS với các khả năng được quản lý của Amazon SageMaker HyperPod, trong một bài đăng trên AWS Machine Learning Blog được xuất bản vào ngày 4 tháng 9 năm 2026. Dự án kết hợp giao diện web với một tác nhân AI lên kế hoạch và thực thi các hoạt động cụm đa giai đoạn thông qua các công cụ Model Context Protocol.
InstantStart chạy như một container quản lý ngoài luồng duy nhất trong tài khoản AWS của người dùng, gọi các API dịch vụ AWS và API Kubernetes mà không nằm trong đường dữ liệu của các công việc đào tạo hay yêu cầu suy luận. Mọi tài nguyên nó tạo ra đều là đối tượng chuẩn của AWS hoặc Kubernetes, có thể kiểm tra bằng AWS Command Line Interface và kubectl. Giao diện web, API REST và các công cụ MCP được tác nhân sử dụng là ba mặt của cùng một container, vì vậy cả hai giao diện đều đi qua một backend duy nhất và trải qua cùng một quá trình xác thực.
Một Backend Đằng Sau Hai Giao Diện
Lý thuyết thiết kế trung tâm của bài viết là các công cụ MCP bao bọc các API REST của mặt phẳng điều khiển thay vì AWS CLI hoặc SDK, vì vậy một lần xác thực được thêm vào sẽ bảo vệ cả trình duyệt và tác nhân. Trong giao diện web, việc tạo một cụm với các phụ thuộc đã được cài đặt, bật tự động khôi phục node và gắn lưu trữ là một biểu mẫu và bảng tiến trình; trong terminal, nó là một câu ngôn ngữ tự nhiên duy nhất gửi tới cấu hình tác nhân gọi là hypd-inst-agent, được xây dựng cho Kiro CLI. Tác nhân sau đó sắp xếp các công việc: tạo control-plane của EKS, chọn cụm hoạt động, điều chỉnh phụ thuộc, tạo cụm HyperPod và thiết lập lưu trữ. AWS cho biết việc tạo control-plane của EKS hoàn thành trong khoảng 8 đến 12 phút, và mỗi giai đoạn sau đó ghi lại trạng thái riêng và có thể thử lại một cách độc lập.
Ba quy tắc quy trình làm việc được mã hoá trong các kỹ năng của tác nhân dự án, mà bài viết mô tả là các sổ tay markdown được phiên bản trong kho. Tác nhân theo dõi mỗi hoạt động kéo dài đến trạng thái cuối cùng thay vì báo cáo một yêu cầu đã gửi. Nó chỉ đặt các câu hỏi cấp quyết định, như Vùng khả dụng, loại instance và loại công suất, trong khi coi CIDR subnet, bảng định tuyến và nhóm bảo mật là công việc của control-plane. Và nó kiểm tra trước khi tạo, liệt kê các cụm hiện có và truy vấn các vùng và loại instance hợp lệ trước khi đưa ra lựa chọn.
Các Khả Năng Được Quản Lý Như Trạng Thái Được Điều Hòa
InstantStart tạo các cụm HyperPod với tính năng tự động khôi phục node được bật, trong đó HyperPod có thể khởi động lại hoặc thay thế các node lỗi dựa trên tác nhân giám sát sức khỏe, các kiểm tra sức khỏe cơ bản và các kiểm tra sức khỏe sâu tùy chọn, kiểm tra áp lực GPU và kết nối Elastic Fabric Adapter trước khi các node nhận công việc. Khi người dùng thêm một nhóm instance, loại công suất, chế độ giao diện mạng và vị trí subnet được quyết định như một thao tác tạo duy nhất; loại công suất và chế độ giao diện chỉ EFA được cố định trong suốt vòng đời của nhóm. Control plane định tuyến mọi đường công suất thông qua một hàm duy nhất cung cấp các subnet tính toán kích thước /20 cho các đội ngũ bộ tăng tốc lớn.
HyperPod managed Karpenter-based node autoscaling quyết định mức độ công suất đang chạy tại bất kỳ thời điểm nào, với AWS vận hành bộ điều khiển Karpenter và các node khởi chạy từ các nhóm instance HyperPod được mở rộng từ không. Bài viết lưu ý một giới hạn phạm vi: managed Karpenter chỉ quản lý các nhóm instance HyperPod, không phải công suất Amazon EC2 đa mục đích.
Bảng tính năng nâng cao hiển thị các khả năng được quản lý của HyperPod, bao gồm tác nhân đào tạo, tác nhân suy luận, checkpoint phân lớp được quản lý và tự động mở rộng được quản lý, với mỗi công tắc được ánh xạ tới một thao tác backend có ý thức phụ thuộc. Kích hoạt checkpoint phân lớp cung cấp một chuỗi danh tính trải dài từ tài khoản dịch vụ Kubernetes, một vai trò và chính sách IAM, một quan hệ tin cậy OpenID Connect và chú thích ràng buộc, và tắt nó sẽ loại bỏ cùng một chuỗi. Bài viết cũng mô tả một hợp đồng explicit-diff được áp dụng sau một lỗi sớm: giao diện chỉ gửi các trường mà người dùng thực sự thay đổi, và backend đọc trạng thái cụm thực tế và không thực hiện gì khi yêu cầu và trạng thái thực tế đã khớp.
Các Đường Dẫn Đào Tạo và Suy Luận
Đối với đào tạo, InstantStart cung cấp hai đường nộp. Tác nhân đào tạo HyperPod, được cài đặt như một add-on của EKS, bổ sung khả năng khôi phục lỗi ở mức quy trình, phát hiện công việc treo thông qua giám sát mẫu log và phát hiện ngoại lệ, với công việc được nộp dưới dạng tài nguyên HyperPodPyTorchJob mang một ngân sách khôi phục có thể nhìn thấy. Đường thứ hai là KubeRay tiêu chuẩn, hướng tới các tải công việc gốc Ray như học tăng cường. Trên cả hai là một lớp công thức cho các script PyTorch thuần, LLaMA-Factory, MS-Swift và học tăng cường VERL, tất cả chia sẻ một hợp đồng dữ liệu trong đó cùng một bucket Amazon S3 được gắn vào môi trường phát triển và bên trong các pod. Nhật ký công việc truyền tới trình duyệt qua WebSocket, và các công thức có thể báo cáo các chỉ số như tốc độ đào tạo tới MLflow được quản lý trên Amazon SageMaker AI.
Suy luận cũng có hai đường. Đường được quản lý giao vòng đời cho tác nhân suy luận HyperPod, với bộ nhớ đệm KV phân lớp được quản lý và các chiến lược định tuyến thông minh được khai báo cùng với endpoint. Đường tự quản lý triển khai một container phục vụ do người dùng chọn, như vLLM hoặc SGLang, như một triển khai Kubernetes tiêu chuẩn, với các dạng dịch vụ bao gồm một bộ cân bằng tải bên ngoài, một dịch vụ nội bộ cụm và một nhóm mô hình gồm các worker GPU ấm có thể được gán lại bằng cách thay đổi nhãn. Đối với việc phục vụ SGLang đa bản sao, control plane có thể triển khai router SGLang với định tuyến có nhận thức bộ nhớ đệm và điều khiển tự động mở rộng thông qua Kubernetes Event-driven Autoscaling.
Công Cụ Tác Nhân và Ranh Giới
Theo bài viết, máy chủ MCP công bố 38 công cụ bao phủ vòng đời cụm, nhóm instance, tính năng được quản lý, lưu trữ, tải mô hình, triển khai suy luận, công việc và các thao tác node. Mỗi công cụ thay đổi đều đặt tên cho công cụ trạng thái xác định việc hoàn thành, và các thao tác lưu lại giai đoạn của chúng trước khi bắt đầu polling để việc thử lại của tác nhân không thể phát lại một sự thay đổi. Kho GitHub của dự án mô tả nền tảng như một hệ thống tích hợp đào tạo và suy luận được xây dựng trên SageMaker HyperPod và điều phối EKS tiêu chuẩn, và README của nó cho biết các công cụ MCP bao bọc các API backend của dự án để tuân thủ các thực hành tốt nhất trong khi các kỹ năng của tác nhân điều phối quy trình công việc đầu cuối mà không cần thiết lập cục bộ nào ngoài tác nhân.
Bài viết vạch ra các ranh giới vận hành rõ ràng. Các kỹ năng chẩn đoán gói sẵn cho NCCL, sức khỏe node và lỗi tạo cụm tự thực hiện kiểm tra chỉ đọc, trình bày các lệnh thay đổi trạng thái dưới dạng gợi ý và nâng cấp theo thứ tự kiểm tra, khởi động lại, sau đó thay thế. IAM, ủy quyền Kubernetes, kiểm soát mạng và xác thực backend vẫn là các ranh giới bảo mật thực tế; tác nhân mở rộng quyền truy cập vào control plane mà không mở rộng đặc quyền của mình. AWS cũng khuyên rằng đào tạo linh hoạt hiện đang loại trừ Spot Instances, checkpoint phân lớp được quản lý và đào tạo không checkpoint, và rằng các hạn ngạch sử dụng cụm SageMaker HyperPod và đặt chỗ kế hoạch đào tạo cho các loại GPU cao cấp cần được sắp xếp trước cụm đầu tiên.
Việc triển khai bắt đầu từ một mẫu CloudFormation tạo môi trường quản lý, một bucket S3 chia sẻ và các vai trò IAM hỗ trợ, với giao diện web được phục vụ từ container trên cổng 3099 và được truy cập thông qua một phiên chuyển tiếp cổng của AWS Systems Manager.












