AI 모델 및 플랫폼

AWS, 에이전트 운영을 위한 오픈소스 HyperPod InstantStart 제어 플레인 상세 정보

mm
Unite.AI를 Google의 선호 소스에 추가

Amazon Web Services는 2026년 9월 4일에 게시된 AWS Machine Learning 블로그 게시물에서 Amazon EKS 오케스트레이션과 Amazon SageMaker HyperPod의 관리형 기능을 결합한 오픈소스 제어 플레인인 HyperPod InstantStart에 대해 상세히 설명했습니다. 이 프로젝트는 웹 인터페이스와 모델 컨텍스트 프로토콜 도구를 통해 다단계 클러스터 작업을 계획하고 실행하는 AI 에이전트를 결합합니다.

InstantStart는 사용자의 AWS 계정 내에서 단일 out-of-band 관리 컨테이너로 실행되며, 학습 작업이나 추론 요청의 데이터 경로에 개입하지 않고 AWS 서비스 API와 Kubernetes API를 호출합니다. 생성되는 모든 리소스는 AWS 명령줄 인터페이스와 kubectl로 검사할 수 있는 표준 AWS 또는 Kubernetes 객체입니다. 웹 UI, REST API, 그리고 에이전트가 사용하는 MCP 도구는 동일한 컨테이너의 세 가지 모습으로, 두 인터페이스 모두 하나의 백엔드를 통해 들어가 동일한 검증을 거칩니다.

두 인터페이스 뒤에 있는 하나의 백엔드

이 게시물의 핵심 설계 논거는 MCP 도구가 AWS CLI나 SDK 대신 제어 플레인의 자체 REST API를 래핑하기 때문에 한 번 추가된 검증이 브라우저와 에이전트 모두를 보호한다는 점입니다. 웹 인터페이스에서는 종속성이 설치되고 자동 노드 복구가 활성화되며 스토리지가 마운트된 클러스터를 생성하는 것이 양식과 진행 패널로 표시되고, 터미널에서는 Kiro CLI용으로 구축된 hypd-inst-agent라는 에이전트 구성에 대한 단일 자연어 문장으로 표현됩니다. 에이전트는 작업을 순차적으로 실행합니다: EKS 제어 플레인 생성, 활성 클러스터 선택, 종속성 조정, HyperPod 클러스터 생성, 그리고 스토리지 설정. AWS에 따르면 EKS 제어 플레인 생성은 대략 8~12분이 소요되며, 이후 단계마다 자체 상태를 기록하고 독립적으로 재시도할 수 있습니다.

프로젝트의 에이전트 기술에는 세 가지 워크플로 규칙이 포함되어 있으며, 게시물에서는 이를 저장소에 버전 관리되는 마크다운 플레이북으로 설명합니다. 에이전트는 제출된 요청을 보고하는 대신 모든 장기 실행 작업을 최종 상태까지 폴링합니다. 가용 영역, 인스턴스 유형, 용량 유형과 같은 의사결정 수준의 질문만을 묻고, 서브넷 CIDR, 라우트 테이블, 보안 그룹은 제어 플레인 작업으로 취급합니다. 또한 생성 전에 기존 클러스터를 나열하고 유효한 영역 및 인스턴스 유형을 조회하여 선택지를 제공하는 등 사전 검사를 수행합니다.

조정된 상태로서의 관리형 기능

InstantStart는 자동 노드 복구가 활성화된 HyperPod 클러스터를 생성합니다. 이를 통해 HyperPod는 상태 모니터링 에이전트, 기본 건강 검사, 그리고 선택적인 심층 건강 검사를 기반으로 GPU와 Elastic Fabric Adapter 연결성을 스트레스 테스트한 후 작업을 수락하기 전에 결함이 있는 노드를 재부팅하거나 교체할 수 있습니다. 사용자가 인스턴스 그룹을 추가하면 용량 유형, 네트워크 인터페이스 모드, 서브넷 배치가 하나의 생성 시점 작업으로 확정되며, 용량 유형과 EFA 전용 인터페이스 모드는 그룹 수명 동안 고정됩니다. 제어 플레인은 모든 용량 경로를 단일 함수로 라우팅하여 대규모 가속기 플릿을 위한 /20 크기의 컴퓨트 서브넷을 프로비저닝합니다.

HyperPod가 관리하는 Karpenter 기반 노드 자동 확장은 해당 용량이 언제든지 얼마나 사용되는지를 결정하며, AWS가 Karpenter 컨트롤러를 직접 운영하고 노드는 0에서 확장된 HyperPod 인스턴스 그룹에서 시작됩니다. 게시물에서는 한계 범위를 언급합니다: 관리형 Karpenter는 일반 목적의 Amazon EC2 용량이 아니라 HyperPod 인스턴스 그룹만을 관리합니다.

고급 기능 패널은 HyperPod의 관리형 기능을 보여주며, 여기에는 학습 연산자, 추론 연산자, 관리형 계층형 체크포인팅, 관리형 자동 확장이 포함되고 각 토글은 종속성을 인식하는 백엔드 작업에 매핑됩니다. 계층형 체크포인팅을 활성화하면 Kubernetes 서비스 계정, IAM 역할 및 정책, OpenID Connect 신뢰 관계, 바인딩 어노테이션을 아우르는 정체성 체인이 프로비저닝되고, 이를 비활성화하면 동일한 체인이 제거됩니다. 게시물은 초기 버그 이후 채택된 명시적 diff 계약도 설명합니다: 인터페이스는 사용자가 실제로 변경한 필드만 제출하고, 백엔드는 실제 클러스터 상태를 읽어 요청된 상태와 실제 상태가 이미 일치하면 아무 작업도 수행하지 않습니다.

학습 및 추론 경로

학습을 위해 InstantStart는 두 가지 제출 경로를 제공합니다. EKS 애드온으로 설치되는 HyperPod 학습 연산자는 프로세스 수준의 오류 복구, 로그 패턴 모니터링을 통한 작업 정지 감지, 그리고 이상치 감지를 추가하며, 작업은 가시적인 복구 예산을 포함한 HyperPodPyTorchJob 리소스로 제출됩니다. 두 번째 경로는 표준 KubeRay이며, 강화 학습과 같은 Ray 네이티브 워크로드를 대상으로 합니다. 두 경로 위에는 일반 PyTorch 스크립트, LLaMA-Factory, MS-Swift, VERL 강화 학습을 위한 레시피 레이어가 있으며, 모두 동일한 Amazon S3 버킷을 개발 환경과 파드 내부에 마운트하는 하나의 데이터 계약을 공유합니다. 작업 로그는 WebSocket을 통해 브라우저로 스트리밍되며, 레시피는 학습 처리량과 같은 메트릭을 Amazon SageMaker AI의 관리형 MLflow에 보고할 수 있습니다.

추론도 두 가지 경로를 갖습니다. 관리형 경로는 HyperPod 추론 연산자에게 라이프사이클을 맡기며, 엔드포인트와 함께 관리형 계층형 KV 캐시와 지능형 라우팅 전략을 선언합니다. 자체 관리형 경로는 vLLM이나 SGLang과 같은 사용자가 선택한 서빙 컨테이너를 표준 Kubernetes 배포로 배치하며, 서비스 형태는 외부 로드 밸런서, 클러스터 내부 서비스, 라벨 변경으로 재할당 가능한 워밍 GPU 워커 풀을 포함합니다. 다중 복제 SGLang 서빙의 경우, 제어 플레인은 캐시 인식 라우팅을 갖춘 SGLang 라우터를 배포하고 Kubernetes 이벤트 기반 자동 확장을 통해 자동 스케일링을 수행할 수 있습니다.

에이전트 도구 및 경계

게시물에 따르면 MCP 서버는 클러스터 수명 주기, 인스턴스 그룹, 관리형 기능, 스토리지, 모델 다운로드, 추론 배포, 작업 및 노드 작업을 포괄하는 38개의 도구를 공개합니다. 모든 변형 도구는 완료를 결정하는 상태 도구를 이름으로 지정하며, 작업이 폴링을 시작하기 전에 단계가 지속되어 에이전트 재시도가 변형을 재실행하지 못하도록 합니다. 프로젝트의 GitHub 저장소는 이 플랫폼을 SageMaker HyperPod와 표준 EKS 오케스트레이션 위에 구축된 학습·추론 통합 시스템으로 설명하고, README에서는 MCP 도구가 모범 사례 준수를 위해 프로젝트 백엔드 API를 래핑하고 에이전트 기술이 에이전트 외에 로컬 설정 없이 엔드‑투‑엔드 워크플로를 조정한다고 명시합니다.

게시물은 명시적인 운영 경계를 제시합니다. NCCL, 노드 건강, 클러스터 생성 실패에 대한 번들 진단 기술은 자체적으로 읽기 전용을 조사하고, 상태 변경 명령을 제안으로 제시하며, 조사 → 재부팅 → 교체 순서로 에스컬레이션합니다. IAM, Kubernetes 인증, 네트워크 제어 및 백엔드 검증이 실제 보안 경계를 유지하며, 에이전트는 권한을 확대하지 않고 제어 플레인 접근성을 넓힙니다. AWS는 또한 탄력적 학습이 현재 Spot 인스턴스, 관리형 계층형 체크포인팅, 체크포인트 없는 학습을 제외하고 있으며, 고성능 GPU 유형에 대한 SageMaker HyperPod 클러스터 사용량 할당량 및 학습 계획 예약은 첫 클러스터 시작 전에 조정해야 한다고 조언합니다.

배포는 관리 환경, 공유 S3 버킷 및 지원 IAM 역할을 생성하는 CloudFormation 템플릿에서 시작되며, 웹 인터페이스는 컨테이너의 3099 포트에서 제공되고 AWS Systems Manager 포트 포워딩 세션을 통해 접근됩니다.

테오 내쉬유나이트.AI의 AI 생성 전문가로, AI 인프라, 컴퓨팅, 및 현대적인 인공 지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드를 위한 기술적 기초에 중점을 두고 있으며, 데이터 센터, 가속기, 네트워킹, 및 이를 연결하는 소프트웨어 스택을 포함합니다.
분석적이고 엔지니어링 중심의 관점에서 테오 내쉬는 GPU, 커스텀 실리콘, 메모리 아키텍처, 및 분산 시스템의 발전에 따라 새로운 세대의 AI 모델이 어떻게 가능해지는지 조사합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성, 및 실제로 AI 인프라를 배치하는 실질적인 제약에 특별한 주의를 기울입니다.
테오 내쉬가 작성한 기사들은 AI로 생성되어 유나이트.AI의 편집 팀에 의해 검토되어 기술적 정확성, 명확성, 및 급변하는 AI 컴퓨팅 환경에 대한 책임 있는 보도를 보장합니다.