Yapay zeka modelleri ve platformları

AWS, Ajan İşlemleri için Açık Kaynak HyperPod InstantStart Kontrol Düzlemini Detaylandırıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Amazon Web Services, HyperPod InstantStart’ı, Amazon EKS orkestrasyonunu Amazon SageMaker HyperPod’un yönetilen yetenekleriyle birleştiren açık kaynak bir kontrol düzlemi olarak, 4 Eylül 2026 tarihinde yayımlanan bir AWS Machine Learning Blog gönderisi içinde ayrıntılandırdı. Proje, bir web arayüzünü Model Context Protocol araçlarıyla çok aşamalı küme işlemlerini planlayan ve yürüten bir AI ajanıyla eşleştiriyor.

InstantStart, bir kullanıcının AWS hesabı içinde tek bir out-of-band yönetim konteyneri olarak çalışır; AWS hizmet API’lerini ve Kubernetes API’sini, eğitim işleri ya da çıkarım isteklerinin veri yolunda bulunmadan çağırır. Oluşturduğu her kaynak, AWS Command Line Interface ve kubectl ile incelenebilen standart bir AWS veya Kubernetes nesnesidir. Web UI, bir REST API ve ajan tarafından kullanılan MCP araçları aynı konteynerin üç yüzüdür; bu sayede her iki arayüz de tek bir backend üzerinden girer ve aynı doğrulamaları geçer.

İki Arayüzün Arkasında Tek Bir Backend

Yazının temel tasarım argümanı, MCP araçlarının kontrol düzleminin kendi REST API’lerini AWS CLI veya SDK yerine sarmalamasıdır; böylece bir kez eklenen doğrulama, tarayıcıyı ve ajanı aynı anda korur. Web arayüzünde, bağımlılıkları kurulu, otomatik düğüm kurtarma etkin ve depolama bağlanmış bir küme oluşturmak bir form ve ilerleme paneli olarak görülür; bir terminalde ise bu, Kiro CLI için oluşturulmuş hypd-inst-agent adlı bir ajan yapılandırmasına tek bir doğal dil cümlesi olarak gönderilir. Ajan daha sonra işi şu sırayla yürütür: EKS kontrol‑düzlemi oluşturma, aktif küme seçimi, bağımlılık uzlaştırması, HyperPod küme oluşturma ve depolama kurulumu. AWS, EKS kontrol‑düzlemi oluşturmanın yaklaşık 8‑12 dakika sürdüğünü ve sonraki her aşamanın kendi durumunu kaydederek bağımsız olarak yeniden denenebileceğini belirtiyor.

Projenin ajan yeteneklerinde üç iş akışı kuralı kodlanmıştır; yazı bu kuralları depoda sürümlenmiş markdown oyun kitapları olarak tanımlar. Ajan, gönderilen bir isteği raporlamak yerine, uzun süren her işlemi terminal duruma kadar izler. Yalnızca Bölge (Availability Zone), örnek tipi ve kapasite tipi gibi karar düzeyinde sorular sorar; subnet CIDR’leri, yönlendirme tabloları ve güvenlik gruplarını ise kontrol‑düzlemi işi olarak ele alır. Ayrıca, oluşturma öncesinde denetleme yapar; mevcut kümeleri listeler ve geçerli bölgeler ile örnek tiplerini sorgular, ardından seçenekleri sunar.

Yönetilen Yetkinlikler Uzlaştırılmış Durum Olarak

InstantStart, otomatik düğüm kurtarma özelliği etkin olan HyperPod kümeleri oluşturur; bu sayede HyperPod, sağlık izleme ajanı, temel sağlık kontrolleri ve GPU’ları ve Elastic Fabric Adapter bağlantısını zorlayan isteğe bağlı derin sağlık kontrolleriyle hatalı düğümleri yeniden başlatabilir veya değiştirebilir, düğümler işi kabul etmeden önce. Bir kullanıcı bir örnek grubu eklediğinde, kapasite tipi, ağ arabirimi modu ve alt ağ yerleşimi tek bir oluşturma işlemi olarak belirlenir; kapasite tipi ve yalnızca EFA arabirimi modu grup ömrü boyunca sabittir. Kontrol düzlemi, büyük hızlandırıcı filoları için /20 boyutunda hesaplama alt ağları sağlayan tek bir işlev üzerinden tüm kapasite yollarını yönlendirir.

HyperPod tarafından yönetilen Karpenter tabanlı düğüm otomatik ölçeklendirme, o an ne kadar kapasitenin çalışacağını belirler; AWS, Karpenter denetleyicisini kendisi işletir ve düğümler, sıfırdan ölçeklendirilmiş HyperPod örnek gruplarından başlatılır. Yazı, bir kapsam sınırlamasına da değinir: yönetilen Karpenter, HyperPod örnek gruplarını yönetir, genel amaçlı Amazon EC2 kapasitesini değil.

Gelişmiş Özellikler paneli, eğitim operatörü, çıkarım operatörü, yönetilen katmanlı kontrol noktası ve yönetilen otomatik ölçeklendirme gibi HyperPod’un yönetilen yeteneklerini gösterir; her bir geçiş, bağımlılık‑bilincine sahip bir backend işlemiyle eşlenir. Katmanlı kontrol noktasını etkinleştirmek, bir Kubernetes hizmet hesabı, bir IAM rolü ve politikası, bir OpenID Connect güven ilişkisi ve bağlama açıklaması içeren bir kimlik zinciri oluşturur; devre dışı bırakmak aynı zinciri kaldırır. Yazı ayrıca erken bir hatadan sonra benimsenen açık‑fark sözleşmesini açıklar: arayüz yalnızca kullanıcının gerçekten değiştirdiği alanları gönderir ve backend, istenen ve mevcut durum zaten eşleştiğinde gerçek küme durumunu okur ve hiçbir işlem yapmaz.

Eğitim ve Çıkarım Yolları

Eğitim için, InstantStart iki gönderim yolu sunar. EKS eklentisi olarak kurulan HyperPod eğitim operatörü, süreç‑seviyesinde hata kurtarma, günlük‑deseni izleme yoluyla takılı iş tespiti ve aykırı değer tespiti ekler; iş, görünür bir kurtarma bütçesi taşıyan HyperPodPyTorchJob kaynakları olarak gönderilir. İkinci yol, pekiştirmeli öğrenme gibi Ray‑yerel iş yüklerine yönelik standart KubeRay’dir. Her iki yolun üzerinde, düz PyTorch betikleri, LLaMA-Factory, MS‑Swift ve VERL pekiştirmeli öğrenme için bir tarif katmanı bulunur; hepsi aynı Amazon S3 kovasının geliştirme ortamında ve pod içinde bağlandığı tek bir veri sözleşmesini paylaşır. İş günlükleri WebSocket üzerinden tarayıcıya akıtılır ve tarifler, eğitim verimliliği gibi metrikleri Amazon SageMaker AI üzerindeki yönetilen MLflow’a raporlayabilir.

Çıkarım da iki yola sahiptir. Yönetilen yol, yaşam döngüsünü HyperPod çıkarım operatörüne devreder; yönetilen katmanlı KV önbellekleme ve uç nokta ile birlikte bildirilen akıllı yönlendirme stratejileri bulunur. Kendinin yönettiği yol, vLLM veya SGLang gibi kullanıcının seçtiği bir sunum konteynerini standart bir Kubernetes dağıtımı olarak dağıtır; hizmet şekilleri arasında harici bir yük dengeleyici, küme içi bir hizmet ve bir etiket değişikliğiyle yeniden atanabilen sıcak GPU çalışanlarından oluşan bir model havuzu yer alır. Çoklu kopyalı SGLang sunumu için kontrol düzlemi, önbellek‑bilincine sahip yönlendirme ile SGLang yönlendiricisini dağıtabilir ve Kubernetes Event‑driven Autoscaling aracılığıyla otomatik ölçeklendirmeyi yönlendirebilir.

Ajan Araçları ve Sınırlar

MCP sunucusu, yazıya göre, küme yaşam döngüsü, örnek grupları, yönetilen özellikler, depolama, model indirme, çıkarım dağıtımı, işler ve düğüm işlemlerini kapsayan 38 araç yayınlar. Her değiştirici araç, tamamlanmayı belirleyen durum aracını adlandırır ve işlemler, anket başlamadan önce aşamalarını kalıcı hâle getirir; böylece bir ajan yeniden denemesi mutasyonu yeniden oynatamaz. Projenin GitHub deposu, platformu SageMaker HyperPod ve standart EKS orkestrasyonu üzerine inşa edilmiş bir eğitim‑ve‑çıkarım bütünleşik sistemi olarak tanımlar ve README, MCP araçlarının en iyi uygulama uyumluluğu için proje backend API’lerini sarmaladığını, ajan yeteneklerinin ise ajanın ötesinde sıfır yerel kurulumla uçtan uca iş akışlarını yönettiğini belirtir.

Yazı, açık operasyonel sınırları ortaya koyar. NCCL, düğüm sağlığı ve küme‑oluşturma hataları için paketlenmiş tanı becerileri, yalnızca okuma modunda kendi başlarına araştırma yapar, durum‑değiştiren komutları öneri olarak sunar ve sırasıyla araştır, yeniden başlat, ardından değiştir şeklinde yükseltir. IAM, Kubernetes yetkilendirmesi, ağ kontrolleri ve backend doğrulaması gerçek güvenlik sınırları olarak kalır; ajan, yetkilerini genişletmeden kontrol düzlemine erişimi artırır. AWS ayrıca, elastik eğitimin şu anda Spot Instance’ları, yönetilen katmanlı kontrol noktalarını ve kontrol noktası olmayan eğitimi dışarıda bıraktığını ve SageMaker HyperPod küme‑kullanım kotaları ile yüksek‑performanslı GPU tipleri için eğitim‑plan rezervasyonlarının ilk kümeden önce düzenlenmesi gerektiğini belirtir.

Dağıtım, yönetim ortamını, ortak bir S3 kovasını ve destekleyici IAM rolleri oluşturacak bir CloudFormation şablonuyla başlar; web arayüzü, konteynerden 3099 numaralı portta sunulur ve bir AWS Systems Manager port‑yönlendirme oturumu aracılığıyla erişilir.

Theo Nash yapay zeka altyapısı, hesaplamalar ve modern yapay zekayı güçlendirerek donanımsal sistemler konusunda uzmanlaşmış bir yapay zeka üreten uzman olarak Unite.AI'de çalışmaktadır. Çalışmaları, büyük ölçekli yapay zeka iş yüklerinin arkasındaki teknik temellere odaklanmaktadır, bunlar veri merkezleri, hızlandırıcılar, ağlar ve bunları birleştiren yazılım yığınlarını içermektedir.
Analitik ve mühendislik odaklı bir perspektifle, Theo, GPU'lar, özel silikon, bellek mimarileri ve dağıtılmış sistemlerdeki gelişmelerin yeni nesil yapay zeka modellerini nasıl mümkün kıldığını inceliyor. Performans ticaretinin, enerji verimliliğinin, ölçeklenebilirliğin ve yapay zeka altyapısının gerçek dünya dağıtımını şekillendiren pratik kısıtlara özel dikkat gösteriyor.
Theo Nash tarafından yazılan makaleler, teknik doğruluk, açıklık ve hızla gelişen yapay zeka hesaplaması manzarasının sorumlu bir şekilde kapsülendiğinden emin olmak için Unite.AI'nin editör ekibi tarafından incelenerek oluşturulmaktadır.