Yapay zeka modelleri ve platformları
AWS, GPU‑Bilinçli Yönlendirme için SageMaker HyperPod Inference Gateway’i Başlattı

Amazon Web Services, 18 Eylül 2026 tarihinde Amazon SageMaker HyperPod Inference Gateway‘i duyurdu; bu, büyük dil modeli çıkarımı için Kubernetes‑yerel, GPU‑bilinçli yönlendirme sistemi olup mevcut HyperPod altyapısında Amazon EKS için tek bir yönetilen eklenti olarak dağıtılıyor. AWS, ağ geçidinin ilk token gecikmesini %82’ye kadar azaltabileceğini belirtti.
Ağ Geçidinin Arkasındaki Yönlendirme Sorunu
AWS’ye göre, varsayılan Kubernetes yük dengeleme algoritmaları, örneğin round-robin ve en az bağlantı, GPU durumuna dair bir görünürlük sağlamaz: hangi podların KV önbellekleri dolmuş, hangilerinin uzun bağlam üretiminde orta aşamada olduğu ve hangilerinin zaten bir istek için gereken LoRA adaptörüne sahip olduğu bellek içinde. Şirket, yoğun podların arkasında isteklerin biriktiğini, boş kapasitenin kullanılmadığını, trafik patlamaları sırasında ilk token gecikmesinin dört saniyenin üzerine çıktığını, kullanımın düzensiz ve öngörülemez hâle geldiğini ve operatörlerin bunu dengelemek için aşırı kaynak ayırdığını belirtti. AWS, bir sohbet botu kullanıcısının ilk tokeni beklerken 4,4 saniye yerine 800 milisaniyeden kısa bir sürede aldığını gösteren bir senaryo tasvir etti.
İki Katmanlı Mimari
Ağ geçidi, Kubernetes‑yerel primitifler üzerine inşa edilmiş iki katmanlı bir tasarım kullanır. AWS, her çıkarım isteğini en uygun pod’a yerleştirmek için gerçek zamanlı GPU sinyallerini kullandığını söyledi. 1. Katman, her HyperPod veya EKS kümesinde amazon-sagemaker-hyperpod-inference eklentisi olarak doğrudan kurulur ve açık kaynaklı Gateway API Inference Extension üzerine inşa edilmiş üç bileşenden oluşur. Envoy Gateway, katman‑7 proxy’si, gelen HTTPS trafiğini sonlandırır ve her küme için tek bir özel uç nokta sunar. Body‑Based Router, gelen OpenAI‑uyumlu istek gövdesini inceler, model alanını ayıklar ve isteği doğru model havuzuna yönlendirir; böylece bir ağ geçidi birden çok modeli hizmet verebilir.
Endpoint Picker, her model‑servis podundan gerçek zamanlı Prometheus metriklerini tüketir ve KV önbellek kullanımı, kuyruk derinliği, LoRA adaptör yerleşimi, önek önbellek isabet oranı ve çalışan istekler gibi değerlendiriciler arasında ağırlıklı bir puanlama algoritması uygular. Her değerlendirici, belirli bir iş yükü için yönlendirme davranışının ayarlanmasına olanak tanıyan yapılandırılabilir bir ağırlığa sahiptir; örneğin gecikmeye duyarlı sohbet ile verimlilik‑optimize edilmiş toplu iş arasında.
2. Katman, Global Inference Router, yakında geleceği belirtilen bir özelliktir. AWS, çoklu kümeler ve bölgeler arasında filo‑geniş koordinasyon, küme‑arası geçiş, küresel oran sınırlaması ve maliyet‑bilinçli trafik şekillendirme ekleyeceğini duyurdu. 2. Katman, 1. Katmanın üzerine inşa edilir; her kümenin kendi küme‑içindeki ağ geçidi ise yerel yönlendirmeyi yönetmeye devam eder.
Dağıtım, Hata Yönetimi ve Gözlemlenebilirlik
Dağıtım, tek bir aws eks create-addon komutu ve modelleri ve yönlendirme davranışını tanımlayan tek bir deklaratif InferenceGatewayConfig özel kaynağından oluşur; mevcut model sunucu dağıtımları pod etiketleri aracılığıyla keşfedilir. AWS, kurulumun yan hizmet (sidecar), hizmet ağı (service mesh) ve uygulama kodu değişikliği gerektirmediğini belirtti. Ağ geçidi, HTTP üzerinden standart bir OpenAI‑uyumlu uç nokta sunar; AWS’ye göre, mevcut istemci kodu değişmeden çalışır, SDK değişikliği ve çıkarım trafiği için SigV4 imzası gerekmez.
Ortak bir temel model üzerinde ince ayarlı LoRA adaptörleri sunan iş yükleri için, Endpoint Picker’ın LoRA Affinity Scorer’ı, istekleri zaten istenen adaptöre GPU belleği içinde sahip pod’lara yönlendirir; eğer hiçbir pod bu adaptörü yüklemiş değilse, istek en fazla kullanılabilir kapasiteye sahip pod’a gider. AWS, bunun adaptör değiştirme gecikmesini ortadan kaldırdığını söyledi.
Belgelendirilmiş hata davranışları pod hatası, havuz tükenmesi, küme hatası ve bölge hatasını kapsar. Pod hatası durumunda, Endpoint Picker, eski metriklere sahip pod’ları dışlar ve sağlıklı pod’lara yönlendirir; metrikler yeniden geldiğinde otomatik olarak iyileşir. Havuz tükenmesi durumunda, ağ geçidi HTTP 429 yanıtını bir Retry-After başlığıyla döndürür ve otomatik ölçekleme kapasite ekler. Küme hatası durumunda, Global Inference Router eski bir kalp atışını tespit eder ve trafiği 35 saniye içinde yeniden yönlendirir; küme yeniden devreye alındığında kademeli olarak artış sağlar. Bölgesel hata durumunda, bölge‑arası yönlendirme otomatik olarak etkinleşir; AWS, bunun daha yüksek gecikme getirdiğini ancak kullanılabilirlik üzerinde etkisi olmadığını belirtti.
Ağ geçidi, pod, havuz, küme ve filo seviyelerinde metrikler yayınlar: KV önbellek kullanımı, kuyruk derinliği, çalışan istekler ve adaptör yerleşimi Prometheus aracılığıyla pod seviyesinde; istek toplamları, süre histogramları ve token sayıları Prometheus ve Grafana aracılığıyla havuz seviyesinde; ortalama KV önbellek, hata oranı ve P99 gecikmesi Amazon CloudWatch aracılığıyla küme seviyesinde; ve yönlendirme kararları, geçiş olayları ve oran sınırlama vuruşları CloudWatch aracılığıyla filo seviyesinde.
AWS Tarafından Bildirilen Performans Sonuçları
AWS, 8B ile 235B parametre arasında değişen dört modeli H100 GPU’lu p5.48xlarge örnekleri ve A10G GPU’lu g5 örnekleri üzerinde benchmark ettiğini belirtti. Tüm trafik, üretim isteğinin izlediği yolu eşleştiren dahili Application Load Balancer’lar üzerinden yönlendirildi; kontrollü yük üreten ayrı bir istemci düğüm grubu ve model sunucularının ayrı bir sunucu düğüm grubunda izole edilmesi sağlandı. Her sonuç, ağ geçidinin ayarlama yapılmamış varsayılan yönlendirme yapılandırmasını kullanır ve aynı model kopyaları üzerindeki Kubernetes round-robin temeline karşı ölçülür, AWS’ye göre.
Rapor edilen sonuçlarda, karışık nesil GPU filosu, Llama-3.1-8B için zaman‑ilk‑token P95 ve P99 gecikmesini %97 oranında, %8 daha yüksek verimlilik artışıyla azalttı ve Qwen3-32B için %98 ve %97, %50 daha yüksek verimlilik artışıyla azalttı. Ani trafik altında, Llama-3.1-70B P95 ve P99 gecikmelerinde sırasıyla %94 ve %98 azalma ve %12 daha yüksek verimlilik sağladı, Qwen3-235B ise benzer P95 gecikmesi ve %89 daha düşük P99 gösterdi. Paylaşılan istem ön ekleriyle, Llama-3.1-8B P95 ve P99 gecikmeleri sırasıyla %26 ve %43 azaldı.
AWS, tamamen tutarlı bir filo üzerinde sabit trafik altında geçidin round‑robin ile eşdeğer performans gösterdiğini ve karşılaştırılabilir sonuçları çalıştırma‑çalıştırma varyansı içindeki farklar olarak tanımladığını belirtti. Şirket, iyileştirmelerin en büyük olduğu alanların round‑robin’in en çok zorlandığı durumlar olduğunu söyledi: karışık donanım, ani talep ve paylaşılan istem ön ekleri.
Kullanılabilirlik ve Yol Haritası
AWS, geçidi Kubernetes Gateway API ve onun Inference Extension’ına uygun, tek bir özel kaynak tanımıyla yapılandırılmış ve vLLM, SGLang ve TGI dahil olmak üzere herhangi bir OpenAI‑uyumlu model sunucusuyla uyumlu olarak tanımlıyor. Yönetim, kubectl, GitOps, Helm ve ArgoCD aracılığıyla çalışıyor; kurulum, yükseltmeler ve geri dönüşler EKS eklenti yaşam döngüsü üzerinden yönetiliyor.
Tier 1 küme‑başına yönlendirme, çıkarım eklentisinin mevcut olduğu bölgelerde 18 Eylül 2026 tarihinden itibaren kullanılabilir. Global Inference Router’ın ötesinde, AWS’nin yol haritasında adı geçen öğeler arasında, InferenceModelRewrite özel kaynaklarını kullanarak trafiğin bir yüzdesini yeni model sürümlerine yönlendirecek canary trafik bölme ve istekleri Kritik, Standart veya Bırakılabilir olarak sınıflandıran, bant‑başına kabul kontrolü sağlayan akış kontrolü yer alıyor.












