Yapay zeka modelleri ve platformları

AWS, Elastik Bellek ve Hızlı Soğuk Başlatmalar için Bedrock AgentCore Çalışma Zamanını Yeniden Düzenliyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Amazon Web Services duyurdu 18 Eylül 2026’da yeni AgentCore çalışma zamanını, Amazon Bedrock AgentCore içinde yönetilen hesaplama katmanının yeniden düzenlenmiş bir sürümü olarak, şirketin bellek yönetimini oturumlar serbest bırakıldıkça geri kazanıp konteyner görüntüsü boyutu veya eşzamanlılık ne olursa olsun tutarlı soğuk başlatma süreleri sağladığını belirtti.

AgentCore çalışma zamanı, geliştiricilere altyapı oluşturma veya sürdürme zorunluluğu olmadan ajanları dağıtıp çalıştırmak için tam yönetilen bir ortam sağlayan yönetilen bir hesaplama katmanıdır. AWS, lansmandan bu yana binlerce ekibin üretim ajanlarını çalıştırmak için kullandığını ve ilk sürümün oturum izolasyonu, sıfıra ölçekleme davranışı ve kullanım başına ödeme fiyatlandırmasıyla sunucusuz bir temel oluşturduğunu söyledi. Bu tüketim modeli devam ediyor: faturalandırma kaynak kullanımını izler, I/O bekleyen boş CPU için ücret alınmaz ve platform, bir ajanın işi olmadığında tamamen sıfıra kadar ölçeklenir.

Lansmanın Ele Aldığı Sorunlar

Orijinal çalışma zamanında, bir oturum tahsis edilen belleği tahsis anından oturum sona erene kadar tutuyordu, çünkü ara bir geri kazanım gerçekleşmiyordu. AWS, bunun uzun süren ya da ani artış gösteren ajanların bellek kullanımının en yüksek seviyesini 24 saat boyunca ödemeye devam ettiğini, bellek kullanımının durdurulmasından çok sonra bile, özellikle ara sıra patlama yapan ancak günün çoğu zamanında boşta kalan ajanlar için bir boşluk olduğunu belirtti.

Başlangıç davranışı ikinci zorluktu. AWS, zaten başlatılmış bir ortama gelen bir oturumun 100 milisaniyeden kısa sürede başladığını, ancak bunu garanti etmek için ortamları yeterince sıcak tutmanın hesaplama kaynaklarını rezerve tutmayı gerektirdiğini, bu yüzden çoğu oturumun yeni bir ortamı başlatarak, görüntüyü çekerek ve ilk isteği çalıştırmadan önce ajanı başlatarak soğuk bir başlangıçla başladığını söyledi. Bu gecikme görüntü boyutu ve eşzamanlılık arttıkça artar ve en kötü durum, en çok oturumun geldiği ve en az hazır ortamın kaldığı ani trafik altında görülür. AWS’ye göre müşteriler, yedek ortamları hazır tutarak, bellek tahsislerini optimize ederek ve kapasiteyi azaltarak maliyetleri kontrol altında tutarak her iki sorunu da aşmışlardır.

AWS’nin Ölçtükleri

Soğuk bir başlangıca platformun kendisinin ne eklediğini izole etmek için AWS, girdisini geri döndüren ve hiçbir model ya da araç çağırmayan boş bir yankı ajanı test etti. us-west-2 bölgesindeki bir Amazon EC2 örneğinde çalışan bir Python istemcisi, VPC eşlemesi olmadan, boto3 SDK’sını kullanarak, us-east-1 bölgesindeki ajanları genel internet üzerinden çağırdı; bu nedenle her istemci tarafı ölçümü, iki AWS Bölgesi arasındaki gidiş-dönüş süresini platformun kendi başlangıç süresinin üzerine ekler. Şirket, varsayılan hesap kotaları içinde, her iki çalışma zamanı sürümü ve beş görüntü boyutu için ajan başına 5.000 soğuk çağrı gönderdi.

Bu şekilde ölçüldüğünde, AWS yeni çalışma zamanının 200 MB’den 2 GB’ye kadar bir görüntüde P75 soğuk başlangıç gecikmesinin yaklaşık 2 saniye olduğunu, görüntü boyutunun buna etkisi olmadığını, oysa orijinal çalışma zamanının gecikmesinin görüntü boyutuyla birlikte yaklaşık 5,4 saniyeden neredeyse 30 saniyeye yükseldiğini raporladı. Yankı testinde, ajanın kendi kodu P75’te yaklaşık 34 milisaniye çalıştı, bu yüzden ölçülen sürenin neredeyse tamamı platformun başlangıç süresiydi. AWS, etkileşimli ajanlar için başlangıç süresini gizlemeyi, bir kullanıcı etkileşime girdiğinde (örneğin bir sohbet açtığında) oturumu başlatarak, ortamın ilk isteği yazarken ısınmasını öneriyor.

Yeni Çalışma Zamanı Nasıl Çalışıyor

Yeni çalışma zamanı, her oturumu tam olarak tahsis edilmiş bir iz yerine küçük bir bellek profiliyle başlatır, ardından iş yükü ihtiyaç duydukça ek bellek tahsis eder ve sayfalar. Bir ajan, istek başına tamponları serbest bıraktığında veya önbellek verilerini istekler arasında süresi dolduğunda, platform belleği oturum sona erene kadar tutmak yerine geri alır. AWS, bu geri kazanım davranışını milyarlarca oturumun tahsis desenleri analizine dayanarak ayarladığını söyledi.

Soğuk başlangıçlar değişir çünkü her ajan bir kez yüklenir ve ardından bir anlık görüntüden çalışır. Bir çalışma zamanı oluşturulduğunda veya güncellendiğinde, AgentCore konteyneri başlatır, sağlıklı rapor vermesini bekler ve çalışan ortamın bir anlık görüntüsünü yakalar; böylece model artefaktlarını yükleme ve statik yapılandırmayı alma gibi tek seferlik başlatma işlemleri zaten tamamlanmış olur. Her yeni örnek, sıfırdan başlatmak yerine bu anlık görüntüyü geri yükler. AWS, çalışma zamanının anlık görüntüden önbellekleri ve geçici belleği çıkardığını, böylece konteyner görüntüsü büyüdükçe boyutunun yaklaşık olarak sabit kaldığını ve bu sayede geri yükleme gecikmesinin geniş bir görüntü boyutu aralığında istikrarlı kaldığını söyledi.

Faturalandırma bellek modeline göre değişir. Yeni çalışma zamanı, bir oturum süresince tüm konteyner görüntüsünü bellekte tutmak yerine, ajan tarafından aktif olarak kullanılan, talep üzerine yüklenen ve boşta olduğunda geri kazanılan bellek için ücret alır. AWS, bu değişikliği çok daha az GB-saat üzerine uygulanan daha yüksek bir oran olarak tanımladı ve çoğu ajan için ayak izinin artandan daha fazla düştüğünü, dolayısıyla faturanın azaldığını söyledi.

Platform Sürümleri, Bölgeler ve Limitler

Geliştiriciler, bir çalışma zamanı oluştururken veya güncellerken platformVersion alanını V2 olarak ayarlayarak yeni çalışma zamanını etkinleştirirler, AgentCore Geliştirici Kılavuzu‘na göre. V1 varsayılanıdır: oluşturma sırasında alanı atlamak V1 çalışma zamanı üretir ve güncelleme sırasında atlamak mevcut platform sürümünü korur. V2, us-east-1, us-east-2, us-west-2, eu-west-1 ve ap-northeast-1 bölgelerinde mevcuttur.

V2 bir oluşturma veya güncelleme ortamı hazırlayıp anlık görüntü aldığından, bu işlemler çalışma zamanının READY durumuna ulaşması için birkaç dakika sürer; V1 çalışma zamanı ise saniyeler içinde hazır olur. AgentCore, kapsayıcının /ping uç noktasından gelen ilk sağlıklı yanıt üzerine anlık görüntüyü alır ve kapsayıcı başlangıçtan itibaren 120 saniye içinde sağlıklı rapor vermezse, oluşturma sağlık kontrol hatasıyla başarısız olur. Kılavuz ayrıca V2’nin şu anda doğrudan kod dağıtımları için toplam ortam değişkeni boyutunu 1,5 KB, konteyner ajanları için 2,5 KB ile sınırladığını, V1’de ise 4 KB olduğunu ve AWS CloudFormation ile AWS CDK’nin şu anda platformVersion ayarlamasını desteklemediğini belirtir.

Anlık görüntüler, doğrudan yönetilmek yerine çalışma zamanının sürümlerini ve uç noktalarını izler. AgentCore, bir uç nokta bir sürüme işaret ettiğinde anlık görüntü hazırlar ve hiçbir uç nokta ona işaret etmediğinde birini siler; silme işlemi en fazla 8 saat sürebilir, bu da maksimum oturum ömrüdür, çünkü anlık görüntü üzerinde zaten çalışan oturumlar sona kadar devam eder. Oturumlar, izole CPU, bellek ve dosya sistemi kaynaklarına sahip ayrılmış microVM’lerde çalışır, en fazla 8 saat kalıcıdır ve 15 dakikalık hareketsizlikten sonra sonlandırılır; ardından microVM sonlandırılır ve bellek temizlenir.

Yol Haritası ve Başlangıç

Lansmanın ötesinde, AWS yolda birkaç yetenek listesi sundu: her oturum için bir bellek alt sınırı rezerve eden ve üzerindeki talep üzerine artışa izin veren taahhütlü temel indirimler, sürekli aktif oturumları hedef alır; daha büyük RAM, vCPU ve oturum depolama; x86 microVM desteği; bellek anlık görüntüsü alarak duraklatma ve devam ettirme, ayrıca aktif bir oturum sonlandırılmadan önce durumu serileştirmek için çalışma zamanı kancaları; ve denetimsiz ajanlar için her oturuma kapsamlı bir kimlik veren oturum bağlamı anahtarları.

AWS, geliştiricileri AgentCore Geliştirici Kılavuzu’na, GitHub üzerindeki AgentCore örnek deposuna ve kullanıcının kendi AWS hesabı içinde yeni çalışma zamanının soğuk başlangıç gecikmesini gösteren bir yük testi örneğine yönlendirdi.

Theo Nash yapay zeka altyapısı, hesaplamalar ve modern yapay zekayı güçlendirerek donanımsal sistemler konusunda uzmanlaşmış bir yapay zeka üreten uzman olarak Unite.AI'de çalışmaktadır. Çalışmaları, büyük ölçekli yapay zeka iş yüklerinin arkasındaki teknik temellere odaklanmaktadır, bunlar veri merkezleri, hızlandırıcılar, ağlar ve bunları birleştiren yazılım yığınlarını içermektedir.
Analitik ve mühendislik odaklı bir perspektifle, Theo, GPU'lar, özel silikon, bellek mimarileri ve dağıtılmış sistemlerdeki gelişmelerin yeni nesil yapay zeka modellerini nasıl mümkün kıldığını inceliyor. Performans ticaretinin, enerji verimliliğinin, ölçeklenebilirliğin ve yapay zeka altyapısının gerçek dünya dağıtımını şekillendiren pratik kısıtlara özel dikkat gösteriyor.
Theo Nash tarafından yazılan makaleler, teknik doğruluk, açıklık ve hızla gelişen yapay zeka hesaplaması manzarasının sorumlu bir şekilde kapsülendiğinden emin olmak için Unite.AI'nin editör ekibi tarafından incelenerek oluşturulmaktadır.