Yapay zeka modelleri ve platformları

WEKA, NeuralMesh 6 ve WEKApod 3’ü AI Altyapısının İnferansa Doğru Kaydığı Dönemde Tanıttı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

WEKA, AI endüstrisinin en pahalı ortaya çıkan sorunlarından biri olan GPU’ların üretkenliğini korumak için koordineli bir yazılım ve donanım revizyonu başlattı: modeller eğitimden sürekli, büyük ölçekli inference aşamasına geçerken.

Duyurular, şirketin veri ve bellek platformuna önemli bir güncelleme olan NeuralMesh 6‘yı ve AI bulutları, model geliştiricileri, araştırma kurumları ve GPU altyapısı işleten işletmeler için tasarlanan üçüncü nesil WEKApod cihazlarını içeriyor.

Birlikte, AI altyapısı tasarımında daha geniş bir değişimi yansıtıyorlar, depolamanın pasif bir depodan aktif bir bellek ve veri teslimat katmanına evrilmesi.

Üretime Yönelik Birleştirilmiş AI Çabası

AI çıkarımı için altyapı gereksinimleri, model eğitimi için olanlar açısından önemli ölçüde farklılık gösteriyor. Eğitim işleri genellikle göreceli olarak öngörülebilir boru hatları aracılığıyla büyük veri kümelerini işler. Agentic AI, retrieval-augmented generation ve uzun bağlamlı akıl yürütme sistemleri ise değişen verilere erişmeli, tekrarlanan etkileşimler boyunca bağlamı korumalı ve pahalı GPU’ları bilgi beklerken boşta bırakmamalıdır.

WEKA’nın yanıtı, depolamayı, bellek uzantısını, dosya erişimini, nesne erişimini ve veri hareketini aynı platformun parçaları olarak ele almaktır. NeuralMesh, eğitim, çıkarım ve yüksek performanslı hesaplama için ortak bir veri temeli sağlamak üzere tasarlanmıştır.

Yeni sürüm, bu mimariyi çok kiracılık, yerel nesne depolama, dağıtılmış önbelleğe alma, otomatik veri azaltma, Kubernetes işlemleri ve merkezi gözlemleme ile genişletiyor.

Yazılım ve cihaz duyurularını birbirinden bağımsız güncellemeler olarak konumlandırmak yerine, şirket bunları aynı sistemin iki parçası olarak sunuyor. NeuralMesh 6, verilerin nasıl depolandığını, taşındığını, izole edildiğini ve teslim edildiğini kontrol ederken, WEKApod 3, bu işlevlere özel donanım sunuyor.

NeuralMesh 6 Dosya ve Nesne İş Yüklerini Birleştirmektedir

NeuralMesh 6’daki daha önemli eklemelerden biri, yerel bir S3 uygulamasıdır ve NVMe depolamayı kullanır. Aynı alt düzey veri blokları, S3 nesne protokollerini ve POSIX veya Ağ Dosya Sistemi arayüzlerini takip etmeden ayrı kopyalar olmadan erişilebilir.

Bu önemli çünkü AI boru hatları genellikle nesne depolama, yüksek performanslı dosya sistemleri, eğitim ortamları ve çıkarım kümeleri arasında bilgi taşır. Her kopya kapasite tüketir, gecikmelere neden olur ve yönetimini karmaşıklaştırır. Birleştirilmiş bir ad alanı, bir protokol aracılığıyla oluşturulan verilerin başka bir protokol aracılığıyla hemen erişilebilir olmasını sağlayabilir.

WEKA, uygulamasının her düğümde 2.000 ila 5.000 eşzamanlı S3 bağlantısını desteklediğini söylüyor. Ayrıca, verilerin GPU belleğine geleneksel CPU ve işletim sistemi katmanlarından geçmeden taşınmasına olanak tanıyan Uzaktan Doğrudan Bellek Erişimi üzerinden S3’u destekliyor.

Platform, iki düzeyde çok kiracılık sunuyor. Composable Clusters, ayrı kiracılara adanmış işlemci, bellek ve depolama kaynakları ayırır, जबकi sanal çok kiracılık, ağ izolasyonu, bağımsız şifreleme, ayrı kimlik doğrulama ve kiracı başına hizmet kalitesi kontrolü sağlar.

Sanal ortamlar, şirketin belirttiğine göre, bir kümeye 1.000’den fazla izole kiracıya destek olabilir. Fiziksel ve sanal modellerin birleştirilmesi, büyük bir altyapı operatörünün her biri için bağımsız bir depolama kümesi dağıtmadan on binlerce mantıksal olarak ayrılmış müşteriyi desteklemesine olanak tanır.

Bu, GPU-as-a-service sağlayıcıları ve egemen AI bulutları için özellikle önemlidir, bunlar yüksek altyapı kullanımını sıkı müşteri izolasyonu ile dengelemelidir.

Verileri GPU’ların Bulunduğu Her Yere Taşımak

NeuralMesh 6 ayrıca, veri merkezleri, bulutlar ve coğrafi bölgeler arasında dağıtılan AI iş yükleri için meta veri öncelikli replikasyon ve uzak önbelleğe almayı tanıtıyor.

Geleneksel replikasyon genellikle bir iş yükü başlamadan önce tüm bir veri kümesinin kopyalanmasını gerektirir. NeuralMesh ise, meta verilerin hemen görünür olmasını sağlar, ardından alt düzey verileri istendiğinde taşır.

Bu, operatörlerin projeye ait her dosyayı önce kopyalamadan without GPU kapasitesine doğru işleri taşımasına olanak tanır. Bu yaklaşım, bulut patlaması, dağıtılmış AI altyapısı ve coğrafi olarak ayrılmış araştırma veya mühendislik ekipleri arasındaki işbirliğini desteklemek için tasarlanmıştır.

Ayrıca, verilerin orijinal olarak depolandığı yere bakılmaksızın tutarlı bir şekilde adreslenebileceği bir global ad alanı modeline doğru ilk adımlardan birini temsil eder.

Diğer bir yeni özellik, parmak izleme, benzerlik karması, veri azaltma ve sıkıştırma işlemlerini sürekli olarak uygular, bu işlemleri arka planda isteğe bağlı bir işlem olarak değil.

WEKA, NeuralMesh 6’nın AI eğitim verilerine %6 katına kadar kapasite tasarrufu sağlayabileceğini, yazma yükünün %5’ten az olacağını iddia ediyor. Gerçek azaltma, veri kümesine bağlı olacaktır. Kontrol noktaları, konteynır katmanları, model sürümleri ve yinelemeli eğitim verileri önemli ölçüde tekrarları içerebilirken, diğer veri türleri daha az etkili bir şekilde sıkıştırılabilir.

Şirket, temsilcisi müşteri verilerini dağıtımdan önce analiz etmeyi ve ortaya çıkan tahmini kapasite ve performans taahhütlerinin bir parçası olarak kullanmayı planlıyor.

Depolamayı Genişletilmiş AI Bellek Katmanına Dönüştürmek

NeuralMesh ayrıca, WEKA’nın Augmented Memory Grid adlı bir özelliği içerir ve bu, çıkarım için NVMe depolamayı GPU belleğinin kalıcı bir uzantısı olarak kullanır.

Büyük dil modelleri, bir.prompt veya sohbetten hesaplanan bilgileri içeren bir anahtar-değer önbelleği oluşturur. Uzun bağlamlar ve agentic iş akışları için bu önbellek çok büyük olabilir. Yüksek bant genişliği GPU belleğinde kalması mümkün değilse, sistemler bunu atabilir, yeniden hesaplayabilir veya daha yavaş altyapıya taşıyabilir.

Augmented Memory Grid, bu önbelleği kalıcı bir NVMe destekli katmanda depolar ve Uzaktan Doğrudan Bellek Erişimi ve NVIDIA GPUDirect Storage’u kullanarak bunu GPU’lara geri taşır.

Hedef, tekrar eden ön doldurma hesaplamasının birincil kaynağı olan yeniden kullanılabilir bağlamı korurken, kaynakları azaltmaktır.

WEKA, Oracle Cloud Altyapısı’nda NVIDIA H100 GPU’ları kullanarak testlerde, 10 kat daha yüksek token aktarım hızına, 10 kat daha fazla eşzamanlı kullanıcıya ve GPU başına 7 kat daha fazla token elde edildiğini bildirdi.

Bu rakamlar evrensel performans beklentileri değil, belirli iş yükü ölçümleridir, ancak çıkarım altyapısı tasarımının önemli bir parçası olan kalıcı önbellek yönetimini neden önemli hale getirdiğini göstermektedir.

WEKApod 3 Donanım Katmanını Kontrol Ediyor

Önceki WEKApod sistemleri, WEKA yazılımıyla birlikte önceden doğrulanmış altyapıyı birleştirdiği halde, üçüncü nesil daha da dikey olarak entegre sistem tasarımına doğru ilerliyor.

WEKA, yeni iki yuva birimi şasisini, sürücü bağlantısını, soğutma mimarisini, hata alanlarını ve hizmete alma sistemini tasarladı. Cihazlar, dahili olarak PCI Express Gen 6 kullanıyor ve NVIDIA (NVDA ) ConnectX ağı ile Spectrum-X Ethernet altyapısına bağlantı kuruyor.

WEKApod ailesi şimdi üç yapılandırılabilir sistemden oluşuyor. Nitro, bant genişliği yoğun çıkarım ve AI fabrikası iş yükleri için optimize edilmiş durumda. Prime, performans ve kapasite arasında denge sağlamak için üç seviyeli hücre ve dört seviyeli hücre flaş kullanıyor. Prime Max, iki yuva birimi şasisine 70’e kadar NVMe sürücüsü sığdırarak maksimum depolama yoğunluğuna öncelik veriyor.

Tam bir rafta, WEKA, Prime Max’ın 441,5 petabayt ham kapasite ve NeuralMesh veri azaltması之后 1,1 exabayt etkili kapasite sağlayabileceğini söylüyor. Raftaki sistem, saniyede 10,2 terabayt veri aktarım hızına ve saniyede 210 milyon girdi/çıkış işlemini destekleyecek şekilde derecelendiriliyor.

Ham ve etkili kapasite arasındaki fark önemlidir. Exabayt rakamı, depolanan verilerin azaltılabilirliğine bağlıdır ve fiziksel flaşın bir exabaytından daha fazlası olarak yorumlanmamalıdır.

Bununla birlikte, daha yüksek yoğunluk, GPU’lerle rekabet halinde olan depolama için alan, soğutma ve elektrik kapasitesine sahip tesislerde önemli sonuçlar doğurabilir.

Kısıtlı Veri Merkezleri için Tasarlandı

Yeni sistemler ayrıca, AI altyapı projelerini giderek daha fazla şekillendiren fiziksel sınırlamalara hitap ediyor.

GPU kümeleri, büyük miktarda elektrik, soğutma, ağ ve yer gerektirir. Verileri verimsiz bir şekilde tüketen depolama sistemleri, bir tesisin destekleyebileceği hızlandırıcıların sayısını azaltabilir.

WEKA, yeni cihazların, ilgili kategorilerdeki diğer en iyi halka açık alternatiflere kıyasla %267 daha fazla etkili kapasite yoğunluğu ve %114 daha fazla performans yoğunluğu sunduğunu iddia ediyor.

Şirket, sistemleri 35 derece Celsius’a kadar olan ambient sıcaklıklarda çalışacak şekilde tasarladı. Yazılım kontrollü güç azaltma, termal stres sırasında performansı dần dần azaltmaya yönelik olarak tasarlandı.

Arka plan olmadan bir sürücü tasarımı daha küçük hata alanları oluştururken, sıcak takaslı boot sürücüleri ve yönlendirilmiş değiştirme prosedürleri bakım süresini azaltmaya yönelik olarak tasarlandı. Müşteriler, şasi tipi, bellek, sürücü kapasitesi ve sürücü sayısını yapılandırabilir, dağıtımlar bir petabayttan daha azından 100 petabayta kadar çeşitlilik gösterebilir.

AI Fabrikaları Etrafında Bir Ekosistem Oluşturmak

Eşlik eden ortaklık duyuruları, platformun altyapı entegratörleri, bulut sağlayıcıları ve AI orkestrasyon satıcıları aracılığıyla müşterilere ulaşacağını gösteriyor.

Spectro Cloud, NeuralMesh’i PaletteAI ile birleştirecek ve empresa AI fabrikalarını dağıtmak ve işletmek için bir veri katmanı olarak konumlandırıyor. World Wide Technology ve Computacenter, sistemleri daha geniş altyapı projelerine entegre etmeyi planlıyor, जबकi Glocomp, müşterilerin daha iyi AI performansı ve daha öngörülebilir altyapı maliyetleri talebini vurguladı.

Bu ekosistem stratejisi önemlidir, çünkü çoğu kuruluş üretim AI ortamlarını tek bir tedarikçiden toplamıyor.

Tipik bir dağıtım, birden fazla satıcıdan GPU’lar, ağ, depolama, Kubernetes, model sunma yazılımı, gözlemleme, güvenlik ve yönetim ürünleri içerebilir. Ortak olarak doğrulanmış yapılandırmalar, entegrasyon çalışmalarını azaltabilir, ancak müşterilerin kendi modellerini, veri kümelerini, ağlarını ve eşzamanlılık gereksinimlerini kullanarak performansı test etmesi gerekecektir.

AI Altyapısı Açısından Anlamı

Duyurunun en önemli yönü, bireysel kapasite veya aktarım hızına ilişkin herhangi bir rakam değil, depolama, dağıtılmış önbelleğe alma, bellek yönetimi, veri hareketi ve kiracı izolasyonu arasındaki artan birleşmedir.

AI ajanları daha uzun geçmişleri hatırladıkça, daha fazla kurumsal bilgiye erişip sürekli çalıştıkça, GPU’ları çevreleyen altyapı, her yararlı yanıtın maliyetini giderek daha fazla belirleyecektir.

Artık hızlandırıcı eklemek, tekrarlanan bağlam işlemleri, yavaş veri hareketi, parçalı protokoller veya kullanılmayan depolama kapasitesi tarafından oluşan tıkanıkları çözmez. AI altyapısının bir sonraki aşaması, ham hesaplama kapasitesini artırmak kadar, GPU’ları verimli bir şekilde beslemek ve yönetmekle ilgili olacaktır.

NeuralMesh 6, 2026’nın ikinci yarısında genel olarak kullanılabilir hale gelmesi planlanıyor, mevcut müşteriler standardı yazılım kanalı aracılığıyla yükseltmeye hak kazanacak. Yeni WEKApod Nitro, Prime ve Prime Max sistemleri siparişe açık, teslimatların 2026 sonbaharında başlaması bekleniyor.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.