Yapay zeka modelleri ve platformları
Spectro Cloud, PaletteAI Inference Launchpad’ı Kuruluşların AI Token Masraflarını Kontrol Etmesine Yardımcı Olmak için Başlattı

Spectro Cloud, PaletteAI Inference Launchpad’ı başlattı, bu bir yerel olarak yönetilen çıkarım platformudur ve kuruluşların dış model hizmetlerine bağımlılığını azaltmasına ve yapay zeka iş yüklerinin artan maliyetini daha iyi kontrol etmesine yardımcı olmak üzere tasarlanmıştır.
Şirket, organizasyonların dış token maliyetlerini iş yükü karışımı, altyapısı ve model seçimine bağlı olarak %70’e kadar azaltabileceğini söylüyor. Spectro Cloud ayrıca PaletteAI’nin AMD tabanlı altyapı için desteğini genişletti, böylece müşterilere daha geniş bir grafik işleme birimi (GPU) yelpazesi, çıkarım çalışma zamanları ve model sunma teknolojileri sunuyor.
Bu duyurular, kurumsal AI’de daha geniş bir değişimi yansıtıyor. Şirketler, deneysel aşamadan öteye geçip müşteri hizmetleri, yazılım geliştirme, analiz ve iç operasyonlar gibi alanlarda yapay zekayı uygulamaya başladığında, model girişlerini ve çıkışlarını işlemenin maliyeti önemli bir altyapı sorunu haline geliyor.
AI Çıkarımını Kuruluş Verilerine Yaklaştırmak
PaletteAI Inference Launchpad, yerel bir ilk yaklaşım üzerine inşa edilmiştir. Dışarıda barındırılan bir sınır modeline her isteği otomatik olarak göndermek yerine, kuruluşlar uygun iş yüklerini kendi veri merkezlerinde, özel bulutlarında, egemen ortamlarında veya kenar konumlarında bulunan altyapıda çalıştırabilirler.
Kuruluşlar, belirli görevler için sınır modellerine erişimlerini koruyabilirler. Platform, maliyet, performans, yönetim gereksinimleri ve görevin karmaşıklığı gibi faktörlere bağlı olarak yerel ve dış modeller arasında istekleri yönlendirmek için tasarlanmıştır.
Bu hibrit model, kuruluşlar daha küçük ve daha uzmanlaşmış modellere geçtikçe giderek daha önemli hale gelebilir. Bir müşteri destek isteği, belge sınıflandırma görevi veya iç bilgi sorgusu, gelişmiş akıl yürütme, karmaşık kodlama veya çoklu modlu analiz gibi görevler için aynı model kapasitesine ihtiyaç duy nemus olabilir.
Uygun iş yüklerini yerel olarak tutmak, ayrıca çıkarımı uygulamalara, kullanıcılara ve veri kaynaklarına yaklaştırmak yoluyla gecikmeyi azaltabilir. Düzenlenen endüstrilerde faaliyet gösteren kuruluşlar için yerel işleme, hassas bilgilerin nasıl işlendiğine dair daha iyi kontrol sağlayabilir.
Token Kullanımı Altyapı Metriği Oluyor
Tokenlar, yapay zeka modellerinin metin, kod ve diğer bilgileri böldüğü ve işlediği birimlere verilen addır. Her bir istem ve üretilen yanıt tokenları tüketir ve birçok ticari model hizmeti token sayısı üzerinden ücretlendirilir.
Bu, AI maliyetlerinin denetimli deneylerden binlerce çalışana veya müşteriye hizmet veren uygulamalara geçtikçe hızla artabileceği anlamına gelir. AI ajanları, tekrarlanan model çağrıları, bilgi alma, sonuçları değerlendirme ve dış araçları kullanma gibi görevleri gerçekleştirdiği için sorun daha da karmaşık hale gelir.
Goldman Sachs Araştırması, aylık AI token tüketiminin 2026 ile 2030 arasında 24 kat artarak yaklaşık 120 katrilyon token/montha ulaşmasını öngörüyor. Bu öngörülen büyüme, kurumsal benimseme ve daha özerk AI ajanlarının ortaya çıkmasıyla sürüyor.
Inference Launchpad, bu sorunu çözmek için altyapı ekiplerine token tüketimini ölçme, kotalar oluşturma ve kullanım politikaları uygulama araçları sunar. Bu kontroller, şirketlerin AI harcamalarından sorumlu olan ekipleri, uygulamaları ve modelleri anlamalarına yardımcı olabilir, böylece çıkarımı öngörülemez bir dış hizmet ücreti olarak değil, daha yönetilebilir bir maliyet olarak ele alabilirler.
Spectro Cloud’un bahsettiği %70’lik azalma, garantili bir tasarruf olarak değil, potansiyel bir sonuç olarak değerlendirilmelidir. Gerçek ekonomik faydalar, GPU edinme veya kiralama maliyetleri, kullanım oranları, enerji tüketimi, model verimliliği, istek hacmi ve dış sağlayıcıların fiyatlandırması gibi faktörlere bağlı olacaktır.
Yerel Modelleri Sınır Modellerini Ortadan Kaldırmadan
Platformun model yönlendirme yetenekleri, kuruluşları tüm yerel veya tüm bulut kararı vermeye zorlamaktan kaçınmak için tasarlanmıştır.
Kuruluşlar, öngörülebilir veya gizlilik duyarlı görevler için daha küçük yerel modelleri kullanabilirken, daha talepkar istekleri sınır modellerine gönderebilirler. Politikalar, ayrıca belirli departmanlar, yargı bölgeleri veya veri sınıflandırmaları için hangi modellerin izinli olduğunu belirleyebilir.
Bu, çıkarım katmanına doğrudan yönetim getirir. Örneğin, bir finans kuruluşu, belirli bilgileri kontrol edilen bir ortamdan çıkarmayı önlerken, duyarlı olmayan istekleri dış bir modele kullanmasına izin verebilir. Bir çok uluslu şirket, bölgesel veri gereksinimlerine göre farklı yönlendirme kuralları uygulayabilir.
Spectro Cloud, model seçimi ve yönetimini PaletteAI’nin daha geniş altyapı yönetim stratejisinin bir parçası olarak konumlandırdı. Platform, paylaşılan GPU ortamlarını, rol tabanlı erişimi, kaynak kotalarını ve çoklu kiracılı kontrolü destekler; bu, birden fazla ekibin aynı altyapıyı kullanmasını sağlar, ancak altta yatan sistemlere sınırsız erişim sağlamaz.
AMD AI Altyapısı için Genişletilmiş Destek
Inference Launchpad ile birlikte, Spectro Cloud, AMD tabanlı AI ortamları için daha geniş bir desteği duyurdu.
Entegrasyon, AMD GPU’ları, AMD GPU Operatörü, ROCm yazılım yığını ve AMD Çıkarım Mikro Hizmetlerini (AIMs) içerir. Bu bileşenler, AI modellerini üretim ortamında çalıştırmak için gereken altyapının farklı katmanlarını ele alır.
AMD GPU Operatörü, Kubernetes kümelerinde AMD Instinct hızlandırıcılarının yapılandırmasını ve yönetimini basitleştirir. ROCm, AI ve yüksek performanslı hesaplama iş yüklerini AMD donanımında çalıştırmak için kullanılan temel açık yazılım yığınıdır; sürücüler, kitaplıklar, çalışma zamanları ve geliştirme araçları içerir.
AIMs, AMD Instinct GPU’ları için standardize edilmiş çıkarım mikro hizmetlerini sağlar. Optim化 edilmiş modelleri ve destekleyici yazılımları dağıtıma hazır hizmetlere paketlemeye yönelik olarak tasarlanmıştır; bu, bir modeli üretime alma işleminin bir parçası olarak gereken entegrasyon çalışmalarının bir kısmını azaltabilir.
Kurumsal müşteriler için bu genişletilmiş destek, NVIDIA (NVDA ) ve AMD altyapısı için ayrı yönetim süreçleri oluşturmak yerine karma GPU ortamlarını çalıştırmayı daha kolay hale getirebilir.
Donanımından Modellere Kadar Yığını Yönetmek
Spectro Cloud, başlangıçta Palette’i, kamu bulutları, özel veri merkezleri, çıplak metal sistemler ve kenar konumlarındaki kümeleri dağıtmak ve bakımını yapmak için bir Kubernetes yönetim platformu olarak geliştirdi.
PaletteAI, bu temeli AI altyapısına genişletir. Kubernetes yaşam döngüsü yönetimini, GPU orkestrasyonunu, model hizmetlerini, güvenlik kontrollerini, ağ oluşturmayı ve makine öğrenimi operasyonları araçlarını birleştirir. Spectro Cloud, platformu, fiziksel donanım katmanından üstünde çalışan modellere ve çıkarım hizmetlerine kadar altyapıyı yönetmek için bir yol olarak tanımlar.
Platform ayrıca PaletteAI Studio’yu içerir; bu, Kubeflow, MLflow, ClearML, Run:ai ve Hugging Face gibi teknolojilerden oluşan önceden entegre edilmiş altyapı ve AI yığınları sağlar. Bu yapılandırmalar, platform ekiplerine, her bileşeni manuel olarak entegre etmek yerine yinelemeli dağıtım şablonları sağlar.
Inference Launchpad, token yönlendirmesi, ölçümü ve yerel olarak yönetilen model sunma gibi özelliklerini bu daha geniş altyapı katmanına ekler.
Egemen ve Düzenlenen AI Ortamlarını Desteklemek
Spectro Cloud, ayrıca neocloud’lar, yönetilen hizmet sağlayıcıları ve egemen bulut operatörlerini hedefliyor. Bu sağlayıcılar genellikle paylaşılan GPU altyapısını sunarken, müşteriler arasında izolasyonu korumak ve yargı bölgesine özgü kontrolleri uygulamak zorundadır.
Şirket, Austin ve Dubai’den hoạt động gösteren altyapı sağlayıcısı NexusIgnite ile birlikte, veri ikametgahı, uyumluluk ve operasyonel egemenlik içeren dağıtımları desteklemek için çalışıyor.
Veri ikametgahı genellikle bilgilerin nerede depolandığı ile ilgilidir. Egemen AI, altyapının kimin tarafından işletildiği, hangi yasal sistemlerin uygulandığı, kimin erişebileceği ve ortamın dış hizmetlerden ayrılabileceği veya denetlenebileceği gibi ek soruları gündeme getirir.
Spectro Cloud’un platformu, self-hosted ve hava boşluğu dağıtımlarını desteklerken, PaletteAI VerteX, hükümet ve düzenlenmiş ortamlar için güvenlik kontrolleri ekler.
Bu yetenekler, her AI etkileşimini paylaşılan bir kamu hizmetine yönlendiremeyen hükümetler, sağlık kuruluşları, finans kurumları ve kritik altyapı operatörleri için özellikle ilgili olabilir.
Kurumsal AI Operasyonları Around Artan Rekabet
Bu lansman, Spectro Cloud’un 100 milyon dolarlık Seri D yatırım turunu duyurmasının ardından geldi; bu tur, Goldman Sachs Alternatifleri’nin büyüme ekibi tarafından liderlik ediliyor ve AMD Ventures, Ericsson, LG Technology Ventures ve Maximus’un katılımıyla gerçekleşti.
Şirket, fonların üretim AI altyapısı, egemen bulutlar, neocloud hizmetleri ve dağıtılmış çıkarım alanındaki genişlemesini destekleyeceğini söyledi. Spectro Cloud şimdiye kadar yaklaşık 260 milyon dolar topladı.
Stratejisi, model geliştirmek yerine model işletmesine odaklanan AI pazarının ortaya çıkan bir katmanını yansıtıyor. Model seçenekleri çoğaldıkça, kuruluşlar nerede çalıştırıldığını, hangi GPU’ların tahsis edildiğini, hangi verilere erişilebileceğini ve kullanımın nasıl ölçüldüğünü belirleyebilecek altyapıya ihtiyaç duyar.
PaletteAI Inference Launchpad ve genişletilmiş AMD entegrasyonu hemen kullanıma sunuluyor. Uzun vadeli önemleri, yerel olarak yönetilen çıkarımın, dış model sağlayıcılarını kullanarak kaçınmaya çalıştıkları operasyonel karmaşıklığı yeniden yaratmadan tutarlı ekonomik faydalar sağlayıp sağlamayacağına bağlı olacaktır.












