Modele i platformy AI
Spectro Cloud uruchamia PaletteAI Inference Launchpad, aby pomóc przedsiębiorstwom kontrolować koszty tokenów AI

Spectro Cloud uruchomił PaletteAI Inference Launchpad, platformę zarządzaną lokalnie do inferencji, zaprojektowaną w celu pomocy przedsiębiorstwom w redukcji zależności od zewnętrznych usług modelowych i zwiększeniu kontroli nad rosnącymi kosztami obciążeń sztucznej inteligencji.
Firma twierdzi, że organizacje mogą zmniejszyć koszty zewnętrznych tokenów nawet o 70%, w zależności od ich mieszanki obciążeń, infrastruktury i wyboru modeli. Spectro Cloud rozszerzył również wsparcie dla infrastruktury AMD w ramach PaletteAI, dając klientom szerszy wybór jednostek przetwarzania grafiki (GPU), środowisk inferencji i technologii serwowania modeli.
Ogłoszenia te odzwierciedlają szerszy trend w przedsiębiorstwach AI. Podczas gdy firmy przechodzą od eksperymentów do wdrożenia sztucznej inteligencji w obszarach takich jak obsługa klienta, rozwój oprogramowania, analiza i operacje wewnętrzne, koszt przetwarzania wejść i wyjść modeli staje się znaczącym problemem infrastrukturalnym.
Przybliżanie inferencji AI do danych przedsiębiorstw
PaletteAI Inference Launchpad oparty jest na podejściu lokalnym do inferencji. Zamiast automatycznego wysyłania każdego żądania do zewnętrznie hostowanego modelu frontier, organizacje mogą uruchamiać odpowiednie obciążenia na infrastrukturze zlokalizowanej w ich własnych centrach danych, chmurach prywatnych, środowiskach suwerennych lub lokalizacjach brzegowych.
Przedsiębiorstwa mogą nadal zachować dostęp do zewnętrznie hostowanych modeli frontier dla zadań, które wymagają ich możliwości. Platforma jest przeznaczona do kierowania żądaniami między lokalnymi a zewnętrznymi modelami na podstawie czynników takich jak koszt, wydajność, wymagania dotyczące zarządzania i złożoność zadania.
Ten model hybrydowy może stać się coraz bardziej istotny, gdy organizacje przyjmują mniejsze i bardziej wyspecjalizowane modele. Żądanie wsparcia klienta, zadanie klasyfikacji dokumentów lub wewnętrzne zapytanie wiedzy może nie wymagać takiej samej pojemności modelu, jak zaawansowane rozumowanie, złożone kodowanie lub analiza multimodalna.
Trzymanie odpowiednich obciążeń lokalnie może również zmniejszyć opóźnienia, przenosząc inferencję bliżej aplikacji, użytkowników i źródeł danych. Dla organizacji działających w regulowanych branżach, przetwarzanie lokalne może zapewnić większą kontrolę nad tym, gdzie są obsługiwane informacje wrażliwe.
Użycie tokenów staje się metryką infrastruktury
Tokeny to jednostki, w które modele sztucznej inteligencji dzielą i przetwarzają tekst, kod i inne informacje. Każde żądanie i wygenerowana odpowiedź zużywają tokeny, a wiele komercyjnych usług modelowych pobiera opłaty zgodnie z liczbą przetworzonych tokenów.
Oznacza to, że koszty AI mogą szybko rosnąć, gdy systemy przechodzą od kontrolowanych testów do aplikacji obsługujących tysiące pracowników lub klientów. Problem staje się jeszcze bardziej skomplikowany z agentami AI, które mogą wykonywać wielokrotne wywołania modeli, pobierać informacje, oceniać wyniki i używać zewnętrznych narzędzi przed ukończeniem jednego zadania.
Badania Goldman Sachs prognozują, że miesięczne zużycie tokenów AI wzrośnie 24-krotnie między 2026 a 2030 rokiem, osiągając około 120 tryliardów tokenów miesięcznie. Ten przewidywany wzrost jest napędzany przez rosnące wdrożenie przedsiębiorstw i pojawienie się bardziej autonomicznych agentów AI.
Inference Launchpad rozwiązuje ten problem, dostarczając zespołom infrastruktury narzędzia do pomiaru zużycia tokenów, ustanawiania limitów i stosowania zasad użytkowania. Kontrole te mogą pomóc firmom zrozumieć, które zespoły, aplikacje i modele są odpowiedzialne za ich wydatki na AI, zamiast traktować inferencję jako nieprzewidywalną opłatę za usługę zewnętrzną.
Zmniejszenie o 70% wymienione przez Spectro Cloud powinno być traktowane jako potencjalny wynik, a nie gwarantowane oszczędności. Rzeczywiste ekonomiczne efekty będą zależały od kosztów nabycia lub wynajmu GPU, wskaźników wykorzystania, zużycia energii, wydajności modelu, objętości żądań i cen dostawców zewnętrznych.
Modele lokalne bez eliminowania modeli frontier
Możliwości routingu modeli platformy są zaprojektowane w celu uniknięcia zmuszania przedsiębiorstw do podejmowania decyzji o wyborze wszystkich lokalnych lub wszystkich chmurowych modeli.
Organizacje mogą używać mniejszych modeli lokalnych dla przewidywalnych lub wrażliwych zadań, podczas gdy bardziej wymagające żądania są kierowane do modeli frontier. Polityki mogą również określać, które modele są dozwolone dla poszczególnych departamentów, jurysdykcji lub klasyfikacji danych.
Wprowadza to bezpośrednio zarządzanie w warstwie inferencji. Na przykład instytucja finansowa mogłaby uniemożliwić opuszczanie pewnych informacji z kontrolowanego środowiska, jednocześnie pozwalając na używanie zewnętrznego modelu dla mniej wrażliwych żądań. Międzynarodowa firma mogłaby stosować różne reguły routingu w zależności od wymagań dotyczących danych w poszczególnych regionach.
Spectro Cloud umieścił wybór modelu i zarządzanie jako część szerszej strategii zarządzania infrastrukturą PaletteAI. Platforma obsługuje środowiska GPU udostępnione, dostęp oparty na rolach, limity zasobów i kontrolę na poziomie najemcy, mające na celu umożliwienie wielu zespołom korzystanie z tej samej infrastruktury bez otrzymywania nieograniczonego dostępu do podstawowych systemów.
Rozszerzone wsparcie dla infrastruktury AI AMD
Wraz z Inference Launchpad, Spectro Cloud ogłosił szersze wsparcie dla środowisk AI opartych na AMD.
Integracja obejmuje procesory graficzne AMD, operator GPU AMD, oprogramowanie ROCm i usługi inferencji AMD, powszechnie znane jako AIM. Te składniki dotyczą różnych warstw infrastruktury niezbędnej do działania modeli AI w produkcji.
Operator GPU AMD ułatwia konfigurację i zarządzanie przyspieszaczami AMD Instinct w klastrach Kubernetes. Oprogramowanie ROCm zapewnia podstawową otwartą warstwę oprogramowania, w tym sterowniki, biblioteki, środowiska uruchomieniowe i narzędzia programistyczne używane do uruchamiania obciążeń sztucznej inteligencji i obliczeń wysokowydajnych na sprzęcie AMD.
Usługi AIM zapewniają standardowe usługi inferencji dla serwowania modeli na przyspieszaczach GPU AMD Instinct. Są one zaprojektowane w celu zapakowania zoptymalizowanych modeli i oprogramowania wspierającego w wdrożone usługi, redukując część pracy integracyjnej zwykle wymaganej do przeniesienia modelu do produkcji.
Dla klientów przedsiębiorstw to rozszerzone wsparcie może ułatwić działanie środowisk GPU mieszanego typu zamiast budowania oddzielnych procesów zarządzania dla infrastruktury NVIDIA (NVDA ) i AMD.
Zarządzanie stosem od sprzętu do modeli
Spectro Cloud pierwotnie opracował Palette jako platformę zarządzania Kubernetes do wdrażania i utrzymywania klastrów w chmurach publicznych, prywatnych centrach danych, systemach bear-metal i lokalizacjach brzegowych.
PaletteAI rozszerza tę bazę do infrastruktury AI. Łączy zarządzanie cyklem życia Kubernetes z orchestracją GPU, usługami modelowymi, kontrolami bezpieczeństwa, sieciami i narzędziami operacji maszynowych. Spectro Cloud opisuje platformę jako sposób zarządzania infrastrukturą od warstwy fizycznej do modeli i usług inferencji działających na jej górze.
Platforma obejmuje również PaletteAI Studio, które zapewnia preintegrowaną infrastrukturę i stosy AI zbudowane z technologii takich jak Kubeflow, MLflow, ClearML, Run:ai i Hugging Face. Te konfiguracje są przeznaczone do zapewnienia zespołom platformowych szablonów wdrożeniowych zamiast wymagania ręcznej integracji każdego składnika.
Inference Launchpad dodaje routing tokenów, pomiar i lokalne serwowanie modeli do tej szerszej warstwy infrastruktury.
Wspieranie środowisk suwerennych i regulowanych AI
Spectro Cloud koncentruje się również na neochmurach, dostawcach usług zarządzanych i operatorach chmury suwerennej. Ci dostawcy często muszą oferować infrastrukturę GPU udostępnioną, utrzymując izolację między klientami i egzekwując kontrolę na poziomie jurysdykcji.
Firma współpracuje z NexusIgnite, dostawcą infrastruktury działającym z Austin i Dubaju, w celu wspierania wdrożeń dotyczących rezydencji danych, zgodności i operacyjnej suwerenności.
Rezydencja danych dotyczy zwykle miejsca, w którym przechowywane są informacje. Suwerenny AI wprowadza dodatkowe pytania dotyczące tego, kto obsługuje infrastrukturę, jakie systemy prawne mają zastosowanie, kto może do niej uzyskać dostęp i czy środowisko może być audytowane lub odłączone od usług zewnętrznych.
Platforma Spectro Cloud obsługuje wdrożenia samodzielne i odizolowane, podczas gdy PaletteAI VerteX dodaje kontrolę bezpieczeństwa przeznaczoną dla środowisk rządowych i regulowanych.
Te możliwości mogą być szczególnie istotne dla rządów, organizacji opieki zdrowotnej, instytucji finansowych i operatorów infrastruktury krytycznej, które nie mogą kierować każdej interakcji AI przez współdzieloną usługę publiczną.
Rosnąca konkurencja wokół operacji AI przedsiębiorstw
Uruchomienie następuje krótko po tym, jak Spectro Cloud ogłosił rundę finansowania serii D w wysokości 100 milionów dolarów, prowadzoną przez Growth Equity w Goldman Sachs Alternatives, z udziałem AMD Ventures, Ericsson, LG Technology Ventures i Maximus.
Firma stwierdziła, że finansowanie wesprze rozwój infrastruktury AI w produkcji, chmur suwerennych, usług neocloud i rozproszonej inferencji. Spectro Cloud zebrał do tej pory około 260 milionów dolarów.
Jej strategia odzwierciedla pojawiającą się warstwę rynku AI, skupioną na operacjach modeli, a nie na tworzeniu modeli podstawowych. Wraz ze zwiększaniem się liczby opcji modeli, przedsiębiorstwa coraz bardziej potrzebują infrastruktury, która może określać, gdzie modele są uruchamiane, jak są przydzielane GPU, jakie dane mogą uzyskać dostęp i jak jest mierzone ich użycie.
PaletteAI Inference Launchpad i rozszerzone wsparcie AMD są dostępne natychmiast. Ich długoterminowe znaczenie będzie zależało od tego, czy inferencja zarządzana lokalnie może dostarczyć spójne korzyści ekonomiczne bez odtwarzania złożoności operacyjnej, której przedsiębiorstwa liczyły na uniknięcie, korzystając z zewnętrznych dostawców modeli.












