Modely a platformy AI
Spectro Cloud Spouští PaletteAI Inference Launchpad, aby Pomohl Podnikům Řídit Náklady na AI Tokeny

Spectro Cloud spustil PaletteAI Inference Launchpad, platformu pro lokální inferenci, která je navržena tak, aby pomohla podnikům snížit jejich závislost na externích službách modelů a získat více kontroly nad rostoucími náklady na úlohy umělé inteligence.
Společnost uvádí, že organizace mohou snížit externí náklady na tokeny až o 70 %, v závislosti na jejich směsi úloh, infrastruktury a výběru modelů. Spectro Cloud také rozšířil podporu PaletteAI pro infrastrukturu založenou na AMD, což zákazníkům nabízí širší výběr jednotek grafického zpracování (GPU), runtime pro inferenci a technologií pro serving modelů.
Tyto oznámení odrážejí širší posun v podnikovém AI. Jak společnosti přecházejí od experimentování a nasazují umělou inteligenci napříč zákaznickou službou, vývojem softwaru, analýzami a interními operacemi, náklady na zpracování vstupů a výstupů modelů se stávají významnou infrastrukturní záležitostí.
Přibližování AI Inferenci k Podnikovým Datům
PaletteAI Inference Launchpad je postaven kolem lokálního přístupu k inferenci. Místo automatického odesílání každé žádosti na externě hostovaný frontier model mohou organizace spouštět vhodné úlohy na infrastruktuře umístěné ve svých vlastních datových centrech, privátních cloudech, suverénních prostředích nebo na okrajích.
Podniky si mohou stále zachovat přístup k externě hostovaným frontier modelům pro úkoly, které vyžadují jejich schopnosti. Platforma je určena k směrování žádostí mezi lokálními a externími modely na základě faktorů, jako jsou náklady, výkon, požadavky na správu a složitost úkolu.
Tento hybridní model může být stále důležitější, jak organizace přijímají menší a specializovanější modely. Žádost o podporu zákazníků, úloha klasifikace dokumentů nebo interní dotaz na znalosti nemusí vyžadovat stejnou kapacitu modelu jako pokročilé odůvodňování, komplexní kódování nebo multimodální analýza.
Udržení vhodných úloh lokálně může také snížit latenci tím, že inferenci přiblíží aplikacím, uživatelům a zdrojům dat. Pro organizace, které operují v regulovaných odvětvích, lokální zpracování může poskytnout větší kontrolu nad tím, kde se zpracovává citlivá informace.
Použití Tokenů se Stává Infrastrukturním Metrickem
Tokeny jsou jednotky, do kterých umělá inteligence dělí a zpracovává text, kód a další informace. Každá výzva a generovaná odpověď spotřebuje tokeny, a mnoho komerčních služeb modelů účtuje podle počtu zpracovaných tokenů.
To znamená, že náklady na AI mohou rychle růst, jak systémy přecházejí z řízených testů na aplikace, které slouží tisícům zaměstnanců nebo zákazníků. Problém se stává ještě složitějším s AI agenty, kteří mohou dělat opakované modelové volání, načítat informace, vyhodnocovat výsledky a používat externí nástroje, než dokončí jeden úkol.
Výzkum Goldman Sachs odhaduje, že měsíční spotřeba tokenů AI se zvýší 24krát mezi lety 2026 a 2030, dosáhne přibližně 120 kvadrilionů tokenů měsíčně. Tento předpokládaný růst je poháněn rostoucí podnikovou adopcí a vznikem více autonomních AI agentů.
Inference Launchpad řeší tuto otázku tím, že poskytuje infrastrukturním týmům nástroje pro měření spotřeby tokenů, stanovení kvót a aplikaci zásad použití. Tyto kontroly by mohly pomoci společnostem pochopit, které týmy, aplikace a modely jsou odpovědné za jejich výdaje na AI, místo aby se inferenci považovalo za nepředvídatelnou externí službu.
Snížení o 70 %, které uvádí Spectro Cloud, by mělo být považováno za potenciální výsledek, spíše než za garantované úspory. Skutečné ekonomické výsledky budou záviset na nákladech na pořízení nebo pronájem GPU, sazbách využití, spotřebě energie, efektivitě modelů, objemu požadavků a cenách externích poskytovatelů.
Místní Modely Bez Eliminace Frontier Modelů
Schopnosti modelového směrování platformy jsou navrženy tak, aby se vyhnuly nutnosti, aby se podniky rozhodly mezi kompletně lokálními nebo kompletně cloudovými modely.
Organizace mohou použít menší lokální modely pro předvídatelné nebo citlivé úkoly, zatímco více náročné požadavky mohou být směrovány na frontier modely. Zásady mohou také určit, které modely jsou povoleny pro konkrétní oddělení, jurisdikce nebo klasifikace dat.
To zavádí správu přímo do vrstvy inferenci. Například finanční instituce by mohla zabránit tomu, aby certain informace opustily kontrolované prostředí, zatímco by umožnila nesenzitivní požadavky používat externí model. Multinacionální společnost by mohla aplikovat různé směrovací pravidla na základě regionálních požadavků na data.
Spectro Cloud umístil výběr modelu a správu jako součást širší strategie infrastrukturní správy PaletteAI. Platforma podporuje sdílené prostředí GPU, role-based přístup, kvóty zdrojů a kontroly na úrovni tenantů, které jsou určeny k umožnění více týmům používat stejnou infrastrukturu bez neomezeného přístupu k základním systémům.
Rozšířená Podpora pro Infrastrukturu AMD AI
Spolu s Inference Launchpadem Spectro Cloud oznámil širší podporu pro prostředí AI založená na AMD.
Integrace pokrývá GPU AMD, AMD GPU Operator, softwareový stack ROCm a AMD Inference Microservices, běžně označované jako AIMs. Tyto komponenty řeší různé vrstvy infrastruktury požadované pro provoz AI modelů v produkci.
AMD GPU Operator zjednodušuje konfiguraci a správu urychlovačů AMD Instinct uvnitř clusterů Kubernetes. ROCm poskytuje základní otevřený softwareový stack, včetně ovladačů, knihoven, runtime a vývojových nástrojů, používaných pro spouštění úloh umělé inteligence a high-performance computing na hardwaru AMD.
AIMs poskytují standardizované inference mikroslužby pro serving modelů na GPU AMD Instinct. Jsou navrženy tak, aby balily optimalizované modely a podpůrný software do nasaditelných služeb, snižují tak část integrační práce, která je obvykle vyžadována k přesunu modelu do produkce.
Pro podnikové zákazníky by tato rozšířená podpora mohla usnadnit provoz smíšených prostředí GPU místo budování samostatných procesů správy pro infrastrukturu NVIDIA (NVDA ) a AMD.
Správa Zásobníku Od Hardwaru k Modelům
Spectro Cloud původně vyvinul Palette jako platformu pro správu Kubernetes pro nasazování a údržbu clusterů napříč veřejnými cloudy, privátními datovými centry, systémy bare-metal a okraji.
PaletteAI rozšiřuje tuto základnu do infrastruktury AI. Kombinuje správu životního cyklu Kubernetes s orchestrací GPU, službami modelů, bezpečnostními kontrolami, sítěmi a nástroji pro operace strojového učení. Spectro Cloud popisuje platformu jako způsob, jak spravovat infrastrukturu od fyzické vrstvy hardwaru až po modely a služby inferenci, které na ní běží.
Platforma také zahrnuje PaletteAI Studio, které poskytuje předem integrovanou infrastrukturu a zásobníky AI postavené z technologií, jako jsou Kubeflow, MLflow, ClearML, Run:ai a Hugging Face. Tyto konfigurace jsou určeny k poskytnutí týmům platformy opakovaně nasaditelné šablony, místo aby vyžadovaly manuální integraci každé komponenty.
Inference Launchpad přidává směrování tokenů, měření a lokálně spravované serving modelů do této širší infrastrukturní vrstvy.
Podpora Suverénních a Regulovaných Prostředí AI
Spectro Cloud se také zaměřuje na neocloudy, poskytovatele spravovaných služeb a suverénní cloudové operátory. Tyto poskytovatelé často potřebují nabízet sdílenou infrastrukturu GPU, zatímco zachovávají izolaci mezi zákazníky a vynucují kontrolu specifické pro jurisdikci.
Společnost spolupracuje s NexusIgnite, poskytovatelem infrastruktury, který operuje z Austinu a Dubaje, aby podpořil nasazení, která zahrnují rezidenci dat, dodržování předpisů a operativní suverenitu.
Rezidence dat se obecně týká toho, kde je informace uložena. Suverénní AI zavádí další otázky o tom, kdo provozuje infrastrukturu, které právní systémy se aplikují, kdo k ní může mít přístup a zda lze prostředí auditovat nebo odpojit od externích služeb.
Platforma Spectro Cloud podporuje samo-hostované a air-gapped nasazení, zatímco PaletteAI VerteX přidává bezpečnostní kontroly určené pro vládní a regulované prostředí.
Tyto schopnosti mohou být besonders relevantní pro vlády, zdravotnické organizace, finanční instituce a operátory kritické infrastruktury, kteří nemohou směrovat každou interakci AI přes sdílenou veřejnou službu.
Rostoucí Soutěž v Oblasti Podnikových Operací AI
Spuštění se koná krátce po tom, co Spectro Cloud oznámil kolo financování Series D ve výši 100 milionů dolarů vedené Growth Equity at Goldman Sachs Alternatives, se účastí AMD Ventures, Ericsson, LG Technology Ventures a Maximus.
Společnost uvedla, že financování bude podporovat její expanzi v oblasti infrastruktury pro produkční AI, suverénní cloudy, neocloudové služby a distribuovanou inferenci. Spectro Cloud nyní získal přibližně 260 milionů dolarů.
Jeho strategie odráží vznikající vrstvu trhu AI zaměřenou na provoz modelů, spíše než na vývoj základních modelů. Jak se možnosti modelů množí, podniky stále více potřebují infrastrukturu, která může určit, kde modely běží, jak jsou přidělovány GPU, které údaje mohou přístup a jak se měří využití.
PaletteAI Inference Launchpad a rozšířená integrace AMD jsou okamžitě k dispozici. Jejich dlouhodobý význam bude záviset na tom, zda lokálně spravovaná inferenci může poskytnout konzistentní ekonomické výhody bez opětovného vytváření operační složitosti, které podniky doufaly vyhnout se pomocí externích poskytovatelů modelů.












