AI-modeller och plattformar

Spectro Cloud lanserar PaletteAI Inference Launchpad för att hjälpa företag kontrollera AI-tokenkostnader

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Spectro Cloud har lanserat PaletteAI Inference Launchpad, en lokalt hanterad inferensplattform som är utformad för att hjälpa företag minska sin beroende av externa modelltjänster och få mer kontroll över de växande kostnaderna för artificiell intelligensarbetsbelastningar.

Företaget säger att organisationer kan minska externa tokenkostnader med så mycket som 70%, beroende på deras arbetsbelastningsblandning, infrastruktur och val av modeller. Spectro Cloud har också utökat PaletteAI:s stöd för AMD-baserad infrastruktur, vilket ger kunderna ett bredare urval av grafikprocessorer (GPU), inferenskörningar och modellserveringstekniker.

De här tillkännagivandena speglar en bredare förändring inom företagsartificiell intelligens. När företag går bortom experiment och distribuerar artificiell intelligens över kundtjänst, programvaruutveckling, analyser och interna operationer blir kostnaden för att bearbeta modellinmatningar och utmatningar en betydande infrastrukturfråga.

Att bringa AI-inferens närmare företagsdata

PaletteAI Inference Launchpad är byggd kring en lokalt först-approach till inferens. Istället för att automatiskt skicka varje begäran till en externt värd frontier-modell kan organisationer köra lämpliga arbetsbelastningar på infrastruktur som finns i deras egna datacenter, privata moln, suveräna miljöer eller edge-platser.

Företag kan fortfarande behålla åtkomst till externt värdade frontier-modeller för uppgifter som kräver deras funktioner. Plattformen är avsedd att dirigera begäranden mellan lokala och externa modeller baserat på faktorer som kostnad, prestanda, styrningskrav och uppgiftens komplexitet.

Denna hybridmodell kan bli allt viktigare när organisationer antar mindre och mer specialiserade modeller. En kundsupportbegäran, en dokumentklassificeringsuppgift eller en intern kunskapsfråga kan inte kräva samma modellkapacitet som avancerad resonemang, komplex kodning eller multimodal analys.

Att hålla lämpliga arbetsbelastningar lokalt kan också minska latensen genom att bringa inferens närmare applikationer, användare och datakällor. För organisationer som verkar i reglerade branscher kan lokal bearbetning ge större kontroll över var känslig information hanteras.

Tokenanvändning blir en infrastrukturmetric

Token är de enheter som artificiell intelligensmodeller delar in och bearbetar text, kod och annan information. Varje prompt och genererad svar förbrukar token, och många kommersiella modelltjänster tar betalt enligt antalet token som bearbetas.

Detta innebär att AI-kostnader kan öka snabbt när systemen går från kontrollerade tester till applikationer som servar tusentals anställda eller kunder. Problemet blir ännu mer komplicerat med AI-agenter, som kan göra upprepade modellanrop, hämta information, utvärdera resultat och använda externa verktyg innan de slutför en enda uppgift.

Goldman Sachs Research förväntar sig att den månatliga AI-tokenkonsumtionen kommer att öka 24-faldigt mellan 2026 och 2030, och nå cirka 120 kvadriljoner token per månad. Den projicerade tillväxten drivs av den växande företagsadoptionen och framväxten av mer autonoma AI-agenter.

Inference Launchpad hanterar detta problem genom att ge infrastrukturlag verktyg för att mäta tokenkonsumtion, etablera kvoter och tillämpa användningsprinciper. Dessa kontroller kan hjälpa företag att förstå vilka team, applikationer och modeller som är ansvariga för deras AI-utgifter, snarare än att behandla inferens som en oförutsägbar extern serviceavgift.

Den 70-procentiga minskningen som Spectro Cloud nämner bör ses som en potentiell utgång snarare än en garanterad besparing. De faktiska ekonomiska resultaten kommer att bero på GPU-anskaffnings- eller hyrkostnader, utnyttjandegrad, energiförbrukning, modellverkningsgrad, begärandevolym och prissättning av externa leverantörer.

Lokala modeller utan att eliminera frontier-modeller

Plattformens modellroutningsfunktioner är utformade för att undvika att tvinga företag till ett allt-lokalt eller allt-molnbaserat beslut.

Organisationer kan använda mindre lokala modeller för förutsägbara eller känsliga uppgifter medan de skickar mer krävande begäranden till frontier-modeller. Principer kan också bestämma vilka modeller som är tillåtna för särskilda avdelningar, jurisdiktioner eller dataklassificeringar.

Detta introducerar styrning direkt i inferenslagret. Ett finansinstitut, till exempel, kunde förhindra att viss information lämnar en kontrollerad miljö, medan de tillåter icke-känsliga begäranden att använda en extern modell. Ett multinationellt företag kunde tillämpa olika routningsregler baserat på regionala datakrav.

Spectro Cloud har positionerat modellvalet och styrningen som en del av PaletteAI:s bredare infrastrukturhanteringsstrategi. Plattformen stöder delade GPU-miljöer, rollbaserad åtkomst, resurskvoter och hygnsnivåkontroller som är avsedda att låta flera team använda samma infrastruktur utan att få obegränsad åtkomst till de underliggande systemen.

Utökat stöd för AMD AI-infrastruktur

I samband med Inference Launchpad meddelade Spectro Cloud ett bredare stöd för AMD-baserade AI-miljöer.

Integreringen omfattar AMD GPU, AMD GPU-operatör, ROCm-programvarustack och AMD Inference Microservices, som vanligtvis kallas AIMs. Dessa komponenter hanterar olika lager av den infrastruktur som krävs för att köra AI-modeller i produktion.

AMD GPU-operatören förenklar konfigurationen och hanteringen av AMD Instinct-acceleratorer inom Kubernetes-kluster. ROCm tillhandahåller den underliggande öppna programvarustacken, inklusive drivrutiner, bibliotek, körningar och utvecklingsverktyg som används för att köra artificiell intelligens och högpresterande beräkningsarbetsbelastningar på AMD-hårdvara.

AIMs tillhandahåller standardiserade inferensmikrotjänster för att serva modeller på AMD Instinct GPU. De är utformade för att paketera optimerade modeller och stödprogramvara i distribuerbara tjänster, vilket minskar en del av integreringsarbetet som normalt krävs för att flytta en modell till produktion.

För företagskunder kan detta utökade stöd göra det enklare att köra blandade GPU-miljöer istället för att bygga separata hanteringsprocesser för NVIDIA (NVDA ) och AMD-infrastruktur.

Att hantera stacken från hårdvara till modeller

Spectro Cloud utvecklade ursprungligen Palette som en Kubernetes-hanteringsplattform för att distribuera och underhålla kluster över offentliga moln, privata datacenter, bar-metal-system och edge-platser.

PaletteAI utökar den här grunden till AI-infrastruktur. Den kombinerar Kubernetes-livscykelhantering med GPU-orchestrering, modelltjänster, säkerhetskontroller, nätverk och maskinlärningsverktyg. Spectro Cloud beskriver plattformen som ett sätt att hantera infrastruktur från den fysiska hårdvarulagret till modellerna och inferenstjänsterna som körs ovanpå den.

Plattformen innehåller också PaletteAI Studio, som tillhandahåller förintegrerad infrastruktur och AI-stackar byggda från tekniker som Kubeflow, MLflow, ClearML, Run:ai och Hugging Face. Dessa konfigurationer är avsedda att ge plattformsteam återanvändbara distributionsmallar istället för att kräva att de integrerar varje komponent manuellt.

Inference Launchpad lägger till tokenroutning, mätning och lokalt hanterad modellservering till den bredare infrastrukturlagret.

Stöd för suveräna och reglerade AI-miljöer

Spectro Cloud riktar sig också mot neomoln, hanterade tjänsteleverantörer och suveräna molnoperatörer. Dessa leverantörer behöver ofta erbjuda delad GPU-infrastruktur medan de upprätthåller isolering mellan kunder och tillämpar jurisdiktionspecifika kontroller.

Företaget samarbetar med NexusIgnite, en infrastrukturleverantör som opererar från Austin och Dubai, för att stödja distributioner som involverar dataresidens, regelefterlevnad och operativ suveränitet.

Dataresidens handlar vanligtvis om var informationen lagras. Suverän AI introducerar ytterligare frågor om vem som opererar infrastrukturen, vilka rättssystem som gäller, vem som kan komma åt den och om miljön kan granskas eller kopplas bort från externa tjänster.

Spectro Clouds plattform stöder självvärdade och luftgapade distributioner, medan PaletteAI VerteX lägger till säkerhetskontroller som är avsedda för reglerade miljöer.

Dessa funktioner kan vara särskilt relevanta för regeringar, hälsoorganisationer, finansiella institutioner och kritiska infrastrukturoperatörer som inte kan dirigera varje AI-interaktion via en delad offentlig tjänst.

Ökande konkurrens kring företags AI-operationer

Lanseringen sker strax efter att Spectro Cloud meddelade en serie D-finansieringsrunda på 100 miljoner dollar som leds av Growth Equity at Goldman Sachs Alternatives, med deltagande från AMD Ventures, Ericsson, LG Technology Ventures och Maximus.

Företaget sa att finansieringen skulle stödja deras expansion i produktion AI-infrastruktur, suveräna moln, neomolntjänster och distribuerad inferens. Spectro Cloud har nu samlat in cirka 260 miljoner dollar.

Deras strategi speglar ett framväxande lager av AI-marknaden som fokuserar på att köra modeller snarare än att utveckla grundmodeller. När modellalternativen ökar behöver företag alltmer infrastruktur som kan bestämma var modellerna körs, hur GPU:er allokeras, vilken data de kan komma åt och hur användningen mäts.

PaletteAI Inference Launchpad och det utökade AMD-stödet är tillgängliga omedelbart. Deras långsiktiga betydelse kommer att bero på om lokalt hanterad inferens kan leverera konsekventa ekonomiska fördelar utan att återskapa den operativa komplexitet som företag hoppades undvika genom att använda externa modellleverantörer från första början.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.