AI-modeller og plattformer

Spectro Cloud lanserer PaletteAI Inference Launchpad for å hjelpe bedrifter med å kontrollere AI-utgiftene

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Spectro Cloud har lansert PaletteAI Inference Launchpad, en lokal administrert inferensplattform designet for å hjelpe bedrifter med å redusere avhengigheten av eksterne modelltjenester og få mer kontroll over de voksende kostnadene forbundet med kunstig intelligens-arbeidsbelastninger.

Selskapet sier at organisasjoner kan redusere eksterne token-kostnader med opptil 70 %, avhengig av arbeidsbelastningsblandingen, infrastrukturen og valg av modeller. Spectro Cloud har også utvidet PaletteAI-støtten for AMD-basert infrastruktur, noe som gir kundene et bredere valg av grafikkprosessorer (GPU-er), inferenskjøringer og modell-tjenester.

Annonsene reflekterer en større endring i bedriftens AI. Mens bedrifter går beyond eksperimentering og distribuerer kunstig intelligens over kundeservice, programvareutvikling, analyse og interne operasjoner, blir kostnaden av å prosessere modellinndata og -utdata et betydelig infrastrukturproblem.

Bringing AI Inference Closer to Enterprise Data

PaletteAI Inference Launchpad er bygget rundt en lokal-first-tilnærming til inferens. I stedet for å sende hver forespørsel automatisk til en eksternt vertsfremmodell, kan organisasjoner kjøre egnet arbeidsbelastning på infrastruktur plassert i deres egne datasentre, private skytjenester, suverene miljøer eller kantlokasjoner.

Bedrifter kan fortsatt beholde tilgang til eksternt vertsfremmodeller for oppgaver som krever deres evner. Plattformen er ment å dirigere forespørsler mellom lokale og eksterne modeller basert på faktorer som kostnad, ytelse, styringskrav og kompleksiteten av oppgaven.

Dette hybridmodellen kan bli stadig viktigere mens organisasjoner adopterer mindre og mer spesialiserte modeller. En kundesupportforespørsel, dokumentklassifiseringsoppgave eller intern kunnskapsforespørsel kan ikke kreve samme modellkapasitet som avansert resonnering, kompleks kodning eller multimodal analyse.

Å holde egnet arbeidsbelastning lokalt kan også redusere latency ved å flytte inferens nærmere applikasjoner, brukere og datakilder. For organisasjoner som opererer i regulerte industrier, kan lokal prosessering gi større kontroll over hvor sensitiv informasjon håndteres.

Token Usage Becomes an Infrastructure Metric

Token er enhetene kunstig intelligens-modeller deler og prosesserer tekst, kode og annen informasjon. Hver forespørsel og generert svar forbruker token, og mange kommersielle modelltjenester beregner etter antall prosesserte token.

Dette betyr at AI-kostnader kan øke raskt mens systemer går fra kontrollerte forsøk til applikasjoner som betjener tusenvis av ansatte eller kunder. Problemet blir enda mer komplisert med AI-agenter, som kan gjøre gjentatte modellforespørsler, hente informasjon, evaluere resultater og bruke eksterne verktøy før de fullfører en enkelt oppgave.

Goldman Sachs Research forventer at månedlig AI-token-forbruk vil øke 24 ganger mellom 2026 og 2030, og nå omtrent 120 kvadrillioner token per måned. Den projekterte veksten drives av økende bedriftsadoptsjon og fremveksten av mer autonome AI-agenter.

Inference Launchpad løser dette problemet ved å gi infrastrukturteamene verktøy for å måle token-forbruk, etablere kvoter og anvende brukspolitikk. Disse kontrollene kan hjelpe selskaper med å forstå hvilke team, applikasjoner og modeller som er ansvarlige for deres AI-utgifter, i stedet for å behandle inferens som en uforutsigbar ekstern tjenestekostnad.

Den 70 % reduksjonen som Spectro Cloud nevner, bør sees på som en potensiell utfall i stedet for en garantert besparelse. Den faktiske økonomien vil avhenge av GPU-erhvervings- eller leiekostnader, utnyttelsesrater, energiforbruk, modell-effektivitet, forespørselsvolum og prisingen av eksterne tjenesteleverandører.

Local Models Without Eliminating Frontier Models

Plattformens modell-routingsfunksjoner er designet for å unngå å tvinge bedrifter til å velge mellom en fullstendig lokal eller fullstendig sky-basert løsning.

Organisasjoner kan bruke mindre lokale modeller for forutsigbare eller personvernssensitive oppgaver, mens de sender mer krævende forespørsler til fremmodeller. Politikk kan også bestemme hvilke modeller som er tillatt for bestemte avdelinger, jurisdiksjoner eller dataklassifiseringer.

Dette introduserer styring direkte i inferenslaget. En finansinstitusjon, for eksempel, kunne forhindre bestemt informasjon fra å forlate en kontrollert miljø, mens de tillater ikke-sensitive forespørsler å bruke en ekstern modell. En multinasjonal bedrift kunne anvende ulike routingsregler basert på regionale datakrav.

Spectro Cloud har posisjonert modellvalg og styring som en del av PaletteAI sin bredere infrastrukturhåndteringsstrategi. Plattformen støtter delt GPU-miljø, rollebasert tilgang, ressurskvoter og leiebasert kontroll som er ment å la flere team bruke samme infrastruktur uten å motta ubegrensede tilgang til underliggende systemer.

Expanded Support for AMD AI Infrastructure

I tillegg til Inference Launchpad, har Spectro Cloud annonsert utvidet støtte for AMD-drevne AI-miljøer.

Integrasjonen dekker AMD-GPU-er, AMD-GPU-operatoren, ROCm-programvarestakken og AMD-Inference Microservices, vanligvis kjent som AIMs. Disse komponentene addresserer ulike lag av infrastrukturen som kreves for å operere AI-modeller i produksjon.

AMD-GPU-operatoren forenkler konfigurasjonen og håndteringen av AMD-Instinct-akseleratorer i Kubernetes-kluster. ROCm gir den underliggende åpne programvarestakken, inkludert drivere, biblioteker, kjøringer og utviklingsverktøy som brukes til å kjøre kunstig intelligens- og høy-ytelsesarbeidsbelastninger på AMD-hardware.

AIMs gir standardiserte inferens-mikrotjenester for å betjene modeller på AMD-Instinct-GPU-er. De er designet for å pakke optimerte modeller og støttende programvare inn i installerbare tjenester, og redusere en del av integreringsarbeidet som vanligvis kreves for å flytte en modell inn i produksjon.

For bedriftskunder kan denne utvidede støtten gjøre det enklere å operere blandede GPU-miljøer i stedet for å bygge separate håndteringsprosesser for NVIDIA (NVDA ) og AMD-infrastruktur.

Managing the Stack From Hardware to Models

Spectro Cloud utviklet opprinnelig Palette som en Kubernetes-håndteringsplattform for å deployere og vedlikeholde kluster over offentlige skytjenester, private datasentre, bare-metal-systemer og kantlokasjoner.

PaletteAI utvider denne grunnlaget inn i AI-infrastruktur. Den kombinerer Kubernetes-livssyklushåndtering med GPU-orkesering, modelltjenester, sikkerhetskontroller, nettverk og maskinlæringsoperasjoner-verktøy. Spectro Cloud beskriver plattformen som en måte å håndtere infrastruktur fra det fysiske hardwarlaget til modellene og inferenstjenestene som kjører på toppen av det.

Plattformen inkluderer også PaletteAI Studio, som gir forhåndsintegret infrastruktur og AI-stakker bygget fra teknologier som Kubeflow, MLflow, ClearML, Run:ai og Hugging Face. Disse konfigurasjonene er ment å gi plattformteamene gjentakende deploy-templatene i stedet for å kreve at de integrerer hver komponent manuelt.

Inference Launchpad legger til token-routings-, målings- og lokalt håndtert modell-betjening til det bredere infrastruktur-laget.

Supporting Sovereign and Regulated AI Environments

Spectro Cloud tar også mål på neoclouds, managed service-providers og suverene sky-operatører. Disse leverandørene må ofte tilby delt GPU-infrastruktur mens de opprettholder isolasjon mellom kunder og håndhever jurisdiksjonsspesifikke kontroller.

Selskapet samarbeider med NexusIgnite, en infrastruktur-leverandør som opererer fra Austin og Dubai, for å støtte deployeringer som involverer data-residens, kompatibilitet og operasjonell suverenitet.

Data-residens omhandler vanligvis hvor informasjonen lagres. Suveren AI introduserer ytterligere spørsmål om hvem som opererer infrastrukturen, hvilke rettssystemer som gjelder, hvem som kan få tilgang til den og om miljøet kan auditeres eller frakobles fra eksterne tjenester.

Spectro Clouds plattform støtter selv-vertede og luftgap-deployeringer, mens PaletteAI VerteX legger til sikkerhetskontroller som er ment for regulerings- og regjeringsmiljøer.

Disse egenskapene kan være spesielt relevante for regjeringer, helseorganisasjoner, finansinstitusjoner og kritisk infrastruktur-operatører som ikke kan rute hver AI-interaksjon gjennom en delt offentlig tjeneste.

Growing Competition Around Enterprise AI Operations

Lanseringen kommer kort tid etter at Spectro Cloud annonserte en $100 millioner Series D-finansieringsrunde ledet av Growth Equity at Goldman Sachs Alternatives, med deltakelse fra AMD Ventures, Ericsson, LG Technology Ventures og Maximus.

Selskapet sa at finansieringen ville støtte utvidelsen av produksjons-AI-infrastruktur, suverene skytjenester og distribuert inferens. Spectro Cloud har nå samlet inn omtrent $260 millioner.

Deres strategi reflekterer et nytt lag av AI-markedet som fokuserer på å operere modeller i stedet for å utvikle grunnmodeller. Mens modell-alternativene multipliseres, trenger bedrifter stadig mer infrastruktur som kan bestemme hvor modellene kjører, hvordan GPU-er allokeres, hvilke data de kan få tilgang til og hvordan bruken måles.

PaletteAI Inference Launchpad og den utvidede AMD-integrasjonen er tilgjengelige med en gang. Deres langsiktige betydning vil avhenge av om lokalt håndtert inferens kan levere konsistente økonomiske fordeler uten å gjenopprette den operative kompleksiteten bedrifter håpet å unngå ved å bruke eksterne modell-leverandører fra første sted.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.