AI-modellen en platforms

Spectro Cloud lanceert PaletteAI Inference Launchpad om bedrijven te helpen bij het controleren van AI-tokenkosten

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Spectro Cloud heeft PaletteAI Inference Launchpad gelanceerd, een lokaal beheerd inferentieplatform dat bedrijven moet helpen om hun afhankelijkheid van externe modellen te verminderen en meer controle te krijgen over de groeiende kosten van kunstmatige intelligentie-workloads.

Volgens het bedrijf kunnen organisaties hun externe tokenkosten met maximaal 70% verminderen, afhankelijk van hun workloadmix, infrastructuur en keuze van modellen. Spectro Cloud heeft ook de ondersteuning van PaletteAI voor AMD-gebaseerde infrastructuur uitgebreid, waardoor klanten een bredere keuze hebben aan graphics processing units (GPUs), inferentie-runtimes en model-servingtechnologieën.

De aankondigingen weerspiegelen een bredere verschuiving in enterprise AI. Terwijl bedrijven verder gaan dan experimenten en kunstmatige intelligentie implementeren in klantenservice, softwareontwikkeling, analytics en interne operaties, worden de kosten van het verwerken van modelinputs en -outputs een belangrijke infrastructuurzorg.

AI-inferentie dichter bij bedrijfsgegevens brengen

PaletteAI Inference Launchpad is gebouwd rond een lokale benadering van inferentie. In plaats van elke aanvraag automatisch te verzenden naar een extern gehoste frontier-model, kunnen organisaties geschikte workloads uitvoeren op infrastructuur die zich in hun eigen datacenters, private clouds, soevereine omgevingen of edge-locaties bevindt.

Bedrijven kunnen nog steeds toegang houden tot extern gehoste frontier-modellen voor taken die hun capaciteiten vereisen. Het platform is bedoeld om aanvragen tussen lokale en externe modellen te routeren op basis van factoren zoals kosten, prestaties, governance-eisen en de complexiteit van de taak.

Dit hybride model kan steeds belangrijker worden naarmate organisaties kleinere en meer gespecialiseerde modellen adopteren. Een klantenservicerequest, documentclassificatietaken of interne kennisvraag kan niet dezelfde modelcapaciteit vereisen als geavanceerde redenering, complexe codering of multimodale analyse.

Het houden van geschikte workloads lokaal kan ook latency verminderen door inferentie dichter bij applicaties, gebruikers en gegevensbronnen te brengen. Voor organisaties die opereren in gereguleerde industrieën, kan lokale verwerking meer controle bieden over waar gevoelige informatie wordt verwerkt.

Tokengebruik wordt een infrastructuurmeting

Tokens zijn de eenheden waarin kunstmatige intelligentiemodellen tekst, code en andere informatie verdelen en verwerken. Elke prompt en gegenereerde reactie verbruikt tokens, en veel commerciële modellen diensten berekenen kosten op basis van het aantal verwerkte tokens.

Dit betekent dat AI-kosten snel kunnen stijgen als systemen van gecontroleerde proeven naar toepassingen gaan die duizenden medewerkers of klanten bedienen. Het probleem wordt nog complexer met AI-agents, die meerdere modelaanroepen kunnen doen, informatie opvragen, resultaten evalueren en externe tools gebruiken voordat ze een enkele taak voltooien.

Goldman Sachs Research verwacht dat de maandelijkse AI-tokenconsumptie 24-voudig zal toenemen tussen 2026 en 2030, tot ongeveer 120 quadriljoen tokens per maand. Deze verwachte groei wordt gedreven door de toenemende adoptie van enterprise en de opkomst van meer autonome AI-agents.

Inference Launchpad lost dit probleem op door infrastructuurteams tools te geven om tokenconsumptie te meten, quota’s in te stellen en gebruiksbeleid toe te passen. Deze controles kunnen bedrijven helpen om te begrijpen welke teams, applicaties en modellen verantwoordelijk zijn voor hun AI-uitgaven, in plaats van inferentie te behandelen als een onvoorspelbare externe servicekosten.

De 70% reductie die door Spectro Cloud wordt genoemd, moet worden beschouwd als een potentieel resultaat in plaats van een gegarandeerde besparing. De werkelijke economie zal afhankelijk zijn van GPU-aanschaffings- of huurkosten, utilisatiegraden, energieverbruik, model-efficiëntie, aanvraagvolume en de prijzen van externe aanbieders.

Lokale modellen zonder frontier-modellen te elimineren

De modelrouteringsmogelijkheden van het platform zijn ontworpen om bedrijven niet te dwingen tot een alles-lokaal of alles-wolk beslissing.

Organisaties kunnen kleinere lokale modellen gebruiken voor voorspelbare of gevoelige taken, terwijl ze meer veeleisende aanvragen naar frontier-modellen sturen. Beleid kan ook bepalen welke modellen zijn toegestaan voor specifieke afdelingen, rechtsgebieden of gegevensclassificaties.

Dit introduceert governance rechtstreeks in de inferentie-laag. Een financiële instelling, bijvoorbeeld, kan voorkomen dat bepaalde informatie een gecontroleerde omgeving verlaat, terwijl het niet-gevoelige aanvragen toestaat om een extern model te gebruiken. Een multinationaal bedrijf kan verschillende routeringsregels toepassen op basis van regionale gegevensvereisten.

Spectro Cloud heeft modelkeuze en governance gepositioneerd als onderdeel van de bredere infrastructuurbeheerstrategie van PaletteAI. Het platform ondersteunt gedeelde GPU-omgevingen, rolgebaseerde toegang, resourcequota’s en tenantniveaucontroles die zijn bedoeld om meerdere teams in staat te stellen hetzelfde infrastructuur te gebruiken zonder onbeperkte toegang tot de onderliggende systemen te krijgen.

Uitgebreide ondersteuning voor AMD AI-infrastructuur

Naast Inference Launchpad heeft Spectro Cloud een bredere ondersteuning voor AMD-gebaseerde AI-omgevingen aangekondigd.

De integratie omvat AMD-GPU’s, de AMD GPU Operator, de ROCm-softwarestack en AMD Inference Microservices, algemeen bekend als AIMs. Deze componenten richten zich op verschillende lagen van de infrastructuur die nodig zijn om AI-modellen in productie te gebruiken.

De AMD GPU Operator vereenvoudigt de configuratie en het beheer van AMD Instinct-accelerators in Kubernetes-clusters. ROCm biedt de onderliggende open softwarestack, inclusief stuurprogramma’s, bibliotheken, runtimes en ontwikkelingsgereedschappen die worden gebruikt om kunstmatige intelligentie- en high-performance computing-workloads uit te voeren op AMD-hardware.

AIMs bieden gestandaardiseerde inferentie-microservices voor het serveren van modellen op AMD Instinct GPU’s. Ze zijn ontworpen om geoptimaliseerde modellen en ondersteunende software te verpakken in implementeerbare services, waardoor sommige van de integratiewerkzaamheden die normaal gesproken nodig zijn om een model in productie te brengen, worden verminderd.

Voor enterprise-klanten kan deze uitgebreide ondersteuning het makkelijker maken om gemengde GPU-omgevingen te exploiteren in plaats van afzonderlijke beheersprocessen op te zetten voor NVIDIA (NVDA ) en AMD-infrastructuur.

Het beheer van de stack van hardware tot modellen

Spectro Cloud heeft oorspronkelijk Palette ontwikkeld als een Kubernetes-beheerplatform voor het implementeren en onderhouden van clusters in publieke clouds, private datacenters, bare-metal-systemen en edge-locaties.

PaletteAI breidt deze basis uit naar AI-infrastructuur. Het combineert Kubernetes-levenscyclusbeheer met GPU-orchestratie, model-services, beveiligingscontroles, netwerken en machine learning-operations-tooling. Spectro Cloud beschrijft het platform als een manier om infrastructuur te beheren van de fysieke hardwarelaag tot de modellen en inferentieservices die erop draaien.

Het platform omvat ook PaletteAI Studio, dat vooraf geïntegreerde infrastructuur- en AI-stacks biedt die zijn opgebouwd uit technologieën zoals Kubeflow, MLflow, ClearML, Run:ai en Hugging Face. Deze configuraties zijn bedoeld om platformteams herhaalbare implementatiesjablonen te geven in plaats van ze te dwingen om elke component handmatig te integreren.

Inference Launchpad voegt tokenroutering, metering en lokaal beheerde modelservering toe aan die bredere infrastructuurlaag.

Ondersteuning voor soevereine en gereguleerde AI-omgevingen

Spectro Cloud richt zich ook op neoclouds, managed serviceproviders en soevereine cloudoperators. Deze providers hebben vaak gedeelde GPU-infrastructuur nodig, terwijl ze isolatie tussen klanten en jurisdictionele controles handhaven.

Het bedrijf werkt samen met NexusIgnite, een infrastructuurprovider die opereert vanuit Austin en Dubai, om implementaties te ondersteunen die gegevensresidu, compliance en operationele soevereiniteit betreffen.

Gegevensresidu gaat over waar informatie wordt opgeslagen. Soevereine AI introduceert extra vragen over wie de infrastructuur beheert, welke rechtsstelsels van toepassing zijn, wie toegang heeft en of de omgeving kan worden geaudit of losgekoppeld van externe services.

Spectro Cloud’s platform ondersteunt self-hosted en air-gapped implementaties, terwijl PaletteAI VerteX beveiligingscontroles toevoegt die zijn bedoeld voor overheid- en gereguleerde omgevingen.

Deze mogelijkheden kunnen bijzonder relevant zijn voor overheden, gezondheidsorganisaties, financiële instellingen en kritieke infrastructuuroperators die niet elke AI-interactie via een gedeelde publieke service kunnen routeren.

Groeiende concurrentie rond enterprise AI-operaties

De lancering vindt plaats kort na de aankondiging van Spectro Cloud van een $100 miljoen Series D-financieringsronde onder leiding van Growth Equity at Goldman Sachs Alternatives, met deelname van AMD Ventures, Ericsson, LG Technology Ventures en Maximus.

Het bedrijf zei dat de financiering de uitbreiding van de productie-AI-infrastructuur, soevereine clouds, neocloudservices en gedistribueerde inferentie zou ondersteunen. Spectro Cloud heeft nu ongeveer $260 miljoen opgehaald.

De strategie van het bedrijf weerspiegelt een opkomende laag van de AI-markt die zich richt op het opereren van modellen in plaats van het ontwikkelen van basismodellen. Naarmate de modelopties toenemen, hebben bedrijven steeds meer infrastructuur nodig die kan bepalen waar modellen draaien, hoe GPU’s worden toegewezen, welke gegevens ze kunnen benaderen en hoe het gebruik wordt gemeten.

PaletteAI Inference Launchpad en de uitgebreide AMD-integratie zijn onmiddellijk beschikbaar. Hun langetermijnsignificatie zal afhangen van of lokaal beheerde inferentie consistent economische voordelen kan bieden zonder de operationele complexiteit te recreëren die bedrijven hoopten te vermijden door externe modelaanbieders te gebruiken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.