Modelli e piattaforme di IA
Spectro Cloud lancia PaletteAI Inference Launchpad per aiutare le imprese a controllare i costi dei token AI

Spectro Cloud ha lanciato PaletteAI Inference Launchpad, una piattaforma di inferenza gestita localmente progettata per aiutare le imprese a ridurre la loro dipendenza dai servizi di modelli esterni e a ottenere un maggiore controllo sui costi crescenti dei carichi di lavoro di intelligenza artificiale.
La società afferma che le organizzazioni possono ridurre i costi dei token esterni fino al 70%, a seconda del loro mix di carichi di lavoro, infrastrutture e scelta di modelli. Spectro Cloud ha anche ampliato il supporto di PaletteAI per l’infrastruttura basata su AMD, offrendo ai clienti una scelta più ampia di unità di elaborazione grafica (GPU), runtime di inferenza e tecnologie di servizio di modelli.
Le dichiarazioni riflettono un più ampio cambiamento nell’intelligenza artificiale aziendale. Mentre le società vanno oltre la sperimentazione e distribuiscono l’intelligenza artificiale in servizi clienti, sviluppo software, analisi e operazioni interne, il costo dell’elaborazione degli input e degli output dei modelli sta diventando una preoccupazione significativa per l’infrastruttura.
Portare l’inferenza AI più vicino ai dati aziendali
PaletteAI Inference Launchpad è costruito intorno a un approccio local-first all’inferenza. Invece di inviare automaticamente ogni richiesta a un modello frontier esterno, le organizzazioni possono eseguire carichi di lavoro idonei su infrastrutture situate nei propri centri dati, cloud privati, ambienti sovrani o posizioni edge.
Le imprese possono ancora mantenere l’accesso ai modelli frontier esterni per attività che richiedono le loro capacità. La piattaforma è progettata per instradare le richieste tra modelli locali ed esterni in base a fattori come costi, prestazioni, requisiti di governance e complessità dell’attività.
Questo modello ibrido potrebbe diventare sempre più importante mentre le organizzazioni adottano modelli più piccoli e specializzati. Una richiesta di supporto clienti, un’attività di classificazione di documenti o una query di conoscenza interna potrebbe non richiedere la stessa capacità di modello di ragionamento avanzato, codifica complessa o analisi multimodale.
Mantenere i carichi di lavoro appropriati a livello locale potrebbe anche ridurre la latenza spostando l’inferenza più vicino alle applicazioni, agli utenti e alle fonti di dati. Per le organizzazioni che operano in settori regolamentati, l’elaborazione locale può fornire un maggiore controllo su dove vengono gestite le informazioni sensibili.
L’utilizzo dei token diventa una metrica dell’infrastruttura
I token sono le unità in cui i modelli di intelligenza artificiale dividono e elaborano il testo, il codice e altre informazioni. Ogni prompt e risposta generata consuma token, e molti servizi di modelli commerciali addebitano in base al numero di token elaborati.
Ciò significa che i costi AI possono aumentare rapidamente mentre i sistemi passano da prove controllate ad applicazioni che servono migliaia di dipendenti o clienti. Il problema diventa ancora più complesso con gli agenti AI, che possono effettuare più chiamate di modello, recuperare informazioni, valutare i risultati e utilizzare strumenti esterni prima di completare un’unica attività.
Goldman Sachs Research prevede che il consumo mensile di token AI aumenterà di 24 volte tra il 2026 e il 2030, raggiungendo circa 120 quadrilioni di token al mese. Questa crescita prevista è trainata dall’adozione aziendale in espansione e dall’emergere di agenti AI più autonomi.
Inference Launchpad affronta questo problema fornendo agli team di infrastruttura strumenti per misurare il consumo di token, stabilire quote e applicare politiche di utilizzo. Questi controlli potrebbero aiutare le società a comprendere quali team, applicazioni e modelli sono responsabili delle loro spese AI piuttosto che trattare l’inferenza come un addebito esterno imprevedibile.
La riduzione del 70% citata da Spectro Cloud dovrebbe essere considerata come un risultato potenziale piuttosto che un risparmio garantito. L’economia reale dipenderà dai costi di acquisizione o noleggio di GPU, dai tassi di utilizzo, dal consumo di energia, dall’efficienza del modello, dal volume delle richieste e dal prezzo dei fornitori esterni.
Modelli locali senza eliminare i modelli frontier
Le capacità di instradamento dei modelli della piattaforma sono progettate per evitare di costringere le imprese in una decisione tutto-locale o tutto-nuvola.
Le organizzazioni possono utilizzare modelli locali più piccoli per attività prevedibili o sensibili alla privacy mentre inviano richieste più impegnative ai modelli frontier. Le politiche possono anche determinare quali modelli sono consentiti per particolari dipartimenti, giurisdizioni o classificazioni di dati.
Ciò introduce la governance direttamente nel livello di inferenza. Ad esempio, un’istituzione finanziaria potrebbe impedire che determinate informazioni lascino un ambiente controllato, mentre consente alle richieste non sensibili di utilizzare un modello esterno. Un’azienda multinazionale potrebbe applicare regole di instradamento diverse in base ai requisiti di dati regionali.
Spectro Cloud ha posizionato la scelta del modello e la governance come parte della strategia di gestione dell’infrastruttura di PaletteAI. La piattaforma supporta ambienti di GPU condivisi, accesso basato su ruoli, quote di risorse e controlli a livello di tenant progettati per consentire a più team di utilizzare la stessa infrastruttura senza ottenere un accesso non restrittivo ai sistemi sottostanti.
Supporto esteso per l’infrastruttura AI di AMD
Insieme a Inference Launchpad, Spectro Cloud ha annunciato un supporto più ampio per ambienti AI basati su AMD.
L’integrazione copre GPU AMD, l’operatore GPU AMD, lo stack software ROCm e i microservizi di inferenza AMD, comunemente noti come AIM. Questi componenti affrontano diversi livelli dell’infrastruttura necessaria per operare modelli AI in produzione.
L’operatore GPU AMD semplifica la configurazione e la gestione degli acceleratori AMD Instinct all’interno dei cluster Kubernetes. ROCm fornisce lo stack software aperto sottostante, compresi driver, librerie, runtime e strumenti di sviluppo utilizzati per eseguire carichi di lavoro di intelligenza artificiale e calcolo ad alte prestazioni su hardware AMD.
AIM fornisce microservizi di inferenza standardizzati per servire modelli su GPU AMD Instinct. Sono progettati per impacchettare modelli ottimizzati e software di supporto in servizi distribuibili, riducendo alcuni dei lavori di integrazione normalmente necessari per spostare un modello in produzione.
Per i clienti aziendali, questo supporto esteso potrebbe rendere più facile operare ambienti GPU misti invece di costruire processi di gestione separati per l’infrastruttura NVIDIA (NVDA ) e AMD.
Gestione dello stack dall’hardware ai modelli
Spectro Cloud ha originariamente sviluppato Palette come piattaforma di gestione Kubernetes per la distribuzione e la manutenzione di cluster su cloud pubblici, centri dati privati, sistemi bare-metal e posizioni edge.
PaletteAI estende quella base nell’infrastruttura AI. Combina la gestione del ciclo di vita di Kubernetes con l’orchestrazione GPU, i servizi di modelli, i controlli di sicurezza, la rete e gli strumenti di operazioni di apprendimento automatico. Spectro Cloud descrive la piattaforma come un modo per gestire l’infrastruttura dal livello fisico dell’hardware ai modelli e ai servizi di inferenza in esecuzione su di esso.
La piattaforma include anche PaletteAI Studio, che fornisce stack di infrastruttura e AI pre-integrati costruiti con tecnologie come Kubeflow, MLflow, ClearML, Run:ai e Hugging Face. Queste configurazioni sono progettate per fornire ai team di piattaforma modelli di distribuzione ripetibili invece di richiedere loro di integrare ogni componente manualmente.
Inference Launchpad aggiunge il routing dei token, la misurazione e il servizio di modello gestito localmente a quel livello di infrastruttura più ampio.
Supporto per ambienti AI sovrani e regolamentati
Spectro Cloud sta anche puntando a neocloud, fornitori di servizi gestiti e operatori di cloud sovrani. Questi fornitori devono spesso offrire infrastrutture GPU condivise mantenendo l’isolamento tra i clienti e applicando controlli specifici della giurisdizione.
La società sta lavorando con NexusIgnite, un fornitore di infrastrutture che opera da Austin e Dubai, per supportare la distribuzione di dati di residenza, conformità e sovranità operativa.
La residenza dei dati riguarda generalmente dove vengono archiviati i dati. L’AI sovrana introduce ulteriori domande su chi opera l’infrastruttura, quali sistemi legali si applicano, chi può accedervi e se l’ambiente può essere auditato o disconnesso da servizi esterni.
La piattaforma di Spectro Cloud supporta la distribuzione self-hosted e air-gapped, mentre PaletteAI VerteX aggiunge controlli di sicurezza destinati ad ambienti governativi e regolamentati.
Queste capacità potrebbero essere particolarmente rilevanti per i governi, le organizzazioni sanitarie, le istituzioni finanziarie e gli operatori di infrastrutture critiche che non possono instradare ogni interazione AI attraverso un servizio pubblico condiviso.
Concorrenza in aumento intorno alle operazioni AI aziendali
Il lancio arriva poco dopo che Spectro Cloud ha annunciato un round di finanziamento di serie D da 100 milioni di dollari guidato da Growth Equity at Goldman Sachs Alternatives, con la partecipazione di AMD Ventures, Ericsson, LG Technology Ventures e Maximus.
La società ha affermato che il finanziamento sosterrà la sua espansione nell’infrastruttura AI di produzione, nei servizi di cloud sovrani, nei servizi di neocloud e nell’inferenza distribuita. Spectro Cloud ha ora raccolto circa 260 milioni di dollari.
La sua strategia riflette un livello emergente del mercato AI focalizzato sull’operazione di modelli piuttosto che sullo sviluppo di modelli di base. Mentre le opzioni di modelli si moltiplicano, le imprese hanno sempre più bisogno di un’infrastruttura che possa determinare dove vengono eseguiti i modelli, come vengono allocati i GPU, quali dati possono accedere e come viene misurato l’utilizzo.
PaletteAI Inference Launchpad e l’integrazione AMD estesa sono disponibili immediatamente. La loro importanza a lungo termine dipenderà dal fatto che l’inferenza gestita localmente possa fornire benefici economici consistenti senza ricreare la complessità operativa che le imprese speravano di evitare utilizzando i fornitori di modelli esterni.












