Modele și platforme AI
Spectro Cloud lansează PaletteAI Inference Launchpad pentru a ajuta întreprinderile să controleze costurile tokenelor AI

Spectro Cloud a lansat PaletteAI Inference Launchpad, o platformă de inferență gestionată local, proiectată pentru a ajuta întreprinderile să reducă dependența de serviciile externe de modele și să câștige mai mult control asupra costurilor în creștere ale sarcinilor de lucru cu inteligență artificială.
Compania afirmă că organizațiile pot reduce costurile externe cu tokenuri cu până la 70%, în funcție de mixul de sarcini de lucru, infrastructură și alegerea modelelor. Spectro Cloud a extins, de asemenea, suportul PaletteAI pentru infrastructura bazată pe AMD, oferind clienților o gamă mai largă de unități de procesare grafică (GPU), inferențe și tehnologii de servire a modelelor.
Anunțurile reflectă o schimbare mai largă în domeniul inteligenței artificiale pentru întreprinderi. Pe măsură ce companiile depășesc experimentarea și implementează inteligența artificială în servicii pentru clienți, dezvoltare de software, analize și operațiuni interne, costul procesării intrărilor și ieșirilor de modele devine o preocupare semnificativă pentru infrastructură.
Aducerea inferenței AI mai aproape de datele întreprinderilor
PaletteAI Inference Launchpad este construit în jurul unei abordări locale pentru inferență. În loc să trimită automat fiecare cerere către un model frontier extern, organizațiile pot rula sarcini de lucru potrivite pe infrastructură situată în centrele lor de date, clouduri private, medii suverane sau locații de margine.
Întreprinderile pot păstra, în continuare, accesul la modelele frontier externe pentru sarcini care necesită capacitățile acestora. Platforma este destinată să direcționeze cererile între modelele locale și externe pe baza factorilor precum cost, performanță, cerințe de guvernanță și complexitatea sarcinii.
Acest model hibrid poate deveni din ce în ce mai important pe măsură ce organizațiile adoptă modele mai mici și mai specializate. O cerere de suport pentru clienți, o sarcină de clasificare a documentelor sau o întrebare de cunoaștere internă poate să nu necesite aceeași capacitate de model ca și raționamentul avansat, codificarea complexă sau analiza multimodală.
Menținerea sarcinilor de lucru potrivite la nivel local poate reduce, de asemenea, latența prin apropierea inferenței de aplicații, utilizatori și surse de date. Pentru organizațiile care funcționează în industrii reglementate, procesarea locală poate oferi un control mai mare asupra locului în care se manipulează informații sensibile.
Utilizarea tokenului devine o metrică a infrastructurii
Tokenurile sunt unitățile în care modelele de inteligență artificială divid și procesează text, cod și alte informații. Fiecare prompt și răspuns generat consumă tokenuri, iar multe servicii comerciale de modele taxează în funcție de numărul de tokenuri procesate.
Acest lucru înseamnă că costurile AI pot crește rapid pe măsură ce sistemele trec de la încercări controlate la aplicații care deservesc mii de angajați sau clienți. Problema devine și mai complicată cu agenții AI, care pot face apeluri repetitive la modele, pot recupera informații, pot evalua rezultate și pot utiliza unelte externe înainte de a finaliza o singură sarcină.
Cercetarea Goldman Sachs estimează că consumul lunar de tokenuri AI va crește de 24 de ori între 2026 și 2030, ajungând la aproximativ 120 de quadrilion de tokenuri pe lună. Această creștere estimată este determinată de adoptarea în creștere a întreprinderilor și de apariția unor agenți AI mai autonomi.
Inference Launchpad abordează această problemă prin oferirea unor instrumente pentru echipele de infrastructură, care să poată măsura consumul de tokenuri, să stabilească cote și să aplice politici de utilizare. Aceste controale ar putea ajuta companiile să înțeleagă care echipe, aplicații și modele sunt responsabile pentru cheltuielile lor cu AI, în loc să trateze inferența ca o taxă externă imprevizibilă.
Reducerea cu 70% menționată de Spectro Cloud ar trebui să fie considerată ca o posibilă consecință, și nu ca o economie garantată. Economia reală va depinde de costurile de achiziție sau închiriere a GPU-urilor, de ratele de utilizare, de consumul de energie, de eficiența modelelor, de volumul de cereri și de prețurile furnizorilor externi.
Modele locale fără eliminarea modelelor frontier
Capacitățile de rutare a modelelor platformei sunt proiectate pentru a evita forțarea întreprinderilor să ia o decizie exclusiv locală sau exclusiv în cloud.
Organizațiile pot utiliza modele locale mai mici pentru sarcini previzibile sau sensibile din punct de vedere al confidențialității, în timp ce trimit cereri mai solicitante către modelele frontier. Politicile pot determina, de asemenea, care modele sunt permise pentru anumite departamente, jurisdicții sau clasificări de date.
Acest lucru introduce guvernanța direct în stratul de inferență. De exemplu, o instituție financiară ar putea preveni ca anumite informații să părăsească un mediu controlat, permițând, în același timp, ca cererile nesensibile să utilizeze un model extern. O companie multinațională ar putea aplica reguli de rutare diferite în funcție de cerințele de date regionale.
Spectro Cloud a poziționat alegerea modelului și guvernanța ca parte a strategiei sale mai largi de gestionare a infrastructurii PaletteAI. Platforma susține medii partajate de GPU, acces bazat pe rol, cote de resurse și controale la nivel de chiriaș, menite să permită mai multor echipe să utilizeze aceeași infrastructură fără a avea acces nelimitat la sistemele subiacente.
Extinderea suportului pentru infrastructura AI AMD
Alături de Inference Launchpad, Spectro Cloud a anunțat o extindere a suportului pentru medii AI bazate pe AMD.
Integrarea acoperă GPU-urile AMD, operatorul GPU AMD, stiva de software ROCm și microserviciile de inferență AMD, cunoscute sub numele de AIM. Aceste componente abordează diferite straturi ale infrastructurii necesare pentru a opera modele AI în producție.
Operatorul GPU AMD simplifică configurarea și gestionarea acceleratorilor Instinct AMD în interiorul clusterelor Kubernetes. ROCm oferă stiva de software deschis subiacent, incluzând drivere, biblioteci, runtime-uri și unelte de dezvoltare utilizate pentru a rula sarcini de lucru cu inteligență artificială și calcul de înaltă performanță pe hardware AMD.
AIM oferă microservicii de inferență standardizate pentru servirea modelelor pe GPU-urile Instinct AMD. Acestea sunt proiectate pentru a ambala modele optimizate și software-ul asociat în servicii care pot fi implementate, reducând unele dintre lucrările de integrare obișnuite necesare pentru a muta un model în producție.
Pentru clienții întreprinderilor, această extindere a suportului ar putea face mai ușoară operarea mediilor mixte de GPU, în loc de a construi procese de gestionare separate pentru infrastructura NVIDIA (NVDA ) și AMD.
Gestionarea stivei de la hardware la modele
Spectro Cloud a dezvoltat inițial Palette ca o platformă de gestionare Kubernetes pentru implementarea și întreținerea clusterelor în clouduri publice, centre de date private, sisteme bare-metal și locații de margine.
PaletteAI extinde această bază în infrastructura AI. Combina gestionarea ciclului de viață Kubernetes cu orchestrarea GPU, servicii de modele, controale de securitate, rețea și unelte de operare a mașinilor de învățare. Spectro Cloud descrie platforma ca o modalitate de a gestiona infrastructura de la stratul fizic de hardware până la modelele și serviciile de inferență care rulează pe aceasta.
Platforma include, de asemenea, PaletteAI Studio, care oferă stive de infrastructură și AI preintegrate, construite din tehnologii precum Kubeflow, MLflow, ClearML, Run:ai și Hugging Face. Aceste configurații sunt menite să ofere echipei platformei șabloane de implementare repetabile, în loc să necesite integrarea manuală a fiecărui component.
Inference Launchpad adaugă rutarea tokenului, măsurarea și servirea modelului gestionat local la acest strat de infrastructură mai larg.
Suport pentru medii AI suverane și reglementate
Spectro Cloud se axează, de asemenea, pe furnizorii de servicii gestionate, operatorii de cloud suverani și neocloud. Acești furnizori au nevoie adesea să ofere infrastructură partajată de GPU, menținând, în același timp, izolarea între clienți și aplicând controale specifice jurisdicției.
Compania lucrează cu NexusIgnite, un furnizor de infrastructură care operează din Austin și Dubai, pentru a sprijini implementările care implică rezidența datelor, conformitatea și suveranitatea operațională.
Rezidența datelor se referă, în general, la locul în care sunt stocate informațiile. Inteligența artificială suverană introduce întrebări suplimentare despre cine operează infrastructura, care sisteme juridice se aplică, cine are acces și dacă mediul poate fi auditat sau deconectat de la serviciile externe.
Platforma Spectro Cloud susține implementări auto-găzduite și izolate, în timp ce PaletteAI VerteX adaugă controale de securitate destinate mediilor guvernamentale și reglementate.
Aceste capacități pot fi deosebit de relevante pentru guverne, organizații de sănătate, instituții financiare și operatori de infrastructură critică care nu pot ruta fiecare interacțiune AI printr-un serviciu public partajat.
Crescerea competiției în jurul operațiunilor AI pentru întreprinderi
Lansarea are loc la scurt timp după ce Spectro Cloud a anunțat un tur de finanțare Seria D de 100 de milioane de dolari, condus de Growth Equity la Goldman Sachs Alternatives, cu participarea AMD Ventures, Ericsson, LG Technology Ventures și Maximus.
Compania a declarat că finanțarea va sprijini extinderea sa în infrastructura de producție AI, clouduri suverane, servicii de neocloud și inferență distribuită. Spectro Cloud a strâns, în prezent, aproximativ 260 de milioane de dolari.
Strategia sa reflectă un strat emergent al pieței AI, axat pe operarea modelelor, și nu pe dezvoltarea modelelor de bază. Pe măsură ce opțiunile de modele se multiplică, întreprinderile au nevoie din ce în ce mai mult de infrastructură care să poată determina unde rulează modelele, cum sunt alocate GPU-urile, ce date pot accesa și cum se măsoară utilizarea.
PaletteAI Inference Launchpad și integrarea extinsă AMD sunt disponibile imediat. Semnificația lor pe termen lung va depinde de capacitatea inferenței gestionate local de a oferi beneficii economice constante fără a recrea complexitatea operațională pe care întreprinderile au sperat să o evite prin utilizarea furnizorilor de modele externe.












