AI-mallit ja alustat
Spectro Cloud julkaisee PaletteAI Inference Launchpadin, joka auttaa yrityksiä hallitsemaan tekoälykustannukset

Spectro Cloud on julkaissut PaletteAI Inference Launchpadin, joka on paikallisesti hallittu inference-alusta, joka on suunniteltu auttamaan yrityksiä vähentämään riippuvuuttaan ulkoisista mallipalveluista ja saavuttamaan enemmän valvontaa kasvavista tekoälytyön kuormituksista.
Yritys sanoo, että organisaatiot voivat vähentää ulkoisia token-kustannuksia jopa 70 %, riippuen työmäärästä, infrastruktuurista ja mallivalinnoista. Spectro Cloud on myös laajentanut PaletteAI:n tukea AMD-pohjaisille infrastruktuureille, jolloin asiakkaat saavat laajemman valikoiman grafiikkaprosessoreita, inference-ajonaikaisia ja mallipalvelutekniikoita.
Tiedotteet heijastelevat laajempaa muutosta yritysten tekoälyssä. Kun yritykset siirtyvät kokeilusta ja käyttävät tekoälyä asiakaspalvelussa, ohjelmistokehityksessä, analytiikassa ja sisäisissä prosesseissa, mallisyötteen ja tulosteen käsittelykustannukset muodostuvat merkittäväksi infrastruktuurikysymykseksi.
Teckoälyinferenssin lähentäminen yritysten tietoihin
PaletteAI Inference Launchpad on rakennettu paikallisesti ensin -lähestymistavalle. Sen sijaan, että jokainen pyyntö lähetetään automaattisesti ulkoisesti isännöidylle frontier-mallille, organisaatiot voivat ajaa soveltuvia työmääriä omassa infrastruktuurissaan, joka sijaitsee omassa datakeskuksessa, yksityisissä pilvissä, suvereenien ympäristöissä tai reunalla.
Yritykset voivat edelleen pitää käyttöön ulkoisesti isännöidyt frontier-mallit tehtävien, jotka vaativat niiden kykyjä. Alusta on tarkoitettu reitittämään pyyntöjä paikallisesti ja ulkoisesti mallien välillä tekijöiden, kuten kustannusten, suorituskyvyn, hallinnollisten vaatimusten ja tehtävän monimutkaisuuden perusteella.
Tämä hybridimalli voi tulla yhä tärkeämmäksi, kun organisaatiot ottaa käyttöön pienempiä ja erikoistuneempia malleja. Asiakastukipyyntö, asiakirjan luokittelutehtävä tai sisäinen tietopyyntö ei välttämättä vaadi samaa mallikapasiteettia kuin edistynyt päättely, monimutkainen koodaus tai monimodaalinen analyysi.
Paikallisten työmäärien pitäminen paikallisesti voi myös vähentää viivettä lähentämällä inferenssiä sovelluksista, käyttäjistä ja tietolähteistä. Organisaatioille, jotka toimivat säännellyissä aloissa, paikallinen käsittely voi tarjota suuremman valvonnan siitä, missä herkkä tieto käsitellään.
Token-käytön muuttuminen infrastruktuurimittaukseksi
Tokenit ovat yksiköt, joihin tekoälymallit jakavat ja käsittelevät tekstiä, koodia ja muita tietoja. Jokainen pyyntö ja luotu vastaus kuluttaa tokenia, ja monet kaupalliset mallipalvelut laskuttavat tokenien määrän mukaan.
Tämä tarkoittaa, että tekoälykustannukset voivat kasvaa nopeasti, kun järjestelmät siirtyvät hallituista kokeiluista sovelluksiin, jotka palvelevat tuhansia työntekijöitä tai asiakkaita. Ongelma muodostuu entistä monimutkaisemmaksi tekoälyagenttien kanssa, jotka voivat tehdä toistuvia mallikutsuja, noutaa tietoja, arvioida tuloksia ja käyttää ulkoisia työkaluja ennen yhden tehtävän suorittamista.
Goldman Sachs tutkimus odottaa, että kuukausittainen tekoälytoken-kulutus kasvaa 24-kertaiseksi vuosien 2026 ja 2030 välillä, saavuttaen noin 120 biljoonaa tokenia kuukaudessa. Tämä ennustettu kasvu johtuu laajenevasta yritysten omaksumisesta ja itsenäisempien tekoälyagenttien ilmaantumisesta.
Inference Launchpad vastaa tähän ongelmaan antamalla infrastruktuuritiimeille työkalut token-kulutuksen mittaukseen, kiintiön asettamiseen ja käyttöpolitiikkojen soveltamiseen. Nämä valvontatoimenpiteet voivat auttaa yrityksiä ymmärtämään, mitkä tiimit, sovellukset ja mallit ovat vastuussa tekoälykustannuksistaan eikä kohdella inferenssiä enää epävarmana ulkoisena palvelumaksuna.
70 %:n vähennys, jonka Spectro Cloud mainitsee, tulisi käsittää potentiaalisena tuloksena eikä taatustuna säästönä. Todelliset taloudelliset seikat riippuvat GPU-hankintamenoista, käyttöasteista, energiankulutuksesta, mallitehokkuudesta, pyyntömäärästä ja ulkoisten tarjoajien hinnoittelusta.
Paikalliset mallit ilman frontier-mallien poistamista
Alustan mallireititysmahdollisuudet on suunniteltu välttämään pakottamasta yrityksiä tekemään kaikki paikallinen tai kaikki pilvi-päätös.
Organisaatiot voivat käyttää pienempiä paikallisia malleja ennustettavissa tai tietosuojaa koskevissa tehtävissä ja lähettää vaativammat pyynnöt frontier-malleille. Käytäntöjä voidaan myös määrittää, mitkä mallit on sallittu tiettyjen osastojen, alueiden tai tietoluokkien osalta.
Tämä tuo hallinnon suoraan inference-kerrokseen. Esimerkiksi rahoituslaitos voi estää tietyn tiedon poistumisen valvotusta ympäristöstä, kun taas sallii epäherkkäiden pyyntöjen käyttää ulkoista mallia. Monikansallinen yritys voi soveltaa eri reitityssääntöjä aluekohtaisten tietovaatimusten perusteella.
Spectro Cloud on asettanut mallivalinnan ja hallinnon osaksi PaletteAI:n laajempaa infrastruktuurin hallintastrategiaa. Alusta tukee jaettuja GPU-ympäristöjä, roolipohjaista pääsyä, resurssikiintiöitä ja vuokralaiskohtaisia valvontatoimia, joiden tarkoituksena on sallia useiden tiimien käyttää samaa infrastruktuuria ilman rajoituksetonta pääsyä perustaviin järjestelmiin.
Laajennettu tuki AMD-tekoälyinfrastruktuurille
Inference Launchpadin rinnalla Spectro Cloud ilmoitti laajemmasta tuosta AMD-pohjaisille tekoälyympäristöille.
Integraatio kattaa AMD:n grafiikkaprosessoreita, AMD GPU -operaattoria, ROCm-ohjelmistopinoa ja AMD Inference Microservices -palveluita, jotka tunnetaan yleisesti AIMs-palveluina. Nämä komponentit koskevat eri kerroksia infrastruktuurista, jota tarvitaan tekoälymallien käyttöönottoon tuotantoon.
AMD GPU -operaattori yksinkertaa AMD Instinct -kiihdyttimien konfigurointia ja hallintaa Kubernetes-klustereissa. ROCm tarjoaa avoimen ohjelmistopinon, mukaan lukien ajureita, kirjastoja, suorituskykyisiä työkaluja ja kehitystyökaluja, joita käytetään tekoäly- ja suorituskyvyn työkuormituksien suorittamiseen AMD-laitteilla.
AIMs tarjoavat standardoidut inference-mikropalvelut mallien tarjoamiseen AMD Instinct -GPU:illa. Ne on suunniteltu pakkaamaan optimoituja malleja ja tukevia ohjelmistoja käyttöönotettaviin palveluihin, mikä vähentää jotain integraatiotyötä, jota normaalisti vaaditaan mallin siirtämisessä tuotantoon.
Yritysasiakkaille tämä laajennettu tuki voi tehdä helpommaksi toimia sekoittuneissa GPU-ympäristöissä sen sijaan, että rakentaa erillisiä hallintoprosesseja NVIDIA (NVDA ) ja AMD-infrastruktuurille.
Pinon hallinta laitteistosta malleihin
Spectro Cloud kehitti alun perin Paletten Kubernetes-hallintaplatformaksi klustereiden käyttöönottoon ja ylläpitoon julkisissa pilvissä, yksityisissä datakeskuksissa, paljaisissa järjestelmissä ja reunalla.
PaletteAI laajentaa tämän perustan tekoälyinfrastruktuuriin. Se yhdistää Kubernetes- elinkaaren hallinnan GPU-orkestraatiota, mallipalveluita, turvallisuusvalvontaa, verkkotekniikkaa ja koneoppimisen operaatiotyökaluja. Spectro Cloud kuvaa alustaa tienä hallita infrastruktuuria fyysisestä laitteistokerroksesta malleihin ja inference-palveluihin, jotka pyörii sen päällä.
Alusta sisältää myös PaletteAI Studio, joka tarjoaa esivalmistellun infrastruktuurin ja tekoälypinon, joka on rakennettu tekniikoista, kuten Kubeflow, MLflow, ClearML, Run:ai ja Hugging Face. Nämä konfiguraatiot on tarkoitettu antamaan alustatiimeille toistettavat käyttöönotto-mallit sen sijaan, että vaatisivat manuaalista integrointia jokaisen komponentin osalta.
Inference Launchpad lisää tokenin reitityksen, mittauksen ja paikallisesti hallitun mallipalvelun laajempaan infrastruktuurikerrokseen.
Tukea suvereenille ja säännellyille tekoälyympäristöille
Spectro Cloud on myös kohdistamassa neocloud-palveluntarjoajia, hallittuja palveluntarjoajia ja suvereenisia pilvioperaattoreita. Nämä tarjoajat tarvitsevat usein jakoa GPU-infrastruktuuria samalla, kun ylläpitävät eristystä asiakkaiden välillä ja soveltavat aluekohtaisia valvontatoimia.
Yritys työskentelee NexusIgniten kanssa, joka on infrastruktuuripalveluntarjoaja, joka toimii Austinista ja Dubaista, tukemaan käyttöönottoja, jotka liittyvät tietoresidenssiin, vaatimustenmukaisuuteen ja operatiiviseen suvereniteettiin.
Tietoresidenssi liittyy yleensä siihen, missä tietoja säilytetään. Suvereeni tekoäly tuo lisäksi kysymyksiä siitä, kuka toimii infrastruktuurin, mitkä oikeusjärjestelmät soveltuvat, kuka pääsee siihen käyttöön ja voidaanko ympäristöä tarkastella tai erottaa ulkoisista palveluista.
Spectro Cloudin alusta tukee itseisännityksiä ja ilmatiloja, kun taas PaletteAI VerteX lisää turvallisuusvalvontaa, jota on tarkoitettu hallituksille ja säännellyille ympäristöille.
Nämä ominaisuudet voivat olla erityisen merkittäviä hallituksille, terveydenhuollon organisaatioille, rahoituslaitoksille ja kriittisten infrastruktuurien toimijoille, jotka eivät voi reitittää jokaista tekoälyvuorovaikutusta jaettuun julkiseen palveluun.
Kasvava kilpailu yritysten tekoälyoperaatioissa
Julkaisu tapahtuu pian sen jälkeen, kun Spectro Cloud ilmoitti 100 miljoonan dollarin Series D -rahoituskierroksen, jonka johti Growth Equity at Goldman Sachs Alternatives, johon osallistuivat myös AMD Ventures, Ericsson, LG Technology Ventures ja Maximus.
Yritys sanoi, että rahoitus tukee laajentumistaan tuotantotekoälyinfrastruktuuriin, suvereenisiin pilviin, neocloud-palveluihin ja jakeluinferenssiin. Spectro Cloud on nyt kerännyt noin 260 miljoonaa dollaria.
Strategia heijastelee tekoälymarkkinoiden uutta kerrosta, joka keskittyy mallien käyttöönottoon eikä perusmallien kehittämiseen. Kun mallivaihtoehtoja lisääntyy, yrityksillä on yhä enemmän tarvetta infrastruktuurille, joka voi määrittää, missä malleja ajetaan, miten GPU:ita jaetaan, mitä tietoja niillä voidaan käyttää ja miten käyttöä mitataan.
PaletteAI Inference Launchpad ja laajennettu AMD-integraatio ovat saatavilla välittömästi. Niiden pitkän aikavälin merkitys riippuu siitä, voivatko paikallisesti hallitut inferenssit tarjota johdonmukaisia taloudellisia hyötyjä ilman operatiivisen monimutkaisuuden uudelleenluomista, jonka yritykset toivoivat välttävänsä käyttämällä ulkoisia mallipalveluntarjoajia.












