Kumppanuudet

Crusoe solmii monivuotisen sopimuksen Perplexityn koulutuksen ja inferenssin tehostamiseksi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Crusoe on 15. syyskuuta 2026 julisti monivuotisesta kumppanuudesta Perplexityn kanssa, jonka puitteissa Perplexity suorittaa koko mallin elinkaaren Crusoe Cloudissa, kouluttaen huippumalleja omistetuilla NVIDIA GB300 NVL72 -klustereilla ja tarjoamalla niitä tuotannossa Crusoe’n Managed Inference -palvelun kautta.

San Franciscosta päivätty ilmoitus sitoo myös Crusoe’n ottamaan käyttöön Perplexity Enterprise Pro:n ja Max:n 1 800 työntekijälleen. Julkaisun mukaan käyttöönotto on tarkoitettu varustamaan henkilöstö verkkohaku- ja sisäisellä tiedonhaulla, monivaiheisella tutkimuksella, data-analyysillä sekä pääsyllä huippuluokan AI-malleihin.

Julkaisu kuvaa Perplexityn tuotteita toimivan reaaliaikaisesti miljoonille käyttäjille, ympäristössä, jossa inferenssin latenssi ja läpivirtaavuus ovat itse tuote, eivätkä teoreettiset mittapuut. Crusoe kertoi, että sen Managed Inference -palvelu on rakennettu tuotantotason inferenssiä varten, hyödyntäen omaehtoisia optimointeja ja suunniteltu suorituskykyä ja kustannustehokkuutta varten suosituissa malleissa, ja että Crusoe Cloud tarjoaa operatiivisen syvyyden ja mittakaavan, joka vastaa Perplexityn kasvua.

Johtajien lausunnot

Crusoe’n perustaja ja toimitusjohtaja Chase Lochmiller totesi, että nopeimmin kehittyvät AI-yritykset tarvitsevat infrastruktuurin, joka pysyy mukana koko mallin elinkaaren ajan ja skaalautuu niiden mukana kasvessa. “Perplexity rakentaa tulevaisuutta siitä, miten ihmiset löytävät vastauksia, ja Crusoe on keskeinen kumppani tämän mahdollistamisessa, ensimmäisestä elektronista viimeiseen tokeniin,” Lochmiller sanoi.

Perplexityn perustaja ja toimitusjohtaja Aravind Srinivas totesi, että AI:n käyttö Perplexityn mittakaavassa tarkoittaa, että jokainen millisekunti latenssia tuntuu käyttäjille. Hän kuvaili Crusoe’ta rakennettuna tämän rajoituksen ympärille, kutsuen sitä korkean läpivirran, matalan latenssin inferenssiksi, jota tukee seuraavan sukupolven laitteisto.

Dion Harris, NVIDIA:n HPC- ja AI-infrastruktuuriratkaisujen vanhempi johtaja, totesi, että moderni AI vaatii yhtenäisen laskenta-arkkitehtuurin tutkimuksesta käyttöönottoon. NVIDIA GB300 NVL72:n ja NVIDIA InfiniBandin tukemana Harris sanoi, että Crusoe Cloud mahdollistaa Perplexityn kouluttaa, hienosäätää ja tarjota huippumalleja tuotannossa agenttien AI:n vaatimalla nopeudella ja tehokkuudella.

GB300 NVL72 -alusta

Sopimuksessa nimetyt omistetut koulutusklusterit toimivat NVIDIA:n GB300 NVL72:lla, jonka NVIDIA kuvaa täysin nestekylmitetyksi, rack-tasoiseksi järjestelmäksi, jossa on 72 Blackwell Ultra -GPU:ta ja 36 Arm-pohjaista Grace‑CPU:ta. NVIDIA:n julkaisemissa teknisissä tiedoissa on 130 TB/s NVLink‑kaistanleveyttä, 20 TB GPU-muistia, enintään 576 TB/s kaistanleveyttä, 37 TB nopeaa muistia ja 2 592 Arm Neoverse V2 -CPU-ydintä. Jokainen GPU saa 800 Gb/s verkkoyhteyden ConnectX-8 SuperNIC -IO-moduulin kautta, toimien joko Quantum‑X800 InfiniBand- tai Spectrum‑X Ethernet -verkkoalustoilla.

NVIDIA väittää, että GB300 NVL72:lla rakennetut AI-tehtaat tarjoavat jopa 50‑kertainen kokonaiskasvun AI-tehtaan suorituskyvyssä verrattuna Hopper-pohjaisiin alustoihin. Yritys selittää luvun 10‑kertaiseen parannukseen käyttäjän vasteaikassa, mitattuna tokeneina sekunnissa per käyttäjä, ja 5‑kertaiseen läpivirtaavuuden parannukseen megawattia kohti suhteessa Hopperiin, ja huomauttaa, että luvut ovat ennakoituja suorituskykyjä, jotka voivat muuttua.

Hallinnoitu inferenssipalvelu ja historia

Sopimuksen tuotantokäyttöön tarkoitettu elementti toimii Crusoe Managed Inference -palvelussa, jonka yritys tehdy yleisesti saataville 20. marraskuuta 2025, tuotantoinferenssityökuormille Crusoe Cloudissa. Palvelu saa voimansa Crusoe’n omaan inferenssi‑moottoriin, joka on rakennettu MemoryAlloy:n ympärille, klusterinlaajuisen avain-arvo -välimuistin, joka poistaa päällekkäiset esitäytöt sallimalla GPU:iden hakea etuliitevälimuisteja paikallisilta ja etäsolmuilta. Crusoe väittää, että moottori tarjoaa jopa 9,9‑kerran nopeamman ajan ensimmäiseen tokeniin ja 5‑kerran suuremman läpivirran, verrattuna vLLM:ään Llama-3.3-70B -mallin neljän solmun käyttöönotossa.

Crusoe tarjoaa palvelua kolmessa käyttöönotto­vaihtoehdossa, yrityksensä Managed Inference -tuotesivun mukaan. Serverless Inference tarjoaa käyttöön perustuvaa kulutusta avoimille malleille täysin hallinnoidun API:n kautta, suunnattuna varhaisvaiheen työkuormiin, pienivolyymiseen liikenteeseen ja nopeaan kokeiluun. Self-Serve Deployments, joiden mukaan sivu kertoo olevan nyt yleisesti saatavilla, suorittavat malleja, jotka on optimoitu läpivirtaan tai vasteaikaan, mukaan lukien Crusoe’n Serverless Fine-Tuning -toiminnolla räätälöidyt mallit. Tailored Deployments yhdistää asiakkaat Crusoe’n tiimiin omistetuksi, benchmarkatuksi päätepisteeksi, vaihtoehto, jonka sivu kohdistaa omistamattomiin malleihin.

Kehittäjät pääsevät palveluun Crusoe Intelligence Foundryn kautta, keskuksesta, jossa he voivat luoda API-avaimia, käyttää hallinnoituja päätepisteitä, jotka on viritetty kullekin mallille, seurata suorituskykymittareita ja mahdollistaa varatun läpivirran tuotantotason käyttöönottoja varten. Crusoe’n mallihubi listaa ennalta määritetyt avoimet mallit laboratoriosta, mukaan lukien DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba ja NVIDIA, kunkin mallin ilmoitetuilla parametrimäärillä ja kontekstipituuksilla.

Theo Nash on tekoälygeneroitu asiantuntija Unite.AI:ssa, joka kattaa tekoälyinfrastruktuurin, laskennan ja modernin tekoälyä voimistavat laitteistojärjestelmät. Hänen työnsä keskittyy suurten tekoälykuormien taustalla oleviin teknisiin perusteisiin, mukaan lukien datakeskukset, kiihdyttimet, verkkotiet ja ohjelmistopinot, jotka sitoutuvat niihin.
Analyytisesta ja insinöörijohtoisesta näkökulmasta Theo tarkastelee, miten GPU:n, mukautetun piirin, muistiarkkitehtuurien ja hajautettujen järjestelmien edistysaskeleet mahdollistavat uusia tekoälymallien sukupolvia. Hän kiinnittää erityistä huomiota suorituskyky-yhteyksiin, energiatehokkuuteen, skaalautuvuuteen ja käytännön rajoituksiin, jotka muokkaavat tekoälyinfrastruktuurin todellista käyttöönottoa.
Artikkelit, joita Theo Nash on kirjoittanut, on tekoälygeneroitu ja Unite.AI:n toimittajatiimi on tarkastanut ne varmistaakseen teknisen tarkkuuden, selkeyden ja vastuullisen kattavuuden nopeasti kehittyvässä tekoälylaskennan maisemassa.