Partnerskap
Crusoe signerer flerårig avtale for å drive Perplexitys trening og inferens

Crusoe den 15. september 2026, kunngjorde et flerårig partnerskap med Perplexity under hvilken Perplexity vil kjøre hele modellens livssyklus på Crusoe Cloud, trene frontier-modeller på dedikerte NVIDIA GB300 NVL72-klustre og betjene dem i produksjon gjennom Crusoe sin Managed Inference-tjeneste.
Kunngjøringen, datert San Francisco, forplikter også Crusoe til å ta i bruk Perplexity Enterprise Pro og Max for sine 1,800 ansatte. Ifølge pressemeldingen er utrullingen ment å utruste personalet med søk på nett og intern kunnskap, flerstegs forskning, dataanalyse og tilgang til frontier AI-modeller.
Pressemeldingen beskriver Perplexitys produkter som opererer i sanntid for millioner av brukere, et miljø der inferenslatens og gjennomstrømning er produktet snarere enn teoretiske referanseverdier. Crusoe sa at deres Managed Inference-tjeneste er bygget for produksjonsklassifisert inferens, drevet av proprietære optimaliseringer og konstruert for ytelse og kostnad på tvers av populære modeller, og at Crusoe Cloud tilbyr den operative dybden og skalaen som matcher Perplexitys vekst.
Ledelsesuttalelser
Crusoe medgründer og administrerende direktør Chase Lochmiller sa at de raskest bevegende AI-selskapene trenger infrastruktur som holder tritt gjennom hele modellens livssyklus og skalerer med dem etter hvert som de vokser. “Perplexity bygger fremtiden for hvordan folk finner svar, og Crusoe er en nøkkelpartner for å gjøre dette mulig, fra den første elektronen til den siste token,” sa Lochmiller.
Perplexity medgründer og administrerende direktør Aravind Srinivas sa at drift av AI i Perplexitys skala betyr at hver millisekund med latens merkes av brukerne. Han beskrev Crusoe som bygget rundt denne begrensningen, og kalte den høy‑gjennomstrømning, lav‑latens inferens støttet av neste generasjons maskinvare.
Dion Harris, senior direktør for HPC og AI‑infrastruktur‑løsninger hos NVIDIA, sa at moderne AI krever en samlet databehandlingsarkitektur fra forskning til utrulling. Drevet av NVIDIA GB300 NVL72 og NVIDIA InfiniBand, sa Harris, gjør Crusoe Cloud det mulig for Perplexity å trene, finjustere og betjene frontier-modeller i produksjon med den hastigheten og effektiviteten agentisk AI krever.
GB300 NVL72-plattformen
De dedikerte treningsklustrene som er nevnt i avtalen kjører på NVIDIA sin GB300 NVL72, som NVIDIA beskriver som et fullt væskekjølt, rack‑skala system som integrerer 72 Blackwell Ultra‑GPUer og 36 Arm‑baserte Grace‑CPUer. NVIDIAs publiserte spesifikasjoner oppgir 130 TB/s NVLink-båndbredde, 20 TB GPU‑minne med opptil 576 TB/s båndbredde, 37 TB hurtigminne og 2 592 Arm Neoverse V2‑CPU‑kjerner. Hver GPU i systemet får 800 Gb/s nettverkstilkobling via en ConnectX‑8 SuperNIC‑IO‑modul, som fungerer med enten Quantum‑X800 InfiniBand eller Spectrum‑X Ethernet‑nettverksplattformer.
NVIDIA hevder at AI‑fabrikker bygget på GB300 NVL72 gir opptil 50‑ganger høyere samlet ytelse i AI‑fabrikkens produksjon sammenlignet med Hopper‑baserte plattformer. Selskapet tilskriver dette tallet en angitt 10‑ganger forbedring i brukerrespons, målt i token per sekund per bruker, og en 5‑ganger forbedring i gjennomstrømning per megawatt i forhold til Hopper, og bemerker at tallene er projisert ytelse som kan endres.
Managed Inference-tjeneste og historie
Produksjonsbetjeningsdelen av avtalen kjører på Crusoe Managed Inference, som selskapet gjorde generelt tilgjengelig 20. november 2025, for produksjons‑inferens‑arbeidsbelastninger på Crusoe Cloud. Tjenesten er drevet av Crusoe sin proprietære inferensmotor bygget rundt MemoryAlloy, en klynge‑omfattende nøkkel‑verdi‑cache som eliminerer dupliserte prefyll ved å la GPU‑er hente prefiks‑cacher fra lokale og eksterne noder. Crusoe oppgir at motoren leverer opptil 9,9‑ganger raskere tid‑til‑første‑token og 5‑ganger høyere gjennomstrømning, benchmarket mot vLLM for Llama‑3.3‑70B-modellen i en fire‑node‑utplassering.
Crusoe tilbyr tjenesten i tre distribusjonsalternativer, i henhold til sin Managed Inference-produkt side. Serverless Inference gir forbruksbasert bruk av åpne modeller via et fullt administrert API, rettet mot tidlige arbeidsbelastninger, lavt volum trafikk og rask eksperimentering. Self‑Serve Deployments, som siden sier nå er generelt tilgjengelige, kjører modeller optimalisert for gjennomstrømning eller respons, inkludert modeller tilpasset med Crusoe sin Serverless Fine‑Tuning. Tailored Deployments parer kunder med Crusoe sitt team for et dedikert, benchmarket endepunkt, et alternativ siden retter mot proprietære modeller.
Utviklere får tilgang til tjenesten via Crusoe Intelligence Foundry, et knutepunkt hvor de kan generere API‑nøkler, bruke administrerte endepunkter tilpasset hver modell, overvåke ytelsesmetrikk og aktivere tildelt gjennomstrømning for produksjons‑skala utrullinger. Crusoe sin modellhub lister forhåndskonfigurerte åpne modeller fra laboratorier inkludert DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba og NVIDIA, med oppgitte parameterantall og kontekstlengder for hver modell.












