Partnerství
Crusoe uzavírá víceroletou dohodu na poskytování výpočetního výkonu pro trénink a inferenci Perplexity.

Crusoe dne 15. září 2026 oznámil víceroleté partnerství s Perplexity, v rámci kterého Perplexity bude provozovat celý životní cyklus svých modelů na platformě Crusoe Cloud, trénovat špičkové modely na vyhrazených clusterech NVIDIA GB300 NVL72 a nasazovat je do výroby prostřednictvím služby Managed Inference od Crusoe.
Oznámení, datované v San Franciscu, také zavazuje Crusoe k nasazení Perplexity Enterprise Pro a Max pro svých 1 800 zaměstnanců. Podle tiskové zprávy má nasazení vybavit zaměstnance vyhledáváním informací na webu i interně, vícestupňovým výzkumem, analýzou dat a přístupem k špičkovým modelům AI.
Tisková zpráva charakterizuje produkty Perplexity jako fungující v reálném čase pro miliony uživatelů, což je prostředí, kde jsou latence a propustnost inferencí samotným produktem, nikoli teoretickými benchmarky. Crusoe uvedl, že jeho služba Managed Inference je vytvořena pro produkční inferenci poháněnou proprietárními optimalizacemi a navrženou pro výkon a náklady napříč populárními modely, a že Crusoe Cloud poskytuje operační hloubku a škálovatelnost odpovídající růstu Perplexity.
Prohlášení vedení
Spoluzakladatel a CEO Crusoe, Chase Lochmiller, řekl, že nejrychleji se rozvíjející společnosti v oblasti AI potřebují infrastrukturu, která drží krok během celého životního cyklu modelu a škáluje se s nimi, jak rostou. “Perplexity buduje budoucnost toho, jak lidé nacházejí odpovědi, a Crusoe je klíčovým partnerem, který to umožňuje, od prvního elektronu po poslední token,” řekl Lochmiller.
Spoluzakladatel a CEO Perplexity, Aravind Srinivas, řekl, že provozování AI v měřítku Perplexity znamená, že každá milisekunda latence je uživateli znát. Popsal Crusoe jako postavený kolem této omezení a označil jej za vysokoprůtokovou, nízkolatentní inferenci podporovanou hardware nové generace.
Dion Harris, senior director pro HPC a AI Infrastructure Solutions ve společnosti NVIDIA, řekl, že moderní AI vyžaduje jednotnou výpočetní architekturu od výzkumu po nasazení. Poháněný technologiemi NVIDIA GB300 NVL72 a NVIDIA InfiniBand, Harris uvedl, že Crusoe Cloud umožňuje Perplexity trénovat, dolaďovat a nasazovat špičkové modely do výroby s rychlostí a efektivitou, kterou požaduje agentní AI.
Platforma GB300 NVL72
Vyhrazené tréninkové clustery uvedené ve smlouvě běží na GB300 NVL72 od NVIDIA, který NVIDIA popisuje jako plně kapalně chlazený systém na úrovni racku, integrující 72 GPU Blackwell Ultra a 36 procesorů Grace založených na architektuře Arm. Publikované specifikace NVIDIA uvádějí šířku pásma NVLink 130 TB/s, 20 TB paměti GPU s až 576 TB/s šířkou pásma, 37 TB rychlé paměti a 2 592 jader Arm Neoverse V2. Každý GPU v systému získává 800 Gb/s síťové připojení prostřednictvím IO modulu ConnectX-8 SuperNIC, pracujícího buď s platformou InfiniBand Quantum‑X800, nebo Ethernet Spectrum‑X.
NVIDIA tvrdí, že AI továrny postavené na GB300 NVL72 poskytují až 50‑násobné celkové zvýšení výkonu výstupu AI továrny ve srovnání s platformami založenými na Hopperu. Společnost tuto hodnotu přisuzuje údajně 10‑násobnému zlepšení odezvy uživatele, měřenému v tokenech za sekundu na uživatele, a 5‑násobnému zlepšení propustnosti na megawatt oproti Hopperu, a upozorňuje, že uvedená čísla jsou projekční výkonnost a mohou se změnit.
Služba Managed Inference a historie
Produkční část dohody běží na službě Crusoe Managed Inference, kterou společnost obecně zpřístupnila 20. listopadu 2025 pro produkční inference úlohy na Crusoe Cloud. Služba je poháněna proprietárním inference enginem Crusoe postaveným kolem MemoryAlloy, clusterového key‑value cache, který eliminuje duplicitní předvyplňování tím, že umožňuje GPU načítat prefixové cache z lokálních i vzdálených uzlů. Crusoe uvádí, že engine poskytuje až 9,9‑násobně rychlejší čas do prvního tokenu a 5‑násobně vyšší propustnost, benchmarkováno proti vLLM pro model Llama‑3.3‑70B ve čtyřuzlovém nasazení.
Crusoe nabízí službu ve třech nasazovacích možnostech, podle své stránky produktu Managed Inference. Serverless Inference poskytuje spotřebu otevřených modelů na základě využití prostřednictvím plně spravovaného API, zaměřeného na rané fáze pracovních zátěží, nízký objem provozu a rychlé experimentování. Self‑Serve Deployments, které stránka uvádí jako nyní obecně dostupné, spouštějí modely optimalizované pro propustnost nebo odezvu, včetně modelů přizpůsobených pomocí Serverless Fine‑Tuning od Crusoe. Tailored Deployments spojují zákazníky s týmem Crusoe pro dedikovaný, benchmarkovaný endpoint, volba určená pro proprietární modely.
Vývojáři získají přístup ke službě prostřednictvím Crusoe Intelligence Foundry, centra, kde mohou generovat API klíče, používat spravované endpointy laděné na jednotlivé modely, sledovat výkonnostní metriky a povolit přidělenou propustnost pro nasazení v produkčním měřítku. Hub modelů Crusoe uvádí předkonfigurované otevřené modely z laboratoří včetně DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba a NVIDIA, s uvedeným počtem parametrů a délkou kontextu pro každý model.












