Partnerskap

Crusoe undertecknar flerårigt avtal för att driva Perplexity‑träning och inferens

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Crusoe den 15 september 2026 annonserade ett flerårigt partnerskap med Perplexity där Perplexity kommer att köra hela sin modellcykel på Crusoe Cloud, träna frontier‑modeller på dedikerade NVIDIA GB300 NVL72‑kluster och leverera dem i produktion via Crusoe’s Managed Inference‑tjänst.

Meddelandet, daterat San Francisco, förbinder också Crusoe att anta Perplexity Enterprise Pro och Max för sina 1 800 anställda. Enligt pressmeddelandet är utrullningen avsedd att utrusta personalen med web‑ och intern kunskapssökning, flerstegs‑forskning, dataanalys och åtkomst till frontier‑AI‑modeller.

Pressmeddelandet beskriver Perplexitys produkter som att de fungerar i realtid för miljontals användare, en miljö där inferenslatens och genomströmning är själva produkten snarare än teoretiska referensvärden. Crusoe uppgav att deras Managed Inference‑tjänst är byggd för produktionsklassad inferens, drivs av proprietära optimeringar och är konstruerad för prestanda och kostnad över populära modeller, samt att Crusoe Cloud erbjuder den operativa djupet och skalan som matchar Perplexitys tillväxt.

Ledande uttalanden

Crusoe:s medgrundare och VD Chase Lochmiller sade att de snabbast växande AI‑företagen behöver infrastruktur som hänger med hela modellens livscykel och skalar med dem i takt med deras tillväxt. “Perplexity bygger framtiden för hur människor hittar svar, och Crusoe är en nyckelpartner för att möjliggöra det, från den första elektronen till den sista token,” sade Lochmiller.

Perplexitys medgrundare och VD Aravind Srinivas sade att drift av AI i Perplexitys skala innebär att varje millisekund av latens märks av användarna. Han beskrev Crusoe som byggt kring den begränsningen och kallade det för hög‑genomströmning, låg‑latens inferens stödjad av nästa generations hårdvara.

Dion Harris, senior director för HPC‑ och AI‑infrastrukturlösningar på NVIDIA, sade att modern AI kräver en enhetlig beräkningsarkitektur från forskning till driftsättning. Drivet av NVIDIA GB300 NVL72 och NVIDIA InfiniBand, sade Harris att Crusoe Cloud gör det möjligt för Perplexity att träna, finjustera och leverera frontier‑modeller i produktion med den hastighet och effektivitet som agentbaserad AI kräver.

GB300 NVL72‑plattformen

De dedikerade träningsklustren som nämns i avtalet körs på NVIDIA:s GB300 NVL72, som NVIDIA beskriver som ett fullt vätskekylt, rack‑skalig system som integrerar 72 Blackwell Ultra‑GPU:er och 36 Arm‑baserade Grace‑CPU:er. NVIDIA:s publicerade specifikationer listar 130 TB/s NVLink‑bandbredd, 20 TB GPU‑minne med upp till 576 TB/s bandbredd, 37 TB snabbminne och 2 592 Arm Neoverse V2‑CPU‑kärnor. Varje GPU i systemet får 800 Gb/s nätverksanslutning via en ConnectX‑8 SuperNIC‑IO‑modul, som fungerar med antingen Quantum‑X800 InfiniBand eller Spectrum‑X Ethernet‑nätverksplattformar.

NVIDIA påstår att AI‑fabriker byggda på GB300 NVL72 levererar upp till 50 × högre total prestanda för AI‑fabrikens output jämfört med Hopper‑baserade plattformar. Företaget tillskriver den siffran en påstådd 10 × förbättring av användarrespons, mätt i token per sekund per användare, och en 5 × förbättring av genomströmning per megawatt i förhållande till Hopper, och noterar att siffrorna är prognostiserad prestanda som kan förändras.

Managed Inference‑tjänst och historik

Produktionsservicen i avtalet körs på Crusoe Managed Inference, som företaget gjorde allmänt tillgänglig den 20 november 2025, för produktions‑inferensarbetsbelastningar på Crusoe Cloud. Tjänsten drivs av Crusoe:s proprietära inferensmotor byggd kring MemoryAlloy, en kluster‑omfattande nyckel‑värde‑cache som eliminerar dubbla förfyllningar genom att låta GPU:er hämta prefix‑cacher från lokala och fjärrnoder. Crusoe uppger att motorn levererar upp till 9.9 × snabbare tid‑till‑första‑token och 5 × högre genomströmning, jämfört med vLLM för Llama‑3.3‑70B‑modellen i en fyr‑nods‑utplacering.

Crusoe erbjuder tjänsten i tre driftsättningsalternativ, enligt deras Managed Inference‑produktsida. Serverless Inference erbjuder användningsbaserad konsumtion av öppna modeller via ett fullt hanterat API, riktat mot tidiga arbetsbelastningar, låg volym trafik och snabb experimentering. Self‑Serve Deployments, som sidan säger nu är allmänt tillgängliga, kör modeller optimerade för genomströmning eller respons, inklusive modeller anpassade med Crusoe:s Serverless Fine‑Tuning. Tailored Deployments parar kunder med Crusoe:s team för en dedikerad, benchmarkad endpoint, ett alternativ som sidan pekar på för proprietära modeller.

Utvecklare får åtkomst till tjänsten via Crusoe Intelligence Foundry, ett nav där de kan generera API‑nycklar, använda hanterade endpoints som är finjusterade för varje modell, övervaka prestandamått och möjliggöra provisionerad genomströmning för produktionsskala‑utplaceringar. Crusoe:s modellhub listar förkonfigurerade öppna modeller från laboratorier inklusive DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba och NVIDIA, med angivna parameterantal och kontextlängder för varje modell.

Theo Nash är en AI-genererad specialist på Unite.AI, som täcker AI-infrastruktur, beräkningar och de hårdvarusystem som driver modern konstgjord intelligens. Hans arbete fokuserar på de tekniska grunderna bakom storskaliga AI-arbetsbelastningar, inklusive datacenter, acceleratorer, nätverk och de programvarustackar som binder samman dem.
Med en analytisk och ingenjörsdriven perspektiv undersöker Theo hur framsteg inom GPU:er, anpassad kisel, minnesarkitekturer och distribuerade system möjliggör nya generationer av AI-modeller. Han ägnar särskild uppmärksamhet åt prestandaavvägningar, energoeffektivitet, skalbarhet och de praktiska begränsningarna som formar den verkliga distributionen av AI-infrastruktur.
Artiklar skrivna av Theo Nash är AI-genererade och granskade av Unite.AIs redaktionella team för att säkerställa teknisk noggrannhet, tydlighet och ansvarsfull rapportering om den snabbt utvecklande AI-beräkningslandskapet.