Partnership
Crusoe firma un accordo pluriennale per potenziare l’addestramento e l’inferenza di Perplexity

Crusoe, il 15 settembre 2026, ha annunciato una partnership pluriennale con Perplexity in base alla quale Perplexity gestirà l’intero ciclo di vita del modello su Crusoe Cloud, addestrando modelli di frontiera su cluster dedicati NVIDIA GB300 NVL72 e servendoli in produzione tramite il servizio Managed Inference di Crusoe.
L’annuncio, datato San Francisco, impegna inoltre Crusoe ad adottare Perplexity Enterprise Pro e Max per i suoi 1.800 dipendenti. Secondo il comunicato, l’implementazione è destinata a fornire al personale ricerca sul web e conoscenza interna, ricerca a più fasi, analisi dei dati e accesso a modelli AI di frontiera.
Il comunicato descrive i prodotti di Perplexity come operanti in tempo reale per milioni di utenti, un contesto in cui latenza e throughput dell’inferenza sono il prodotto stesso piuttosto che benchmark teorici. Crusoe ha dichiarato che il suo servizio Managed Inference è progettato per inferenza di livello produttivo, alimentato da ottimizzazioni proprietarie e ingegnerizzato per prestazioni e costi su modelli popolari, e che Crusoe Cloud offre la profondità operativa e la scala necessarie per accompagnare la crescita di Perplexity.
Dichiarazioni esecutive
Il cofondatore e CEO di Crusoe, Chase Lochmiller, ha affermato che le aziende AI più rapide hanno bisogno di un’infrastruttura che tenga il passo lungo l’intero ciclo di vita del modello e si scala con loro man mano che crescono. “Perplexity sta costruendo il futuro di come le persone trovano risposte, e Crusoe è un partner chiave per rendere ciò possibile, dal primo elettrone all’ultimo token”, ha detto Lochmiller.
Il cofondatore e CEO di Perplexity, Aravind Srinivas, ha dichiarato che gestire l’AI alla scala di Perplexity significa che ogni millisecondo di latenza è percepito dagli utenti. Ha descritto Crusoe come costruito attorno a tale vincolo, definendolo un’inferenza ad alto throughput e bassa latenza supportata da hardware di nuova generazione.
Dion Harris, senior director of HPC and AI Infrastructure Solutions di NVIDIA, ha affermato che l’AI moderna richiede un’architettura informatica unificata dalla ricerca alla distribuzione. Alimentato da NVIDIA GB300 NVL72 e NVIDIA InfiniBand, Harris ha dichiarato che Crusoe Cloud consente a Perplexity di addestrare, perfezionare e servire modelli di frontiera in produzione con la velocità e l’efficienza richieste dall’AI agente.
La piattaforma GB300 NVL72
I cluster di addestramento dedicati citati nell’accordo funzionano su GB300 NVL72 di NVIDIA, che NVIDIA descrive come un sistema a rack completamente raffreddato a liquido, integrante 72 GPU Blackwell Ultra e 36 CPU Grace basate su Arm. Le specifiche pubblicate da NVIDIA elencano 130 TB/s di larghezza di banda NVLink, 20 TB di memoria GPU con fino a 576 TB/s di larghezza di banda, 37 TB di memoria veloce e 2.592 core CPU Arm Neoverse V2. Ogni GPU del sistema riceve 800 Gb/s di connettività di rete tramite un modulo IO ConnectX-8 SuperNIC, operante con le piattaforme di rete Quantum‑X800 InfiniBand o Spectrum‑X Ethernet.
NVIDIA afferma che le fabbriche AI basate su GB300 NVL72 offrono un aumento complessivo delle prestazioni fino a 50 volte rispetto alle piattaforme basate su Hopper. L’azienda attribuisce questo dato a un miglioramento dichiarato di 10 volte nella reattività dell’utente, misurata in token al secondo per utente, e a un miglioramento di 5 volte nel throughput per megawatt rispetto a Hopper, e osserva che i valori sono prestazioni stimate soggette a variazioni.
Servizio Managed Inference e storia
L’elemento di produzione dell’accordo funziona su Crusoe Managed Inference, che l’azienda ha reso generalmente disponibile il 20 novembre 2025, per carichi di lavoro di inferenza in produzione su Crusoe Cloud. Il servizio è alimentato dal motore di inferenza proprietario di Crusoe, costruito attorno a MemoryAlloy, una cache chiave‑valore a livello di cluster che elimina i prefilling duplicati consentendo alle GPU di recuperare le cache di prefisso da nodi locali e remoti. Crusoe afferma che il motore offre fino a 9.9x tempi più rapidi per il primo token e 5x maggiore throughput, confrontato con vLLM per il modello Llama‑3.3‑70B in un deployment a quattro nodi.
Crusoe offre il servizio in tre opzioni di distribuzione, secondo la sua pagina del prodotto Managed Inference. Serverless Inference propone un consumo basato sull’uso di modelli aperti tramite un’API completamente gestita, destinata a carichi di lavoro in fase iniziale, traffico a basso volume e sperimentazione rapida. Le Self‑Serve Deployments, che la pagina indica ora disponibili in generale, eseguono modelli ottimizzati per throughput o reattività, inclusi modelli personalizzati con il Serverless Fine‑Tuning di Crusoe. Le Tailored Deployments abbinano i clienti al team di Crusoe per un endpoint dedicato e benchmarkato, un’opzione che la pagina indirizza verso modelli proprietari.
Gli sviluppatori accedono al servizio tramite Crusoe Intelligence Foundry, un hub dove possono generare chiavi API, utilizzare endpoint gestiti ottimizzati per ciascun modello, monitorare metriche di prestazione e abilitare throughput provisionato per distribuzioni su scala produttiva. L’hub dei modelli di Crusoe elenca modelli aperti pre‑configurati provenienti da laboratori tra cui DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba e NVIDIA, con il numero di parametri e la lunghezza del contesto dichiarati per ogni modello.












