Parteneriate
Crusoe semnează un acord pe mai mulţi ani pentru a alimenta antrenamentul şi inferenţa Perplexity.

Crusoe pe 15 septembrie 2026, anunță un parteneriat pe mai mulţi ani cu Perplexity în temeiul căruia Perplexity îşi va rula întregul ciclu de viaţă al modelului pe Crusoe Cloud, antrenând modele de frontieră pe clustere dedicate NVIDIA GB300 NVL72 şi le va servi în producţie prin serviciul Managed Inference al Crusoe.
Anunţul, datat în San Francisco, angajează, de asemenea, Crusoe să adopte Perplexity Enterprise Pro şi Max pentru cei 1.800 de angajaţi ai său. Conform comunicatului, implementarea are scopul de a echipa personalul cu căutare pe web şi de cunoştinţe interne, cercetare în mai mulţi paşi, analiză de date şi acces la modele AI de frontieră.
Comunicatul caracterizează produsele Perplexity ca funcționând în timp real pentru milioane de utilizatori, un mediu în care latența și debitul inferenței sunt produsul, nu simple repere teoretice. Crusoe a declarat că serviciul său Managed Inference este conceput pentru inferență de nivel producție, alimentat de optimizări proprietare și proiectat pentru performanță și cost în cadrul modelelor populare, și că Crusoe Cloud oferă profunzimea operațională și scala necesare pentru a se potrivi cu creșterea Perplexity.
Declarații executive
Co-fondatorul și CEO-ul Crusoe, Chase Lochmiller, a declarat că companiile AI care evoluează cel mai rapid au nevoie de o infrastructură care să țină pasul pe tot parcursul ciclului de viață al modelului și să se scaleze odată cu ele pe măsură ce cresc. „Perplexity construiește viitorul modului în care oamenii găsesc răspunsuri, iar Crusoe este un partener cheie în realizarea acestui lucru, de la primul electron până la ultimul token”, a spus Lochmiller.
Co-fondatorul și CEO-ul Perplexity, Aravind Srinivas, a afirmat că rularea AI la scară Perplexity înseamnă că fiecare milisecundă de latență este percepută de utilizatori. El a descris Crusoe ca fiind construit în jurul acestei constrângeri, numindu-l inferență cu debit ridicat și latență scăzută, susținută de hardware de generație următoare.
Dion Harris, director senior al soluțiilor HPC și AI Infrastructure la NVIDIA, a declarat că AI modern necesită o arhitectură de calcul unificată, de la cercetare la implementare. Alimentat de NVIDIA GB300 NVL72 și NVIDIA InfiniBand, a spus Harris, Crusoe Cloud permite Perplexity să antreneze, să ajusteze fin și să servească modele de frontieră în producție cu viteza și eficiența pe care AI-ul agentic le solicită.
Platforma GB300 NVL72
Clusterele de antrenament dedicate menționate în acord rulează pe GB300 NVL72 de la NVIDIA, pe care NVIDIA îl descrie ca un sistem complet răcit lichid, la scară de rack, integrând 72 de GPU-uri Blackwell Ultra și 36 de CPU-uri Grace bazate pe Arm. Specificațiile publicate de NVIDIA enumeră 130 TB/s de lățime de bandă NVLink, 20 TB de memorie GPU cu până la 576 TB/s de lățime de bandă, 37 TB de memorie rapidă și 2.592 de nuclee CPU Arm Neoverse V2. Fiecare GPU din sistem primește 800 Gb/s de conectivitate de rețea printr-un modul IO ConnectX‑8 SuperNIC, funcționând fie cu platformele de rețea Quantum‑X800 InfiniBand, fie cu Spectrum‑X Ethernet.
NVIDIA susține că fabricile AI construite pe GB300 NVL72 oferă o creștere de până la 50 de ori a performanței totale a producției de AI comparativ cu platformele bazate pe Hopper. Compania atribuie această cifră unei îmbunătățiri declarate de 10 ori a răspunsului utilizatorului, măsurată în tokeni pe secundă per utilizator, și unei îmbunătățiri de 5 ori a debitului pe megawatt în raport cu Hopper, și notează că aceste valori reprezintă performanțe proiectate, supuse modificărilor.
Serviciul Managed Inference și istoric
Elementul de servire în producție al acordului rulează pe Crusoe Managed Inference, pe care compania l-a pus la dispoziție în mod general pe 20 noiembrie 2025, pentru sarcini de inferență în producție pe Crusoe Cloud. Serviciul este alimentat de motorul de inferență proprietar al Crusoe, construit în jurul MemoryAlloy, un cache de tip cheie-valoare la nivel de cluster care elimină prefilling-urile duplicate permițând GPU-urilor să recupereze cache-urile de prefix de la noduri locale și îndepărtate. Crusoe afirmă că motorul oferă un timp până la primul token de până la 9,9 ori mai rapid și un debit de 5 ori mai mare, comparativ cu vLLM pentru modelul Llama‑3.3‑70B într-o implementare pe patru noduri.
Crusoe oferă serviciul în trei opțiuni de implementare, conform paginii de produs Managed Inference. Serverless Inference oferă consum bazat pe utilizare a modelelor deschise printr-un API complet gestionat, destinat sarcinilor de lucru în stadiu incipient, traficului de volum redus și experimentării rapide. Implementările Self-Serve, pe care pagina le declară acum disponibile în mod general, rulează modele optimizate pentru debit sau răspuns, inclusiv modele personalizate cu Serverless Fine-Tuning de la Crusoe. Implementările Tailored asociază clienții cu echipa Crusoe pentru un punct final dedicat, benchmarkat, o opțiune pe care pagina o recomandă pentru modele proprietare.
Dezvoltatorii accesează serviciul prin Crusoe Intelligence Foundry, un hub în care pot genera chei API, utiliza puncte finale gestionate ajustate pentru fiecare model, monitoriza metrici de performanță și activa debitul provizionat pentru implementări la scară de producție. Hub-ul de modele al Crusoe enumeră modele deschise preconfigurate din laboratoare precum DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba și NVIDIA, cu numărul de parametri și lungimile de context specificate pentru fiecare model.












