Partenariats
Crusoe signe un accord pluriannuel pour alimenter la formation et l’inférence de Perplexity

Crusoe le 15 septembre 2026, a annoncé un partenariat pluriannuel avec Perplexity dans le cadre duquel Perplexity exécutera l’intégralité du cycle de vie de ses modèles sur Crusoe Cloud, entraînant des modèles de pointe sur des clusters dédiés NVIDIA GB300 NVL72 et les déployant en production via le service Managed Inference de Crusoe.
L’annonce, datée de San Francisco, engage également Crusoe à adopter Perplexity Enterprise Pro et Max pour ses 1 800 employés. Selon le communiqué, le déploiement vise à fournir au personnel une recherche web et interne de connaissances, une recherche à étapes multiples, une analyse de données et un accès aux modèles d’IA de pointe.
Le communiqué décrit les produits de Perplexity comme fonctionnant en temps réel pour des millions d’utilisateurs, un environnement où la latence et le débit d’inférence sont le produit lui‑même plutôt que de simples repères théoriques. Crusoe a déclaré que son service Managed Inference est conçu pour une inférence de niveau production, alimentée par des optimisations propriétaires et conçue pour la performance et le coût sur les modèles populaires, et que Crusoe Cloud offre la profondeur opérationnelle et l’échelle nécessaires pour accompagner la croissance de Perplexity.
Déclarations des dirigeants
Le cofondateur et PDG de Crusoe, Chase Lochmiller, a déclaré que les entreprises d’IA les plus dynamiques ont besoin d’une infrastructure qui suit le rythme tout au long du cycle de vie du modèle et qui évolue avec elles à mesure qu’elles grandissent. « Perplexity construit l’avenir de la façon dont les gens trouvent des réponses, et Crusoe est un partenaire clé pour rendre cela possible, du premier électron au dernier jeton », a déclaré Lochmiller.
Le cofondateur et PDG de Perplexity, Aravind Srinivas, a indiqué que faire fonctionner l’IA à l’échelle de Perplexity signifie que chaque milliseconde de latence est ressentie par les utilisateurs. Il a décrit Crusoe comme étant conçu autour de cette contrainte, le qualifiant d’inférence à haut débit et à faible latence, soutenue par du matériel de nouvelle génération.
Dion Harris, directeur principal des solutions HPC et d’infrastructure IA chez NVIDIA, a déclaré que l’IA moderne nécessite une architecture informatique unifiée, de la recherche au déploiement. Alimenté par NVIDIA GB300 NVL72 et NVIDIA InfiniBand, Harris a affirmé que Crusoe Cloud permet à Perplexity d’entraîner, d’ajuster finement et de déployer des modèles de pointe en production avec la rapidité et l’efficacité exigées par l’IA agentique.
La plateforme GB300 NVL72
Les clusters d’entraînement dédiés mentionnés dans l’accord fonctionnent sur le GB300 NVL72 de NVIDIA, que NVIDIA décrit comme un système entièrement refroidi par liquide, à l’échelle d’un rack, intégrant 72 GPU Blackwell Ultra et 36 CPU Grace basés sur Arm. Les spécifications publiées par NVIDIA indiquent une bande passante NVLink de 130 TB/s, 20 TB de mémoire GPU avec jusqu’à 576 TB/s de bande passante, 37 TB de mémoire rapide et 2 592 cœurs CPU Arm Neoverse V2. Chaque GPU du système bénéficie d’une connectivité réseau de 800 Gb/s via un module d’E/S ConnectX‑8 SuperNIC, fonctionnant avec les plateformes réseau Quantum‑X800 InfiniBand ou Spectrum‑X Ethernet.
NVIDIA affirme que les usines d’IA construites sur le GB300 NVL72 offrent jusqu’à 50 fois plus de performance globale de production d’IA comparées aux plateformes basées sur Hopper. L’entreprise attribue ce chiffre à une amélioration de 10 fois de la réactivité des utilisateurs, mesurée en jetons par seconde et par utilisateur, et à une amélioration de 5 fois du débit par mégawatt par rapport à Hopper, tout en précisant que ces chiffres sont des performances projetées susceptibles d’évoluer.
Service d’inférence gérée et historique
L’élément de production du contrat fonctionne sur Crusoe Managed Inference, que l’entreprise a rendu généralement disponible le 20 novembre 2025, pour les charges de travail d’inférence en production sur Crusoe Cloud. Le service est alimenté par le moteur d’inférence propriétaire de Crusoe, construit autour de MemoryAlloy, un cache clé‑valeur à l’échelle du cluster qui élimine les préremplissages en double en permettant aux GPU de récupérer les caches de préfixes depuis des nœuds locaux et distants. Crusoe indique que le moteur offre jusqu’à 9.9x plus rapide le temps jusqu’au premier jeton et 5x un débit supérieur, comparé à vLLM pour le modèle Llama‑3.3‑70B dans un déploiement à quatre nœuds.
Crusoe propose le service sous trois options de déploiement, selon sa page produit Managed Inference. Serverless Inference offre une consommation à l’usage de modèles ouverts via une API entièrement gérée, destinée aux charges de travail en phase initiale, au trafic à faible volume et à l’expérimentation rapide. Les déploiements en libre-service, que la page indique désormais généralement disponibles, exécutent des modèles optimisés pour le débit ou la réactivité, y compris des modèles personnalisés avec le Serverless Fine‑Tuning de Crusoe. Les déploiements sur mesure associent les clients à l’équipe de Crusoe pour un point de terminaison dédié et étalonné, une option que la page propose pour les modèles propriétaires.
Les développeurs accèdent au service via Crusoe Intelligence Foundry, un hub où ils peuvent générer des clés API, utiliser des points de terminaison gérés adaptés à chaque modèle, surveiller les indicateurs de performance et activer le débit provisionné pour des déploiements à l’échelle de la production. Le hub de modèles de Crusoe répertorie des modèles ouverts préconfigurés provenant de laboratoires tels que DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba et NVIDIA, avec les nombres de paramètres et les longueurs de contexte indiqués pour chaque modèle.












