Partenariats
Thinking Machines Lab signe un accord annuel de $65M pour Crusoe Cloud Inference

Crusoe et Thinking Machines Lab a annoncé un accord annuel de $65 million le 23 septembre 2026, pour alimenter l’inférence des modèles ouverts du laboratoire sur Crusoe Cloud, avec les charges de travail de production servies sur un déploiement dédié de systèmes NVIDIA HGX B200 via Crusoe Managed Inference.
L’annonce, datée de San Francisco, indique que Thinking Machines Lab proposera une gamme de charges de travail de production, y compris ses modèles Inkling, GLM 5.2 et 5.3, ainsi que ses propres variantes affinées, sur un déploiement dédié Tailored Deployment de systèmes NVIDIA HGX B200 connectés au réseau NVIDIA Quantum‑2 InfiniBand. Crusoe a décrit ce déploiement comme étant conçu pour un service à haut débit et rentable à grande échelle.
Crusoe exploitera et prendra en charge le cluster directement en tant que Tailored Deployment, que le communiqué décrit comme un point d’accès dédié, étalonné et garanti par un SLA, destiné à offrir à Thinking Machines Lab un rapport prix‑performance et une marge de montée en charge sans devoir gérer sa propre pile d’inférence. Dans le communiqué, Crusoe se décrit comme le premier fournisseur d’infrastructure IA verticalement intégré de l’industrie.
Options d’inférence gérée et moteur MemoryAlloy
Sur page produit Managed Inference de Crusoe, l’entreprise présente les Tailored Deployments comme son niveau d’optimisation le plus élevé : le client fournit le modèle et définit les exigences tandis que Crusoe s’occupe du reste, avec un point d’accès dédié et étalonné destiné aux modèles propriétaires, à l’optimisation d’inférence sur mesure et à des performances garanties par un SLA.
La page détaille également Serverless Inference, la consommation à l’usage de modèles open‑source via une API entièrement gérée dans Crusoe Intelligence Foundry, ainsi que Self‑Serve Deployments, désormais généralement disponibles, qui exécutent les modèles dans le Foundry avec une inférence optimisée pour le débit ou la réactivité, y compris les modèles personnalisés grâce à la fonction Serverless Fine‑Tuning de l’entreprise. Le Foundry est présenté comme une plateforme développeur permettant de découvrir des modèles, de générer des clés API, de suivre les indicateurs de performance et de déployer des points d’accès gérés.
Crusoe indique que son moteur d’inférence est alimenté par MemoryAlloy, un tissu mémoire natif du cluster qui persiste entre les nœuds et permet un routage intelligent afin d’éliminer les calculs de préremplissage redondants. L’entreprise rapporte un temps jusqu’à 9,9 fois plus rapide jusqu’au premier jeton et un débit 5 fois supérieur grâce au décodage spéculatif et au regroupement dynamique, des chiffres comparés à vLLM servant le modèle Llama‑3.3‑70B dans un déploiement à quatre nœuds.
Les modèles Inkling et GLM
Les charges de travail nommées dans l’accord comprennent la propre famille Inkling du laboratoire. Thinking Machines Lab a publié Inkling le 15 juillet 2026, le décrivant comme un transformeur Mixture‑of‑Experts à poids ouverts avec 975 milliards de paramètres au total et 41 milliards de paramètres actifs, prenant en charge une fenêtre de contexte allant jusqu’à 1 million de jetons. Selon le laboratoire, Inkling a été pré‑entraîné sur 45 trillions de jetons couvrant texte, images, audio et vidéo, et cet effort constituait la première grande session d’entraînement du laboratoire, réalisée sur des systèmes NVIDIA GB300 NVL72.
Parallèlement à Inkling, le laboratoire a présenté Inkling‑Small, un modèle Mixture‑of‑Experts plus léger de 276 milliards de paramètres avec 12 milliards de paramètres actifs, offrant un compromis différent entre performance et latence. Les poids complets d’Inkling sont publiés sur Hugging Face, à la fois sous forme de checkpoint original et de checkpoint NVFP4 pour une inférence efficace sur les systèmes NVIDIA Blackwell, et le modèle est disponible pour le fine‑tuning sur Tinker, la plateforme de personnalisation de modèles du laboratoire, avec des options de longueur de contexte de 64 K et 256 K.
Le contrat place également GLM 5.2 et GLM 5.3 parmi les charges de travail de production du laboratoire sur le service. Le hub de modèles Managed Inference de Crusoe répertorie le GLM 5.3 de Z.ai avec 753 milliards de paramètres et une fenêtre de contexte de 1,000,000‑token, ainsi que le GLM 5.3 Flash avec 320 milliards de paramètres, tous deux disponibles pour Serverless Inference.
Déclarations exécutives et expansion prévue
« Crusoe Managed Inference nous a fait passer de l’évaluation à la production rapidement et a respecté les normes que nous appliquons à nos propres systèmes, nous offrant l’échelle et l’économie nécessaires pour réinvestir dans la recherche au cœur de notre activité », a déclaré Myle Ott, responsable ML Infra chez Thinking Machines Lab.
Erwan Menard, vice‑président senior de la gestion produit pour Crusoe Cloud, a indiqué que Thinking Machines Lab possède une équipe d’ingénierie sophistiquée qui attend de ses partenaires qu’ils atteignent son niveau d’exigence élevé à mesure qu’elle se développe. Il a affirmé que Crusoe a créé Managed Inference afin de fournir une infrastructure, une inférence et des outils de cycle de vie de modèles rentables et fiables en tant que service, permettant aux entreprises d’exécuter leurs modèles choisis en production à grande échelle.
Les entreprises ont également indiqué qu’elles envisageaient de s’étendre à l’inférence par lots pour la génération de données synthétiques à grande échelle, ce que le communiqué décrit comme la transformation de l’inférence en un moteur de recherche. Crusoe a déclaré que Thinking Machines Lab rejoint une liste de clients qui a porté Crusoe Managed Inference à plus de $100 million de ARR contractuel moins d’un an après son lancement.












