Partnerschaften

Thinking Machines Lab unterschreibt Jahresvertrag über $65M für Crusoe Cloud Inference

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Crusoe und Thinking Machines Lab kündigte eine jährliche Vereinbarung über $65 Millionen am 23. September 2026, um Inferenz für die offenen Modelle des Labors auf Crusoe Cloud zu betreiben, wobei Produktions‑Workloads über ein dediziertes Deployment von NVIDIA‑HGX‑B200‑Systemen durch Crusoe Managed Inference bereitgestellt werden.

Die Ankündigung, datiert in San Francisco, besagt, dass Thinking Machines Lab eine Reihe von Produktions‑Workloads, darunter seine Inkling‑Modelle, GLM 5.2 und 5.3 sowie eigene feinabgestimmte Varianten, auf einem dedizierten Tailored Deployment von NVIDIA‑HGX‑B200‑Systemen, die mit NVIDIA‑Quantum‑2‑InfiniBand‑Netzwerk verbunden sind, bereitstellen wird. Crusoe charakterisierte das Deployment als für Hochdurchsatz und kosteneffiziente Bereitstellung im großen Maßstab ausgelegt.

Crusoe wird den Cluster direkt als Tailored Deployment betreiben und unterstützen, das in der Mitteilung als dedizierter, benchmarkter, SLA‑unterstützter Endpunkt beschrieben wird, der Thinking Machines Lab Preis‑Leistung und Spielraum für Skalierung bietet, ohne dass das Labor seine eigene Inferenz‑Stack verwalten muss. In der Mitteilung bezeichnet sich Crusoe als der erste vertikal integrierte KI‑Infrastruktur‑Anbieter der Branche.

Optionen für Managed Inference und die MemoryAlloy‑Engine

Auf Crusoe’s Managed Inference-Produktseite präsentiert das Unternehmen Tailored Deployments als höchste Optimierungsstufe: Der Kunde liefert das Modell und definiert die Anforderungen, während Crusoe den Rest übernimmt, mit einem dedizierten, benchmarkten Endpunkt, der für proprietäre Modelle, maßgeschneiderte Inferenz‑Optimierung und SLA‑unterstützte Leistung ausgelegt ist.

Die Seite beschreibt außerdem Serverless Inference, nutzungsbasierte Nutzung von Open‑Source‑Modellen über eine vollständig verwaltete API in Crusoe Intelligence Foundry, sowie Self‑Serve Deployments, die jetzt allgemein verfügbar sind und Modelle in der Foundry mit für Durchsatz oder Reaktionszeit optimierter Inferenz ausführen, einschließlich Modelle, die mit der Serverless‑Fine‑Tuning‑Funktion des Unternehmens angepasst wurden. Die Foundry selbst wird als Entwicklerplattform zum Entdecken von Modellen, Erzeugen von API‑Schlüsseln, Überwachen von Leistungskennzahlen und Bereitstellen verwalteter Endpunkte präsentiert.

Crusoe gibt an, dass seine Inferenz‑Engine von MemoryAlloy angetrieben wird, einem cluster‑nativen Speicher‑Fabric, das über Knoten hinweg persistiert und intelligentes Routing ermöglicht, um redundante Pre‑Fill‑Berechnungen zu eliminieren. Das Unternehmen berichtet von bis zu 9,9‑fach schnellerer Time‑to‑First‑Token‑Zeit und 5‑fach höherem Durchsatz durch spekulatives Decoding und dynamisches Batching, Messwerte, die gegen vLLM beim Servieren des Llama‑3.3‑70B‑Modells in einem Vier‑Node‑Deployment benchmarked wurden.

Die Inkling‑ und GLM‑Modelle

Die im Vertrag genannten Workloads umfassen die eigene Inkling‑Familie des Labors. Thinking Machines Lab veröffentlichte Inkling am 15. Juli 2026, und beschreibt es als Open‑Weights Mixture‑of‑Experts‑Transformer mit insgesamt 975 Mrd. Parametern und 41 Mrd. aktiven Parametern, der ein Kontextfenster von bis zu 1 Mio. Tokens unterstützt. Laut dem Labor wurde Inkling auf 45 Billionen Tokens aus Text, Bildern, Audio und Video vortrainiert, und das Projekt war der erste größere Traininglauf des Labors, durchgeführt auf NVIDIA‑GB300‑NVL72‑Systemen.

Neben Inkling stellte das Labor Inkling‑Small vor, ein leichteres Mixture‑of‑Experts‑Modell mit 276 Mrd. Parametern und 12 Mrd. aktiven Parametern, das ein anderes Leistungs‑ und Latenz‑Trade‑off bietet. Inkling‑Vollgewichte werden auf Hugging Face veröffentlicht, sowohl als ursprünglicher Checkpoint als auch als NVFP4‑Checkpoint für effiziente Inferenz auf NVIDIA‑Blackwell‑Systemen, und das Modell ist für Fine‑Tuning auf Tinker, der Modell‑Anpassungsplattform des Labors, mit Kontextlängenoptionen von 64 K und 256 K verfügbar.

Der Vertrag platziert außerdem GLM 5.2 und 5.3 unter den Produktions‑Workloads des Labors im Service. Das Managed‑Inference‑Modell‑Hub von Crusoe listet Z.ai’s GLM 5.3 mit 753 Mrd. Parametern und einem Kontext von 1 000 000 Tokens sowie GLM 5.3 Flash mit 320 Mrd. Parametern, beide für Serverless Inference verfügbar.

Erklärungen der Führungskräfte und geplante Expansion

“Crusoe Managed Inference hat uns schnell von der Evaluierung in die Produktion gebracht und die Standards erfüllt, die wir an unsere eigenen Systeme anlegen, und uns die Skalierung sowie Wirtschaftlichkeit gegeben, um in die Forschung zu reinvestieren, die dem Kern unserer Arbeit zugrunde liegt,” sagte Myle Ott, ML‑Infra‑Leiter bei Thinking Machines Lab.

Erwan Menard, SVP Product Management für Crusoe Cloud, sagte, dass Thinking Machines Lab ein hochentwickeltes Engineering‑Team habe, das von Partnern erwartet, dass sie mit seiner hohen Messlatte Schritt halten, während es wächst. Er erklärte, dass Crusoe Managed Inference entwickelt habe, um kosteneffiziente, zuverlässige Infrastruktur, Inferenz und Werkzeuge für den Modell‑Lebenszyklus als Service bereitzustellen, damit Unternehmen ihre ausgewählten Modelle in der Produktion im großen Maßstab ausführen können.

Die Unternehmen sagten, sie planen zudem, in Batch‑Inference für groß angelegte synthetische Datengenerierung zu expandieren, was die Mitteilung als Umwandlung der Inferenz in ein Forschung‑Flywheel darstellt. Crusoe erklärte, dass Thinking Machines Lab einer Kundenliste beitritt, die Crusoe Managed Inference in weniger als einem Jahr seit dem Start auf über $100 Millionen vertraglich gebundenes ARR gebracht hat.

Theo Nash ist ein von KI generierter Spezialist bei Unite.AI, der sich mit KI-Infrastruktur, Rechenleistung und den Hardware-Systemen befasst, die die moderne künstliche Intelligenz antreiben. Seine Arbeit konzentriert sich auf die technischen Grundlagen hinter großen KI-Workloads, einschließlich Rechenzentren, Beschleunigern, Netzwerken und den Software-Stacks, die sie verbinden.
Mit einer analytischen und ingenieursteuernden Perspektive untersucht Theo, wie Fortschritte in GPUs, benutzerdefiniertem Silizium, Speicherarchitekturen und verteilten Systemen neue Generationen von KI-Modellen ermöglichen. Er achtet besonders auf Leistungsabstriche, Energieeffizienz, Skalierbarkeit und die praktischen Einschränkungen, die die realen Einsatzmöglichkeiten von KI-Infrastruktur prägen.
Artikel, die von Theo Nash verfasst werden, sind von KI generiert und von Unite.AIs Redaktionsteam überprüft, um technische Genauigkeit, Klarheit und verantwortungsvolle Berichterstattung über die sich schnell entwickelnde KI-Rechenlandschaft sicherzustellen.