Partnerschappen

Thinking Machines Lab tekent $65M jaarlijkse overeenkomst voor Crusoe Cloud Inference

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Crusoe en Thinking Machines Lab kondigde een jaarlijkse overeenkomst van $65 miljoen aan op 23 september 2026, om inferentie voor de open modellen van het laboratorium op Crusoe Cloud mogelijk te maken, met productie‑workloads die worden bediend via een dedicated inzet van NVIDIA HGX B200‑systemen via Crusoe Managed Inference.

De aankondiging, gedateerd San Francisco, stelt dat Thinking Machines Lab een reeks productie‑workloads zal bedienen, waaronder zijn Inkling‑modellen, GLM 5.2 en 5.3, en eigen fijn‑afgestemde varianten, op een dedicated Tailored Deployment van NVIDIA HGX B200‑systemen verbonden met NVIDIA Quantum‑2 InfiniBand‑netwerk. Crusoe karakteriseerde de inzet als ontworpen voor hoge doorvoersnelheid en kostenefficiënte service op schaal.

Crusoe zal de cluster rechtstreeks uitvoeren en ondersteunen als een Tailored Deployment, die in de release wordt omschreven als een dedicated, gebenchmarkte, SLA‑ondersteunde endpoint bedoeld om Thinking Machines Lab prijs‑prestaties en ruimte voor schaalvergroting te bieden zonder een eigen inferentie‑stack te beheren. In de release beschrijft Crusoe zichzelf als de eerste volledig geïntegreerde AI‑infrastructuurprovider in de sector.

Beheerde Inference‑opties en de MemoryAlloy‑engine

Op Crusoe’s Managed Inference productpagina presenteert het bedrijf Tailored Deployments als het hoogste optimalisatieniveau: de klant levert het model en definieert de eisen, terwijl Crusoe de rest afhandelt, met een dedicated, gebenchmarkte endpoint gericht op propriëtaire modellen, maatwerk‑inference‑optimalisatie en SLA‑ondersteunde prestaties.

De pagina beschrijft ook Serverless Inference, gebruiksgebaseerde consumptie van open‑source modellen via een volledig beheerde API in Crusoe Intelligence Foundry, en Self‑Serve Deployments, nu algemeen beschikbaar, die modellen in de Foundry uitvoeren met inference geoptimaliseerd voor doorvoer of responsiviteit, inclusief modellen aangepast met de Serverless Fine‑Tuning‑functie van het bedrijf. De Foundry zelf wordt gepresenteerd als een ontwikkelaarsplatform voor het ontdekken van modellen, het genereren van API‑sleutels, het monitoren van prestatiestatistieken en het inzetten van beheerde endpoints.

Crusoe meldt dat zijn inference‑engine wordt aangedreven door MemoryAlloy, een cluster‑native geheugen‑fabric die over knooppunten heen persistent is en intelligente routering mogelijk maakt om overbodige prefill‑berekeningen te elimineren. Het bedrijf rapporteert tot 9,9× snellere time‑to‑first‑token en 5× hogere doorvoer met speculatieve decodering en dynamische batching, cijfers die zijn gebenchmarkd tegen vLLM die het Llama‑3.3‑70B‑model bedient in een vier‑knooppunt‑deployment.

De Inkling‑ en GLM‑modellen

De in de overeenkomst genoemde workloads omvatten de eigen Inkling‑familie van het laboratorium. Thinking Machines Lab bracht Inkling uit op 15 juli 2026, en beschrijft het als een open‑weights Mixture‑of‑Experts‑transformer met 975 B totale parameters en 41 B actieve parameters, die een context‑venster van tot 1 M tokens ondersteunt. Volgens het laboratorium is Inkling voorgetraind op 45 triljoen tokens van tekst, afbeeldingen, audio en video, en was dit de eerste grote training van het laboratorium, uitgevoerd op NVIDIA GB300 NVL72‑systemen.

Naast Inkling toonde het laboratorium Inkling‑Small, een lichtere 276 B‑parameter Mixture‑of‑Experts‑model met 12 B actieve parameters dat een andere prestatie‑ en latentie‑afweging heeft. De volledige gewichten van Inkling worden gepubliceerd op Hugging Face, zowel als de originele checkpoint als een NVFP4‑checkpoint voor efficiënte inference op NVIDIA Blackwell‑systemen, en het model is beschikbaar voor fine‑tuning op Tinker, het model‑aanpassingsplatform van het laboratorium, met opties voor contextlengte van 64 K en 256 K.

De overeenkomst plaatst ook GLM 5.2 en 5.3 onder de productie‑workloads van het laboratorium op de dienst. Crusoe’s Managed Inference modelhub vermeldt Z.ai’s GLM 5.3 met 753 B parameters en een context van 1 000 000 tokens, en GLM 5.3 Flash met 320 B parameters, beide beschikbaar voor Serverless Inference.

Executive‑verklaringen en geplande uitbreiding

“Crusoe Managed Inference bracht ons snel van evaluatie naar productie en voldeed aan de normen waaraan wij onze eigen systemen meten, waardoor we de schaal en economie kregen om opnieuw te investeren in het onderzoek dat de kern van ons werk vormt,” zei Myle Ott, ML Infra Lead bij Thinking Machines Lab.

Erwan Menard, SVP of Product Management voor Crusoe Cloud, zei dat Thinking Machines Lab een geavanceerd engineeringteam heeft dat van partners verwacht dat ze aan de hoge norm voldoen naarmate het groeit. Hij verklaarde dat Crusoe Managed Inference heeft gebouwd om kostenefficiënte, betrouwbare infrastructuur, inference en model‑levenscyclus‑tools als dienst te leveren, zodat bedrijven hun gekozen modellen op schaal in productie kunnen draaien.

De bedrijven zeiden dat ze ook willen uitbreiden naar batch‑inference voor grootschalige synthetische datageneratie, wat de release beschrijft als het omzetten van inference in een vliegwiel voor onderzoek. Crusoe meldde dat Thinking Machines Lab zich aansluit bij een klantenlijst die Crusoe Managed Inference naar meer dan $100 miljoen aan gecontracteerde ARR heeft gebracht minder dan een jaar na de lancering.

Theo Nash is een AI-gegenereerde specialist bij Unite.AI, waar hij zich richt op AI-infrastructuur, compute en de hardware-systemen die moderne kunstmatige intelligentie aandrijven. Zijn werk richt zich op de technische fundamenten achter grote AI-werklasten, waaronder datacenters, accelerators, netwerken en de software-stacks die deze verbinden.
Met een analytische en technisch gedreven perspectief onderzoekt Theo hoe vooruitgang in GPUs, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI-modellen mogelijk maken. Hij let vooral op prestatie-afwegingen, energiedoeltreffendheid, schaalbaarheid en de praktische beperkingen die de inzet van AI-infrastructuur in de praktijk bepalen.
Artikelen geschreven door Theo Nash zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om technische nauwkeurigheid, duidelijkheid en verantwoorde dekking van het snel evoluerende AI-computelandschap te garanderen.