Partnerskap
Thinking Machines Lab skriver under ett $65M årsavtal för Crusoe Cloud Inference

Crusoe och Thinking Machines Lab annonserade ett $65 miljoner årsavtal den 23 september 2026, för att driva inferens för laboratoriets öppna modeller på Crusoe Cloud, med produktionsarbetsbelastningar som körs på en dedikerad utrullning av NVIDIA HGX B200‑system via Crusoe Managed Inference.
Meddelandet, daterat San Francisco, anger att Thinking Machines Lab kommer att tillhandahålla ett antal produktionsarbetsbelastningar, inklusive dess Inkling‑modeller, GLM 5.2 och 5.3 samt egna finjusterade varianter, på en dedikerad Tailored Deployment av NVIDIA HGX B200‑system anslutna med NVIDIA Quantum‑2 InfiniBand‑nätverk. Crusoe beskrev utrullningen som konstruerad för hög genomströmning och kostnadseffektiv service i stor skala.
Crusoe kommer att driva och stödja klustret direkt som en Tailored Deployment, vilket pressmeddelandet beskriver som en dedikerad, benchmarkad, SLA‑stödd slutpunkt avsedd att ge Thinking Machines Lab pris‑prestanda och marginal för att skala utan att behöva hantera sin egen inferensstack. I meddelandet beskriver Crusoe sig själva som branschens första vertikalt integrerade leverantör av AI‑infrastruktur.
Alternativ för Managed Inference och MemoryAlloy‑motorn
På Crusoe Managed Inference‑produktsida presenterar företaget Tailored Deployments som sin högsta optimeringsnivå: kunden levererar modellen och definierar kraven medan Crusoe sköter resten, med en dedikerad, benchmarkad slutpunkt avsedd för proprietära modeller, skräddarsydd inferensoptimering och SLA‑stödd prestanda.
Sidan beskriver också Serverless Inference, användningsbaserad konsumtion av öppen källkod-modeller via ett fullständigt hanterat API i Crusoe Intelligence Foundry, samt Self‑Serve Deployments, som nu är allmänt tillgängliga och kör modeller i Foundry med inferens optimerad för genomströmning eller svarstid, inklusive modeller anpassade med företagets Serverless Fine‑Tuning‑funktion. Foundry själv presenteras som en utvecklarplattform för att upptäcka modeller, generera API‑nycklar, övervaka prestandamått och distribuera hanterade slutpunkter.
Crusoe säger att deras inferensmotor drivs av MemoryAlloy, ett kluster‑inbyggt minnesfabric som beständigt sträcker sig över noder och möjliggör intelligent routing för att eliminera redundanta förfyllningsberäkningar. Företaget rapporterar upp till 9,9 × snabbare tid till första token och 5 × högre genomströmning med spekulativ avkodning och dynamisk batchning, siffror som benchmarkades mot vLLM som servade Llama‑3.3‑70B‑modellen i en fyrnodig utrullning.
Inkling‑ och GLM‑modellerna
Avtalets namngivna arbetsbelastningar inkluderar laboratoriets egna Inkling‑familj. Thinking Machines Lab släppte Inkling den 15 juli 2026, och beskriver den som en öppen‑vikt Mixture‑of‑Experts‑transformer med 975 B totala parametrar och 41 B aktiva parametrar, som stödjer ett kontextfönster på upp till 1 M token. Enligt laboratoriet förtränades Inkling på 45 triljon token som spänner över text, bilder, ljud och video, och insatsen var laboratoriets första stora träningskörning, genomförd på NVIDIA GB300 NVL72‑system.
Tillsammans med Inkling presenterade laboratoriet Inkling‑Small, en lättare 276 B‑parameter Mixture‑of‑Experts‑modell med 12 B aktiva parametrar som har en annan prestanda‑ och latensavvägning. Inkling‑s fulla vikter publiceras på Hugging Face, både som den ursprungliga checkpointen och som en NVFP4‑checkpoint för effektiv inferens på NVIDIA Blackwell‑system, och modellen är tillgänglig för fin‑justering på Tinker, laboratoriets plattform för modell‑anpassning, med kontextlängdsalternativ på 64 K och 256 K.
Avtalet placerar också GLM 5.2 och 5.3 bland laboratoriets produktionsarbetsbelastningar på tjänsten. Crusoe’s Managed Inference modellhub listar Z.ai:s GLM 5.3 med 753 B parametrar och ett kontextfönster på 1 000 000 token samt GLM 5.3 Flash med 320 B parametrar, båda tillgängliga för Serverless Inference.
Ledande uttalanden och planerad expansion
”Crusoe Managed Inference tog oss snabbt från utvärdering till produktion och levde upp till de standarder vi ställer på våra egna system, vilket gav oss skala och ekonomi för att återinvestera i forskningen som ligger i kärnan av vårt arbete,” sade Myle Ott, ML Infra Lead på Thinking Machines Lab.
Erwan Menard, SVP för produktledning för Crusoe Cloud, sade att Thinking Machines Lab har ett sofistikerat ingenjörsteam som förväntar sig att partners uppfyller deras höga krav i takt med att de växer. Han förklarade att Crusoe byggde Managed Inference för att leverera kostnadseffektiv, pålitlig infrastruktur, inferens och verktyg för modellens livscykel som en tjänst så att företag kan köra sina valda modeller i produktion i stor skala.
Företagen sade att de också planerar att expandera till batch‑inferens för storskalig syntetisk datagenerering, vilket pressmeddelandet beskriver som att omvandla inferens till en drivkraft för forskning. Crusoe uppgav att Thinking Machines Lab ansluter sig till en kundlista som har drivit Crusoe Managed Inference över $100 miljoner i kontrakterad ARR på mindre än ett år från lanseringen.












