Partnerskap

Thinking Machines Lab skriver under ett $65M årsavtal för Crusoe Cloud Inference

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Crusoe och Thinking Machines Lab annonserade ett $65 miljoner årsavtal den 23 september 2026, för att driva inferens för laboratoriets öppna modeller på Crusoe Cloud, med produktionsarbetsbelastningar som körs på en dedikerad utrullning av NVIDIA HGX B200‑system via Crusoe Managed Inference.

Meddelandet, daterat San Francisco, anger att Thinking Machines Lab kommer att tillhandahålla ett antal produktionsarbetsbelastningar, inklusive dess Inkling‑modeller, GLM 5.2 och 5.3 samt egna finjusterade varianter, på en dedikerad Tailored Deployment av NVIDIA HGX B200‑system anslutna med NVIDIA Quantum‑2 InfiniBand‑nätverk. Crusoe beskrev utrullningen som konstruerad för hög genomströmning och kostnadseffektiv service i stor skala.

Crusoe kommer att driva och stödja klustret direkt som en Tailored Deployment, vilket pressmeddelandet beskriver som en dedikerad, benchmarkad, SLA‑stödd slutpunkt avsedd att ge Thinking Machines Lab pris‑prestanda och marginal för att skala utan att behöva hantera sin egen inferensstack. I meddelandet beskriver Crusoe sig själva som branschens första vertikalt integrerade leverantör av AI‑infrastruktur.

Alternativ för Managed Inference och MemoryAlloy‑motorn

Crusoe Managed Inference‑produktsida presenterar företaget Tailored Deployments som sin högsta optimeringsnivå: kunden levererar modellen och definierar kraven medan Crusoe sköter resten, med en dedikerad, benchmarkad slutpunkt avsedd för proprietära modeller, skräddarsydd inferensoptimering och SLA‑stödd prestanda.

Sidan beskriver också Serverless Inference, användningsbaserad konsumtion av öppen källkod-modeller via ett fullständigt hanterat API i Crusoe Intelligence Foundry, samt Self‑Serve Deployments, som nu är allmänt tillgängliga och kör modeller i Foundry med inferens optimerad för genomströmning eller svarstid, inklusive modeller anpassade med företagets Serverless Fine‑Tuning‑funktion. Foundry själv presenteras som en utvecklarplattform för att upptäcka modeller, generera API‑nycklar, övervaka prestandamått och distribuera hanterade slutpunkter.

Crusoe säger att deras inferensmotor drivs av MemoryAlloy, ett kluster‑inbyggt minnesfabric som beständigt sträcker sig över noder och möjliggör intelligent routing för att eliminera redundanta förfyllningsberäkningar. Företaget rapporterar upp till 9,9 × snabbare tid till första token och 5 × högre genomströmning med spekulativ avkodning och dynamisk batchning, siffror som benchmarkades mot vLLM som servade Llama‑3.3‑70B‑modellen i en fyrnodig utrullning.

Inkling‑ och GLM‑modellerna

Avtalets namngivna arbetsbelastningar inkluderar laboratoriets egna Inkling‑familj. Thinking Machines Lab släppte Inkling den 15 juli 2026, och beskriver den som en öppen‑vikt Mixture‑of‑Experts‑transformer med 975 B totala parametrar och 41 B aktiva parametrar, som stödjer ett kontextfönster på upp till 1 M token. Enligt laboratoriet förtränades Inkling på 45 triljon token som spänner över text, bilder, ljud och video, och insatsen var laboratoriets första stora träningskörning, genomförd på NVIDIA GB300 NVL72‑system.

Tillsammans med Inkling presenterade laboratoriet Inkling‑Small, en lättare 276 B‑parameter Mixture‑of‑Experts‑modell med 12 B aktiva parametrar som har en annan prestanda‑ och latensavvägning. Inkling‑s fulla vikter publiceras på Hugging Face, både som den ursprungliga checkpointen och som en NVFP4‑checkpoint för effektiv inferens på NVIDIA Blackwell‑system, och modellen är tillgänglig för fin‑justering på Tinker, laboratoriets plattform för modell‑anpassning, med kontextlängdsalternativ på 64 K och 256 K.

Avtalet placerar också GLM 5.2 och 5.3 bland laboratoriets produktionsarbetsbelastningar på tjänsten. Crusoe’s Managed Inference modellhub listar Z.ai:s GLM 5.3 med 753 B parametrar och ett kontextfönster på 1 000 000 token samt GLM 5.3 Flash med 320 B parametrar, båda tillgängliga för Serverless Inference.

Ledande uttalanden och planerad expansion

”Crusoe Managed Inference tog oss snabbt från utvärdering till produktion och levde upp till de standarder vi ställer på våra egna system, vilket gav oss skala och ekonomi för att återinvestera i forskningen som ligger i kärnan av vårt arbete,” sade Myle Ott, ML Infra Lead på Thinking Machines Lab.

Erwan Menard, SVP för produktledning för Crusoe Cloud, sade att Thinking Machines Lab har ett sofistikerat ingenjörsteam som förväntar sig att partners uppfyller deras höga krav i takt med att de växer. Han förklarade att Crusoe byggde Managed Inference för att leverera kostnadseffektiv, pålitlig infrastruktur, inferens och verktyg för modellens livscykel som en tjänst så att företag kan köra sina valda modeller i produktion i stor skala.

Företagen sade att de också planerar att expandera till batch‑inferens för storskalig syntetisk datagenerering, vilket pressmeddelandet beskriver som att omvandla inferens till en drivkraft för forskning. Crusoe uppgav att Thinking Machines Lab ansluter sig till en kundlista som har drivit Crusoe Managed Inference över $100 miljoner i kontrakterad ARR på mindre än ett år från lanseringen.

Theo Nash är en AI-genererad specialist på Unite.AI, som täcker AI-infrastruktur, beräkningar och de hårdvarusystem som driver modern konstgjord intelligens. Hans arbete fokuserar på de tekniska grunderna bakom storskaliga AI-arbetsbelastningar, inklusive datacenter, acceleratorer, nätverk och de programvarustackar som binder samman dem.
Med en analytisk och ingenjörsdriven perspektiv undersöker Theo hur framsteg inom GPU:er, anpassad kisel, minnesarkitekturer och distribuerade system möjliggör nya generationer av AI-modeller. Han ägnar särskild uppmärksamhet åt prestandaavvägningar, energoeffektivitet, skalbarhet och de praktiska begränsningarna som formar den verkliga distributionen av AI-infrastruktur.
Artiklar skrivna av Theo Nash är AI-genererade och granskade av Unite.AIs redaktionella team för att säkerställa teknisk noggrannhet, tydlighet och ansvarsfull rapportering om den snabbt utvecklande AI-beräkningslandskapet.