Partnerskap

Thinking Machines Lab signerer en $65M årlig avtale for Crusoe Cloud Inference

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Crusoe og Thinking Machines Lab kunngjorde en $65 million årsavtale 23. september 2026, for å drive inferens for laboratoriets åpne modeller på Crusoe Cloud, med produksjonsarbeidsbelastninger levert på en dedikert distribusjon av NVIDIA HGX B200-systemer via Crusoe Managed Inference.

Kunngjøringen, datert San Francisco, oppgir at Thinking Machines Lab vil betjene en rekke produksjonsarbeidsbelastninger, inkludert deres Inkling-modeller, GLM 5.2 og 5.3, samt egne finjusterte varianter, på en dedikert Tailored Deployment av NVIDIA HGX B200-systemer koblet til NVIDIA Quantum-2 InfiniBand-nettverk. Crusoe beskriver distribusjonen som konstruert for høy gjennomstrømning og kostnadseffektiv betjening i stor skala.

Crusoe vil drifte og støtte klyngen direkte som en Tailored Deployment, som pressemeldingen beskriver som et dedikert, benchmarket, SLA-støttet endepunkt ment å gi Thinking Machines Lab pris‑ytelse og margin for skalering uten å måtte håndtere sin egen inferens‑stack. I pressemeldingen beskriver Crusoe seg selv som bransjens første vertikalt integrerte leverandør av AI‑infrastruktur.

Alternativer for Managed Inference og MemoryAlloy‑motoren

Crusoe sin Managed Inference-produktside presenterer selskapet Tailored Deployments som sitt høyeste optimaliseringsnivå: kunden leverer modellen og definerer kravene mens Crusoe håndterer resten, med et dedikert, benchmarket endepunkt tilpasset proprietære modeller, skreddersydd inferensoptimalisering og SLA‑støttet ytelse.

Siden beskriver også Serverless Inference, forbruksbasert bruk av åpen kildekode-modeller via et fullt administrert API i Crusoe Intelligence Foundry, samt Self‑Serve Deployments, nå generelt tilgjengelige, som kjører modeller i Foundry med inferens optimalisert for gjennomstrømning eller respons, inkludert modeller tilpasset med selskapets Serverless Fine‑Tuning‑funksjon. Foundry presenteres som en utviklerplattform for å oppdage modeller, generere API‑nøkler, overvåke ytelsesmetrikk og distribuere administrerte endepunkter.

Crusoe sier at deres inferensmotor drives av MemoryAlloy, et klynge‑native minnefabrikk som vedvarer på tvers av noder og muliggjør intelligent ruting for å eliminere redundant prefill‑beregning. Selskapet rapporterer opptil 9,9 × raskere tid‑til‑første‑token og 5 × høyere gjennomstrømning ved bruk av spekulativ dekoding og dynamisk batching, tall som er benchmarket mot vLLM som betjener Llama‑3.3‑70B-modellen i en fire‑node‑distribusjon.

Inkling‑ og GLM-modellene

Avtalens navngitte arbeidsbelastninger inkluderer laboratoriets egen Inkling-familie. Thinking Machines Lab lanserte Inkling 15. juli 2026, og beskriver den som en åpen‑vektet Mixture‑of‑Experts‑transformer med 975 milliarder totale parametere og 41 milliarder aktive parametere, som støtter et kontekstvindu på opptil 1 M token. Ifølge laboratoriet ble Inkling forhåndstrent på 45 billioner token som spenner over tekst, bilder, lyd og video, og innsatsen var laboratoriets første store treningskjøring, utført på NVIDIA GB300 NVL72‑systemer.

Ved siden av Inkling forhåndsviste laboratoriet Inkling‑Small, en lettere Mixture‑of‑Experts‑modell med 276 milliarder parametere og 12 milliarder aktive parametere som har en annen ytelses‑ og latenstidsavveining. Inkling sine fullstendige vekter er publisert på Hugging Face, både som den opprinnelige sjekkpunktet og som et NVFP4‑sjekkpunk for effektiv inferens på NVIDIA Blackwell‑systemer, og modellen er tilgjengelig for finjustering på Tinker, laboratoriets plattform for modelltilpasning, med kontekstlengdealternativene 64 K og 256 K.

Avtalen plasserer også GLM 5.2 og 5.3 blant laboratoriets produksjonsarbeidsbelastninger på tjenesten. Crusoe sin Managed Inference-modellhub lister Z.ai sin GLM 5.3 med 753 milliarder parametere og et kontekstvindu på 1 000 000 token, samt GLM 5.3 Flash med 320 milliarder parametere, begge tilgjengelige for Serverless Inference.

Uttalelser fra ledelsen og planlagt ekspansjon

“Crusoe Managed Inference tok oss fra evaluering til produksjon raskt og møtte de standardene vi stiller til våre egne systemer, og ga oss skalaen og økonomien til å reinvestere i forskningen som er kjernen i det vi gjør,” sa Myle Ott, ML Infra Lead hos Thinking Machines Lab.

Erwan Menard, SVP of Product Management for Crusoe Cloud, sa at Thinking Machines Lab har et sofistikert ingeniørteam som forventer at partnere leverer på deres høye krav etter hvert som de vokser. Han uttalte at Crusoe bygde Managed Inference for å levere kostnadseffektiv, pålitelig infrastruktur, inferens og verktøy for modellens livssyklus som en tjeneste, slik at selskaper kan kjøre sine valgte modeller i produksjon i stor skala.

Selskapene sa at de også ser på å utvide til batch‑inferens for storskalig syntetisk datagenerering, noe pressemeldingen beskriver som å gjøre inferens til en drivkraft for forskning. Crusoe opplyser at Thinking Machines Lab blir med i en kundeliste som har tatt Crusoe Managed Inference over $100 million i kontrahert ARR på under ett år etter lansering.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og hårdwaresystemer som driver moderne kunstig intelligens. Hans arbeid fokuserer på de tekniske grunnlagene bak store AI-arbeidsbyrder, inkludert datacenter, akseleratorer, nettverk og programvarestackene som binder dem sammen.
Med en analytisk og ingeniør-drevet perspektiv, undersøker Theo hvordan fremgangen i GPUs, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger spesiell vekt på ytelses-avveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former virkelige AI-infrastruktur-utsteder.
Artikler skrevet av Theo Nash er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av den raskt utviklende AI-beregningssfæren.