Partnerskaber

Thinking Machines Lab indgår $65M årlig aftale for Crusoe Cloud Inference

mm
Føj Unite.AI til dine foretrukne kilder på Google

Crusoe og Thinking Machines Lab annoncerede en årlig aftale på $65 millioner den 23. september 2026, for at drive inferens for laboratoriets åbne modeller på Crusoe Cloud, med produktionsarbejdsbelastninger leveret på en dedikeret implementering af NVIDIA HGX B200-systemer via Crusoe Managed Inference.

Meddelelsen, dateret San Francisco, oplyser, at Thinking Machines Lab vil betjene en række produktionsarbejdsbelastninger, herunder deres Inkling-modeller, GLM 5.2 og 5.3 samt deres egne finjusterede varianter, på en dedikeret Tailored Deployment af NVIDIA HGX B200-systemer forbundet med NVIDIA Quantum-2 InfiniBand-netværk. Crusoe karakteriserer implementeringen som designet til høj gennemløbshastighed, omkostningseffektiv betjening i stor skala.

Crusoe vil køre og supportere klyngen direkte som en Tailored Deployment, som pressemeddelelsen beskriver som et dedikeret, benchmarket, SLA‑understøttet endpoint, der skal give Thinking Machines Lab pris‑ydelsesforhold og margin til at skalere uden at administrere deres egen inferens‑stack. I meddelelsen beskriver Crusoe sig selv som branchens første vertikalt integrerede AI‑infrastrukturleverandør.

Managed Inference‑muligheder og MemoryAlloy‑motoren

Crusoe’s Managed Inference-produktside præsenterer virksomheden Tailored Deployments som sit højeste optimeringsniveau: kunden leverer modellen og definerer kravene, mens Crusoe håndterer resten, med et dedikeret, benchmarket endpoint, der er placeret til proprietære modeller, skræddersyet inferensoptimering og SLA‑understøttet ydeevne.

Siden beskriver også Serverless Inference, forbrugsbaseret brug af open‑source‑modeller gennem et fuldt administreret API i Crusoe Intelligence Foundry, samt Self‑Serve Deployments, som nu er generelt tilgængelige, og som kører modeller i Foundry med inferens optimeret til gennemløb eller respons, inklusive modeller tilpasset med virksomhedens Serverless Fine‑Tuning‑funktion. Foundry selv præsenteres som en udviklerplatform til at opdage modeller, generere API‑nøgler, overvåge ydeevnemålinger og implementere administrerede endpoints.

Crusoe siger, at deres inferensmotor drives af MemoryAlloy, et klynge‑native hukommelses‑fabric, der vedvarer på tværs af noder og muliggør intelligent routing for at eliminere redundant prefill‑beregning. Virksomheden rapporterer op til 9,9‑gange hurtigere tid‑til‑første‑token og 5‑gange højere gennemløb ved brug af spekulativ dekodning og dynamisk batching, tal som de benchmarkede mod vLLM, der betjener Llama-3.3-70B-modellen i en fire‑node‑implementering.

Inkling‑ og GLM‑modeller

De navngivne arbejdsbelastninger i aftalen omfatter laboratoriets egen Inkling-familie. Thinking Machines Lab frigav Inkling den 15. juli 2026, og beskriver den som en open‑weights Mixture‑of‑Experts‑transformer med 975 milliarder samlede parametre og 41 milliarder aktive parametre, som understøtter et kontekstvindue på op til 1 million tokens. Ifølge laboratoriet blev Inkling fortrænet på 45 billioner tokens, der dækker tekst, billeder, lyd og video, og indsatsen var laboratoriets første store træningskørsel, udført på NVIDIA GB300 NVL72-systemer.

Sammen med Inkling præsenterede laboratoriet Inkling‑Small, en lettere vægtet 276 milliarder‑parameter Mixture‑of‑Experts‑model med 12 milliarder aktive parametre, som har en anden ydelses‑ og latenstids‑afvejning. Inkling’s fulde vægte er offentliggjort på Hugging Face, både som den oprindelige checkpoint og som en NVFP4‑checkpoint for effektiv inferens på NVIDIA Blackwell-systemer, og modellen er tilgængelig for fin‑tuning på Tinker, laboratoriets model‑tilpasningsplatform, med kontekstlængde‑muligheder på 64 K og 256 K.

Aftalen placerer også GLM 5.2 og 5.3 blandt laboratoriets produktionsarbejdsbelastninger på tjenesten. Crusoe’s Managed Inference modelhub lister Z.ai’s GLM 5.3 med 753 milliarder parametre og et kontekstvindue på 1 000 000 tokens samt GLM 5.3 Flash med 320 milliarder parametre, begge tilgængelige for Serverless Inference.

Ledelsesudtalelser og planlagt udvidelse

„Crusoe Managed Inference tog os fra evaluering til produktion hurtigt og levede op til de standarder, vi stiller til vores egne systemer, hvilket gav os skalaen og økonomien til at geninvestere i forskningen i kernen af vores arbejde,“ sagde Myle Ott, ML Infra Lead hos Thinking Machines Lab.

Erwan Menard, SVP of Product Management for Crusoe Cloud, udtalte, at Thinking Machines Lab har et sofistikeret ingeniørteam, som forventer, at partnere lever op til deres høje standard, efterhånden som de vokser. Han sagde, at Crusoe byggede Managed Inference for at levere omkostningseffektiv, pålidelig infrastruktur, inferens og værktøjer til modellens livscyklus som en service, så virksomheder kan køre deres valgte modeller i produktion i stor skala.

Virksomhederne udtalte, at de også ser på at udvide til batch‑inferens for stor‑skala syntetisk datagenerering, hvilket meddelelsen beskriver som at gøre inferens til en drivkraft for forskning. Crusoe sagde, at Thinking Machines Lab tilslutter sig en kundeliste, der har bragt Crusoe Managed Inference forbi $100 millioner i kontrakteret ARR på mindre end et år efter lanceringen.

Theo Nash er en AI-genereret specialist hos Unite.AI, der dækker AI-infrastruktur, beregning og de hardware-systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag for store AI-arbejdsbyrder, herunder datacentre, acceleratorer, netværk og software-stacks, der binder dem sammen.
Med en analytisk og ingeniør-dreven perspektiv undersøger Theo, hvordan fremskridt i GPU'er, brugerdefineret silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI-modeller. Han lægger særlig vægt på ydelses-omkostningsforhold, energoeffektivitet, skalerbarhed og de praktiske begrænsninger, der former den virkelige udvikling af AI-infrastruktur.
Artikler skrevet af Theo Nash er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af den hurtigt udviklende AI-beregningsskala.