Partnerství
Thinking Machines Lab podepsal roční dohodu v hodnotě $65M pro Crusoe Cloud Inference

Crusoe a Thinking Machines Lab oznámili roční dohodu v hodnotě $65 milionů dne 23. září 2026, aby poháněli inferenci pro otevřené modely laboratoře na Crusoe Cloud, s produkčními pracovními zátěžemi obsluhovanými na dedikovaném nasazení systémů NVIDIA HGX B200 prostřednictvím Crusoe Managed Inference.
Oznámení, datované San Franciscem, uvádí, že Thinking Machines Lab bude poskytovat řadu produkčních pracovních zátěží, včetně svých modelů Inkling, GLM 5.2 a 5.3 a vlastních jemně vyladěných variant, na dedikovaném Tailored Deployment systémů NVIDIA HGX B200 připojených k síti NVIDIA Quantum‑2 InfiniBand. Crusoe charakterizoval nasazení jako navržené pro vysokou propustnost a nákladově efektivní obsluhu ve velkém měřítku.
Crusoe bude cluster provozovat a podporovat přímo jako Tailored Deployment, což vydání popisuje jako dedikovaný, benchmarkovaný, na SLA podložený koncový bod určený k poskytnutí poměru cena‑výkon a rezervy pro škálování Thinking Machines Lab bez nutnosti spravovat vlastní inference stack. Ve vydání Crusoe popisuje sebe jako první vertikálně integrovaného poskytovatele AI infrastruktury v odvětví.
Možnosti Managed Inference a engine MemoryAlloy
Na stránce produktu Managed Inference společnosti Crusoe společnost představuje Tailored Deployments jako nejvyšší úroveň optimalizace: zákazník přinese model a definuje požadavky, zatímco Crusoe se postará o zbytek, s dedikovaným, benchmarkovaným koncovým bodem určeným pro proprietární modely, zakázkovou optimalizaci inferencí a výkon podložený SLA.
Stránka také podrobně popisuje Serverless Inference, spotřebu založenou na využití open‑source modelů prostřednictvím plně spravovaného API v Crusoe Intelligence Foundry, a Self‑Serve Deployments, nyní obecně dostupné, které spouštějí modely ve Foundry s inferencí optimalizovanou pro propustnost nebo odezvu, včetně modelů přizpůsobených pomocí funkce Serverless Fine‑Tuning společnosti. Foundry samotná je představena jako vývojářská platforma pro objevování modelů, generování API klíčů, sledování výkonnostních metrik a nasazování spravovaných koncových bodů.
Crusoe uvádí, že jeho inference engine je poháněn MemoryAlloy, cluster‑nativní paměťovou tkaninou, která přetrvává napříč uzly a umožňuje inteligentní směrování k eliminaci nadbytečných výpočtů předvyplnění. Společnost hlásí až 9,9‑násobně rychlejší čas do prvního tokenu a 5‑násobně vyšší propustnost při použití spekulativního dekódování a dynamického dávkování, údaje benchmarkované oproti vLLM obsluhujícímu model Llama‑3.3‑70B ve čtyřuzlovém nasazení.
Modely Inkling a GLM
Mezi pojmenované pracovní zátěže dohody patří vlastní rodina Inkling laboratoře. Thinking Machines Lab vydala Inkling 15. července 2026, popisující ji jako transformer typu Mixture‑of‑Experts s otevřenými vahami, s celkem 975 miliardami parametrů a 41 miliardami aktivních parametrů, podporující kontextové okno až 1 milion tokenů. Podle laboratoře byl Inkling předtrénován na 45 bilionů tokenů zahrnujících text, obrázky, audio a video a tento projekt byl první velký tréninkový běh laboratoře, provedený na systémech NVIDIA GB300 NVL72.
Plné váhy Inkling jsou zveřejněny na Hugging Face, jak jako originální checkpoint, tak jako checkpoint NVFP4 pro efektivní inferenci na systémech NVIDIA Blackwell, a model je k dispozici pro jemné doladění na platformě Tinker, modelové přizpůsobovací platformě laboratoře, s možnostmi kontextové délky 64 K a 256 K.
Dohoda také zařazuje GLM 5.2 a 5.3 mezi produkční pracovní zátěže laboratoře v rámci služby. Hub modelů Managed Inference od Crusoe uvádí GLM 5.3 od Z.ai s 753 miliardami parametrů a kontextem 1 000 000 tokenů a GLM 5.3 Flash s 320 miliardami parametrů, oba dostupné pro Serverless Inference.
Prohlášení vedení a plánované rozšíření
“Crusoe Managed Inference nás rychle posunulo od hodnocení k produkci a splnilo standardy, které klademe na naše vlastní systémy, což nám poskytlo rozsah a ekonomiku pro reinvestice do výzkumu, který je jádrem naší činnosti,” řekl Myle Ott, vedoucí ML Infra ve společnosti Thinking Machines Lab.
Erwan Menard, SVP produktového managementu pro Crusoe Cloud, uvedl, že Thinking Machines Lab má sofistikovaný inženýrský tým, který očekává, že partneři splní jeho vysoké nároky během růstu. Řekl, že Crusoe vytvořil Managed Inference, aby poskytl nákladově efektivní, spolehlivou infrastrukturu, inferenci a nástroje pro životní cyklus modelů jako službu, aby společnosti mohly provozovat své vybrané modely v produkci ve velkém měřítku.
Společnosti uvedly, že také plánují rozšířit se do batch inferencí pro generování syntetických dat ve velkém měřítku, což vydání představuje jako proměnu inferencí v hybný motor výzkumu. Crusoe uvedl, že Thinking Machines Lab se připojuje k seznamu zákazníků, kteří během méně než jednoho roku od spuštění dosáhli s Crusoe Managed Inference kontraktního ARR přes $100 milionů.












