Partnerství

Thinking Machines Lab podepsal roční dohodu v hodnotě $65M pro Crusoe Cloud Inference

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Crusoe a Thinking Machines Lab oznámili roční dohodu v hodnotě $65 milionů dne 23. září 2026, aby poháněli inferenci pro otevřené modely laboratoře na Crusoe Cloud, s produkčními pracovními zátěžemi obsluhovanými na dedikovaném nasazení systémů NVIDIA HGX B200 prostřednictvím Crusoe Managed Inference.

Oznámení, datované San Franciscem, uvádí, že Thinking Machines Lab bude poskytovat řadu produkčních pracovních zátěží, včetně svých modelů Inkling, GLM 5.2 a 5.3 a vlastních jemně vyladěných variant, na dedikovaném Tailored Deployment systémů NVIDIA HGX B200 připojených k síti NVIDIA Quantum‑2 InfiniBand. Crusoe charakterizoval nasazení jako navržené pro vysokou propustnost a nákladově efektivní obsluhu ve velkém měřítku.

Crusoe bude cluster provozovat a podporovat přímo jako Tailored Deployment, což vydání popisuje jako dedikovaný, benchmarkovaný, na SLA podložený koncový bod určený k poskytnutí poměru cena‑výkon a rezervy pro škálování Thinking Machines Lab bez nutnosti spravovat vlastní inference stack. Ve vydání Crusoe popisuje sebe jako první vertikálně integrovaného poskytovatele AI infrastruktury v odvětví.

Možnosti Managed Inference a engine MemoryAlloy

Na stránce produktu Managed Inference společnosti Crusoe společnost představuje Tailored Deployments jako nejvyšší úroveň optimalizace: zákazník přinese model a definuje požadavky, zatímco Crusoe se postará o zbytek, s dedikovaným, benchmarkovaným koncovým bodem určeným pro proprietární modely, zakázkovou optimalizaci inferencí a výkon podložený SLA.

Stránka také podrobně popisuje Serverless Inference, spotřebu založenou na využití open‑source modelů prostřednictvím plně spravovaného API v Crusoe Intelligence Foundry, a Self‑Serve Deployments, nyní obecně dostupné, které spouštějí modely ve Foundry s inferencí optimalizovanou pro propustnost nebo odezvu, včetně modelů přizpůsobených pomocí funkce Serverless Fine‑Tuning společnosti. Foundry samotná je představena jako vývojářská platforma pro objevování modelů, generování API klíčů, sledování výkonnostních metrik a nasazování spravovaných koncových bodů.

Crusoe uvádí, že jeho inference engine je poháněn MemoryAlloy, cluster‑nativní paměťovou tkaninou, která přetrvává napříč uzly a umožňuje inteligentní směrování k eliminaci nadbytečných výpočtů předvyplnění. Společnost hlásí až 9,9‑násobně rychlejší čas do prvního tokenu a 5‑násobně vyšší propustnost při použití spekulativního dekódování a dynamického dávkování, údaje benchmarkované oproti vLLM obsluhujícímu model Llama‑3.3‑70B ve čtyřuzlovém nasazení.

Modely Inkling a GLM

Mezi pojmenované pracovní zátěže dohody patří vlastní rodina Inkling laboratoře. Thinking Machines Lab vydala Inkling 15. července 2026, popisující ji jako transformer typu Mixture‑of‑Experts s otevřenými vahami, s celkem 975 miliardami parametrů a 41 miliardami aktivních parametrů, podporující kontextové okno až 1 milion tokenů. Podle laboratoře byl Inkling předtrénován na 45 bilionů tokenů zahrnujících text, obrázky, audio a video a tento projekt byl první velký tréninkový běh laboratoře, provedený na systémech NVIDIA GB300 NVL72.

Plné váhy Inkling jsou zveřejněny na Hugging Face, jak jako originální checkpoint, tak jako checkpoint NVFP4 pro efektivní inferenci na systémech NVIDIA Blackwell, a model je k dispozici pro jemné doladění na platformě Tinker, modelové přizpůsobovací platformě laboratoře, s možnostmi kontextové délky 64 K a 256 K.

Dohoda také zařazuje GLM 5.2 a 5.3 mezi produkční pracovní zátěže laboratoře v rámci služby. Hub modelů Managed Inference od Crusoe uvádí GLM 5.3 od Z.ai s 753 miliardami parametrů a kontextem 1 000 000 tokenů a GLM 5.3 Flash s 320 miliardami parametrů, oba dostupné pro Serverless Inference.

Prohlášení vedení a plánované rozšíření

“Crusoe Managed Inference nás rychle posunulo od hodnocení k produkci a splnilo standardy, které klademe na naše vlastní systémy, což nám poskytlo rozsah a ekonomiku pro reinvestice do výzkumu, který je jádrem naší činnosti,” řekl Myle Ott, vedoucí ML Infra ve společnosti Thinking Machines Lab.

Erwan Menard, SVP produktového managementu pro Crusoe Cloud, uvedl, že Thinking Machines Lab má sofistikovaný inženýrský tým, který očekává, že partneři splní jeho vysoké nároky během růstu. Řekl, že Crusoe vytvořil Managed Inference, aby poskytl nákladově efektivní, spolehlivou infrastrukturu, inferenci a nástroje pro životní cyklus modelů jako službu, aby společnosti mohly provozovat své vybrané modely v produkci ve velkém měřítku.

Společnosti uvedly, že také plánují rozšířit se do batch inferencí pro generování syntetických dat ve velkém měřítku, což vydání představuje jako proměnu inferencí v hybný motor výzkumu. Crusoe uvedl, že Thinking Machines Lab se připojuje k seznamu zákazníků, kteří během méně než jednoho roku od spuštění dosáhli s Crusoe Managed Inference kontraktního ARR přes $100 milionů.

Theo Nash je specialista na umělou inteligenci vygenerovaný v Unite.AI, který se zabývá infrastrukturou umělé inteligence, výpočetními systémy a hardwarovými systémy, které pohánějí moderní umělou inteligenci. Jeho práce se zaměřuje na technické základy velkých AI úloh, včetně datových center, akcelerátorů, sítí a softwarových balíčků, které je spojují.
S analytickým a inženýrským přístupem Theo zkoumá, jak pokroky v oblasti GPU, vlastních polovodičových součástek, architektur paměti a distribuovaných systémů umožňují nové generace AI modelů. Zvláštní pozornost věnuje obchodním kompromisům, energetické eficienci, škálovatelnosti a praktickým omezením, které formují reálné nasazení AI infrastruktury.
Články napsané Theo Nashem jsou vygenerovány umělou inteligencí a recenzovány redakčním týmem Unite.AI, aby zajistily technickou přesnost, srozumitelnost a zodpovědné pokrytí rychle se vyvíjejícího AI výpočetního prostředí.