Partnerstwa

Thinking Machines Lab podpisuje roczną umowę o wartości $65M na usługę Crusoe Cloud Inference

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Crusoe i Thinking Machines Lab ogłosiły roczną umowę o wartości $65 mln 23 września 2026 r., aby zasilić inferencję otwartych modeli laboratorium w Crusoe Cloud, przy produkcyjnych obciążeniach obsługiwanych na dedykowanym wdrożeniu systemów NVIDIA HGX B200 poprzez Crusoe Managed Inference.

W ogłoszeniu, datowanym w San Francisco, stwierdzono, że Thinking Machines Lab będzie obsługiwać szereg produkcyjnych obciążeń, w tym modele Inkling, GLM 5.2 i 5.3 oraz własne warianty dostrojone, na dedykowanym Tailored Deployment systemów NVIDIA HGX B200 połączonych z siecią NVIDIA Quantum-2 InfiniBand. Crusoe określił to wdrożenie jako zaprojektowane pod kątem wysokiej przepustowości i kosztowo efektywnego serwowania w skali.

Crusoe będzie uruchamiać i wspierać klaster bezpośrednio jako Tailored Deployment, które w komunikacie opisane jest jako dedykowany, benchmarkowany punkt końcowy z gwarancją SLA, mający zapewnić Thinking Machines Lab korzystny stosunek ceny do wydajności oraz zapas mocy do skalowania bez konieczności zarządzania własnym stosie inferencji. W komunikacie Crusoe opisuje się jako pierwszego w branży w pełni zintegrowanego dostawcę infrastruktury AI.

Opcje Managed Inference i silnik MemoryAlloy

Na strona produktu Managed Inference firmy Crusoe firma przedstawia Tailored Deployments jako najwyższy poziom optymalizacji: klient dostarcza model i definiuje wymagania, a Crusoe zajmuje się resztą, oferując dedykowany, benchmarkowany punkt końcowy przeznaczony dla modeli własnościowych, dedykowanej optymalizacji inferencji oraz wydajności wspieranej SLA.

Strona opisuje również Serverless Inference, zużycie oparte na wykorzystaniu otwarto‑źródłowych modeli poprzez w pełni zarządzane API w Crusoe Intelligence Foundry, oraz Self‑Serve Deployments, które są już powszechnie dostępne i uruchamiają modele w Foundry z inferencją zoptymalizowaną pod kątem przepustowości lub responsywności, w tym modele dostosowane przy użyciu funkcji Serverless Fine‑Tuning firmy. Samego Foundry przedstawiono jako platformę deweloperską do odkrywania modeli, generowania kluczy API, monitorowania metryk wydajności oraz wdrażania zarządzanych punktów końcowych.

Crusoe informuje, że jego silnik inferencji jest napędzany przez MemoryAlloy, natywną dla klastra tkaninę pamięci, która utrzymuje się pomiędzy węzłami i umożliwia inteligentne routowanie w celu wyeliminowania zbędnych obliczeń prefill. Firma podaje, że osiąga do 9,9‑krotnego przyspieszenia czasu do pierwszego tokenu oraz 5‑krotny wzrost przepustowości dzięki dekodowaniu spekulacyjnemu i dynamicznemu grupowaniu, wyniki benchmarkowane w porównaniu z vLLM obsługującym model Llama‑3.3‑70B w czterowęzłowym wdrożeniu.

Modele Inkling i GLM

Wymienione w umowie obciążenia obejmują własną rodzinę Inkling laboratorium. Thinking Machines Lab wydała Inkling 15 lipca 2026, opisując go jako transformator Mixture‑of‑Experts o otwartym zestawie wag, z 975 mld całkowitych parametrów i 41 mld aktywnych parametrów, obsługujący okno kontekstowe do 1 M tokenów. Według laboratorium Inkling został wstępnie wytrenowany na 45 bilionach tokenów obejmujących tekst, obrazy, dźwięk i wideo, a przedsięwzięcie było pierwszym dużym treningiem laboratorium, przeprowadzonym na systemach NVIDIA GB300 NVL72.

Obok Inkling laboratorium zaprezentowało Inkling‑Small, lżejszy model Mixture‑of‑Experts o 276 mld parametrów i 12 mld aktywnych parametrów, oferujący inny kompromis wydajności i opóźnienia. Pełne wagi Inkling są opublikowane na Hugging Face, zarówno jako oryginalny checkpoint, jak i checkpoint NVFP4 umożliwiający efektywną inferencję na systemach NVIDIA Blackwell, a model jest dostępny do dostrajania w Tinker, platformie laboratorium do personalizacji modeli, z opcjami długości kontekstu 64 K i 256 K.

Umowa również umieszcza GLM 5.2 i 5.3 wśród produkcyjnych obciążeń laboratorium w usłudze. Hub modeli Managed Inference firmy Crusoe wymienia GLM 5.3 od Z.ai z 753 mld parametrów i kontekstem 1 000 000 tokenów oraz GLM 5.3 Flash z 320 mld parametrów, oba dostępne w ramach Serverless Inference.

Oświadczenia kierownictwa i planowane rozszerzenie

„Crusoe Managed Inference przeniosło nas z etapu oceny do produkcji szybko i spełniło standardy, które stosujemy wobec naszych własnych systemów, dając nam skalę i ekonomię pozwalającą reinwestować w badania będące rdzeniem naszej działalności”, powiedział Myle Ott, lider ds. infrastruktury ML w Thinking Machines Lab.

Erwan Menard, wiceprezes ds. zarządzania produktem w Crusoe Cloud, powiedział, że Thinking Machines Lab posiada zaawansowany zespół inżynierski, który oczekuje od partnerów spełniania wysokich wymagań w miarę rozwoju. Dodał, że Crusoe stworzyło Managed Inference, aby dostarczyć kosztowo efektywną, niezawodną infrastrukturę, inferencję oraz narzędzia do zarządzania cyklem życia modeli jako usługę, umożliwiając firmom uruchamianie wybranych modeli w produkcji w dużej skali.

Firmy oświadczyły, że planują również rozszerzenie działalności o batch inference w celu generowania syntetycznych danych na dużą skalę, co komunikat opisuje jako przekształcenie inferencji w koło zamachowe dla badań. Crusoe poinformowało, że Thinking Machines Lab dołącza do listy klientów, dzięki której Crusoe Managed Inference przekroczyło $100 mln skonsolidowanego rocznego przychodu (ARR) w mniej niż rok od uruchomienia.

Theo Nash jest specjalistą wygenerowanym przez AI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami i systemami sprzętowymi, które napędzają nowoczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach dużych obciążeń AI, w tym centrach danych, przyspiesznikach, sieciach i stosach oprogramowania, które je łączą.
Z analitycznej i inżynierskiej perspektywy Theo analizuje, jak postępy w zakresie GPU, niestandardowego krzemowego, architektur pamięci i systemów rozproszonych umożliwiają nowe pokolenia modeli AI. Zwraca szczególną uwagę na wymiany pomiędzy wydajnością, efektywnością energetyczną, skalowalnością i praktycznymi ograniczeniami, które kształtują wdrożenie infrastruktury AI w świecie rzeczywistym.
Artykuły napisane przez Theo Nasha są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI w celu zapewnienia technicznej dokładności, klarowności i odpowiedzialnego pokrycia szybko ewoluującego krajobrazu obliczeń AI.