Parteneriate
Thinking Machines Lab semnează un acord anual de 65 de milioane de dolari pentru Crusoe Cloud Inference

Crusoe și Thinking Machines Lab au anunțat un acord anual de 65 de milioane de dolari pe 23 septembrie 2026, pentru a alimenta inferența modelelor deschise ale laboratorului pe Crusoe Cloud, cu sarcini de producție furnizate pe o implementare dedicată a sistemelor NVIDIA HGX B200 prin Crusoe Managed Inference.
Comunicatului, datat San Francisco, se afirmă că Thinking Machines Lab va furniza o gamă de sarcini de producție, inclusiv modelele sale Inkling, GLM 5.2 și 5.3, precum și variantele sale ajustate fin, pe o implementare dedicată Tailored Deployment a sistemelor NVIDIA HGX B200 conectate prin rețeaua NVIDIA Quantum-2 InfiniBand. Crusoe a caracterizat implementarea ca fiind proiectată pentru rată mare de transfer și servire eficientă din punct de vedere al costurilor la scară.
Crusoe va rula și susține clusterul direct ca un Tailored Deployment, pe care comunicatul îl descrie ca un punct final dedicat, benchmarkat și susținut de SLA, destinat să ofere Thinking Machines Lab performanță-preț și marjă de creștere fără a gestiona propriul său stack de inferență. În comunicat, Crusoe se descrie ca fiind primul furnizor de infrastructură AI integrată vertical în industrie.
Opțiuni de Managed Inference și motorul MemoryAlloy
Pe pagina produsului Managed Inference de la Crusoe, compania prezintă Tailored Deployments ca nivelul său maxim de optimizare: clientul aduce modelul și definește cerințele, în timp ce Crusoe se ocupă de restul, cu un punct final dedicat, benchmarkat, destinat modelelor proprietare, optimizării personalizate a inferenței și performanței susținute de SLA.
Pagina detaliază, de asemenea, Serverless Inference, consumul bazat pe utilizare al modelelor open-source printr-un API complet gestionat în Crusoe Intelligence Foundry, și Self-Serve Deployments, acum disponibile în mod general, care rulează modele în Foundry cu inferență optimizată pentru debit sau răspuns rapid, inclusiv modele personalizate cu funcția Serverless Fine-Tuning a companiei. Foundry în sine este prezentat ca o platformă pentru dezvoltatori pentru descoperirea modelelor, generarea de chei API, monitorizarea metricilor de performanță și implementarea de puncte finale gestionate.
Crusoe afirmă că motorul său de inferență este alimentat de MemoryAlloy, o rețea de memorie nativă pentru cluster care persistă între noduri și permite rutare inteligentă pentru a elimina calculul redundant de preumplere. Compania raportează un timp până la primul token de până la 9,9x mai rapid și un debit de 5x mai mare utilizând decodare speculativă și batchare dinamică, valori comparate cu vLLM care servește modelul Llama-3.3-70B într-o implementare pe patru noduri.
Modelele Inkling și GLM
Sarcinile menționate în acord includ familia Inkling a laboratorului. Thinking Machines Lab a lansat Inkling pe 15 iulie 2026, descriindu-l ca un transformator Mixture-of-Experts cu greutăți deschise, având 975 B total de parametri și 41 B parametri activi, susținând o fereastră de context de până la 1 M de tokeni. Conform laboratorului, Inkling a fost pre-antrenat pe 45 de trilioane de tokeni care acoperă text, imagini, audio și video, iar efortul a reprezentat prima sesiune majoră de antrenament a laboratorului, realizată pe sistemele NVIDIA GB300 NVL72.
Alături de Inkling, laboratorul a prezentat Inkling-Small, un model Mixture-of-Experts mai ușor, cu 276 B parametri și 12 B parametri activi, care oferă un alt echilibru între performanță și latență. Greutățile complete ale Inkling sunt publicate pe Hugging Face, atât ca punct de control original, cât și ca punct de control NVFP4 pentru inferență eficientă pe sistemele NVIDIA Blackwell, iar modelul este disponibil pentru fine-tuning pe Tinker, platforma de personalizare a modelelor a laboratorului, cu opțiuni de lungime de context de 64 K și 256 K.
Acordul plasează, de asemenea, GLM 5.2 și 5.3 în rândul sarcinilor de producție ale laboratorului pe serviciu. Hub-ul de modele Managed Inference al Crusoe enumeră GLM 5.3 de la Z.ai cu 753 B parametri și un context de 1,000,000 de tokeni, și GLM 5.3 Flash cu 320 B parametri, ambele disponibile pentru Serverless Inference.
Declarații executive și extindere planificată
„Crusoe Managed Inference ne-a dus rapid de la evaluare la producție și a îndeplinit standardele pe care le aplicăm propriilor noastre sisteme, oferindu-ne scala și economia necesare pentru a reinvesti în cercetarea care stă la baza activității noastre,” a declarat Myle Ott, lider al ML Infra la Thinking Machines Lab.
Erwan Menard, SVP al Managementului de Produs pentru Crusoe Cloud, a afirmat că Thinking Machines Lab are o echipă de ingineri sofisticată care așteaptă ca partenerii să îndeplinească standardele sale înalte pe măsură ce crește. El a spus că Crusoe a creat Managed Inference pentru a oferi infrastructură, inferență și unelte pentru ciclul de viață al modelelor, eficiente din punct de vedere al costurilor și fiabile, ca serviciu, astfel încât companiile să poată rula modelele alese în producție la scară.
Companiile au declarat că intenționează să se extindă și în inferență în lot pentru generarea de date sintetice la scară largă, pe care comunicatul o prezintă ca transformarea inferenței într-un motor de cercetare. Crusode a afirmat că Thinking Machines Lab se alătură unei liste de clienți care a depășit 100 de milioane de dolari în ARR contractat cu Crusoe Managed Inference în mai puțin de un an de la lansare.












