Partnership

Thinking Machines Lab firma un accordo annuale da $65M per Crusoe Cloud Inference

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Crusoe e Thinking Machines Lab annunciato un accordo annuale da $65 milioni il 23 settembre 2026, per alimentare l’inferenza dei modelli aperti del laboratorio su Crusoe Cloud, con carichi di lavoro di produzione serviti su un deployment dedicato di sistemi NVIDIA HGX B200 tramite Crusoe Managed Inference.

L’annuncio, datato San Francisco, afferma che Thinking Machines Lab fornirà una gamma di carichi di lavoro di produzione, inclusi i suoi modelli Inkling, GLM 5.2 e 5.3, e le proprie varianti fine‑tuned, su un Tailored Deployment dedicato di sistemi NVIDIA HGX B200 collegati alla rete NVIDIA Quantum-2 InfiniBand. Crusoe ha descritto il deployment come progettato per un servizio ad alto throughput e a costi contenuti su larga scala.

Crusoe gestirà e supporterà il cluster direttamente come Tailored Deployment, che il comunicato descrive come un endpoint dedicato, benchmarkato e supportato da SLA, destinato a fornire a Thinking Machines Lab un rapporto prezzo‑prestazioni e margine di scalabilità senza dover gestire la propria infrastruttura di inferenza. Nel comunicato, Crusoe si descrive come il primo fornitore di infrastruttura AI verticalmente integrata del settore.

Opzioni di Managed Inference e il motore MemoryAlloy

Sulla pagina del prodotto Managed Inference di Crusoe, l’azienda presenta le Tailored Deployments come il più alto livello di ottimizzazione: il cliente porta il modello e definisce i requisiti mentre Crusoe si occupa del resto, con un endpoint dedicato e benchmarkato, posizionato per modelli proprietari, ottimizzazione su misura dell’inferenza e prestazioni supportate da SLA.

La pagina dettaglia anche Serverless Inference, il consumo basato sull’uso di modelli open source tramite un’API completamente gestita in Crusoe Intelligence Foundry, e Self-Serve Deployments, ora generalmente disponibili, che eseguono i modelli nel Foundry con inferenza ottimizzata per throughput o reattività, inclusi modelli personalizzati con la funzionalità Serverless Fine‑Tuning dell’azienda. Il Foundry è presentato come una piattaforma per sviluppatori per scoprire modelli, generare chiavi API, monitorare metriche di prestazione e distribuire endpoint gestiti.

Crusoe afferma che il suo motore di inferenza è alimentato da MemoryAlloy, un tessuto di memoria nativo del cluster che persiste tra i nodi e consente un routing intelligente per eliminare calcoli di pre‑riempimento ridondanti. L’azienda riporta fino a 9.9× tempi più rapidi per il primo token e 5× maggiore throughput grazie al decoding speculativo e al batch dinamico, dati confrontati con vLLM che serviva il modello Llama-3.3-70B in un deployment a quattro nodi.

I modelli Inkling e GLM

I carichi di lavoro nominati nell’accordo includono la famiglia Inkling del laboratorio. Thinking Machines Lab ha rilasciato Inkling il 15 luglio 2026, descrivendolo come un transformer Mixture-of-Experts a pesi aperti con 975B parametri totali e 41B parametri attivi, che supporta una finestra di contesto fino a 1M token. Secondo il laboratorio, Inkling è stato preaddestrato su 45 trilioni di token che includono testo, immagini, audio e video, e lo sforzo è stato il primo grande training del laboratorio, eseguito su sistemi NVIDIA GB300 NVL72.

Accanto a Inkling, il laboratorio ha presentato Inkling‑Small, un modello Mixture-of-Experts più leggero da 276B parametri con 12B parametri attivi che presenta un diverso compromesso tra prestazioni e latenza. I pesi completi di Inkling sono pubblicati su Hugging Face, sia come checkpoint originale sia come checkpoint NVFP4 per inferenza efficiente su sistemi NVIDIA Blackwell, e il modello è disponibile per il fine‑tuning su Tinker, la piattaforma di personalizzazione dei modelli del laboratorio, con opzioni di lunghezza del contesto di 64K e 256K.

L’accordo colloca anche GLM 5.2 e 5.3 tra i carichi di lavoro di produzione del laboratorio sul servizio. Il modello hub di Managed Inference di Crusoe elenca GLM 5.3 di Z.ai con 753B parametri e un contesto di 1.000.000 di token e GLM 5.3 Flash con 320B parametri, entrambi disponibili per Serverless Inference.

Dichiarazioni esecutive e espansione pianificata

“Crusoe Managed Inference ci ha portato dalla valutazione alla produzione rapidamente e ha soddisfatto gli standard a cui teniamo i nostri sistemi, fornendoci la scala e l’economia per reinvestire nella ricerca al cuore di ciò che facciamo,” ha dichiarato Myle Ott, ML Infra Lead presso Thinking Machines Lab.

Erwan Menard, SVP Product Management per Crusoe Cloud, ha affermato che Thinking Machines Lab dispone di un team di ingegneria sofisticato che si aspetta che i partner soddisfino i suoi elevati standard man mano che cresce. Ha dichiarato che Crusoe ha costruito Managed Inference per fornire infrastruttura, inferenza e strumenti per il ciclo di vita dei modelli, efficienti in termini di costi e affidabili, come servizio, così che le aziende possano eseguire i modelli scelti in produzione su larga scala.

Le aziende hanno dichiarato di voler espandere anche l’inferenza batch per la generazione di dati sintetici su larga scala, che il comunicato descrive come trasformare l’inferenza in un volano per la ricerca. Crusoe ha affermato che Thinking Machines Lab si aggiunge a un elenco di clienti che ha portato Crusoe Managed Inference oltre i $100 milioni di ARR contrattato in meno di un anno dal lancio.

Theo Nash è uno specialista generato da AI presso Unite.AI, che copre l'infrastruttura AI, il calcolo e i sistemi hardware che alimentano l'intelligenza artificiale moderna. Il suo lavoro si concentra sulle fondamenta tecniche di grandi carichi di lavoro AI, tra cui data center, acceleratori, networking e gli stack software che li collegano.
Con una prospettiva analitica e ingegneristica, Theo esamina come i progressi nelle GPU, nel silicio personalizzato, nelle architetture della memoria e nei sistemi distribuiti consentono nuove generazioni di modelli AI. Presta particolare attenzione ai compromessi di prestazioni, all'efficienza energetica, alla scalabilità e alle limitazioni pratiche che influenzano il dispiegamento di infrastrutture AI nel mondo reale.
Gli articoli scritti da Theo Nash sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza tecnica, la chiarezza e la copertura responsabile del panorama in rapida evoluzione del calcolo AI.