Parcerias
Thinking Machines Lab assina acordo anual de $65 milhões para Crusoe Cloud Inference

Crusoe e Thinking Machines Lab anunciaram um acordo anual de $65 milhões em 23 de setembro de 2026, para impulsionar a inferência dos modelos abertos do laboratório no Crusoe Cloud, com cargas de trabalho de produção atendidas em uma implantação dedicada de sistemas NVIDIA HGX B200 através do Crusoe Managed Inference.
O comunicado, datado de São Francisco, afirma que a Thinking Machines Lab atenderá a uma variedade de cargas de trabalho de produção, incluindo seus modelos Inkling, GLM 5.2 e 5.3, e suas próprias variantes ajustadas, em uma implantação dedicada Tailored Deployment de sistemas NVIDIA HGX B200 conectados à rede NVIDIA Quantum-2 InfiniBand. A Crusoe descreveu a implantação como projetada para alto rendimento, serviço econômico em escala.
A Crusoe executará e suportará o cluster diretamente como um Tailored Deployment, que o comunicado descreve como um endpoint dedicado, benchmarkado e respaldado por SLA, destinado a oferecer à Thinking Machines Lab desempenho‑preço e margem para escalar sem gerenciar sua própria pilha de inferência. No comunicado, a Crusoe se descreve como a primeira provedora de infraestrutura de IA verticalmente integrada da indústria.
Opções de Managed Inference e o Motor MemoryAlloy
Na página do produto Managed Inference da Crusoe, a empresa apresenta as Tailored Deployments como seu nível mais alto de otimização: o cliente fornece o modelo e define os requisitos enquanto a Crusoe cuida do restante, com um endpoint dedicado e benchmarkado, posicionado para modelos proprietários, otimização de inference sob medida e desempenho respaldado por SLA.
A página também detalha Serverless Inference, consumo baseado em uso de modelos de código aberto através de uma API totalmente gerenciada no Crusoe Intelligence Foundry, e Self-Serve Deployments, agora geralmente disponíveis, que executam modelos no Foundry com inference otimizado para rendimento ou capacidade de resposta, incluindo modelos personalizados com o recurso Serverless Fine‑Tuning da empresa. O Foundry em si é apresentado como uma plataforma para desenvolvedores descobrirem modelos, gerarem chaves de API, monitorarem métricas de desempenho e implantarem endpoints gerenciados.
A Crusoe afirma que seu motor de inference é alimentado pelo MemoryAlloy, um tecido de memória nativo de cluster que persiste entre nós e permite roteamento inteligente para eliminar computação redundante de pré‑preenchimento. A empresa relata até 9,9 vezes mais rapidez no tempo até o primeiro token e 5 vezes maior rendimento usando decodificação especulativa e lote dinâmico, números que foram benchmarkados contra o vLLM servindo o modelo Llama‑3.3‑70B em uma implantação de quatro nós.
Os Modelos Inkling e GLM
As cargas de trabalho nomeadas no acordo incluem a família Inkling do laboratório. A Thinking Machines Lab lançou Inkling em 15 de julho de 2026, descrevendo‑o como um transformador Mixture‑of‑Experts de pesos abertos com 975 bilhões de parâmetros totais e 41 bilhões de parâmetros ativos, suportando uma janela de contexto de até 1 milhão de tokens. Segundo o laboratório, Inkling foi pré‑treinado em 45 trilhões de tokens abrangendo texto, imagens, áudio e vídeo, e o esforço foi a primeira grande execução de treinamento do laboratório, realizada em sistemas NVIDIA GB300 NVL72.
Junto com o Inkling, o laboratório apresentou o Inkling‑Small, um modelo Mixture‑of‑Experts mais leve de 276 bilhões de parâmetros com 12 bilhões de parâmetros ativos que apresenta um trade‑off diferente de desempenho e latência. Os pesos completos do Inkling são publicados no Hugging Face, tanto como o checkpoint original quanto como um checkpoint NVFP4 para inference eficiente em sistemas NVIDIA Blackwell, e o modelo está disponível para fine‑tuning no Tinker, a plataforma de personalização de modelos do laboratório, com opções de comprimento de contexto de 64 mil e 256 mil.
O acordo também inclui GLM 5.2 e 5.3 entre as cargas de trabalho de produção do laboratório no serviço. O hub de modelos Managed Inference da Crusoe lista o GLM 5.3 da Z.ai com 753 bilhões de parâmetros e contexto de 1 000 000 de tokens, e o GLM 5.3 Flash com 320 bilhões de parâmetros, ambos disponíveis para Serverless Inference.
Declarações Executivas e Expansão Planejada
“O Crusoe Managed Inference nos levou da avaliação à produção rapidamente e atendeu aos padrões que aplicamos aos nossos próprios sistemas, proporcionando a escala e a economia para reinvestir na pesquisa que está no cerne do que fazemos”, disse Myle Ott, ML Infra Lead da Thinking Machines Lab.
Erwan Menard, SVP de Product Management da Crusoe Cloud, disse que a Thinking Machines Lab possui uma equipe de engenharia sofisticada que espera que os parceiros atinjam seu alto padrão à medida que cresce. Ele afirmou que a Crusoe desenvolveu o Managed Inference para oferecer infraestrutura, inference e ferramentas de ciclo de vida de modelo econômicas e confiáveis como serviço, permitindo que as empresas executem seus modelos escolhidos em produção em escala.
As empresas disseram que também pretendem expandir para inference em lote para geração de dados sintéticos em larga escala, que o comunicado descreve como transformar a inference em um motor de crescimento para a pesquisa. A Crusoe afirmou que a Thinking Machines Lab se junta a uma lista de clientes que levou o Crusoe Managed Inference a ultrapassar $100 milhões em ARR contratado em menos de um ano desde o lançamento.












