Alianzas

Thinking Machines Lab firma un acuerdo anual de $65M para Crusoe Cloud Inference

mm
Añade Unite.AI a tus fuentes preferidas en Google

Crusoe y Thinking Machines Lab anunció un acuerdo anual de $65 millones el 23 de septiembre de 2026, para impulsar la inferencia de los modelos abiertos del laboratorio en Crusoe Cloud, con cargas de trabajo de producción atendidas en un despliegue dedicado de sistemas NVIDIA HGX B200 a través de Crusoe Managed Inference.

El anuncio, con fecha de San Francisco, indica que Thinking Machines Lab ofrecerá una variedad de cargas de trabajo de producción, incluidos sus modelos Inkling, GLM 5.2 y 5.3, y sus propias variantes afinadas, en un despliegue dedicado de despliegue a medida de sistemas NVIDIA HGX B200 conectados con la red NVIDIA Quantum-2 InfiniBand. Crusoe describió el despliegue como diseñado para un servicio de alto rendimiento y rentable a gran escala.

Crusoe ejecutará y soportará el clúster directamente como un despliegue a medida, que el comunicado describe como un punto final dedicado, evaluado y respaldado por SLA, destinado a ofrecer a Thinking Machines Lab una relación precio‑rendimiento y margen para escalar sin gestionar su propia pila de inferencia. En el comunicado, Crusoe se describe a sí mismo como el primer proveedor de infraestructura de IA verticalmente integrado de la industria.

Opciones de Inferencia Gestionada y el Motor MemoryAlloy

En página del producto Managed Inference de Crusoe, la empresa presenta los Despliegues a medida como su máximo nivel de optimización: el cliente aporta el modelo y define los requisitos mientras Crusoe se encarga del resto, con un punto final dedicado y evaluado, orientado a modelos propietarios, optimización de inferencia a medida y rendimiento respaldado por SLA.

La página también detalla Serverless Inference, el consumo basado en uso de modelos de código abierto a través de una API totalmente gestionada en Crusoe Intelligence Foundry, y Self-Serve Deployments, ahora generalmente disponible, que ejecutan modelos en Foundry con inferencia optimizada para rendimiento o capacidad de respuesta, incluidos modelos personalizados con la función Serverless Fine-Tuning de la empresa. El propio Foundry se presenta como una plataforma para desarrolladores para descubrir modelos, generar claves API, monitorear métricas de rendimiento y desplegar puntos finales gestionados.

Crusoe afirma que su motor de inferencia funciona con MemoryAlloy, una arquitectura de memoria nativa del clúster que persiste entre nodos y permite un enrutamiento inteligente para eliminar cálculos redundantes de pre‑relleno. La empresa reporta hasta 9.9× mayor velocidad en el tiempo al primer token y 5× mayor rendimiento usando decodificación especulativa y lotes dinámicos, cifras comparadas con vLLM sirviendo el modelo Llama-3.3-70B en un despliegue de cuatro nodos.

Los modelos Inkling y GLM

Las cargas de trabajo nombradas en el acuerdo incluyen la familia Inkling del laboratorio. Thinking Machines Lab lanzó Inkling el 15 de julio de 2026, describiéndolo como un transformador Mixture-of-Experts de pesos abiertos con 975 mil millones de parámetros totales y 41 mil millones de parámetros activos, que soporta una ventana de contexto de hasta 1 millón de tokens. Según el laboratorio, Inkling se preentrenó con 45 billones de tokens que abarcan texto, imágenes, audio y video, y el esfuerzo constituyó la primera gran sesión de entrenamiento del laboratorio, realizada en sistemas NVIDIA GB300 NVL72.

Junto a Inkling, el laboratorio presentó Inkling-Small, un modelo Mixture-of-Experts más ligero de 276 mil millones de parámetros con 12 mil millones de parámetros activos que ofrece un diferente equilibrio entre rendimiento y latencia. Los pesos completos de Inkling se publican en Hugging Face, tanto como el checkpoint original como un checkpoint NVFP4 para inferencia eficiente en sistemas NVIDIA Blackwell, y el modelo está disponible para afinación en Tinker, la plataforma de personalización de modelos del laboratorio, con opciones de longitud de contexto de 64 mil y 256 mil.

El acuerdo también incluye GLM 5.2 y 5.3 entre las cargas de trabajo de producción del laboratorio en el servicio. El hub de modelos Managed Inference de Crusot enumera el GLM 5.3 de Z.ai con 753 mil millones de parámetros y un contexto de 1 000 000 de tokens, y GLM 5.3 Flash con 320 mil millones de parámetros, ambos disponibles para Serverless Inference.

Declaraciones Ejecutivas y Expansión Planificada

“Crusoe Managed Inference nos llevó de la evaluación a la producción rápidamente y cumplió los estándares que aplicamos a nuestros propios sistemas, dándonos la escala y la economía para reinvertir en la investigación que está en el núcleo de lo que hacemos”, dijo Myle Ott, ML Infra Lead en Thinking Machines Lab.

Erwan Menard, SVP of Product Management de Crusoe Cloud, dijo que Thinking Machines Lab cuenta con un equipo de ingeniería sofisticado que espera que los socios cumplan con su alto nivel a medida que crece. Añadió que Crusoe desarrolló Managed Inference para ofrecer infraestructura, inferencia y herramientas de ciclo de vida de modelos como servicio, de forma rentable y fiable, de modo que las empresas puedan ejecutar sus modelos elegidos en producción a gran escala.

Las compañías también declararon que buscan expandirse a la inferencia por lotes para la generación de datos sintéticos a gran escala, lo que el comunicado describe como convertir la inferencia en una rueda de impulso para la investigación. Crusoe señaló que Thinking Machines Lab se une a una lista de clientes que ha llevado a Crusoe Managed Inference a superar los $100 millones en ARR contratado en menos de un año desde su lanzamiento.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.