Партнёрства
Thinking Machines Lab подписывает годовое соглашение на $65 млн для Crusoe Cloud Inference

Crusoe и Thinking Machines Lab объявили о годовом соглашении на $65 млн 23 сентября 2026 г., чтобы обеспечить инференс открытых моделей лаборатории в Crusoe Cloud, при этом производственные нагрузки обслуживаются на выделенном развертывании систем NVIDIA HGX B200 через Crusoe Managed Inference.
В объявлении, датированном Сан‑Франциско, говорится, что Thinking Machines Lab будет обслуживать широкий спектр производственных нагрузок, включая модели Inkling, GLM 5.2 и 5.3, а также собственные доработанные варианты, на выделенном Tailored Deployment систем NVIDIA HGX B200, соединённых с сетью NVIDIA Quantum‑2 InfiniBand. Crusoe охарактеризовал развертывание как разработанное для высокопропускной, экономичной подачи в масштабе.
Crusoe будет напрямую управлять и поддерживать кластер как Tailored Deployment, который в релизе описан как выделенная, протестированная, поддерживаемая SLA конечная точка, предназначенная предоставить Thinking Machines Lab соотношение цены и производительности и запас мощности для масштабирования без необходимости управлять собственной инференс‑стекой. В релизе Crusoe описывает себя как первого в отрасли вертикально интегрированного поставщика AI‑инфраструктуры.
Варианты Managed Inference и движок MemoryAlloy
На странице продукта Managed Inference от Crusoe компания представляет Tailored Deployments как высший уровень оптимизации: клиент предоставляет модель и определяет требования, а Crusoe занимается остальным, предоставляя выделенную, протестированную конечную точку, предназначенную для проприетарных моделей, индивидуальной оптимизации инференса и производительности, поддерживаемой SLA.
Страница также описывает Serverless Inference, потребление открытых моделей на основе использования через полностью управляемый API в Crusoe Intelligence Foundry, а также Self‑Serve Deployments, теперь общедоступные, которые запускают модели в Foundry с инференсом, оптимизированным для пропускной способности или отклика, включая модели, настроенные с помощью функции Serverless Fine‑Tuning компании. Сам Foundry представлен как платформа для разработчиков, позволяющая находить модели, генерировать API‑ключи, отслеживать метрики производительности и развертывать управляемые конечные точки.
Crusoe заявляет, что его движок инференса работает на основе MemoryAlloy — кластерно‑нативной памяти‑тканевой сети, сохраняющейся между узлами и обеспечивающей интеллектуальную маршрутизацию для устранения избыточных вычислений предзаполнения. Компания сообщает о ускорении до 9,9‑кратного времени до первого токена и в 5 раз более высокой пропускной способности благодаря спекулятивному декодированию и динамической пакетной обработке; эти показатели сравнивались с vLLM, обслуживающим модель Llama‑3.3‑70B в четырёхузловом развертывании.
Модели Inkling и GLM
В перечень рабочих нагрузок, указанных в соглашении, входит собственная семья Inkling лаборатории. Thinking Machines Lab выпустила Inkling 15 июля 2026 г., описав её как трансформер Mixture‑of‑Experts с открытыми весами, имеющий 975 млрд общих параметров и 41 млрд активных параметров, поддерживающий контекстное окно до 1 млн токенов. По данным лаборатории, Inkling была предварительно обучена на 45 триллионов токенов, охватывающих текст, изображения, аудио и видео, и это был первый крупный тренировочный запуск лаборатории, выполненный на системах NVIDIA GB300 NVL72.
Вместе с Inkling лаборатория представила Inkling‑Small, облегчённую модель Mixture‑of‑Experts с 276 млрд параметров и 12 млрд активных параметров, предлагающую иной компромисс между производительностью и задержкой. Полные веса Inkling опубликованы на Hugging Face, как в виде оригинального чекпоинта, так и в виде чекпоинта NVFP4 для эффективного инференса на системах NVIDIA Blackwell, а модель доступна для доработки в Tinker, платформе лаборатории по кастомизации моделей, с вариантами контекстной длины 64 К и 256 К.
В соглашении также указаны GLM 5.2 и GLM 5.3 среди производственных нагрузок лаборатории в сервисе. В хабе моделей Managed Inference от Crusoe перечислен GLM 5.3 от Z.ai с 753 млрд параметров и контекстом в 1 000 000 токенов, а также GLM 5.3 Flash с 320 млрд параметров; обе модели доступны для Serverless Inference.
Заявления руководства и планируемое расширение
“Crusoe Managed Inference быстро перевела нас от оценки к продакшну и соответствовала тем стандартам, которым мы предъявляем требования к собственным системам, предоставив масштаб и экономию, позволяющие реинвестировать в исследования, лежащие в основе нашей деятельности”, — сказал Майл Отт, руководитель ML Infra в Thinking Machines Lab.
Эрван Менар, старший вице-президент по управлению продуктами в Crusoe Cloud, сказал, что у Thinking Machines Lab есть продвинутая инженерная команда, которая ожидает от партнёров соответствия высоким требованиям по мере роста. Он отметил, что Crusoe создал Managed Inference, чтобы предоставить экономичную, надёжную инфраструктуру, инференс и инструменты жизненного цикла моделей как сервис, позволяя компаниям запускать выбранные модели в продакшн‑масштабе.
Компании также заявили о планах расширения в сторону пакетного инференса для генерации синтетических данных в крупномасштабных объёмах, что в релизе представлено как превращение инференса в «маховик» для исследований. Crusoe сообщил, что Thinking Machines Lab присоединилась к списку клиентов, благодаря которым Crusoe Managed Inference превысил $100 млн подписанного ARR менее чем за год после запуска.












