Партнёрства

Thinking Machines Lab подписывает годовое соглашение на $65 млн для Crusoe Cloud Inference

mm
Добавьте Unite.AI в избранные источники в Google

Crusoe и Thinking Machines Lab объявили о годовом соглашении на $65 млн 23 сентября 2026 г., чтобы обеспечить инференс открытых моделей лаборатории в Crusoe Cloud, при этом производственные нагрузки обслуживаются на выделенном развертывании систем NVIDIA HGX B200 через Crusoe Managed Inference.

В объявлении, датированном Сан‑Франциско, говорится, что Thinking Machines Lab будет обслуживать широкий спектр производственных нагрузок, включая модели Inkling, GLM 5.2 и 5.3, а также собственные доработанные варианты, на выделенном Tailored Deployment систем NVIDIA HGX B200, соединённых с сетью NVIDIA Quantum‑2 InfiniBand. Crusoe охарактеризовал развертывание как разработанное для высокопропускной, экономичной подачи в масштабе.

Crusoe будет напрямую управлять и поддерживать кластер как Tailored Deployment, который в релизе описан как выделенная, протестированная, поддерживаемая SLA конечная точка, предназначенная предоставить Thinking Machines Lab соотношение цены и производительности и запас мощности для масштабирования без необходимости управлять собственной инференс‑стекой. В релизе Crusoe описывает себя как первого в отрасли вертикально интегрированного поставщика AI‑инфраструктуры.

Варианты Managed Inference и движок MemoryAlloy

На странице продукта Managed Inference от Crusoe компания представляет Tailored Deployments как высший уровень оптимизации: клиент предоставляет модель и определяет требования, а Crusoe занимается остальным, предоставляя выделенную, протестированную конечную точку, предназначенную для проприетарных моделей, индивидуальной оптимизации инференса и производительности, поддерживаемой SLA.

Страница также описывает Serverless Inference, потребление открытых моделей на основе использования через полностью управляемый API в Crusoe Intelligence Foundry, а также Self‑Serve Deployments, теперь общедоступные, которые запускают модели в Foundry с инференсом, оптимизированным для пропускной способности или отклика, включая модели, настроенные с помощью функции Serverless Fine‑Tuning компании. Сам Foundry представлен как платформа для разработчиков, позволяющая находить модели, генерировать API‑ключи, отслеживать метрики производительности и развертывать управляемые конечные точки.

Crusoe заявляет, что его движок инференса работает на основе MemoryAlloy — кластерно‑нативной памяти‑тканевой сети, сохраняющейся между узлами и обеспечивающей интеллектуальную маршрутизацию для устранения избыточных вычислений предзаполнения. Компания сообщает о ускорении до 9,9‑кратного времени до первого токена и в 5 раз более высокой пропускной способности благодаря спекулятивному декодированию и динамической пакетной обработке; эти показатели сравнивались с vLLM, обслуживающим модель Llama‑3.3‑70B в четырёхузловом развертывании.

Модели Inkling и GLM

В перечень рабочих нагрузок, указанных в соглашении, входит собственная семья Inkling лаборатории. Thinking Machines Lab выпустила Inkling 15 июля 2026 г., описав её как трансформер Mixture‑of‑Experts с открытыми весами, имеющий 975 млрд общих параметров и 41 млрд активных параметров, поддерживающий контекстное окно до 1 млн токенов. По данным лаборатории, Inkling была предварительно обучена на 45 триллионов токенов, охватывающих текст, изображения, аудио и видео, и это был первый крупный тренировочный запуск лаборатории, выполненный на системах NVIDIA GB300 NVL72.

Вместе с Inkling лаборатория представила Inkling‑Small, облегчённую модель Mixture‑of‑Experts с 276 млрд параметров и 12 млрд активных параметров, предлагающую иной компромисс между производительностью и задержкой. Полные веса Inkling опубликованы на Hugging Face, как в виде оригинального чекпоинта, так и в виде чекпоинта NVFP4 для эффективного инференса на системах NVIDIA Blackwell, а модель доступна для доработки в Tinker, платформе лаборатории по кастомизации моделей, с вариантами контекстной длины 64 К и 256 К.

В соглашении также указаны GLM 5.2 и GLM 5.3 среди производственных нагрузок лаборатории в сервисе. В хабе моделей Managed Inference от Crusoe перечислен GLM 5.3 от Z.ai с 753 млрд параметров и контекстом в 1 000 000 токенов, а также GLM 5.3 Flash с 320 млрд параметров; обе модели доступны для Serverless Inference.

Заявления руководства и планируемое расширение

“Crusoe Managed Inference быстро перевела нас от оценки к продакшну и соответствовала тем стандартам, которым мы предъявляем требования к собственным системам, предоставив масштаб и экономию, позволяющие реинвестировать в исследования, лежащие в основе нашей деятельности”, — сказал Майл Отт, руководитель ML Infra в Thinking Machines Lab.

Эрван Менар, старший вице-президент по управлению продуктами в Crusoe Cloud, сказал, что у Thinking Machines Lab есть продвинутая инженерная команда, которая ожидает от партнёров соответствия высоким требованиям по мере роста. Он отметил, что Crusoe создал Managed Inference, чтобы предоставить экономичную, надёжную инфраструктуру, инференс и инструменты жизненного цикла моделей как сервис, позволяя компаниям запускать выбранные модели в продакшн‑масштабе.

Компании также заявили о планах расширения в сторону пакетного инференса для генерации синтетических данных в крупномасштабных объёмах, что в релизе представлено как превращение инференса в «маховик» для исследований. Crusoe сообщил, что Thinking Machines Lab присоединилась к списку клиентов, благодаря которым Crusoe Managed Inference превысил $100 млн подписанного ARR менее чем за год после запуска.

Тео Нэш - специалист, сгенерированный ИИ, в Unite.AI, освещающий инфраструктуру ИИ, вычисления и аппаратные системы, которые обеспечивают современный искусственный интеллект. Его работа сосредоточена на технических основах, лежащих в основе крупномасштабных рабочих нагрузок ИИ, включая центры данных, ускорители, сетевое взаимодействие и программные стеки, которые их объединяют.
С аналитической и инженерно-ориентированной точки зрения, Тео исследует, как достижения в области GPU, специального кремния, архитектур памяти и распределенных систем позволяют создавать новые поколения моделей ИИ. Он уделяет особое внимание компромиссам между производительностью, энергоэффективностью, масштабируемостью и практическими ограничениями, которые формируют реальное развертывание инфраструктуры ИИ.
Статьи, написанные Тео Нэшем, сгенерированы ИИ и рассмотрены редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и ответственное освещение быстро развивающегося ландшафта вычислений ИИ.