Ortaklıklar
Thinking Machines Lab, Crusoe Cloud Inference için $65M Yıllık Anlaşma İmzaladı

Crusoe ve Thinking Machines Lab $65 million yıllık bir anlaşma duyurdu 23 Eylül 2026’da, laboratuvarın açık modelleri için Crusoe Cloud’da çıkarım gücünü sağlamak amacıyla, üretim iş yükleri NVIDIA HGX B200 sistemlerinin özel bir dağıtımı üzerinden Crusoe Managed Inference aracılığıyla sunulacak.
San Francisco tarihli duyuru, Thinking Machines Lab’ın Inkling modelleri, GLM 5.2 ve 5.3 ve kendi ince ayarlı varyantları dahil olmak üzere bir dizi üretim iş yükünü, NVIDIA Quantum-2 InfiniBand ağıyla bağlanan NVIDIA HGX B200 sistemlerinin özel bir Tailored Deployment’ı üzerinde sunacağını belirtiyor. Crusoe, bu dağıtımı yüksek verimli, maliyet-etkin ölçekli hizmet için tasarlanmış olarak nitelendiriyor.
Crusoe, kümeyi doğrudan bir Tailored Deployment olarak çalıştırıp destekleyecek; bu sürümde, Thinking Machines Lab’a kendi çıkarım yığınına sahip olmadan fiyat-performans ve ölçeklenebilirlik payı sağlamak amacıyla tasarlanmış, özel, benchmarklanmış, SLA destekli bir uç nokta olarak tanımlanıyor. Sürümde, Crusoe kendisini sektörün ilk dikey bütünleşik AI altyapı sağlayıcısı olarak tanımlıyor.
Yönetilen Çıkarım Seçenekleri ve MemoryAlloy Motoru
Crusoe’nun Managed Inference ürün sayfası üzerinde şirket, Tailored Deployments’ı en yüksek optimizasyon seviyesi olarak sunuyor: müşteri modeli getiriyor ve gereksinimleri tanımlıyor, geri kalanını ise Crusoe hallediyor; özel modeller, özelleştirilmiş çıkarım optimizasyonu ve SLA destekli performans için konumlandırılmış, özel, benchmarklanmış bir uç nokta sağlanıyor.
Sayfa ayrıca Serverless Inference’ı, Crusoe Intelligence Foundry içinde tam yönetilen bir API aracılığıyla açık kaynak modellerinin kullanım bazlı tüketimini ve artık genel kullanıma açık Self-Serve Deployments’ı detaylandırıyor; bu dağıtımlar, Foundry içinde modelleri çalıştırarak çıkarımı verimlilik ya da yanıt süresi için optimize ediyor ve şirketin Serverless Fine-Tuning özelliğiyle özelleştirilmiş modelleri içeriyor. Foundry, modelleri keşfetmek, API anahtarları oluşturmak, performans metriklerini izlemek ve yönetilen uç noktaları dağıtmak için bir geliştirici platformu olarak sunuluyor.
Crusoe, çıkarım motorunun MemoryAlloy tarafından desteklendiğini belirtiyor; bu, düğümler arasında kalıcı olan ve gereksiz ön doldurma hesaplamalarını ortadan kaldırmak için akıllı yönlendirme sağlayan bir küme yerel bellek dokumasıdır. Şirket, spekülatif kod çözme ve dinamik toplu işleme kullanarak ilk token süresinde 9.9x daha hızlı ve verimlilikte 5x daha yüksek bir artış rapor ediyor; bu rakamlar, dört düğümlü bir dağıtımda Llama-3.3-70B modelini vLLM ile hizmet verirken yapılan benchmark sonuçlarıdır.
Inkling ve GLM Modelleri
Anlaşmanın adı geçen iş yükleri, laboratuvarın kendi Inkling ailesini içeriyor. Thinking Machines Lab 15 Temmuz 2026’da Inkling’i yayınladı, onu 975B toplam parametre ve 41B aktif parametreye sahip, açık ağırlıklı Mixture-of-Experts dönüştürücü olarak tanımlıyor ve 1M token’a kadar bir bağlam penceresini destekliyor. Laboratuvara göre, Inkling, metin, görüntü, ses ve video kapsayan 45 trilyon token üzerinde ön eğitim almış ve bu çaba, laboratuvarın NVIDIA GB300 NVL72 sistemlerinde gerçekleştirilen ilk büyük eğitim çalışmasıydı.
Inkling’in yanında, laboratuvar Inkling‑Small’ı ön izledi; 276 B parametreli daha hafif bir Mixture‑of‑Experts modeli, 12 B aktif parametreye sahip ve farklı bir performans ve gecikme dengesi sunuyor. Inkling’in tam ağırlıkları Hugging Face üzerinde yayınlanıyor, hem orijinal checkpoint hem de NVIDIA Blackwell sistemlerinde verimli çıkarım için bir NVFP4 checkpoint olarak, ve model Tinker’da, laboratuvarın model‑özelleştirme platformunda, 64 K ve 256 K bağlam uzunluğu seçenekleriyle ince ayar için kullanılabilir.
Anlaşma ayrıca GLM 5.2 ve 5.3’ü laboratuvarın hizmet üzerindeki üretim iş yükleri arasına dahil ediyor. Crusoe’nun Managed Inference model hub’ı, Z.ai’nin 1,000,000 token bağlamına sahip 753B parametreli GLM 5.3’ünü ve 320B parametreli GLM 5.3 Flash’ı listeliyor; her ikisi de Serverless Inference için kullanılabilir.
Yönetici Açıklamaları ve Planlanan Genişleme
“Crusoe Managed Inference, bizi değerlendirmeden üretime hızlı bir şekilde taşıdı ve kendi sistemlerimize uyguladığımız standartları karşıladı; bize, yaptığımız işin temelindeki araştırmaya yeniden yatırım yapmamızı sağlayacak ölçek ve ekonomik avantajlar sağladı,” dedi Thinking Machines Lab’da ML Infra Lead olan Myle Ott.
Crusoe Cloud için Ürün Yönetimi SVP’si Erwan Menard, Thinking Machines Lab’ın, büyüdükçe ortakların yüksek standartlarını karşılamasını bekleyen sofistike bir mühendislik ekibine sahip olduğunu söyledi. Crusoe’nun Managed Inference’ı, maliyet-etkin, güvenilir altyapı, çıkarım ve model yaşam döngüsü araçlarını hizmet olarak sunmak için geliştirdi; böylece şirketler seçtikleri modelleri ölçekli üretimde çalıştırabilir.
Şirketler, büyük ölçekli sentetik veri üretimi için toplu çıkarıma genişlemeyi de planladıklarını belirtti; bu duyuru, çıkarımı araştırma için bir döngü haline getirme olarak çerçevelendiriyor. Crusoe, Thinking Machines Lab’ın, lansmandan bir yılın altında sözleşmeli ARR’de $100 millionun üzerine çıkan bir müşteri listesine katıldığını söyledi.












