Kemitraan

Thinking Machines Lab Menandatangani Kesepakatan Tahunan $65M untuk Crusoe Cloud Inference

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Crusoe dan Thinking Machines Lab mengumumkan kesepakatan tahunan $65 juta pada 23 September 2026, untuk mempercepat inference bagi model terbuka laboratorium di Crusoe Cloud, dengan beban kerja produksi dilayani pada penyebaran khusus sistem NVIDIA HGX B200 melalui Crusoe Managed Inference.

Pengumuman, yang berlokasi di San Francisco, menyatakan bahwa Thinking Machines Lab akan melayani berbagai beban kerja produksi, termasuk model Inkling, GLM 5.2 dan 5.3, serta varian yang di‑fine‑tune sendiri, pada Tailored Deployment khusus sistem NVIDIA HGX B200 yang terhubung dengan jaringan NVIDIA Quantum-2 InfiniBand. Crusoe menggambarkan penyebaran tersebut sebagai dirancang untuk throughput tinggi, layanan yang hemat biaya pada skala besar.

Crusoe akan menjalankan dan mendukung klaster secara langsung sebagai Tailored Deployment, yang dalam rilis dijelaskan sebagai endpoint khusus, terbenchmark, didukung SLA, yang dimaksudkan untuk memberikan Thinking Machines Lab kinerja‑harga dan ruang kepala untuk skala tanpa mengelola tumpukan inference sendiri. Dalam rilis tersebut, Crusoe menggambarkan dirinya sebagai penyedia infrastruktur AI terintegrasi vertikal pertama di industri.

Opsi Managed Inference dan Mesin MemoryAlloy

Pada halaman produk Managed Inference Crusoe, perusahaan menyajikan Tailored Deployments sebagai tingkat optimisasi tertinggi: pelanggan membawa model dan mendefinisikan persyaratan sementara Crusoe menangani sisanya, dengan endpoint khusus yang terbenchmark yang ditujukan untuk model proprietari, optimisasi inference khusus, dan kinerja yang didukung SLA.

Halaman tersebut juga merinci Serverless Inference, konsumsi berbasis penggunaan model open‑source melalui API yang sepenuhnya dikelola di Crusoe Intelligence Foundry, serta Self‑Serve Deployments, yang kini tersedia secara umum, yang menjalankan model di Foundry dengan inference yang dioptimalkan untuk throughput atau responsivitas, termasuk model yang disesuaikan dengan fitur Serverless Fine‑Tuning perusahaan. Foundry sendiri dipresentasikan sebagai platform pengembang untuk menemukan model, menghasilkan kunci API, memantau metrik kinerja, dan menyebarkan endpoint terkelola.

Crusoe menyatakan bahwa mesin inference‑nya didukung oleh MemoryAlloy, sebuah fabric memori native klaster yang bertahan lintas node dan memungkinkan routing cerdas untuk menghilangkan perhitungan prefill yang berulang. Perusahaan melaporkan hingga 9,9× waktu ke token pertama lebih cepat dan throughput 5× lebih tinggi dengan menggunakan decoding spekulatif dan batching dinamis, angka yang dibandingkan dengan vLLM yang melayani model Llama-3.3-70B dalam penyebaran empat node.

Model Inkling dan GLM

Beban kerja yang disebutkan dalam kesepakatan mencakup keluarga Inkling milik laboratorium. Thinking Machines Lab merilis Inkling pada 15 Juli 2026, menggambarkannya sebagai transformer Mixture‑of‑Experts dengan bobot terbuka yang memiliki 975B total parameter dan 41B parameter aktif, mendukung jendela konteks hingga 1M token. Menurut laboratorium, Inkling dilatih sebelumnya pada 45 triliun token yang mencakup teks, gambar, audio, dan video, dan upaya tersebut merupakan pelatihan besar pertama laboratorium, yang dilakukan pada sistem NVIDIA GB300 NVL72.

Selain Inkling, laboratorium memperkenalkan Inkling‑Small, model Mixture‑of‑Experts dengan bobot lebih ringan 276B parameter dan 12B parameter aktif yang memiliki pertukaran kinerja dan latensi yang berbeda. Bobot lengkap Inkling dipublikasikan di Hugging Face, baik sebagai checkpoint asli maupun sebagai checkpoint NVFP4 untuk inference efisien pada sistem NVIDIA Blackwell, dan model tersebut tersedia untuk fine‑tuning di Tinker, platform kustomisasi model laboratorium, dengan opsi panjang konteks 64K dan 256K.

Kesepakatan juga menempatkan GLM 5.2 dan 5.3 di antara beban kerja produksi laboratorium pada layanan tersebut. Hub model Managed Inference Crusoe mencantumkan GLM 5.3 dari Z.ai dengan 753B parameter dan konteks 1.000.000‑token serta GLM 5.3 Flash dengan 320B parameter, keduanya tersedia untuk Serverless Inference.

Pernyataan Eksekutif dan Rencana Ekspansi

“Crusoe Managed Inference membawa kami dari evaluasi ke produksi dengan cepat dan memenuhi standar yang kami terapkan pada sistem kami sendiri, memberi kami skala dan ekonomi untuk berinvestasi kembali dalam riset yang menjadi inti dari apa yang kami lakukan,” kata Myle Ott, Pemimpin Infra ML di Thinking Machines Lab.

Erwan Menard, SVP Manajemen Produk untuk Crusoe Cloud, mengatakan bahwa Thinking Machines Lab memiliki tim teknik yang canggih yang mengharapkan mitra memenuhi standar tinggi seiring pertumbuhan. Ia menyatakan bahwa Crusoe membangun Managed Inference untuk menyediakan infrastruktur, inference, dan alat siklus hidup model yang hemat biaya dan dapat diandalkan sebagai layanan sehingga perusahaan dapat menjalankan model pilihan mereka dalam produksi berskala.

Perusahaan‑perusahaan tersebut mengatakan mereka juga berencana memperluas ke batch inference untuk generasi data sintetis berskala besar, yang dalam rilis digambarkan sebagai mengubah inference menjadi roda penggerak bagi riset. Crusoe menyatakan bahwa Thinking Machines Lab bergabung dengan daftar pelanggan yang telah melampaui $100 juta ARR kontrak kurang dari satu tahun sejak peluncuran.

Theo Nash adalah seorang spesialis yang dihasilkan oleh AI di Unite.AI, yang meliputi infrastruktur AI, komputasi, dan sistem perangkat keras yang memungkinkan kecerdasan buatan modern. Pekerjaannya berfokus pada fondasi teknis di balik beban kerja AI skala besar, termasuk pusat data, akselerator, jaringan, dan tumpukan perangkat lunak yang menghubungkannya.
Dengan perspektif analitis dan berbasis teknik, Theo memeriksa bagaimana kemajuan dalam GPU, silikon kustom, arsitektur memori, dan sistem terdistribusi memungkinkan generasi baru model AI. Ia memperhatikan khusus pada pertukaran kinerja, efisiensi energi, skalabilitas, dan kendala praktis yang membentuk penerapan infrastruktur AI di dunia nyata.
Artikel yang ditulis oleh Theo Nash dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi teknis, kejelasan, dan liputan yang bertanggung jawab atas lanskap komputasi AI yang berkembang pesat.