パートナーシップ

Thinking Machines Lab、Crusoe Cloud 推論向け年額 $65M の契約を締結

mm
Unite.AI を Google の優先ソースに追加

Crusoe と Thinking Machines Lab 年額$65百万の契約を発表した 2026年9月23日、ラボのオープンモデルの推論を支えるため、Crusoe Cloud 上で NVIDIA HGX B200 システムの専用デプロイメントを通じてプロダクションワークロードを提供します。

サンフランシスコ発の発表によると、Thinking Machines Lab は、Inkling モデル、GLM 5.2 および 5.3、そして独自のファインチューニングバリアントを含む幅広いプロダクションワークロードを、NVIDIA Quantum-2 InfiniBand ネットワークで接続された NVIDIA HGX B200 システムの専用 Tailored Deployment 上で提供する予定です。Crusoe はこのデプロイメントを、高スループットかつコスト効率の高いスケール時のサービス提供を目的として設計されたものと位置付けました。

Crusoe はクラスターを直接 Tailored Deployment として運用・サポートし、リリースではこれを、Thinking Machines Lab に価格性能とスケール余裕を提供し、独自の推論スタックを管理することなく利用できるように設計された、専用・ベンチマーク済み・SLA に基づくエンドポイントと説明しています。リリースでは、Crusoe は自社を業界初の垂直統合型 AI インフラストラクチャプロバイダーと位置付けています。

マネージド推論オプションと MemoryAlloy エンジン

Crusoe の Managed Inference 製品ページ では、同社は Tailored Deployments を最高レベルの最適化として提示しています。顧客はモデルを持ち込み要件を定義し、残りは Crusoe が処理し、専用・ベンチマーク済みのエンドポイントが独自モデル、カスタム推論最適化、SLA に基づくパフォーマンス向けに配置されます。

このページでは、Serverless Inference(完全に管理された API を通じてオープンソースモデルを使用量ベースで利用できる)や、現在一般提供中の Self-Serve Deployments(Foundry 内でモデルを実行し、スループットまたは応答性に最適化された推論を提供し、同社の Serverless Fine-Tuning 機能でカスタマイズされたモデルを含む)についても詳述しています。Foundry は、モデルの探索、API キーの生成、パフォーマンス指標の監視、マネージドエンドポイントのデプロイを行う開発者向けプラットフォームとして提示されています。

Crusoe は、同社の推論エンジンが MemoryAlloy によって駆動されていると述べています。MemoryAlloy はクラスターネイティブなメモリファブリックで、ノード間で持続し、インテリジェントなルーティングにより冗長なプレフィル計算を排除します。同社は、投機的デコーディングと動的バッチングを使用することで、最初のトークンまでの時間が最大 9.9 倍速く、スループットが 5 倍向上したと報告しており、これらの数値は 4 ノードデプロイメントで Llama-3.3-70B モデルを vLLM で提供した場合と比較したベンチマーク結果です。

Inkling と GLM モデル

契約で指定されたワークロードには、ラボ独自の Inkling ファミリーが含まれます。Thinking Machines Lab 2026年7月15日に Inkling をリリースした、総パラメータ数 975B、アクティブパラメータ数 41B のオープンウェイト Mixture-of-Experts トランスフォーマーで、最大 1M トークンのコンテキストウィンドウをサポートすると説明しました。ラボによると、Inkling はテキスト、画像、音声、動画を網羅した 45 兆トークンで事前学習されており、NVIDIA GB300 NVL72 システム上で実施されたラボ初の大規模トレーニングです。

Inkling に加えて、ラボは Inkling-Small をプレビューしました。これは 276B パラメータの軽量 Mixture-of-Experts モデルで、アクティブパラメータは 12B で、性能とレイテンシのトレードオフが異なります。Inkling の完全なウェイトは Hugging Face に公開されており、オリジナルチェックポイントと NVIDIA Blackwell システム上で効率的な推論を可能にする NVFP4 チェックポイントの両方が提供されています。また、モデルはラボのモデルカスタマイズプラットフォーム Tinker でファインチューニング可能で、64K と 256K のコンテキスト長オプションがあります。

契約には、サービス上でラボのプロダクションワークロードとして GLM 5.2 と 5.3 も含まれます。Crusoe の Managed Inference モデルハブでは、Z.ai の GLM 5.3 が 753B パラメータで 1,000,000 トークンのコンテキストを持ち、GLM 5.3 Flash が 320B パラメータで、いずれも Serverless Inference で利用可能と掲載されています。

エグゼクティブ声明と計画的拡大

「Crusoe Managed Inference は評価段階から本番環境への移行を迅速に実現し、我々が自社システムに求める基準を満たしてくれました。その結果、規模とコスト効率が向上し、私たちの中核研究に再投資できるようになりました」と Thinking Machines Lab の ML Infra Lead、Myle Ott は述べました。

Crusoe Cloud のプロダクトマネジメント SVP、Erwan Menard は、Thinking Machines Lab が高度なエンジニアリングチームを有しており、成長に伴いパートナーにも高い基準を求めていると述べました。彼は、Crusoe が Managed Inference を構築したのは、コスト効率が高く信頼性のあるインフラストラクチャ、推論、モデルライフサイクルツールをサービスとして提供し、企業が選択したモデルをスケールした本番環境で実行できるようにするためだと語っています。

両社は、大規模な合成データ生成のためのバッチ推論への拡大も検討していると述べており、リリースではこれを研究のための推論を回転軸(フライホイール)に変えることと位置付けています。Crusoe は、Thinking Machines Lab がローンチから1年未満で契約 ARR が $100 百万を超える顧客リストに加わったと述べました。

テオ・ナッシュは、Unite.AIのAI生成専門家で、AIインフラストラクチャ、コンピューティング、そしてモダンな人工知能を支えるハードウェアシステムについて取り上げています。彼の仕事は、大規模なAIワークロードの背後にある技術的基礎に焦点を当てており、データセンター、加速器、ネットワーク、そしてそれらを結びつけるソフトウェアスタックを含みます。
分析的かつエンジニアリング主導の視点から、テオは、GPU、カスタムシリコン、メモリアーキテクチャ、分散システムの進歩が新しいAIモデルの世代をどのように可能にしているかを調査しています。彼は、パフォーマンスのトレードオフ、エネルギー効率、スケーラビリティ、そしてAIインフラストラクチャの現実世界での展開を形作る実用的制約に特に注意を払っています。
テオ・ナッシュによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明確性、そして急速に進化しているAIコンピューティング景観の責任ある報道を確保するためにレビューされています。