パートナーシップ

CrusoeがPerplexityのトレーニングと推論を支えるマルチイヤー契約に署名

mm
Unite.AI を Google の優先ソースに追加

Crusoeは2026年9月15日に、Perplexityとのマルチイヤーパートナーシップを発表した。この提携により、PerplexityはCrusoe Cloud上でモデルライフサイクル全体を実行し、専用のNVIDIA GB300 NVL72クラスターで最先端モデルのトレーニングを行い、CrusoeのManaged Inferenceサービスを通じて本番環境で提供する。

サンフランシスコ発の発表では、Crusoeが従業員1,800人向けにPerplexity Enterprise ProとMaxを導入することも約束しています。リリースによると、この導入はスタッフにウェブおよび社内知識検索、マルチステップリサーチ、データ分析、そして最先端AIモデルへのアクセスを提供することを目的としています。

本リリースでは、Perplexityの製品は数百万ユーザーに対してリアルタイムで動作すると説明されており、推論のレイテンシとスループットが理論的ベンチマークではなく製品そのものとなる環境です。Crusoeは、同社のManaged Inferenceサービスが独自の最適化により本番レベルの推論を実現し、人気モデル全体で性能とコストを最適化するよう設計されていると述べ、Crusoe CloudがPerplexityの成長に見合う運用深度と規模を提供すると語っています。

経営陣の声明

Crusoeの共同創業者兼CEOであるChase Lochmillerは、最も急速に動くAI企業はモデルライフサイクル全体でペースを保ち、成長に合わせてスケールするインフラが必要だと述べました。”Perplexityは人々が答えを見つける方法の未来を構築しており、Crusoeは最初の電子から最後のトークンまでそれを実現する重要なパートナーです” とLochmillerは語っています。

Perplexityの共同創業者兼CEOであるAravind Srinivasは、Perplexity規模でAIを運用することはレイテンシの1ミリ秒がユーザーに直接影響することを意味すると述べました。彼はCrusoeをその制約に基づいて構築されたと説明し、次世代ハードウェアに支えられた高スループット・低レイテンシ推論と評価しました。

NVIDIAのHPCおよびAIインフラストラクチャソリューション部門上級ディレクターであるDion Harrisは、現代のAIは研究から展開まで統合されたコンピューティングアーキテクチャを必要とすると述べました。NVIDIA GB300 NVL72とNVIDIA InfiniBandによって駆動されると同時に、Harrisは、Crusoe CloudがPerplexityに対し、エージェントAIが求める速度と効率で本番環境で最先端モデルのトレーニング、ファインチューニング、提供を可能にすると語りました。

GB300 NVL72プラットフォーム

契約で指定された専用トレーニングクラスターはNVIDIAのGB300 NVL72上で稼働し、NVIDIAはこれを72枚のBlackwell Ultra GPUと36個のArmベースGrace CPUを統合した、完全液体冷却のラック規模システムと説明しています。NVIDIAが公表した仕様では、NVLink帯域幅130 TB/s、GPUメモリ20 TB(最大576 TB/sの帯域)、高速メモリ37 TB、Arm Neoverse V2 CPUコア2,592個が示されています。システム内の各GPUはConnectX-8 SuperNIC I/Oモジュールを介して800 Gb/sのネットワーク接続を受け、Quantum-X800 InfiniBandまたはSpectrum-X Ethernetネットワーキングプラットフォームのいずれかと連携します。

NVIDIAは、GB300 NVL72上に構築されたAIファクトリーがHopperベースのプラットフォームと比較して、全体的な出力性能が最大50倍向上すると主張しています。同社はこの数値を、ユーザーあたりのトークン/秒で測定されたユーザー応答性が10倍向上し、Hopperに対してメガワット当たりのスループットが5倍向上したことに起因すると説明し、これらの数値は将来的に変動する可能性のある予測性能であると付記しています。

Managed Inferenceサービスとその歴史

契約の本番提供要素はCrusoe Managed Inference上で動作し、同社はこのサービスを2025年11月20日に一般提供開始しました。Crusoe Cloud上の本番推論ワークロード向けです。このサービスは、MemoryAlloyを中心としたCrusoe独自の推論エンジンによって駆動され、クラスター全体のキー・バリューキャッシュであるため、GPUがローカルおよびリモートノードからプレフィックスキャッシュを取得でき、重複するプリフィルを排除します。Crusoeは、このエンジンが最初のトークンまでの時間を最大9.9倍高速化し、スループットを5倍向上させると述べており、4ノード展開でLlama-3.3-70Bモデルに対してvLLMと比較したベンチマーク結果です。

Crusoeは、Managed Inference製品ページに記載されている通り、3つのデプロイオプションで本サービスを提供しています。Serverless Inferenceは、完全に管理されたAPIを通じてオープンモデルの使用量ベースの消費を提供し、初期段階のワークロード、低トラフィック、迅速な実験を対象としています。ページが現在一般提供中とするSelf-Serve Deploymentsは、スループットまたは応答性に最適化されたモデルを実行し、CrusoeのServerless Fine-Tuningでカスタマイズされたモデルも含みます。Tailored Deploymentsは、顧客とCrusoeのチームを組み合わせ、専用のベンチマーク済みエンドポイントを提供するオプションで、ページはこれを独自モデル向けに案内しています。

開発者はCrusome Intelligence Foundryを通じてサービスにアクセスでき、APIキーの生成、各モデルにチューニングされたマネージドエンドポイントの使用、パフォーマンス指標の監視、そして本番規模デプロイのためのプロビジョンドスループットの有効化が可能です。Crusoeのモデルハブには、DeepSeek、Google、Z.ai、OpenAI、Meta、Alibaba、NVIDIAなどのラボからの事前構成オープンモデルが掲載されており、各モデルのパラメータ数とコンテキスト長が記載されています。

テオ・ナッシュは、Unite.AIのAI生成専門家で、AIインフラストラクチャ、コンピューティング、そしてモダンな人工知能を支えるハードウェアシステムについて取り上げています。彼の仕事は、大規模なAIワークロードの背後にある技術的基礎に焦点を当てており、データセンター、加速器、ネットワーク、そしてそれらを結びつけるソフトウェアスタックを含みます。
分析的かつエンジニアリング主導の視点から、テオは、GPU、カスタムシリコン、メモリアーキテクチャ、分散システムの進歩が新しいAIモデルの世代をどのように可能にしているかを調査しています。彼は、パフォーマンスのトレードオフ、エネルギー効率、スケーラビリティ、そしてAIインフラストラクチャの現実世界での展開を形作る実用的制約に特に注意を払っています。
テオ・ナッシュによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明確性、そして急速に進化しているAIコンピューティング景観の責任ある報道を確保するためにレビューされています。