AIモデルとプラットフォーム
Cerebras、分散化により推論スループットが5倍向上したと報告

Cerebras Systemsは2026年10月1日、分散化と呼ばれる手法を用いて初期結果で推論スループットを5倍に向上させたと述べました。使用したCerebrasシステムの数は同じで、トークン生成速度の低下はありませんでした。この開示は基礎からの分散推論という、Isaac TaiとZhenwei Gaoによる同社のブログ記事で行われ、同テーマの計画されたシリーズの第一回となります。
この記事は、分散化という用語や、プレフィルは計算に依存し、デコードはメモリに依存するといった主張を聞いたことがある読者向けにシリーズの枠組みを示し、実際にそれが何を意味するのかを説明します。説明は基礎から構築され、アクセラレータが演算とデータ転送をどのようにバランスさせるかから始まります。
プレフィルとデコードはハードウェアに異なる要求を課す
この記事では、算術強度を「メモリとアクセラレータの計算ユニット間で転送されるバイト数で割った浮動小数点演算回数」と定義しています。例の一つでは、2つの行列を加算する際、6バイト転送ごとに1 FLOP が実行され、算術強度は 0.167 FLOP/バイトとなり、この比率は行列が大きくなるにつれて一定です。行列乗算は異なる挙動を示し、各出力値は一方の入力の全行と他方の入力の全列から構成されるため、読み込まれた値がより多くの出力に寄与し、入力サイズが大きくなるにつれて算術強度が増加します。
記事によれば、推論とはモデルの固定重みと入力トークン間でこのような行列乗算が連鎖するプロセスであり、異なる強度プロファイルを持つ2つのフェーズで実行されます。プレフィル時には、プロンプト全体が大規模な行列演算として並列に処理され、実際のプロンプトは数千から数十万トークンに及ぶことがあります。デコード時にはトークンが一つずつ生成され、モデルは KV キャッシュに依存します。このキャッシュは以前のトークンで計算されたキーと値を保持し、再計算せずに再利用されます。
両フェーズとも、生成される各トークンごとにモデルの重み全体(数百ギガバイトからテラバイト規模になることもある)を計算ユニットへ転送しなければなりません。記事は、プレフィル後に算術強度が低下する一方でメモリ転送量はほぼ一定であることを示し、このギャップが生の計算容量を増やしてもデコード時にトークンが必ずしも速く到達しない理由であると指摘しています。
分散化により推論が別々のプールに分割される
実運用では、推論サーバーは通常多数のリクエストを同時に処理し、プレフィルとデコードが同一ハードウェア上で実行されると、計算集中的なプレフィルがアクティブなデコードリクエストを停滞させる可能性があります。スケジューラは、新規リクエストをできるだけ早く最初のトークンに到達させること、アクティブな応答をスムーズにストリーミングし続けること、総スループットを最大化することの間で選択しなければなりません。バッチ処理により同時リクエストはモデル重みの読み取り作業を共有できますが、バッチサイズが大きくなると各デコードステップに要する時間が長くなり、結果として総スループットは上がるものの、各ユーザーが受け取るトークンは遅くなります。
記事では、分散化を2つのフェーズを別々のハードウェアプールで実行するシステム設計パターンとして説明しています。ステージが分離されると、運用者はハードウェアを割り当て、バッチポリシーを設定し、各フェーズのレイテンシまたはスループットを個別に優先順位付けできます。たとえば、最初のトークンまでの時間を厳格に管理するシステムはプレフィルにより多くの容量を確保し、スムーズなストリーミングを重視するシステムはデコードに大きなプールまたはより緊密にスケジュールされたプールを割り当てます。これらのプールは個別にスケールさせることも可能です。
分離により新たな要件が生じます。プレフィルで KV キャッシュが構築された後、そのリクエスト固有の状態はデコードプールへ転送され、生成を続行できるようメモリにロードされます。一方、モデルの重みは両プールにすでにロードされています。記事は、ハンドオフにネットワークと調整のオーバーヘッドが加わり、容量が需要に合わない場合はどちらかのプールがアイドル状態になる可能性があること、そして追加のレイテンシはキャッシュが同一ロケーションのマシン間で移動するか、地域間で移動するかに依存すると指摘しています。分散化は規模が大きいほど魅力的であり、プールを独立してサイズ設定・スケジューリングすることで得られる利益が転送や運用コストを上回り、ストリーミングを滑らかにするだけでなく、サービスシステムの制御インターフェース自体を変えると論じています。
異種ハードウェア、初期結果、そしてパートナーシップ
Cerebrasは、異種分散化の開発をリードしており、1つの推論システム内で複数種のチップを組み合わせ、メモリに依存するセグメントと計算に依存するセグメントに異なるハードウェアを割り当てています。記事では、同社のウェーハスケール設計(ウェーハ全体に SRAM と計算リソースを分散配置)と、GPU が高帯域メモリから小規模なオンチップメモリやキャッシュを経由してモデルデータをステージングする方式を比較しています。
記事に掲載された、2026年9月10日付のピークメモリ帯域幅チャートでは、Cerebras WSE-3 のオンチップ SRAM がウェーハあたり 21,000 TB/s、名前のないオンチップ SRAM アクセラレータが 150 TB/s、HBM4 GPU がそれぞれ 23.3 TB/s と 22 TB/s と示されています。このチャートは、SRAM の数値はプロセッサ全体のローカルメモリ帯域幅の合計であり、HBM の数値はオフチップメモリからのトラフィックを測定したものであるため、これらの数値はトークン速度を測ったものではなく、異なるメモリ階層を表すことに注意を促しています。
この投稿は、2026年9月10日のArtificial Analysisデータを再掲し、GPT-oss-120Bが10,000トークンの入力で高度な推論を実行していることを示しています。Cerebrasは1秒あたり1,669トークン、SambaNovaは708トークン、Groqは475トークン、Microsoft Azureは319トークン、Nebiusは294トークン、Basetenは293トークンと一覧化しています。
Cerebrasは、従来の統合システムでは容量を増やすことはより多くのハードウェアを導入することを意味し、パートナーアクセラレータを活用してプロンプト処理を担当させることで、同一のWSEフットプリントで初期テストにおいて容量を5倍に向上させたと述べました。同社は、より高速なトークンを市場に提供するために複数のハードウェアパートナーと提携したと発表し、投稿内の図では、AWS Trainium と AMD Helios Instinct GPU システムが、Cerebras のデコードプールに供給するプレフィルハードウェアオプションの一部として示されています。
この投稿は、エージェント型アプリケーションが異種分散に非常に適していると指摘しています。なぜなら、これらはしばしば長く複数ターンのワークフローを伴い、モデル呼び出しごとにコンテキストが蓄積し、各ステップでの遅延が累積するからです。Cerebrasは、次回の掲載で関与するハードウェアおよびソフトウェアスタックと、大規模な分散推論を展開する際の経済的トレードオフについて取り上げると述べました。












