AIモデルとプラットフォーム

Cerebras、OpenAI の GPT-5.6 Sol を新しい Ultrafast ティアで秒間 750 トークンで実行

mm
Unite.AI を Google の優先ソースに追加

Cerebras (CBRS ) は現在、GPU クラウドが公に匹敵できない速度で OpenAI の旗艦モデルを実行しています。2026 年 8 月 13 日、ウェーハスケール チップメーカー が発表、Ultrafast と呼ばれる新しい OpenAI サービスティアで GPT-5.6 Sol を動かし、最大で秒間 750 トークンの出力を実現し、OpenAI の見解によれば、標準処理より最大 14 倍高速でモデルを実行しています。Ultrafast はまず限定プレビューとして OpenAI API で一部顧客に提供され、容量が増えるにつれてアクセスが拡大します。

中心となる主張は明確です――先端的な知能を速度低下なしで提供すること。GPT-5.6 Sol は OpenAI の最も高性能なモデルであり、Cerebras のシリコン上ではトークン生成がリアルタイム製品に組み込めるほど高速で、従来の夜間バッチ処理の裏で走る必要がありません。両社はこのティアを、ハイステークスな作業に十分賢いモデルと、作業が進行中でも使用できるほど高速なモデルとのトレードオフを解消するものとして位置付けています。

Ultrafast の背後にある速度数値

秒間 750 トークンという数値が見出し的なインパクトを持ちますが、より示唆に富む比較は Cerebras が公開した直接比較の結果です。Artificial Analysis が報告した出力速度と比較して、Ultrafast 上の GPT-5.6 Sol は Claude Fable 5 の 11 倍、Fast モードの Opus 4.8 の 5 倍の速度で動作すると同社は述べています。

Cerebras はまた、PhD レベルの難易度を想定した 2,500 問のベンチマーク「Humanity’s Last Exam」でもこのティアをフルパスさせました。Ultrafast 上の GPT-5.6 Sol は 2,500 問すべてに 11 時間 11 分で回答し、Claude Fable 5 は同等の結論に達するのに 78 時間 27 分要したと同社は報告しています――約 7 倍遅いということです。経済的に価値のある知的作業を測るベンチマーク GDP‑Val では、標準処理に比べてエンドツーエンドで 5.6 倍の速度向上を実現し、品質の低下はありませんでした。

これらはベンダー主導の評価であり、Cerebras はその点を明言しています――Humanity’s Last Exam の比較は 2026 年 7 月 10 日と 7 月 13〜15 日に Cerebras がベンチマークを実施し、GDP‑Val の数値は同社が 2026 年 7 月 31 日に行ったテストから得られたものです。独立した結果ではなく、同社独自の測定値として扱ってください。

ウェーハスケールチップがレイテンシで優位になる理由

ここで重要なのは仕組みです。これが、比較的小規模なチップメーカーが GPU 既存企業が追いつけない速度で OpenAI の最大規模モデルを提供できる理由を説明します。大規模モデルの高速推論は本質的にデータ移動の問題であり、GPU では各トークンを生成するたびにモデルの重みをオンチップメモリとオフチップストレージ間で何度もやり取りする必要があり、メモリ帯域幅がボトルネックになります。

Cerebras の解決策は、この移動を根本的に排除することです。同社の Wafer‑Scale Engine は 44 GB の SRAM を単一のウェーハサイズチップに搭載しており、モデルの重みはオンチップに留まり、トークンはウェーハ間でパイプライン化された層を途切れなく通過します。重みがシリコンから離れないため、アプローチはモデルサイズに比例して拡張でき、先端モデルが大きくなるにつても速度優位性が保たれるというのが同社の主張です。推論コストの観点から見ると、モデル提供のコストとレイテンシは、重みをどれだけ速く計算資源に供給できるかに支配されますが、44 GB を単一ダイに常駐させることでこの課題に直接対処しています。

100億ドル規模のパートナーシップが旗艦モデルに到達

Ultrafast は、数か月にわたって築かれてきた関係の中で最も顕著な製品です。OpenAI は 2026 年初頭に 低レイテンシ計算に 100 億ドル規模で Cerebras を起用しており、今回のリリースでその計算リソースが同社の小規模または特化型モデルではなく、トップモデルの背後に配置されました。OpenAI は Ultrafast を、プラットフォームに超低レイテンシ推論をもたらすパートナーシップの「次のステップ」と表現しています。

Cerebras にとってこの配置は重要です。同社は長らく、マーケットの重心が GPU サプライヤにある中でも、ウェーハスケールアーキテクチャが推論に最適な形態であると主張してきました――既存企業が モデルをシリコンに直接組み込む方向へと舵を切る中で、アクセラレータ事業全体で競争が繰り広げられています。OpenAI の旗艦モデルの提供層を担うことで、Cerebras は市場トップの実績あるリファレンス顧客を獲得しました。このモデルは OpenAI が発表した GPT‑5.6 ファミリー(旗艦の Sol、バランスの取れた Terra、コスト効率の高い Luna)を基盤としており、Ultrafast は Cerebras をそのラインナップの最前線に位置付けます。

誰が利用でき、何のために使われるか

OpenAI はこのティアを、時間的に敏感でハイステークスな作業向けに位置付けています――障害が進行中のインシデント対応、変動する市場状況下での金融リサーチ、リアルタイムのカスタマーサポートや音声、コマース、そしてかつては夜間に実行されていたライブリサーチループなどです。早期アクセスは、Jane Street、Podium、Basis、Rogo など、コーディング、コマース、金融分野の企業に提供されています。

「Cerebras がもたらした速度向上は印象的です」と Jane Street の AI アシスタント部門の John Crepezzi 氏は OpenAI の発表で述べました。「これによりモデルの利用方法が多様化し、開発者がより集中し生産的に作業できるようになりました」。

OpenAI は意図的に展開範囲を限定しています。同社はプレビュー期間中に、桁違いの速度向上がどこで最大の価値を生むかを学び、容量が拡大するにつれてアクセスを広げると述べています。OpenAI と Cerebras の両社は、プレビューが拡大するにつれてアップデートの登録を受け付けています。

今後の展開

短期的に注目すべきは能力ではなく容量です。Ultrafast は限定プレビューであり、両社はより広範な提供を固定された日付ではなく容量の増加に結び付けています――したがって拡大速度が注目点です。長期的な課題は、OpenAI のモデルが拡大するにつれて Cerebras のオンチップメモリ優位性が維持できるかどうかであり、これこそがウェーハスケールアーキテクチャが掲げる賭けそのものです。

テオ・ナッシュは、Unite.AIのAI生成専門家で、AIインフラストラクチャ、コンピューティング、そしてモダンな人工知能を支えるハードウェアシステムについて取り上げています。彼の仕事は、大規模なAIワークロードの背後にある技術的基礎に焦点を当てており、データセンター、加速器、ネットワーク、そしてそれらを結びつけるソフトウェアスタックを含みます。
分析的かつエンジニアリング主導の視点から、テオは、GPU、カスタムシリコン、メモリアーキテクチャ、分散システムの進歩が新しいAIモデルの世代をどのように可能にしているかを調査しています。彼は、パフォーマンスのトレードオフ、エネルギー効率、スケーラビリティ、そしてAIインフラストラクチャの現実世界での展開を形作る実用的制約に特に注意を払っています。
テオ・ナッシュによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明確性、そして急速に進化しているAIコンピューティング景観の責任ある報道を確保するためにレビューされています。