AIモデルとプラットフォーム
セレブラス、世界最速のAI推論ソリューションを発表:20倍のスピード、コストの少ない分数

Cerebras Systems (CBRS ) は、高性能AIコンピューティングの先駆者であり、AI推論を革命的にする画期的なソリューションを発表しました。2024年8月27日、同社は、世界最速のAI推論サービスであるCerebras Inferenceを発表しました。従来のGPUベースのシステムよりも圧倒的なパフォーマンスを発揮するCerebras Inferenceは、20倍のスピードを達成し、コストを大幅に削減し、AIコンピューティングの新しい基準を設定しました。
前例のないスピードとコスト効率
Cerebras Inferenceは、さまざまなAIモデル、特に急成長している大規模言語モデル(LLM)で、優れたパフォーマンスを発揮するように設計されています。例えば、Llama 3.1 8Bモデルでは1秒あたり1,800トークン、Llama 3.1 70Bモデルでは1秒あたり450トークンを処理します。これは、NVIDIA (NVDA ) GPUベースのソリューションの20倍のスピードであり、コストも大幅に削減されています。Cerebrasは、Llama 3.1 8Bモデルで1千万トークンあたり10セント、Llama 3.1 70Bモデルで1千万トークンあたり60セントから提供しています。これは、既存のGPUベースのオファリングと比較して100倍の価格性能の改善を表します。
精度を維持しながらスピードの限界を突破する
Cerebras Inferenceの最も印象的な側面の1つは、スピードを大幅に向上させながらも、最先端の精度を維持する能力です。他のアプローチが精度を犠牲にしてスピードを優先するのとは異なり、Cerebrasのソリューションは、推論実行全体で16ビットドメイン内に留まることで、パフォーマンスの向上がAIモデルの出力の品質を損なうことなく実現します。これは、精度に重点を置く開発者にとって、重要な要素です。
Micah Hill-Smith、Artificial Analysisの共同創設者兼CEOは、この成果の重要性を強調しています。「Cerebrasは、MetaのLlama 3.1 8Bおよび70B AIモデルで、GPUベースのソリューションの10倍以上のスピードを達成しています。Llama 3.1 8Bでは、1秒あたり1,800以上の出力トークン、Llama 3.1 70Bでは、1秒あたり446以上の出力トークンを測定しています。これは、これらのベンチマークの新しい記録です。」
AI推論の重要性の増大
AI推論は、AIコンピューティングで最も急成長しているセグメントであり、約40%のAIハードウェア市場を占めています。Cerebrasのような高スピードAI推論の出現は、ブロードバンドインターネットの登場に似て、新しい機会を解放し、AIアプリケーションの新しい時代を迎えることになります。Cerebras Inferenceを使用すると、開発者は、複雑なリアルタイムパフォーマンスを必要とする次世代のAIアプリケーション、たとえばAIエージェントや知能システムを構築できます。
Andrew Ng、DeepLearning.AIの創設者は、AI開発におけるスピードの重要性を強調しています。「DeepLearning.AIには、LLMを繰り返し呼び出して結果を得る必要がある複数のエージェントワークフローがあります。Cerebrasは、印象的なスピードの推論機能を構築しました。これは、こうしたワークロードにとって非常に役立つことになります。」

幅広い業界のサポートと戦略的パートナーシップ
Cerebrasは、業界リーダーからの強力なサポートを得て、AIアプリケーションの開発を加速するための戦略的パートナーシップを形成しています。Kim Branson、GlaxoSmithKlineのAI/ML担当シニアVPで、Cerebrasの初期顧客の1人は、このテクノロジーの変革的な可能性を強調しています。「スピードとスケールは、すべてを変えます。」
LiveKit、Perplexity、Meterなどの他の企業も、Cerebras Inferenceが彼らの事業に与える影響について熱意を示しています。これらの企業は、Cerebrasのコンピューティング機能の力を利用して、より反応性の高い、人間のようなAI体験を作成し、検索エンジンのユーザーインタラクションを改善し、ネットワーク管理システムを強化しています。
Cerebras Inference:階層とアクセシビリティ
Cerebras Inferenceは、3つの競争力のある価格設定の階層で提供されています:無料、開発者、エンタープライズ。無料階層では、寛容な使用制限付きで無料のAPIアクセスを提供し、幅広いユーザーにアクセス可能です。開発者階層では、柔軟なサーバーレス展開オプションを提供し、Llama 3.1モデルは1千万トークンあたり10セントと60セントで提供されます。エンタープライズ階層では、継続的なワークロードを持つ組織を対象とし、カスタマイズされたモデル、カスタムのサービス レベル アグリーメント、専用のサポートを提供し、価格は要問い合わせです。
Cerebras Inferenceを支える:Wafer Scale Engine 3(WSE-3)
Cerebras Inferenceの核心は、Cerebras CS-3システムで、業界を牽引するWafer Scale Engine 3(WSE-3)が動作しています。このAIプロセッサは、サイズとスピードにおいて無類であり、NVIDIAのH100よりも7,000倍のメモリ帯域幅を提供しています。WSE-3の巨大なスケールにより、多数の同時ユーザーを処理でき、パフォーマンスを損なうことなく、スピードを維持することができます。このアーキテクチャにより、Cerebrasは、通常GPUベースのシステムに陥るトレードオフを回避し、AIワークロードで最高のパフォーマンスを提供できます。
シームレスな統合と開発者向けAPI
Cerebras Inferenceは、開発者を念頭に置いて設計されています。OpenAI Chat Completions APIと完全に互換性のあるAPIを提供し、最小限のコード変更で簡単に移行できます。この開発者向けアプローチにより、Cerebras Inferenceを既存のワークフローに統合することが可能になり、高パフォーマンスのAIアプリケーションを迅速に展開できます。
Cerebras Systems:業界全体でイノベーションを推進
Cerebras Systemsは、AIコンピューティングのリーダーであると同時に、ヘルスケア、エネルギー、政府、科学計算、金融サービスなど、さまざまな業界で重要な役割を果たしています。同社のソリューションは、国立研究所、Aleph Alpha、メイヨー クリニック、GlaxoSmithKlineなどの機関でのブレークスルーに貢献しています。
スピード、スケーラビリティ、精度を提供することで、Cerebrasは、これらの分野の組織が、AIとその他の分野で最も困難な課題に取り組むことができます。ヘルスケアにおける薬剤発見の加速や、科学研究における計算能力の強化など、Cerebrasはイノベーションの先頭に立っています。
結論:AI推論の新しい時代
Cerebras Systemsは、Cerebras Inferenceの発売で、AI推論の新しい基準を設定しています。従来のGPUベースのシステムよりも20倍のスピードを達成し、コストを大幅に削減することで、Cerebrasは、AIをよりアクセスしやすくし、次世代のAIアプリケーションの道を開いています。最先端のテクノロジー、戦略的パートナーシップ、イノベーションへの取り組みにより、Cerebrasは、AI業界を、前例のないパフォーマンスとスケーラビリティの新しい時代に導くことになります。
Cerebras SystemsとCerebras Inferenceの詳細については、www.cerebras.aiを訪問してください。












