AIモデルとプラットフォーム

Spectro Cloud、 PaletteAI Inference Launchpad を発売してエンタープライズの AI トークン コストを削減する

mm
Unite.AI を Google の優先ソースに追加

Spectro Cloudは、 PaletteAI Inference Launchpad を発売しました。これは、外部モデル サービスへの依存を減らし、人工知能ワークロードの増加するコストをより制御できるように設計された、ローカルで管理される推論プラットフォームです。

会社によると、組織は、外部トークン コストを最大 70% 削減できる可能性があります。これは、ワークロード ミックス、インフラストラクチャ、モデル選択によって異なります。 Spectro Cloud はまた、 PaletteAI の AMD ベースのインフラストラクチャへのサポートを拡大し、顧客にグラフィックス プロセッシング ユニット (GPU)、推論ランタイム、モデル サービング テクノロジーの選択肢を拡大しました。

この発表は、エンタープライズ AI のより広範な変化を反映しています。企業が実験を超えて、顧客サービス、ソフトウェア開発、分析、内部運用にわたる人工知能を展開するにつれて、モデル入力と出力の処理コストは、重要なインフラストラクチャに関する懸念事項となっています。

エンタープライズ データに AI 推論を近づける

PaletteAI Inference Launchpad は、推論のローカル ファースト アプローチを中心に構築されています。外部ホスト フロンティア モデルに毎回リクエストを自動的に送信するのではなく、組織は、自社のデータセンター、プライベート クラウド、主権環境、エッジ ロケーションにあるインフラストラクチャで適切なワークロードを実行できます。

企業は、外部ホスト フロンティア モデルへのアクセスを保持できます。これは、外部モデルが必要なタスクに使用されます。プラットフォームは、コスト、パフォーマンス、ガバナンス要件、タスクの複雑さなどの要因に基づいて、ローカル モデルと外部モデル間でリクエストをルーティングするように設計されています。

このハイブリッド モデルは、企業がより小さく特殊化されたモデルを採用するにつれて、ますます重要になる可能性があります。顧客サポート リクエスト、ドキュメント分類タスク、または内部ナレッジ クエリには、高度な推論、複雑なコーディング、またはマルチモーダル分析に必要なモデル容量は必要ない場合があります。

適切なワークロードをローカルに保つことで、推論をアプリケーション、ユーザー、データ ソースに近づけることで待ち時間を短縮することもできます。規制された業界で運営している組織にとって、ローカル処理により、機密情報をどのように処理するかをより制御できます。

トークンの使用はインフラストラクチャ メトリックになる

トークンは、人工知能モデルがテキスト、コード、その他の情報を分割して処理する単位です。各プロンプトと生成された応答はトークンを消費し、多くの商用モデル サービスは処理されるトークンの数に応じて課金します。

これは、AI コストが、システムが制御された試験から、数千の従業員または顧客にサービスを提供するアプリケーションに移行するにつれて急激に増加する可能性があることを意味します。AI エージェントの場合、問題はさらに複雑になります。エージェントは、単一のタスクを完了する前に、繰り返しモデル呼び出しを行い、情報を取得し、結果を評価し、外部ツールを使用する可能性があります。

ゴールドマン サックス リサーチ によると、2026 年から 2030 年にかけて、毎月の AI トークン消費量は 24 倍に増加し、約 120 クアドリリオン トークン/月に達することが予測されています。この予測増加は、エンタープライズの拡大と、より自律的な AI エージェントの出現によって推進されています。

Inference Launchpad は、インフラストラクチャ チームに、トークン消費を測定し、クォータを確立し、使用ポリシーを適用するためのツールを提供することで、この問題に対処します。これらのコントロールにより、企業は、AI スペンディングの原因となるチーム、応用プログラム、モデルをよりよく理解できるようになり、推論を予測不可能な外部サービス料金として扱うのではなく、より適切な方法で扱うことができます。

Spectro Cloud が提示した 70% の削減は、保証された節約ではなく、潜在的な結果として見なされるべきです。実際の経済的影響は、GPU の取得またはレンタルコスト、使用率、エネルギー消費、モデル効率、リクエスト ボリューム、および外部プロバイダーの価格設定によって異なります。

フロンティア モデルを排除せずにローカル モデル

プラットフォームのモデル ルーティング機能は、企業をすべてローカルまたはすべてクラウドの決定に迫ることを避けるように設計されています。

組織は、予測可能またはプライバシーに敏感なタスクに小さなローカル モデルを使用できますが、より厳しいリクエストはフロンティア モデルに送信できます。ポリシーは、特定の部門、管轄区域、またはデータ分類に対して許可されるモデルの決定も行うことができます。

これにより、推論レイヤーにガバナンスが直接導入されます。たとえば、金融機関は、特定の情報が制御された環境を離れることを防ぐことができますが、非機密リクエストは外部モデルを使用できます。多国籍企業は、地域のデータ要件に基づいてルーティング ルールを適用できます。

Spectro Cloud は、モデル選択とガバナンスを PaletteAI のインフラストラクチャ管理戦略の一部として位置付けました。プラットフォームは、共有 GPU 環境、ロールベースのアクセス、リソース クォータ、テナント レベルのコントロールをサポートしています。これらのコントロールにより、複数のチームが同じインフラストラクチャを使用できますが、基盤となるシステムへのアクセスは制限されます。

AMD AI インフラストラクチャのサポートの拡大

Inference Launchpad とともに、Spectro Cloud は AMD パワーの AI 環境へのサポートを拡大しました。

統合には、AMD GPU、AMD GPU オペレーター、ROCm ソフトウェア スタック、および AMD Inference Microservices (AIMs) が含まれます。これらのコンポーネントは、AI モデルをプロダクションで実行するために必要なインフラストラクチャのさまざまなレイヤーに対処します。

AMD GPU オペレーターは、Kubernetes クラスター内の AMD Instinct アクセラレーターの構成と管理を簡素化します。ROCm は、AI ワークロードと高性能コンピューティング ワークロードを AMD ハードウェアで実行するために使用される、ドライバー、ライブラリ、ランタイム、開発ツールを含むオープン ソフトウェア スタックを提供します。

AIMs は、AMD Instinct GPU でモデルを提供するための標準化された推論マイクロサービスを提供します。これらは、最適化されたモデルとサポート ソフトウェアをデプロイ可能なサービスにパッケージ化することで、モデルをプロダクションに移行するために通常必要な一部の統合作業を削減するように設計されています。

企業顧客にとって、この拡張サポートにより、NVIDIA (NVDA ) と AMD インフラストラクチャの両方を個別の管理プロセスを構築せずに操作できるようになります。

ハードウェアからモデルまでのスタックを管理する

Spectro Cloud は、元々 Palette を、パブリック クラウド、プライベート データセンター、ベア メタル システム、エッジ ロケーションにわたるクラスターの展開とメンテナンスのための Kubernetes 管理プラットフォームとして開発しました。

PaletteAI は、この基盤を AI インフラストラクチャに拡大します。Kubernetes ライフサイクル管理と GPU オーケストレーション、モデル サービス、セキュリティ コントロール、ネットワーク、および機械学習操作ツールを組み合わせます。Spectro Cloud は、プラットフォームを、物理ハードウェア レイヤーから上に実行されているモデルと推論サービスまで、インフラストラクチャを管理する方法として説明しています。

プラットフォームには、PaletteAI Studio も含まれています。これは、Kubeflow、MLflow、ClearML、Run:ai、Hugging Face などのテクノロジーから事前に統合されたインフラストラクチャと AI スタックを提供します。これらの構成は、プラットフォーム チームに、毎回のデプロイ テンプレートを提供することを目的としています。手動で各コンポーネントを統合する必要性を排除するためです。

Inference Launchpad は、トークン ルーティング、測定、およびローカルで管理されるモデル サービングを、このより広範なインフラストラクチャ レイヤーに追加します。

主権および規制された AI 環境をサポートする

Spectro Cloud は、Neoclouds、管理サービス プロバイダー、主権クラウド オペレーターも対象としています。これらのプロバイダーは、共有 GPU インフラストラクチャを提供しながら、顧客間の分離を維持し、管轄区域固有のコントロールを適用する必要があります。

会社は、データ居住性、コンプライアンス、運用の主権に関係するデプロイをサポートするために、オースティンとドバイから運営しているインフラストラクチャ プロバイダーである NexusIgnite と協力しています。

データ居住性は、情報がどこに保存されるかについて一般的に関心があります。主権 AI は、インフラストラクチャを誰が運用するか、どの法制度が適用されるか、誰がアクセスできるか、環境が監査または外部サービスから切断できるかについて、追加の質問を提起します。

Spectro Cloud のプラットフォームは、セルフホストおよびエアギャップ デプロイをサポートしていますが、PaletteAI VerteX には、政府や規制された環境向けのセキュリティ コントロールが追加されています。

これらの機能は、公共機関、ヘルスケア機関、金融機関、クリティカル インフラストラクチャ オペレーターなどの、AI のすべての相互作用を共有パブリック サービスを介してルーティングできない組織にとって特に重要です。

エンタープライズ AI オペレーションの競争の激化

この発表は、Spectro Cloud が 100 万ドルシリーズ D ラウンド を発表した直後です。このラウンドは、ゴールドマン サックス アルタナティブの成長エクイティによって主導され、AMD Ventures、エリクソン、LG テクノロジー ベンチャーズ、マキシマスが参加しています。

会社は、この資金調達により、プロダクション AI インフラストラクチャ、主権クラウド、Neocloud サービス、分散型推論の拡大を支援する予定です。Spectro Cloud は現在、約 2 億 6000 万ドルの資金を調達しました。

その戦略は、モデル開発ではなくモデル操作に重点を置いた、AI 市場の新しい層を反映しています。モデル オプションが増えるにつれて、企業は、モデルをどこで実行するか、GPU をどのように割り当てるか、どのデータにアクセスできるか、使用方法をどのように測定するかを決定できるインフラストラクチャが必要になります。

PaletteAI Inference Launchpad と AMD の統合の拡大は、すぐに利用可能です。その長期的な重要性は、ローカルで管理される推論が、外部モデル プロバイダーを使用することで避けようとした運用の複雑さを再現せずに、一貫した経済的利益を提供できるかどうかに依存します。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。