AIモデルとプラットフォーム

Fireworks AI、Training APIを一般提供開始

mm
Unite.AI を Google の優先ソースに追加

Fireworks AIは2026年8月31日に、Training APIとFireworks Labの一般提供を発表し、オープンモデル上でカスタムトレーニングループを実行したい機械学習チーム向けに、管理されたトレーニングおよびロールアウトインフラストラクチャを開放しました。Training APIは顧客独自のPythonトレーニングループをFireworksが管理する分散コンピュートに接続し、勾配計算とモデル更新を行うトレーナーと、サンプル生成を行うロールアウトデプロイの両方をカバーします。

上記の発表で説明された取り決めに基づき、顧客は好きな場所からループをオーケストレーションし、損失関数や報酬関数、データ、環境を制御し続けます。Fireworksはトレーナーとロールアウト間のやり取りを管理し、重みの同期、失敗したスワップの回復、トレーニングとロールアウトの整合性を含みます。同社はこのAPIを、MLチームが既存のトレーニングワークフローで報告している制約—モデルや手法の選択肢の限定、パラメータやトレーニングループの制御の制限、硬直したコンピュート、トレーニングとロールアウトインフラの分断—への対応として位置付けています。

サーバーレスと専用コンピュート

Training APIは2つのコンピュートオプションを提供します。サーバーレストレーニングでは、顧客は共有インフラ上でLoRAアダプタをトークン単位の課金でトレーニングでき、サンプリングは同一セッションで実行されます。Fireworksはこれを、実験のイテレーションや大規模実行のリスク低減、ロールアウトとトレーニングを交互に行う強化学習ループの実行に適していると説明しています。専用トレーニングは、フルパラメータトレーニング、サーバーレスプールを超えるモデル、より長いコンテキスト長やLoRAランク、持続的なスループットを対象とし、各実行に合わせた弾性キャパシティでGPU時間単位の課金となります。

サーバーレス層は常時稼働の共有プールに接続し、人気モデルのキュレーションリスト、共有キャパシティ、アカウントごとのレートリミットを提供します。専用層は実行ごとにトレーナーとデプロイをプロビジョニングし、最大規模のMixture‑of‑ExpertsモデルまでLoRAおよびフルパラメータモードをサポートし、競合やレートリミットがありません。有望なチェックポイントはUIまたはAPIを通じて本番推論にデプロイでき、マルチLoRAデプロイにより各顧客やユースケースは別個のインフラなしで調整済みモデルを取得できると同社は述べています。

3つのトレーニングサーフェス

Training APIは、Fireworksトレーニングプラットフォーム上の他の2つのインターフェースと並んで提供されます。MLエンジニア向けのManaged Trainingは、顧客が手法(SFT、DPO、またはRL)とベースモデルを選択し、UIまたはAPIから起動する組み込みジョブを実行します。Fireworks Labは、発表時点で一般提供されており、顧客チームに前方配置された研究者やエンジニアを組み込みます。エンゲージメントは、能力、ベースライン、成功基準、スコープを定義する診断から開始し、時間枠を設けた実装へと移行し、顧客は本番対応モデル、評価ハーネス、データパイプライン、トレーニングループ、レシピを保持します。

Training API自体はML研究者向けで、SFT、DPO、ORPO、RL、蒸留をサポートし、サーバーレスコンピュート上のLoRAから専用クラスター上のフルパラメータトレーニングまで対応します。

大規模強化学習

Fireworksは、フロンティアラボ以外で10,000台以上のGPUを用いて強化学習を実行した数少ない組織の一つであり、RLトレーニングを「正確性」「パフォーマンス効率」「開発速度」の3つの要件で構成すると述べています。

正確性に関して、同社はロールアウトエンジンとトレーナーが同一の数値定義を共有する必要があると述べています。小さな数値ドリフトは、トークンのクリッピングや報酬の崩壊を通じて学習シグナルを破壊する可能性がある一方で、全体は正常に動作しているように見えるからです。FireworksはBF16、ブロック単位のFP8、NVFP4などの数値フォーマットをエンドツーエンドで揃え、両経路のカーネルとリダクション動作を統一し、Router Replayを用いてロールアウトと逆伝播間のMixture‑of‑Expertsルーティング決定を保持し、バッチ不変カーネルと決定的リダクションを併用しています。同社は、ロールアウトエンジンとトレーナーで同一シーケンスを実行し、トレイン‑インファレンスKLダイバージェンスを測定することで整合性を検証し、Fireworksトレーニングで起動されたすべてのモデルに対して継続的に検証を行っていると述べています。

パフォーマンスに関して、Fireworksは非同期RLを実行し、ロールアウトの収集とトレーニングを重ね合わせることで、ロールアウトGPUが前回のトレーニングで更新された重みを使用しつつ次のバッチ生成を開始でき、アルゴリズムが許容する範囲で重みの陳腐化を制限します。各トレーニングステップ後、更新された重みは実行中のロールアウトデプロイにホットロードされ、モデル全体を再ロードする必要がありません。フルパラメータチェックポイントについては、同社は現在と過去の重み間のXOR差分を計算し、zstd圧縮を適用することで、転送帯域幅を最大10倍削減できると述べています。

開発速度に関して、同社は1つのプラットフォーム上で継続的な「トレーニング→デプロイ→評価→再トレーニング」ループを構築し、チェックポイントが直接サービスや本番トレース、評価、フィードバックに移行し次の実行に反映されると説明しています。チームは同じトレーニング予算で2〜4倍のイテレーション数を報告していると述べています。

顧客事例

発表では複数の顧客事例が紹介されました。Harveyは非同期RLを用いて長期的な法務作業向けにKimi K3を事後トレーニングし、Harvey TenetモデルはLABで19.7%の全合格率を達成し、Claude Fable 5の11.5%と比較してタスクあたりのコストは約3分の1だったとFireworksは述べています。Vercelはv0のオートフィクサー向けに強化ファインチューニングと投機的デコードを使用し、93%のエラーなし生成率とエンドツーエンド遅延の40倍改善を実現したと同社は報告しています。Heidi Healthは臨床記録作成をファインチューニングされたオープンモデルに移行し、概念実証から本番へと4週間で移行、レイテンシは3.5倍低減しました。FactoryはオープンなQwenベース上で2つの小規模LoRAアダプタをファインチューニングし、露出したシークレットのスクリーニングを行いました。5%の誤報予算で、トレーニングされたモデルは実際のシークレットの約70%を検出し、GPT‑5.5の約59%と比較されましたとFireworksは報告しています。

Training APIは現在、Fireworksのセルフサーブサインアップを通じて利用可能で、サーバーレスアクセスはプロビジョニング不要です。同社は、ハンズオンサポートを希望するチームをFireworks Labのコンサルテーションへ案内しています。

テオ・ナッシュは、Unite.AIのAI生成専門家で、AIインフラストラクチャ、コンピューティング、そしてモダンな人工知能を支えるハードウェアシステムについて取り上げています。彼の仕事は、大規模なAIワークロードの背後にある技術的基礎に焦点を当てており、データセンター、加速器、ネットワーク、そしてそれらを結びつけるソフトウェアスタックを含みます。
分析的かつエンジニアリング主導の視点から、テオは、GPU、カスタムシリコン、メモリアーキテクチャ、分散システムの進歩が新しいAIモデルの世代をどのように可能にしているかを調査しています。彼は、パフォーマンスのトレードオフ、エネルギー効率、スケーラビリティ、そしてAIインフラストラクチャの現実世界での展開を形作る実用的制約に特に注意を払っています。
テオ・ナッシュによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明確性、そして急速に進化しているAIコンピューティング景観の責任ある報道を確保するためにレビューされています。