AIモデルとプラットフォーム

Liquid AI、LFM2.5-DSparkをリリース、最大3.2倍高速な推論を実現

mm
Unite.AI を Google の優先ソースに追加

Liquid AIは2026年8月20日にLFM2.5ファミリーの3つのモデル向けに投機的デコード用ドラフトチェックポイントをリリースし、単一のH100 GPUで最大3.18倍、Appleシリコン搭載MacBookで最大2.87倍のスループット向上を報告しました(モデル出力は変わりません)。LFM2.5-DSpark リリースは、LFM2.5-1.2B-Instruct、LFM2.5-2.6B、およびMixture‑of‑Experts構成のLFM2.5-8B-A1B用ドラフトを含み、各モデルは対象モデルに対して約3億パラメータのドラフトオーバーヘッドを追加しています。

チェックポイントはSafetensorsとGGUF形式で提供され、llama.cppとSGLangで初日からサポートされています。これらの統合は公式コードベースに上流で貢献されています。投機的デコードは対象モデルが検証したトークンのみを出力するため、同社は生成テキストは貪欲デコード時の対象モデル単独の出力と同一であり、ベンチマーク精度は変わらないと述べています。

Liquid AIの測定では、バッチサイズ1、温度0で5つのデータセットを使用し、LFM2.5-2.6Bの平均スピードアップはH100で2.67倍(1秒あたり323トークンから864トークン)、M4 Max MacBook Proで2.27倍(61トークンから139トークン)となっています。最大の単一結果はMATH500上のLFM2.5-8B-A1Bで、H100のスループットが3.18倍に上昇し、428トークン/秒から1,362トークン/秒となりました。また、同社はDSparkがマルチツールシナリオにおいてLFM2.5-2.6Bの関数呼び出しレイテンシを平均57%削減したと報告しており、これはLFM2.5シリーズが対象とするオンデバイスのエージェントワークロードにおける主要成果です。

DSparkがデコードを高速化する仕組み

LLM推論のデコード段階はメモリ帯域がボトルネックとなります。レイテンシの大部分は計算自体ではなく、DRAMからオンチップメモリへの重みのストリーミングに起因します。そのため、推論コストがこの分野の中心的なエンジニアリング課題となっています

投機的デコードは、小さなドラフトモデルが候補トークンのブロックを提案し、対象モデルがそのブロック全体を一度のフォワードパスで検証することで、重みのロードコストをチェックされた各トークンに分散させます。

DSparkは2026年7月にDeepSeekの研究者が発表した論文で紹介され、同社のDeepSeek‑V4サービングシステムに実装されています。3つのコンポーネントを組み合わせています:すべてのドラフトトークンの隠れ状態を単一パスで生成する並列バックボーン、ブロック後半で受容率が低下しないように隣接トークン間の依存関係をモデル化する軽量シーケンシャルヘッド、そしてコストが削減効果を上回る場合に低信頼度サフィックスを剪定する信頼度スケジュール検証器です。DeepSeekの実運用では、論文はユーザーごとの生成速度が従来のMTP‑1ベースラインに対して60〜85%向上したと報告しています。

Liquid AIのドラフターはこのレシピを簡易化したAttention‑only設計で実装しています:5層、ステップあたり9トークンのブロックサイズ、128,000語彙に対するマルコフヘッド。詳細はLFM2.5-2.6B-DSpark モデルカードをご参照ください。各ドラフターは教師あり微調整、チャット、コード、関数呼び出しデータを混合したデータで15エポック学習され、損失最小化ではなく受容率最大化でチェックポイントが選択されました。正確性保証は品質向上に直結します。「投機的デコードは正確です:対象モデルがすべての提案トークンを検証するため、貪欲出力は対象モデル単独と同じです」とGGUF モデルカードは述べており、応答ごとのタイミング情報で提案・受容されたドラフトトークン数が確認できます。

LFM2.5-DSparkの数値

  • 3.18x — 報告された中で最高のGPUスピードアップ (LFM2.5-8B-A1B、MATH500、H100:428 → 1,362 トークン/秒)
  • 2.87x — 報告された中で最高のオンデバイススピードアップ (LFM2.5-1.2B-Instruct、HumanEval、M4 Max:136 → 389 トークン/秒)
  • 2.67x / 2.27x — LFM2.5-2.6Bの5データセットにおける平均H100/M4 Maxスピードアップ
  • 57%:マルチツールシナリオにおけるLFM2.5-2.6Bの関数呼び出しレイテンシ平均削減率
  • 295.7M–327.7M(ドラフトモデルのパラメータ数、対象モデルは1.2B〜8B)
  • 4.81 / 10、ブロックサイズ9におけるLFM2.5-2.6Bのステップあたり平均受容ドラフトトークン数

報告されたスピードアップが縮小する箇所

Liquid AI独自の表から、性能向上が一様でないことが分かります。同社はその理由を説明しています。LFM2.5-8B-A1Bでは、受容率が3モデル中で最も高いにもかかわらず、オンデバイスでの改善は平均1.18倍にとどまります。このギャップは、llama.cppのMetalバックエンドにおける現在のMixture‑of‑Experts実装と、トークンブロックを検証する際に専門家間で発生する余分な重みトラフィックに起因すると同社は述べています。LFM2.5-1.2B-Instructでは、データセットごとに受容率が大きく変動するため、テキスト分布に応じてスピードアップが最大52%変動し、H100上のMT‑Benchでは1.66倍、MATH500では2.56倍に達します。

すべての数値はLiquid AIが独自に構築したハーネスからベンダー報告されたものです:GPU測定はBF16で80GB H100 1台上のSGLang、オンデバイス測定はFP16 GGUF重みを使用したM4 Max上の実験的Metalカーネルを備えるllama.cppで、出力トークンは256で上限が設定されています。SGLang経路はLFM2ターゲット向けにDSparkサポートが組み込まれたビルドが必要で、llama.cpp経路も同様のビルドが必要です。そのため、スピードアップは各エンジンの統合状況に依存し、安定版リリースに含まれるわけではありません。

Liquid AIのオンデバイス推進の現状

DSparkのリリースは、わずか1週間余りで行われたLFM2.5ファミリーの3番目のアップデートです。2026年8月12日には、エッジ向けビジョン‑ランゲージモデルであるLFM2.5-VL-3Bをリリースし、2026年8月19日にはファミリー向けに量子化認識蒸留済みQ4_0チェックポイントを公開しました。根底にある考え方は変わりません:同社は、2.6BモデルのDSparkによるMacBook上でのスピードアップが、ほとんどの商用クラウドモデルが提供する約140トークン/秒というスループットを超えるインタラクティブ性を実現すると述べています。

3つのドラフターはすべて現在Hugging Faceで利用可能です:LFM2.5-1.2B-Instruct-DSpark、LFM2.5-2.6B-DSpark、そしてLFM2.5-8B-A1B-DSpark。llama.cpp向けのデプロイにはGGUFビルドも併せて提供されています。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。