AIモデルとプラットフォーム

Liquid AIがLFM2.5-VL-3Bを出荷し、エッジでのビジョン言語AIを高速化

mm
Unite.AI を Google の優先ソースに追加

Liquid AIは2026年8月12日、3.1億パラメータのオープンウェイトビジョン言語モデルであるLFM2.5-VL-3Bをリリースしました。このモデルは、データセンターではなく、携帯電話、ラップトップ、シングルGPUで実行するように設計されています。モデルは、会社のブログHugging Faceに掲載されており、すぐに利用可能な重みを備えています。モデルは、前年のLFM2-VL-3Bを拡張し、より強力な画面理解、オブジェクトグラウンド、多画像推論、および関数呼び出しを備えています。

会社は、このリリースを、セルフホステッドハードウェア用の最も優れたビジョンモデルとして位置付けている。リリースポストでは、Liquid AIはそれを「私たちの最も優れたビジョン言語モデル」と説明しており、「2倍のサイズのモデルと競合するビジョン性能を提供し、CPUおよびGPUのさまざまな展開でより高速に実行され、パラメータが少ないモデルよりも優れています。」

このリリースのすべてのベンチマークと速度の数字は、ベンダーが報告したものです。Liquid AIは、vLLM 0.26.0を使用して評価を実行し、すべてのモデルを推論モードで実行し、直接回答を求めました。新しいモデルの独立した評価はまだありませんが、これはリリース日の期待される状態であり、Unite.AIによるAmazonの研究は、同じ比較モデルを評価し、なぜ独立して測定された転写動作がクリーンなベンチマークスコアから乖離するのかを示しています。

LFM2.5-VL-3Bが画面、文書、複数画像を読み取る方法

モデルは、GoogleのSigLIP2 400M NaFlexビジョンエンコーダーと、2026年8月4日にリリースされたLiquid AIのLFM2.5-2.6Bテキストモデルの同じ事前トレーニングバックボーンをペアにしています。 モデルカードによると、約34兆トークンで事前トレーニングされ、前身よりも4倍多くのビジョンデータがあり、トークナイザーの拡張によりボキャブラリーが128,000トークンに倍増しました。事後トレーニングでは、教師モデルからの知識蒸留と多報酬強化学習を組み合わせた監督フィーネチューニングが行われます。

4つの機能領域が、LFM2-VL-3Bからのアップグレードを定義します。画面理解については、モデルはScreenSpot-v2のデスクトップ、モバイル、ウェブスプリットで平均80.7を達成し、前身の2.5〜7.6から大幅に上昇し、8億パラメータのGemma-4-E4Bの50.9を上回り、84.2のInternVL 3.5 4Bに次ぐものとなりました。グラウンドについては、モデルが自然言語で記述されたオブジェクトのバウンディングボックスを返すRefCOCOの精度が、57.1から87.9に上昇し、30点以上の改善を示し、Liquid AIはこれを合成グラウンドデータの拡大に帰因しています。

関数呼び出しは、会社のビジョンラインに新しく導入された機能です。ToolSandboxでは、スコアが26.4から59.5に倍増し、3.1BモデルはGemma-4-E2Bと同等で、Qwen3.5-2Bを上回りました。多画像推論も大幅に改善され、BLINKは50.2から61.5に、MuirBenchは34.9から58.3に上昇しました。

28のビジョンベンチマーク全体で、LFM2.5-VL-3Bは平均69.4を達成し、前身の57.2から12ポイント改善され、4.7億パラメータのQwen3.5-4Bに0.7ポイント届きました。平均は実際のテクスチャを隠していますが、モデルは一般的なスイートの一部でライバルに後れを取り、CountBenchQAでは92.2から87.3に低下しました。

モデルが意図的に省略するもの

LFM2.5-VL-3Bは、推論モデルの非推論バージョンです。モデルは、間接的な思考の連鎖を生成するのではなく、直接回答を生成します。これは、Liquid AIが遅延の最適化として説明する設計上の選択です。モデルカードは、モデルを「シングルターン、高スループット、低遅延タスク」に適したものとして推奨しており、自動車アプリケーションのためのリアルタイムオブジェクト検出、スキャンドキュメントのバッチOCR、メニューと道路標識のデバイス上の翻訳を意図したワークロードとして挙げています。

カードはまた、モデルが何に適していないかを明確に述べています。モデルは「長いコンテキスト、推論集中タスク、たとえばビジュアルウェブデザイン、またはブループリントについての高度な技術的な質問に回答する」タスクに適していないと述べています。コンテキストの長さは32,768トークンで、カードはレイアウトアノテーションOCR形式を実験的とし、変更される可能性がある、信頼できない可能性がある、解析が簡単でない可能性があることを警告しています。これらはベンダーの自己制限声明であり、能力の主張が終了する場所を示しています。

リリースを裏付ける速度の数字は、その設計から生じます。Liquid AIは、Apple M5 Maxで228トークン/秒、AMD Ryzen AI Max+ 395で116トークン/秒、約3 GBのメモリで、Galaxy S26 Ultraで20トークン/秒のデコード速度を報告しています。シングルNVIDIA H100では、5フレームのビデオクリップで最初のトークンの時間を約34ミリ秒、Gemmaモデルでは約200ミリ秒、ハイコンカレンシーで約11,000トークン/秒の出力スループットを測定し、1枚のカードで1日あたり約10億トークンの出力を達成します。

LFM2.5-VL-3Bの数字

  • 3.1億パラメータ、34兆トレーニングトークン、32,768トークンのコンテキスト
  • 28のビジョンベンチマークで平均69.4、LFM2-VL-3Bの57.2に対して
  • ScreenSpot-v2の画面理解で平均80.7、前身の2.5〜7.6から上昇
  • グラウンドのRefCOCO精度が57.1から87.9に上昇
  • ToolSandboxの関数呼び出しで59.5、26.4から上昇
  • Apple M5 Maxで228トークン/秒、Galaxy S26 Ultraで20トークン/秒、約3 GBのメモリフットプリント
  • シングルH100で約11,000トークン/秒の出力

LFM2.5-VL-3Bに付属するもの

重みは、Hugging Faceからオープンウェイトライセンスの下でダウンロード可能です。GGUF、ONNX、MLX形式の量子化エクスポートと、llama.cpp、MLX、vLLM、SGLang、ONNXランタイムのデイワンサポートがあります。 WebGPUデモは、モデルを完全にブラウザで実行し、会社は英語、アラビア語、中国語、日本語、ヒンディー語を含む16の言語をサポートしています。

リリースは、Liquid AIが2026年下半期を通じて構築してきたLFM2.5ファミリーを補完しています。2026年8月4日にリリースされたLFM2.5-2.6Bテキストモデル、2026年7月下旬にリリースされた長いコンテキストCPU推論のエンコーダバリアント、および今回のフラグシップビジョンチャーであるLFM2.5-VL-3Bです。ファインチューニングノートブックとドキュメントは、モデルが最初の日に特定のグラウンド、OCR、またはツール呼び出しワークロードに適応できるように、重みと一緒に出荷されます。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。