โมเดลและแพลตฟอร์ม AI
Liquid AI เปิดตัว LFM2.5-VL-3B สำหรับ AI วิชวล-ภาษาที่เร็วขึ้นบน Edge

Liquid AI เปิดตัว LFM2.5-VL-3B เมื่อวันที่ 12 สิงหาคม 2026 เป็นโมเดลวิชวล-ภาษาแบบเปิดที่มีพารามิเตอร์ 3.1 พันล้านตัว ซึ่งออกแบบมาเพื่อรันบนโทรศัพท์มือถือ คอมพิวเตอร์แล็ปท็อป และ GPU เพียงตัวเดียว ไม่ใช่ในศูนย์ข้อมูล โมเดลนี้ ประกาศบนบล็อกของบริษัท และ โพสต์บน Hugging Face โดยมีน้ำหนักโมเดลพร้อมใช้งานทันที โดยขยายโมเดล LFM2-VL-3B ของปีที่แล้วด้วยความเข้าใจหน้าจอ ที่มีพื้นฐานมาจากวัตถุ การให้เหตุผลภาพหลายภาพ และการเรียกฟังก์ชัน
บริษัทวางตำแหน่งการเปิดตัวนี้ว่าเป็นโมเดลวิชวลที่มีความสามารถมากที่สุดสำหรับฮาร์ดแวร์ที่ติดตั้งเอง ในโพสต์เปิดตัว Liquid AI อธิบายว่า “โมเดลวิชวล-ภาษาของเราที่มีความสามารถมากที่สุด” ซึ่ง “มีประสิทธิภาพวิชวลที่แข่งขันกับโมเดลที่มีขนาดใหญ่กว่าสองเท่า ในขณะที่รันเร็วขึ้นบน CPU และ GPU หลายตัว แม้กระทั่งเมื่อเทียบกับโมเดลที่มีพารามิเตอร์น้อยกว่า”
ตัวเลขที่ใช้ในการเปรียบเทียบและความเร็วทั้งหมดในข้อมูลนี้มาจากผู้ผลิต: Liquid AI ได้ทำการประเมินผลด้วยตนเองโดยใช้ vLLM 0.26.0 โดยมีโมเดลทุกตัวในโหมดที่ไม่ต้องมีการให้เหตุผล และตอบคำถามโดยตรง ไม่มีการประเมินผลอิสระของโมเดลใหม่นี้จนถึงตอนนี้ ซึ่งเป็นสถานการณ์ที่คาดหวังในวันปล่อยตัว แม้ว่ารายงานล่าสุดของ Unite.AI เกี่ยวกับการศึกษาของ Amazon ที่ประเมินโมเดลที่เหมือนกันหลายตัวจะแสดงให้เห็นว่า ทำไมพฤติกรรมการถอดเสียงที่วัดได้จากอิสระสามารถแยกออกจากคะแนนการประเมินแบบสะอาด
วิธีการอ่านหน้าจอ เอกสาร และหลายภาพของ LFM2.5-VL-3B
โมเดลนี้จับคู่ SigLIP2 400M NaFlex วิชวลเอนโคเดอร์จาก Google พร้อมกับแบ็คโบนของโมเดลข้อความ LFM2.5-2.6B ของ Liquid AI ที่ปล่อยออกมาเมื่อวันที่ 4 สิงหาคม 2026 ตาม การ์ดโมเดล โมเดลนี้ได้รับการฝึกฝนบนโทเค็นประมาณ 34 ล้านล้านโทเค็น โดยมีข้อมูลวิชวลมากกว่าโมเดลก่อนหน้าถึงสี่เท่า และขนาดคำศัพท์ถูกขยายเป็นสองเท่าถึง 128,000 โทเค็น โดยการขยายโทเคไนเซอร์ที่มีอยู่แล้ว ไม่ใช่การฝึกใหม่ การเปลี่ยนแปลงนี้มีจุดมุ่งหมายเพื่อใช้กับภาษาที่ไม่ใช่ภาษาละติน หลังการฝึกจะรวมการปรับให้เหมาะสมแบบดูแลและความแตกต่างของความรู้จากโมเดลครูที่ใหญ่กว่า ตามด้วยการเรียนรู้แบบเสริมหลายรางวัล
พื้นที่ความสามารถสี่ประการที่กำหนดการอัปเกรดเหนือ LFM2-VL-3B ในการทำความเข้าใจหน้าจอ โมเดลเฉลี่ย 80.7 บนการแบ่ง desktop, mobile และ web ของ ScreenSpot-v2 เพิ่มขึ้นจากหลักเดียวในโมเดลก่อนหน้าและนำหน้า Gemma-4-E4B ที่มีพารามิเตอร์ 8 พันล้านตัวที่ 50.9 แม้ว่าจะตามหลัง InternVL 3.5 4B ที่ 84.2 ในด้านการให้เหตุผลที่มีพื้นฐานมาจากวัตถุ ความแม่นยำของ RefCOCO เพิ่มขึ้นจาก 57.1 เป็น 87.9 ซึ่งเป็นการเพิ่มขึ้นมากกว่า 30 จุด ซึ่ง Liquid AI ให้เครดิตกับข้อมูลการให้เหตุผลสังเคราะห์ที่มีขนาดใหญ่ขึ้น
การเรียกฟังก์ชันเป็นคุณลักษณะใหม่ในบรรทัดวิชวลของบริษัท ใน ToolSandbox ซึ่งวัดการใช้เครื่องมือ คะแนนเพิ่มขึ้นมากกว่าสองเท่าจาก 26.4 เป็น 59.5 ทำให้โมเดล 3.1B เทียบเท่ากับ Gemma-4-E2B และนำหน้า Qwen3.5-2B การให้เหตุผลภาพหลายภาพก็มีการปรับปรุงอย่างมากเช่นกัน โดย BLINK เพิ่มขึ้นจาก 50.2 เป็น 61.5 และ MuirBench เพิ่มขึ้นจาก 34.9 เป็น 58.3
ทั่วทั้ง 28 บンチมาร์กวิชวล โมเดล LFM2.5-VL-3B เฉลี่ย 69.4 ซึ่งเป็นการปรับปรุง 12 จุดเหนือ 57.2 ของโมเดลก่อนหน้า และอยู่ห่างจาก Qwen3.5-4B ที่มีพารามิเตอร์ 4.7 พันล้านตัวเพียง 0.7 จุด ค่าเฉลี่ยซ่อนความแตกต่างที่แท้จริง: โมเดลตามหลังโมเดลคู่แข่งในบางชุด และสูญเสียพื้นที่ใน CountBenchQA ซึ่งลดลงจาก 92.2 เป็น 87.3
สิ่งที่โมเดลละเว้นอย่างเจตนา
LFM2.5-VL-3B เป็นโมเดลที่ไม่ต้องมีการให้เหตุผล มันจะตอบคำถามโดยตรงโดยไม่ต้องสร้างโซ่การให้เหตุผลระหว่างกัน การออกแบบที่ Liquid AI อธิบายว่าเป็นการเพิ่มประสิทธิภาพความล่าช้า: การ์ดโมเดลแนะนำให้ใช้ “งานแบบหลายรอบ สูง ความเร็วต่ำ” โดยระบุการตรวจจับวัตถุในเวลาจริงสำหรับการใช้งานรถยนต์ การ OCR ลองเอกสารที่สแกน และการแปลเมนูและป้ายทางบนอุปกรณ์เป็นงานที่ตั้งใจ
การ์ดเดียวกันระบุอย่างชัดเจนว่าโมเดลไม่เหมาะสม “ไม่แนะนำสำหรับงานที่ต้องใช้การให้เหตุผลและบริบทที่ยาว เช่น การออกแบบเว็บที่มีการให้เหตุผลหรือตอบคำถามทางเทคนิคเกี่ยวกับแผนภาพ” ความยาวบริบทคือ 32,768 โทเค็น และการ์ดโมเดลระบุการวางโครงเรื่อง OCR เป็นรูปแบบทดลอง โดยเตือนว่า “อาจเปลี่ยนแปลง อาจไม่น่าเชื่อถือ และอาจไม่ตรงไปตรงมาในการวิเคราะห์” นี่คือข้อจำกัดที่ระบุโดยผู้ผลิต และระบุจุดสิ้นสุดของการอ้างสิทธิ์ความสามารถ
ตัวเลขความเร็วที่ยึดการปล่อยตัวนี้ตามมาจากนั้น Liquid AI รายงานความเร็วในการถอดรหัส 228 โทเค็นต่อวินาทีบน Apple M5 Max และ 116 โทเค็นต่อวินาทีบน AMD Ryzen AI Max+ 395 ในหน่วยความจำประมาณ 3 GB และ 20 โทเค็นต่อวินาทีบน Galaxy S26 Ultra บน NVIDIA H100 โมเดลเดียว บริษัทวัดเวลาจนถึงโทเค็นแรกที่ประมาณ 34 มิลลิวินาทีบนคลิปวิดีโオ 5 เฟรม เทียบกับประมาณ 200 มิลลิวินาทีสำหรับโมเดล Gemma และปริมาณการผลิตสัญญาณออกที่ใกล้ 11,000 โทเค็นต่อวินาทีที่มีการร้องขอหลายรายการ ซึ่งบริษัทกล่าวว่าบวกกันเป็นเกือบหนึ่งพันล้านโทเค็นออกต่อวันบนการ์ดเดียว
LFM2.5-VL-3B โดยตัวเลข
- 3.1 พันล้านพารามิเตอร์; 34 ล้านล้านโทเค็นในการฝึกฝน; 32,768 โทเค็นบริบท
- 69.4 ค่าเฉลี่ยทั่ว 28 บンチมาร์กวิชวล เทียบกับ 57.2 สำหรับ LFM2-VL-3B
- 80.7 ค่าเฉลี่ยบน ScreenSpot-v2 การทำความเข้าใจหน้าจอ เพิ่มขึ้นจาก 2.5 ถึง 7.6 ต่อการแบ่งในโมเดลก่อนหน้า
- 87.9 ความแม่นยำ RefCOCO การให้เหตุผลที่มีพื้นฐานมาจากวัตถุ เพิ่มขึ้นจาก 57.1
- 59.5 ใน ToolSandbox การเรียกฟังก์ชัน เพิ่มขึ้นจาก 26.4
- 228 โทเค็น/วินาทีในการถอดรหัสบน Apple M5 Max; 20 โทเค็น/วินาทีบน Galaxy S26 Ultra; รอยเท้าหน่วยความจำประมาณ 3 GB
- ประมาณ 11,000 โทเค็น/วินาทีในการผลิตสัญญาณออกที่มีการร้องขอหลายรายการบน H100
สิ่งที่จัดส่งพร้อมกับ LFM2.5-VL-3B
น้ำหนักโมเดลสามารถดาวน์โหลดได้แล้วจาก Hugging Face ภายใต้ใบอนุญาตน้ำหนักแบบเปิด โดยมีการส่งออกแบบปริมาณในรูปแบบ GGUF, ONNX และ MLX พร้อมการสนับสนุนในวันแรกบน llama.cpp, MLX, vLLM, SGLang และ ONNX runtime การดемо WebGPU รันโมเดลทั้งหมดในเบราว์เซอร์ และบริษัทระบุภาษาที่รองรับ 16 ภาษา รวมถึงภาษาอังกฤษ อาหรับ จีน ญี่ปุ่น และฮินดี
การปล่อยตัวนี้ทำให้ครอบครัว LFM2.5 ของ Liquid AI สมบูรณ์ ซึ่งได้รับการรวบรวมในช่วงครึ่งหลังของปี 2026: โมเดลข้อความ LFM2.5-2.6B เมื่อวันที่ 4 สิงหาคม 2026 เวอร์ชันเอนโคเดอร์สำหรับการอนุมาน CPU ที่มีบริบทยาวในปลายเดือนกรกฎาคม 2026 และตอนนี้คือระดับวิชวลแฟลกชิป ซึ่งตามมาจาก LFM2.5-VL-1.6B และ 450M ที่เล็กกว่า โน้ตบุ๊กการปรับให้เหมาะสมและการจัดทำเอกสารจะจัดส่งพร้อมกับน้ำหนักโมเดล เพื่อให้สามารถปรับโมเดลให้เหมาะสมกับงานที่มีพื้นฐานมาจากวัตถุ OCR หรือการเรียกฟังก์ชันตั้งแต่วันแรก












