Mô hình và nền tảng AI
Liquid AI Ra Mắt LFM2.5-VL-3B Cho Trí Tuệ Nhân Tạo Thị Giác Ngôn Ngữ Nhanh Hơn Trên Edge

Liquid AI đã phát hành LFM2.5-VL-3B vào ngày 12 tháng 8 năm 2026, một mô hình tầm nhìn ngôn ngữ mở có 3,1 tỷ tham số được xây dựng để chạy trên điện thoại, máy tính xách tay và card đồ họa đơn thay vì trong trung tâm dữ liệu. Mô hình này, được công bố trên blog của công ty và được đăng trên Hugging Face với trọng lượng có sẵn ngay lập tức, mở rộng LFM2-VL-3B của năm ngoái với sự hiểu biết màn hình mạnh mẽ hơn, nền tảng đối tượng, lý luận đa hình ảnh và gọi hàm.
Công ty định vị việc phát hành này là mô hình tầm nhìn mạnh nhất của họ cho phần cứng tự tổ chức. Trong bài đăng phát hành, Liquid AI mô tả nó là “mô hình tầm nhìn ngôn ngữ mạnh nhất của chúng tôi”, một mô hình “cung cấp hiệu suất tầm nhìn cạnh tranh với các mô hình có kích thước gấp đôi, trong khi chạy nhanh hơn trên nhiều triển khai CPU và GPU, thậm chí so với các mô hình có ít tham số hơn.”
Tất cả các số liệu và tốc độ trong bản phát hành này đều được báo cáo bởi nhà cung cấp: Liquid AI đã chạy các đánh giá này bằng vLLM 0.26.0, với mọi mô hình ở chế độ không lý luận và được yêu cầu trả lời trực tiếp. Hiện tại chưa có đánh giá độc lập về mô hình mới, điều này là bình thường vào ngày phát hành, mặc dù gần đây Unite.AI đã đưa tin về một nghiên cứu của Amazon đã đánh giá một số mô hình so sánh tương tự, minh họa tại sao hành vi chuyển录 độc lập có thể khác với điểm chuẩn sạch.
Làm Thế Nào LFM2.5-VL-3B Đọc Màn Hình, Tài Liệu và Nhiều Hình Ảnh
Mô hình này kết hợp một SigLIP2 400M NaFlex bộ mã hóa tầm nhìn từ Google với cùng một xương sống được đào tạo trước như mô hình văn bản LFM2.5-2.6B của Liquid AI, được phát hành vào ngày 4 tháng 8 năm 2026. Theo thẻ mô hình, nó được đào tạo trước trên khoảng 34 nghìn tỷ token với bốn lần nhiều dữ liệu tầm nhìn hơn so với người tiền nhiệm, và từ vựng của nó đã tăng gấp đôi lên 128.000 token bằng cách mở rộng bộ mã hóa hiện có thay vì đào tạo lại, một thay đổi nhằm vào các kịch bản không phải Latin. Đào tạo sau kết hợp tinh chỉnh có giám sát với sự khuếch tán kiến thức từ một mô hình giáo viên lớn hơn, sau đó là học tăng cường đa phần thưởng.
Bốn lĩnh vực khả năng định nghĩa sự nâng cấp trên LFM2-VL-3B. Về hiểu biết màn hình, mô hình này đạt trung bình 80,7 trên các phân chia máy tính để bàn, di động và web của ScreenSpot-v2, tăng từ một con số đơn lên 2,5 đến 7,6 trên mỗi phân chia trên mô hình trước và vượt xa mô hình Gemma-4-E4B 8 tỷ tham số ở 50,9, mặc dù thấp hơn mô hình InternVL 3.5 4B ở 84,2. Về nền tảng, nơi mô hình trả về các hộp giới hạn cho các đối tượng được mô tả trong ngôn ngữ tự nhiên, độ chính xác RefCOCO tăng từ 57,1 lên 87,9, một lợi ích hơn 30 điểm mà Liquid AI cho là do dữ liệu nền tảng tổng hợp có quy mô.
Gọi hàm là mới trong dòng tầm nhìn của công ty. Trên ToolSandbox, đo lường việc sử dụng công cụ, điểm số tăng hơn gấp đôi từ 26,4 lên 59,5, đưa mô hình 3,1 tỷ tham số này lên ngang bằng với Gemma-4-E2B và vượt qua Qwen3.5-2B. Lý luận đa hình ảnh cũng cải thiện mạnh mẽ, với BLINK tăng từ 50,2 lên 61,5 và MuirBench từ 34,9 lên 58,3.
Trên toàn bộ 28 tiêu chuẩn tầm nhìn, LFM2.5-VL-3B đạt trung bình 69,4, một cải thiện 12 điểm so với 57,2 của người tiền nhiệm và trong vòng 0,7 điểm so với mô hình Qwen3.5-4B 4,7 tỷ tham số lớn hơn. Trung bình này che giấu kết cấu thực sự: mô hình này tụt lại phía sau các đối thủ trên một số bộ thử nghiệm chung, và nó thực sự mất đất trên CountBenchQA, giảm từ 92,2 xuống 87,3.
Mô Hình Cố Ý Bỏ Qua Điều Gì
LFM2.5-VL-3B là một mô hình không lý luận. Nó trả lời trực tiếp thay vì tạo ra một chuỗi suy nghĩ trung gian, một lựa chọn thiết kế mà Liquid AI coi là tối ưu hóa độ trễ: thẻ mô hình khuyên nên sử dụng nó cho “các nhiệm vụ một lượt, tốc độ cao, độ trễ thấp”, đặt tên cho phát hiện đối tượng gần thời gian thực cho các ứng dụng ô tô, OCR hàng loạt tài liệu được quét và dịch trên thiết bị menu và biển báo đường là các ứng dụng dự định.
Thẻ mô hình đó cũng tuyên bố rõ ràng những gì mô hình này không phải là. Nó “không được khuyến nghị cho các nhiệm vụ lý luận dài, đòi hỏi lý luận cao, chẳng hạn như thiết kế web trực quan, hoặc trả lời các câu hỏi kỹ thuật cao về bản vẽ.” Độ dài ngữ cảnh là 32.768 token, và thẻ mô hình đánh dấu định dạng OCR chú thích bố cục như một tính năng thử nghiệm, cảnh báo rằng nó “có thể thay đổi, có thể không đáng tin cậy, và có thể không đơn giản để phân tích.” Đây là những hạn chế khả năng mà nhà cung cấp tuyên bố, và chúng đánh dấu nơi các tuyên bố về khả năng dừng lại.
Các số liệu tốc độ neo vào việc phát hành này xuất phát từ thiết kế đó. Liquid AI báo cáo tốc độ giải mã 228 token mỗi giây trên Apple M5 Max và 116 token mỗi giây trên AMD Ryzen AI Max+ 395, trong khoảng 3 GB bộ nhớ, và 20 token mỗi giây trên Galaxy S26 Ultra. Trên một card NVIDIA H100 đơn, công ty đo thời gian đến token đầu tiên ở khoảng 34 mili giây trên một đoạn video năm khung hình, so với khoảng 200 mili giây đối với các mô hình Gemma, và tốc độ đầu ra gần 11.000 token mỗi giây ở độ đồng thời cao, điều mà họ cho là thêm lên đến gần một tỷ token đầu ra mỗi ngày trên một card.
LFM2.5-VL-3B Theo Số Liệu
- 3,1 tỷ tham số; 34 nghìn tỷ token đào tạo trước; ngữ cảnh 32.768 token
- 69,4 trung bình trên 28 tiêu chuẩn tầm nhìn, so với 57,2 của LFM2-VL-3B
- 80,7 trung bình trên ScreenSpot-v2 hiểu biết màn hình, tăng từ 2,5 đến 7,6 trên mỗi phân chia trên mô hình trước
- 87,9 độ chính xác RefCOCO nền tảng, tăng từ 57,1
- 59,5 trên ToolSandbox gọi hàm, tăng từ 26,4
- 228 token/s giải mã trên Apple M5 Max; 20 token/s trên Galaxy S26 Ultra; khoảng 3 GB bộ nhớ
- Khoảng 11.000 token/s đầu ra tại độ đồng thời cao trên một card H100
Điều Gì Đi Kèm Với LFM2.5-VL-3B
Trọng lượng có thể tải xuống ngay từ Hugging Face theo giấy phép trọng lượng mở, với xuất khẩu lượng tử trong các định dạng GGUF, ONNX và MLX và hỗ trợ ngày đầu trên llama.cpp, MLX, vLLM, SGLang và các thời gian chạy ONNX. Một demo WebGPU chạy mô hình hoàn toàn trong trình duyệt, và công ty liệt kê 16 ngôn ngữ được hỗ trợ bao gồm tiếng Anh, tiếng Ả Rập, tiếng Trung, tiếng Nhật và tiếng Hindi.
Phát hành này hoàn thiện dòng LFM2.5 mà Liquid AI đã xây dựng trong nửa cuối năm 2026: mô hình văn bản LFM2.5-2.6B vào ngày 4 tháng 8 năm 2026, các biến thể bộ mã hóa cho suy luận CPU dài vào cuối tháng 7 năm 2026, và bây giờ là tầng tầm nhìn hàng đầu, tiếp theo là các biến thể nhỏ hơn LFM2.5-VL-1.6B và 450M. Các sổ tay tinh chỉnh và tài liệu đi kèm với trọng lượng, vì vậy mô hình có thể được thích nghi với các ứng dụng nền tảng, OCR hoặc gọi hàm cụ thể từ ngày đầu tiên.












