Yapay zeka modelleri ve platformları
Sıvı AI, LFM2.5-VL-3B’yi Daha Hızlı Görüntü-Dil AI için Çift Kenarlı Olarak Gönderir

Liquid AI, 12 Ağustos 2026’da LFM2.5-VL-3B’yi yayınladı. Bu, 3.1 milyar parametreli açık ağırlıklı bir görüntü-dil modelidir ve telefonlarda, dizüstü bilgisayarlarda ve tek GPU’larda çalışmak üzere tasarlanmıştır. Model, şirketin blogunda ve Hugging Face’e gönderilen ağırlıklarla birlikte, önceki yılın LFM2-VL-3B’sini daha güçlü ekran anlaşılması, nesne zemini, çoklu görüntü akıl yürütmesi ve işlev çağırması ile genişletir.
Şirket, bu sürümü kendisinin en yetenekli görüntüleme modeli olarak konumlandırıyor. Yayın yazısında, Liquid AI bunu “en yetenekli görüntü-dil modelimiz” olarak tanımlar ve “iki katı büyüklüğündeki modellere karşı rekabetçi görüntüleme performansı sunarken, daha az parametreli modellere kıyasla CPU ve GPU dağıtımlarında daha hızlı çalışır” diye belirtir.
Bu sürüde verilen tüm benchmark ve hız rakamları satıcı tarafından bildirilen değerlerdir: Liquid AI, vLLM 0.26.0 kullanarak değerlendirmeleri kendisi gerçekleştirmiştir ve her model doğrudan cevap vermek üzere akıl yürütme dışı modda çalıştırılmıştır. Henüz bu yeni model için bağımsız değerlendirmeler mevcut değildir, ancak Unite.AI’nin Amazon çalışmasıyla ilgili yakın zamanda yapılan bircoverage, bağımsız olarak ölçülen transkript davranışının neden temiz benchmark puanlarından sapabileceğini gösterir.
LFM2.5-VL-3B’nin Ekranları, Belgeleri ve Çoklu Görüntüleri Nasıl Okuduğu
Model, Google’un SigLIP2 400M NaFlex görüntüleme kodlayıcısını Liquid AI’nin 4 Ağustos 2026’da yayınladığı LFM2.5-2.6B metin modelinin aynı önceden eğitilmiş omurgasıyla birleştirir. Model kartına göre, yaklaşık 34 trilyon tokenle önceden eğitilmiş ve önceki sürümüne kıyasla dört kat daha fazla görüntüleme verisiyle eğitilmiştir. Sözlüğü, tokenizerı genişleterek değil de yeniden eğitmeyerek 128.000 tokenle ikiye katlanmıştır ve bu değişiklik non-Latin betiklerine yöneliktir. Eğitim sonrası, denetimli fine-tuning ve daha büyük bir öğretmen modelinden bilgi damıtımı ile çoklu ödül pekiştirmeli öğrenim birleştirilir.
Dört yetenek alanı, LFM2-VL-3B’den bu güncellemeyi tanımlar. Ekran anlaşılmasında, model ScreenSpot-v2’nin masaüstü, mobil ve web bölümlerinin ortalaması 80.7’dir ve bu, önceki sürümdeki tek basamaklı değerlerden ve 8 milyar parametreli Gemma-4-E4B’nin 50.9’undan daha iyidir, ancak daha büyük InternVL 3.5 4B’nin 84.2’sinden daha düşüktür. Zemini belirlemede, model doğal dilde tanımlanan nesnelerin sınırlayıcı kutularını döndürür ve RefCOCO’da doğruluk 57.1’den 87.9’a çıkar, bu da Liquid AI’nin sentetik zemini büyütmesinden kaynaklandığını belirttiği 30 puanın üzerinde bir artıştır.
İşlev çağırma, şirketin görüntüleme ürün ailesine yeni bir özelliktir. AraçSandbox’ta, araç kullanımını ölçen bir testte, skor 26.4’ten 59.5’e çıkar ve bu, 3.1 milyar parametreli modeli Gemma-4-E2B ile aynı seviyeye ve Qwen3.5-2B’den daha iyi bir konuma getirir. Çoklu görüntü akıl yürütmesi de keskin bir şekilde iyileşir, BLINK 50.2’den 61.5’e ve MuirBench 34.9’dan 58.3’e çıkar.
28 full görüntüleme benchmark’ının tamamında, LFM2.5-VL-3B ortalaması 69.4’tür, bu da önceki sürümün 57.2’sine kıyasla 12 puanlık bir iyileşmedir ve 4.7 milyar parametreli Qwen3.5-4B’den 0.7 puan daha düşüktür. Bu ortalama, bazı genel testlerde rakiplerinin gerisinde kaldığını ve CountBenchQA’da 92.2’den 87.3’e düştüğünü gizler.
Modelin Kasıtlı Olarak Bıraktığı
LFM2.5-VL-3B, akıl yürütme olmayan bir modeldir. Doğrudan cevaplar verir ve ara akıl zinciri oluşturmaz, bu da Liquid AI tarafından gecikme optimizasyonu olarak tanımlanır: Model kartı, “tek tur, yüksek verimlilik, düşük gecikme görevleri” için önerilir ve gerçek zamanlı nesne algılama, belgelerin toplu OCR işlemleri ve cihaz上的 menu ve yol işaretlerinin çevirisi gibi iş yüklerini adlandırır.
Aynı kart, modelin ne için olmadığını açıkça belirtir. “Uzun bağlam, akıl yürütme yoğun görevler, örneğin görsel web tasarımı veya mühendislik çizimlerine ilişkin teknik sorulara cevap vermek için önerilmez” diye belirtir. Bağlam uzunluğu 32.768 tokendir ve kart, düzen-annotasyon OCR formatının deneysel olduğunu ve “değişebileceği, güvenilemeyeceği ve kolayca parse edilemeyeceği” konusunda uyarıda bulunur. Bunlar, satıcının kendi kısıtlamalarıdır ve yetenek iddialarının nerede bittiğini gösterir.
Hız rakamları, bu tasarımdan kaynaklanır. Liquid AI, Apple M5 Max’te saniyede 228 token, AMD Ryzen AI Max+ 395’te saniyede 116 token ve yaklaşık 3 GB bellek içinde ölçer ve Galaxy S26 Ultra’da saniyede 20 token hızına ulaşır. Tek bir NVIDIA H100’de, beş karelik bir video klip için ilk tokena ulaşma süresini yaklaşık 34 milisaniye olarak ölçer ve Gemma modellerine kıyasla yaklaşık 200 milisaniye olarak bildirir ve yüksek paralellikte yaklaşık 11.000 token/s çıktı verimliliği sağlar, bu da bir kartta günlük yaklaşık bir milyar çıktı tokenine karşılık gelir.
LFM2.5-VL-3B Rakamlarıyla
- 3.1 milyar parametre; 34 trilyon ön-eğitim tokeni; 32.768 token bağlamı
- 28 görüntüleme benchmark’ının ortalaması 69.4, LFM2-VL-3B’nin 57.2’sine kıyasla
- ScreenSpot-v2’de ekran anlaşılma ortalaması 80.7, önceki modelin her bir bölmesindeki 2.5 ila 7.6 puanından daha yüksek
- RefCOCO’da zemini belirleme doğruluğu 87.9, 57.1’den daha yüksek
- AraçSandbox’ta işlev çağırma puanı 59.5, 26.4’ten daha yüksek
- Apple M5 Max’te saniyede 228 token; Galaxy S26 Ultra’da saniyede 20 token; yaklaşık 3 GB bellek ayak izi
- Tek bir H100’de yaklaşık 11.000 çıktı tokeni/saniye, yüksek paralellikte
LFM2.5-VL-3B ile Ne Geliyor
Ağırlıklar, Hugging Face’den açık ağırlık lisansı altında şimdi indirilebiliyor ve GGUF, ONNX ve MLX formatlarında nicemlendirmeli dışa aktarmalar ve llama.cpp, MLX, vLLM, SGLang ve ONNX çalışma zamanları için gün-1 desteği sunuyor. WebGPU demo, modeli tamamen tarayıcıda çalıştırır ve şirket, İngilizce, Arapça, Çince, Japonca ve Hintçe dahil 16 dilin desteklediğini listeledi.
Yayın, Liquid AI’nin 2026’nin ikinci yarısında oluşturduğu LFM2.5 ailesini tamamlar: 4 Ağustos 2026’da LFM2.5-2.6B metin modeli, Temmuz 2026’nın sonlarında uzun bağlam CPU çıkarımı için kodlayıcı varyantları ve şimdi bu amiral gemisi görüntüleme sürümü, daha küçük LFM2.5-VL-1.6B ve 450M varyantlarını takip eder. Ağırlıklarla birlikte fine-tuning defterleri ve belgeler gönderilir, böylece model ilk günden itibaren belirli zemini, OCR veya işlev çağırma iş yüklerine uyarlanabilir.












