Modele i platformy AI

Liquid AI uruchamia LFM2.5-VL-3B dla szybszego sztucznego inteligentnego widzenia i języka na krawędzi

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma Liquid AI wydała model LFM2.5-VL-3B 12 sierpnia 2026 r., 3,1-miliardowy parametr otwartego modelu widzenia i języka, zaprojektowanego do uruchamiania na telefonach, laptopach i pojedynczych kartach graficznych, a nie w centrum danych. Model, ogłoszony na blogu firmy i opublikowany na Hugging Face z dostępnymi od razu wagami, rozszerza ubiegłoroczny model LFM2-VL-3B o lepsze zrozumienie ekranu, ugruntowanie obiektów, wieloobrazową inferencję i wywoływanie funkcji.

Firma przedstawia ten wydanie jako najbardziej zdolny model widzenia dla samodzielnie hostowanych urządzeń. W poście o wydaniu Liquid AI opisuje go jako “najbardziej zdolny model widzenia i języka”, który “dostarcza konkurencyjne wyniki widzenia w porównaniu z modelami o podwójnej liczbie parametrów, przy jednoczesnym szybszym działaniu na różnych konfiguracjach procesorów i kart graficznych, nawet w porównaniu z modelami o mniejszej liczbie parametrów”.

Wszystkie dane benchmarkowe i prędkości w tym wydaniu są raportowane przez dostawcę: Liquid AI przeprowadził oceny samodzielnie przy użyciu vLLM 0.26.0, z każdym modelem w trybie nieinferencyjnym i z monitem do odpowiedzi bezpośredniej. Nie ma jeszcze niezależnych ocen nowego modelu, co jest oczekiwanym stanem gry w dniu wydania, chociaż ostatnie artykuły Unite.AI na temat badania Amazon, które oceniło kilka tych samych modeli porównawczych, ilustrują dlaczego niezależnie mierzone zachowania transkrypcyjne mogą się różnić od czystych wyników benchmarkowych.

Jak LFM2.5-VL-3B czyta ekrany, dokumenty i wiele obrazów

Model łączy SigLIP2 400M NaFlex kodery widzenia od Google z tym samym pre-trenowanym modelem co model tekstu LFM2.5-2.6B od Liquid AI, wydanym 4 sierpnia 2026 r. Zgodnie z karta modelu, został pre-trenowany na około 34 bilionach tokenów z czterokrotnie większą ilością danych widzenia niż jego poprzednik, a jego słownictwo zostało podwojone do 128 000 tokenów przez rozszerzenie istniejącego tokenizera, a nie przez ponowne szkolenie, co ma na celu obsługę nie-latyńskich skryptów. Po szkoleniu łączy nadzorowane dokształcanie z destylacją wiedzy z większego modelu nauczyciela, a następnie wielo-nagrodowe uczenie wzmacnianie.

Cztery obszary możliwości definiują ulepszenie w porównaniu z LFM2-VL-3B. W zakresie zrozumienia ekranu model średnio osiąga 80,7 w podziałach desktop, mobilnym i webowym ScreenSpot-v2, w górę z jednych cyfr w poprzednim wydaniu i znacznie przed 8-miliardowym modelem Gemma-4-E4B przy 50,9, chociaż za większym modelem InternVL 3.5 4B przy 84,2. W przypadku ugruntowania, gdzie model zwraca prostokąty ograniczające dla obiektów opisanych w języku naturalnym, precyzja RefCOCO skacze z 57,1 do 87,9, co stanowi wzrost o ponad 30 punktów, który Liquid AI przypisuje skalowanym syntetycznym danym ugruntowującym.

Wywoływanie funkcji jest nową funkcją w linii widzenia firmy. W ToolSandbox, który mierzy użycie narzędzi, wynik ponad dwukrotnie wzrasta z 26,4 do 59,5, co stawia model 3,1B na równi z Gemma-4-E2B i przed Qwen3.5-2B. Wieloobrazowa inferencja również znacznie się poprawia, z BLINK rosnącym z 50,2 do 61,5 i MuirBench z 34,9 do 58,3.

Przez cały 28-benchmarkowy zestaw widzenia LFM2.5-VL-3B średnio osiąga 69,4, co stanowi 12-punktową poprawę w porównaniu z poprzednim modelem przy 57,2 i w granicach 0,7 punktu od większego 4,7-miliardowego modelu Qwen3.5-4B. Średnia ukrywa prawdziwą teksturę: model wyprzedza swoich rywali w niektórych ogólnych zestawach, a nawet traci grunt na CountBenchQA, który spada z 92,2 do 87,3.

Co model celowo pomija

LFM2.5-VL-3B jest modelem nieinferencyjnym. Odpowiada bezpośrednio, zamiast generować pośredni łańcuch myśli, co jest projektem, który Liquid AI ujmuje jako optymalizację opóźnienia: karta modelu zaleca go do “jednoobrotowych, wysokowydajnych, niskich opóźnień zadań”, wymieniając prawie w czasie rzeczywistym wykrywanie obiektów dla aplikacji samochodowych, partię OCR skanowanych dokumentów i tłumaczenie menu i znaków drogowych na urządzeniu jako przeznaczone obciążenia.

Ta sama karta stanowi wyraźnie, czego model nie jest. “Nie zaleca się do długich, wymagającychinferencji zadań, takich jak projektowanie witryn internetowych, lub odpowiedzi na bardzo techniczne pytania o plany”. Długość kontekstu wynosi 32 768 tokenów, a karta oznacza format anotacji układu OCR jako eksperymentalny, ostrzegając, że “może ulec zmianie, może być niezawodny, a może nie być trywialne do sparsowania”. Są to własne stwierdzone ograniczenia dostawcy, które oznaczają, gdzie kończą się roszczenia o zdolności.

Podane liczby prędkości wynikają z tego projektu. Liquid AI raportuje prędkość dekodowania 228 tokenów na sekundę na Apple M5 Max i 116 tokenów na sekundę na AMD Ryzen AI Max+ 395, w około 3 GB pamięci, oraz 20 tokenów na sekundę na Galaxy S26 Ultra. Na pojedynczej karcie NVIDIA H100 firma mierzy czas do pierwszego tokenu w przybliżeniu 34 milisekund na pięcioklatkowym klipie wideo, w porównaniu z około 200 milisekundami dla modeli Gemma, oraz wyjściowy przepływ w pobliżu 11 000 tokenów na sekundę przy wysokiej współbieżności, co, jak twierdzi, dodaje się do prawie miliarda tokenów wyjściowych na dzień na jednej karcie.

LFM2.5-VL-3B według liczb

  • 3,1 miliarda parametrów; 34 biliony tokenów pre-trenowania; 32 768 tokenów kontekstu
  • 69,4 średnia w 28 benchmarkach widzenia, w porównaniu z 57,2 dla LFM2-VL-3B
  • 80,7 średnia w ScreenSpot-v2 zrozumieniu ekranu, w górę z 2,5 do 7,6 na podział w poprzednim modelu
  • 87,9 precyzja RefCOCO ugruntowania, w górę z 57,1
  • 59,5 w ToolSandbox wywoływania funkcji, w górę z 26,4
  • 228 tokenów/s dekodowania na Apple M5 Max; 20 tokenów/s na Galaxy S26 Ultra; około 3 GB śladu pamięci
  • Około 11 000 tokenów/s wyjściowych przy wysokiej współbieżności na jednej karcie H100

Co jest dostarczane z LFM2.5-VL-3B

Wagi są dostępne do pobrania teraz z Hugging Face na licencji open-weight, z eksportami kwantowanymi w formatach GGUF, ONNX i MLX oraz wsparciem dla llama.cpp, MLX, vLLM, SGLang i ONNX runtime od dnia wydania. Demo WebGPU uruchamia model całkowicie w przeglądarce, a firma wymienia 16 obsługiwanych języków, w tym angielski, arabski, chiński, japoński i hindi.

Wydanie uzupełnia rodzinę LFM2.5, którą Liquid AI składał przez drugą połowę 2026 r.: model tekstu LFM2.5-2.6B 4 sierpnia 2026 r., warianty kodera dla długiego kontekstu CPU inference w późnym lipcu 2026 r. oraz teraz flagowy poziom widzenia, który następuje po mniejszych wariantach LFM2.5-VL-1.6B i 450M. Notesy do fine-tuningu i dokumentacja są dostarczane wraz z wagami, aby model mógł być dostosowany do określonych obciążeń ugruntowania, OCR lub wywoływania funkcji od pierwszego dnia.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.