Моделі та платформи ШІ

Liquid AI випускає LFM2.5-VL-3B для швидшої візуальної мови на краю

mm
Додайте Unite.AI до бажаних джерел у Google

Liquid AI випустила LFM2.5-VL-3B 12 серпня 2026 року, 3,1-мільярдний параметр відкритої вагової візуальної мови моделі, створеної для роботи на телефонах, ноутбуках і одинарних GPU, а не в центрі даних. Модель, оголошена на блозі компанії і опублікована на Hugging Face з вагами, доступними відразу, розширює LFM2-VL-3B минулого року з більш сильним розумінням екрану, об’єктним основуванням, багаторазовим висновком і функціональним викликом.

Компанія позиціонує випуск як свою найбільш здатну візуальну модель для самохостованого апаратного забезпечення. У випусковому повідомленні Liquid AI описує її як “нашу найбільш здатну візуальну мовну модель”, яка “предоставляє конкурентоспроможну візуальну продуктивність проти моделей у два рази більших, при цьому працює швидше на всіх видах CPU і GPU, навіть порівняно з моделями, які мають менше параметрів”.

Всі бенчмарки і швидкісні показники в цьому випуску є заявленими виробником: Liquid AI провела оцінки самостійно за допомогою vLLM 0.26.0, з кожною моделлю у режимі без висновку і з прямою відповіддю. Незалежні оцінки нової моделі ще не існують, що є очікуваним станом на день випуску, хоча недавнє висвітлення Unite.AI дослідження Amazon, яке оцінило кілька тих самих порівняльних моделей, показує чому незалежно виміряна поведінка транскрипції може відрізнятися від чистих бенчмарків.

Як LFM2.5-VL-3B читає екрани, документи та багаторазові зображення

Модель поєднує SigLIP2 400M NaFlex візуальний кодувальник від Google з тим же попередньо натренованим бекбоном, що і текстова модель LFM2.5-2.6B Liquid AI, випущена 4 серпня 2026 року. За даними карти моделі, вона була попередньо натренована на приблизно 34 трильйонах токенів з чотири рази більшою кількістю візуальних даних, ніж її попередник, а її словник подвоївся до 128 000 токенів шляхом розширення існуючого токенізаційного засобу, а не повторної тренування, що було спрямовано на нелатинські скрипти. Посттренінг поєднує наглядове тонке налаштування з знанням дистиляції від більшої вчительської моделі, а потім багаторазове підкріплення навчання.

Чотири області можливостей визначають апгрейд над LFM2-VL-3B. На розумінні екрану модель у середньому становить 80,7 по десктоп-, мобільному і веб-розділам ScreenSpot-v2, що вище однозначних цифр на попередньому випуску і значно випереджає 8-мільярдний параметр Gemma-4-E4B на рівні 50,9, хоча і позаду більшої InternVL 3.5 4B на рівні 84,2. На основуванні, де модель повертає обмежувальні рамки для об’єктів, описаних природною мовою, точність RefCOCO стрибає з 57,1 до 87,9, що є зростанням понад 30 пунктів, яке Liquid AI пояснює масштабованими синтетичними даними основування.

Функціональний виклик є новим у лінії візуальних моделей компанії. На ToolSandbox, який вимірює використання інструментів, оцінка більше ніж подвоюється з 26,4 до 59,5, поставивши 3,1-мільярдну модель на рівні з Gemma-4-E2B і попереду Qwen3.5-2B. Багаторазовий висновок також покращується різко, з BLINK, який стрибає з 50,2 до 61,5, і MuirBench з 34,9 до 58,3.

По всьому 28-бенчмарку візуального набору LFM2.5-VL-3B у середньому становить 69,4, що є 12-бальною поліпшенням порівняно з 57,2 попередника і на рівні з більшим 4,7-мільярдним параметром Qwen3.5-4B. Середнє значення приховує справжню текстуру, хоча: модель відстає від своїх конкурентів на деяких загальних наборах і навіть втрачає позиції на CountBenchQA, який падає з 92,2 до 87,3.

Що модель свідомо залишає поза увагою

LFM2.5-VL-3B є моделлю без висновку. Вона відповідає безпосередньо, а не генерує проміжну ланцюжок думок, що є дизайнерським вибором, який Liquid AI позиціонує як оптимізацію затримки: карта моделі рекомендує її для “однохідних, високопродуктивних, низькозатримкових завдань”, називаючи майже реальний час виявлення об’єктів для автомобільних застосунків, пакетну OCR сканованих документів і переклад меню та дорожніх знаків на пристрої як призначені робочі навантаження.

Той самий документ прямо зазначає, для чого модель не підходить. Вона “не рекомендується для довгих контекстів, висновкових завдань, таких як візуальний веб-дизайн, або для відповідей на високотехнічні питання про схеми”. Довжина контексту становить 32 768 токенів, а документ позначає її формат анотації макету OCR як експериментальний, попереджаючи, що він “може змінитися, може бути ненадійним і може не бути тривіальним для парсингу”. Це власні обмеження виробника, і вони позначають, де зупиняються претензії на можливості.

Швидкісні показники, які закріплюють випуск, випливають з цього дизайну. Liquid AI повідомляє про швидкість декодування 228 токенів на секунду на Apple M5 Max і 116 токенів на секунду на AMD Ryzen AI Max+ 395, у близько 3 ГБ пам’яті, і 20 токенів на секунду на Galaxy S26 Ultra. На одному NVIDIA H100 компанія вимірює час до першого токену приблизно за 34 мілісекунди на п’ятикадровому відеокліпі, проти близько 200 мілісекунд для моделей Gemma, і вихідну продуктивність близько 11 000 токенів на секунду при високій конкуренції, що, як вона стверджує, складає майже мільярд вихідних токенів на день на одній карті.

LFM2.5-VL-3B за цифрами

  • 3,1 мільярда параметрів; 34 трильйони токенів попередньої тренування; 32 768 токенів контексту
  • 69,4 у середньому по 28 візуальним бенчмаркам, проти 57,2 для LFM2-VL-3B
  • 80,7 у середньому по ScreenSpot-v2 для розуміння екрану, що вище 2,5-7,6 за розділ на попередній моделі
  • 87,9 точність RefCOCO для основування, що вище 57,1
  • 59,5 на ToolSandbox для функціонального виклику, що вище 26,4
  • 228 токенів/с декодування на Apple M5 Max; 20 токенів/с на Galaxy S26 Ultra; приблизно 3 ГБ пам’яті
  • Приблизно 11 000 токенів/с вихідної продуктивності при високій конкуренції на одному H100

Що поставляється з LFM2.5-VL-3B

Ваги можна завантажити зараз з Hugging Face під відкритою ліцензією ваг, з квантованими експортами у форматах GGUF, ONNX і MLX і підтримкою з першого дня на llama.cpp, MLX, vLLM, SGLang і ONNX. Демо WebGPU запускає модель повністю у браузері, а компанія перераховує 16 підтримуваних мов, включаючи англійську, арабську, китайську, японську та хінді.

Випуск завершує сімейство LFM2.5, яке Liquid AI збирає у другій половині 2026 року: текстову модель LFM2.5-2.6B 4 серпня 2026 року, варіанти кодувальника для довгих контекстів CPU-інференсу у кінці липня 2026 року, і тепер флагманський візуальний рівень, який слідує за меншими варіантами LFM2.5-VL-1.6B і 450M. Ноутбуки тонкого налаштування і документація поставляються разом з вагами, тому модель можна адаптувати до конкретних завдань основування, OCR або виклику інструментів з першого дня.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.