Модели и платформы ИИ
Liquid AI представляет LFM2.5-VL-3B для более быстрого зрения-языка ИИ на краю

Liquid AI выпустила LFM2.5-VL-3B 12 августа 2026 года, 3,1-миллиардный параметр открытого веса модели зрения-языка, предназначенной для запуска на телефонах, ноутбуках и отдельных GPU, а не в центре данных. Модель, анонсированная в блоге компании и опубликованная на Hugging Face с весами, доступными сразу, расширяет LFM2-VL-3B прошлого года с более сильным пониманием экрана, объектным основанием, многокадровым рассуждением и функциональным вызовом.
Компания позиционирует выпуск как свою наиболее способную модель зрения для самообслуживаемого оборудования. В посте о выпуске Liquid AI описывает ее как “нашу наиболее способную модель зрения-языка”, которая “предоставляет конкурентоспособную производительность зрения против моделей в два раза больше ее размера, при этом работает быстрее на диапазоне CPU и GPU, даже по сравнению с моделями, имеющими меньше параметров”.
Все показатели производительности и скорости в этом выпуске являются заявленными производителем: Liquid AI провела оценки самостоятельно, используя vLLM 0.26.0, с каждой моделью в режиме без рассуждения и с просьбой ответить直接. Не существует независимых оценок новой модели, что является ожидаемым состоянием на день выпуска, хотя недавнее освещение Unite.AI исследования Amazon, оценившего несколько из тех же сравнительных моделей, иллюстрирует почему независимо измеренное транскрипционное поведение может расходиться с чистыми показателями производительности.
Как LFM2.5-VL-3B читает экраны, документы и несколько изображений
Модель объединяет SigLIP2 400M NaFlex визуальный кодировщик от Google с тем же предварительно обученным бэкбоном, что и текстовая модель LFM2.5-2.6B от Liquid AI, выпущенная 4 августа 2026 года. Согласно карте модели, она была предварительно обучена на примерно 34 триллионах токенов с четырьмя разами больше визуальных данных, чем ее предшественник, и ее словарь был удвоен до 128 000 токенов путем расширения существующего токенизатора, а не повторной тренировки, изменение, направленное на нелатинские скрипты. Пост-тренировка объединяет контролируемую тонкую настройку с дистилляцией знаний из более крупной модели учителя, за которой следует многонаградное обучение с подкреплением.
Четыре области возможностей определяют апгрейд над LFM2-VL-3B. На понимании экрана модель в среднем составляет 80,7 по десктоп-, мобильным и веб-разделам ScreenSpot-v2, что выше единиц на предыдущем выпуске и намного опережает 8-миллиардный параметр Gemma-4-E4B на 50,9, хотя и отстает от более крупной InternVL 3.5 4B на 84,2. На основании, где модель возвращает ограничивающие рамки для объектов, описанных в естественном языке, точность RefCOCO увеличивается с 57,1 до 87,9, что является приростом более чем на 30 пунктов, который Liquid AI приписывает масштабированным синтетическим данным основания.
Вызов функций новый в линейке зрения компании. На ToolSandbox, который измеряет использование инструментов, оценка более чем удваивается с 26,4 до 59,5, что ставит 3,1-миллиардную модель на один уровень с Gemma-4-E2B и опережает Qwen3.5-2B. Многокадровое рассуждение также улучшается резко, с BLINK, увеличивающимся с 50,2 до 61,5, и MuirBench с 34,9 до 58,3.
По всем 28 бенчмаркам зрения LFM2.5-VL-3B в среднем составляет 69,4, что является 12-пунктовым улучшением над 57,2 ее предшественника и находится в пределах 0,7 пунктов от более крупной 4,7-миллиардной модели Qwen3.5-4B. Среднее значение скрывает реальную текстуру, хотя: модель отстает от своих соперников на некоторых общих наборах и фактически теряет позиции на CountBenchQA, который падает с 92,2 до 87,3.
Что модель намеренно оставляет без внимания
LFM2.5-VL-3B является моделью без рассуждения. Она отвечает напрямую, не генерируя промежуточной цепочки мыслей, дизайнерский выбор, который Liquid AI обрамляет как оптимизацию задержки: карта модели рекомендует ее для “одноходовых, высокопроизводительных, низкозадержечных задач”, называя近 реальное время обнаружения объектов для автомобильных применений, пакетную OCR сканированных документов и перевод меню и дорожных знаков на устройстве в качестве предназначенных рабочих нагрузок.
Та же карта гласит явно, для чего модель не предназначена. Она “не рекомендуется для задач с длинным контекстом, требующих рассуждений, таких как визуальный веб-дизайн или ответы на высокотехнические вопросы о чертежах”. Длина контекста составляет 32 768 токенов, и карта отмечает свой формат OCR макета-аннотации как экспериментальный, предупреждая, что он “может измениться, может быть ненадежным и может быть не тривиальным для парсинга”. Это собственные заявленные ограничения компании, и они отмечают, где претензии на возможности прекращаются.
Скоростные показатели, которые служат якорем для выпуска, следуют из этого дизайна. Liquid AI сообщает о скоростях декодирования 228 токенов в секунду на Apple M5 Max и 116 токенов в секунду на AMD Ryzen AI Max+ 395, примерно в 3 ГБ памяти, и 20 токенов в секунду на Galaxy S26 Ultra. На одном NVIDIA H100 компания измеряет время до первого токена примерно за 34 миллисекунды на пятикадровом видеоклипе, против около 200 миллисекунд для моделей Gemma, и пропускную способность вывода около 11 000 токенов в секунду при высокой конкуренции, что, по ее словам, добавляется до почти миллиарда токенов вывода в день на одной карте.
LFM2.5-VL-3B в цифрах
- 3,1 миллиарда параметров; 34 триллиона токенов предварительной тренировки; 32 768 токенов контекста
- 69,4 в среднем по 28 бенчмаркам зрения, против 57,2 для LFM2-VL-3B
- 80,7 в среднем на ScreenSpot-v2 понимании экрана, против 2,5-7,6 на предыдущей модели
- 87,9 точность основания RefCOCO, против 57,1
- 59,5 на ToolSandbox вызове функций, против 26,4
- 228 токенов/с декодирования на Apple M5 Max; 20 токенов/с на Galaxy S26 Ultra; примерно 3 ГБ памяти
- Примерно 11 000 токенов/с вывода при высокой конкуренции на одном H100
Что поставляется с LFM2.5-VL-3B
Веса можно скачать сейчас с Hugging Face под открытой лицензией веса, с квантованными экспортами в форматах GGUF, ONNX и MLX и поддержкой на день выпуска на llama.cpp, MLX, vLLM, SGLang и ONNX. Демо WebGPU запускает модель полностью в браузере, и компания перечисляет 16 поддерживаемых языков, включая английский, арабский, китайский, японский и хинди.
Выпуск завершает семейство LFM2.5, которое Liquid AI собирала во второй половине 2026 года: текстовую модель LFM2.5-2.6B 4 августа 2026 года, варианты кодировщика для длинного контекста CPU-инференса в конце июля 2026 года, и теперь флагманский уровень зрения, который следует за меньшими вариантами LFM2.5-VL-1.6B и 450M. Тетради тонкой настройки и документация поставляются вместе с весами, поэтому модель может быть адаптирована к конкретным задачам основания, OCR или вызова инструментов с первого дня.












