نماذج ومنصات الذكاء الاصطناعي
Liquid AI تطلق LFM2.5-VL-3B لتحسين الذكاء الاصطناعي للرؤية واللغة على الحواف

أصدرت Liquid AI نموذج LFM2.5-VL-3B في 12 أغسطس 2026، وهو نموذج رؤية ولغة مفتوح الوزن يحتوي على 3.1 مليار معامل، مصمم للتشغيل على الهواتف والكمبيوترات المحمولة ووحدات معالجة الرسومات الفردية بدلاً من مركز البيانات. النموذج، الذي تم الإعلان عنه على مدونة الشركة وتم نشره على Hugging Face مع توفر الأوزان على الفور، يمتد إلى نموذج LFM2-VL-3B السابق مع فهم الشاشة الأقوى وتأسيس الكائنات وتعقل الصور المتعددة والدعوة إلى الوظائف.
تضع الشركة الإصدار كنموذج رؤية الأكثر قدرة للعتاد المضيف. في منشور الإصدار، تصف Liquid AI النموذج بأنه “نموذجنا الأكثر قدرة على رؤية اللغة”، والذي “يوفر أداء رؤية منافس مع نماذج أكبر ضعف حجمه، مع تشغيل أسرع عبر مجموعة من تطبيقات المعالجة المركزية والمعالجات الرسومية حتى مقارنة بالنماذج التي تحتوي على معاملات أقل”.
جميع الأرقام المعيارية والأداء المذكورة في هذا الإصدار هي تقارير من قبل البائع: قامت Liquid AI بتشغيل التقييمات بنفسها باستخدام vLLM 0.26.0، مع كل نموذج في وضع غير منطقي ومحفز للاستجابة مباشرة. لا توجد تقييمات مستقلة للنموذج الجديد بعد، وهو ما هو متوقع في يوم الإصدار، على الرغم من أن تغطية Unite.AI الأخيرة لدراسة أمازون التي قيمت نفس النماذج المقارنة توضح لماذا يمكن أن تختلف سلوك النقل المستقل عن نتائج البenchmarks النظيفة.
كيف يقرأ LFM2.5-VL-3B الشاشات والوثائق والصور المتعددة
يجمع النموذج بين محرك فك التشفير SigLIP2 400M NaFlex من جوجل مع نفس الهيكل المسبق للتدريب مثل نموذج النص LFM2.5-2.6B من Liquid AI، الذي تم إصداره في 4 أغسطس 2026. وفقًا لبيان النموذج، تم تدريبه مسبقًا على حوالي 34 تريليون رمز مع أربعة أضعاف المزيد من بيانات الرؤية من سابقه، وتم مضاعفة قاموسه إلى 128000 رمز عن طريق تمديد محلل الرموز الحالي بدلاً من إعادة التدريب، وهو تغيير يهدف إلى النصوص غير اللاتينية. يجمع التدريب بعد الإعداد بين التنقيح الخاضع للإشراف مع استخلاص المعرفة من نموذج معلم أكبر، يليها تعلم التعزيز المتعدد المكافأة.
تحدد أربع مجالات قدرة التحسين على LFM2-VL-3B. في فهم الشاشة، يبلغ النموذج متوسط 80.7 عبر تقسيمات سطح المكتب والجوال والويب من ScreenSpot-v2، من أرقام فردية على الإصدار السابق ومتقدم بشكل جيد على نموذج Gemma-4-E4B ذي 8 مليارات معامل عند 50.9، على الرغم من أنه ي tụن نموذج InternVL 3.5 4B عند 84.2. في التأسيس، حيث يعود النموذج بأطر متوافقة مع الكائنات الموصوفة باللغة الطبيعية، يقفز دقة RefCOCO من 57.1 إلى 87.9، وهو مكسب يزيد عن 30 نقطة يattributesه Liquid AI إلى بيانات التأسيس الاصطناعي المضخمة.
الدعوة إلى الوظائف هي ميزة جديدة في خط رؤية الشركة. على ToolSandbox، الذي يقيس استخدام الأدوات، يزيد الرقم أكثر من الضعف من 26.4 إلى 59.5، مما يجعل نموذج 3.1B على قدم المساواة مع Gemma-4-E2B وأمام Qwen3.5-2B. كما تحسنت العقلانية المتعددة للصور بشكل حاد، مع ارتفاع BLINK من 50.2 إلى 61.5 وMuirBench من 34.9 إلى 58.3.
عبر مجموعة كاملة من 28 اختبارًا للرؤية، يبلغ LFM2.5-VL-3B متوسط 69.4، وهو تحسين بنسبة 12 نقطة عن 57.2 سابقه، وضمن 0.7 نقطة من نموذج Qwen3.5-4B الأكبر ذي 4.7 مليار معامل. يخفي المتوسط بعض النسيج الحقيقي: النموذج ي tụن منافسيه في بعض المجموعات العامة، ويفقد الأرض على CountBenchQA، الذي ينخفض من 92.2 إلى 87.3.
ما يتركه النموذج عمدًا
LFM2.5-VL-3B هو نموذج غير منطقي. إنه يجيب مباشرة بدلاً من توليد سلسلة تفكير وسيطة، وهو خيار تصميم Liquid AI يصفه بالتحسين من التأخير: يوصي النموذج ب “المهام المنطقية المفردة، عالية الإنتاجية، منخفضة التأخير”، ويسرد الكشف عن الكائنات في الوقت الفعلي للتطبيقات السيارات، و OCR الدفعة للوثائق الممسوحة ضوئيًا، وترجمة القوائم واللافتات على الجهاز كأحمال عمل مقصودة.
النفس البطاقة يشير بوضوح إلى ما لا ينوي النموذج القيام به. إنه “لا يوصى به للمهام التي تتطلب سياقًا طويلًا، أو مهام منطقية كثيفة، مثل تصميم الويب المرئي، أو الإجابة على أسئلة فنية عالية التقنية حول المخططات”. طول السياق هو 32768 رمز، وتحذر البطاقة من تنسيق OCR الملاحظات Experimental Layout، مشيرة إلى أنه “قد يتغير، قد يكون غير موثوق به، وربما لا يكون من السهل تحليله”. هذه هي قيود القدرة المعلنة من قبل البائع، وتحدد حيث تتوقف المطالبات بالقدرة.
أرقام السرعة التي تؤسس الإصدار تتبع ذلك التصميم. تقارير Liquid AI سرعات فك التشفير تبلغ 228 رمزًا في الثانية على Apple M5 Max و 116 رمزًا في الثانية على AMD Ryzen AI Max+ 395، في حوالي 3 جيجابايت من الذاكرة، و 20 رمزًا في الثانية على Galaxy S26 Ultra. على NVIDIA H100 مفرد، تقيس الشركة وقت Appearance الأول عند حوالي 34 مللي ثانية على مقطع فيديو مكون من خمس إطارات، مقابل حوالي 200 مللي ثانية للنماذج Gemma، وانتاج خرج قريب من 11000 رمز في الثانية عند تزامن عال، مما يضيف ما يقرب من مليار رمز خرج في اليوم على بطاقة واحدة.
LFM2.5-VL-3B بالأرقام
- 3.1 مليار معامل؛ 34 تريليون رمز مسبق التدريب؛ 32768 رمز سياق
- 69.4 متوسط عبر 28 اختبارًا للرؤية، مقابل 57.2 ل LFM2-VL-3B
- 80.7 متوسط على ScreenSpot-v2 لفهم الشاشة، من 2.5 إلى 7.6 لكل تقسيم على النموذج السابق
- 87.9 دقة RefCOCO للتأسيس، من 57.1
- 59.5 على ToolSandbox للدعوة إلى الوظائف، من 26.4
- 228 رمز/ثانية فك التشفير على Apple M5 Max؛ 20 رمز/ثانية على Galaxy S26 Ultra؛ حوالي 3 جيجابايت أثر الذاكرة
- حوالي 11000 رمز/ثانية إخراج عند تزامن عال على H100 مفرد
ما يأتي مع LFM2.5-VL-3B
الأوزان قابلة للتنزيل الآن من Hugging Face تحت رخصة الوزن المفتوح، مع تصدير كمومي في صيغ GGUF و ONNX و MLX و دعم يوم الأول عبر llama.cpp و MLX و vLLM و SGLang و ONNX. يوجد تطبيق WebGPU يعمل النموذج بالكامل في المتصفح، ويستند الشركة إلى 16 لغة مدعومة بما في ذلك الإنجليزية والعربية والصينية واليابانية والهندية.
الإصدار يكمّل عائلة LFM2.5 التي جمعتها Liquid AI خلال النصف الثاني من 2026: نموذج النص LFM2.5-2.6B في 4 أغسطس 2026، ومتغيرات المُкод للاستدلال بالسياق الطويل في أواخر يوليو 2026، والنموذج الرائد للرؤية الآن، الذي يلي المتغيرات الأصغر LFM2.5-VL-1.6B و 450M. توجد دفاتر ملاحظات التنقيح والوثائق جنبًا إلى جنب مع الأوزان، بحيث يمكن تعديل النموذج لتحميلات عمل محددة للتأسيس أو OCR أو استدعاء الأدوات من اليوم الأول.












