تقارير

إطلاق ألبابا لتقرير تقني Qwen3-VL يوضح تحليل فيديو لمدة ساعتين

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

نشر فريق Qwen التابع لألبابا تقرير تقني Qwen3-VL في 26 نوفمبر، مع توثيق مفصل للنموذج مفتوح المصدر للرؤية واللغة الذي تم إطلاقه لأول مرة في سبتمبر. وكشف الورقة التي كتبها 64 مؤلفًا أن النظام يمكنه معالجة فيديوهات مدتها ساعتان داخل نافذة سياق تحتوي على 256000 رمز مع الحفاظ على دقة قريبة من الكمال في تحديد الإطارات المحددة.

حققت الطراز الرائد Qwen3-VL-235B-A22B دقة 100٪ في اختبارات “الإبرة في العصبة” عند البحث في فيديوهات مدتها 30 دقيقة، وحافظت على دقة 99.5٪ حتى عند مسح فيديوهات مدتها ساعتان تحتوي على ما يقرب من مليون رمز. وتتمثل طريقة الاختبار في إدراج إطار “إبرة” семантиًا مهم في مواقع عشوائية داخل فيديوهات طويلة، ثم تحدي النموذج لتحديد وتحليل ذلك الإطار المحدد.

تضع هذه القدرة نموذج Qwen3-VL كتطور كبير في فهم الفيديو الطويل – مجال حيث كافح معظم نماذج الرؤية واللغة للحفاظ على تحليل متسق خلال فترات زمنية مطولة.

الbenchmark الأداء مقابل النماذج الرائدة

يوثق التقرير التقني أداء Qwen3-VL عبر عدة معايير تقييم، مع قوة خاصة في مهام الرياضيات البصرية.حققت النموذج 85.8٪ في MathVista، متجاوزة 81.3٪ ل GPT-5، وقادت MathVision بنسبة 74.6٪ دقة مقارنة بـ Gemini 2.5 Pro (73.3٪) و GPT-5 (65.8٪).

أثبتت قدرات معالجة المستندات قوة مماثلة. حقق النموذج 96.5٪ في DocVQA لفهム المستندات و 875 نقطة في OCRBench، مع دعم التعرف على النص عبر 39 لغة – ما يقرب من أربع مرات تغطية اللغة لنظيره السابق Qwen2.5-VL. تم الحفاظ على أكثر من 70٪ دقة في مهام OCR في 32 من تلك اللغات المدعومة.

تتوفر عائلة النماذج، من خلال Hugging Face و Alibaba Cloud، في كل من الإصدارات الكثيفة (2B، 4B، 8B، 32B معامل) وتكوين الخبراء (30B-A3B و 235B-A22B). وحدها الإصدار 8B تجاوز أكثر من 2 مليون تحميل منذ إطلاقه في سبتمبر.

然而، لم تكن النتائج ساحقة بشكل موحد. في اختبار MMMU-Pro متعدد التخصصات المعقد، سجل Qwen3-VL 69.3٪ مقارنة بـ 78.4٪ ل GPT-5. كما احتفظ المنافسون التجاريون بمزايا في معايير الإجابة على أسئلة الفيديو العامة، مما يشير إلى أن النموذج يمتاز كمتخصص في الرياضيات البصرية وتحليل المستندات بدلاً من كونه قائدًا عامًا.

ثلاثة تحسينات معمارية

يوضح التقرير التقني ثلاثة تحسينات معمارية رئيسية ت驱ّض هذه القدرات. أولاً، يُستخدم “التركيب المتداخل MRoPE” لتحسين أداء النموذج في الفيديوهات الطويلة من خلال توزيع التمثيلات الرياضية بشكل متساوٍ عبر الأبعاد الزمنية والعرضية والارتفاعية بدلاً من تجميعها حسب البعد.

ثانيًا، يدمج DeepStack ميزات Transformer البصرية متعددة المستويات لتقاط تفاصيل بصرية دقيقة وتightening الانطباق بين الصورة والنص. ويتحرك التحسين الثالث أبعد من التضمين الزمني الدوراني إلى محاذاةタイムスタンプ النصية الصريحة، مما يتيح تمثيل زمني أكثر دقة عند الحاجة إلى الإشارة إلى لحظات محددة في محتوى الفيديو.

أثبت النظام أيضًا قدرات وكلاء تتجاوز الإدراك البصري النقي. على ScreenSpot Pro، الذي يقيّم الملاحة داخل واجهات المستخدم الرسومية، حقق النموذج 61.8٪ دقة. كما سجل اختبار AndroidWorld، الذي يتطلب من النظام تشغيل تطبيقات Android بشكل مستقل، 63.7٪ دقة للطراز 32B.

مناظير المنافسة مفتوحة المصدر

جميع نماذج Qwen3-VL التي تم إطلاقها منذ سبتمبر متاحة تحت رخصة Apache 2.0 مع أوزان مفتوحة. تشمل المجموعة النماذج الكثيفة starting من 2B معامل مناسب للنشر على الحواف إلى الطراز الرائد 235B-A22B الذي يتطلب موارد حسابية كبيرة – يبلغ حجم الأخير 471 جيجابايت.

تعد توقيتات توثيق تقني هامًا. أظهر Gemini 1.5 Pro من جوجل قدرات مماثلة لاستخراج الإطارات من فيديوهات طويلة في بداية عام 2024، لكن Qwen3-VL يجلب وظيفية مماثلة إلى النظام البيئي مفتوح المصدر. مع ازدياد عدد مستخدمي الذكاء الاصطناعي التوليدي في الصين إلى 515 مليون في الأشهر الأخيرة، و جذب نموذج Qwen أكثر من 300 مليون تحميل حول العالم، تضع ألبابا بوضوح نماذجها مفتوحة المصدر كأساس لتطوير الذكاء الاصطناعي متعدد الوضعيات على مستوى العالم.

سجل النموذج السابق Qwen2.5-VL بالفعل أكثر من 2800 استشهاد في أقل من 10 أشهر، مما يشير إلى تبني بحثي قوي. ومن المتوقع أن يسرع التقرير التقني المفصل ل Qwen3-VL هذا المسار، حيث يوفر للباحثين التفاصيل المعمارية والتدريبية اللازمة للبناء أو المنافسة مع هذه القدرات.

ما يعنيه هذا لل مطورين

للفريق الذي يعمل على تحليل الفيديو أو ذكاء المستندات أو الاستدلال البصري، يوفر Qwen3-VL قدرات جاهزة للإنتاج دون الاعتماد على واجهات برمجة التطبيقات. وتجعل قوة النموذج في الرياضيات البصرية مناسبًا على الفور لتكنولوجيا التعليم، وأدوات البحث العلمي، وأي تطبيق يتطلب تفسير الرسومات أو المخططات أو التدوين الرياضي داخل الصور.

لا تزال الفجوة بين النماذج المفتوحة والمنغمة موجودة في بعض المجالات. يظهر Qwen3-VL أن نماذج الأوزان المفتوحة يمكن أن تتطابق أو تتجاوز الأنظمة المملوكة في مهام متخصصة مثل الرياضيات البصرية، حتى لو كانت تسبقها في اختبارات المنطق الأوسع نطاقًا.

للمجتمع مفتوح المصدر للذكاء الاصطناعي، يُعتبر التقرير التقني المفصل أكثر من مجرد توثيق – إنه خارطة طريق يمكن للفرق الأخرى دراستها وانتقادها والبناء عليها. سواء أدى ذلك إلى تنفيذات منافسة أو أبحاث مكملة، فإن خط القاعدة لذكاء متعدد الوضعيات مفتوح المصدر قد تحرك بشكل كبير للأعلى.

Alex McFarland هو صحفي وكاتب في مجال الذكاء الاصطناعي يستكشف أحدث التطورات في الذكاء الاصطناعي. وقد تعاون مع العديد من الشركات الناشئة في مجال الذكاء الاصطناعي والمنشورات في جميع أنحاء العالم.