زاوية Anderson
ألعاب الفوضى تعزز التفكير البصري للذكاء الاصطناعي

تشير الأبحاث الجديدة إلى أن نماذج الذكاء الاصطناعي يمكن أن تصبح أكثر ذكاءً في الرؤية من خلال حل ألعاب الفوضى. إعادة ترتيب الصور والفيديوهات والمشاهد ثلاثية الأبعاد المخلوطة تساعدهم على تعزيز مهاراتهم البصرية دون الحاجة إلى بيانات إضافية
أو علامات أو أدوات. في الهرولة الحالية لدفع نماذج اللغةالكبيرةمتعددة الوضعية ( MLLMs *) إلى الأمام ، هناك القليل من الانتصارات السهلة ولا مجال للغداء المجاني. على الرغم من أن العديد من الإصدارات الصينية للبرامج مفتوحة المصدر في عام 2025 تم الإبلاغ عن أن لديها في الأدبيات البحثية ، فإن معظم النهج المزعوم “المجاني” لتطويرهندسة الذكاء الاصطناعي تُظهر تحسينات فإن طفيفة فقط ؛ أو تحسينات في مجالات ليست الأكثر سعيًا. ومع ذلك ، البحث عن مبادئ أساسيةلم تكتشف بعد قد تسريع وتيرة التطوير أمر لا يمكن التخلي عنه. تكاليف تطوير وتشغيل أقل ، فإن الإصدارات الغربية تميل إلى إلقاء المزيد من الأموال في المشكلة: المزيد من حجم البيانات ، والمزيد من قوة الاستدلال ، والمزيد من الكهرباء (على الرغم من أننا لاحظنا مؤخرًا أن لا يزال هناك المزيد من المشاهدين البشر الحقيقيين ، منذ أن يكون ذلك باهظًا جدًا حتى لثورة الذكاء الاصطناعي ذات التكلفة البالغة تريليون دولار+).
التعامل مع القطع
في حين أن هذا ليس بالضبط في تلك الفئة ، فإن التعاون الأكاديمي الجديد بين المؤسسات الصينية يزعم أنه قد حدد أن جعل نماذج اللغة الكبيرة


متسقة على القاعدة Qwen2.5-VL ، مع تعديل مقاييس القيمة لکل اختبار للوضوح. Source: https://arxiv.org/pdf/2509.25190 النظام الذي صممه الباحثون يُسمى ، ويتضمن تدريب نماذج اللغة الكبيرة متعددة الوضعية الحالية على تم تفتيتها موادوتوزيعهاعشوائيًا ، مثل الفوضى. قام المؤلفون بتطوير ثلاث طرق لهذا النهج: صورة ، فيديو ، وثلاثي الأبعاد (أي Visual معقولاًJigsaw شبكات ) ، ووجدوا أن تعديلًا

تقسيم الصورة إلى قطع في ، وتمزج ، ويتوقع النموذج الترتيب الصحيح؛

ثلاثية الأبعاد ، يتم تمزج النقاط ذات الأعماق المختلفة ، ويرتب النموذجها من الأقرب إلى البصرية من خلال إعادة الأبعد. طريقة تدريب Visual Jigsaw تساعد نماذج الذكاء الاصطناعي على تحسين فهم المعلومات

يتطلب أي تعليم إضافي: الجواب غير الصحيح ، مثل “الغش” باستخدام نفس الرقم بشكل متكرر ، يحصل على درجة صفر.
لا لتشجيع وجهته النهائية داخلالتنسيق الثابت ، يجب على النموذج وضع استدلاله داخل علامات علامات <think> . يحصل على مكافأة صغيرة إذا تم استخدام هذا التنسيق بشكل صحيح. <answer>
الصور
لإنشاء لغز للوضع ، يتم تقسيم صورة إلى شبكة من القطع عن طريق تقطيعها إلى كتل متساوية الحجم: الصور أمثلة على قطع الصور التي يجب على النظام حلها. تُ منbốتر القطع في ترتيب ثابت من أعلى اليسار إلى أسفل اليمين ، كما هو الحال في ترتيب القراءة على الصفحة ، قبل تمزجها بتمزج عشوائي. ثم يتعرض النظام لهذه المجموعة الممزوجة تم استخدام القطع ، ويجب أن يجد الترتيب الأصلي عن طريق التنبؤ بالترتيب الصحيح الذي يستعيد التخطيط الأصلي. في التدريب ، 118,000 صورة من مجموعة COCO ، مع كل صورة تنتج تسع قطع (أي “قطع الفوضى”). الطلب المقدم إلى النظام موضح أعلاه (الصورة الجديدة’ مع التعليق الذي يبدأ بـ ). ‘من مواد البحث
الفيديو
فيما يتعلق بمهام فوضى الفيديو، ثم تقطيع الفيديو إلى تسلسل من المقاطع عن طريق تقطيعها بشكل متساوٍ عبر الوقت ، ثم تمزج مقاطع الفيديو.

الزمني الصحيح الأصلي: أمثلة مقطوعة من تحدي الفوضى الفيديوية ، من مواد البحث الجديدة. تم استخدام 100,000 فيديو من مجموعة LLaVA-Video للتدريب على هذا الوضع ، مع كل فيديو مقطع إلى ست قطع. لمنع النظام من استغلال الدلائل الواضحة للمطابقة الإطارية عند حدود القطع ، تم قص 5٪ من الإطارات في بداية ونهاية كل قطعة. كانت كل قطعة تحتوي على أكثر من 12 إطارًا ، كل منها بحد أقصى 128x28x28 بكسل. تم استبعاد الفيديوهات القصيرة جدًا (أقل من 24 ثانية). الطلب المقدم لهذه المهمة موضح أدناه: الطلب التعلمي المقدم إلى نماذج اللغة الكبيرة متعددة الوضعية لمهمة الفيديو بدون المقاطع التي تم تقديمها إلى النموذج..،
البيانات ثلاثية الأبعاد
تتضمن مهمة فوضى ثلاثية الأبعاد كاملة عادةً تقسيم مساحة ثلاثية الأبعاد (مثل كتل فوكسل أو سحب النقاط) إلى أجزاء أصغر وتدريب نموذج لإعادة بناء التخطيط المكاني الأصلي. ومع ذلك، لا يمتلك النموذج النموذجي متعدد الأنماط القدرة على التعامل مباشرةً مع البيانات ثلاثية الأبعاد الخام؛بدلاً من ذلك، يعتمد على مدخلات الصور أو الفيديو المُعَلمة. لذا، ولإنشاء مهمة تستخدم الاستدلال ثلاثي الأبعاد مع الحفاظ على توافقها مع نماذج اللغة الكبيرة متعددة الأنماط الحالية، قدّم الباحثون صيغةً أكثر جدوى باستخدام:

النظر والحركة الكاميرا. يُخلص نموذج الفوضى ثلاثية الأبعاد بشكل صحيح إلى العلاقة المكانية بين مشاهدتين لمشهد والاتجاه المحتمل للحركة الكاميرا ، متغلبًا على نموذج Qwen2.5-VL-7B. من كل صورةRGB-D ، يُمنح النموذج قائمة ممزوجة من النقاط التي كانت ذات أعماق مختلفة في الأصل ، تتراوح من الأقرب إلى الأبعد ، والهدف هو استعادة ترتيب العمق الصحيح باستخدام فقط الصورة ثنائية الأبعاد كمرجع: الطلب التعلمي للفوضى ثلاثية الأبعاد. كل نقطة تم وضع علامة عليها على الصورة (التي يتم عرضها على النموذج ، ولكن لا يتم تمثيلها في مثال الطلب الموجود في الصورة أعلاه) ، ويجب على النموذج التنبؤ بأي نقطة كانت الأقرب ، والأقرب ثانيًا ، وهكذا ، بفعالية إعادة بناء التسلسل الأصلي للعمق دون الوصول إلى القيم الخام للعمق. تم تدريب مهمة الفوضى ثلاثية الأبعاد على صور RGB-D من مجموعة ScanNet ، باستخدام 300,000 نموذج تم إنشاؤه bằng اختيار مجموعات عشوائية من ست نقاط العمق لكل صورة. أمثلة على سحب النقاط من مجموعة ScanNet المستخدمة

الاختبارات
للاختبارات الأولية ، استخدم النظام Qwen2.5-VL-7B-Instruct كنموذج أساسي متعدد الأنماط. استُخدمت خوارزمية GRPO للتدريب، مع إزالة كلٍّ من تنظيم KL وفقدان دالة `into`. للتنبؤات،

باتش عالمي من 256 ، في حين استخدمت الفوضى الفيديوية والفوضى

128. عند تخصيصها لكل طلب، أنتج النموذج 16 استجابة بدرجة ترميز 1.0. تم تدريب كلا النموذجين باستخدام: مهمةالفوضى الصورية والفيديوية لمدة

الاختبارات
للاختبارات الأولية ، استخدم النظام Qwen2.5-VL-7B-Instruct كنموذج متعدد الوضعية الأساسي. تم استخدام خوارزمية GRPO للتدريب ، مع إزالة كل منالتنظيمKL و فقدان `into`
` . للتوقعات الجزئية ، تم تطبيق عامل تخفيض 0.2. استخدم التدريب على الفوضى الصورية حجم باتش عالمي من 256 ، في حين استخدمت الفوضى الفيديوية والفوضى ثلاثية الأبعاد 128. تم تعيين لكل طلب، أنتج النموذج 16 استجابة بدرجة ترميز 1.0. تم تدريب النموذجين. مهمة الفوضى الصورية والفيديوية لمدة 1,000 خطوة ، في حين تم تدريب مهمة الفوضى ثلاثية الأبعاد لمدة 800 خطوة. معدل التعلم إلى 1×10⁻⁶.
الفوضى الصورية
تم اختبار نموذج الفوضى الصورية عبر ثلاث فئات من الاختبارات المركزة على الرؤية: للاستدلال الدقيق و الفهم ، MMVP ، جزء الاستدلال الدقيق من MMStar؛ MMBench؛ HR-Bench ؛ V*؛ MME-RealWorld (lite)؛ LISA-Grounding ؛ وOVD-Eval . بالنسبة إلىفهم الفراغ أحادي البعد ، كانت الاختباراتVSR ؛OmniSpatial ؛ و DepthAnything V2(DA-2K) الفهم البصري ، تم استخدامWinoground و SugerCrepe++ . تم اختبار ثلاثة أسس ، جميعها مشتقة من Qwen2.5-VL-7B: ThinkLite-VL للاستدلال المتعدد الوضعية؛ VL-Cogito للمهام البصرية والعلمية العامة؛ و LLaVA-Critic-R1 للاستدلال البصري. تم تقييم جميعها باستخدام إجابات قصيرة فقط ، لأن الاستدلال السلسلة الفكرية (CoT) أحيانًا يقلل الأداء. نتائج

للفوضى الصورية ، كما هو موضح أعلاه ، يقول المؤلفون: ‘(الصور
أعلاه) تُظهر أن طريقةنا تحسن بشكل مستمر القدرات المركزة على الرؤية على ثلاثة أنواع من الاختبارات. هذه النتائج تؤكد أن دمج التدريب على الفوضى الصورية بعد الإصدار يعزز بشكل كبير من التمثيل البصري ونظام اللغة في نماذج اللغة الكبيرة متعددة الوضعية.
‘نسبة هذه التحسينات إلى حقيقة أن حل الفوضى الصورية يتطلب من النموذج الاهتمام بالتفاصيل المحلية للقطع ، والاستدلال عن التخطيطات المكانية العالمية ، والتفكير في العلاقات بين القطع ، مما يفيد مباشرة الفهم الدقيق والمكاني والمركب.’
الفوضى الفيديوية
تم إجراء التقييم لفوضى الفيديو. علىAoTBench ؛Vinoground ؛TOMATO ؛ FAVOR-Bench؛ TUNA-Bench ؛Video-MME ؛ TempCompass؛ TVBench؛ MotionBench؛ LVBench؛ VSI-Bench؛ Video-TT ؛و CVBench .Video-R1 تماستخدامه
كأساس ، تم تدريبه مع تعليم إشرافي بارد ثم تعلم تعزيزي للاستدلال والتفكير في الفيديو. في هذه الحالة ، تم تضمين عمليات التفكير الكاملة في التقييمات ، لأنها أنتجت نتائج أفضل بشكل متسق من الإجابات المباشرة. تم تقييد جميع النماذج بحد أقصى 256x28x28 بكسل ، وتم اختبارها عبر ثلاثة إعدادات إطارية – 16 و 32 و 64: نتائج التقييم على

الفيديوية تحسينات مستمرة عبر جميع اختبارات الفيديو وإعدادات الإطارات ، مع مكاسب قوية بشكل خاص في المهام التي تتطلب التفكير الزمني والاتجاهية ، مثل تلك الموجودة في AoTBench ، وأيضًا في اختبارات التفكير عبر الفيديوهات ، مثل CVBench: ‘تؤكد
هذه النتائج أن حل مهام الفوضى الفيديوية يشجع النموذج على التقاط الاستمرارية الزمنية بشكل أفضل ، وفهم العلاقات عبر الفيديوهات ، والتفكير في الاتساق الاتجاهي ، والتعامل مع سيناريوهات الفيديو الشاملة والقابلة للتعميم.’
البيانات ثلاثية الأبعاد
تم تقييم النموذج للوضع ثلاثي الأبعاد. SAT-Real؛ 3DSRBench؛ ViewSpatial؛ All-Angles ؛السابق VSI-Bench ؛ SPARBench (tiny)؛والسابقة DA-2K . نتائج التقييم على اختبارات

المؤلفون: ‘(الفوضى ثلاثية
الأبعاد) تحقق مكاسب كبيرة عبر جميع الاختبارات. كما هو متوقع ، فإن أكبر مكسب يتم تحقيقه على DA-2K ، وهو اختبار تقدير العمق يتعلق مباشرة بمهمة التدريب على الترتيب العميق. ومع ذلك ، نلاحظ تحسينات مستمرة عبر مجموعة واسعة من المهام الأخرى ، بما في ذلك تلك التي تتضمن مدخلات فيديو أحادية العرض (مثل 3DSRBench ، (OmniSpatial)) ، ومتعددة العرض (مثل ViewSpatial ، All-Angles) ،
والفيديو المركزي (مثل VSI-Bench). ‘ ‘تُظهر هذه النتائج أن نهجنا لا يعلم فقط المهارة المحددة للترتيب العميق ، بل يعزز أيضًا القدرة العامة للنموذج على إدراك الهياكل المكانية ثلاثية الأبعاد.’
الاستنتاج
ما لا يزال غير واضح تمامًا من هذا البحث هو العلاقة الدقيقة بين الصور والوصف التي تعمل على تحسين أداء نماذج اللغة الكبيرة متعددة الوضعية. عند النظر الأول ، يبدو أن عملية التعلم من خلال حل الألغاز تشبه إلى حد ما محاولاتنا الأولى وتطورنا. ومع ذلك ، فإن نظرة أعمق على البحث يكشف عن مدى اعتماد نماذج اللغة الكبيرة متعددة الوضعية على اللغة كجسر مثير بين الواقع البصري والواقع السيميائي. * يفضل مؤلفو البحث استخدام المصطلح الأقل شيوعًا ‘نماذج اللغة الكبيرة متعددة الوضعية’ ، ويرمز إليها بـ MLLMs . هذا هو مصطلح جديد أو نادر الاستخدام ، ويتعلق بنماذج يمكنها التفكير والتحليل المكاني للصور بشكل مكثف ، ولكنها لا تولد صورًا. مع ظهور أنماط ونموذجmớiة ، يتم مراجعة هذا المصطلح باستمرار. تم نشره لأول مرة يوم الخميس ، 2 أكتوبر2025.
First published Thursday, 2 أكتوبر 2025












