زاوية Anderson

ألعاب الفوضى تعزز التفكير البصري للذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

تشير الأبحاث الجديدة إلى أن نماذج الذكاء الاصطناعي يمكن أن تصبح أكثر ذكاءً في الرؤية من خلال حل ألعاب الفوضى. إعادة ترتيب الصور والفيديوهات والمشاهد ثلاثية الأبعاد المخلوطة تساعدهم على تعزيز مهاراتهم البصرية دون الحاجة إلى بيانات إضافية

 

أو علامات أو أدوات. في الهرولة الحالية لدفع نماذج اللغةالكبيرةمتعددة الوضعية ( MLLMs *) إلى الأمام ، هناك القليل من الانتصارات السهلة ولا مجال للغداء المجاني. على الرغم من أن العديد من الإصدارات الصينية للبرامج مفتوحة المصدر في عام 2025 تم الإبلاغ عن أن لديها في الأدبيات البحثية ، فإن معظم النهج المزعوم “المجاني” لتطويرهندسة الذكاء الاصطناعي تُظهر تحسينات فإن طفيفة فقط ؛ أو تحسينات في مجالات ليست الأكثر سعيًا. ومع ذلك ، البحث عن مبادئ أساسيةلم تكتشف بعد قد تسريع وتيرة التطوير أمر لا يمكن التخلي عنه. تكاليف تطوير وتشغيل أقل ، فإن الإصدارات الغربية تميل إلى إلقاء المزيد من الأموال في المشكلة: المزيد من حجم البيانات ، والمزيد من قوة الاستدلال ، والمزيد من الكهرباء (على الرغم من أننا لاحظنا مؤخرًا أن لا يزال هناك المزيد من المشاهدين البشر الحقيقيين ، منذ أن يكون ذلك باهظًا جدًا حتى لثورة الذكاء الاصطناعي ذات التكلفة البالغة تريليون دولار+).

التعامل مع القطع

في حين أن هذا ليس بالضبط في تلك الفئة ، فإن التعاون الأكاديمي الجديد بين المؤسسات الصينية يزعم أنه قد حدد أن جعل نماذج اللغة الكبيرة

Visual Jigsaw هو إطار عمل بعد التدريب ذاتي يُحسّن من مهارات الرؤية في نماذج اللغة الكبيرة متعددة الوضعية. من خلال التدريب على مهام الفوضى عبر الصور والفيديوهات والبيانات ثلاثية الأبعاد ، يكتسب النماذج رؤية دقيقة ومكانية وتركيبية أفضل في الصور ، وتعزيزًا لreasoning الزمني في الفيديوهات ، وفهماً متقدمًا للجغرافيا في المشاهد ثلاثية الأبعاد. يعرض مخطط الرادار في الصورة أعلاه مكاسب متسقة على القاعدة Qwen2.5-VL ، مع تعديل مقاييس القيمة لکل اختبار للوضوح. متعددة الوضعية تحل ألعاب الفوضى تحسن أدائهم بشكل ملحوظ ، على الرغم من أن هذا النهج القائم على التعزيز سجل أداء سيئًا في هذه المنطقة من قبل ، وعلى الرغم من أنه لا يتطلب أي أنظمة إضافية أو نماذج مساعدة أو عمليات “إضافة” أخرى: Visual الوضعية.Jigsaw هو إطار عمل بعد التدريب ذاتي يُحسّن من مهارات الرؤية في نماذج اللغة الكبيرة متعددة منخلال التدريب على مهام الفوضى عبر

تمثيل لمهام الفوضى البصرية الثلاثة. في الفوضى الصورية ، يتم تقسيم الصورة إلى قطع ، وتمزج ، ويتوقع النموذج الترتيب الصحيح؛ في الفوضى الفيديوية ، يتم تمزج مقاطع الفيديو ، ويعيد النموذج ترتيبها الزمني؛ في الفوضى ثلاثية الأبعاد ، يتم تمزج النقاط ذات الأعماق المختلفة ، ويرتب النموذجها من الأقرب إلى الأبعد. الصور والفيديوهات والبيانات ثلاثية الأبعاد ، يكتسب النماذج رؤية دقيقة ومكانية وتركيبية أفضل في الصور ، وتعزيزًا لreasoning الزمني في الفيديوهات ، وفهماً متقدمًا للجغرافيا في المشاهد ثلاثية الأبعاد. يعرض مخطط الرادار في الصورة أعلاه مكاسب

متسقة على القاعدة Qwen2.5-VL ، مع تعديل مقاييس القيمة لکل اختبار للوضوح. Source: https://arxiv.org/pdf/2509.25190 النظام الذي صممه الباحثون يُسمى ، ويتضمن تدريب نماذج اللغة الكبيرة متعددة الوضعية الحالية على تم تفتيتها موادوتوزيعهاعشوائيًا ، مثل الفوضى. قام المؤلفون بتطوير ثلاث طرق لهذا النهج: صورة ، فيديو ، وثلاثي الأبعاد (أي Visual معقولاًJigsaw شبكات ) ، ووجدوا أن تعديلًا

أمثلة على قطع الصور التي يجب على النظام حلها. بنفس العملية كان مفيدًا لجميع ثلاثة المجالات: تمثيل لمهام الفوضى البصرية الثلاثة. في الفوضى الصورية ، يتم

تقسيم الصورة إلى قطع في ، وتمزج ، ويتوقع النموذج الترتيب الصحيح؛

أمثلة مقطوعة من تحدي الفوضى الفيديوية ، من مواد البحث الجديدة. الفوضى الفيديوية ، يتم تمزج مقاطع الفيديو ، ويعيد النموذج ترتيبها الزمني؛ في الفوضى

ثلاثية الأبعاد ، يتم تمزج النقاط ذات الأعماق المختلفة ، ويرتب النموذجها من الأقرب إلى البصرية من خلال إعادة الأبعد. طريقة تدريب Visual Jigsaw تساعد نماذج الذكاء الاصطناعي على تحسين فهم المعلومات

الطلب التعلمي المقدم إلى نماذج اللغة الكبيرة متعددة الوضعية لمهمة الفيديو. تجميع هذه الصور أو مقاطع الفيديو أو نقاط البيانات ثلاثية الأبعاد المخلوطة. تعتمد هذه العملية على الكلمات وليس على الصور ، وبالتالي لا يتعين على النموذج توليد الصور أو استخدام أي مكونات بصرية إضافية. هذا النهج يتناسب مع نظام يُسمى ( التعلم بالتعزيز من المكافآت القابلة للتحقق RLVR ) ، حيث يحصل النموذج على مكافآت للاجابات الصحيحة بناءً على قواعد واضحة وآلية؛ وبالتالي ،

يتطلب أي تعليم إضافي: الجواب غير الصحيح ، مثل “الغش” باستخدام نفس الرقم بشكل متكرر ، يحصل على درجة صفر.

لا لتشجيع وجهته النهائية داخلالتنسيق الثابت ، يجب على النموذج وضع استدلاله داخل علامات علامات <think> . يحصل على مكافأة صغيرة إذا تم استخدام هذا التنسيق بشكل صحيح. <answer>

الصور

لإنشاء لغز للوضع ، يتم تقسيم صورة إلى شبكة من القطع عن طريق تقطيعها إلى كتل متساوية الحجم: الصور أمثلة على قطع الصور التي يجب على النظام حلها. تُ منbốتر القطع في ترتيب ثابت من أعلى اليسار إلى أسفل اليمين ، كما هو الحال في ترتيب القراءة على الصفحة ، قبل تمزجها بتمزج عشوائي. ثم يتعرض النظام لهذه المجموعة الممزوجة تم استخدام القطع ، ويجب أن يجد الترتيب الأصلي عن طريق التنبؤ بالترتيب الصحيح الذي يستعيد التخطيط الأصلي. في التدريب ، 118,000 صورة من مجموعة COCO ، مع كل صورة تنتج تسع قطع (أي “قطع الفوضى”). الطلب المقدم إلى النظام موضح أعلاه (الصورة الجديدة’ مع التعليق الذي يبدأ بـ ). ‘من مواد البحث

الفيديو

فيما يتعلق بمهام فوضى الفيديو، ثم تقطيع الفيديو إلى تسلسل من المقاطع عن طريق تقطيعها بشكل متساوٍ عبر الوقت ، ثم تمزج مقاطع الفيديو.

أمثلة من أسئلة فهم الفراغ ثلاثي الأبعاد المستخدمة لتقييم الأداء في استدلال زاوية النظر والحركة الكاميرا. يُخلص نموذج الفوضى ثلاثية الأبعاد بشكل صحيح إلى العلاقة المكانية بين مشاهدتين لمشهد والاتجاه المحتمل للحركة الكاميرا ، متغلبًا على نموذج Qwen2.5-VL-7B. يعرض النظام هذه التسلسلات الممزوجة ، ويجب أن يجد الترتيب

الزمني الصحيح الأصلي: أمثلة مقطوعة من تحدي الفوضى الفيديوية ، من مواد البحث الجديدة. تم استخدام 100,000 فيديو من مجموعة LLaVA-Video للتدريب على هذا الوضع ، مع كل فيديو مقطع إلى ست قطع. لمنع النظام من استغلال الدلائل الواضحة للمطابقة الإطارية عند حدود القطع ، تم قص 5٪ من الإطارات في بداية ونهاية كل قطعة. كانت كل قطعة تحتوي على أكثر من 12 إطارًا ، كل منها بحد أقصى 128x28x28 بكسل. تم استبعاد الفيديوهات القصيرة جدًا (أقل من 24 ثانية). الطلب المقدم لهذه المهمة موضح أدناه: الطلب التعلمي المقدم إلى نماذج اللغة الكبيرة متعددة الوضعية لمهمة الفيديو بدون المقاطع التي تم تقديمها إلى النموذج..،

البيانات ثلاثية الأبعاد

تتضمن مهمة فوضى ثلاثية الأبعاد كاملة عادةً تقسيم مساحة ثلاثية الأبعاد (مثل كتل فوكسل أو سحب النقاط) إلى أجزاء أصغر وتدريب نموذج لإعادة بناء التخطيط المكاني الأصلي. ومع ذلك، لا يمتلك النموذج النموذجي متعدد الأنماط القدرة على التعامل مباشرةً مع البيانات ثلاثية الأبعاد الخام؛بدلاً من ذلك، يعتمد على مدخلات الصور أو الفيديو المُعَلمة. لذا، ولإنشاء مهمة تستخدم الاستدلال ثلاثي الأبعاد مع الحفاظ على توافقها مع نماذج اللغة الكبيرة متعددة الأنماط الحالية، قدّم الباحثون صيغةً أكثر جدوى باستخدام:

الطلب التعلمي للفوضى ثلاثية الأبعاد. الصور ثنائية البعد التي تحتوي على معلومات العمق لكل بكسل (أي RGB-D ). أمثلة من أسئلة فهم الفراغ ثلاثي الأبعاد المستخدمة لتقييم الأداء في استدلال زاوية

النظر والحركة الكاميرا. يُخلص نموذج الفوضى ثلاثية الأبعاد بشكل صحيح إلى العلاقة المكانية بين مشاهدتين لمشهد والاتجاه المحتمل للحركة الكاميرا ، متغلبًا على نموذج Qwen2.5-VL-7B. من كل صورةRGB-D ، يُمنح النموذج قائمة ممزوجة من النقاط التي كانت ذات أعماق مختلفة في الأصل ، تتراوح من الأقرب إلى الأبعد ، والهدف هو استعادة ترتيب العمق الصحيح باستخدام فقط الصورة ثنائية الأبعاد كمرجع: الطلب التعلمي للفوضى ثلاثية الأبعاد. كل نقطة تم وضع علامة عليها على الصورة (التي يتم عرضها على النموذج ، ولكن لا يتم تمثيلها في مثال الطلب الموجود في الصورة أعلاه) ، ويجب على النموذج التنبؤ بأي نقطة كانت الأقرب ، والأقرب ثانيًا ، وهكذا ، بفعالية إعادة بناء التسلسل الأصلي للعمق دون الوصول إلى القيم الخام للعمق. تم تدريب مهمة الفوضى ثلاثية الأبعاد على صور RGB-D من مجموعة ScanNet ، باستخدام 300,000 نموذج تم إنشاؤه bằng اختيار مجموعات عشوائية من ست نقاط العمق لكل صورة. أمثلة على سحب النقاط من مجموعة ScanNet المستخدمة

أمثلة على سحب النقاط من مجموعة ScanNet المستخدمة في الفوضى ثلاثية الأبعاد. Source: https://arxiv.org/pdf/1702.04405 في الفوضى ثلاثية الأبعاد. Source: https://arxiv.org/pdf/1702.04405 كل نقطة كانت مطلوبة لتكون داخل نطاق عمق من 0.1 إلى 10 أمتار ، ولتعزيز التنوع ، لم يُسمح لأي نقطتين في مجموعة أن تكون أقرب من 40 بكسل في مستوى الصورة ، أو أقل من 0.2 متر في العمق.

الاختبارات

للاختبارات الأولية ، استخدم النظام Qwen2.5-VL-7B-Instruct كنموذج أساسي متعدد الأنماط. استُخدمت خوارزمية GRPO للتدريب، مع إزالة كلٍّ من تنظيم KL وفقدان دالة `into`. للتنبؤات،

نتائج التقييم على اختبارات الصور. تحسنت الفوضى الصورية على نموذج Qwen2.5-VL-7B الأساسي عبر جميع فئات المهام (أي الاستدلال الدقيق والفهم؛ الفهم المكاني أحادي البعد؛ والاستدلال المركب البصري)، متغلبًا على الأسس المُدرَّبة بعد الإصدار السابقة. الجزئية ، تم تطبيق عامل تخفيض 0.2. استخدم التدريب على الفوضى الصورية حجم

باتش عالمي من 256 ، في حين استخدمت الفوضى الفيديوية والفوضى

نتائج التقييم على معايير الصورة. تم تحسين Image Jigsaw على النموذج الأساسي Qwen2.5-VL-7B في جميع فئات المهام (أي الإدراك والفهم الدقيقين؛ والفهم المكاني الأحادي؛ والتفكير البصري التركيبي)، متفوقًا في الأداء على الخطوط الأساسية السابقة بعد التدريب. ثلاثية الأبعاد

128. عند تخصيصها لكل طلب، أنتج النموذج 16 استجابة بدرجة ترميز 1.0. تم تدريب كلا النموذجين باستخدام: مهمةالفوضى الصورية والفيديوية لمدة

نتائج التقييم على اختبارات الفيديو ، حيث تفوقت الفوضى الفيديوية على الأساس بشكل متسق عبر جميع المهام وإعدادات الإطارات. 1,000 خطوة ، في حين تم تدريب مهمة الفوضى ثلاثية الأبعاد لمدة 800 خطوة. معدل التعلم إلى 1×10⁻⁶.

الاختبارات

للاختبارات الأولية ، استخدم النظام Qwen2.5-VL-7B-Instruct كنموذج متعدد الوضعية الأساسي. تم استخدام خوارزمية GRPO للتدريب ، مع إزالة كل منالتنظيمKL و فقدان `into`

` . للتوقعات الجزئية ، تم تطبيق عامل تخفيض 0.2. استخدم التدريب على الفوضى الصورية حجم باتش عالمي من 256 ، في حين استخدمت الفوضى الفيديوية والفوضى ثلاثية الأبعاد 128. تم تعيين لكل طلب، أنتج النموذج 16 استجابة بدرجة ترميز 1.0. تم تدريب النموذجين. مهمة الفوضى الصورية والفيديوية لمدة 1,000 خطوة ، في حين تم تدريب مهمة الفوضى ثلاثية الأبعاد لمدة 800 خطوة. معدل التعلم إلى 1×10⁻⁶.

الفوضى الصورية

تم اختبار نموذج الفوضى الصورية عبر ثلاث فئات من الاختبارات المركزة على الرؤية: للاستدلال الدقيق و الفهم ، MMVP ، جزء الاستدلال الدقيق من MMStar؛ MMBench؛ HR-Bench ؛ V*؛ MME-RealWorld (lite)؛ LISA-Grounding ؛ وOVD-Eval . بالنسبة إلىفهم الفراغ أحادي البعد ، كانت الاختباراتVSR ؛OmniSpatial ؛ و DepthAnything V2(DA-2K) الفهم البصري ، تم استخدامWinoground و SugerCrepe++ . تم اختبار ثلاثة أسس ، جميعها مشتقة من Qwen2.5-VL-7B: ThinkLite-VL للاستدلال المتعدد الوضعية؛ VL-Cogito للمهام البصرية والعلمية العامة؛ و LLaVA-Critic-R1 للاستدلال البصري. تم تقييم جميعها باستخدام إجابات قصيرة فقط ، لأن الاستدلال السلسلة الفكرية (CoT) أحيانًا يقلل الأداء. نتائج

يتم تقييم النتائج بناءً على معايير الفيديو، حيث يتفوق Video Jigsaw على خط الأساس باستمرار عبر جميع المهام وإعدادات الإطارات. التقييم على اختبارات الصور. تحسنت الفوضى الصورية على نموذج Qwen2.5-VL-7B الأساسي عبر جميع فئات المهام (أي الاستدلال الدقيق والفهم؛ الفهم المكاني أحادي البعد؛ والاستدلال المركب البصري)، متغلبًا على الأسس المُدرَّبة بعد الإصدار السابقة. من بين النتائج

للفوضى الصورية ، كما هو موضح أعلاه ، يقول المؤلفون: ‘(الصور

أعلاه) تُظهر أن طريقةنا تحسن بشكل مستمر القدرات المركزة على الرؤية على ثلاثة أنواع من الاختبارات. هذه النتائج تؤكد أن دمج التدريب على الفوضى الصورية بعد الإصدار يعزز بشكل كبير من التمثيل البصري ونظام اللغة في نماذج اللغة الكبيرة متعددة الوضعية.

‘نسبة هذه التحسينات إلى حقيقة أن حل الفوضى الصورية يتطلب من النموذج الاهتمام بالتفاصيل المحلية للقطع ، والاستدلال عن التخطيطات المكانية العالمية ، والتفكير في العلاقات بين القطع ، مما يفيد مباشرة الفهم الدقيق والمكاني والمركب.’

الفوضى الفيديوية

تم إجراء التقييم لفوضى الفيديو. علىAoTBench ؛Vinoground ؛TOMATO ؛ FAVOR-Bench؛ TUNA-Bench ؛Video-MME ؛ TempCompass؛ TVBench؛ MotionBench؛ LVBench؛ VSI-Bench؛ Video-TT ؛و CVBench .Video-R1 تماستخدامه

كأساس ، تم تدريبه مع تعليم إشرافي بارد ثم تعلم تعزيزي للاستدلال والتفكير في الفيديو. في هذه الحالة ، تم تضمين عمليات التفكير الكاملة في التقييمات ، لأنها أنتجت نتائج أفضل بشكل متسق من الإجابات المباشرة. تم تقييد جميع النماذج بحد أقصى 256x28x28 بكسل ، وتم اختبارها عبر ثلاثة إعدادات إطارية – 16 و 32 و 64: نتائج التقييم على

نتائج التقييم على اختبارات ثلاثية الأبعاد: تحسنت الفوضى ثلاثية الأبعاد الأداء عبر مهام المقارنة العمقية مثل DA-2K ، بالإضافة إلى اختبارات الإدراك ثلاثي الأبعاد الأوسع التي تغطي مدخلات الفيديو أحادية العرض ومتعددة العرض والمركزية. اختبارات الفيديو ، حيث تفوقت الفوضى الفيديوية على الأساس بشكل متسق عبر جميع المهام وإعدادات الإطارات. أنتجت الفوضى

الفيديوية تحسينات مستمرة عبر جميع اختبارات الفيديو وإعدادات الإطارات ، مع مكاسب قوية بشكل خاص في المهام التي تتطلب التفكير الزمني والاتجاهية ، مثل تلك الموجودة في AoTBench ، وأيضًا في اختبارات التفكير عبر الفيديوهات ، مثل CVBench: ‘تؤكد

هذه النتائج أن حل مهام الفوضى الفيديوية يشجع النموذج على التقاط الاستمرارية الزمنية بشكل أفضل ، وفهم العلاقات عبر الفيديوهات ، والتفكير في الاتساق الاتجاهي ، والتعامل مع سيناريوهات الفيديو الشاملة والقابلة للتعميم.’

البيانات ثلاثية الأبعاد

تم تقييم النموذج للوضع ثلاثي الأبعاد. SAT-Real؛ 3DSRBench؛ ViewSpatial؛ All-Angles ؛السابق VSI-Bench ؛ SPARBench (tiny)؛والسابقة DA-2K . نتائج التقييم على اختبارات

نتائج التقييم على معايير ثلاثية الأبعاد: قام برنامج 3D Jigsaw بتحسين الأداء عبر مهام المقارنة المتعمقة مثل DA-2K، بالإضافة إلى معايير الإدراك ثلاثي الأبعاد الأوسع التي تغطي مدخلات الفيديو ذات الرؤية الفردية ومتعددة المشاهدة والأنانية. ثلاثية الأبعاد: تحسنت الفوضى ثلاثية الأبعاد الأداء عبر مهام المقارنة العمقية مثل DA-2K ، بالإضافة إلى اختبارات الإدراك ثلاثي الأبعاد الأوسع التي تغطي مدخلات الفيديو أحادية العرض ومتعددة العرض والمركزية. هنا يقول

المؤلفون: ‘(الفوضى ثلاثية

الأبعاد) تحقق مكاسب كبيرة عبر جميع الاختبارات. كما هو متوقع ، فإن أكبر مكسب يتم تحقيقه على DA-2K ، وهو اختبار تقدير العمق يتعلق مباشرة بمهمة التدريب على الترتيب العميق. ومع ذلك ، نلاحظ تحسينات مستمرة عبر مجموعة واسعة من المهام الأخرى ، بما في ذلك تلك التي تتضمن مدخلات فيديو أحادية العرض (مثل 3DSRBench ، (OmniSpatial)) ، ومتعددة العرض (مثل ViewSpatial ، All-Angles) ،

والفيديو المركزي (مثل VSI-Bench). ‘ ‘تُظهر هذه النتائج أن نهجنا لا يعلم فقط المهارة المحددة للترتيب العميق ، بل يعزز أيضًا القدرة العامة للنموذج على إدراك الهياكل المكانية ثلاثية الأبعاد.’

الاستنتاج

ما لا يزال غير واضح تمامًا من هذا البحث هو العلاقة الدقيقة بين الصور والوصف التي تعمل على تحسين أداء نماذج اللغة الكبيرة متعددة الوضعية. عند النظر الأول ، يبدو أن عملية التعلم من خلال حل الألغاز تشبه إلى حد ما محاولاتنا الأولى وتطورنا. ومع ذلك ، فإن نظرة أعمق على البحث يكشف عن مدى اعتماد نماذج اللغة الكبيرة متعددة الوضعية على اللغة كجسر مثير بين الواقع البصري والواقع السيميائي. * يفضل مؤلفو البحث استخدام المصطلح الأقل شيوعًا ‘نماذج اللغة الكبيرة متعددة الوضعية’ ، ويرمز إليها بـ MLLMs . هذا هو مصطلح جديد أو نادر الاستخدام ، ويتعلق بنماذج يمكنها التفكير والتحليل المكاني للصور بشكل مكثف ، ولكنها لا تولد صورًا. مع ظهور أنماط ونموذجmớiة ، يتم مراجعة هذا المصطلح باستمرار. تم نشره لأول مرة يوم الخميس ، 2 أكتوبر2025.

First published Thursday, 2 أكتوبر 2025

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai