زاوية Anderson
يفضل الذكاء الاصطناعي قراءة الكتاب أكثر من مشاهدة الفيلم

شكل صور ، مثل JPEG و PNG – فإنهم يفضلون أن يقوم المستخدم باستخراج إطاراته الخاصة و تحميلها كصور (التي مستعدون للتعليق عليها). هم في حالة سلسلة OpenAI GPT
من المدهش أن يكون من الصعب الحصول على نماذج الذكاء الاصطناعي لمشاهدة ومعلق على المحتوى المرئي الفعلي ، حتى لو تم تصميمها لهذا الغرض. إنهم أكثر اهتماما بالكلمة المكتوبة. إذا كنت قد حاولت تحميل مقطع فيديو صغير إلى ChatGPT أو إلى نموذج رؤية/لغة مشابه ، فقد تفاجأت بمعرفة أنهم لا يستطيعون في الواقع تحليل الفيديو. بينما يمكن للنماذج مثل ChatGPT-4o+ تحليل الإطارات الفردية – في للفيديو: ، يمكن ، بعد بعض الجهد ، استخراج تشغيل كامل من إطار من مقطع فيديو و تغذيته إلى ChatGPT ، لغرض ، على سبيل المثال ، توليد مسار روائي من صنع الذكاء الاصطناعي صور ورمز من درس OpenAI حول تحليل الإطارات

إما عن طريق استدعاء الدوال في روتين أكبر، كما في المثال السابق، أو عن طريق استخراج الإطارات باستخدام FFMPEG أو حلول تحرير الفيديو المجانية والمدفوعة. إلى حد ما، وربما إلى حد كبير، تعتمد قيود تحليل الفيديو في منتجات ضخمة مثل ChatGPT على: مجرد توفير نسخة واحدة من الذكاء الاصطناعي مع خيارات متعددة. الفيديو ،أشهر ترميزات وتخصيص موارد الحاسوب لعملية استخراج الفيديو التي تثقل على القرص وتحد من معالجة الحاسوب ، ليست مسألة تافهة ، إذا قرر مئات الملايين من المستخدمين البدء في استخدام هذه المرافق كل يوم. استخدام الموارد علاوة على ذلك ، يمكن <img class=” wp-image-225176″ src=”https://www.unite.ai/wp-content/uploads/2025/10/optical-flow.jpg” alt=”رسومات flux البصري توضح كيفية تتبع الحركة عبر الإطارات في تسلسل الفيديو، حيث تشير المتجهات الخضراء إلى اتجاه الحركة وشدتها. توفر هذه الخرائط استمرارية الوقت اللازمة لنماذج اللغة المرئية، ويمكن أن تُستخدم أيضًا كدليل هيكلي في سير عمل نماذج اللغة المرئية. يمكن لتحليل الوقت أن يكشف عن صورة مختلفة تمامًا من إطار واحد (تخيل شخصًا يدخل منزلًا). بحالة مزاج جيدة ثم يكتشف جثة) ؛ لذلك ، يجب مراعاة الخلاصة الزمنية الكاملة حتى للفيديو القصير هو مهمة صعبة ومكلفة من

الاستسلام لمذكرات كليف
على الرغم من ذلك ، منذ أن يمكن لنماذج مثل نموذج لغة دفتر ملاحظات جوجل ومدخلات ChatGPT الحديثة قراءة البيانات الوصفية المرتبطة (أي محتوى نصي مضمن يوفر سياقًا للفيديو)، وهي لا تمنع تحميل مقاطع الفيديو.وأحيانًا، قد يحاولون حتى تفسير فيديو لا يحتوي على بيانات مفيدة: في الحالة التالية، الله ثم قام بتحميل مقطعًا عشوائيًا مدته 6 ثوانٍ من الفيلم الإيطالي (2021) إلى NotebookLM ، مع التأكد من أن المقطع لا يحتوي على نص مفيد ، إما في البيانات الوصفية أو في اسم الملف. يد

TL;DW
هذا ، وفقًا للاطلاع على ورقة بحثية جديدة من جامعة بريستول في المملكة ألف كلمة (VQA) – تعتمد أيضًاالمتحدة ، بعنوان ، حيث يخلص المؤلفان إلى أن نماذج اللغة البصرية الحالية (VLMs) – النماذج المخصصة لتحليل الفيديو بطرق أكثر جهدًا ، والمشاركة في الفيديو ليسworth من الجودة على المعلومات النصية عند وجودها: إجابة الأسئلة الفيديوية عندما قدم المؤلفون نماذج مع صور متحركة وأسئلة و إجابات متعددة ، وجدوا أن النماذج غالبًا ما اعتمدت على الأنماط في النص ، chứ لا شيء يحدث على الشاشة – وفي العديد من الحالات ، أدت بنفس القدر ما يبدو أنهحتى عند إزالة السؤال . كاملًا في شكل منأشكال الاختصار أو الغش ، ما كان مهمًا للغاية بالنسبة لأغلب النماذج هو القدرة على تحديد الأنماط في الإجابات الممكنة ؛ فقط عندما أصبح المهمة أكثر صعوبة ، من خلال إضافة المزيد من خيارات الإجابة ، بدأت الذكاء الاصطناعي في الاهتمام أكثر بالفيديو: أجرى المؤلفون اختبارات VQA تحت ظروفمختلفة على ست نماذج VLM ذات سمات متنوعة ؛ ووجدوا أن النتائج تشير إلى

الطريقة
للفهم كيف يساهم كل مدخل في قرار النموذج ، يستخدم العمل الجديد طريقة مننظرية الألعاب تسمى قيم شابلي . تم تصميم هذه الطريقة في الأصل لتوزيع العائد العادل بين اللاعبين في تحالف ، وتخصص قيم شابلي الائتمان لكل “لاعب” بناءً على تأثيره الفردي. بصورة فعالة ، إذن ، “اللاعبون” في هذا السيناريو هم إما إطارات الفيديو أو مكونات النص (التعليقات ، العناوين ، إلخ) لمهمة VQA ؛ و “العائد” هو إجابة النموذج النهائية. من خلال اختبار ما يحدث عند إضافة أو إزالة كل جزء ، تكشف التقنية عن مدى أهمية كل عنصر في الوصول إلى الإجابة المختارة.
المقاييس
تم تعريف مقياسان بسيطان لمقارنة مقدار مساهمة كل نمطية (أي الفيديو أو السؤال أو الإجابة) في قرار النموذج: يقيس مقدار Explanation حقيقة أن الكلي الذي جاء من كل نوع من المدخلات ؛ هنا ، يتم جمع جميع قيم شابلي المتاحة ، ويتم حساب الحصة الخاصة بكل نمطية كنسبة مئوية من الإجمالي. مساهمة النمطية ثانيًا ، يصحح مساهمة لكل ميزة بعض النمطيات ، مثل الفيديو ، تحتوي على العديد من الميزات أكثر من غيرها. بدلاً من ذلك ، يتم حساب قيمة شابلي المتوسطة لكل ميزة ، ويتم مقارنة هذه القيم المتوسطة لتحديد نمطية السائد.
البيانات والاختبارات
قام المؤلفون باختبار النهج على ست نماذج VLM ذات سمات متنوعة ، مصممة لضمان أن مبادئ الاختبارات تكون قابلة للتطبيق بشكل عام: تم اختيار النماذج لطول سياق مختلف ، وعمر مختلف (أي منذ إطلاق الإطار) ، وتكوين بنية مختلف. كان المتسابقون FrozenBiLM ؛ InternVideo ؛ VideoLLaMA2 ؛ VideoLLaMA3 ؛ LLaVa-Video (الذييعتمد علىQwen2 )؛ وLongVA (الذي يستخدم أيضًا Qwen2). منأجل التنوع نفسه ، تم اختيار أربعة مجموعات بيانات مستهدفة: EgoSchema ، وهو مجموعة بيانات VQA مصممة لتكونمستحيلة دون مشاهدة الفيديو المرتبط ؛ HD-EPIC ، وهو مجموعة بيانات تركز على المطبخ وتتميز بفيديوهات غيرعادية الطول ؛ MVBench ، وهي مجموعة محددة من المساهماتمن مجموعات بيانات أخرى ؛ و LVBench ، الذييطرح أسئلة VQA حول فيديوهات طويلة جدًا. منها ، قام المؤلفون بتصميم 60 سؤالاً – عشرة من كل نوع سؤال. أوضحت مقاييس المساهمة أن معظم النماذج تعتمد أقل على الفيديو وأكثر على النص ، خاصة عند الحكم على الإطارات إطارًا إطارًا. حتى عندما كان للفيديو أداء معقول في المساهمة الإجمالية ، كانت تأثيراته لكل ميزة غالبًا ما تكون طفيفة ، مما يشير إلى أن النموذج قد يستخدم الفيديو بشكل عام ، ولكنه يهمل الإطارات الفردية. كان VideoLLaMA3 هو المتميز الرئيسي هنا ، مع اعتماد مرئي أقوى ، خاصة على التسلسلات الأطول في LVBench: درجات مساهمة

التأثير لكل إطار. فيما يتعلق بالنص ، كان السؤال يميل إلى أن يكون أكثر أهمية من الإجابة ، خاصة في النماذج الأقوى. كان هذا أكثر وضوحًا في مجموعات بيانات مثل EgoSchema ، حيث كانت الأسئلة أطول وأكثر طبيعية ، بينما كانت الإجابات قصيرة وأحيانًا مخططة. عكس MVBench هذا إلى حد ما ، حيث زادت بنية الإجابة الثنائية من أهمية رمز الإجابة. عبر جميع النماذج والمجموعات البيانية ، ومع ذلك ، تم التخلي عن الرؤية باستمرار
، حيث قامت اللغة بأداء العمل الشاق. ينصPaper على ما يلي: ‘(لنماذج السياق الطويل) ، يظهر الفيديو مساهمات مخفضة بشكل كبير ، مما
ذا صلة بالغ الأهمية ، ولكن هذا يدل على أن قيم شابلي لإطاراته الفردية أكثر مركزًا حول الصفر ، وأن انتباه النموذج إليها أقل توجيهًا من النص.’ لاختبار كيف يساهم كل جزء من المدخل في دقة النموذج ، أجرى الباحثون اختبارات
يعني أن قيم شابلي لكل إطار تكون أصغر بكثير من نظيراتها في ميزات النص. ‘ ‘الفيديو كنمطية برمتها لا يزال الإزالة إضافية باستخدام – إخفاء جزء أو أكثر من المدخل ، ومراقبة مدى تغير دقة النموذج الناتجة: التحويل إذا انخفضت الأداء بشكل حاد عند إزالة مدخل معين ، فإن ذلك المدخل مهم ؛ إذا أدى النموذج بنفس القدر من الجودة ، فذلك يشير إلى أن الجزء المفقود لم يكن يعتمد عليه بشكل كبير. في هذا الصدد ، تعتبر اختبارات التحويل نوعًا من دراسة التكرارية. تأثيرأداء

تأثير ضئيل. تشير النتائج (الموضحة أعلاه) إلى أن الإجابات (الإجابات النصية في بيانات الاختيار المتعدد) تحمل أكبر وزن عبر اللوحة. غالبًا ما تسبب إخفاء الإجابة أكبر انخفاض في الدقة ، وأحيانًا يؤدي إلى خفض النماذج إلى أداء عشوائي: ومع الحالات ذلك ، كان لإخفاء تأثير أقل بكثير ، مما يدعم الاكتشاف السابق بأن النماذج تقلل من قيمة السؤال. السؤال في بعض المؤلفون بتحديد ما إذا كان، حتى تحسنت الدقة ، مما يشير إلى أن النماذج كانت في بعض الأحيان مجرد مطابقة للإجابات مع أدلة نصية أو بصرية بدلاً من تقييم السؤال بشكل صحيح. عند إزالة السؤال تختلف النماذج أيضًا في اعتمادها على الفيديو: بعضها احتفظ بأداء معقول بدون فيديو ، مما يؤكد مرة أخرى على مساهمة الفيديو المحدودة في العديد من التكوينات الحالية. ثم قام لكن مع يمكن إجبار النماذج على الاعتماد على الفيديو عن طريق إضافة المزيد من الإجابات الخاطئة إلى خيارات الاختيار المتعدد. عندما كانت الإجابات الخاطئة سهلة ومستعارة من أسئلة أخرى ، تحسنت الأداء ، حيث قامت النماذج بمطابقة الأنماط النصية بدون تفكير كبير.

يؤدي هذا إلى تقليل هيمنة النص بشكل غير صحيح وزيادة التأثير النسبي للعناصر المرئية والأسئلة.في VideoLLaMA3، أدى إخفاء الفيديو إلى تقليل الدقة بنسبة 40% على EgoSchema و15% على LVBench، مما يشير إلى أن زيادة طفيفة في عدد الاستجابات يمكن أن تحول النماذج بعيدًا عن اختصارات النص ونحو التفكير متعدد الوسائط الحقيقي.كما لاحظ الباحثون أيضًا، من خلال الفحص

الأقوى في مناطق النص (الحمراء) أن النماذج
الإسناد للسؤال والإجابة. هذه الحدود الواضحة هي حيث تنتهي الإطارات الفيديو وتبدأ ميزات النص ، مما يدل على أن مساهمة نمطية الفيديو أقل بكثير من السؤال / الإجابة. ‘ باختصار ، عبر جميع المجموعات البيانية ، تكون القيم أقوى بكثير نحو نهاية النص ، مما يشير بقوة إلى
تعتمد بشكل أكبر على اللغة من الفيديو. في تعليق على النتائج أعلاه ، يشير المؤلفون إلى ما يلي: ‘magnitude قيم شابلي أكبر بكثير على الجانب الأيمن من كل خريطة حرارة ، تمثيل ، أن النماذج تعتمد بشكل أكبر على اللغة من الإشارات البصرية. حتى عندما الفيديو ، تكون المساهمة موزعة بشكل رقيق عبر العديد من الإطارات ، غالبًا بدون نمط متسق. يستخدم نرى أدناه مثالًا موضحًا من EgoSchema. تم تحديد 16 إطارًا “أهم” باستخدام قيم شابلي وتم تلوينها وفقًا لتأثيرها

التأثير الإيجابي والسلبي على الإجابة المختارة. النتيجة هي أن كل إطار له تأثير ضعيف فقط مقارنة بالكلمات في السؤال والإجابة. الإشارات البصرية نادرة وغير متسقة ، بينما توجيه الكلمات مثل “كرسي” و “سياج” النموذج نحو الخيار الصحيح – أو بعيدًا عنه ، اعتمادًا على السياق.
الخلاصة
من يعمل في تحرير الفيديو أو تحليله سيعرف بالفعل كم هذه العمليات مكلفة من حيث الموارد ، ويفهم لماذا لا يمكن للشركات التي تتعامل مع ملايين الطلبات القائمة على الذكاء الاصطناعي يوميًا أن تسمح البيانات بمعالجات فيديو تفسيرية و تحريرية عشوائية للمستخدمين. شيء واحد يجب تذكره في هذا الصدد هو أن معظم واجهات API للذكاء الاصطناعي التي ستجربها (باستثناء إصدار تجريبي جديد قصير الأمد لدعم بحث علمي جديد) تسعى إلى تحقيق رغبات المستخدمين على أدنى مستوى من إنفاق الموارد. ذلك يعني الاعتماد على البيانات الوصفية الحالية من البيانات التي قدمها المستخدم أو استرجاع RAG ، إذا كان ذلك ممكنًا ؛ و استخراج الوصفية (إذا لزم الأمر) لمواد قابلة للفهم أكثر مثل PDF و المستندات و الصور الفردية. ما لا يُعتبر هو تشغيل فيديو تم تحميله عبر CLIP أو أحدث إصدار من YOLO ، أو عبر أي نموذج VLM مكلف ومستهلك للزمن يمكنه تحديد ما يوجد في الإطارات وفهم ما يحدث في الفيديو المقدم ، مع مراعاة الزمنية. ومع ذلك ، لا يعني ذلك أن الظواهر التي توثقها الورقة الحالية تنجم عن نهج هندسي مقتصد. يشير المؤلفون إلى أن النص يهيمن على أنماذج التدريب المتعددة الحالية بأي حال ، مما يشير إلى أن “اللغة البصرية” أقل تطورًا أو أقل أهمية أو إعلامية في سياق متعدد الوسائط أو (على الأقل في الوقت الحالي) أقل فهمًا. * من المثير للاهتمام أن يبدو أن المواد التي جاءت بها NotebookLM هي إما أصلية تمامًا أو غير مؤشرة بواسطة جوجل ، لأنني غير قادر على العثور على أي نتائج ويب يمكن أن تكون قد تسربت إلى بيانات التدريب وطورت هذه الإخراج. نشر لأول مرة يوم الجمعة ،
31 أكتوبر 2025 ؛ تم تحريره في الساعة 14:20 لتنسيق












