زاوية Anderson
مواجهة مشكلة الغازلايتينج في الذكاء الاصطناعي

يمكن للنماذج الإيضاحية للذكاء الاصطناعي أن تُقنع بالخروج من الحقيقة. حتى بعد رؤية الإجابة الصحيحة، فإنها تتراجع أمام المستخدمين المتفائلين، وتعيد كتابة الواقع، وتصنع تفسيرات وهمية لتبرير ذلك.
الذكاء الاصطناعي خاطئ بما يكفي، وغالباً ما يكون كذلك، بحيث يُجبرنا على تساؤل استنتاجاته، إذا شعنا أن الاستنتاجات قد تكون خاطئة.
المشكلة هي، إذا كنا نعلم شيئاً مختلفاً من البداية، فلماذا كنا نسأل في المقام الأول؟ من أجل التأكيد بشأن اعتقاد أو شك部分ي؟
إذا كان الأمر كذلك، فإن حالة الفن في النماذج اللغة الكبيرة (LLMs) والنماذج اللغة الرؤية (VLMs، والتي تعمل بشكل متعدد، وقبول وتوليد الصور والفيديوهات) ليست مناسبة جيداً للتصدي، بسبب مشكلة التمييز.
أنت محق تماما!
تمت تسمية ممارسة إقناع الذكاء الاصطناعي بتغيير رأيه من خلال الصراع باسم ‘هجوم الغازلايتينج النفي’، وأحياناً يتم وصفها كمسألة أمنية – لا سيما لأنها لها بعض الإمكانيات ل ‘اختراق’ نموذج من قيودها التشغيلية:

من ورقة 2025 ‘تقييم الهجمات الغازلايتينج النفي ضد النماذج اللغة الكبيرة متعددة الوضع’ المصدر
然而، الاختراق والاختبار اللذان لا يشكلان مشكلة هنا؛ بل استخدام يومي ومتوقع للتفاعل مع الذكاء الاصطناعي، حيث نتوقع أن نستطيع مناقشة، والفوز أو الاستسلام أو إهمال الأمر، وفقاً لتجربتنا الانسانية في الحصول على المعرفة.
أهداف متحركة
تم ملاحظة قابلية الغازلايتينج في النماذج اللغة الكبيرة في عدة أوراق، بما في ذلك منشور سينغافوري من أكتوبر 2025، وورقة 2025 لا تضللني: التخفيف من الغازلايتينج من خلال إعادة توزيع الانتباه في النماذج اللغة.
حتى الآن، لم يتم دراسة هذه الظاهرة في النماذج اللغة الرؤية القادرة على الفيديو – وهو إهمال يتم تناوله من خلال تعاون جديد بين المؤسسات في شنغهاي وسنغافورة.
الطريقة
يُوصف نموذج الفيديو على أنه شيء يشاهد مقطع فيديو، ويتوصل إلى إجابة عن سؤال حولها، وينبغي أن ي坚 على هذه الإجابة إذا كانت الأدلة واضحة. تبدأ المشكلة عندما يأتي رسالة ثانية تدفع نموذج إلى تغيير رأيه.
يُعرَّف التمييز على أنه الحصول على الإجابة الصحيحة أولاً، ثم التبديل إلى إجابة خاطئة بعد الضغط، حتى لو لم يتغير شيء في الفيديو.
التوزيع
تم سحب 1013 عينة من GasVideo-1000 من MSRVTT-QA (300)، وActivityNet-QA (200)، وPerception Test (293)، وMVBench (120)، وVideoMME (100)، مع اختيار المزيج لتحقيق توازن بين الإجابة المفتوحة لأسئلة الفيديو والمنطق الزمني والسببي.
البيانات والاختبارات
تم اختبار نماذج الفيديو اللغة التالية في الدراسة: VideoLLaMA3، Video-ChatGPT-7B، LLaVA-Video-7B-Qwen2، LongVU-Qwen2-7B، Qwen3-VL-235B-A22B-Instruct، والنموذج المغلق Google Gemini-3-Pro.
الاستنتاج
نظرًا لطبيعة واجهات النماذج اللغة الرؤية القائمة على المحادثة، فقد يستغرق الأمر وقتًا طويلاً حتى يفهم المستخدم أن قواعد المناقشة تختلف بشكل كبير عن التفاعلات البشرية.
يمكن أن يكون أحد الطرق لتحقيق ذلك هو “تحييد” نبرة السياق، وإعادة التأكيد على أن المستخدم يتواصل مع نموذج آلة، وأن الإشارات حول اللياقة والمناقشة لا يجب أن تُعتمد أو تُعطى وزنًا مساوياً للتفاعلات البشرية.
نُشر لأول مرة يوم الأربعاء، 22 أبريل 2026












