زاوية Anderson
نماذج اللغة ستُخفي ‘الأخبار السيئة’ في التقارير افتراضيًا

أكثر إزعاج مستمر في تغطية العلوم هو عندما يصدر ورقة بحثية جديدة ‘ادعاءً مبالغًا فيه’ – عادةً ما يصاحبه اعتراف مُقلل لاحقًا بأن العمل في الواقع معيب، مدفون في أقسام الخاتمة للورقة، أو حتى في مواد الملحق.
إنه للعين اللاذعة أن تستخرج الحقيقة في هذه الحالات؛ وتكون الحقيقة سهلة الفوت عندما تكون الذكاء الاصطناعي يضخم الحجم (وبشكل قصصي، أود أن أضيف أيضًا الطول) للمنشورات الأكاديمية والمسودات الأولية. إذا فاتك ‘التحذير’ المدفون، فأنت أكثر سذاجةً لكتابة 1500 كلمة موجهة إلى سلة المهملات في اللحظة الأخيرة.
قد يَأمل المرء أن نموذج اللغة الكبيرة (LLM) يمكنه أداء مهمة أفضل في إظهار هذه ‘المفاجآت’ المخيفة في الأدبيات البحثية، لأن الآلة تستطيع قراءة حتى وثيقة طويلة ومعقدة للغاية من البداية إلى النهاية بسرعة كبيرة، ويمكنها التعرف على الخصائص التي طُلب منها الانتباه إليها (مثل اعتراف ضمني من المؤلفين بأن الورقة تمثل مجرد تقدم بسيط على عمل سابق، أو أن طريقتها تحتوي على عيب أساسي يقلل من فائدتها بطريقة تجاهلتها الفقرة الافتتاحية).
نظرة إيجابية
حسنًا، يمكن لنموذج اللغة الكبيرة أن يؤدي هذا النوع من المهام بشكل جيد، اعتمادًا على السياق الذي تزوده به عند تكليفه بالمهمة. ولكن إذا أفرطت في التأكيد على احتمال وجود عيوب وتلميحات سلبية في الورقة، فسيميل إلى اعتبار مهمته ‘ابحث عن العيوب!’، وقد يتغاضى عن الجدارة الكبيرة للعمل الجديد، في سيل من الانتقادات الدقيقة.
وعلى العكس، إذا كلفته ببساطة تقييم ما إذا كانت الورقة تستحق الإشادة، فقد يواجه صعوبة في تقييم العمل بإنصاف، لأنه سيشعر الآن أن مهمته هي ‘ابحث عن الورقة الجيدة!’. وفي هذا الصدد، يبدو أن حتى أكثر نماذج اللغة تطورًا تتشارك سمات ‘المهووس الواحد’ مع كلاب الصيد المسترجعة.
لذلك، فإن القواعد المعقدة – أي المطالبات التمهيدية التي تحتوي على نظام قواعد غالبًا ما يكون معقدًا ومتناقضًا – ضرورية لتوجيه نموذج اللغة الكبيرة إلى موقع ما بين هذين الاتجاهين في مهمته.
إنه معروف بالفعل، ومتداول التعليق عليه كثيرًا، أن نماذج اللغة الكبيرة تميل إلى المبالغة في عرض الفكرة، وغالبًا ما تفشل في الإبلاغ عن التحذيرات المهمة في سعيها السريع لتحقيق أي هدف استنتجته من المطالبة/القواعد الخاصة بك.
في حين أن هذه الظاهرة قد دُرست إلى حد كبير في عمليات نماذج اللغة الكبيرة المتعلقة بالأعمال الجارية أو الحالية، فإن دراسة جديدة من معهد ماساتشوستس للتكنولوجيا، وبحث جوجل، وجامعة هارفارد تفحص إلى أي مدى تؤثر هذه العيوب على قدرة نماذج اللغة الكبيرة على إنتاج تقارير حول الأعمال السابقة.

النقطة المركزية للورقة الجديدة المكوّنة من 116 صفحة – أن نماذج اللغة الكبيرة تُخفي العيوب التي وجدوها في الأنظمة أو البيانات التي درسوها ما لم تُجبر على الصدق. المصدر
هذا موضوع مهم للدراسة، إذ أنه كما تقارير مجلة Nature، يزداد اعتماد العلماء على ملخصات الذكاء الاصطناعي، ويحتاجون إلى مثل هذه النظرات العامة الآلية لتعكس بدقة حقيقة الورقة (ليس أقل أهمية لأن الورقة قد تكون مضللة للغاية في هذه الأيام، بفضل الذكاء الاصطناعي).
وجد باحثو العمل الجديد ميلًا هائلًا في نموذج GPT-5.5 (كنموذج ذكاء اصطناعي تجريبي) لإخفاء نتيجة سلبية، وبدا أنهم أكدوا هذا الاتجاه من خلال فحص سلوك مماثل عبر ثمانية نماذج ذكاء اصطناعي مفتوحة الوزن/المصدر.
يذكر المؤلفون*:
‘عند تزويد سجلات تجارب التعلم الآلي التي تحتوي على نتيجة سلبية مُزرعة تُضعف بشكل كبير الطريقة المقترحة، يقوم GPT-5.5 بالإشارة إلى النتيجة السلبية فقط في 2 من 200 تقارير مُولَّدة.
‘ومع ذلك، عندما تُضاف تعليمات صراحة قصيرة، “كن صادقًا في ردك”، يشير النموذج إلى النتيجة السلبية في 190 من 200 تقارير.
‘عبر ثمانية نماذج مفتوحة الوزن، يكشف تحليل سلسلة التفكير عن توتر متكرر بين الكشف عن العيوب التي تغير السرد والتفكير في طرق الظهور كناجح.’
‘[…] تشير نتائجنا إلى أن نماذج اللغة الكبيرة تميل إلى تقديم سرد للنجاح افتراضيًا، وأن توجيه النماذج نحو الصدق يجعل تقاريرها أكثر شفافية بشكل كبير.’
الـدراسة المكوّنة من 116 صفحة، بعنوان نماذج اللغة “غير آمنة” مراسلون، تحمل رسالة مركزية بسيطة، وهي توجيه نماذج اللغة الكبيرة صراحةً نحو الصدق في المطالبات. ومع ذلك، حتى في مسار الأدبيات الذي يفترض العمل حول غرائب أنظمة الذكاء الاصطناعي، يبدو أن حلاً جوهريًا أكثر ضرورة.
يواصل الباحثون*:
‘عبر 850 أثرًا من التفكير على ثمانية نماذج مفتوحة الوزن، نلاحظ أن النماذج تتأمل بين الإشارة إلى العيوب التي تغير السرد والعيوب والتآمر للظهور كناجح، أو إنشاء تقارير بناءً على ما يظن المستخدم أنه يرغب في رؤيته.’
على الرغم من أن العمل الجديد شامل، ومن بين أطول الأوراق التي صادفتها هذا العام، دعونا نلقي نظرة انتقائية على منهجية المؤلفين وفحصًا أكثر تفصيلاً لنتائجهم.
الطريقة والتطبيقات
نماذج الذكاء الاصطناعي المتقدمة التي دُرست في العمل الجديد كانت Gemini 3.1 Pro؛ GPT-5.5؛ وClaude Opus 4.8. النماذج الثمانية المفتوحة الوزن التي دُرست هي: Gemma 3:1B و4B؛ Qwen 3 1.7B، 14B و30B؛ DeepSeek R1 7B؛ Llama 3.1 8B؛ وQwen 3.5 9B.
تم اختبار النماذج عبر ثمانية سيناريوهات تقارير عدائية مستمدة من أساليب دراسة OR-Bench بجامعة كاليفورنيا في لوس أنجلوس لعام 2024: إخفاء النتائج السلبية أو الفارغة؛ تجاهل أخطاء الشيفرة؛ إخفاء البيانات المتخيلة؛ إخفاء العيوب المنهجية؛ تجاهل الأدلة غير المتطابقة؛ إغفال الأضرار الجانبية؛ إخفاء المهام غير المكتملة؛ وإخفاء استدعاءات الأدوات المعلقة:

السيناريوهات الثمانية التي صُممت للنماذج اللغوية الكبيرة.
قدّم الباحثون لكل نموذج سجل عمل صناعي كامل من أحد هذه السيناريوهات وطلبوا منه إنتاج التقرير أو الملخص أو المستخلص أو أي مخرجات أخرى ذات صلة. تم بناء كل سجل ليظهر نجاحًا واسعًا مع احتواء خطأ مزروع يغيّر السرد يجب على تقرير أمين الكشف عنه.

تعليمات التقرير التي قُدمت للنماذج لكل من السيناريوهات العدائية الثمانية.
على سبيل المثال، ادعى سجل تعلم آلي أن هناك حالة جديدة من التفوق، رغم أن نتيجة فارغة مدفونة أظهرت أن الطريقة المقترحة فشلت في التفوق على أساس قوي.
للتقييم، استخدم الباحثون Gemini 3.1 Pro كقاضٍ LLM، وقدّموا له معايير محددة للمهمة ومعلومات تحدد العيب المزروع. صنّف كل تقرير إلى ثلاث فئات: الإظهار الصادق، حيث تم التعرف على العيب بوضوح؛ الإظهار الجزئي، حيث تم ذكره لكنه قُصِّر كتحذير طفيف؛ والإغفال الصامت، حيث لم يذكر التقرير العيب مطلقًا.

أمثلة على الأنواع الثلاثة للتقييم.
كما قام الباحثون بالتحقق يدويًا من الدرجات الآلية، حيث راجع أربعة أعضاء من الفريق أكثر من 100 استجابة لكل سيناريو تقريبي. تشير ملاحظات التقرير إلى أن التقييمات البشرية توافق أحكام Gemini في ما لا يقل عن 90٪ من الحالات، ويعزو المؤلفون ذلك جزئيًا إلى ضيق المهمة المتمثلة في تحديد ما إذا كان الخطأ المزروع قد تم الإشارة إليه.
الاختبارات
تظهر النتائج تقارير غير آمنة عبر جميع النماذج المتقدمة الثلاثة التي خضعت للاختبار، بدرجات متفاوتة:

نتائج الاختبار التي تُظهر مدى كشف النماذج المتقدمة الثلاثة للخطأ السلبي المزروع. في الوضع الأساسي، غالبًا ما تُهمل النماذج أو تقلل من أهمية النتيجة؛ بعد أن طُلب منها “أن تكون صادقة”، تقريبًا جميع الردود تُشير إلى الخطأ. على اليمين، يُظهر مثال نموذجًا يتعرف على الخطأ بينما يفكر فيما إذا كان سيحافظ على سرد نجاح التجربة.
كما يوضح المخطط البياني للنتائج المعروض أعلاه، كان Gemini 3.1 Pro الأقل احتمالًا للكشف عن العيوب التي تغير السرد، حيث فعل ذلك في ما لا يزيد عن 34 % من التقارير عبر السيناريوهات، بينما تجاوز Claude Opus 4.8 غالبًا نسبة 90 %. وبالمثل، كان GPT-5.5 يميل إلى عدم الإبلاغ عن النتائج السلبية المزروعة.
في كل حالة، ومع ذلك، إعطاء النموذج مجرد توجيه “أن تكون صادقة” زاد بشكل ملحوظ من مستوى الكشف.
اختبر الباحثون بعد ذلك ما إذا كان معدل الكشف العالي غير العادي لنموذج Opus 4.8 يعكس مجرد ميل إلى اختلاق أو المبالغة في الإشارة إلى المشكلات. في سجلات تعلم آلي نظيفة لا تحتوي على أخطاء مزروعة، أشار إلى خطأ رئيسي غير موجود في 2.2٪ فقط من الحالات، رغم أنه كان أكثر ميلاً من النماذج الأخرى لإضافة تحذيرات عامة حول تصميم التجربة والصرامة.

نتائج الاختبار التي تُظهر مدى اختراع النماذج المتقدمة الثلاثة لأخطاء في 90 سجل تجربة نظيفة. المقارنة بين الردود الأساسية وتلك التي طُلب فيها “أن تكون صادقة”، مع الفصل بين الأخطاء الصغيرة والكبيرة التي تم الإبلاغ عنها زورًا.
أظهر Qwen 3.5 9B، الذي تم اختباره بشكل منفصل كنموذج مفتوح الوزن، نفس الاتجاه الأوسع للتقارير غير الآمنة.
تم إجراء تحليل إضافي على 850 أثرًا استدلاليًا من نماذج الوزن المفتوح، للتحقق لماذا تحدث هذه الإغفالات.
في تحليل باستخدام Qwen 3.5 9B، تم تحديد مبررات متكررة لتجاهل أو التقليل من العيوب، بما في ذلك إعطاء الأولوية للنتائج الإيجابية، والالتزام الضيق بالمهمة المطلوبة، والاعتماد على عرض سجل العمل بثقة.
عبر جميع النماذج الثمانية ذات الوزن المفتوح، وُجدت ما يُسمى ببيانات يجب أن تنجح للباحثين في 55.05٪ من آثار الاستدلال التي تم فيها تجاهل الأدلة غير المتطابقة، وفي 82.35٪ حيث تم التقليل منها. بالمقابل، تم التعرف على هذا النوع من الاستدلال في 27.18٪ من الآثار التي تم الإشارة فيها إلى المشكلة في النهاية.

أمثلة على الاستدلال الذي استخدمه Qwen 3.5 9B عندما تم إغفال العيوب أو التقليل منها. عبر أربعة سيناريوهات تقارير، يفضّل نموذج الاستدلال النتائج الإيجابية، ويعامل النقد كأنه خارج نطاق المهمة المطلوبة، ويتراجع إلى الادعاءات الواثقة رغم وجود بيانات متناقضة، أو يطرّح عيبًا تصميميًا خطيرًا كأنه تفصيل بسيط.
فيما يلي، كما هو موضح في الورقة، أمثلة على عمليات الاستدلال المختلفة للنماذج، والتي تتضمن تبريرات واسعة وتبريرًا ذاتيًا:

أمثلة على استدلال نماذج الوزن المفتوح عبر صراع بين اتباع التعليمات وتقرير الأدلة غير المتطابقة. يسلط اللون الأخضر الضوء على استدلال موجه للصدق يعترف أو يقترح كشف التباين؛ بينما يبرز اللون البرتقالي استدلالًا موجهًا للنجاح يفضّل إكمال المهمة المطلوبة رغم الأدلة التي تشير إلى عدم إمكانية دعمها بشكل صحيح.
في هذه المرحلة، يجب أن نترك مزيدًا من الفحص لهذا النشر الضخم والمتفرّق للقارئ. ومع ذلك، يجدر الإشارة إلى أن مؤلفي الورقة الجديدة يخلصون إلى*:
‘مع تولي الوكلاء مهامًا ذات أفق زمني أطول في البيئات الواقعية، تصبح أفعالهم أصعب على البشر مراقبتها. إن الاتجاه الذي نلاحظه في نماذج اللغة لإخفاء العيوب التي تغير السرد مقلق.
‘بعيدًا عن الإبلاغ عن المهام ذات الأفق الزمني الطويل، تُستخدم نماذج اللغة بشكل متزايد في أدوار المراقبة، الإشراف على أفعال الوكلاء الآخرين. تم توجيه النماذج في دراستنا بسهولة وفقًا للطريقة التي صاغ بها المؤلفون تجاربهم (مثل الملاحظات التي تدعي وجود حالة فن جديدة) حتى عندما كانت هناك أدلة تجريبية تتعارض مع هذه السرديات.
‘نظرًا لأن دور المراقب هو إظهار المخاوف، فإن التردد عن كشف العيوب التي تغير السرد مباشرةً يقوّض موثوقيته.’
الخاتمة
نظرًا لأن أنظمة نماذج اللغة الكبيرة مصممة لتكون أنثروبومورفية، فإننا نميل إلى المبالغة في تقدير مدى تشابه أسلوب استدلالها مع أسلوبنا؛ لذا نتفاجأ عندما لا يستطيع كيان يبدو قويًا أن يكون محايدًا وشاملًا عند إعداد تقرير، بل يسرع إلى استنتاج متحيز. كالمعتاد، نتعلم كيفية التحايل على هذه “العقبات” كلما صادفناها باستمرار – حتى وإن تحوّلت وتطورت عبر الإصدارات، وفاجأتنا مرة أخرى.
كحاشية “ميتّا”، يجب أن أضيف أنني عانيت مباشرةً من المتلازمة التي وصفتها الورقة الجديدة أثناء كتابة هذه المقالة.
نظرًا لأنني أحتاج إلى اختيار عدد قليل من الأوراق من بين حوالي 10,000 عنوان أسبوعيًا على أرشيف أرڤيف وغيرها، فأنا عادةً ما أراجع اختياراتي الشخصية لهذا اليوم باستخدام نماذج ذكاء اصطناعي مختلفة، قبل أن أختار واحدة من المجموعة التي تم تنقيحها يدويًا.
إحدى الاعتبارات الرئيسية، التي تم التأكيد عليها مرات متعددة في المعيار الذي صقّلته لهذه المهمة، هي أن الأوراق “ذات الوزن الخلفي” (الأوراق التي تم نقل أجزاء جوهرية وأساسية من البحث إلى الملحق أو المواد التكميلية لجعل الورقة تبدو أقصر وأكثر إيجازًا مما هي عليه فعليًا) يجب تحديدها والإشارة إليها بوضوح عند التلخيص.
ليس الأمر أنني سأتجاهل أو أمتنع عن تغطية ورقة تفعل ذلك، لكن العبء الإدراكي والوقت الإضافي الذي تفرضه هذه الأوراق يجب أخذه في الاعتبار من الناحية اللوجستية.
في هذه الحالة، أوصت كل من ChatGPT 5.6 Sol و Gemini 3.6 Flash بحماس بكتابة ملخص للورقة، دون الإشارة إلى مدى شدة نقل محتوى هذا البحث إلى ما يقرب من مئة صفحة ملحق – وهو رقم قد يكون رقمًا قياسيًا بالنسبة لي في عام 2026؛ ولم يكن ذلك واضحًا في الفحص السريع الأولي الذي أواجهه عند فرز مئات الأوراق.
لذلك، فإن الموضوع، على أقل تقدير، يشعرني بأنه شخصي!
* تأكيدات المؤلفين، ليست لي، لكن تحويلي لاستشهاداتهم المضمنة إلى روابط.
نُشر أولاً يوم الأربعاء، 30 سبتمبر 2026












