زاوية Anderson
إذا قلت لبرنامج الذكاء الاصطناعي ألا تفعل شيئًا، فمن المرجح أن يقوم بذلك

قد يؤدي 告诉 ChatGPT ألا يفعل شيئًا إلى اقتراحه فعل ذلك بنشاط، وقد يصل الأمر إلى حد موافقة بعض النماذج على السرقة أو الخداع عند تضمين الإشارة إلى الفعل المحظور في الاستعلام.
قد واجهت، مثل tôi، ظاهرة غريبة مع نماذج اللغة الكبيرة (LLMs) حيث لا يغض النماذج ببساطة عن تعليمات محددة قدمتها، والتي تتضمن حظرًا (أي ‘لا تفعل [شيئًا]’)، بل يبدو أنها تتجاوز حدودها لتنفذ الthing الذي قمت بتوضيحه – حتى لو كان ذلك “خارج الشخصية” بالنسبة للنموذج.
هذه هي ميزة معروفة حتى في نماذج NLP أقدم؛ وقد ظهرت فرع بحثي متزايد حول قدرات النفي في LLMs في السنوات الأخيرة.
على الرغم من أنه قد يكون من الصعب على الأشخاص ملاحقة المعنى المدفون في نفي مزدوج معقد، فإن LLMs لديها عيب إضافي، كما هو موضح في المثال التالي لاستدلال التناقض في ChatGPT، من ورقة 2023:

فشل في استدلال التناقض في حالة من ChatGPT، من ورقة 2023 ‘Language models are not naysayers: An analysis of language models on negation benchmarks’. في وقت الكتابة، لم يعد هذا يخدع نماذج ChatGPT. المصدر
على الرغم من أن آليات العمل الداخلية لنموذج مغلق مثل ChatGPT غير واضحة، يبدو أن الجواب الثاني ي repurposes المنطق المستخدم لإنشاء الجواب الأول؛ ومع ذلك، فإن هذا المنطق لا ينطبق على الحالة الثانية، لأن الرجل قد يمتلك حيوانًا آخر من كلب†.
هنا، بالتالي، يبدو أن نتيجة الاستفسار الثاني قد تأثرت بالسياق للحل المكتسب للقضية الأولى.
كما أن اقتراح وجود فعل محظور يمكن أن يؤدي إلى تنفيذ ذلك الفعل المحظور غالبًا بواسطة LLM، الذي يعترف بمعالجة الفعل، ولكن ليس النفي.
هذا هو تقييد شديد على فائدة LLMs، لأن في المجالات التي قد يتم استخدام نماذج اللغة فيها لتطبيقات حرجة، مثل الطب أو المالية أو الأمن، من المهم أن تفسر بشكل صحيح الأوامر التي تحتوي على محظورات.
لا يعني لا نعم
يتم التأكيد على هذه المشكلة في ورقة جديدة من الولايات المتحدة، والتي تدرس مدى عجز النماذج التجارية (مثل ChatGPT) والنماذج مفتوحة المصدر (مثل LLaMA) عن اتباع تعليمات سلبية.
قامت الباحثون بتحليل 16 نموذجًا في 14 سيناريو أخلاقي، وخلصت إلى أن النماذج مفتوحة المصدر تؤيد (أي تشجع أو تنفذ أو تمكن) تعليمات محظورة بشكل محدد 77٪ من الوقت تحت نفى بسيط (‘لا تفعل هذا’)، و100٪ من الوقت تحت نفى معقد (‘لا تفعل هذا إذا أدى إلى ذلك’).

أمثلة على المقترحات الأخلاقية التي كان على نماذج اللغة أن تتفاوض عليها. ‘ال$action’ في كل حالة ليست ‘إجابة صحيحة’، بل هي الإجراء المقترح، الذي يجب على نموذج اللغة أن يقرر تنفيذه أو عدم تنفيذه. المصدر
في حين أن النماذج التجارية سارت بشكل أفضل، فقط Gemini-3-Flash حقق أعلى تصنيف في مقياس جديد للتحسس للنفي (NSI) مقترح من الورقة (على الرغم من أن Grok 4.1 كان قريبًا جدًا).
تحت هذا المقياس الجديد، سيتم حظر جميع النماذج التي تم اختبارها من اتخاذ القرارات في المجالات الطبية والمالية والقانونية والعسكرية والأعمال والتعليم والعلوم – مما يجعلها غير قابلة للاستخدام في مثل هذه السياقات. على الرغم من أن نماذج الاستدلال بشكل عام أدت بشكل أفضل، إلا أن هذه النهج البطيئة فشلت أيضًا في الاستفسارات التي تحتوي على نفى مركب.
نظرًا للارتباط الطويل بين الحوسبة والمنطق الثنائي الموثوق به، مثل المنطق البولي، قد يكون المستخدمون الذين يعتبرون الاتساق الثنائي بمثابة توقع أساسي معرضين بشكل خاص لفشل هذا النوع.
في تعليقهم على صعوبة التي يواجهها النماذج مفتوحة المصدر في تحليل الاستفسارات المنفية، يقول المؤلفون:
‘النماذج التجارية تؤدي بشكل أفضل ولكن لا تزال تظهر تقلبات بنسبة 19-128٪. يتناقص الاتفاق بين النماذج من 74٪ في الاستفسارات الإيجابية إلى 62٪ في الاستفسارات المنفية، وتثبت السيناريوهات المالية أنها مرنة ضعف السيناريوهات الطبية […]’
‘تؤكد النتائج على وجود فجوة بين ما تحققه تقنيات التوجيه الحالية وما يتطلبه النشر الآمن: النماذج التي لا تستطيع تمييز “افعل X” و “لا تفعل X” بشكل موثوق به لا ينبغي أن تتخذ قرارات مستقلة في سياقات عالية المخاطر.’
تلاحظ الورقة أن الأخطاء من هذا النوع أكثر احتمالاً للتأثير على الأفراد الأقل حظاً عبر المجالات المذكورة:
‘التكيف مع المجال ليس مجرد ضبط تقني. بل له آثار على المساواة. ‘
‘المرنة المالية تعني أن السكان الأقل ثراء يتعرضون لمخاطر أعلى لارتكاب أخطاء النفي، على سبيل المثال أولئك الذين يبحثون عن قروض أو منافع أو رصيد.’
كما يؤكد المؤلفون أن المشكلة لا يمكن حلها من خلال نهج التوجيه التقليدي، لأن القضية تتضمن فشلًا جوهريًا في معالجة النية في LLMs، chứ không yêu cầu الشركات تقييد ما يقولونه، أو كيف يفهمون استفسارًا:
‘يمكن أن يكون النموذج “متماشى” من حيث رفض الكلمات الضارة أثناء فشله في معالجة هيكل الطلبات. التوجيه الحقيقي يتطلب ليس فقط تعلم ما يجب تقديره، ولكن أيضًا معالجة التعبيرات اللغوية لتلك القيم. ‘
‘حتى يتم تحقيق هذه القدرة بشكل موثوق، يجب أن يعني “لا” “لا”. ‘
من المثير للاهتمام، على الرغم من أن Gemini Flash كان الفائز الوحيد في مقياسهم الجديد، فإن النماذج الصينية الحالية LLMs بشكل عام أثبتت أنها أقل عرضة للمشكلة.
الورقة الجديدة بعنوان When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models، وهي من تأليف باحثين في كينيون كوليدج في أوهايو.
الطريقة والبيانات
السناريوهات الأخلاقية الـ 14 التي طوّرها الباحثون لاختبار LLMs كانت:

السناريوهات الأخلاقية الـ 14 المصممة لتحدي نماذج اللغة (تم إعادة تنسيقها من ملف PDF الأصلي، حيث كان من الصعب إعادة إنتاج هذا التوضيح هنا).
المحتوى في عمود ‘ال$action AT STAKE’ أعلاه ليس مقصودًا بأنه ‘إجابات أخلاقية صحيحة’، بل هو الإجراء المتاح فقط لتنفيذ أو عدم تنفيذ كل سيناريو؛ هنا لا يتم اختبار LLMs على معاييرها الأخلاقية، بل على قدرتهم على تحليل الاستفسارات المعقدة والمنفية في السياقات الحرجة.
لذلك، فإن شدة هذه السيناريوهات هي فقط توضيحية، من جانب المؤلفين؛ يمكن أن تكون LLMs قد تم استجوابها بنجاح على مواضيع أقل حدة.
النماذج التجارية الأمريكية التي تم اختبارها في هذا العمل كانت GPT-5.1؛ GPT-5.2؛ GPT-5-mini؛ Claude-Haiku-4.5؛ Claude-Sonnet-4.5؛ Gemini-3-Flash؛ Grok-4.1-non-reasoning؛ وGrok-4.1-reasoning.
النماذج التجارية الصينية التي تم اختبارها كانت DeepSeek-V3؛ GLM-4؛ Kimi-K2؛ وQwen3.
النماذج مفتوحة المصدر المستخدمة كانت LLaMA-3.2-1B؛ Gemma-3-4B؛ Granite-3.3-2B؛ وPhi-4-mini-3.8B.
تم كتابة الاستفسارات لكل من السيناريوهات الـ 14 في أربعة إصدارات: F0 أشار إلى أن الإجراء يجب أن يتم؛ F1، أنه لا ينبغي أن يتم؛ F2 يدعم السعي لتحقيق هدف حتى لو كان ذلك يتطلب الإجراء المحظور؛ وF3 يرفض الهدف إذا كان يتطلب الإجراء المحظور:
‘تحت F0، يُطلب من النماذج أن تقول إن الرجل “يجب أن يسرق المتجر”. تحت F1، “لا يجب أن يسرق المتجر”. تحت F2، “يجب أن ينقذ ابنته حتى لو كان ذلك يعني أنه يجب أن يسرق المتجر”. ‘
‘تحت F3، “لا ينبغي أن ينقذ ابنته إذا كان ذلك يعني أنه يجب أن يسرق المتجر”. الحقائق القابلة للقبول تظل ثابتة، ويتغير فقط القطبية.’
يجادل النهج بأن إذا كان النموذج يفهم كيف يعمل النفي، يجب أن “يتقلب” إجاباته بشكل نظيف بين الإصدارات الإيجابية والسالبة لنفس الاستفسار. لذلك، إذا وافق 60٪ من الاستجابات على أن ‘يجب أن يفعل X’ (F0)،那么 40٪ فقط يجب أن توافق على أن ‘لا يجب أن يفعل X’ (F1) – لأن رفض F1 يعني أيضًا دعم الإجراء؛ وعندما لا تتطابق الأرقام، فإن النموذج يقرأ النفي بشكل خاطئ.
الاختبارات
استخدم المؤلفون اختبار كوكرين كيو واختبار كروسكال ووليس إتش لقياس مدى تأثير الإطار (تغيرات في قطبية الاستفسار مع الحفاظ على المعنى) على استجابات النموذج، داخل الفئات وخارجها. بعد تعديل للايجابيات الكاذبة، وجد المؤلفون أن إجابة النموذج تغيرت بشكل كبير بناءً على كيفية صياغة الاستفسار – حتى عند الحفاظ على المعنى الأساسي.
كما اختبروا ما إذا كان تقليل العشوائية (“درجة الحرارة”) يجعل النماذج أقل هشاشة:

معدلات الموافقة لكل نوع استفسار (F0–F3) عبر ثلاث فئات نموذجية: الصينية، الأمريكية، ومفتوحة المصدر (OSS). يظهر F0 التوجيه الإيجابي البسيط، بينما يُظهر F1 النفي المباشر. F2 وF3 يختبران النفي المركب مع أهداف مضمنة. القيم هي LPN-معيارية، وتظهر كيف تختلف موافقة النموذج حسب الإطار، مع نموذج OSS يظهر حساسية قوية للنفي.
تحت الاستفسارات الإيجابية البسيطة (F0)، قدمت نماذج من جميع الفئات الثلاث دعمًا معتدلاً للإجراءات المقترحة، مع معدلات موافقة بين 24٪ و37٪. كان هذا متوقعًا، نظرًا لأن السيناريوهات تم تصميمها كمazes أخلاقية بدون إجابات صحيحة واضحة. ومع ذلك، يشير المؤلفون إلى أن التوازن انهار تحت النفي:
‘النماذج مفتوحة المصدر تقفز من 24٪ موافقة تحت F0 إلى 77٪ تحت F1. عندما يُقال لهم “لا يجب أن يفعل X”، فإنهم يؤيدون فعل X أكثر من ثلاث مرات من أربع. تحت النفي المركب (F3)، يصلون إلى 100٪ موافقة، وهو تأثير سقف يُظهر فشلًا تامًا في معالجة مشغل النفي.’
أظهرت النماذج مفتوحة المصدر أقصى تأثيرات الإطار، مع ارتفاع معدلات الموافقة بنسبة 317٪ من F0 إلى F3 – وهو دليل على أن مخرجاتها حساسة جدًا لكيفية صياغة السؤال. كما أظهرت النماذج التجارية الأمريكية تقلبات كبيرة، مع مضاعفة معدلات الموافقة عند إعادة صياغة الاستفسارات من F0 إلى F3.
كانت النماذج التجارية الصينية أكثر استقرارًا بشكل عام، مع زيادة بنسبة 19٪ فقط من F0 إلى F3، مقارنة بقفزات بنسبة أكثر من 100٪ في المجموعات الأخرى. وأهم من ذلك، كانت النماذج الصينية الوحيدة التي خفضت موافقتها عند نفى استفسار، مما يشير إلى أنها فهمت أن قول “لا يجب” يعني النقيض من “يجب”:

معدلات موافقة الإجراء، معروضة حسب نوع الإطار وفئة النموذج. تظهر النماذج مفتوحة المصدر (الأخضر) تأثيرات إطار قوية، مع ارتفاع الموافقة إلى 77٪ تحت النفي البسيط (F1) وصولاً إلى 100٪ تحت النفي المركب (F3). فقط النماذج الصينية (اللوحة الوسطى) تقلل من الموافقة عند إضافة النفي البسيط، كما هو متوقع. تشير شريطات الخطأ إلى فترات ثقة بنسبة 95٪.
وافقت النماذج على بعضها بنسبة 74٪ من الوقت عندما استخدمت الاستفسارات صياغة إيجابية، ولكن فقط بنسبة 62٪ عندما تم التعبير عن نفس الأفكار بالنفي – وهو انخفاض بنسبة 12 نقطة يُظهر أن النماذج لا يتم تدريبها على معالجة النفي بطريقة متسقة:

انخفضت الموافقة بين النماذج من 73-75٪ إلى 62٪ عندما استخدمت الاستفسارات النفي بدلاً من الصياغة الإيجابية. يشير الفجوة البالغة 11 نقطة إلى أن مصادر التدريب المختلفة لا تعلم النماذج معالجة النفي بنفس الطريقة. تشير شريطات الخطأ إلى فترات ثقة بنسبة 95٪.
اختلافات المجال
لقياس مدى سهولة قلب حكم نموذج عن طريق إعادة صياغة استفسار بنفي، طور المؤلفون مؤشر الحساسية للنفي (NSI) – وهو مقياس مصمم لتحديد ما إذا كان النموذج ينتج إجابات معاكسة семantically لاستفسارات معادلة منطقيًا ولكن مصاغة بنفي.
يشير معدل NSI العالي إلى أن النموذج ي đảo موقفه بشكل متكرر عند نفى استفسار، مما يُظهر الاعتماد على صياغة سطحية بدلاً من الاستدلال المتسق.
تم استخدام مقياس NSI في الاختبارات لتقييم حساسية المجال في النفي (أي ما إذا كان فئة السياق ‘المالية’ أو ‘العسكرية’، وما إلى ذلك، يؤثر على النتيجة). تم تحقيق بعض التباينات المثيرة للاهتمام هنا، حيث أثبتت بعض أنواع القرارات أنها أكثر حساسية لتغييرات الصياغة من غيرها.
على سبيل المثال، أثار استفسارات الأعمال والمالية هشاشة عالية، مع نموذج ي đảo إجاباته عند إعادة صياغة استفسار أو نفيه، مع تسجيله ما بين 0.64 و0.65 على مقياس NSI. كانت استفسارات الطبية أكثر استقرارًا، بمعدل متوسط يبلغ 0.34:

درجات حساسية النفي عبر المجالات، حيث تشير القيم الأعلى إلى احتمال أكبر لأن النماذج ت đảo إجاباتها عند إعادة صياغة استفسارات بنفي
ملاحظة أن المجال الطبي أنتج أقل عدد من الأخطاء والمالي أنتج أعلى عدد، يفترض المؤلفون:
‘لماذا قد يكون هناك فجوة؟ من الممكن أن القرارات الطبية قد تستفيد من إشارة تدريب أوضح. مبادئ هيبوقراطية، بروتوكولات محددة، وأدب محترف متسع قد يؤанк سلوك النموذج حتى عند تغيير الإطار.’
‘في المقابل، القرارات المالية تتضمن تسويات غامضة بأقل إجماع اجتماعي، مما يترك النماذج أكثر عرضة للإشارات السطحية.’
كانت المشكلة أكثر حدة في النماذج مفتوحة المصدر، التي بلغت درجات NSI أعلى من 0.89 في استفسارات المالية والأعمال والعسكرية. كانت الأنظمة التجارية أقل هشاشة ولكن لا تزال تظهر حساسية عالية، مع تسجيلها بين 0.20 و0.75 حسب المجال:

درجات حساسية النفي (NSI) معروضة حسب النموذج والمجال، باستخدام مقياس لوني من الأخضر (متين، NSI = 0) إلى الأحمر (هش، NSI = 100). النماذج مجتمعة حسب المنشأ، مع الأنظمة الصينية في الأعلى، يليها النماذج الأمريكية في الوسط والنماذج مفتوحة المصدر في الأسفل. الحساسية هي أعلى في المجالات المالية والأعمال والعسكرية، حيث يظهر العديد من النماذج قيم NSI مرتفعة، بينما المجالات الطبية والتعليمية تميل إلى إنتاج مخرجات أكثر استقرارًا. يبقى Gemini-3-Flash متينًا عبر جميع الفئات، بتسجيله صفر في كل مجال، بينما تصل النماذج مفتوحة المصدر إلى أقصى قيمة NSI من 100 في الإعدادات الأكثر عرضة للفشل.
كما يشير المؤلفون إلى أن زيادة هشاشة النماذج مفتوحة المصدر في هذا المجال قد تتحمل مخاطر غير متناسبة على المجموعات الهشة أو المهمشة، التي قد تكون أكثر عرضة لاستخدام أنظمة محلية تم توزيعها لreasons ميزانية في إعدادات حكومية أو بلدية†††:
‘إذا قامت المؤسسة بنشر نموذج مفتوح المصدر لreasons ميزانية، فإن العبء يقع بشكل غير متناسب على السكان الذين يتعاملون بالفعل مع ظروف مالية هشة. وثقت Buolamwini وGebru كيف تتراجع دقة التعرف على الوجه على طول الخطوط الديمغرافية. ‘
‘تظهر نتائجنا على فجوة موازية على طول الخطوط المجالية، حيث تتحمل السكان الأقل ثراء خطرًا أعلى لارتكاب أخطاء النفي.’
على الرغم من أننا لا نملك هنا نطاقًا لتغطية كل نتائج الورقة ودراسات الحالة الختامية، إلا أنه من الجدير بالذكر أن دراسات الحالة تظهر ميلًا لاستجابات النماذج غير حساسة للنفي إلى توصية دورات غير قابلة للتوصية ببساطة لأنها فشلت في تفسير بنية النفي:
‘تحت F0، تؤيد النماذج مفتوحة المصدر السرقة 52٪ من الوقت، وهو انقسام قابل للدفاع نظرًا لتعقيد السيناريو الأخلاقي. تحت F1 (“لا يجب سرقة”), تؤيدونها 100٪. النفي ينتج موافقة كاملة على الإجراء المحظور.’
‘تظهر النماذج التجارية نمطًا مختلطًا، مع ارتفاع الموافقة الجماعية من 33٪ إلى 70٪ تحت النفي البسيط. تظهر بعض النماذج التجارية انعكاسًا شبه كامل، بينما تظهر أخرى زيادات متواضعة. ‘
‘لا تصل أي فئة إلى الانعكاس المرآة الذي سيكون نتيجة لمعالجة النفي الصحيحة.’
الخلاصة
هذه واحدة من أكثر الأوراق إثارة للاهتمام التي واجهتها مؤخرًا، وأنا أوصي القارئ بالتحقيق أكثر، لأن هناك الكثير من المواد التي لم تتم تغطيتها هنا.
ربما يكون الأمر الأكثر إثارة للاهتمام في الدراسة هو مدى تكرار مواجهة مستخدمي LLMs لهذه المشكلة، وتعلمهم تدريجيًا ألا يضعوا “أفكار غير مرغوب فيها” في عمليات التفكير في LLMs، وغالبًا ما يحاولون استبعاد نتائج غير مرغوب فيها بوسائل أخرى غير النفي في الاستفسار – مثل استفسارات النظام على مستوى المستخدم، أو تخزين الذاكرة طويلة الأمد، أو قوالب استفسار متكررة تحافظ على الهدف.
في الممارسة، لا تنجح أي من هذه الطرق بشكل جيد، بينما يصعب استخلاص العلاجات من نتائج الاختبار بسبب طبيعة Gemini Flash الغامضة – التي كانت أفضل أداء في LLM هنا.
ربما تكمن الدلائل الأكثر إثارة للاهتمام للproblem المعماري الأساسي في دراسة سبب أداء النماذج الصينية بشكل أفضل بكثير في هذا الجانب الصعب.
* هيئة موجودة بالفعل في لغات رومانسية عدة، بما في ذلك الإيطالية.
†حتى ChatGPT-4o لا يرتكب هذا الخطأ بعد الآن.
†† الورقة الأصلية تحتوي على بعض الإسنادات الخاطئة للجداول والرسومات. في بعض الأحيان، يشير النص إلى أن الجدول 1 (الذي هو مجرد قائمة بالنماذج التي تم اختبارها) يحتوي على النتائج الأساسية. في هذه الحالات، كان عليّ تخمين ما هي الأرقام أو الجداول الصحيحة، وأنا أتطلع إلى تصحيح المؤلفين.
††† استبدالي للروابط التشعبية بدلاً من الإسنادات داخل النص للمؤلفين.
نشرت لأول مرة يوم الثلاثاء، 3 فبراير 2026












