زاوية Anderson

تبرير السلسلة الفكرية المثبتة “الزخرفية” في نماذج اللغة الرئيسية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
An AI-generated image (GPT1.5) depicting a robot cheating in an exam by using a smartphone.

يوفر البحث الجديد طريقة سهلة لتحديد أن الشرح المتقن خطوة خطوة للجميع الحالي نماذج اللغة الذكية الرائدة – بما في ذلك ChatGPT و Claude – هي في الواقع “زخرفية” ، وغالبًا ما يتم اختراعها بعد أن قرر الذكاء الاصطناعي ما هو الجواب.

 

في العام الماضي ، أظهرت سلسلة من الدراسات ذات المستوى العالي من الشركات التي تواجه الذكاء الاصطناعي ، بما في ذلك Anthropic و Apple ، أن ما يسمى “نماذج الذكاء الاصطناعي” غالبًا ما تنتج شرحًا خطوة خطوة لا يعكس ما أخبر Answersهم في الواقع.

لأسباب مختلفة ، انحدر النقاش قريبا إلى ردود قاسية و تفسيرات متنوعة (بما في ذلك على هذا الموقع) ، تاركًا بدون حل السؤال حول ما إذا كان تبرير السلسلة الفكرية (CoT) مجرد زخرفة جمالية مصممة لتؤكد على المستخدمين النهائيين ، أو دليل على عملية تفكير حقيقية.

ChatGPT 'يظهر عمله' - ولكن هل قرر بالفعل ماذا سوف يجيب؟

ChatGPT ‘يظهر عمله’ – ولكن هل قرر بالفعل ماذا سوف يجيب؟

أظهر و أخبر

الآن ، يوفر ورقة جديدة من الهند طريقة رخيصة وسهلة للتكرار لقياس ما إذا كانت تلك الشرح المتقن خطوة خطوة في واجهات ChatGPT و نماذج اللغة الكبيرة الأخرى (LLMs) تعكس بالفعل الذكاء الاصطناعي يعمل من خلال الخطوات إلى استنتاج.

ال بحث الجديد يأتي من两个 باحثين عبر معهد الهند لتقنية المعلومات الله أباد (IIITA) في الله أباد ، ومعهد الهند الوطني لتقنية المعلومات والإلكترونيات (NIELIT) في دلهي.

وجد المؤلفون أن في معظم الحالات ، عبر مجال كبير من نماذج LLMs المملوكة و مفتوحة المصدر ، تبرير السلسلة الفكرية المقدم للمستخدمين هو “زخرفي” ، مخترع بعد أن قرر الذكاء الاصطناعي الجواب الذي سوف يقدمه.

اختبار مثل ChatGPT5.4 و Claude Opus 4.6-R و DeepSeek-V3.2 ، وجد المؤلفون أن إزالة أي خطوة واحدة من 10-15 خطوة CoT المقدمة فعلا تغير الجواب أقل من 17٪ من الوقت ، وأن أي خطوة واحدة ، وحدها ، كانت كافية لاستعادة الجواب الصحيح.

المؤلفون يعلنون *:

‘الإطارات التنظيمية للذكاء الاصطناعي في الرعاية الصحية والتمويل والقانون تتطلب بشكل متزايد “نظم يمكن تفسيرها”.

‘تظهر نتائجنا أن النهج المعتاد – الذي يطلب من النموذج إظهار عمله – يوفر وهمًا من الشفافية.

‘الشرح متقن وملائم للنطاق ومخادع بطريقة خفية: يصف التفكير الذي لم يؤد النموذج.

‘الذكاء الاصطناعي الطبي الذي يكتب “يشير الإوزينوفيليا إلى عملية انسداد” لم يكن بالضرورة يفكر في الإوزينوفيليا على الإطلاق. قد يكون قد مطابقة من سؤال الجذور إلى الجواب واخترع التفكير في وقت لاحق.

‘تحت قانون الاتحاد الأوروبي للذكاء الاصطناعي (المادة 13) ، يجب على نظام الذكاء الاصطناعي ذي المخاطر العالية تقديم “معلومات هامة حول المنطق المشار إليه”.

المؤلفون يلاحظون أن نموذجين صغيرين من النماذج التي تم اختبارها انكسر نمط الخداع الشائع في ظروف معينة: MiniMax-M25 أظهر تفكير خطوة حقيقية عند التعامل مع تحليل المشاعر ، في حين Kimi-K25 أظهر تفكير حقيقي بنسبة 39٪ للتعامل مع تصنيف الموضوع.

في جميع الحالات الأخرى ، كما هو الحال مع النماذج الأكبر والأكثر شهرة ، بدا أن خطوات التفكير التي تم تقديمها هي بالكامل زخرفية ، حيث استخدم النماذج بدلاً من ذلك الطرق المختصرة.

نماذج صغيرة تحاول بجد

بالإضافة إلى النماذج العشرة التي تم اختبارها ، قام المؤلفون أيضًا باختبار عدد من النماذج المفتوحة الصغيرة ، تتراوح بين 0.8 إلى 8 مليار معامل (وهو رقم متواضع في هذه الأيام) ، ووجدوا أن هذه النماذج الصغيرة تحقق بالفعل التفكير ، وأن السلسلة الفكرية التي تظهرها عادة (وليس دائمًا) ضرورية لتحقيق استنتاجات مفيدة ودقيقة.

أظهرت النماذج الصغيرة حاجة بنسبة 55٪ للتفكير الخطوي ، بالمقارنة مع المتوسط البالغ 11٪ للحاجة عبر النماذج الأكبر ، والتي ، يؤكد المؤلفون ، تعلمت تجاوز التفكير المتعدد الخطوات تمامًا ، وصولًا إلى الإجابات الصحيحة من خلال طرق مختصرة داخلية لا تعكسها كتاباتها.

المؤلفون يطرحون أن كلما كان النموذج أفضل في مهمة ، زادت الحاجة إلى خطوات التفكير (على الرغم من أن هذا هو تفسير أكثر دبلوماسية لمفهوم تجاوز التحليل العقلاني لصالح الإجابة التي كانت أقوى في توزيع بيانات التدريب)††:

‘النماذج الصغيرة تفكر بصدق في الرياضيات لأنها 必须—نقص المعرفة المعاملية لتجاوزها.

‘النماذج المتقدمة لديها أنماط رياضية داخلية كافية بحيث يصبح التفكير السلسلي واضحًا.

الطريقة

الطريقة المستخدمة لاختبار النماذج تعتمد على ثلاثة معايير:

الضرورة يزيل كل خطوة CoT على حدة ، ثم يتحقق من ما إذا تغير الجواب. أي خطوة يزيلها يعتبر “ضروريًا”؛ الكفاية يزيل كل خطوة على حدة ، ويتحقق من ما إذا كان يمكن استعادة الجواب. أي خطوة يمكن أن تؤدي إلى استعادة الجواب تعتبر “كافية”؛ و حساسية الترتيب يخلط الخطوات ، ويتحقق من ما إذا تغير الجواب (من المفترض أن يعتمد التفكير الحقيقي على التسلسل وليس الكلمات الرئيسية).

بمجتمعهم ، تشير الضرورة العالية والكفاية المنخفضة إلى التفكير الحقيقي الخطوة بخطوة ، في حين تشير الضرورة المنخفضة والكفاية العالية إلى أن الشرح يمكن إزالته أو إعادة ترتيبه أو تقليله دون التأثير على النتيجة.

يشير المؤلفون إلى أن هذه الطريقة تلغي الحاجة إلى الوصول إلى النموذج الأبيض ، حيث يمكن إجراؤها مقابل بضع دولارات على نماذج API مغلقة المصدر مثل ChatGPT و Claude ، وبالطبع بنجاح على نماذج مفتوحة الوزن التي يمكن تثبيتها محليًا.

التكاليف الدنيا

يحدد المؤلفون التفكير الحقيقي من خلال الضرورة و الكفاية ، مع ضرورة عالية وكفاية منخفضة تشير إلى أن كل خطوة تحمل وزن فريد. ngượcًا ، يظهر التفكير الزخرفي ضرورة منخفضة وكفاية عالية ، مما يعني أن الخطوات يمكن إزالتها أو استخدامها بمفردها دون تغيير الجواب.

الضرورة وحدها ، يعلنون ، يمكن أن يخفي ذلك ، منذ أن قد توجد مسارات صالحة متعددة. لذلك الكفاية يتم استخدامها لتحقق من ما إذا كان كل خطوة فردية بالفعل تشفر النتيجة ، و حساسية الترتيب يتحقق من ما إذا كان النموذج يعتمد على التسلسل بدلاً من الإشارات السطحية.

تعتمد هذه الطريقة على إطار الشرح المتوافق مع التدخل (ICE) ، ويتطلب فقط وصول API نص-داخل ، نص-خارج ، ولإطار سلسلة من ست خطوات ، يتطلب 15 تقييمًا ، بتكلفة تتراوح بين 1-2 دولار لكل نموذج.

الاختبارات

تم اختبار عشرة نماذج API في الأساس مع نهج ICE المنقح: ChatGPT-5.4؛ Claude Opus 4.6-R؛ DeepSeek-V3.2؛ GPT-OSS-120B؛ Kimi-K2.5؛ Qwen3.5-397B؛ Qwen3.5-122B؛ MiniMax-M2.5؛ GLM-5؛ و Nemotron-Ultra (253B معامل).

تم اختبار كل نموذج على أربعة مهام: تصنيف المشاعر (باستخدام (SST-2))؛ مشاكل كلمات رياضية (باستخدام GSM8K)؛ تصنيف الموضوع (باستخدام AG News)؛ والأسئلة الطبية (باستخدام (MedQA)).

صلابة الإخراج

أشار الاختبار إلى ظاهرة رابعة ، والتي أطلق عليها المؤلفون اسم صلابة الإخراج: بعض النماذج غير راغبة في الإخراج عمليات التفكير ، اعتمادًا أيضًا على الموضوع ، وربما على ظروف أخرى.

يشير المؤلفون إلى أن صلابة الإخراج تعتمد على المهمة:

يشير المؤلفون إلى أن صلابة الإخراج لا تبدو عشوائية:

الاستنتاج

هذه ورقة مثيرة للاهتمام توفر اختبارًا وتحليلًا أكثر شمولاً حول الموضوع أكثر مما نستطيع تغطيته هنا ، وأنا أوصي القارئ بالمادة الأصلية.

الرسالة المركزية ، التي تتوافق مع الجدل السابق ، هي أن منصات الذكاء الاصطناعي ذات المخاطر العالية قد تكون على استعداد للانحراف الحاد وغير الصادق ، فيما يتعلق بمحاكاة المعايير التي لا تزال نماذجها قادرة على تحقيقها.

علاوة على ذلك ، فإن الفجوة بين حجم وقدرات النماذج المفتوحة والنموذج مغلقة المصدر مثل ChatGPT كبيرة لدرجة أن одного لا يمكن استنتاج تأثيرات النموذج المغلق من تثبيتات مفتوحة الوزن ، مما يزيد من غموض هذه العمليات والمعايير.

ومع ذلك ، فمن النادر أن تظهر منهجية اختبار 白-ال hộp حقيقية يمكن أن تشمل نماذج مفتوحة المصدر ومغلقة المصدر ؛ ولكن العلاجات الحقيقية للمخادع مثل هذا النوع من المرجح أن تحدث فقط عندما تهدد هيئات قوية مثل الاتحاد الأوروبي أرباح خطوط النماذج الرئيسية.

*تحويلي لمراجع المؤلفين إلى روابط.

الورقة لا تكشف عن قائمة متجانسة من هذه النماذج الصغيرة ، وتشمل متغيرات إضافية من نموذج واحد ، مما يجعل قائمة نهائية مسألة استنتاج.

†† التوكيدات للمؤلفين.

نشر لأول مرة يوم الأربعاء ، 25 مارس 2026

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai