زاوية Anderson

تعاني الأي.ai للبرمجة من تأثير دونينج-كرuger

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

الأبحاث الجديدة أن الأي.ai للبرمجة مثل ChatGPT تعاني من تأثير دونينج-كرuger، وتتصرف بأكثر ثقة عندما تكون أقل كفاءة. عند التعامل مع لغات برمجة غير مألوفة أو نادرة، تدعي ثقة عالية حتى عندما تنهار إجاباتها. يربط الدراسة بين ثقة النموذج والضعف في الأداء تظهر

 

وندرة بيانات التدريب، مما يثير مخاوف جديدة حول مقدار ما تعرفه هذه الأنظمة حقًا عما لا تعرفه. من المعروف أن أي شخص قضى وقتًا معقولاً في التفاعلمع نماذج اللغة الكبيرة حول الأمور الواقعية سيعرف أن نماذج اللغة الكبيرة تميل إلى إعطاء استجابة مثبتةخاطئة للاستعلام المستخدم. إلى جانب أشكالأكثر وضوحًا من الوهم ، فإن سبب هذه الثقة الفارغة ليس واضحًا تمامًا. تشير الأبحاث المنشورة خلال التأكد منه الصيف إلى أن النماذج تعطي إجابات واثقة حتى عندما تعرف أنها مخطئة ، على سبيل المثال؛ في حين تنسب نظريات أخرى الثقة الزائدة إلى اختيارات معمارية ، من بين إمكانيات أخرى. ما يمكن للمستخدم هو أن التجربة مريعة للغاية، لأننا مخططون للاعتماد على تقديرات الناس لقدراتهم الخاصة (على الأقل لأن هناكعواقب قانونية وغيرها لشخص يتعهد أكثر مما يستطيع وتقديم أقل مما وعد به)؛ ويعني نوع من التحويل الانثروبولوجي أننا نميل إلى تكرار هذا السلوك مع أنظمة الذكاء الاصطناعي التفاعلية.لكن نموذج اللغة الكبير كيان غير مسؤول، قد يعود بعد مساعدة المستخدم على تجنب الأخطاء… فيتسبب عن غير قصد في إتلاف شيء مهم، أو على الأقل إضاعة وقت ثمين؛من المؤسف أنه… الإطلاق .يقر بالمسؤولية على أسوأ من ذلك، يبدو

نصيحته، ويشرح عيوب

أن هذا النقص في الحذر يتعذر إزالته، على الأقل في ChatGPT، الذي سيثري المستخدم بوفرة بالصلاحية من صحة تفكيره فقط بعد أن يتم إلحاق الضرر. لا يبدو أن تحديث ذاكرة النظام الدائمة ولا استخدام التأملات المتكررة له تأثير كبير على هذه القضية. يمكن للأشخاص أن يكونوا أيضًا عنيدون ومرتدين – على الرغم من أن أي شخص يخطئ بهذا القدر سيتم فصله مبكرًا. مثل هؤلاء يعانون من العكس من “متلازمة المخادع” (حيث يخاف أنه الموظف

أداء GPT-4o الفعلي والمتصور عبر لغات البرمجة، مصنفًا حسب الأداء الحقيقي. المصدر: https://arxiv.org/pdf/2510.05457 تم ترقيته فوق قدراته) – ، حيث يقدّر شخص ما بشكل كبير تأثير دونينج-كرuger قدراته على أداء مهمة. تكلفة التضخم دراسة جديدة من مايكروسوفت تدرس قيمة تأثير دونينج-كرuger فيما يتعلق بأداء معماريات

البرمجة المدعومة بالذكاء الاصطناعي (مثل Copilot من ريدموند) في جهد بحثي هو الأول الذي يعالج هذا القطاع الفرعي من

لغة برمجة محددة، من بايثون وجافا إلى بيرل وكوبول: نماذج المهام مع اختيار الخيار الصحيح، وتقييم ثقتهم في اختيارهم، وقياس أدائهم الفعلي من خلال مدى…

نماذج اللغة الكبيرة. تتحليل الدراسة كيف يمكن أن تقيّم نماذج الكتابة البرمجية بدقة إجاباتها الخاصة من خلال إعطائها آلاف الأسئلة المتعددة الخيارات، مع كل سؤال ينتمي إلى مجال التي حصلوا فيها على الإجابةالصحيحة – استخدمت الدراسة طريقتين: و الثقةوثقتهم الذاتية تشير إلى مدى جودة ما أنهم. يعتقدون لقياس مدى ثقة النماذج الظاهرة،

لغة

المطلقة . في الأولى، طُلب من النموذج تقديم درجة من صفر إلى واحد جنبًا إلى جنب مع كل إجابة، مع تحديد ثقته في

مجالات لغة البرمجة المستخدمة في الدراسة، إلى جانب عدد أسئلة الترميز متعددة الخيارات التي تم أخذ عينات منها لكل مجال. معينة بواسطة متوسط تلك الدرجات عبر الأسئلة في تلك اللغة. الثقة النسبية

نظرت الطريقة الثانية في مدى ثقة النموذج عند ؛ بالنسبة لكل زوج، كان على النموذج أن يقول أيهما يشعر بأنه أكثر ثقة. تم تصنيف هذه الاختيارات في باستخدام أنظمة تصنيف أصلية مصممة اختيار بين سؤالين للألعاب التنافسية ، معاملة كل سؤال كما لو كان لاعبًا مباراة. مختلفة؛تم تطبيع النتائج النهائية وتحويلها إلى متوسط لكل لغة لتحديد درجة الثقة النسبية. تُفحص الدراسة شكلين مقبولين من تأثير دونينج-كرuger: أحدهما يتبع كيف يسيء نموذج واحد تقييم أدائه عبر مجالات إذا كان نموذجوالآخر يقارن بين مستويات الثقة بين النماذج الأضعف والأقوى. الشكل الأول، يسمى ، يبحث عما واحد يصبحأكثر ثقة زائدة في اللغات التي يؤدي فيها أداءً ضعيفًا. الشكل الثاني، دونينج-كرuger داخل المشارك ، يسأل عما إذا كانت النماذج التي تؤدي أداءً أسوأ بشكل عام تميل أيضًا إلى تقييم نفسها على أنها أعلى. دونينج-كرuger بين المشاركين في كلتا الحالتين، تُستخدم فيالفجوة بين الثقة والأداء الفعلي لقياس الثقة الزائدة، مع فجوات أكبر وإعدادات الأداء الضعيف تشير إلى سلوك دونينج-كرuger. النتائج تختبر الدراسة تأثير دونينج-كرuger عبر ست نماذج لغة كبيرة: Mistral ؛ Phi-3 ؛ DeepSeek-Distill ؛ Phi-4 ؛ GPT-0.1،

برمجة

GPT-4o . تم اختبار كل نموذج على أسئلة متعددة الخيارات من مجموعةCodeNet العامة،مع تمثيل 37 لغةليكشف عن كيفية تباين الثقة والدقة عبر مجالات الترميزالمألوفة والنادرة. تظهر التحليلات بين النماذج نمط دونينج-كرuger الواضح: النماذج التي تتمتع بدقة أقل، بما في ذلك

الأداء الفعلي مقابل الأداء المتصور عبر ستة نماذج رموز، مما يوضح كيف تعرض النماذج ذات الأداء المنخفض مثل Mistral وPhi-3 ثقة عالية على الرغم من الدقة الضعيفة، في حين تُظهر النماذج الأقوى مثل GPT-4o سلوكًا أكثر معايرة أو حتى أقل ثقة. Mistral و Phi-3، تميل إلى المبالغة في تقييم قدراتها، في حين أن النماذج الأفضل أداءً، مثل GPT-4o، أظهرت مستويات ثقة أكثر توافقًا مع أدائها

الفعلي، خاصة عند تقييمها بواسطة الثقة النسبية. تشير النتائج أيضًا إلى أن النماذج الأكثر قدرة قد تقلل من تقديرها أحيانًا (نمط لا تكتشفه درجات الثقة المطلقة). تظهر النتائج أيضًا أن التحليل داخل النموذج يدعم وجود تأثير دونينج-كرuger. في الرسم البياني للمنتج في بداية المقال، نرى كيف أدى كل نموذج عبر لغات برمجة مختلفة، مرتبة حسب الأداء الفعلي. في اللغات التي سجلت فيها النماذج أداءً ضعيفًا، خاصة في اللغات النادرة أو منخفضة الموارد مثل كوبول وبرولوج وسييلون، كانت ثقتهم ملاحظة أكثر من تبريرها. ظهر هذا النمط في كلتا قياسات الثقة المطلقة والثقة النسبية، مما يشير إلى أن . النماذج أقل دراية بحدودها عندما تعمل مع معاملة كل نسخة على أنها مشارك منفصل:في مجالات برمجة غير مألوفة تم تقديم ثلاثة إعدادات بديلة لتحقيق ذلك: أولاً، تم إعطاء كل نموذج شخصية مميزة؛ ثانيًا، تم عينة الاستجابات عند درجة حرارة أعلى أعلى لإنشاء المزيد من التنوع؛ ثالثًا، تم إعادة صياغة التأملات عدة مرات، تُظهر جدول النتائج أعلاه كيف يظل نمط دونينج-كرuger موجودًا في جميع الحالات؛

العلاقة بين الثقة المفرطة والأداء الفعلي عبر إعدادات تجريبية مختلفة، مما يدل على أن نمط دانينغ-كروجر يظل ثابتًا في جميع الظروف ويكون أقوى عندما يتم أخذ عينات من استجابات متعددة ومتنوعة من نفس النموذج. ويظهر أن دونينج-كرuger كان أقوى عندما تم عينة استجابات متعددة من نفس النموذج عند درجة حرارة عالية. للفهم بشكل أفضل كيف

تختلف الأداء المتصورة عن الأداء الفعلي، قارنت الدراسة تقديرات الثقة المطلقة والثقة النسبية، من خلال حساب كيف يبالغ كل نموذج في تقدير قدرته (تحديدًا، الفرق بين درجة ثقته وأدائه الفعلي)، ثم قياس كيف يرتبط ذلك التقييم الزائد بأداء النموذج الحقيقي: تُظهر جدول النتائج أعلاه كيف يرتبط التقييم الزائد بالأداء الفعلي، عبر مجالات برمجة ومواضيع نموذجية. في

العلاقة بين الثقة المفرطة (التي تقاس بالثقة المطلقة ناقص الثقة النسبية) والدقة الفعلية عبر مجالات البرمجة وأنواع النماذج، مما يدل على أن المبالغة في التقدير ترتبط باستمرار بانخفاض الأداء. كلتا الحالتين، يمكننا رؤية أن النماذج التي تتمتع بأداء أقل تميل إلى إظهار ثقة أكبر. أخيرًا، اختبر

المؤلفون ما إذا كان تأثير دونينج-كرuger يظهر في توليد الشفرة، من خلال تقييم النماذج على مجموعة MultiPL-E عبر ثماني لغات برمجة. على الرغم من أن التأثير كان لا يزال موجودًا،

العلاقة بين المبالغة في التقدير والأداء الحقيقي للنماذج المتخصصة الأساسية والمجال الفردي والمتعدد المجالات، مما يُظهر تأثيرات DKE أقوى مع زيادة التخصص. كان أقل وضوحًا من حالة الأسئلة المتعددة الخيارات، ربما يعكس صعوبة أكبر في

تقييم الثقة والدقة في المهام المفتوحة: فيما يخص تفسير تأثير دونينج-كرuger المتنازع عليه، يخلص المؤلفون إلى: قد يكون أحد التفسيرات المحتملةالتي قد تكون مشتركة بين البشر ونماذج الذكاء الاصطناعي هو التفسير المتعاقب، الذي ينص على أن تقييم جودة أداء

العلاقة بين الثقة المفرطة في النموذج وندرة اللغة، باستخدام ثلاثة تصنيفات شعبية. ترتبط اللغات الأقل شيوعًا بأداء أعلى. مهارة هو جزء حاسم من اكتساب المهارة. يمكن اختبار هذا التفسير تجريبيًا في

نماذج الذكاء الاصطناعي من خلال دراسة مسيطرة لاستراتيجيات التدريب المختلفة وما إذا كانت جميعها تؤدي إلى تحسينات متزامنة في الأداء وقدرة على تقييم جودة الأداء. ومع ذلك، هذه الدراسة تتجاوز نطاق هذا البحث، وتركنا ذلك للعمل المستقبلي. الخلاصة حتى

العلاقة بين المبالغة في التقدير والأداء الفعلي في توليد التعليمات البرمجية المفتوحة، بناءً على نتائج MultiPL‑E عبر ثماني لغات. في مجاله الأصلي، قد يكون تأثير دونينج-كرuger (كما يشير المقال) ناجمًا إما

عن سبب إحصائي أو إدراكي. إذا كان السبب إحصائيًا،

فإن تطبيق متلازمة فريدة من نوعها للبشر على سياق تعلم الآلة هو صالح حقًا. على الرغم من أن المؤلفين يطرحون أن السبب قد

يُظهر أنه “إدراكي” في كلتا الحالتين، فإن ذلك سيتطلب موقفًا متأملًا قليلاً. ربما يكون الاكتشاف الأكثر إثارة للاهتمام في البحث هو مدى تمسك نماذج لغة برمجة متعددة في أسوأ ظروفها، أي من خلال إظهار

PHP

أقصى ثقة عند التعامل مع لغات أقل شهرة أو أقل شهرة – وهي استراتيجية ستكون ذاتية التدمير في بيئة عمل حقيقية. * اللغات البرمجية المستخدمة كانت Ada و Bash و C و C# و C++ و COBOL و Ceylon و Clojure و D و Dart و Dash و Elixir و Erland و F# و Fortran و Go و Haskell و Java و JavaScript و Julia و Lisp و Kotlin و Lua و OCaml و Objective-C و و Pascal و Perl و Prolog و Python و Racket و Ruby و Rust و Scala و Swift و TypeScript و Visual Basic. نشر لأول مرة يوم

الأربعاء، 8 أكتوبر 2025

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai