تقارير
داخل الشخصيات البرمجية لأفضل LLMs -洞察ات من تقرير حالة الكود Sonar

في أغسطس 2025 ، أصدرت Sonar أحدث دراسة حالة الكود ، شخصيات البرمجة للنمذجة اللغوية الرائدة – تقرير حالة الكود. هذا البحث يذهب أبعد من درجات الدقة ، حيث يفحص كيف تكتب النماذج اللغوية الكبيرة الكود ويكشف عن “شخصيات برمجية” فريدة من نوعها لكل نموذج.
تم تقييم Claude Sonnet 4 و Claude 3.7 Sonnet و GPT-4o و Llama 3.2 90B و OpenCoder-8B عبر أكثر من 4,400 مهمة جافا باستخدام محرك التحليل الثابت الخاص بـ Sonar – التكنولوجيا التي تم تحسينها على مدار 16 عامًا من خلال منصة SonarQube Enterprise الرائدة.
القدرات المشتركة
أظهر جميع النماذج الخمسة موثوقية صياغية قوية ، مما يعني أن الكود المولد قام بتركيبه بنجاح في معظم الحالات. هذا ما تعكسه درجات HumanEval ، وهو اختبار معيار حيث يُطلب من النماذج حل مشاكل برمجة ويتم فحص حلولها تلقائيًا لضمان دقتها. تصدر Claude Sonnet 4 القائمة بنسبة 95.57٪ درجات HumanEval و 77.04٪ معدل مرجح Pass@1 ، مما يعني أن محاولته الأولى كانت صحيحة في أكثر من ثلاثة أرباع الحالات. سجل Claude 3.7 Sonnet 72.46٪ ، و GPT-4o 69.67٪ ، و Llama 3.2 61.47٪ ، و OpenCoder-8B 60.43٪.
استمر هذا الأداء عبر لغات برمجة مختلفة ، مما يدل على أن هذه النماذج تفكر من خلال المشاكل بدلاً من الاعتماد فقط على الصياغة المخزنة.
الضعف الشائع
الخلل المشترك الأكثر إثارة للقلق كان سوء النظافة الأمنية. قاس Sonar الضعف على مستوى الحظر ، والتي هي الفئة الأكثر خطورة من العيوب – القضايا الأمنية التي يمكن أن تؤدي مباشرة إلى انتهاكات أو تعطل النظام إذا استغلها. وتشمل الأمثلة على ذلك الكود الذي يسمح بالوصول الملف التعسفي أو الحقن أو الحقن أو كلمات المرور المدمجة أو التشفير الخاطئ أو قبول الشهادات غير الموثوقة. كانت هذه العيوب شائعة جدًا: 59.57٪ من عيوب Claude Sonnet 4 كانت على مستوى الحظر ، و 62.5٪ من عيوب GPT-4o ، و 70.73٪ من عيوب Llama 3.2.
كما أشار التقرير إلى تسربات الموارد المتكررة ، وهو نوع من الحشرات التي يفتح فيها الكود موردًا – مثل معالج الملف أو مقبض الشبكة أو الاتصال بالقاعدة البيانية – ولكنه يفشل في إغلاقه بشكل صحيح. بمرور الوقت ، يمكن أن تؤدي هذه التسربات إلى استنفاد الموارد المتاحة ، مما يؤدي إلى مشاكل في الأداء أو تعطل النظام. كان لديه Claude Sonnet 4 54 انتهاكًا ، و Llama 3.2 50 ، و GPT-4o 25.
فيما يتعلق بالصيانة ، كانت معظم القضايا روائح الكود – الأنماط التي لا تكسر البرنامج على الفور ولكن تجعل الصيانة أكثر صعوبة والمزيد من الحساسية للعيوب في المستقبل. أكثر من 90٪ من جميع القضايا المحددة تنطبق على هذه الفئة ، غالبًا ما تتضمن الكود غير المستخدم أو التسمية السيئة أو التعقيد الزائد أو انتهاكات أفضل الممارسات التصميمية.
شخصيات مميزة
من هذا المزيج من القدرات والعيوب ، حدد Sonar ملفات تعريف “شخصية” واضحة.
حصل Claude Sonnet 4 على لقب “المهندس المخضرم”. يكتب الكود الأكثر إطالة – 370,816 سطرًا عبر مجموعة الاختبار – مع تعقيد معرفي عالٍ ، مما يعني أن مسارات المنطق أكثر صعوبة في المتابعة. يعمل بشكل جيد ولكنه معرض لعيوب معقدة مثل تسربات الموارد وخطأ التزامن ، والتي يمكن أن تحدث عند تفاعل خيوط أو عمليات متعددة بطريقة غير مقصودة.
كان OpenCoder-8B “المُنشئ السريع” ، حيث أنتج كودًا قصيرًا ومركزًا – 120,288 سطرًا إجماليًا – ولكن مع أعلى كثافة مشاكل. يجعله سرعته وconciseness مناسبًا للبراهين ، ولكنه خطر في الإنتاج بدون مراجعة دقيقة.
كان Llama 3.2 90B “الوعد غير المحقق”. قدم نتائج متوسطة ولكنه كان لديه أسوأ موقف أمني ، مع أكثر من 70٪ من العيوب مصنفة على أنها مستوى الحظر.
كان GPT-4o “المتخصص الكفء” ، حيث يوازن بين الوظائف والتعقيد ولكنه غالبًا ما يتعثر على أخطاء تدفق التحكم – الأخطاء في تسلسل العمليات المنطقية التي يمكن أن تؤدي إلى نتائج خاطئة أو كود مخطوط.
كان Claude 3.7 Sonnet “السلف المتوازن” ، حيث أنتج كودًا أقل إطالة من سلفه ولكنه كان لديه أعلى كثافة تعليق عند 16.4٪ ، مما يعني أن الكود شرح المنطق أكثر من أي نموذج آخر. على الرغم من أنه كان أفضل في التوثيق ، إلا أنه لا يزال يحمل عيوبًا خطيرة.
كانت واحدة من أكثر النتائج إثارة للدهشة هي المقارنة بين Claude Sonnet 4 و Claude 3.7. على الرغم من أن Sonnet 4 تحسن معدل مرورها بنسبة 6.3٪ ، إلا أن نسبة عيوبه التي تم تصنيفها على أنها حظر تكاد تتضاعف ، من 7.10٪ إلى 13.71٪. كما ارتفعت عيوب الحظر من 56.03٪ إلى 59.57٪. الدرس: التحسينات في الأداء يمكن أن تأتي على حساب السلامة.
الخلاصة
يُظهر تقرير شخصيات البرمجة للنمذجة اللغوية الرائدة – تقرير حالة الكود من Sonar أن دقة المعيار تخبر فقط جزءًا من القصة. فهم المخاطر الأمنية والصيانة وأسلوب البرمجة هو أمر مهم مثل معرفة كيف غالبًا نموذج “يحصل على الأمر الصحيح”.
كل شخصية – سواء كانت مهندسًا أو مُنشئًا أو متخصّصًا أو سلفًا متوازنًا – لها قوة وتعويضات. النتيجة للمطورين والمنظمات هي “الثقة ولكن التحقق” ، حيث يتم ربط مساعدة البرمجة الذكية بالمراقبة البشرية ومراجعة الكود الشاملة والتحقق الأمني الصارم لضمان أن السرعة والراحة لا تؤدي إلى المساومة على السلامة أو الاستقرار على المدى الطويل.












