报告

探索领先LLM的编码个性 – 来自Sonar代码状态报告的洞察

mm
将 Unite.AI 添加到您在 Google 上的首选来源

2025年8月,Sonar发布了其最新的代码状态研究,领先LLM的编码个性 – 代码状态报告。这项研究超越了准确性评分,考察了大型语言模型实际编写代码的方式,并揭示了每个模型的独特“编码个性”。

该研究评估了Claude Sonnet 4、Claude 3.7 Sonnet、GPT-4o、Llama 3.2 90B和OpenCoder-8B等五个模型,使用Sonar自己的静态分析引擎——经过16年完善的SonarQube Enterprise平台技术——评估了超过4,400个Java作业。

共同优势

所有五个模型都表现出强大的语法可靠性,这意味着它们生成的代码在大多数情况下都能编译和运行成功。这一点在它们的HumanEval评分中得到了体现,HumanEval评分是一种基准测试,模型被要求解决编码问题,并且它们的解决方案会被自动检查以确定其正确性。Claude Sonnet 4以95.57%的HumanEval评分和77.04%的加权Pass@1率领先,意味着其第一次尝试在超过四分之三的情况下都是正确的。Claude 3.7 Sonnet的评分为72.46%,GPT-4o为69.67%,Llama 3.2 61.47%,OpenCoder-8B为60.43%。

这种性能在不同的编程语言中都得到了体现,表明这些模型是在通过问题进行推理,而不是仅仅依赖于记忆的语法。

共同弱点

最令人担忧的共同缺陷是糟糕的安全卫生。Sonar衡量了阻塞级别漏洞,这是最严重的缺陷类别——安全问题,如果被利用,可以直接导致重大漏洞或系统损害。例如,允许任意文件访问、SQL或命令注入、硬编码密码、加密配置不当或接受不受信任的证书等问题。这些问题过于常见:Claude Sonnet 4有59.57%的漏洞属于此类别,GPT-4o有62.5%,Llama 3.2有令人担忧的70.73%。

报告还指出反复出现的资源泄漏,一种代码错误,代码打开一个资源(如文件句柄、网络套接字或数据库连接),但未能正确关闭它。随着时间的推移,这些泄漏可能会耗尽可用的系统资源,导致性能问题或崩溃。Claude Sonnet 4有54个此类违规,Llama 3.2有50个,GPT-4o有25个。

在可维护性方面,大多数问题是代码异味——模式不会立即破坏程序,但会使其更难维护,并且更容易出现错误。超过90%的所有已识别问题都属于此类别,通常涉及未使用的代码、糟糕的命名、过度复杂或违反设计最佳实践。

独特个性

从这些优点和缺点的混合中,Sonar确定了明确的“个性”特征。

Claude Sonnet 4获得了“资深架构师”的称号。它编写的代码最冗长——在测试集中有370,816行代码——具有高认知复杂性,这意味着其逻辑路径更难以理解。它的性能良好,但容易出现复杂的错误,如资源泄漏和并发错误,这些错误可能发生在多个线程或进程以意外的方式相互作用时。

OpenCoder-8B被称为“快速原型师”,它生成的代码简短、专注——总共120,288行代码——但问题密度最高。其速度和简洁使其适合概念验证,但在没有仔细审查的情况下不适合生产。

Llama 3.2 90B被称为“未实现的承诺”,它的结果适中,但安全状况最差,超过70%的漏洞被归类为阻塞级别。

GPT-4o被称为“高效的通用者”,它在功能和复杂性之间取得了平衡,但经常出现控制流错误——操作的逻辑顺序中的错误,这可能导致不正确的结果或跳过代码。

Claude 3.7 Sonnet被称为“平衡的前身”,它生成的代码不如其后继者冗长,但注释密度最高,达到16.4%,这意味着它比其他任何模型都更好地解释了其逻辑。虽然它在文档方面做得更好,但它仍然带有大量高严重性漏洞。

最引人注目的发现之一来自比较Claude Sonnet 4和Claude 3.7。虽然Sonnet 4的通过率提高了6.3%,但其错误中被评为阻塞级别的百分比几乎翻倍,从7.10%增加到13.71%。阻塞级别漏洞也从56.03%增加到59.57%。经验表明:性能改进可能以安全性为代价。

结论

Sonar的领先LLM的编码个性 – 代码状态报告明确指出,基准准确性评分只讲述了故事的一部分。了解安全风险、可维护性和编码风格与知道模型“正确”的频率同样重要。

每个个性——无论是架构师、原型师、通用者还是平衡的前身——都有优点和缺点。对于开发人员和组织来说,需要“信任但验证”,将AI编码辅助与人类监督、彻底的代码审查和严格的安全检查相结合,以确保速度和便利不会损害安全性或长期稳定性。

安托万是一位富有远见的领导者,也是 Unite.AI 的创始合伙人。他怀着坚定的热情,致力于塑造和推动人工智能与机器人技术的未来。作为一名多次创业的企业家,他相信人工智能将像电力一样深刻地改变社会,并经常热情地谈论颠覆性技术和通用人工智能(AGI)的潜力。

作为一名未来学家,他致力于探索这些创新将如何塑造我们的世界。此外,他还是 Securities.io 的创始人。该平台专注于投资正在重新定义未来、重塑整个行业的前沿技术。