Informes

Dentro de las Personalidades de Codificación de los LLMs Líderes – Perspectivas del Informe del Estado del Código de Sonar

mm
Añade Unite.AI a tus fuentes preferidas en Google

En agosto de 2025, Sonar publicó su último Estado de Código estudio, Las Personalidades de Codificación de los LLMs Líderes – Un Informe del Estado del Código. Esta investigación va más allá de las puntuaciones de precisión, examinando cómo los grandes modelos de lenguaje realmente escriben código y revelando únicas “personalidades de codificación” para cada uno.

El estudio evaluó a Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B y OpenCoder-8B en más de 4.400 asignaciones de Java utilizando el motor de análisis estático de Sonar, tecnología refinada durante 16 años a través de su plataforma empresarial SonarQube.

Fortalezas Compartidas

Los cinco modelos demostraron una gran confiabilidad sintáctica, lo que significa que su código generado se compiló y se ejecutó con éxito en la mayoría de los casos. Esto se reflejó en sus puntuaciones HumanEval, una prueba de benchmark donde se les pide a los modelos que resuelvan problemas de codificación y sus soluciones se verifican automáticamente para comprobar su corrección. Claude Sonnet 4 encabezó la lista con una puntuación HumanEval del 95,57% y una tasa ponderada Pass@1 del 77,04%, lo que significa que su primer intento fue correcto en más de tres cuartas partes de los casos. Claude 3.7 Sonnet obtuvo una puntuación del 72,46%, GPT-4o del 69,67%, Llama 3.2 del 61,47% y OpenCoder-8B del 60,43%.

Este rendimiento se mantuvo en diferentes lenguajes de programación, lo que muestra que estos modelos razonan a través de los problemas en lugar de confiar únicamente en la sintaxis memorizada.

Debilidades Comunes

La falla compartida más alarmante fue la mala higiene de seguridad. Sonar midió vulnerabilidades de nivel de bloqueador, que son la categoría más grave de fallas, problemas de seguridad que pueden llevar directamente a violaciones importantes o compromisos del sistema si se explotan. Ejemplos incluyen código que permite el acceso arbitrario a archivos, inyección SQL o de comandos, contraseñas codificadas, cifrado mal configurado o certificados no confiables. Estos fueron demasiado comunes: Claude Sonnet 4 tuvo el 59,57% de sus vulnerabilidades en esta gravedad, GPT-4o tuvo el 62,5% y Llama 3.2 un preocupante 70,73%.

El informe también señaló fugas de recursos repetidas, un tipo de error donde el código abre un recurso, como un controlador de archivo, socket de red o conexión de base de datos, pero no lo cierra correctamente. Con el tiempo, estas fugas pueden agotar los recursos del sistema disponibles, lo que lleva a problemas de rendimiento o bloqueos. Claude Sonnet 4 tuvo 54 violaciones de este tipo, Llama 3.2 tuvo 50 y GPT-4o tuvo 25.

En cuanto a la mantenibilidad, la mayoría de los problemas fueron oportunidades de mejora del código, patrones que no rompen el programa de inmediato pero lo hacen más difícil de mantener y más propenso a errores en el futuro. Más del 90% de todos los problemas identificados cayeron en esta categoría, a menudo involucrando código no utilizado, nombres deficientes, complejidad excesiva o violaciones de las mejores prácticas de diseño.

Personalidades Distintas

A partir de esta mezcla de fortalezas y debilidades, Sonar identificó perfiles de “personalidad” claros.

Claude Sonnet 4 ganó el título de “El Arquitecto Senior”. Escribe el código más verboso, 370.816 líneas en el conjunto de pruebas, con alta complejidad cognitiva, lo que significa que sus rutas lógicas son más difíciles de seguir. Funciona bien pero es propenso a errores sofisticados como fugas de recursos y errores de concurrencia, que pueden ocurrir cuando múltiples hilos o procesos interactúan de manera no intencionada.

OpenCoder-8B fue “El Prototipador Rápido”, produciendo código corto y enfocado, 120.288 líneas en total, pero con la mayor densidad de problemas. Su velocidad y brevedad lo hacen adecuado para pruebas de concepto, pero peligroso para producción sin una revisión cuidadosa.

Llama 3.2 90B fue “La Promesa Incumplida”. Obtuvo resultados moderados pero tuvo la peor postura de seguridad, con más del 70% de las vulnerabilidades clasificadas como de nivel de bloqueador.

GPT-4o fue “El Generalista Eficiente”, equilibrando funcionalidad y complejidad pero a menudo tropezando con errores de control de flujo, errores en la secuencia lógica de operaciones que pueden llevar a resultados incorrectos o código omitido.

Claude 3.7 Sonnet fue “El Predecesor Equilibrado”, produciendo código menos verboso que su sucesor pero con la mayor densidad de comentarios, 16,4%, lo que significa que explica su lógica más que cualquier otro modelo. Aunque es mejor en documentación, todavía lleva vulnerabilidades de alto nivel.

Uno de los hallazgos más sorprendentes provino de comparar a Claude Sonnet 4 con Claude 3.7. Aunque Sonnet 4 mejoró su tasa de aprobación en un 6,3%, el porcentaje de sus errores calificados como de nivel de bloqueador casi se duplicó, del 7,10% al 13,71%. Las vulnerabilidades de nivel de bloqueador también aumentaron del 56,03% al 59,57%. La lección: las mejoras en el rendimiento pueden venir a costa de la seguridad.

Conclusión

El informe Las Personalidades de Codificación de los LLMs Líderes – Un Informe del Estado del Código de Sonar hace claro que la precisión de las puntuaciones de benchmark solo cuenta parte de la historia. Entender los riesgos de seguridad, la mantenibilidad y el estilo de codificación es tan importante como saber cuántas veces un modelo “acierta”.

Cada personalidad, ya sea arquitecto, prototipador, generalista o predecesor equilibrado, tiene fortalezas y compensaciones. La lección para los desarrolladores y las organizaciones es “confiar pero verificar”, emparejando la asistencia de codificación de IA con la supervisión humana, la revisión de código exhaustiva y las verificaciones de seguridad rigurosas para asegurarse de que la velocidad y la conveniencia no comprometan la seguridad o la estabilidad a largo plazo.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma e impulsar el futuro de la IA y la robótica. Como emprendedor que ha fundado varias empresas, cree que la IA transformará la sociedad tanto como la electricidad y suele hablar con entusiasmo del potencial de las tecnologías disruptivas y de la inteligencia artificial general (AGI).

Como futurista, se dedica a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma centrada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y transformando sectores enteros.