Rapporter
Inuti kodpersonligheterna hos ledande LLM:er – insikter från Sonar State of Code-rapporten

I augusti 2025 släppte Sonar sin senaste State of Code-studie, Kodpersonligheterna hos ledande LLM:er – En State of Code-rapport. Denna forskning går utöver noggrannhetspoäng och undersöker hur stora språkmodeller faktiskt skriver kod och avslöjar unika “kodpersonligheter” för var och en.
Studien utvärderade Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B och OpenCoder-8B i över 4 400 Java-uppgifter med hjälp av Sonars egen statiska analysmotor – teknik som finslipats under 16 år genom dess flaggskepp SonarQube Enterprise-plattform.
Gemensamma styrkor
Alla fem modellerna visade stark syntaktisk tillförlitlighet, vilket innebär att deras genererade kod kompilerades och kördes framgångsrikt i de flesta fall. Detta återspeglades i deras HumanEval-poäng, ett benchmarktest där modellerna får lösa kodningsproblem och deras lösningar automatiskt kontrolleras för korrekthet. Claude Sonnet 4 toppade listan med en HumanEval-poäng på 95,57 % och en vägd Pass@1-frekvens på 77,04 %, vilket innebär att dess första försök var korrekt i över tre fjärdedelar av fallen. Claude 3.7 Sonnet fick 72,46 %, GPT-4o 69,67 %, Llama 3.2 61,47 % och OpenCoder-8B 60,43 %.
Denna prestation höll i sig över olika programmeringsspråk, vilket visar att dessa modeller resonerar genom problem snarare än att enbart förlita sig på memoriserad syntax.
Vanliga svagheter
Den mest alarmerande delade bristen var dålig säkerhetshygien. Sonar mätte blocker-nivåsårbarheter, som är den allvarligaste kategorin av brister – säkerhetsproblem som kan leda direkt till stora dataintrång eller systemkompromiss om de utnyttjas. Exempel inkluderar kod som tillåter godtycklig filåtkomst, SQL- eller kommandoinjektion, hårdkodade lösenord, felkonfigurerad kryptering eller accepterar obehörliga certifikat. Dessa var alldeles för vanliga: Claude Sonnet 4 hade 59,57 % av sina sårbarheter på denna nivå, GPT-4o hade 62,5 % och Llama 3.2 en oroande 70,73 %.
Rapporten noterade också upprepade resursläckor, en typ av bugg där koden öppnar en resurs – som en filhandtag, nätverkssocket eller databasanslutning – men misslyckas med att stänga den ordentligt. Över tid kan dessa läckor tömma tillgängliga systemresurser, vilket kan leda till prestandaproblem eller krascher. Claude Sonnet 4 hade 54 sådana brott, Llama 3.2 hade 50 och GPT-4o 25.
När det gäller underhållbarhet var de flesta problem kodlukt – mönster som inte bryter programmet omedelbart men gör det svårare att underhålla och mer benäget för buggar i framtiden. Mer än 90 % av alla identifierade problem hamnade i denna kategori, ofta med unused kod, dåliga namn, överdriven komplexitet eller brott mot designbästa praxis.
Distinkta personligheter
Från denna mix av styrkor och brister identifierade Sonar tydliga “personlighetsprofiler”.
Claude Sonnet 4 fick titeln “Den seniora arkitekten”. Den skriver den mest verbala koden – 370 816 rader över testuppsättningen – med hög kognitiv komplexitet, vilket innebär att dess logiska vägar är svårare att följa. Den presterar bra men är benägen för sofistikerade buggar som resursläckor och samtidighetsfel, som kan uppstå när flera trådar eller processer interagerar på oväntade sätt.
OpenCoder-8B var “Den snabba prototyparen”, som producerade kort, fokuserad kod – 120 288 rader totalt – men med den högsta problemdensiteten. Dess snabbhet och koncisthet gör den väl lämpad för bevis för koncept, men farlig för produktion utan noggrann granskning.
Llama 3.2 90B var “Det outvecklade löftet”. Den levererade måttliga resultat men hade den sämsta säkerhetsposturen, med över 70 % av sårbarheterna klassificerade som blocker-nivå.
GPT-4o var “Den effektiva generalisten”, som balanserade funktionalitet och komplexitet men ofta snubblade över kontrollflödesfel – misstag i den logiska sekvensen av operationer som kan leda till felaktiga resultat eller hoppar över kod.
Claude 3.7 Sonnet var “Den balanserade föregångaren”, som producerade mindre verbala koder än sin efterföljare men med den högsta kommentardensiteten på 16,4 %, vilket innebär att den förklarade sin logik mer än någon annan modell. Medan den var bättre på dokumentation, hade den fortfarande betydande hög-nivåsårbarheter.
En av de mest slående resultaten kom från att jämföra Claude Sonnet 4 med Claude 3.7. Även om Sonnet 4 förbättrade sin godkännandefrekvens med 6,3 %, fördubblades andelen av dess buggar som klassificerades som blocker, från 7,10 % till 13,71 %. Blocker-nivåsårbarheter steg också från 56,03 % till 59,57 %. Lektionen: prestandaförbättringar kan komma på bekostnad av säkerhet.
Slutsats
Sonars Kodpersonligheterna hos ledande LLM:er – En State of Code-rapport gör det klart att benchmark-noggrannhet berättar bara en del av historien. Att förstå säkerhetsrisker, underhållbarhet och kodstil är lika viktigt som att veta hur ofta en modell “får det rätt”.
Varje personlighet – vare sig arkitekt, prototypare, generalist eller balanserad föregångare – har styrkor och kompromisser. Lärdomen för utvecklare och organisationer är att “lita men verifiera”, genom att kombinera AI-kodhjälp med mänsklig tillsyn, noggrann kodgranskning och rigorösa säkerhetskontroller för att säkerställa att hastighet och bekvämlighet inte äventyrar säkerhet eller långsiktig stabilitet.












