Rapporter
Indenfor kodningspersonlighederne af førende LLM’er – indsigt fra Sonar State of Code-rapporten

I august 2025 offentliggjorde Sonar sin seneste State of Code undersøgelse, The Coding Personalities of Leading LLMs – A State of Code Report. Denne forskning går ud over nøjagtighedsscores og undersøger, hvordan store sprogmodeller faktisk skriver kode og afslører unikke “kodningspersonligheder” for hver.
Studiet vurderede Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B og OpenCoder-8B på over 4.400 Java-opgaver ved hjælp af Sonars egen statisk analyse-motor – teknologi, der er forfinet over 16 år gennem dets flagskib SonarQube Enterprise-platform.
Fælles styrker
Alle fem modeller viste stærk syntaktisk pålidelighed, hvilket betyder, at deres genererede kode blev kompilleret og kørt succesfuldt i de fleste tilfælde. Dette blev reflekteret i deres HumanEval-scores, en benchmark-test, hvor modellerne blev bedt om at løse kodningsproblemer, og deres løsninger blev automatisk kontrolleret for korrekthed. Claude Sonnet 4 toppede listen med en HumanEval-score på 95,57% og en vægtet Pass@1-rate på 77,04%, hvilket betyder, at dens første forsøg var korrekt i over tre fjerdedele af tilfældene. Claude 3.7 Sonnet scorede 72,46%, GPT-4o 69,67%, Llama 3.2 61,47%, og OpenCoder-8B 60,43%.
Denne præstation holdt ved over forskellige programmeringssprog, hvilket viser, at disse modeller løser problemerne igennem snarere end at stole udelukkende på memoriseret syntaks.
Fælles svagheder
Den mest alarmerende fælles fejl var dårlig sikkerheds hygiene. Sonar målte blocker-niveau sårbarheder, som er den mest alvorlige kategori af fejl – sikkerhedsproblemer, der kan føre direkte til større brud eller system-kompromittering, hvis de udnyttes. Eksempler herpå inkluderer kode, der tillader vilkårlig filadgang, SQL- eller kommando-injektion, hardcoded passwords, misconfigureret kryptering eller accept af ikke-tilstedede certifikater. Disse var alt for almindelige: Claude Sonnet 4 havde 59,57% af sine sårbarheder på dette niveau, GPT-4o havde 62,5%, og Llama 3.2 en bekymrende 70,73%.
Rapporten bemærkede også gentagne ressourcelækager, en type fejl, hvor koden åbner en ressource – såsom en filhåndtering, netværkssoket eller database-forbindelse – men ikke lukker den ordentligt. Over tid kan disse lækager udtømme tilgængelige systemressourcer, hvilket kan føre til ydelsesproblemer eller sammenbrud. Claude Sonnet 4 havde 54 sådanne overtrædelser, Llama 3.2 havde 50, og GPT-4o 25.
Vedrørende vedligeholdelighed var de fleste problemer kode-lugte – mønstre, der ikke ødelægger programmet med det samme, men gør det sværere at vedligeholde og mere tilbøjelig til fejl i fremtiden. Over 90% af alle identificerede problemer faldt i denne kategori, ofte involverende ubrugt kode, dårlig navngivning, excessiv kompleksitet eller overtrædelser af design-bedste-praksis.
Forskellige personligheder
Fra denne blanding af styrker og svagheder identificerede Sonar klare “personligheds”-profiler.
Claude Sonnet 4 fik titlen “Den seniorkarkasser”. Den skriver den mest verbale kode – 370.816 linjer på tværs af testmængden – med høj kognitiv kompleksitet, hvilket betyder, at dens logiske stier er sværere at følge. Den performer godt, men er tilbøjelig til sofistikerede fejl som ressourcelækager og samtidighedsfejl, der kan opstå, når flere tråde eller processer interagerer på uventede måder.
OpenCoder-8B var “Den hurtige prototyper”, der producerede kort, fokuseret kode – 120.288 linjer i alt – men med den højeste fejl-tæthed. Dens hastighed og korthed gør den velegnet til bevis for koncepter, men farlig for produktion uden omhyggelig gennemgang.
Llama 3.2 90B var “Det utilfredsstillede løfte”. Den leverede moderate resultater, men havde den dårligste sikkerhedsstilling, med over 70% af sårbarheder klassificeret som blocker-niveau.
GPT-4o var “Den effektive generalist”, der balancerede funktionalitet og kompleksitet, men ofte snublede over kontrol-flow-fejl – fejl i den logiske sekvens af operationer, der kan føre til forkerte resultater eller oversprungne kode.
Claude 3.7 Sonnet var “Den balancerede forgænger”, der producerede mindre verbale kode end sin efterfølger, men med den højeste kommentar-tæthed på 16,4%, hvilket betyder, at den forklarede sin logik mere end nogen anden model. Selv om den var bedre til dokumentation, havde den stadig betydelige høj-sværheds-sårbarheder.
En af de mest slående fund kom fra sammenligningen af Claude Sonnet 4 med Claude 3.7. Selv om Sonnet 4 forbedrede sin pass-rate med 6,3%, steg procentdelen af dens fejl, der blev vurderet som blocker, næsten fordoblet, fra 7,10% til 13,71%. Blocker-niveau sårbarheder steg også fra 56,03% til 59,57%. Lektien: performancesforbedringer kan komme på bekostning af sikkerhed.
Konklusion
Sonars The Coding Personalities of Leading LLMs – A State of Code Report gør det klart, at benchmark-nøjagtighed kun fortæller en del af historien. At forstå sikkerhedsrisici, vedligeholdelighed og kodningsstil er lige så vigtigt som at vide, hvor ofte en model “får det rigtigt”.
Hver personlighed – enten arkitekt, prototyper, generalist eller balanceret forgænger – har styrker og svagheder. Konklusionen for udviklere og organisationer er at “tillid, men verificér”, parre AI-kodningshjælp med menneskelig oversigt, omhyggelig kode-gennemgang og strenge sikkerhedstjek for at sikre, at hastighed og bekvemmelighed ikke kompromitterer sikkerhed eller langsigtede stabilitet.












