Rapporten

Binnenkijk in de codingspersoonlijkheden van toonaangevende LLM’s – Inzichten uit het Sonar State of Code-rapport

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In augustus 2025 publiceerde Sonar zijn laatste State of Code studie, De codingspersoonlijkheden van toonaangevende LLM’s – Een State of Code-rapport. Dit onderzoek gaat verder dan nauwkeurigheidsscores en onderzoekt hoe grote taalmodellen daadwerkelijk code schrijven en unieke “codingspersoonlijkheden” voor elk onthullen.

De studie beoordeelde Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B en OpenCoder-8B op meer dan 4.400 Java-opdrachten met behulp van Sonar’s eigen statische-analysemotor—technologie die is verfijnd over 16 jaar via zijn vlaggenschip SonarQube Enterprise-platform.

Gedeelde Sterkte

Alle vijf modellen toonden een sterke syntactische betrouwbaarheid, wat betekent dat hun gegenereerde code in de meeste gevallen succesvol werd gecompileerd en uitgevoerd. Dit werd weerspiegeld in hun HumanEval-scores, een benchmarktest waarbij modellen worden gevraagd om coderingsproblemen op te lossen en hun oplossingen automatisch worden gecontroleerd op correctheid. Claude Sonnet 4 stond bovenaan de lijst met een HumanEval-score van 95,57% en een gewogen Pass@1-tarief van 77,04%, wat betekent dat zijn eerste poging in meer dan driekwart van de gevallen correct was. Claude 3.7 Sonnet scoorde 72,46%, GPT-4o 69,67%, Llama 3.2 61,47% en OpenCoder-8B 60,43%.

Deze prestatie bleef gehandhaafd bij verschillende programmeertalen, wat aantoont dat deze modellen problemen doorredeneren in plaats van alleen te vertrouwen op gememoriseerde syntaxis.

Gemeenschappelijke Zwakheden

De meest verontrustende gedeelde zwakte was slechte beveiligingshygiëne. Sonar mat blokkerende kwetsbaarheden, die de ernstigste categorie van fouten zijn—beveiligingsproblemen die rechtstreeks tot grote inbraken of systeemcompromissen kunnen leiden als ze worden uitgebuit. Voorbeelden zijn code die willekeurige bestandstoegang toestaat, SQL- of opdrachtinjectie, harde gecodeerde wachtwoorden, slecht geconfigureerde encryptie of het accepteren van onbetrouwbare certificaten. Deze kwamen veel te vaak voor: Claude Sonnet 4 had 59,57% van zijn kwetsbaarheden in deze ernst, GPT-4o had 62,5% en Llama 3.2 een verontrustende 70,73%.

Het rapport wees ook op herhaalde resource-lekken, een type bug waarbij de code een resource opent—zoals een bestandshandgreep, netwerksokket of databaseverbinding—maar deze niet goed sluit. In de loop van de tijd kunnen deze lekken de beschikbare systeembronnen uitputten, waardoor prestatieproblemen of crashes ontstaan. Claude Sonnet 4 had 54 dergelijke schendingen, Llama 3.2 had 50 en GPT-4o 25.

Op het gebied van onderhoudbaarheid waren de meeste problemen codegeuren—patronen die het programma niet onmiddellijk breken, maar het moeilijker maken om te onderhouden en gevoeliger maken voor bugs in de toekomst. Meer dan 90% van alle geïdentificeerde problemen vielen in deze categorie, vaak met ongebruikte code, slechte benaming, overmatige complexiteit of schendingen van ontwerpprincipes.

Unieke Persoonlijkheden

Uit deze mix van sterke en zwakke punten identificeerde Sonar duidelijke “persoonlijkheidsprofielen”.

Claude Sonnet 4 verdiende de titel “De Senior Architect”. Het schrijft de meest verbale code—370.816 regels in de testset—with hoge cognitieve complexiteit, wat betekent dat zijn logische paden moeilijker te volgen zijn. Het presteert goed, maar is gevoelig voor geavanceerde bugs zoals resource-lekken en concurrency-fouten, die kunnen optreden wanneer meerdere threads of processen op onbedoelde wijze interactie hebben.

OpenCoder-8B was “De Snelle Prototyper”, producerend korte, gefocuste code—120.288 regels in totaal—maar met de hoogste issue-dichtheid. Zijn snelheid en bondigheid maken het goed geschikt voor bewijzen van concepten, maar gevaarlijk voor productie zonder zorgvuldige controle.

Llama 3.2 90B was “De Onvervulde Belofte”. Het leverde matige resultaten, maar had de slechtste beveiligingspositie, met meer dan 70% van de kwetsbaarheden geclassificeerd als blokkerend.

GPT-4o was “De Efficiënte Algemene”, balancerend functionaliteit en complexiteit, maar vaak struikelend over control-flow fouten—fouten in de logische volgorde van operaties die kunnen leiden tot onjuiste resultaten of overgeslagen code.

Claude 3.7 Sonnet was “De Evenwichtige Voorganger”, producerend minder verbale code dan zijn opvolger, maar met de hoogste commentaar-dichtheid op 16,4%, wat betekent dat het zijn logica meer uitlegt dan enig ander model. Hoewel het beter is in documentatie, draagt het nog steeds significante hoge ernst kwetsbaarheden.

Een van de meest opvallende bevindingen kwam uit de vergelijking van Claude Sonnet 4 met Claude 3.7. Hoewel Sonnet 4 zijn slagingspercentage met 6,3% verbeterde, verdubbelde het percentage van zijn bugs dat als blokkerend werd geclassificeerd van 7,10% naar 13,71%. Blokkerende kwetsbaarheden stegen ook van 56,03% naar 59,57%. De les: prestatieverbeteringen kunnen ten koste gaan van veiligheid.

Conclusie

Sonar’s De codingspersoonlijkheden van toonaangevende LLM’s – Een State of Code-rapport maakt duidelijk dat benchmark-nauwkeurigheid slechts een deel van het verhaal vertelt. Het begrijpen van beveiligingsrisico’s, onderhoudbaarheid en codestijl is net zo belangrijk als weten hoe vaak een model “het goed doet”.

Elke persoonlijkheid—of het nu een architect, prototyper, generalist of evenwichtige voorganger is—heeft sterke en zwakke punten. De conclusie voor ontwikkelaars en organisaties is om “te vertrouwen, maar te verifiëren”, door AI-coderingshulp te combineren met menselijke toezicht, grondige code-controle en strikte beveiligingscontroles om ervoor te zorgen dat snelheid en gemak niet ten koste gaan van veiligheid of langetermijnstabiliteit.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie om de toekomst van AI en robotica vorm te geven en vooruit te helpen. Als serieondernemer gelooft hij dat AI de samenleving net zo ingrijpend zal veranderen als elektriciteit. Hij spreekt vaak enthousiast over het potentieel van baanbrekende technologieën en artificiële algemene intelligentie (AGI).

Als futurist onderzoekt hij hoe deze innovaties onze wereld zullen vormgeven. Daarnaast is hij oprichter van Securities.io, een platform dat zich richt op investeringen in geavanceerde technologieën die de toekomst opnieuw definiëren en hele sectoren veranderen.