Rapoarte

În interiorul personalităților de codare ale LLM-urilor de top – Insights din raportul Sonar State of Code

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În august 2025, Sonar a lansat cel mai recent studiu State of Code, Personalitățile de codare ale LLM-urilor de top – Un raport State of Code. Acest studiu merge dincolo de scorurile de acuratețe, examinând modul în care modelele de limbaj mare scriu cod și dezvăluie “personalități de codare” unice pentru fiecare.

Studiul a evaluat Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B și OpenCoder-8B pe mai mult de 4.400 de sarcini Java, utilizând motorul de analiză statică al Sonar, tehnologie rafinată timp de 16 ani prin platforma SonarQube Enterprise.

Puncte forte comune

Toate cele cinci modele au demonstrat o fiabilitate sintactică puternică, ceea ce înseamnă că codul generat a compilat și a rulat cu succes în majoritatea cazurilor. Acest lucru a fost reflectat în scorurile lor HumanEval, un test de benchmark în care modelele sunt solicitate să rezolve probleme de codare și soluțiile lor sunt verificate automat pentru corectitudine. Claude Sonnet 4 a condus lista cu un scor HumanEval de 95,57% și o rată ponderată Pass@1 de 77,04%, ceea ce înseamnă că prima încercare a fost corectă în peste trei sferturi din cazuri. Claude 3.7 Sonnet a obținut 72,46%, GPT-4o 69,67%, Llama 3.2 61,47%, și OpenCoder-8B 60,43%.

Această performanță a fost menținută pe diferite limbi de programare, arătând că aceste modele raționează prin probleme, în loc de a se baza exclusiv pe sintaxă memorizată.

Slăbiciuni comune

Cea mai alarmantă slăbiciune comună a fost igiena securității slabă. Sonar a măsurat vulnerabilități de nivel blocator, care sunt cea mai severă categorie de erori – probleme de securitate care pot duce direct la breșe majore sau compromiterea sistemului, dacă sunt exploatate. Exemple includ cod care permite accesul arbitrar la fișiere, injecția SQL sau a comenzilor, parole hardcodate, criptare defectuoasă sau acceptarea certificatelor neîncredere. Acestea au fost mult prea comune: Claude Sonnet 4 a avut 59,57% din vulnerabilitățile sale la acest nivel de gravitate, GPT-4o a avut 62,5%, și Llama 3.2 un procent îngrijorător de 70,73%.

Raportul a notat, de asemenea, scurgeri repetate de resurse, un tip de eroare în care codul deschide o resursă – cum ar fi un fișier, un socket de rețea sau o conexiune la bază de date – dar nu o închide corect. În timp, aceste scurgeri pot epuiza resursele sistemului disponibile, ducând la probleme de performanță sau blocaje. Claude Sonnet 4 a avut 54 astfel de încălcări, Llama 3.2 a avut 50, și GPT-4o 25.

În ceea ce privește mentenanța, majoritatea problemelor au fost mirosuri de cod – modele care nu rup programul imediat, dar îl fac mai greu de întreținut și mai predispus la erori în viitor. Mai mult de 90% din toate problemele identificate au căzut în această categorie, implicând adesea cod nefolosit, denumiri proaste, complexitate excesivă sau încălcări ale celor mai bune practici de proiectare.

Personalități distincte

Din această combinație de puncte forte și slăbiciuni, Sonar a identificat profiluri de “personalitate” clare.

Claude Sonnet 4 a câștigat titlul “Arhitectul senior”. Acesta scrie codul cel mai verbose – 370.816 linii pe setul de test – cu o complexitate cognitivă ridicată, ceea ce înseamnă că logica sa este mai greu de urmărit. Acesta funcționează bine, dar este predispus la bug-uri sofisticate, cum ar fi scurgeri de resurse și erori de concurență, care pot apărea atunci când multiple fire sau procese interacționează în moduri neintenționate.

OpenCoder-8B a fost “Prototipistul rapid”, producând cod scurt și concentrat – 120.288 de linii în total – dar cu cea mai mare densitate de probleme. Viteza și concizia sa îl fac potrivit pentru demonstrații, dar periculos pentru producție fără o revizuire atentă.

Llama 3.2 90B a fost “Promisiunea neîmplinită”. Acesta a livrat rezultate moderate, dar a avut cea mai proastă postură de securitate, cu peste 70% din vulnerabilități clasificate ca fiind de nivel blocator.

GPT-4o a fost “Generalistul eficient”, echilibrând funcționalitatea și complexitatea, dar adesea căzând peste erori de control al fluxului – greșeli în secvența logică a operațiunilor care pot duce la rezultate incorecte sau la cod sărit.

Claude 3.7 Sonnet a fost “Predecesorul echilibrat”, producând cod mai puțin verbose decât succesorul său, dar cu cea mai mare densitate de comentarii la 16,4%, ceea ce înseamnă că a explicat logica sa mai mult decât orice alt model. Deși a fost mai bun la documentație, a purtat încă vulnerabilități grave de nivel înalt.

Una dintre cele mai izbitoare constatări a venit din compararea lui Claude Sonnet 4 cu Claude 3.7. Deși Sonnet 4 și-a îmbunătățit rata de trecere cu 6,3%, procentul bug-urilor sale evaluate ca fiind de nivel blocator a crescut de la 7,10% la 13,71%. Vulnerabilitățile de nivel blocator au crescut, de asemenea, de la 56,03% la 59,57%. Lecția: îmbunătățirile performanței pot veni la costul securității.

Concluzie

Raportul Sonar Personalitățile de codare ale LLM-urilor de top – Un raport State of Code face clar că scorurile de acuratețe spun doar o parte a poveștii. Înțelegerea riscurilor de securitate, a mentenanței și a stilului de codare este la fel de importantă ca și cunoașterea frecvenței cu care un model “o face corect”.

Fiecare personalitate – fie arhitect, prototipist, generalist sau predecesor echilibrat – are puncte forte și compromisuri. Concluzia pentru dezvoltatori și organizații este de a “încredere, dar verifica”, asociind asistența de codare AI cu supravegherea umană, revizuirea codului și verificările de securitate riguroase pentru a asigura că viteza și conveniența nu compromit securitatea sau stabilitatea pe termen lung.

Antoine este un lider vizionar și partener fondator al Unite.AI, animat de o pasiune de neclintit pentru modelarea și promovarea viitorului inteligenței artificiale și al roboticii. Antreprenor care a fondat mai multe companii, el crede că IA va transforma societatea la fel de profund ca electricitatea și vorbește adesea cu entuziasm despre potențialul tehnologiilor revoluționare și al inteligenței artificiale generale (AGI).

Ca futurolog, se dedică explorării modului în care aceste inovații vor modela lumea noastră. Este, de asemenea, fondatorul Securities.io, o platformă axată pe investiții în tehnologii de vârf care redefinesc viitorul și transformă sectoare întregi.