Zprávy

Uvnitř kódovacích osobností předních LLM – Pozorování ze zprávy Sonar State of Code

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V srpnu 2025 vydala společnost Sonar svou nejnovější State of Code studii, Kódovací osobnosti předních LLM – Zpráva o stavu kódu. Tento výzkum jde za hranice přesnosti, zkoumá, jak velké jazykové modely skutečně píší kód a odhaluje jedinečné „kódovací osobnosti“ pro každý.

Studie vyhodnotila Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B a OpenCoder-8B napříč více než 4 400 úkoly v Javě pomocí vlastního statického analyzátoru Sonar—technologie rafinované během 16 let prostřednictvím své vlajkové lodi SonarQube Enterprise platformy.

Sdílené silné stránky

Všechny pět modelů prokázaly silnou syntaktickou spolehlivost, což znamená, že jejich vygenerovaný kód se sestavil a spustil úspěšně ve většině případů. To se projevilo v jejich HumanEval skóre, benchmark testu, kde jsou modely požádány o řešení kódovacích problémů a jejich řešení jsou automaticky zkontrolovány na správnost. Claude Sonnet 4 se umístil na prvním místě s HumanEval skóre 95,57 % a váženou Pass@1 rychlostí 77,04 %, což znamená, že jeho první pokus byl správný ve více než tří čtvrtinách případů. Claude 3.7 Sonnet získal 72,46 %, GPT-4o 69,67 %, Llama 3.2 61,47 % a OpenCoder-8B 60,43 %.

Tento výkon se udržel napříč různými programovacími jazyky, což ukazuje, že tyto modely řeší problémy spíše než spoléhají se pouze na zapamatované syntaxe.

Sdílené slabiny

Nejběžnější sdílenou vadou byla špatná bezpečnostní hygiena. Sonar měřil blokovací úrovně zranitelností, které jsou nejzávažnější kategorií chyb—bezpečnostní problémy, které mohou vést přímo k velkým útokům nebo kompromitaci systému, pokud jsou zneužity. Příklady zahrnují kód, který umožňuje libovolný přístup k souborům, SQL nebo příkazové injekce, hardcoded hesla, špatně nakonfigurované šifrování nebo přijetí nedůvěryhodných certifikátů. Tyto byly příliš časté: Claude Sonnet 4 měl 59,57 % svých zranitelností na této úrovni, GPT-4o měl 62,5 % a Llama 3.2 znepokojivých 70,73 %.

Zpráva také poznamenala opakované úniky zdrojů, typ chyby, kde kód otevře zdroj—jako je handle souboru, síťový socket nebo databázové připojení—ale nezavře ho správně. S časem tyto úniky mohou vyčerpat dostupné systémové zdroje, což vede k problémům s výkonem nebo pádům. Claude Sonnet 4 měl 54 takových porušení, Llama 3.2 měl 50 a GPT-4o 25.

Co se týče udržovatelnosti, většina problémů byly kódové pachy—vzorce, které nepoškozují program okamžitě, ale činí jej obtížnějším na údržbu a náchylnějším k chybám v budoucnu. Více než 90 % všech identifikovaných problémů spadalo do této kategorie, často zahrnující nezahojený kód, špatné názvy, nadměrnou složitost nebo porušování nejlepších praktik návrhu.

Různé osobnosti

Z této směsi silných a slabých stránek Sonar identifikoval jasnou „osobnostní“ profil.

Claude Sonnet 4 získal titul „Senior architekt“. Píše nejverbosejší kód—370 816 řádků napříč testovacím souborem—with vysokou kognitivní složitostí, což znamená, že jeho logické cesty jsou obtížněji sledovatelné. Funkční dobře, ale náchylný k sofistikovaným chybám, jako jsou úniky zdrojů a chyby souběžnosti, které mohou nastat, když se více vláken nebo procesů vzájemně ovlivňují.

OpenCoder-8B byl „Rychlý prototypér“, produkující krátký, zaměřený kód—120 288 řádků celkem—ale s nejvyšší hustotou problémů. Jeho rychlost a stručnost jej činí vhodným pro koncepční důkazy, ale nebezpečným pro produkci bez pečlivého přezkumu.

Llama 3.2 90B byl „Nesplněný slib“. Dosáhl středních výsledků, ale měl nejhorší bezpečnostní postoje, s více než 70 % zranitelností klasifikovaných jako blokovací.

GPT-4o byl „Efektivní generalista“, vyvažující funkčnost a složitost, ale často spadl přes řízení toku chyb—chyby v logické sekvenci operací, které mohou vést k nesprávným výsledkům nebo přeskočenému kódu.

Claude 3.7 Sonnet byl „Vyvážený předchůdce“, produkující méně verbose kód než jeho nástupce, ale s nejvyšší hustotou komentářů na 16,4 %, což znamená, že vysvětluje svou logiku více než kterýkoli jiný model. Zatímco lepší v dokumentaci, stále nesl významné vysoké úrovně zranitelností.

Jedno z nejvíce pozoruhodných zjištění přišlo ze srovnání Claude Sonnet 4 s Claude 3.7. Ačkoli Sonnet 4 zlepšil svou úspěšnost o 6,3 %, procento jeho chyb klasifikovaných jako blokovací se téměř zdvojnásobilo, z 7,10 % na 13,71 %. Blokovací úrovně zranitelností se také zvýšily z 56,03 % na 59,57 %. Lekce: zlepšení výkonu může přijít na úkor bezpečnosti.

Závěr

Zpráva Sonar Kódovací osobnosti předních LLM – Zpráva o stavu kódu jasně ukazuje, že benchmarková přesnost vypráví pouze část příběhu. Porozumění bezpečnostním rizikům, udržovatelnosti a kódovacímu stylu je stejně důležité jako znalost toho, jak často model „to dělá správně“.

Každá osobnost— zda architekt, prototypér, generalista nebo vyvážený předchůdce—má silné a slabé stránky. Závěr pro vývojáře a organizace je „důvěřovat, ale ověřovat“, spojující pomoc při kódování AI s lidským dohledem, důkladným přezkumem kódu a přísnými bezpečnostními kontrolami, aby se zajistilo, že rychlost a pohodlí neohrozí bezpečnost nebo dlouhodobou stabilitu.

Antoine je vizionářský lídr a zakládající partner Unite.AI, kterého pohání neochvějné nadšení pro utváření a podporu budoucnosti umělé inteligence a robotiky. Jako podnikatel, který založil několik společností, věří, že AI promění společnost stejně zásadně jako elektřina, a často s nadšením hovoří o potenciálu převratných technologií a obecné umělé inteligence (AGI).

Jako futurista se věnuje zkoumání toho, jak tyto inovace budou utvářet náš svět. Je také zakladatelem Securities.io, platformy zaměřené na investice do špičkových technologií, které nově definují budoucnost a proměňují celá odvětví.