Raporty

Wewnętrzna strona osobowości wiodących LLM – spostrzeżenia z raportu Sonar State of Code

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W sierpniu 2025 roku Sonar opublikował swój najnowszy State of Code study, The Coding Personalities of Leading LLMs – A State of Code Report. To badanie wykracza poza oceny dokładności, analizując, jak duże modele językowe naprawdę piszą kod i ujawniają unikalne „osobowości programistyczne” dla każdego.

Badanie oceniło Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B i OpenCoder-8B w ponad 4 400 zadaniach Java przy użyciu własnego silnika analizy statycznej Sonar – technologii udoskonalonej przez 16 lat dzięki platformie SonarQube Enterprise.

Wspólne zalety

Wszystkie pięć modeli wykazało silną niezawodność składniową, co oznacza, że wygenerowany kod został skompilowany i uruchomiony pomyślnie w większości przypadków. Wynika to z ich wyników HumanEval, testu, w którym modele są proszone o rozwiązanie problemów programistycznych, a ich rozwiązania są automatycznie sprawdzane pod kątem poprawności. Claude Sonnet 4 zajęło pierwsze miejsce z wynikiem 95,57% w teście HumanEval i wskaźnikiem Pass@1 na poziomie 77,04%, co oznacza, że pierwsza próba była poprawna w ponad trzech czwartych przypadków. Claude 3.7 Sonnet uzyskał wynik 72,46%, GPT-4o 69,67%, Llama 3.2 61,47%, a OpenCoder-8B 60,43%.

Ten wynik utrzymał się we wszystkich językach programowania, co pokazuje, że te modele rozwiązują problemy, a nie polegają wyłącznie na zapamiętanej składni.

Wspólne słabości

Najbardziej niepokojącą wspólną wadą była słaba higiena bezpieczeństwa. Sonar zmierzył blokujące się luki, które są najbardziej poważną kategorią błędów – problemy bezpieczeństwa, które mogą prowadzić bezpośrednio do poważnych naruszeń lub kompromitacji systemu, jeśli zostaną wykorzystane. Przykłady obejmują kod, który pozwala na dowolny dostęp do plików, wstrzyknięcie SQL lub polecenia, wprowadzanie twardych haseł, nieprawidłową konfigurację szyfrowania lub akceptowanie niezaufanych certyfikatów. Były one zbyt powszechne: Claude Sonnet 4 miał 59,57% swoich luk na tym poziomie, GPT-4o miał 62,5%, a Llama 3.2 aż 70,73%.

Raport zauważył również powtarzające się przecieki zasobów, rodzaj błędu, w którym kod otwiera zasób – taki jak uchwyt pliku, gniazdo sieciowe lub połączenie z bazą danych – ale nie zamyka go prawidłowo. Z czasem te przecieki mogą wyczerpać dostępne zasoby systemu, prowadząc do problemów z wydajnością lub awarii. Claude Sonnet 4 miał 54 takie naruszenia, Llama 3.2 miał 50, a GPT-4o 25.

Jeśli chodzi o utrzymanie, większość problemów była nieprzyjemnymi zapachami – wzorcami, które nie łamią programu od razu, ale utrudniają jego utrzymanie i sprawiają, że jest bardziej podatny na błędy w przyszłości. Ponad 90% wszystkich zidentyfikowanych problemów należało do tej kategorii, często dotycząc nieużywanego kodu, złych nazw, nadmiernej złożoności lub naruszeń najlepszych praktyk projektowych.

Odrębne osobowości

Z tego połączenia zalet i wad Sonar zidentyfikował wyraźne „profilaktyczne” profile.

Claude Sonnet 4 zdobył tytuł „Starszy Architekt”. Pisze najbardziej rozwlekły kod – 370 816 linii w całym zestawie testowym – z wysoką złożonością poznawczą, co oznacza, że jego ścieżki logiczne są trudniejsze do naśladowania. Działa dobrze, ale jest skłonny do sofistykowanych błędów, takich jak przecieki zasobów i błędy współbieżności, które mogą wystąpić, gdy wiele wątków lub procesów oddziałuje w nieoczekiwany sposób.

OpenCoder-8B był „Szybkim Prototypem”, produkując krótki, ukierunkowany kod – 120 288 linii łącznie – ale z najwyższą gęstością problemów. Jego szybkość i zwięzłość sprawiają, że jest dobrze nadający się do dowodów pojęciowych, ale niebezpieczny w produkcji bez starannej kontroli.

Llama 3.2 90B był „Niespełnioną Obietnicą”. Przyniósł umiarkowane wyniki, ale miał najgorszą postawę bezpieczeństwa, z ponad 70% luk zabezpieczeń sklasyfikowanych jako blokujące.

GPT-4o był „Wydajnym Ogólnym”, balansującym funkcjonalność i złożoność, ale często potykał się o błędy przepływu sterowania – błędy w sekwencji logicznej operacji, które mogą prowadzić do niepoprawnych wyników lub pominiętego kodu.

Claude 3.7 Sonnet był „Zrównoważonym Poprzednikiem”, produkując mniej rozwlekły kod niż jego następca, ale z najwyższą gęstością komentarzy na poziomie 16,4%, co oznacza, że wyjaśniał swoją logikę bardziej niż jakikolwiek inny model. Chociaż był lepszy w dokumentacji, nadal miał znaczące luki zabezpieczeń o wysokim poziomie.

Jednym z najbardziej uderzających spostrzeżeń było porównanie Claude Sonnet 4 z Claude 3.7. Chociaż Sonnet 4 poprawił swój wynik o 6,3%, odsetek jego błędów sklasyfikowanych jako blokujące niemal podwoił się, z 7,10% do 13,71%. Luki zabezpieczeń o wysokim poziomie również wzrosły z 56,03% do 59,57%. Lekcja: poprawa wydajności może nastąpić kosztem bezpieczeństwa.

Podsumowanie

Raport Sonar The Coding Personalities of Leading LLMs – A State of Code Report pokazuje, że ocena dokładności opowiada tylko część historii. Zrozumienie ryzyka bezpieczeństwa, utrzymania i stylu kodowania jest równie ważne, jak wiedza o tym, jak często model „trafi w sedno”.

Każda osobowość – czy to architekt, prototyp, ogólny czy zrównoważony poprzednik – ma zalety i wady. Wnioskiem dla deweloperów i organizacji jest „zaufaj, ale sprawdź”, łącząc pomoc w kodowaniu AI z nadzorem ludzkim, staranną kontrolą kodu i rygorystycznymi kontrolami bezpieczeństwa, aby upewnić się, że szybkość i wygoda nie szkodzą bezpieczeństwu ani długoterminowej stabilności.

Antoine jest wizjonerskim liderem i partnerem założycielem Unite.AI. Kieruje nim niezachwiana pasja do kształtowania i rozwijania przyszłości sztucznej inteligencji i robotyki. Jako przedsiębiorca, który założył wiele firm, wierzy, że AI zmieni społeczeństwo równie głęboko jak elektryczność, i często z entuzjazmem mówi o potencjale przełomowych technologii oraz ogólnej sztucznej inteligencji (AGI).

Jako futurolog poświęca się badaniu tego, jak te innowacje ukształtują nasz świat. Jest także założycielem Securities.io, platformy skupionej na inwestowaniu w najnowocześniejsze technologie, które na nowo definiują przyszłość i przekształcają całe branże.