Звіти

Всередині кодових особистостей провідних LLM – висновки з доповіді Sonar State of Code

mm
Додайте Unite.AI до бажаних джерел у Google

У серпні 2025 року Sonar опублікувала свою останню доповідь State of Code study, Кодові особистості провідних LLM – доповідь State of Code. Це дослідження виходить за рамки точності оцінок, розглядаючи, як великі мовні моделі насправді пишуть код і розкриваючи унікальні “кодові особистості” для кожної.

Доповідь оцінила Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B і OpenCoder-8B у понад 4 400 завданнях на Java за допомогою власного статичного аналізу Sonar – технології, відполірованої протягом 16 років на платформі SonarQube Enterprise.

Спільні сильні сторони

Всі п’ять моделей продемонстрували сильну синтаксичну надійність, тобто їхній згенерований код скомпілювався і запустився успішно у більшості випадків. Це було відображено в їхніх HumanEval scores, тестовому бенчмарку, де моделям пропонується вирішити завдання з кодування, а їхні рішення автоматично перевіряються на правильність. Claude Sonnet 4 очолив список із результатом 95,57% за HumanEval і ваговим показником Pass@1 у 77,04%, тобто його перша спроба була правильною у понад трьох чвертях випадків. Claude 3.7 Sonnet отримав 72,46%, GPT-4o – 69,67%, Llama 3.2 – 61,47%, а OpenCoder-8B – 60,43%.

Ця продуктивність зберігалася при роботі з різними мовами програмування, показуючи, що ці моделі думають над проблемами, а не покладаються виключно на запам’ятовані синтаксичні конструкції.

Спільні слабкості

Найбільш тривожною спільною слабкістю була погана безпекова гігієна. Sonar виміряла блокуючі уразливості, які є найбільш серйозною категорією дефектів – безпекових проблем, які можуть безпосередньо привести до великих порушень або компрометації системи, якщо вони будуть використані. Прикладами таких уразливостей є код, який дозволяє довільний доступ до файлів, вставку SQL або команд, зашифровані паролі, неправильно налаштоване шифрування або прийняття недовірячих сертифікатів. Такі уразливості були надто поширені: Claude Sonnet 4 мав 59,57% уразливостей цієї серйозності, GPT-4o – 62,5%, а Llama 3.2 – 70,73%.

У доповіді також було відзначено повторювані витоки ресурсів, тип дефектів, при якому код відкриває ресурс – наприклад, дескриптор файлу, сокет мережі або з’єднання з базою даних – але не закриває його належним чином. З часом такі витоки можуть виснажити доступні системні ресурси, що призводить до проблем з продуктивністю або збоїв. Claude Sonnet 4 мав 54 таких порушень, Llama 3.2 – 50, а GPT-4o – 25.

Відносно підтримки коду більшість проблем були кодовими запахами – шаблонами, які не ламають програму одразу, але роблять її складнішою для підтримки та більш схильною до дефектів у майбутньому. Більше 90% всіх виявлених проблем належали до цієї категорії, часто включаючи неиспользуємий код, погану назву, надмірну складність або порушення найкращих практик проєктування.

Відмінні особистості

З цієї суміші сильних і слабких сторін Sonar визначила чіткі “особистісні” профILI.

Claude Sonnet 4 отримав звання “Старший архітектор”. Він пише найбільш розгалужений код – 370 816 рядків по всьому тестовому набору – з високою когнітивною складністю, тобто його логічні шляхи складніше слідкувати. Він працює добре, але схильний до складних дефектів, таких як витоки ресурсів і помилки конкуренції, які можуть виникнути, коли кілька потоків або процесів взаємодіють ненавмисно.

OpenCoder-8B був “Швидким прототипером”, який генерував короткий, зосереджений код – всього 120 288 рядків – але з найбільшою щільністю проблем. Його швидкість і лаконічність роблять його придатним для прототипів, але небезпечним для виробництва без ретельного огляду.

Llama 3.2 90B був “Неспроможеним обіцянкою”. Він показав помірні результати, але мав найгіршу безпекову позицію, з понад 70% уразливостей, класифікованих як блокуючі.

GPT-4o був “Ефективним універсалом”, який балансував функціональність і складність, але часто спотикався про помилки потоку керування – помилки в логічній послідовності операцій, які можуть призвести до неправильних результатів або пропущеного коду.

Claude 3.7 Sonnet був “Збалансованим попередником”, який генерував менш розгалужений код, ніж його наступник, але з найбільшою щільністю коментарів – 16,4%, тобто він пояснював свою логіку більше, ніж будь-яка інша модель. Хоча він був кращим у документації, він все ж таки мав значні високорівневі уразливості.

Одним з найбільш вражаючих висновків стало порівняння Claude Sonnet 4 з Claude 3.7. Хоча Sonnet 4 покращив свій показник проходження на 6,3%, відсоток його помилок, класифікованих як блокуючі, майже подвоївся – з 7,10% до 13,71%. Блокуючі уразливості також зросли з 56,03% до 59,57%. Урок: покращення продуктивності можуть відбуватися за рахунок безпеки.

Висновок

Доповідь Sonar Кодові особистості провідних LLM – доповідь State of Code робить ясним, що точність бенчмарків розповідає тільки частину історії. Знання безпекових ризиків, підтримки коду та стилю програмування є так само важливим, як і знання того, скільки разів модель “влучає в ціль”.

Кожна особистість – чи то архітектор, чи прототипер, чи універсал, чи збалансований попередник – має сильні та слабкі сторони. Висновок для розробників і організацій полягає в тому, щоб “довіряти, але перевіряти”, поєднуючи допомогу з кодуванням AI з людським наглядом, ретельним переглядом коду та суворими безпековими перевірками, щоб забезпечити, що швидкість і зручність не компрометують безпеку чи довгострокову стабільність.

Антуан — далекоглядний лідер і партнер-засновник Unite.AI, якого надихає незмінна пристрасть до формування та просування майбутнього штучного інтелекту й робототехніки. Як підприємець, що заснував кілька компаній, він вірить, що ШІ змінить суспільство так само докорінно, як електрика, і часто із захопленням говорить про потенціал проривних технологій та загального штучного інтелекту (AGI).

Як футуролог, він присвячує себе дослідженню того, як ці інновації формуватимуть наш світ. Він також є засновником Securities.io — платформи, зосередженої на інвестиціях у передові технології, що переосмислюють майбутнє та змінюють цілі галузі.