Raporlar
Lider LLM’lerin Kodlama Kişilikleri İçinde – Sonar State of Code Raporundan Bilgiler

Ağustos 2025’te, Sonar en son State of Code çalışmasını, Lider LLM’lerin Kodlama Kişilikleri – Bir State of Code Raporu yayınladı. Bu araştırma, doğruluk puanlarının ötesine geçerek, büyük dil modellerinin aslında nasıl kod yazdığını inceliyor ve her biri için benzersiz “kodlama kişilikleri” ortaya koyuyor.
Çalışma, Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B ve OpenCoder-8B’yi, Sonar’ın kendi statik analiz motorunu kullanarak 4.400’den fazla Java görevi üzerinden değerlendirdi—16 yıl boyunca geliştirilen SonarQube Enterprise platformu aracılığıyla mükemmelleştirilen teknoloji.
Paylaşılan Güçlü Yanlar
Beş model de güçlü sözdizimi güvenilirliği gösterdi, yani oluşturdukları kodların büyük çoğunluğu derlendi ve başarıyla çalıştı. Bu, HumanEval puanları ile yansıtıldı, burada modeller kodlama sorunlarını çözmeye davet edilir ve çözümleri otomatik olarak doğruluk için kontrol edilir. Claude Sonnet 4 listede đầu oldu, %95,57’lik bir HumanEval puanı ve %77,04’lük ağırlıklı Pass@1 oranı ile, yani ilk denemesi üçte ikiden fazla durumda doğruydu. Claude 3.7 Sonnet %72,46, GPT-4o %69,67, Llama 3.2 %61,47 ve OpenCoder-8B %60,43 puan aldı.
Bu performans, farklı programlama dilleri boyunca korundu, böylece bu modellerin sorunları çözmede yalnızca sözdizimi belleğinden değil, mantık yoluyla ilerlediğini gösterdi.
Ortak Zayıflıklar
En endişe verici paylaşılan kusur, kötü güvenlik hijyeni idi. Sonar, engelleyici düzeydeki güvenlik açıklarını ölçtü, ki bunlar en ciddi kusur kategorisidir—güvenlik sorunları, istismar edildiğinde doğrudan büyük ihlallere veya sistem tehlikesine neden olabilir. Örnekler arasında keyfi dosya erişimi, SQL veya komut enjeksiyonu, sabitlenmiş parolalar, yanlış yapılandırılmış şifreleme veya güvenilmeyen sertifikaların kabul edilmesi bulunur. Bunlar çok yaygındı: Claude Sonnet 4’ün %59,57’si, GPT-4o’nun %62,5’i ve Llama 3.2’nin endişe verici %70,73’ü bu ciddiyettedir.
Raporda ayrıca, kaynak sızıntıları tekrar edildi, yani kodun bir kaynağı—dosya tutacağı, ağ soketi veya veritabanı bağlantısı—açması ancak düzgün bir şekilde kapatmaması. Zamanla, bu sızıntılar mevcut sistem kaynaklarını tüketebilir, performans sorunlarına veya çökmelere neden olabilir. Claude Sonnet 4, 54 böyle ihlal, Llama 3.2 50 ve GPT-4o 25 ihlal kaydetti.
Bakım açısından, většina sorunları kod kokuları idi—programı hemen bozmaz ancak gelecekte daha fazla hataya eğilimliliği artırır ve bakımı zorlaştırır. Tanımlanmış sorunların %90’ından fazlası bu kategoriye girdi, genellikle kullanılmayan kod, kötü adlandırmalar, aşırı karmaşıklık veya tasarım en iyi uygulamalarına aykırılıkları içeriyordu.
Ayrıntılı Kişilikler
Bu güç ve zayıflık karışımından, Sonar açık “kişilik” profillerini tanımladı.
Claude Sonnet 4, “Senior Mimar” unvanını kazandı. En çok kodu yazdı—test seti boyunca 370.816 satır—ve yüksek bilişsel karmaşıklığa sahip, yani mantık yolları daha zor takip ediliyor. İyi performans gösteriyor ancak kaynak sızıntıları ve eşzamanlılık hataları gibi sofistike hatalara eğilimliliği var, bu hatalar birden fazla iş parçacığı veya sürecin beklenmedik şekilde etkileşime girdiğinde oluşabilir.
OpenCoder-8B, “Hızlı Prototipleyici” idi, kısa ve odaklı kodu üretti—toplam 120.288 satır—ancak en yüksek sorun yoğunluğuna sahipti. Hızı ve özlülüğü, dikkatli bir inceleme olmadan üretimde tehlikeli olabileceği için prova konseptlerine uygun yapıyor.
Llama 3.2 90B, “Gerçekleşmeyen Vaat” idi, ortalamanın üzerinde sonuçlar elde etti ancak en kötü güvenlik durumuna sahipti, güvenlik açıklarının %70’den fazlası engelleyici düzeydeydi.
GPT-4o, “Verimli Genel Uzman” idi, işlevsellik ve karmaşıklık arasında denge kurdu ancak kontrol akışı hataları ile sık sık karşılaştı—işlem mantık sırasındaki hatalar, yanlış sonuçlara veya atlanan koda neden olabilir.
Claude 3.7 Sonnet, “Dengeli Öncül” idi, selefinden daha az verböz kodu üretti ancak %16,4’lük en yüksek yorum yoğunluğuna sahipti, yani mantığını diğerlerinden daha fazla açıkladı. Belgelendirmede daha iyi olmasına rağmen, önemli yüksek şiddette güvenlik açıklarını taşıyordu.
En çarpıcı bulgulardan biri, Claude Sonnet 4 ile Claude 3.7’yi karşılaştırmaktan geldi. Sonnet 4, geçerlilik oranını %6,3 oranında iyileştirdi ancak hatalarının %7,10’dan %13,71’e çıkarak neredeyse iki katına çıkan engelleyici düzeydeki güvenlik açıklarına sahipti. Engelleyici düzeydeki güvenlik açıkları da %56,03’ten %59,57’ye yükseldi. Ders: performans iyileştirmeleri güvenliği tehlikeye atabilir.
Sonuç
Sonar’ın Lider LLM’lerin Kodlama Kişilikleri – Bir State of Code Raporu açıkça gösteriyor ki, benchmark doğruluğu sadece hikayenin bir kısmını anlatıyor. Güvenlik risklerini, bakımını ve kodlama stilini anlamak, bir modelin ne sıklıkla “doğru” olduğunu bilmekten aynı derecede önemli.
Her kişilik—mimar, prototipleyici, uzman veya dengeli öncül—güçlü ve zayıf yanlara sahip. Geliştiriciler ve organizasyonlar için çıkarımda bulunmak, AI kodlama yardımı ile insan denetimini, kapsamlı kod incelemesini ve sıkı güvenlik kontrollerini birleştirmek, böylece hız ve kolaylığın güvenlik veya uzun vadeli istikrarı tehlikeye atmadığını sağlamak önemlidir.












