Laporan

Di Balik Kepribadian Pengkodean LLM Terkemuka – Wawasan dari Laporan Sonar State of Code

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Pada Agustus 2025, Sonar merilis studi terbarunya, State of Code study, The Coding Personalities of Leading LLMs – A State of Code Report. Penelitian ini melampaui skor akurasi, memeriksa bagaimana model bahasa besar sebenarnya menulis kode dan mengungkapkan “kepribadian pengkodean” unik untuk masing-masing.

Studi ini menilai Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B, dan OpenCoder-8B di lebih dari 4.400 tugas Java menggunakan mesin analisis statis Sonar—teknologi yang telah disempurnakan selama 16 tahun melalui platform SonarQube Enterprise.

Kekuatan Bersama

Kelima model menunjukkan keandalan sintaksis yang kuat, yang berarti kode yang dihasilkan dapat dikompilasi dan dijalankan dengan sukses dalam sebagian besar kasus. Hal ini tercermin dalam skor HumanEval mereka, sebuah tes benchmark di mana model diminta untuk menyelesaikan masalah pengkodean dan solusi mereka diperiksa secara otomatis untuk kebenaran. Claude Sonnet 4 menduduki posisi teratas dengan skor HumanEval 95,57% dan tingkat Pass@1 sebesar 77,04%, yang berarti upaya pertamanya benar dalam lebih dari tiga perempat kasus. Claude 3.7 Sonnet mencetak 72,46%, GPT-4o 69,67%, Llama 3.2 61,47%, dan OpenCoder-8B 60,43%.

Kinerja ini tetap konsisten di berbagai bahasa pemrograman, menunjukkan bahwa model-model ini menggunakan penalaran untuk menyelesaikan masalah daripada hanya mengandalkan sintaks yang diingat.

Kelemahan Umum

Kelemahan paling mengkhawatirkan adalah kebersihan keamanan yang buruk. Sonar mengukur vulnerabilitas tingkat blocker, yang merupakan kategori kelemahan paling parah—masalah keamanan yang dapat menyebabkan pelanggaran besar atau kompromi sistem jika dieksploitasi. Contoh termasuk kode yang memungkinkan akses file sewenang-wenang, injeksi SQL atau perintah, kata sandi yang dikodekan, enkripsi yang salah konfigurasi, atau menerima sertifikat tidak tepercaya. Kelemahan ini terlalu umum: Claude Sonnet 4 memiliki 59,57% kerentanan pada tingkat ini, GPT-4o memiliki 62,5%, dan Llama 3.2 memiliki 70,73% yang mengkhawatirkan.

Laporan ini juga mencatat adanya kebocoran sumber daya, sebuah jenis bug di mana kode membuka sumber daya—seperti handle file, soket jaringan, atau koneksi database—tetapi gagal menutupnya dengan benar. Selama waktu, kebocoran ini dapat menghabiskan sumber daya sistem yang tersedia, menyebabkan masalah kinerja atau crash. Claude Sonnet 4 memiliki 54 pelanggaran seperti itu, Llama 3.2 memiliki 50, dan GPT-4o memiliki 25.

Dalam hal kemaintan, sebagian besar masalah adalah bau kode—pola yang tidak memecahkan program secara langsung tetapi membuatnya lebih sulit untuk dipelihara dan lebih rentan terhadap bug di masa depan. Lebih dari 90% dari semua masalah yang diidentifikasi jatuh ke dalam kategori ini, sering melibatkan kode yang tidak digunakan, penamaan yang buruk, kompleksitas yang berlebihan, atau pelanggaran terhadap praktik desain terbaik.

Kepribadian Berbeda

Dari campuran kekuatan dan kelemahan ini, Sonar mengidentifikasi profil “kepribadian” yang jelas.

Claude Sonnet 4 mendapatkan julukan “Arsitek Senior.” Ia menulis kode yang paling panjang—370.816 baris di seluruh set tes—with kompleksitas kognitif yang tinggi, yang berarti jalur logikanya lebih sulit untuk diikuti. Ia berkinerja baik tetapi rentan terhadap bug yang canggih seperti kebocoran sumber daya dan kesalahan konkurensi, yang dapat terjadi ketika beberapa thread atau proses berinteraksi dengan cara yang tidak diinginkan.

OpenCoder-8B adalah “Pembuat Prototipe Cepat,” menghasilkan kode yang singkat dan terfokus—120.288 baris total—tetapi dengan kepadatan masalah tertinggi. Kecepatan dan kesingkatannya membuatnya cocok untuk bukti konsep, tetapi berbahaya untuk produksi tanpa tinjauan yang cermat.

Llama 3.2 90B adalah “Janji yang Belum Terpenuhi.” Ia menghasilkan hasil yang moderat tetapi memiliki postur keamanan terburuk, dengan lebih dari 70% kerentanan yang diklasifikasikan sebagai tingkat blocker.

GPT-4o adalah “Generalis yang Efisien,” menyeimbangkan fungsionalitas dan kompleksitas tetapi sering terjatuh ke dalam kesalahan aliran kontrol—kesalahan dalam urutan logis operasi yang dapat menyebabkan hasil yang salah atau kode yang diabaikan.

Claude 3.7 Sonnet adalah “Pendahulu yang Seimbang,” menghasilkan kode yang kurang panjang daripada penerusnya tetapi dengan kepadatan komentar tertinggi sebesar 16,4%, yang berarti ia menjelaskan logikanya lebih dari model lainnya. Meskipun lebih baik dalam dokumentasi, ia masih membawa kerentanan tingkat tinggi yang signifikan.

Salah satu temuan paling menarik datang dari perbandingan antara Claude Sonnet 4 dan Claude 3.7. Meskipun Sonnet 4 meningkatkan tingkat kelulusannya sebesar 6,3%, persentase bug yang dinilai sebagai blocker hampir dua kali lipat, dari 7,10% menjadi 13,71%. Kerentanan tingkat blocker juga meningkat dari 56,03% menjadi 59,57%. Pelajaran yang dapat diambil: perbaikan kinerja dapat datang dengan biaya keamanan.

Kesimpulan

Laporan Sonar The Coding Personalities of Leading LLMs – A State of Code Report membuat jelas bahwa skor akurasi benchmark hanya menceritakan sebagian dari cerita. Memahami risiko keamanan, kemaintan, dan gaya pengkodean sama pentingnya dengan mengetahui seberapa sering model “benar”.

Setiap kepribadian—baik arsitek, pembuat prototipe, generalis, atau pendahulu yang seimbang—memiliki kekuatan dan trade-off. Kesimpulan untuk pengembang dan organisasi adalah untuk “percayalah tetapi verifikasi,” dengan menggabungkan bantuan pengkodean AI dengan pengawasan manusia, tinjauan kode yang menyeluruh, dan pemeriksaan keamanan yang ketat untuk memastikan bahwa kecepatan dan kenyamanan tidak mengorbankan keamanan atau stabilitas jangka panjang.

Antoine adalah pemimpin visioner dan mitra pendiri Unite.AI, yang didorong oleh semangat tak tergoyahkan untuk membentuk dan memajukan masa depan AI dan robotika. Sebagai pengusaha yang telah mendirikan beberapa perusahaan, ia percaya bahwa AI akan mengubah masyarakat secara mendasar seperti listrik. Ia kerap berbicara dengan antusias tentang potensi teknologi disruptif dan kecerdasan buatan umum (AGI).

Sebagai futuris, ia berdedikasi untuk menelusuri bagaimana inovasi ini akan membentuk dunia kita. Ia juga merupakan pendiri Securities.io, platform yang berfokus pada investasi dalam teknologi mutakhir yang mendefinisikan ulang masa depan dan mengubah berbagai sektor secara menyeluruh.