Báo cáo
Bên trong Nhân cách Lập trình của Các Mô hình LLM Hàng đầu – Insights từ Báo cáo State of Code của Sonar

Vào tháng 8 năm 2025, Sonar đã phát hành nghiên cứu mới nhất của mình, State of Code study, The Coding Personalities of Leading LLMs – A State of Code Report. Nghiên cứu này đi sâu vào việc phân tích cách các mô hình ngôn ngữ lớn thực sự viết mã và tiết lộ các “nhân cách lập trình” độc đáo cho từng mô hình.
Nghiên cứu đã đánh giá Claude Sonnet 4, Claude 3.7 Sonnet, GPT-4o, Llama 3.2 90B và OpenCoder-8B trên hơn 4.400 bài tập Java sử dụng công cụ phân tích tĩnh của Sonar – công nghệ được tinh chỉnh trong 16 năm qua thông qua nền tảng SonarQube Enterprise.
Điểm mạnh Chung
Tất cả năm mô hình đã thể hiện sự tin cậy về mặt cú pháp, nghĩa là mã được tạo ra đã biên dịch và chạy thành công trong hầu hết các trường hợp. Điều này được phản ánh trong HumanEval scores, một bài kiểm trabenchmark nơi các mô hình được yêu cầu giải quyết các vấn đề lập trình và các giải pháp được kiểm tra tự động về tính chính xác. Claude Sonnet 4 đứng đầu danh sách với điểm HumanEval 95,57% và tỷ lệ Pass@1 có trọng số là 77,04%, nghĩa là lần thử đầu tiên của nó chính xác trong hơn ba phần tư số trường hợp. Claude 3.7 Sonnet đạt 72,46%, GPT-4o đạt 69,67%, Llama 3.2 đạt 61,47% và OpenCoder-8B đạt 60,43%.
Hiệu suất này vẫn giữ nguyên trên các ngôn ngữ lập trình khác nhau, cho thấy rằng các mô hình này đang suy nghĩ thông qua các vấn đề chứ không chỉ dựa vào cú pháp được ghi nhớ.
Điểm yếu Chung
Điểm yếu chung đáng lo ngại nhất là vệ sinh an ninh kém. Sonar đã đo lường lỗ hổng mức chặn, là loại lỗ hổng nghiêm trọng nhất – các vấn đề an ninh có thể dẫn trực tiếp đến các vi phạm lớn hoặc thỏa hiệp hệ thống nếu bị khai thác. Ví dụ bao gồm mã cho phép truy cập tệp tùy ý, tiêm SQL hoặc lệnh, mật khẩu cứng, mã hóa không chính xác hoặc chấp nhận chứng chỉ không đáng tin cậy. Những vấn đề này quá phổ biến: Claude Sonnet 4 có 59,57% lỗ hổng ở mức độ nghiêm trọng này, GPT-4o có 62,5% và Llama 3.2 có tới 70,73%.
Báo cáo cũng lưu ý đến việc lặp lại rò rỉ tài nguyên, một loại lỗi nơi mã mở một tài nguyên – như một tay cầm tệp, socket mạng hoặc kết nối cơ sở dữ liệu – nhưng không đóng nó đúng cách. Theo thời gian, những rò rỉ này có thể cạn kiệt tài nguyên hệ thống có sẵn, dẫn đến vấn đề hiệu suất hoặc treo. Claude Sonnet 4 có 54 vi phạm như vậy, Llama 3.2 có 50 và GPT-4o có 25.
Về khả năng bảo trì, hầu hết các vấn đề là mùi mã – các mẫu không làm hỏng chương trình ngay lập tức nhưng làm cho nó khó bảo trì hơn và dễ bị lỗi trong tương lai. Hơn 90% tất cả các vấn đề được xác định thuộc vào loại này, thường liên quan đến mã không sử dụng, đặt tên kém, phức tạp quá mức hoặc vi phạm các nguyên tắc thiết kế tốt nhất.
Nhân cách Độc đáo
Từ sự kết hợp của điểm mạnh và điểm yếu, Sonar đã xác định rõ các “nhân cách” riêng biệt.
Claude Sonnet 4 đã giành được danh hiệu “Kiến trúc sư Cao cấp”. Nó viết mã verbose nhất – 370.816 dòng trên toàn bộ tập thử nghiệm – với độ phức tạp nhận thức cao, nghĩa là các đường logic của nó khó theo dõi hơn. Nó hoạt động tốt nhưng dễ bị lỗi tinh vi như rò rỉ tài nguyên và lỗi đồng thời, có thể xảy ra khi nhiều luồng hoặc tiến trình tương tác theo cách không mong muốn.
OpenCoder-8B là “Người tạo mẫu nhanh”, tạo ra mã ngắn, tập trung – 120.288 dòng tổng cộng – nhưng với mật độ vấn đề cao nhất. Tốc độ và sự ngắn gọn của nó làm cho nó phù hợp cho các bằng chứng khái niệm, nhưng nguy hiểm cho sản xuất nếu không được xem xét kỹ lưỡng.
Llama 3.2 90B là “Lời hứa không được thực hiện”. Nó mang lại kết quả trung bình nhưng có tư thế an ninh tồi tệ nhất, với hơn 70% lỗ hổng được phân loại là mức chặn.
GPT-4o là “Nhà tổng quát hiệu quả”, cân bằng giữa chức năng và phức tạp nhưng thường vấp phải lỗi luồng điều khiển – sai lầm trong trình tự logic của các hoạt động có thể dẫn đến kết quả không chính xác hoặc mã bị bỏ qua.
Claude 3.7 Sonnet là “Tiền thân Cân bằng”, tạo ra mã ít verbose hơn so với người kế nhiệm của nó nhưng có mật độ chú thích cao nhất ở mức 16,4%, nghĩa là nó giải thích logic của mình nhiều hơn bất kỳ mô hình nào khác. Mặc dù tốt hơn trong việc ghi chú, nó vẫn mang theo lỗ hổng mức độ cao đáng kể.
Một trong những phát hiện đáng chú ý nhất đến từ việc so sánh Claude Sonnet 4 với Claude 3.7. Mặc dù Sonnet 4 cải thiện tỷ lệ vượt qua của nó lên 6,3%, nhưng tỷ lệ lỗi của nó được xếp loại là mức chặn gần như gấp đôi, từ 7,10% lên 13,71%. Lỗ hổng mức chặn cũng tăng từ 56,03% lên 59,57%. Bài học: cải thiện hiệu suất có thể đi kèm với chi phí an toàn.
Kết luận
Báo cáo The Coding Personalities of Leading LLMs – A State of Code Report của Sonar làm rõ rằng độ chính xác của điểm chuẩn chỉ kể một phần của câu chuyện. Hiểu về rủi ro an ninh, khả năng bảo trì và phong cách lập trình cũng quan trọng như biết mô hình “đúng” bao nhiêu lần.
Mỗi nhân cách – dù là kiến trúc sư, người tạo mẫu, nhà tổng quát hay tiền thân cân bằng – đều có điểm mạnh và điểm yếu. Bài học cho các nhà phát triển và tổ chức là “tin nhưng kiểm chứng”, kết hợp hỗ trợ mã hóa AI với giám sát của con người, xem xét mã kỹ lưỡng và kiểm tra an ninh nghiêm ngặt để đảm bảo rằng tốc độ và tiện lợi không ảnh hưởng đến an toàn hoặc ổn định lâu dài.












