Nền tảng AI
Ma trận nhầm lẫn là gì?
Một ma trận nhầm lẫn là một bảng đếm tần suất dự đoán của bộ phân loại đồng ý hay không đồng ý với các nhãn đã biết. Nó cho thấy các lớp nào bị nhầm lẫn và cung cấp các số đếm dùng để tính các chỉ số như độ chính xác, độ thu hồi, độ đặc hiệu và F1. Nó là một trong những công cụ chẩn đoán cốt lõi cho các vấn đề phân loại học có giám sát.
Bản thân ma trận không phải là một điểm hiệu suất duy nhất. Nó là một cách trình bày có cấu trúc của các kết quả tại một ngưỡng quyết định, bộ dữ liệu và định nghĩa lớp cụ thể.
Những điểm chính
- Đối với phân loại nhị phân, bốn kết quả là dương tính thật, dương tính giả, âm tính giả và âm tính thật.
- Luôn gắn nhãn cho các trục: các thư viện và ấn phẩm không phải luôn đặt các lớp thực tế và dự đoán theo cùng một hướng.
- Độ chính xác có thể che giấu các lỗi nghiêm trọng khi các lớp không cân bằng.
- Thay đổi ngưỡng phân loại sẽ thay đổi ma trận nhầm lẫn và sự đánh đổi giữa độ chính xác và độ thu hồi.

Bốn kết quả trong phân loại nhị phân
- Dương tính thật (TP): ví dụ là dương tính và mô hình dự đoán dương tính.
- Dương tính giả (FP): ví dụ là âm tính nhưng mô hình dự đoán dương tính.
- Âm tính giả (FN): ví dụ là dương tính nhưng mô hình dự đoán âm tính.
- Âm tính thật (TN): ví dụ là âm tính và mô hình dự đoán âm tính.
Thema scikit‑learn’s convention, rows are true classes and columns are predicted classes. Other visualizations may transpose this arrangement, so the labels—not the corner positions—should guide interpretation.
Các chỉ số được suy ra từ ma trận nhầm lẫn
Độ chính xác
Precision = TP / (TP + FP)
Độ chính xác trả lời: trong số các ví dụ được dự đoán là dương tính, tỷ lệ bao nhiêu thực sự là dương tính?
Độ thu hồi hoặc độ nhạy
Recall = TP / (TP + FN)
Độ thu hồi trả lời: trong số tất cả các ví dụ dương tính thực tế, mô hình đã xác định được bao nhiêu phần trăm? Trong phân loại nhị phân, độ thu hồi của lớp dương tính còn được gọi là độ nhạy hoặc tỷ lệ dương tính thật.
Độ đặc hiệu
Specificity = TN / (TN + FP)
Độ đặc hiệu là độ thu hồi cho lớp âm tính: trong số các âm tính thực tế, mô hình đã từ chối đúng bao nhiêu phần trăm?
Độ chính xác
Accuracy = (TP + TN) / (TP + TN + FP + FN)
Độ chính xác hữu ích khi các lớp và chi phí lỗi tương đối cân bằng. Nó có thể gây hiểu lầm khi một lớp chiếm ưu thế.
Điểm F1
F1 = 2 × (Precision × Recall) / (Precision + Recall)
Điểm F1 tóm tắt độ chính xác và độ thu hồi bằng trung bình hài hòa. Nó bỏ qua các âm tính thật, vì vậy không phải là tóm tắt phù hợp cho mọi nhiệm vụ.
Ví dụ thực tế
Giả sử một tập kiểm tra chứa 1.000 giao dịch. Năm mươi trong số đó là gian lận. Một mô hình phát hiện được 40 vụ gian lận nhưng đánh dấu 30 giao dịch hợp pháp:
- TP = 40
- FN = 10
- FP = 30
- TN = 920
Mô hình có độ chính xác 96%, nhưng độ chính xác (precision) của nó khoảng 57% và độ thu hồi 80%. Độ chính xác cao phần lớn do số lượng giao dịch hợp pháp lớn. Việc mô hình này có chấp nhận được hay không phụ thuộc vào chi phí của các vụ gian lận bị bỏ lỡ, khả năng điều tra, và mức độ hiệu chuẩn của các điểm rủi ro.
Ngưỡng thay đổi ma trận
Nhiều bộ phân loại đưa ra một điểm số thay vì câu trả lời có/không bắt buộc. Hạ ngưỡng dương tính thường làm tăng độ thu hồi và số dương tính giả; nâng ngưỡng thường làm tăng độ chính xác hoặc độ đặc hiệu trong khi bỏ lỡ nhiều dương tính hơn. Ngưỡng nên được chọn dựa trên dữ liệu xác thực và chi phí lỗi thực tế, không nên cố định tự động ở 0.5.
Các đường cong độ chính xác‑thu hồi và ROC tóm tắt hiệu suất qua các ngưỡng. Đường cong độ chính xác‑thu hồi thường cung cấp thông tin hữu ích hơn khi lớp dương tính hiếm.
Ma trận nhầm lẫn đa lớp
Với K lớp, ma trận có kích thước K × K. Các dự đoán đúng nằm trên đường chéo; các ô ngoài đường chéo cho thấy cặp lớp nào bị nhầm lẫn. Các chỉ số theo lớp có thể được trung bình theo các cách khác nhau:
- Trung bình macro: cho mỗi lớp có trọng số bằng nhau.
- Trung bình có trọng số: trọng số mỗi lớp theo số lượng ví dụ của nó.
- Trung bình micro: tổng hợp các số đếm kết quả trước khi tính chỉ số.
Báo cáo chỉ một trung bình có thể che giấu hiệu suất kém trên các lớp nhỏ hơn. Bao gồm số lượng hỗ trợ và kết quả theo lớp khi sự khác biệt quan trọng.
Những sai lầm phổ biến
- Đọc ma trận đã chuyển vị mà không kiểm tra nhãn trục.
- Tính các chỉ số từ dữ liệu huấn luyện thay vì một tập dữ liệu kiểm tra thích hợp.
- Bỏ qua tần suất lớp, chiến lược lấy mẫu, hoặc các thực thể trùng lặp qua các phân đoạn.
- So sánh các ma trận được tạo ở các ngưỡng khác nhau mà không ghi chú sự thay đổi.
- Xem tất cả các dương tính giả và âm tính giả có chi phí bằng nhau.
Do đó, ma trận nhầm lẫn là một công cụ chẩn đoán, không phải là một đánh giá toàn diện. Hiệu chuẩn, phân tích nhóm phụ, độ bền và các hậu quả downstream cũng phải có trong việc đánh giá phân loại.
Đọc từng ô và suy ra các chỉ số hữu ích
Đối với phân loại nhị phân, ma trận nhầm lẫn đếm số dương tính thật, dương tính giả, âm tính giả và âm tính thật cho một lớp dương tính và ngưỡng đã chọn. Độ chính xác tính tỉ lệ dự đoán đúng trên tổng số trường hợp; độ chính xác (precision) hỏi phần trăm các dự đoán dương tính là đúng; độ thu hồi (recall) hỏi phần trăm các dương tính thực tế được tìm thấy; độ đặc hiệu đo lường các âm tính thực tế được từ chối đúng. Điểm F1 là trung bình hài hòa của độ chính xác và độ thu hồi. Không có chỉ số nào là tốt nhất một cách tuyệt đối: việc sàng lọc gian lận, phân loại y tế và lọc thư rác gán các hậu quả khác nhau cho cùng một ô.
Đối với các vấn đề đa lớp, các hàng thường đại diện cho các lớp thực và các cột cho các lớp dự đoán, mặc dù quy ước có thể khác nhau, vì vậy nhãn phải được nêu rõ. Đếm một‑với‑còn lại tạo ra độ chính xác và độ thu hồi cho từng lớp. Trung bình macro cân bằng trọng số cho các lớp; trung bình micro tổng hợp các quyết định và ưu tiên các lớp phổ biến; trung bình có trọng số dựa trên số lượng mẫu của mỗi lớp. Các nhiệm vụ đa nhãn cho phép nhiều nhãn cho mỗi mục và cần các định nghĩa theo nhãn hoặc theo mẫu. Chuẩn hoá theo hàng để kiểm tra mẫu độ thu hồi hoặc theo cột để kiểm tra thành phần dự đoán, nhưng vẫn giữ nguyên số đếm thô để các nhóm hiếm không bị phóng đại trực quan.
Ngưỡng, độ không chắc và quyết định vận hành
Ma trận nhầm lẫn tóm tắt các quyết định cứng tại một ngưỡng. Sử dụng các đường cong độ chính xác‑thu hồi hoặc ROC để so sánh các ngưỡng, sau đó chọn một điểm vận hành dựa trên năng lực, tần suất và chi phí lỗi. Hiệu chuẩn đặt câu hỏi liệu các xác suất dự đoán có khớp với tần suất quan sát hay không và tách biệt với việc xếp hạng. Khi tần suất thay đổi, độ chính xác có thể thay đổi ngay cả khi độ nhạy và độ đặc hiệu vẫn ổn định. Báo cáo khoảng tin cậy hoặc biến thể bootstrap, và tránh rút ra kết luận chỉ dựa trên một vài lỗi trong một nhóm phụ nhỏ.
Kiểm toán các ma trận theo thời gian, địa điểm, thiết bị, ngôn ngữ và các nhóm liên quan để tìm các lỗi tập trung. So sánh mô hình với quy trình quyết định hiện có, bao gồm cả đánh giá của con người. Đối với các chuỗi, ghi lại lỗi ở mỗi giai đoạn: thu thập, phân loại, ngưỡng và hành động. Giám sát các nhãn kết quả trực tiếp cùng với độ trễ và quy trình sửa chữa. Một điểm F1 dường như cải thiện vẫn có thể làm tăng các âm tính giả gây hại hoặc vượt quá khả năng xem xét. Ma trận nhầm lẫn là một sổ ghi chép quyết định; kết nối mỗi ô với người chịu lỗi và phản hồi tiếp theo.
Ví dụ thực tế: chọn ngưỡng sàng lọc y tế
Một mô hình sàng lọc học máy đưa ra điểm rủi ro cho một tình trạng có tần suất thấp. Nhóm này tạo các ma trận nhầm lẫn qua các ngưỡng và báo cáo độ nhạy, độ đặc hiệu, độ chính xác, các trường hợp giới thiệu sai và các trường hợp bỏ sót kèm khoảng tin cậy. Vì giá trị dự đoán dương tính phụ thuộc vào tần suất, nó mô hình hoá quần thể mục tiêu thay vì trích dẫn độ chính xác của một bộ dữ liệu duy nhất. Kết quả được phân đoạn theo thiết bị, địa điểm, tuổi, giới tính và các nhóm được biện minh lâm sàng khác.
Bác sĩ chọn một điểm vận hành giữ được độ nhạy yêu cầu mà không gây quá tải cho các xét nghiệm xác nhận. Ma trận được chuyển đổi thành các số đếm dự kiến trên mỗi 10.000 người được sàng lọc để các hậu quả dễ hiểu. Các điểm số ngoài các điều kiện đã được xác thực sẽ không tạo ra kết luận tự động. Việc giám sát so sánh dự đoán với các chẩn đoán đã xác nhận trễ, theo dõi năng lực và hiệu chuẩn, và kích hoạt đánh giá khi tần suất hoặc cách thu thập thay đổi. Ma trận nhầm lẫn vẫn được liên kết với mô hình, ngưỡng và quần thể cụ thể.
Bằng chứng triển khai và sẵn sàng vận hành
Một quyết định triển khai cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường vận hành, đầu vào, đầu ra, các phụ thuộc, người chịu trách nhiệm và hậu quả của mỗi lỗi quan trọng. Thiết lập một nền tảng có thể tái tạo và một tập đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp bình thường, các điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, sự cố phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị bỏ qua. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền chịu trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng hoạt động. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn, và xác minh việc giám sát bằng các lỗi được chèn cố ý. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình khôi phục, học hỏi từ sự cố, xóa và lưu trữ tài liệu, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.
Câu hỏi thường gặp
Ma trận nhầm lẫn chuẩn hoá là gì?
Chuẩn hoá chia các số đếm cho tổng số của lớp thực, tổng số của lớp dự đoán, hoặc toàn bộ quan sát. Nó làm cho các tỉ lệ dễ so sánh hơn giữa các lớp, nhưng báo cáo cũng nên giữ lại số đếm hỗ trợ thô để các nhóm nhỏ không bị nhầm lẫn là các nhóm có kích thước tương đương.
Ma trận nhầm lẫn có thể đánh giá hồi quy không?
Không trực tiếp. Ma trận nhầm lẫn yêu cầu các lớp rời rạc. Phân nhóm một mục tiêu liên tục sẽ mất thông tin; hồi quy thường nên sử dụng phân tích dư lượng và các chỉ số được thiết kế cho giá trị liên tục, chẳng hạn như MAE hoặc RMSE.












