Nền tảng AI
AI Giải Thích là gì?
AI Giải Thích (XAI) bao gồm các phương pháp và thực tiễn giúp con người hiểu hành vi hoặc đầu ra của hệ thống AI. Một lời giải thích có thể mô tả các đầu vào có ảnh hưởng, hiển thị một ví dụ tương tự, trình bày một thay đổi phản thực, tóm tắt một quy tắc toàn cục hoặc truyền đạt khi hệ thống không biết.
Không có lời giải thích nào là tốt nhất cho mọi trường hợp. Một nhà phát triển đang gỡ lỗi mô hình, một kiểm toán viên kiểm tra tuân thủ chính sách và một cá nhân bị ảnh hưởng bởi quyết định đều cần bằng chứng khác nhau. Do đó, các lời giải thích phải được đánh giá về độ chính xác, ý nghĩa và mục đích sử dụng—không chỉ dựa vào vẻ ngoài hấp dẫn.
Những điểm chính
- Tính minh bạch mô tả thông tin có sẵn; khả năng giải thích liên quan đến ý nghĩa; lời giải thích truyền đạt bằng chứng hoặc lý do.
- Các phương pháp toàn cục tóm tắt một mô hình, trong khi các phương pháp cục bộ giải quyết một dự đoán hoặc một vùng nhỏ.
- Các lời giải thích hậu kỳ có thể hữu ích nhưng có thể không ổn định hoặc không trung thực với mô hình gốc.
- Một lời giải thích không chứng minh tính công bằng, tính nhân quả, độ bền vững hay độ chính xác.

Bốn nguyên tắc cho các lời giải thích hữu ích
NIST đề xuất rằng một hệ thống nên cung cấp lời giải thích, làm cho nó có ý nghĩa với người dùng dự định, đảm bảo nó phản ánh chính xác quy trình của hệ thống, và truyền đạt các giới hạn kiến thức của nó. Những nguyên tắc này tách biệt sự tồn tại của lời giải thích khỏi chất lượng của nó.
Ý nghĩa phụ thuộc vào khán giả. Một mã lý do ngắn gọn có thể giúp người nộp đơn, trong khi nhà phát triển mô hình có thể cần các phân phối, hành vi tính năng và các cụm lỗi. Cả hai đều nên được liên kết với cùng một hệ thống được ghi chép và bối cảnh quyết định.
Phương pháp nội tại và hậu kỳ
Một mô hình tuyến tính thưa hoặc cây quyết định được hạn chế có thể được giải thích trực tiếp trong phạm vi hợp lệ của nó. Một mô hình phức tạp có thể thay vào đó sử dụng phép gán tính năng hậu kỳ, mô hình thay thế cục bộ, các ví dụ, bản đồ nổi bật hoặc các phản thực.
Đơn giản nội tại không tự động trung thực khi các tính năng được định nghĩa kém hoặc quy trình ẩn. Độ phức tạp hậu kỳ không tự động gây hiểu lầm. Phương pháp phải được kiểm tra dựa trên câu hỏi mà nó dự định trả lời.
Gán tính năng và các đầu vào có tương quan
Các phương pháp gán tính năng phân bổ các phần của đầu ra cho các tính năng đầu vào dựa trên các giả định rõ ràng. LIME xây dựng một mô hình thay thế cục bộ đơn giản quanh một dự đoán; các phương pháp liên quan đến SHAP kết nối các gán cộng dồn với khái niệm giá trị Shapley.
Các tính năng có tương quan có thể chia sẻ hoặc trao đổi gán tính năng, và một gán cao không đồng nghĩa với hiệu ứng nhân quả. Thay đổi một tính năng riêng lẻ có thể tạo ra một người, hình ảnh hoặc giao dịch không khả thi. Các lời giải thích nên nêu rõ nền tảng, cách lấy mẫu và các giả định phụ thuộc.
Phản thực, ví dụ và hành vi toàn cục
Một phản thực hỏi thay đổi khả thi nào sẽ làm thay đổi kết quả. Các ràng buộc là thiết yếu: một lời giải thích có thể thực hiện không nên đề xuất các thay đổi bất biến, bất hợp pháp hoặc phi thực tế. Các phương pháp dựa trên ví dụ hiển thị các nguyên mẫu hoặc các trường hợp đào tạo có ảnh hưởng nhưng có thể lộ dữ liệu riêng tư.
Phân tích toàn cục xem xét hiệu suất, phụ thuộc một phần, tính đơn điệu, tương tác và hành vi của các nhóm phụ. Đối với các mô hình tập hợp như gradient boosting, kết hợp các tóm tắt với bằng chứng cục bộ và các kiểm tra trực tiếp các ràng buộc dự kiến.
Xác thực lời giải thích và hệ thống
Kiểm tra độ trung thực, tính ổn định dưới các nhiễu nhỏ, tính nhất quán qua các đầu vào tương đương, sự hiểu biết của người dùng và liệu lời giải thích có hỗ trợ quyết định phù hợp hay không. Các kiểm tra đối kháng nên kiểm tra xem một lời giải thích thuyết phục có thể đi kèm với đầu ra sai hoặc bị thao túng hay không.
XAI nằm trong khuôn khổ đánh giá rộng hơn: chất lượng giữ lại, hiệu chuẩn, công bằng, riêng tư, bảo mật, giám sát và cơ chế kháng cáo. Một lời giải thích có thể hỗ trợ trách nhiệm, nhưng không thể thay thế cho quản trị có trách nhiệm.
Mục tiêu giải thích và các họ phương pháp
AI Giải Thích nên bắt đầu bằng một câu hỏi và khán giả: tại sao một quyết định lại xảy ra, mô hình hoạt động như thế nào chung, bằng chứng nào đã ảnh hưởng đến nó, điều gì sẽ thay đổi kết quả, hoặc liệu một chính sách có được tuân thủ hay không. Các lời giải thích cục bộ giải quyết một dự đoán; các lời giải thích toàn cục tóm tắt hành vi rộng hơn. Các mô hình có khả năng giải thích nội tại tiết lộ các hệ số, quy tắc hoặc cấu trúc, trong khi các phương pháp hậu kỳ xấp xỉ các mô hình phức tạp. Một lời giải thích về hành vi mô hình không tự động là lời giải thích nhân quả của thế giới hoặc là biện minh cho việc quyết định công bằng.
Các phương pháp gán tính năng bao gồm gradient, gradient tích hợp, giá trị kiểu SHAP, hoán vị và các mô hình thay thế cục bộ. Các lời giải thích dựa trên ví dụ truy xuất các trường hợp có ảnh hưởng hoặc tương tự; phản thực đề xuất các thay đổi liên quan đến đầu ra khác; các phương pháp khái niệm liên kết các biểu diễn nội bộ với các danh mục con người. Mỗi phương pháp có các giả định về nền tảng, tính độc lập của tính năng, tính tuyến tính cục bộ, hoặc quyền truy cập mô hình. Các biến có tương quan, tương tác và tiền xử lý có thể làm cho các gán trở nên không ổn định hoặc gây hiểu lầm. So sánh các phương pháp và thay đổi đầu vào để kiểm tra liệu một lời giải thích có dự đoán được hành vi hay không.
Đánh giá và yếu tố con người
Đánh giá độ trung thực—liệu lời giải thích có khớp với mô hình—riêng biệt với tính hợp lý đối với con người. Kiểm tra tính ổn định, độ nhạy, độ đầy đủ, độ thưa và tính hữu ích cho một nhiệm vụ được xác định như gỡ lỗi hoặc kháng cáo. Các nghiên cứu con người cần người tham gia đại diện và nên đo lường chất lượng quyết định, phát hiện lỗi, mức độ dựa vào và thời gian, không phải chỉ xem người dùng có nói biểu đồ trông rõ ràng hay không. Một lời giải thích thuyết phục có thể tăng niềm tin vào một mô hình sai, vì vậy giao diện phải hiển thị sự không chắc chắn, các lựa chọn thay thế và các giới hạn.
Phản thực nên khả thi, có thể thực hiện và không đề xuất thay đổi các đặc tính được bảo vệ hoặc bất biến. Các lời giải thích có thể rò rỉ thông tin mô hình hoặc cá nhân và giúp kẻ tấn công giải mã quyết định. Áp dụng kiểm soát truy cập và giảm thiểu đầu ra. Đối với các trường hợp được quy định hoặc có tác động cao, cần giữ lại nguồn gốc dữ liệu, phiên bản mô hình, ngưỡng và logic quyết định thực tế; một đồ họa tầm quan trọng tính năng chung không thể thay thế cho một lý do có ý nghĩa pháp lý hoặc đánh giá của con người.
Sử dụng lời giải thích một cách có trách nhiệm
Chọn mô hình đơn giản nhất đáp ứng nhu cầu hiệu suất và vận hành, nhưng không hy sinh tính hợp lệ để có khả năng giải thích bề ngoài. Kết hợp lời giải thích với kiểm tra nhóm phụ, kiểm tra độ bền, phân tích nhân quả khi cần thiết và giám sát kết quả. Ghi chép khán giả dự định và các suy luận không hợp lệ. Nếu một lời giải thích thay đổi sau một nhiễu nhẹ, hãy điều tra trước khi triển khai. Giải thích là bằng chứng về một hệ thống dưới một phương pháp; nó có giá trị cho việc gỡ lỗi, giám sát và truyền thông, nhưng không chứng nhận sự thật, công bằng, an toàn hay hiểu biết.
Ví dụ thực tế: giải thích mô hình rủi ro tín dụng
Một nhà cho vay đầu tiên xác định khán giả và lý do cần thiết: người nộp đơn cần các yếu tố quyết định chính xác và một con đường sửa chữa, trong khi các nhà phát triển cần chẩn đoán. Một nền tảng có thể giải thích được đã được hiệu chỉnh được so sánh với một mô hình tăng cường. Các gán tính năng cục bộ, phản thực và phân tích lỗi toàn cục được kiểm tra về độ trung thực, tính ổn định, hành vi tính năng có tương quan và tính hữu ích. Các lời giải thích không thể đề xuất thay đổi tuổi, khuyết tật hoặc đặc tính bất biến khác, và chúng không được trình bày như các hiệu ứng nhân quả.
Bản ghi quyết định sản xuất bảo tồn dữ liệu gốc, chuyển đổi tính năng, mô hình, ngưỡng, chính sách và hành động của con người. Người nộp đơn có thể thách thức dữ liệu sai và nhận được một đánh giá có ý nghĩa. Giám sát kiểm tra độ ổn định của kết quả và lời giải thích qua các nhóm và cập nhật mô hình. Nếu một lời giải thích hợp lý thay đổi dưới một nhiễu tính năng nhẹ hoặc bỏ qua một quy tắc chính sách quyết định, việc triển khai sẽ dừng lại. Giải thích bổ sung cho việc xác thực và quyền thủ tục; nó không biện minh cho mục tiêu không hợp lệ, kết quả phân biệt đối xử, hoặc thiếu quyền lực chịu trách nhiệm của con người.
Bằng chứng triển khai và sẵn sàng vận hành
Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự định, môi trường vận hành, đầu vào, đầu ra, phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập nền tảng có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu dịch vụ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền chịu trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một dự phòng an toàn và xác minh giám sát với các lỗi được chèn cố ý. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, sức khỏe phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần quy trình phục hồi, học từ sự cố, xóa và lưu trữ tài liệu, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.
Câu hỏi thường gặp
Bản đồ chú ý có phải là lời giải thích không?
Chúng có thể là tín hiệu chẩn đoán, nhưng trọng số chú ý đơn lẻ không được đảm bảo trung thực phản ánh các lý do cho đầu ra của mô hình.
AI giải thích có cần một mô hình đơn giản không?
Không phải lúc nào cũng vậy. Các mô hình phức tạp có thể được phân tích bằng các phương pháp hậu kỳ, nhưng những lời giải thích đó cần được xác thực độc lập và có các giới hạn được nêu rõ.












