Lãnh đạo tư tưởng
Giải Thích: Tiền Phong Mới Cho Trí Tuệ Nhân Tạo Trong Bảo Hiểm và Ngân Hàng

Được viết bởi Dr. Ori Katz, Nhà khoa học nghiên cứu phân tích, Earnix.
“Bất kỳ công nghệ tiên tiến nào cũng không thể phân biệt được với ma thuật”, nhà văn khoa học viễn tưởng Arthur C. Clarke đã lập luận. Thật vậy, đôi khi công nghệ tiên tiến, như các thuật toán học máy mới, giống như ma thuật. Các ứng dụng phát triển của học máy, bao gồm phân loại hình ảnh, nhận dạng giọng nói và sử dụng trong ngành bảo hiểm và ngân hàng, dường như có những tính chất siêu nhiên.
Nhiều công ty e ngại khi thay đổi các mô hình phân tích truyền thống của họ – và họ có lý do để làm như vậy. Ma thuật là nguy hiểm, đặc biệt nếu nó không được hiểu rõ. Các mạng nơ-ron và thuật toán ensemble là những “hộp đen”, cấu trúc bên trong của chúng có thể cực kỳ phức tạp. Đồng thời, một số nghiên cứu [1] đã chỉ ra rằng các mạng nơ-ron và thuật toán dựa trên cây có thể vượt trội so với các mô hình rủi ro bảo hiểm truyền thống được tinh chỉnh cẩn thận, được xây dựng bởi các chuyên gia bảo hiểm. Điều này là do khả năng của các thuật toán mới tự động xác định cấu trúc ẩn trong dữ liệu. Sự bí ẩn và hữu ích của các mạng nơ-ron và thuật toán dựa trên cây là đối lập. Có một sự đánh đổi vốn có giữa độ chính xác của một mô hình phân tích và mức độ “giải thích” của nó. Làm thế nào chúng ta có thể tin tưởng vào các mô hình nếu chúng ta không hiểu cách chúng đưa ra kết luận của mình? Chúng ta có nên từ bỏ ma thuật, hy sinh sự tin tưởng và kiểm soát của chúng ta vào thứ mà chúng ta không thể hiểu đầy đủ để có được độ chính xác?
Không chỉ các nhà quản lý và phân tích mới lo lắng về sự đánh đổi này. Trong những năm qua, các cơ quan quản lý đã bắt đầu khám phá mặt tối của ma thuật để tăng khả năng giám sát các ngành công nghiệp này. Các ngành ngân hàng và bảo hiểm được quản lý chặt chẽ ở nhiều khía cạnh và xu hướng quản lý hiện tại liên quan đến việc xem xét kỹ lưỡng các mô hình được sử dụng để đưa ra dự đoán. Ví dụ, Điều 71 của Quy định Bảo vệ Dữ liệu Cá nhân của Liên minh Châu Âu (GDPR) quy định rằng khách hàng phải có quyền nhận được lời giải thích về một quyết định tự động duy nhất sau khi quyết định đó đã được đưa ra. Kể từ khi được ban hành, yếu tố này của quy định đã là trung tâm của một cuộc tranh luận học thuật đầy tranh cãi.
Sự cần thiết cấp bách để giải thích các mô hình phân tích “hộp đen” đã dẫn đến sự xuất hiện của một lĩnh vực nghiên cứu mới: Trí tuệ nhân tạo giải thích được. Các chuyên gia đang phát triển các công cụ cho phép chúng ta nhìn vào bên trong hộp đen và giải mã ít nhất một phần của ma thuật. Hai loại công cụ mà các nhà nghiên cứu đã tạo ra bao gồm các công cụ “Giải thích Toàn cầu” giúp chúng ta hiểu các tính năng chính thúc đẩy dự đoán của mô hình tổng thể và các công cụ “Giải thích Địa phương” được thiết kế để giải thích một dự đoán cụ thể.
Các công cụ giải thích địa phương cho phép chúng ta hiểu được sự đóng góp của từng tính năng vào dự đoán của mô hình. Một ví dụ về giải thích địa phương là việc sử dụng các giá trị Shapley, được đặt theo tên của nhà kinh tế học Lloyd Shapley, người đã phát triển một phương pháp lý thuyết trò chơi để tính toán sự đóng góp của nhiều người chơi hợp tác trong cùng một nhiệm vụ. Trong trường hợp của trí tuệ nhân tạo giải thích được, “các người chơi” là các tính năng của mô hình, trong khi “nhiệm vụ” là dự đoán của mô hình.
Một số nghiên cứu gần đây đã phát triển các phương pháp để ước tính nhanh các giá trị Shapley [2], cho phép chúng ta phân phối dự đoán một cách công bằng giữa các tính năng khác nhau.
Sử dụng Giá trị Shapley để Giải thích Nhu cầu Tái tục Dự đoán của Một Khách hàng Cụ thể

Biểu đồ, dựa trên dữ liệu mô phỏng, cho thấy kết quả của một mô hình nhu cầu dự đoán xác suất tái tục chính sách bảo hiểm ô tô. Đây là một giải thích địa phương cho một khách hàng cụ thể. Mô hình nhu cầu dựa trên một tập hợp phức tạp của các cây quyết định, nhưng biểu đồ trình bày sự đóng góp riêng biệt của từng tính năng vào dự đoán cuối cùng. Trong ví dụ này, mô hình dự đoán rằng khách hàng trung bình trong dữ liệu sẽ tái tục chính sách với xác suất 0,64. Tuy nhiên, đối với khách hàng cụ thể này, xác suất dự đoán cao hơn nhiều, ở mức 0,72. Biểu đồ cho phép bạn xem nguyên nhân của sự khác biệt này.
Mặc dù chúng ta không thể hiểu hoàn toàn cấu trúc bên trong của mô hình phức tạp này, nhưng các giá trị Shapley cho phép chúng ta thấy được các tính năng quan trọng nhất đối với một dự đoán cụ thể, giúp giải mã một phần của ma thuật. Trung bình các giá trị Shapley cá nhân trên toàn dân cho phép chúng ta xem các tính năng nào quan trọng nhất và đạt được khả năng giải thích toàn cầu của mô hình. Các công cụ giải thích phổ biến khác bao gồm “Tính quan trọng của tính năng Permutation”, các mô hình thay thế đơn giản được phù hợp hóa cục bộ và các ví dụ phản thực tế, để đặt tên một số.
Các công cụ giải thích mới là bước tiếp theo cần thiết trong sự tiến hóa của học máy. Chúng có thể cho phép các công ty bảo hiểm và ngân hàng hiểu và tin tưởng vào các mô hình học máy của mình, tuân thủ các quy định mới và cung cấp cho khách hàng của họ thông tin có giá trị. Chúng ta hiện có thể vượt qua phần nào sự đánh đổi giữa độ chính xác và khả năng giải thích và tận hưởng lợi thế của các mô hình học máy mới với ít lo ngại về bản chất “hộp đen” của chúng.
Trong thế giới số hóa nhanh chóng của chúng ta, trở thành một tổ chức hoàn toàn dựa trên phân tích là tiêu chí sinh tồn cơ bản cho các công ty bảo hiểm và ngân hàng. Khả năng này luôn quan trọng – nhưng nó trở nên quan trọng hơn bao giờ hết với điều kiện thị trường biến động mà năm 2020 đã mang lại. Các công ty bảo hiểm và ngân hàng cần phân tích thông minh hơn để mô hình hóa một thực tế mới phức tạp mà họ có thể dựa vào đó để đưa ra quyết định kinh doanh và phục vụ khách hàng nhanh hơn và tốt hơn. Các công cụ giải thích có thể cho phép các công ty bảo hiểm và ngân hàng đạt được điều đó. Theo thời gian, chúng ta sẽ đến điểm mà các mô hình học máy không còn được coi là ma thuật, mà là một công cụ thiết yếu trong kho vũ khí cốt lõi của bất kỳ doanh nghiệp dựa trên dữ liệu nào.
Tham khảo:
[1] Bärtl, M., & Krummaker, S. (2020). Dự đoán yêu cầu trong tài chính tín dụng xuất khẩu: So sánh bốn kỹ thuật học máy. Rủi ro, 8(1), 22.
Noll, A., Salzmann, R., & Wuthrich, M. V. (2020). Nghiên cứu trường hợp: Yêu cầu trách nhiệm pháp lý của Pháp. Có sẵn tại SSRN 3164764.
Fauzan, M. A., & Murfi, H. (2018). Độ chính xác của XGBoost cho dự đoán yêu cầu bảo hiểm. Int. J. Adv. Soft Comput. Appl, 10(2).
Weerasinghe, K. P. M. L. P., & Wijegunasekara, M. C. (2016). Nghiên cứu so sánh về các thuật toán khai thác dữ liệu trong dự đoán yêu cầu bảo hiểm ô tô. Tạp chí Khoa học và Công nghệ Châu Âu, 5(1), 47-54.
[2] Lundberg, S. M., & Lee, S. I. (2017). Một cách tiếp cận thống nhất để giải thích dự đoán mô hình. Trong Advances in neural information processing systems (tr. 4765-4774).
[3] Xem thêm chi tiết tại: https://christophm.github.io/interpretable-ml-book/index.html












