Lãnh đạo tư tưởng
Làm thế nào để loại bỏ thiên vị trong Chiến lược AI/ML và cách giải quyết
‘Thiên vị’ trong các mô hình của bất kỳ loại nào mô tả một tình huống trong đó mô hình phản ứng không chính xác với các yêu cầu hoặc dữ liệu đầu vào vì nó chưa được đào tạo với đủ dữ liệu chất lượng cao, đa dạng để cung cấp phản hồi chính xác. Một ví dụ sẽ là tính năng mở khóa điện thoại bằng nhận dạng khuôn mặt của Apple, đã thất bại với tỷ lệ cao hơn đáng kể đối với những người có làn da sẫm màu so với những người có tông màu sáng hơn. Mô hình này chưa được đào tạo trên đủ hình ảnh của những người có làn da sẫm màu. Đây là một ví dụ tương đối ít rủi ro về thiên vị nhưng chính xác là lý do tại sao Đạo luật AI của EU đã đưa ra các yêu cầu để chứng minh hiệu quả của mô hình (và các biện pháp kiểm soát) trước khi đưa ra thị trường. Các mô hình có đầu ra ảnh hưởng đến tình hình kinh doanh, tài chính, sức khỏe hoặc cá nhân phải được tin cậy, hoặc chúng sẽ không được sử dụng.
Loại bỏ thiên vị với Dữ liệu
Dữ liệu chất lượng cao với số lượng lớn
Trong số nhiều thực hành quản lý dữ liệu quan trọng, một thành phần chính để vượt qua và giảm thiểu thiên vị trong các mô hình AI/ML là thu thập số lượng lớn dữ liệu chất lượng cao, đa dạng. Điều này đòi hỏi sự hợp tác với nhiều tổ chức có dữ liệu như vậy. Thông thường, việc thu thập dữ liệu và hợp tác bị thách thức bởi các vấn đề về bảo vệ quyền riêng tư và/hoặc sở hữu trí tuệ – dữ liệu nhạy cảm không thể được gửi đến chủ sở hữu mô hình, và chủ sở hữu mô hình không thể mạo hiểm làm rò rỉ sở hữu trí tuệ của họ cho chủ sở hữu dữ liệu. Một giải pháp thay thế phổ biến là làm việc với dữ liệu tổng hợp hoặc dữ liệu tổng hợp, điều này có thể hữu ích nhưng cũng có những hạn chế so với việc sử dụng dữ liệu thực, đầy đủ ngữ cảnh. Đây là nơi công nghệ tăng cường quyền riêng tư (PETs) cung cấp những câu trả lời cần thiết.
Dữ liệu tổng hợp: Gần nhưng không hoàn toàn
Dữ liệu tổng hợp được tạo ra một cách nhân tạo để mô phỏng dữ liệu thực. Điều này khó khăn nhưng đang trở nên dễ dàng hơn với các công cụ AI. Dữ liệu tổng hợp chất lượng tốt nên có khoảng cách tính năng giống như dữ liệu thực, hoặc nó sẽ không hữu ích. Dữ liệu tổng hợp chất lượng cao có thể được sử dụng để tăng cường hiệu quả sự đa dạng của dữ liệu đào tạo bằng cách lấp đầy khoảng trống cho các dân số nhỏ, bị thiệt thòi hoặc cho các dân số mà nhà cung cấp AI đơn giản là không có đủ dữ liệu. Dữ liệu tổng hợp cũng có thể được sử dụng để giải quyết các trường hợp biên giới mà có thể khó tìm thấy với số lượng đủ trong thế giới thực. Ngoài ra, các tổ chức có thể tạo một tập dữ liệu tổng hợp để đáp ứng các yêu cầu về quyền riêng tư và cư trú của dữ liệu mà chặn quyền truy cập vào dữ liệu thực. Điều này nghe có vẻ tuyệt vời; tuy nhiên, dữ liệu tổng hợp chỉ là một phần của câu đố, không phải là giải pháp.
Một trong những hạn chế rõ ràng của dữ liệu tổng hợp là sự ngắt kết nối với thế giới thực. Ví dụ, các phương tiện tự hành được đào tạo chỉ trên dữ liệu tổng hợp sẽ gặp khó khăn với các điều kiện đường thực tế, không lường trước được. Ngoài ra, dữ liệu tổng hợp kế thừa thiên vị từ dữ liệu thế giới thực được sử dụng để tạo ra nó – gần như đánh bại mục đích của cuộc thảo luận của chúng tôi. Kết luận, dữ liệu tổng hợp là một lựa chọn hữu ích cho việc tinh chỉnh và giải quyết các trường hợp biên giới, nhưng những cải tiến đáng kể về hiệu quả của mô hình và giảm thiểu thiên vị vẫn phụ thuộc vào việc truy cập dữ liệu thế giới thực.
Một cách tốt hơn: Dữ liệu thực qua các quy trình được PETs kích hoạt
Công nghệ tăng cường quyền riêng tư (PETs) bảo vệ dữ liệu trong khi sử dụng. Khi nói đến các mô hình AI/ML, chúng cũng có thể bảo vệ sở hữu trí tuệ của mô hình được chạy – “hai con chim, một viên đá.” Các giải pháp sử dụng PETs cung cấp tùy chọn đào tạo mô hình trên các tập dữ liệu thực, nhạy cảm mà trước đây không thể truy cập được do lo ngại về quyền riêng tư và bảo mật dữ liệu. Việc mở khóa các luồng dữ liệu để truy cập dữ liệu thực là lựa chọn tốt nhất để giảm thiểu thiên vị. Nhưng làm thế nào nó thực sự hoạt động?
Hiện tại, các lựa chọn hàng đầu bắt đầu với một môi trường máy tính bảo mật. Sau đó, một tích hợp với một giải pháp phần mềm dựa trên PETs làm cho nó sẵn sàng sử dụng ngay lập tức trong khi giải quyết các yêu cầu về quản lý và bảo mật dữ liệu không được bao gồm trong một môi trường thực thi đáng tin cậy (TEE) tiêu chuẩn. Với giải pháp này, các mô hình và dữ liệu đều được mã hóa trước khi được gửi đến môi trường máy tính bảo mật. Môi trường này có thể được lưu trữ ở bất kỳ nơi nào, điều này quan trọng khi giải quyết các yêu cầu về định vị dữ liệu cụ thể. Điều này có nghĩa là cả sở hữu trí tuệ của mô hình và bảo mật của dữ liệu đầu vào đều được duy trì trong quá trình tính toán – ngay cả nhà cung cấp môi trường thực thi đáng tin cậy cũng không có quyền truy cập vào mô hình hoặc dữ liệu bên trong nó. Kết quả mã hóa sau đó được gửi lại để xem xét và nhật ký có sẵn để xem xét.
Quy trình này mở khóa dữ liệu chất lượng tốt nhất mà không quan tâm đến vị trí hoặc ai sở hữu nó, tạo ra một con đường để giảm thiểu thiên vị và các mô hình có hiệu quả cao mà chúng ta có thể tin cậy. Quy trình này cũng là những gì Đạo luật AI của EU mô tả trong các yêu cầu của họ cho một hộp cát quy định AI.
Thúc đẩy Tuân thủ Đạo đức và Pháp lý
Việc thu thập dữ liệu chất lượng tốt, thực sự rất khó. Các yêu cầu về quyền riêng tư và định vị dữ liệu ngay lập tức hạn chế các tập dữ liệu mà các tổ chức có thể truy cập. Để đổi mới và tăng trưởng xảy ra, dữ liệu phải chảy đến những người có thể trích xuất giá trị từ nó.
Điều 54 của Đạo luật AI của EU cung cấp các yêu cầu cho các loại mô hình “nguy cơ cao” về những gì phải được chứng minh trước khi chúng có thể được đưa ra thị trường. Tóm lại, các đội sẽ cần sử dụng dữ liệu thế giới thực trong một Hộp cát Quy định AI để chứng minh hiệu quả của mô hình và tuân thủ tất cả các biện pháp kiểm soát được nêu trong Chương 2, Tiêu đề III. Các biện pháp kiểm soát bao gồm giám sát, minh bạch, giải thích, bảo mật dữ liệu, bảo vệ dữ liệu, tối ưu hóa dữ liệu và bảo vệ mô hình – nghĩ về DevSecOps + Data Ops.
Thử thách đầu tiên sẽ là tìm một tập dữ liệu thực để sử dụng – vì đây vốn là dữ liệu nhạy cảm cho các loại mô hình như vậy. Nếu không có bảo đảm kỹ thuật, nhiều tổ chức có thể do dự khi tin tưởng nhà cung cấp mô hình với dữ liệu của họ hoặc sẽ không được phép làm như vậy. Ngoài ra, cách đạo luật định nghĩa một “Hộp cát Quy định AI” là một thách thức riêng của nó. Một số yêu cầu bao gồm việc đảm bảo dữ liệu được xóa khỏi hệ thống sau khi mô hình đã được chạy cũng như các biện pháp quản lý, thực thi và báo cáo để chứng minh điều đó.
Nhiều tổ chức đã cố gắng sử dụng các phòng sạch dữ liệu (DCR) và môi trường thực thi đáng tin cậy (TEE) sẵn sàng. Nhưng riêng những công nghệ này đòi hỏi chuyên môn đáng kể và công việc để vận hành và đáp ứng các yêu cầu quy định về dữ liệu và AI.
DCR đơn giản hơn để sử dụng, nhưng chưa hữu ích cho nhu cầu AI/ML mạnh mẽ hơn. TEE là các máy chủ bảo mật và vẫn cần một nền tảng hợp tác tích hợp để trở nên hữu ích, nhanh chóng. Điều này, tuy nhiên, xác định một cơ hội cho các nền tảng công nghệ tăng cường quyền riêng tư tích hợp với TEE để loại bỏ công việc đó, đơn giản hóa việc thiết lập và sử dụng hộp cát quy định AI, và do đó, việc thu thập và sử dụng dữ liệu nhạy cảm.
Bằng cách cho phép sử dụng các tập dữ liệu đa dạng và toàn diện hơn theo cách bảo vệ quyền riêng tư, những công nghệ này giúp đảm bảo rằng các thực hành AI và ML tuân thủ các tiêu chuẩn đạo đức và yêu cầu pháp lý liên quan đến quyền riêng tư dữ liệu (ví dụ: GDPR và Đạo luật AI của EU ở châu Âu). Tóm lại, trong khi các yêu cầu thường được đáp ứng với những than thở và than vãn, những yêu cầu này đơn giản là hướng dẫn chúng ta xây dựng các mô hình tốt hơn mà chúng ta có thể tin cậy và dựa vào để đưa ra quyết định quan trọng dựa trên dữ liệu trong khi bảo vệ quyền riêng tư của các đối tượng dữ liệu được sử dụng cho phát triển và tùy chỉnh mô hình.












