Lãnh đạo tư tưởng
Ba Kỹ Thuật Học Máy Bảo Tồn Quyền Riêng Tư Giải Quyết Vấn Đề Quan Trọng Nhất Của Thập Kỷ Này

By Amogh Tarcar, Nghiên cứu viên Học Máy và Trí Tuệ Nhân Tạo, Persistent Systems.
Quyền riêng tư của dữ liệu, theo các chuyên gia trong nhiều lĩnh vực, sẽ là vấn đề quan trọng nhất của thập kỷ này. Điều này đặc biệt đúng đối với học máy (ML) nơi các thuật toán được cung cấp một lượng lớn dữ liệu.
Truyền thống, các kỹ thuật mô hình hóa ML đã dựa vào việc tập trung dữ liệu từ nhiều nguồn vào một trung tâm dữ liệu. Sau tất cả, các mô hình ML mạnh nhất khi chúng có quyền truy cập vào một lượng lớn dữ liệu. Tuy nhiên, có nhiều thách thức về quyền riêng tư khi sử dụng kỹ thuật này. Việc tập hợp dữ liệu đa dạng từ nhiều nguồn ngày nay ít khả thi hơn do các lo ngại về quy định như HIPAA, GDPR và CCPA. Hơn nữa, việc tập trung dữ liệu làm tăng phạm vi và quy mô của việc lạm dụng dữ liệu và các mối đe dọa bảo mật dưới dạng rò rỉ dữ liệu.
Để vượt qua những thách thức này, một số trụ cột của học máy bảo tồn quyền riêng tư (PPML) đã được phát triển với các kỹ thuật cụ thể giúp giảm thiểu rủi ro quyền riêng tư và đảm bảo dữ liệu vẫn an toàn. Dưới đây là một số kỹ thuật quan trọng nhất:
1. Học Liên Liên
Học liên liên là một kỹ thuật đào tạo ML đảo ngược vấn đề tập hợp dữ liệu. Thay vì tập hợp dữ liệu để tạo ra một mô hình ML, học liên liên tập hợp các mô hình ML. Điều này đảm bảo dữ liệu không bao giờ rời khỏi vị trí nguồn và cho phép nhiều bên cộng tác và xây dựng một mô hình ML chung mà không cần chia sẻ trực tiếp dữ liệu nhạy cảm.
Nó hoạt động như sau. Bạn bắt đầu với một mô hình ML cơ bản được chia sẻ với mỗi nút khách hàng. Các nút này sau đó chạy đào tạo cục bộ trên mô hình này bằng dữ liệu của riêng họ. Các bản cập nhật mô hình được chia sẻ định kỳ với nút điều phối, nút này xử lý các bản cập nhật và hợp nhất chúng để có được một mô hình toàn cầu mới. Theo cách này, bạn có được thông tin từ các tập dữ liệu đa dạng mà không cần chia sẻ các tập dữ liệu này.

Nguồn: Persistent Systems
Trong bối cảnh chăm sóc sức khỏe, đây là một công cụ mạnh mẽ và bảo vệ quyền riêng tư để giữ dữ liệu bệnh nhân an toàn trong khi cung cấp cho các nhà nghiên cứu sự khôn ngoan của đám đông. Bằng cách không tập hợp dữ liệu, học liên liên tạo ra một lớp bảo mật bổ sung. Tuy nhiên, các mô hình và bản cập nhật mô hình vẫn còn rủi ro bảo mật nếu bị lộ.
2. Sự Riêng Biệt Khác Biệt
Các mô hình ML thường là mục tiêu của các cuộc tấn công suy luận thành viên. Giả sử bạn chia sẻ dữ liệu chăm sóc sức khỏe của mình với một bệnh viện để giúp phát triển vắc xin ung thư. Bệnh viện giữ dữ liệu của bạn an toàn, nhưng sử dụng học liên liên để đào tạo một mô hình ML công khai. Vài tháng sau, các hacker sử dụng một cuộc tấn công suy luận thành viên để xác định xem dữ liệu của bạn có được sử dụng trong quá trình đào tạo mô hình hay không. Họ sau đó truyền đạt thông tin cho một công ty bảo hiểm, công ty này, dựa trên rủi ro ung thư của bạn, có thể tăng phí bảo hiểm của bạn.
Sự riêng biệt khác biệt đảm bảo rằng các cuộc tấn công của đối thủ vào các mô hình ML sẽ không thể xác định được các điểm dữ liệu cụ thể được sử dụng trong quá trình đào tạo, do đó giảm thiểu rủi ro phơi bày dữ liệu đào tạo nhạy cảm trong học máy. Điều này được thực hiện bằng cách áp dụng “tiếng ồn thống kê” để làm gián đoạn dữ liệu hoặc các tham số mô hình học máy trong khi đào tạo mô hình, làm cho nó khó khăn để thực hiện các cuộc tấn công và xác định xem liệu dữ liệu của một cá nhân cụ thể có được sử dụng để đào tạo mô hình hay không.
Chẳng hạn, Facebook gần đây đã phát hành Opacus, một thư viện tốc độ cao để đào tạo các mô hình PyTorch bằng cách sử dụng một thuật toán đào tạo học máy riêng biệt khác biệt gọi là DP-SGD (Đào tạo Gradient Ngẫu nhiên Riêng biệt). Hình ảnh động dưới đây突 xuất cách nó sử dụng tiếng ồn để che giấu dữ liệu.

Nguồn: Blog Opacus của Facebook
Tiếng ồn này được điều chỉnh bởi một tham số gọi là Epsilon. Nếu giá trị Epsilon thấp, mô hình có quyền riêng tư dữ liệu hoàn hảo nhưng tính hữu dụng và độ chính xác kém. Ngược lại, nếu bạn có giá trị Epsilon cao, quyền riêng tư dữ liệu sẽ giảm trong khi độ chính xác sẽ tăng. Mẹo là tìm sự cân bằng để tối ưu hóa cả hai.
3. Mã Hóa Đồng Hình
Mã hóa tiêu chuẩn truyền thống không tương thích với học máy vì một khi dữ liệu được mã hóa, nó không thể được hiểu bởi thuật toán học máy. Tuy nhiên, mã hóa đồng hình là một sơ đồ mã hóa đặc biệt cho phép chúng ta tiếp tục thực hiện một số loại tính toán.

Nguồn: OpenMined
Sức mạnh của điều này là quá trình đào tạo có thể diễn ra trong một không gian mã hóa hoàn toàn. Nó không chỉ bảo vệ chủ sở hữu dữ liệu mà còn bảo vệ chủ sở hữu mô hình. Chủ sở hữu mô hình có thể chạy suy luận trên dữ liệu mã hóa mà không bao giờ nhìn thấy nó hoặc lạm dụng nó.
Khi áp dụng cho học liên liên, sự hợp nhất của các bản cập nhật mô hình có thể diễn ra một cách bảo mật vì chúng diễn ra trong một môi trường mã hóa hoàn toàn, giảm đáng kể rủi ro của các cuộc tấn công suy luận thành viên.
Thập Kỷ Của Quyền Riêng Tư
Khi chúng ta bước vào năm 2021, học máy bảo tồn quyền riêng tư là một lĩnh vực nghiên cứu mới nổi với hoạt động nghiên cứu đáng kể. Nếu thập kỷ trước là về việc phá vỡ các silo dữ liệu, thì thập kỷ này sẽ là về việc phá vỡ các mô hình học máy trong khi vẫn bảo vệ quyền riêng tư của dữ liệu cơ bản thông qua học liên liên, sự riêng biệt khác biệt và mã hóa đồng hình. Những điều này trình bày một cách mới đầy hứa hẹn để phát triển các giải pháp học máy trong một cách thức nhận thức về quyền riêng tư.












