Góc nhìn Anderson
Dữ Liệu Tổng Hợp Không Bảo Vệ Được Quyền Riêng Tư, Các Nhà Nghiên Cứu Khẳng Định

Một nghiên cứu hợp tác mới giữa Pháp và Anh đã đặt ra nghi ngờ về sự tự tin ngày càng tăng của ngành công nghiệp rằng dữ liệu tổng hợp có thể giải quyết các vấn đề về quyền riêng tư, chất lượng và khả năng tiếp cận (trong số các vấn đề khác) mà đang đe dọa sự tiến bộ trong lĩnh vực học máy.
Trong số các điểm chính được đề cập, các tác giả khẳng định rằng dữ liệu tổng hợp được mô hình hóa từ dữ liệu thực tế vẫn giữ lại đủ thông tin thực sự để không cung cấp sự bảo vệ đáng tin cậy khỏi các cuộc tấn công suy luận và thành viên, những cuộc tấn công này nhằm mục đích làm mất ẩn danh dữ liệu và tái liên kết nó với những người thực sự.
Hơn nữa, những người có nguy cơ cao nhất từ các cuộc tấn công như vậy, bao gồm cả những người có tình trạng sức khỏe nghiêm trọng hoặc hóa đơn bệnh viện cao (trong trường hợp ẩn danh hồ sơ bệnh án), thông qua tính chất “dị biệt” của tình trạng của họ, có khả năng cao nhất bị xác định lại bởi các kỹ thuật này.
Bài báo quan sát:
‘Với quyền truy cập vào một tập dữ liệu tổng hợp, một đối thủ chiến lược có thể suy luận, với sự tự tin cao, sự hiện diện của một bản ghi mục tiêu trong dữ liệu gốc.’
Bài báo cũng lưu ý rằng dữ liệu tổng hợp riêng biệt khác, loại dữ liệu này che giấu chữ ký của các bản ghi cá nhân, thực sự bảo vệ quyền riêng tư của các cá nhân, nhưng chỉ bằng cách làm suy yếu đáng kể sự hữu ích của các hệ thống thu hồi thông tin sử dụng nó.
Nếu có gì, các nhà nghiên cứu quan sát, các phương pháp riêng biệt – những phương pháp sử dụng ‘thông tin thực’ ‘ở một mức độ khác’ thông qua dữ liệu tổng hợp – làm cho kịch bản bảo mật xấu đi hơn so với nó sẽ có:
‘[Các tập dữ liệu tổng hợp] không cung cấp bất kỳ sự minh bạch nào về sự đánh đổi này. Không thể dự đoán được các đặc điểm dữ liệu nào sẽ được bảo tồn và các mẫu nào sẽ bị подав.’
Bài báo mới này, có tiêu đề Dữ Liệu Tổng Hợp – Ngày Groundhog của Ẩn Danh, đến từ hai nhà nghiên cứu tại École Polytechnique Fédérale de Lausanne (EPFL) ở Paris và một nhà nghiên cứu từ Đại học London (UCL).
Các nhà nghiên cứu đã tiến hành các thử nghiệm về các thuật toán đào tạo mô hình riêng tư hiện có, và phát hiện ra rằng một số quyết định triển khai vi phạm các bảo đảm quyền riêng tư chính thức được cung cấp trong các khuôn khổ, để lại các bản ghi đa dạng bị lộ trước các cuộc tấn công suy luận.
Các tác giả cung cấp một phiên bản sửa đổi của mỗi thuật toán có thể giảm thiểu những lỗ hổng này, và đang làm cho mã có sẵn dưới dạng thư viện mã nguồn mở. Họ tuyên bố rằng điều này sẽ giúp các nhà nghiên cứu đánh giá lợi ích quyền riêng tư của dữ liệu tổng hợp và so sánh hữu ích các phương pháp ẩn danh phổ biến. Khung khổ mới kết hợp hai phương pháp tấn công quyền riêng tư quan trọng có thể được áp dụng cho bất kỳ thuật toán đào tạo mô hình tổng hợp nào.
Dữ Liệu Tổng Hợp
Dữ liệu tổng hợp được sử dụng để đào tạo các mô hình học máy trong các kịch bản khác nhau, bao gồm cả trường hợp thiếu thông tin toàn diện có thể được lấp đầy bởi dữ liệu ảo. Một ví dụ về điều này là khả năng sử dụng các khuôn mặt được tạo bởi CGI để cung cấp ‘khó’ hoặc hiếm gặp khuôn mặt cho các tập dữ liệu tổng hợp hình ảnh, nơi các hình ảnh hồ sơ, góc cạnh hoặc biểu cảm không thường xuyên được thấy trong tài liệu nguồn.
Các loại hình ảnh CGI khác đã được sử dụng để điền vào các tập dữ liệu sẽ được chạy trên dữ liệu không tổng hợp, chẳng hạn như các tập dữ liệu có tính năng tay và đồ nội thất.
Về bảo vệ quyền riêng tư, dữ liệu tổng hợp có thể được tạo ra từ dữ liệu thực bằng các hệ thống Mạng Đối Nghịch (GAN) trích xuất các tính năng từ dữ liệu thực và tạo ra các bản ghi ảo tương tự có khả năng tổng quát hóa tốt cho dữ liệu thực (không nhìn thấy) sau này, nhưng được thiết kế để che giấu chi tiết của những người thực sự có trong dữ liệu nguồn.
Phương Pháp
Để phục vụ cho nghiên cứu mới, các tác giả đã đánh giá lợi ích quyền riêng tư trên năm thuật toán đào tạo mô hình tổng hợp. Ba mô hình không cung cấp bảo vệ quyền riêng tư rõ ràng, trong khi hai mô hình còn lại đi kèm với các bảo đảm quyền riêng tư khác biệt. Các mô hình bảng này được chọn để đại diện cho một loạt các kiến trúc.
Các mô hình bị tấn công là BayNet, PrivBay (một phái sinh của PrivBayes/BayNet), CTGAN, PATEGAN và IndHist.
Khung khổ đánh giá cho các mô hình được thực hiện dưới dạng một thư viện Python với hai lớp cốt lõi – GenerativeModels và PrivacyAttacks. Lớp sau này có hai mặt – một đối thủ suy luận thành viên và một cuộc tấn công suy luận thành viên. Khung khổ cũng có khả năng đánh giá lợi ích quyền riêng tư của ‘dữ liệu được làm sạch’ (tức là ẩn danh) và dữ liệu tổng hợp.
Hai tập dữ liệu được sử dụng trong các thử nghiệm là Tập Dữ Liệu Người Lớn từ Kho Lưu Trữ Học Máy UCI và Tập Dữ Liệu Công Cứu Thất Cứu Trợ Công Cộng từ Bộ Dịch Vụ Y Tế Bang Texas. Tập dữ liệu Texas được sử dụng bởi các nhà nghiên cứu chứa 50.000 bản ghi được lấy mẫu từ hồ sơ bệnh nhân cho năm 2013.
Các Cuộc Tấn Công và Phát Hiện
Mục tiêu chung của nghiên cứu là thiết lập ‘khả năng liên kết’ (tái liên kết dữ liệu thực với dữ liệu tổng hợp được lấy cảm hứng từ nó). Các mô hình tấn công được sử dụng trong nghiên cứu bao gồm Hồi Quy Logistic, Rừng Ngẫu Nhiên và Lớp Lân Cận K-Nearest Neighbors.
Các tác giả đã chọn hai nhóm mục tiêu bao gồm năm bản ghi được chọn ngẫu nhiên cho ‘danh mục thiểu số’ của dân số, vì những nhóm này có khả năng dễ bị tấn công liên kết. Họ cũng đã chọn các bản ghi có ‘giá trị thuộc tính danh mục hiếm’ nằm ngoài 95% phân vị của thuộc tính đó. Ví dụ bao gồm các bản ghi liên quan đến nguy cơ tử vong cao, tổng hóa đơn bệnh viện cao và mức độ nghiêm trọng của bệnh.
Mặc dù bài báo không giải thích khía cạnh này, từ góc độ của những kẻ tấn công thực tế, đây chính xác là loại ‘bệnh nhân đắt tiền’ hoặc ‘nguy cơ cao’ có khả năng bị nhắm mục tiêu bởi các phương pháp suy luận thành viên và các phương pháp xuất dữ liệu khác.
Nhiều mô hình tấn công đã được đào tạo chống lại thông tin tham chiếu công khai để phát triển ‘mô hình bóng’ trên mười mục tiêu. Kết quả trên một loạt các thí nghiệm (như được mô tả trước đó) cho thấy rằng một số bản ghi đã ‘rất dễ bị tổn thương’ trước các cuộc tấn công liên kết nhằm vào chúng bởi các nhà nghiên cứu. Kết quả cũng cho thấy rằng 20% tất cả các mục tiêu trong các thử nghiệm nhận được lợi ích quyền riêng tư không từ dữ liệu tổng hợp được tạo ra bởi các phương pháp GAN.
Các nhà nghiên cứu lưu ý rằng kết quả thay đổi tùy thuộc vào phương pháp được sử dụng để tạo ra dữ liệu tổng hợp, vector tấn công và các tính năng của tập dữ liệu được nhắm mục tiêu. Báo cáo tìm thấy rằng trong nhiều trường hợp, việc ức chế danh tính hiệu quả thông qua các phương pháp dữ liệu tổng hợp làm giảm sự hữu ích của các hệ thống kết quả. Về cơ bản, sự hữu ích và độ chính xác của các hệ thống như vậy có thể là chỉ số trực tiếp của mức độ dễ bị tổn thương của chúng trước các cuộc tấn công tái xác định.
Các nhà nghiên cứu kết luận:
‘Nếu một tập dữ liệu tổng hợp bảo tồn các đặc điểm của dữ liệu gốc với độ chính xác cao, và do đó giữ lại sự hữu ích của dữ liệu cho các trường hợp sử dụng mà nó được quảng cáo, nó đồng thời cho phép các đối thủ trích xuất thông tin nhạy cảm về các cá nhân.
‘Một lợi ích cao về quyền riêng tư thông qua bất kỳ cơ chế ẩn danh nào mà chúng tôi đã đánh giá chỉ có thể đạt được nếu phiên bản tổng hợp hoặc được làm sạch của dữ liệu gốc không truyền tải tín hiệu của các bản ghi cá nhân trong dữ liệu thô và thực sự ức chế bản ghi của chúng.’












