Góc nhìn Anderson
Ngày càng nhiều, HIPAA không thể ngăn AI loại bỏ ẩn danh Dữ liệu bệnh nhân

Ngay cả sau khi bệnh viện xóa tên và mã bưu chính, AI hiện đại đôi khi vẫn có thể xác định bệnh nhân là ai. Đây là tin tốt đối với các công ty bảo hiểm, nhưng không phải đối với người bệnh.
Nghiên cứu mới của Đại học New York cho thấy các ghi chú y tế tại Mỹ, dù đã xóa tên và các định danh khác theo HIPAA, vẫn có thể khiến bệnh nhân bị tái nhận dạng. Khi huấn luyện mô hình ngôn ngữ trên một tập lớn hồ sơ bệnh nhân thực chưa kiểm duyệt, những tín hiệu gắn với danh tính vẫn tồn tại; trong một số trường hợp, chỉ chẩn đoán cũng có thể giúp suy ra khu dân cư của bệnh nhân.
Nghiên cứu đặt rủi ro này trong bối cảnh thị trường dữ liệu sức khỏe đã khử định danh trị giá lớn, nơi bệnh viện và nhà môi giới dữ liệu thường bán hoặc cấp phép ghi chú lâm sàng đã làm sạch cho các hãng dược, công ty bảo hiểm và nhà phát triển AI.
Các tác giả thách thức chính khái niệm “khử định danh” được ghi trong cơ chế bảo vệ bệnh nhân của HIPAA. Theo họ, ngay cả khi tuân thủ hoàn hảo Safe Harbor, ghi chú đã khử định danh vẫn liên kết về mặt thống kê với danh tính qua chính những tương quan tạo nên giá trị lâm sàng của chúng. Xung đột này mang tính cấu trúc, không chỉ là vấn đề kỹ thuật.
Nhóm nghiên cứu cho rằng khuôn khổ hiện tại để khử định danh theo HIPAA vẫn để lại hai đường hậu cho các cuộc tấn công liên kết.
Sơ đồ nhân quả trong nghiên cứu cho thấy việc khử định danh kiểu HIPAA xóa các thuộc tính nhạy cảm trực tiếp nhưng vẫn giữ lại những tương quan gắn với danh tính, cho phép suy ra bệnh nhân từ thông tin y tế và thông tin tưởng như không nhạy cảm. Nguồn
Trong ví dụ của các tác giả, thai kỳ cho phép suy ra giới tính sinh học, còn sở thích cưỡi ngựa biểu diễn gợi ý bệnh nhân sống trong khu vực khá giả. Mặc dù ngày sinh và mã bưu chính đã bị xóa, nội dung còn lại vẫn cho phép suy ra đây là một phụ nữ trưởng thành và ước đoán nơi cư trú của cô ấy.
Trong một thí nghiệm, hơn 220.000 ghi chú lâm sàng của 170.000 bệnh nhân NYU Langone vẫn chứa đủ tín hiệu để suy ra các đặc điểm nhân khẩu học sau khi định danh trực tiếp đã bị loại bỏ.
Phân tích sâu hơn
Một mô hình dựa trên BERT được tinh chỉnh để dự đoán sáu thuộc tính từ hồ sơ đã khử định danh. Chỉ với 1.000 mẫu huấn luyện, mô hình đã vượt mức đoán ngẫu nhiên. Giới tính sinh học được phục hồi với độ chính xác trên 99,7%; ngay cả tín hiệu yếu như tháng ghi chú cũng được dự đoán tốt hơn ngẫu nhiên.
Để mô phỏng một cuộc tấn công thực tế, các thuộc tính suy ra được dùng để liên kết với cơ sở dữ liệu bệnh nhân Langone. Rủi ro tái nhận dạng duy nhất cao nhất là 0,34%, khoảng 37 lần mức cơ sở dựa trên lớp chiếm đa số. Nếu áp dụng cho dân số Mỹ, riêng tỷ lệ này tương ứng với khoảng 800.000 bệnh nhân có thể bị nhận dạng.
Các tác giả gọi đây là một nghịch lý: phần lớn rủi ro không đến từ Thông tin Sức khỏe Được Bảo vệ đã bị xóa, mà đến từ nội dung y tế và nội dung được xem là không nhạy cảm nên vẫn được chia sẻ.
Bản đồ các quận của Thành phố New York cho thấy khác biệt về tỷ lệ tử vong tại bệnh viện, thời gian nằm viện trung bình và mức thu nhập. Các chênh lệch theo khu vực như vậy có thể để lại dấu vết vị trí ngay cả trong ghi chú y tế đã khử định danh. Xem bài nghiên cứu gốc để biết thêm ví dụ.
Bài báo cho rằng quy tắc Safe Harbor không còn vận hành như các nhà hoạch định chính sách dự kiến. Xóa 18 định danh có thể đáp ứng câu chữ của luật, nhưng không ngăn mô hình ngôn ngữ hiện đại suy ra danh tính từ văn bản y tế thông thường.
Những bên hưởng lợi nhiều nhất từ điểm yếu này có thể là các tập đoàn lớn liên quan đến bảo hiểm y tế, thay vì tin tặc hoặc kẻ tống tiền theo nghĩa thông thường. Thị trường ghi chú lâm sàng đã khử định danh trị giá hàng tỷ đô la tạo ra động cơ để duy trì tính lưu thông của dữ liệu và tránh các biện pháp bảo vệ riêng tư làm giảm tiện ích hoặc đòi hỏi đầu tư hạ tầng đắt đỏ.
Đây là một bài lập luận và không đưa ra giải pháp dứt khoát. Tuy nhiên, các tác giả đề xuất nghiên cứu về khử định danh nên chú trọng hợp đồng xã hội và hậu quả pháp lý của vi phạm, thay vì chỉ tìm giải pháp kỹ thuật. Bài báo có tên Paradox of De-identification: A Critique of HIPAA Safe Harbour in the Age of LLMs, do bốn nhà nghiên cứu tại Đại học New York và NYU Langone thực hiện.
Phương pháp
Để kiểm tra giả thuyết, các tác giả xây dựng cuộc tấn công liên kết hai giai đoạn bằng 222.949 ghi chú lâm sàng có định danh của 170.283 bệnh nhân tại NYU Langone. Toàn bộ ghi chú được chia theo bệnh nhân thành 80% huấn luyện, 10% xác thực và 10% kiểm thử để tránh rò rỉ giữa các tập.
Bộ dữ liệu này lớn gấp 3,34 lần MIMIC-IV, bộ hồ sơ sức khỏe điện tử công khai lớn nhất. Vì lý do riêng tư, dữ liệu Langone sẽ không được công bố; dự án cung cấp kho mã tạo dữ liệu tổng hợp để người dùng thử các nguyên lý của phương pháp.
Sáu thuộc tính nhân khẩu học được chọn để gần với bộ ba tái nhận dạng kinh điển: giới tính sinh học, khu dân cư, năm ghi chú, tháng ghi chú, thu nhập khu vực và loại bảo hiểm.
Sáu thuộc tính được suy ra từ ghi chú NYU Langone đã khử định danh gồm giới tính sinh học, khu dân cư, năm và tháng ghi chú, thu nhập khu vực và loại bảo hiểm. Chúng được chọn để mô phỏng bộ ba định danh duy nhất được mô tả trong nghiên cứu trước.
Các ghi chú được khử định danh bằng UCSF philter. Mô hình BERT-base-uncased 110 triệu tham số, đã được tiền huấn luyện trên văn bản tổng quát để tránh tiếp xúc trước với dữ liệu lâm sàng, được tinh chỉnh riêng cho từng thuộc tính bằng tám GPU NVIDIA A100 40 GB hoặc H100 80 GB trong tối đa mười epoch.
Quá trình tối ưu dùng AdamW với tốc độ học 2×10⁻⁵ và kích thước lô hiệu dụng 256. Khả năng khái quát trên tập kiểm thử được đánh giá bằng độ chính xác và ROC-AUC có trọng số để tính đến mất cân bằng lớp.
Để cuộc tấn công thực tế hơn, dự đoán không được coi là một câu trả lời duy nhất. Với mỗi thuộc tính, hệ thống giữ lại k giá trị có xác suất cao nhất rồi lọc cơ sở dữ liệu để tìm mọi bệnh nhân khớp với các đặc điểm đó. Kết quả là một danh sách ứng viên cho từng ghi chú.
Đánh giá rủi ro
Rủi ro được tính theo hai bước: đo tần suất bệnh nhân thật xuất hiện trong danh sách ứng viên, sau đó ước tính xác suất chọn đúng người trong nhóm ấy. Vì bước cuối giả định kẻ tấn công chọn ngẫu nhiên một tên trong số các kết quả khớp, con số báo cáo là thận trọng và một kẻ tấn công quyết tâm có thể làm tốt hơn.
Thí nghiệm giả định kẻ tấn công có quyền truy cập toàn bộ quần thể bệnh nhân trong cơ sở dữ liệu bên ngoài. Đây là kịch bản xấu nhất nhưng thực tế đối với một tổ chức lớn hoặc nhà môi giới dữ liệu có độ phủ hồ sơ rộng, thay vì một cá nhân chỉ có thông tin hạn chế.
Kết quả
Rủi ro được đo ở ba mức: tỷ lệ thành công khi đưa bệnh nhân thật vào nhóm ứng viên; xác suất chọn đúng người sau khi nhóm đã được xác định; và xác suất tái nhận dạng duy nhất, là tích của hai đại lượng trên.
Độ chính xác dự đoán giới tính sinh học, khu dân cư, năm, tháng, thu nhập và loại bảo hiểm. BERT-base-uncased huấn luyện trên ghi chú đã được UCSF philter xử lý vượt mức đoán ngẫu nhiên ngay từ 1.000 mẫu, và độ chính xác tăng đều khi dữ liệu đạt 178.000 mẫu.
Trong cả sáu thuộc tính và mọi quy mô dữ liệu từ 1.000 đến 177.000 mẫu, mô hình ngôn ngữ luôn vượt các đường cơ sở ngẫu nhiên. Điều này xác nhận rằng quá trình khử định danh vẫn giữ lại tín hiệu có thể khai thác qua hai đường hậu. Rủi ro xuất hiện ngay lập tức: giới tính sinh học lộ rõ nhất với độ chính xác trên 99,7%, nhưng ngay cả tháng ghi chú cũng được dự đoán tốt hơn ngẫu nhiên.
Biểu đồ đối chiếu tần suất danh sách ứng viên chứa bệnh nhân thật với mức độ dễ chọn đúng người từ danh sách. Mô hình ngôn ngữ tạo rủi ro tái nhận dạng tổng thể cao hơn đoán đơn giản, đạt 0,34% so với 0,0091% của đường cơ sở mạnh nhất.
Bệnh nhân thật xuất hiện càng thường xuyên và danh sách càng ngắn thì rủi ro càng cao. Ở mức đỉnh, mô hình tạo xác suất nhận dạng duy nhất 0,34%, cao hơn khoảng 37 lần đường cơ sở mạnh nhất. Rủi ro còn lớn hơn đối với bệnh nhân có tiền sử y tế hiếm gặp hoặc thuộc nhóm bị thiệt thòi.
Các tác giả kêu gọi đánh giá lại nghiêm túc Safe Harbor. HIPAA dùng định nghĩa nhị phân: dữ liệu hoặc “có định danh” hoặc “đã khử định danh”, và giả định rằng xóa một danh sách token cố định sẽ tách câu chuyện lâm sàng khỏi danh tính. Nhưng phân tích nhân quả và kết quả thực nghiệm cho thấy sự tách rời này chỉ là ảo tưởng. Chẩn đoán và câu chuyện không bị xóa là sản phẩm của hành trình sống riêng biệt, tạo thành chữ ký nhiều chiều có thể truy ngược tới cá nhân.
Quy tắc hiện nay tập trung xóa một danh sách định danh cố định nhưng bỏ qua các mẫu còn lại trong văn bản. Mô hình ngôn ngữ lớn được xây dựng để phát hiện và kết hợp chính những mẫu ấy, khiến chi tiết lâm sàng thông thường trở thành “định danh gián tiếp”.
Khuyến nghị của nghiên cứu bao gồm việc không nên xem tinh chỉnh bằng dữ liệu tổng hợp hoặc dữ liệu “giải mật” là giải pháp tự động: dữ liệu tổng hợp vẫn có thể mang rủi ro từ dữ liệu thật tạo ra nó, còn dữ liệu giải mật giả định chuẩn bảo vệ cũ của HIPAA vẫn hiệu quả.
Kết luận
Vì các đường hậu này có lợi nhất cho tổ chức lớn như công ty bảo hiểm, một rào cản pháp lý kiểu DMCA cấm hành vi vượt biện pháp bảo vệ, bất kể công nghệ, có thể không đủ hiệu quả nếu việc khai thác diễn ra kín đáo và không được tiết lộ.
Các công ty bảo hiểm có động cơ tiếp cận loại thông tin này và, trực tiếp hoặc qua nhà môi giới dữ liệu, đã có mức tiếp cận đáng kể đối với hồ sơ y tế riêng tư. Công ty càng lớn thì cơ sở dữ liệu khách hàng riêng càng rộng. Nếu các giới hạn của HIPAA đang trở thành một “thỏa thuận danh dự” hơn là hàng rào hiệu quả chống khai thác doanh nghiệp, đã đến lúc phải xem xét lại.
* Các trích dẫn trong văn bản của tác giả đã được chuyển thành liên kết khi cần.
Được xuất bản lần đầu vào thứ Tư, ngày 11 tháng 2 năm 2026.












