Sudut Anderson
Semakin Banyak, HIPAA Tidak Dapat Menghentikan AI dari De-Anonimisasi Data Pasien

Even setelah rumah sakit menghilangkan nama dan kode pos, AI modern masih dapat mengetahui siapa pasien tersebut. Berita baik untuk perusahaan asuransi; tidak begitu bagi penerima layanan kesehatan.
Penelitian baru dari New York University menemukan bahwa catatan medis pasien AS, yang telah dihilangkan nama dan identifikasi HIPAA lainnya, dapat membuka pasien untuk re-identifikasi. Dengan melatih model bahasa AI pada korpus besar catatan pasien dunia nyata yang tidak disensor, detail yang mendefinisikan identitas tetap ada – dalam beberapa kasus memungkinkan lingkungan pasien untuk diinferensi dari diagnosis saja.
Studi baru ini menempatkan risiko ini dalam konteks pasar yang menguntungkan dalam data kesehatan yang dihilangkan identitasnya, di mana rumah sakit dan broker data secara rutin menjual atau melisensikan catatan klinis yang telah dihilangkan identitasnya kepada perusahaan farmasi, perusahaan asuransi, dan pengembang AI.
Para penulis studi baru ini menantang konsep ‘de-identifikasi’ itu sendiri, yang ditegakkan dalam perlindungan pasien yang dibuat oleh HIPAA setelah Gubernur Massachusetts William Weld memiliki data medisnya di-anonimkan pada tahun 1997:
‘[Bahkan] di bawah kepatuhan Safe Harbor yang sempurna, catatan “diidentifikasi” tetap terkait secara statistik dengan identitas melalui korelasi yang mengkonfirmasi utilitas klinisnya. Konflik ini bersifat struktural bukan teknis.’
Para peneliti berpendapat bahwa kerangka de-identifikasi yang sesuai dengan HIPAA saat ini meninggalkan dua “backdoor” yang tersedia untuk “serangan penghubungan”:

Dari makalah baru, diagram kausal yang menggambarkan bagaimana de-identifikasi gaya HIPAA menghilangkan atribut sensitif eksplisit sambil meninggalkan korelasi yang terkait dengan identitas, memungkinkan identitas pasien untuk diinferensi melalui informasi non-sensitif dan medis. Sumber
Dalam contoh di atas, kita tidak hanya melihat bahwa pasien hamil – buah yang paling mudah diidentifikasi dalam de-identifikasi, karena itu menetapkan jenis kelamin biologis secara tidak ambigu – tetapi juga bahwa pasien tersebut menyukai hobi yang tidak terkait dengan kelompok berpenghasilan rendah, menurut para peneliti:
‘Meskipun atribut yang dilindungi (DOB dan kode pos) dihilangkan, kita masih dapat menginferensi bahwa pasien adalah seorang wanita dewasa berdasarkan kehamilan, dan tinggal di lingkungan yang berpenghasilan tinggi karena hobi dressage.’
Dalam satu eksperimen, bahkan setelah pengidentifikasi pasien dihilangkan, lebih dari 220.000 catatan klinis dari 170.000 pasien NYU Langone masih membawa sinyal yang cukup untuk memungkinkan ciri-ciri demografis untuk diinferensi.
Drilling Down
Sebuah model BERT-based telah difine-tune untuk memprediksi enam atribut dari catatan yang dihilangkan identitasnya, dan, makalah tersebut mencatat, melebihi tebakan acak dengan hanya 1.000 contoh pelatihan. Jenis kelamin biologis dipulihkan dengan akurasi lebih dari 99,7%, dan bahkan sinyal yang lebih lemah seperti bulan catatan diambil dengan akurasi yang lebih baik dari acak.
Untuk tujuan eksperimental, ciri-ciri yang diinferensi tersebut kemudian digunakan dalam serangan penghubungan terhadap database Langone, menghasilkan risiko re-identifikasi unik maksimum sebesar 0,34% – sekitar 37 kali lebih tinggi dari baseline kelas mayoritas sederhana. Diterapkan pada populasi AS, serangan ini saja akan mengidentifikasi 800.000 pasien.
Para penulis membingkai masalah ini sebagai ‘paradoks’, karena apa yang tersisa dalam catatan pasien yang dihilangkan identitasnya yang sesuai dengan HIPAA jelas merupakan dasar yang layak untuk serangan de-identifikasi:
‘[Sebagian besar] risiko re-identifikasi berasal tidak dari Informasi Kesehatan yang Dilindungi, tetapi dari konten non-sensitif dan medis yang kita anggap aman untuk dibagikan.’

Peta tingkat borough dari tingkat mortalitas di rumah sakit, rata-rata lama tinggal di rumah sakit, dan pendapatan per kapita di seluruh New York City, menunjukkan bagaimana hasil klinis dan variabel sosioekonomi berkumpul secara geografis dan menciptakan pola yang terkait dengan identitas dalam catatan yang dihilangkan identitasnya.
Makalah tersebut berpendapat bahwa aturan Safe Harbor HIPAA tidak lagi berfungsi sebagaimana dimaksud oleh pembuat kebijakan: menghilangkan 18 pengidentifikasi mungkin memuaskan surat keputusan hukum, tetapi menurut para penulis, itu tidak mencegah identitas dari being inferred oleh model bahasa saat ini. Mereka membingkai sistem itu sendiri sebagai dibangun pada asumsi yang sudah ketinggalan zaman tentang apa yang dapat dan tidak dapat diinferensi oleh model bahasa dari teks medis biasa.
Pekerjaan ini juga menunjukkan bahwa mereka yang kemungkinan besar akan diuntungkan dari kelemahan yang dinyatakan adalah perusahaan besar yang terkait dengan asuransi medis, bukan entitas kriminal yang didefinisikan secara konvensional (seperti peretas, pemeras, atau insinyur sosial)*:
‘Kepersistenan Safe Harbor meskipun keterbatasan yang diketahui bukanlah kelalaian tetapi fitur dari sistem yang dioptimalkan untuk likuiditas data daripada perlindungan pasien. Catatan klinis yang dihilangkan identitasnya mewakili pasar multi-miliar dolar, menciptakan disinsentif struktural bagi lembaga kesehatan untuk mengadopsi alternatif yang menjaga privasi yang mungkin mengurangi utilitas data atau memerlukan investasi infrastruktur yang mahal.
‘Ada urgensi untuk menyelidiki, memahami dan menangani disinsentif ini.’
Ini adalah makalah posisi, tanpa jawaban yang jelas; namun, para penulis menyarankan bahwa penelitian tentang de-identifikasi harus berubah ke kontrak sosial dan konsekuensi hukum dari pelanggaran, bukan solusi teknis (arguably pendekatan yang sama yang digunakan oleh DMCA untuk membatasi penyalinan karya yang dilindungi oleh hak cipta, ketika solusi teknis gagal).
Makalah baru ini berjudul Paradoks De-identifikasi: Kritik terhadap Safe Harbour HIPAA di Era LLM, dan berasal dari empat peneliti di New York University, dalam asosiasi dengan rumah sakit NYU Langone.
Metode
Untuk menguji teori mereka, para penulis mengembangkan serangan penghubungan dua tahap menggunakan 222.949 catatan klinis yang diidentifikasi dari 170.283 pasien yang dirawat di NYU Langone, dengan semua catatan dipisahkan oleh pasien menjadi 80% pelatihan, 10% validasi, dan 10% pengujian, untuk mencegah kontaminasi silang.
Untuk konteks, koleksi ini 3,34 kali lebih besar dari dataset MIMIC-IV, koleksi Catatan Kesehatan Elektronik (EHR) yang paling besar dan tersedia secara publik. Untuk alasan privasi, dataset Langone tidak akan dibuat tersedia dalam bentuk apa pun, meskipun pengguna dapat bereksperimen dengan prinsip-prinsip proyek melalui repositori GitHub yang menghasilkan data sintetis.
Enam atribut demografis dikurasi untuk mendekati trio re-identifikasi klasik yang diidentifikasi dalam pekerjaan sebelumnya yang berpengaruh: jenis kelamin biologis; lingkungan; tahun catatan; bulan catatan; pendapatan daerah; dan jenis asuransi:

Atribut demografis yang diinferensi dari catatan klinis NYU Langone yang dihilangkan identitasnya oleh UCSF philter, yang terdiri dari jenis kelamin biologis, lingkungan, tahun catatan, bulan catatan, pendapatan daerah, dan jenis asuransi, dipilih untuk mendekati trio identifikasi unik yang dijelaskan dalam ‘Simple Demographics Often Identify People Uniquely’.
Catatan tersebut dihilangkan identitasnya menggunakan UCSF philter sebelum pemodelan.
Sebuah model BERT-base-uncased dengan 110 juta parameter, yang telah dilatih sebelumnya pada teks domain umum untuk menghindari paparan sebelumnya terhadap data klinis, difine-tune secara terpisah untuk setiap atribut, menggunakan delapan NVIDIA A100 GPUs dengan memori 40GB, atau H100 GPUs, dengan memori 80GB, untuk hingga sepuluh epoch. Optimasi menggunakan AdamW, dengan tingkat pembelajaran 2×10−5, dan ukuran batch efektif sebesar 256
Generalisasi pada set pengujian yang dipegang keluar dievaluasi menggunakan Akurasi dan ROC-AUC terbobot, yang terakhir dipilih untuk mempertimbangkan ketidakseimbangan kelas di seluruh atribut.
Untuk membuat serangan lebih realistis, prediksi model tidak dianggap sebagai jawaban definitif tunggal. Sebaliknya, untuk setiap atribut, top k nilai yang paling mungkin dipertahankan, dan database pasien difilter untuk mencakup siapa saja yang cocok dengan ciri-ciri yang diprediksi. Ini menghasilkan daftar pendek kemungkinan identitas untuk setiap catatan, bukan satu tebakan.
Penilaian Risiko
Risiko re-identifikasi kemudian dihitung dalam dua tahap: mengukur seberapa sering pasien nyata muncul di dalam kelompok yang diidentifikasi; dan memperkirakan kemungkinan memilih orang yang tepat dari dalam kelompok tersebut.
Karena langkah terakhir menganggap seseorang hanya memilih nama secara acak dari kemungkinan cocok, angka yang dilaporkan adalah perkiraan yang hati-hati, dan seorang penyerang yang gigih kemungkinan dapat melakukan lebih baik.
Eksperimen ini menganggap akses ke populasi pasien penuh di database eksternal. Ini mencerminkan skenario terburuk tetapi realistis di mana sebuah lembaga besar atau broker data, dengan cakupan yang luas terhadap catatan pasien, mencoba penghubungan, bukan individu yang bertindak dengan informasi yang terbatas, lebih memperkuat sifat ancaman yang ditangani oleh para penulis dalam pekerjaan ini.
Hasil
Risiko diukur pada tiga tingkat: tingkat keberhasilan re-identifikasi kelompok menangkap seberapa sering pasien nyata muncul di dalam himpunan kandidat yang diidentifikasi oleh model, berdasarkan prediksi top k yang benar di seluruh atribut; re-identifikasi individu dari kelompok mengukur kemungkinan memilih orang yang tepat sekali kelompok telah diidentifikasi; dan probabilitas re-identifikasi unik mengalikan keduanya, menghasilkan kemungkinan keseluruhan untuk mengidentifikasi pasien secara unik dari catatan yang dihilangkan identitasnya:

Akurasi prediksi untuk jenis kelamin biologis, lingkungan, tahun, bulan, pendapatan, dan jenis asuransi, menunjukkan bahwa BERT-base-uncased yang dilatih pada catatan NYU Langone yang dihilangkan identitasnya oleh UCSF philter melebihi tebakan acak bahkan dengan 1.000 contoh pelatihan, dengan akurasi yang meningkat secara stabil seiring dengan pertumbuhan dataset hingga 178.000 sampel.
Dari hasil awal ini, para penulis mencatat:
‘Seperti yang digambarkan [di atas], catatan klinis yang dihilangkan identitasnya tetap rentan terhadap prediksi atribut. Di seluruh enam atribut dan semua rejim data (1k hingga 177k contoh), model bahasa (merah) secara konsisten [melebihi] baseline acak (abu-abu).
‘Hasil ini secara empiris [mendukung] bahwa proses de-identifikasi mempertahankan sinyal yang dapat dieksploitasi di dua jalur belakang.
‘Risiko privasi adalah segera: model mencapai kinerja di atas acak dengan hanya 1.000 contoh pelatihan. Sementara jenis kelamin biologis adalah atribut yang paling terbuka (dipulihkan dengan akurasi lebih dari 99,7%), bahkan sinyal yang paling lemah (bulan catatan) diprediksi dengan akurasi yang lebih baik dari acak.’
Dalam grafik hasil kedua di bawah, satu arah menunjukkan seberapa sering model memasukkan pasien nyata ke dalam daftar pendek. yang lain menunjukkan seberapa kecil daftar pendek itu:

Seberapa sering model memasukkan pasien nyata ke dalam daftar pendek, dipotong melawan seberapa mudah untuk memilih orang yang tepat dari daftar pendek – menunjukkan bahwa model bahasa menciptakan risiko re-identifikasi yang lebih tinggi daripada tebakan sederhana, mencapai 0,34%, dibandingkan dengan 0,0091% untuk baseline terkuat.
Model tersebut lebih sering memasukkan pasien nyata ke dalam daftar pendek, dan daftar pendek itu lebih kecil, maka risikonya lebih tinggi. Model bahasa para penulis melebihi tebakan kelas mayoritas sederhana pada kedua hal, pada puncaknya diterjemahkan ke dalam kemungkinan 0,34% untuk mengidentifikasi pasien secara unik – sekitar 37 kali lebih tinggi dari baseline terkuat.
Para penulis mencatat bahwa untuk pasien dengan riwayat medis yang tidak biasa atau identitas yang terpinggirkan, risiko de-identifikasi lebih tinggi, dan menyimpulkan dengan rekomendasi untuk evaluasi ulang serius terhadap standar Safe Harbor HIPAA:
‘[Standar] Safe Harbor HIPAA [beroperasi] pada definisi biner privasi: data adalah “diidentifikasi” atau “diidentifikasi”. HIPAA menganggap bahwa menghilangkan daftar token statis membuat data “aman”, secara efektif melepaskan narasi klinis dari identitas pasien.
‘Namun, analisis grafik kausal kami dan hasil empiris menunjukkan bahwa pemisahan ini adalah ilusi.
‘Catatan klinis secara inheren terjalin dengan identitas. Diagnosis medis pasien dan narasi yang tidak dihapus adalah produk langsung dari jalur kehidupan unik, menciptakan tanda tangan berdimensi tinggi yang dapat dipetakan kembali ke individu.’
Para penulis lebih lanjut menekankan bahwa aturan de-identifikasi saat ini fokus pada menghilangkan daftar tetap pengidentifikasi, sambil mengabaikan pola yang ditinggalkan dalam teks yang tersisa. Model bahasa besar, mereka mencatat, dibangun untuk mendeteksi dan menggabungkan pola tersebut – yang berarti bahwa detail klinis biasa dapat mulai berfungsi sebagai ‘pengidentifikasi tidak langsung’.
Makalah tersebut berakhir dengan sejumlah rekomendasi, termasuk ajakan untuk berhenti memfine-tune model pada data sintetis, atau ‘data yang di-deklasifikasi’, karena yang pertama mempertahankan risiko privasi sehubungan dengan data nyata yang digunakan untuk meminformasikannya; dan yang kedua menganggap bahwa standar perlindungan sebelumnya masih efektif.
Kesimpulan
Karena ‘pintu belakang’ seperti ini jelas paling menguntungkan bagi organisasi besar, seperti perusahaan asuransi – yang kemungkinan akan menggunakannya dengan cara yang terselubung, dan tanpa pengungkapan – pendekatan ‘blok hukum’ gaya DCMA (di mana akt pelanggaran perlindungan itu sendiri dilarang, terlepas dari teknologi yang digunakan) adalah pendekatan yang tidak efektif.
Sangat diketahui bahwa perusahaan asuransi ingin mendapatkan akses ke informasi seperti itu, dan bahwa, secara langsung atau melalui asosiasi dengan broker data, mereka memiliki akses luar biasa ke catatan kesehatan pribadi; dan semakin besar perusahaan, semakin besar basis data pelanggan asli mereka.
Oleh karena itu, jika ketentuan dan pengamanan HIPAA menjadi lebih seperti ‘perjanjian gentleman’ daripada hambatan yang efektif terhadap eksploitasi perusahaan, maka tinjauan ulang tampaknya sangat diperlukan.
* Konversi saya dari kutipan inline penulis ke tautan.
Dipublikasikan pertama kali pada hari Rabu, 11 Februari 2026












