มุมมองของ Anderson

การที่ HIPAA ไม่สามารถหยุด AI จากการลบความเป็นนิรนามของข้อมูลผู้ป่วยได้

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
An AI-generated image featuring a crowd of businesspeople gathered around the hospital bed of a masked patient, trying to remove his mask. Z-Image Turbo + Qwen Edit V1, via Krita AI Diffusion.

แม้โรงพยาบาลจะลบชื่อและรหัสไปรษณีย์ออกแล้ว AI สมัยใหม่ก็ยังอาจระบุตัวผู้ป่วยได้ ข่าวนี้เป็นประโยชน์ต่อบริษัทประกันภัย แต่ไม่ใช่ต่อผู้รับบริการสุขภาพ

งานวิจัยใหม่จากมหาวิทยาลัยนิวยอร์กพบว่า บันทึกทางการแพทย์ในสหรัฐฯ ที่ลบชื่อและตัวระบุอื่นตาม HIPAA แล้ว ยังทำให้ผู้ป่วยเสี่ยงต่อการถูกระบุตัวตนอีกครั้ง เมื่อฝึกโมเดลภาษาด้วยเวชระเบียนจริงที่ยังมีข้อมูลครบ สัญญาณซึ่งเชื่อมโยงกับตัวตนยังคงอยู่ บางกรณีเพียงการวินิจฉัยก็ช่วยอนุมานย่านที่ผู้ป่วยอาศัยได้

งานวิจัยนี้วางความเสี่ยงดังกล่าวไว้ในบริบทของตลาดข้อมูลสุขภาพที่ผ่านการลบตัวตนซึ่งมีมูลค่าสูง โรงพยาบาลและนายหน้าข้อมูลขายหรือให้สิทธิใช้บันทึกทางคลินิกที่ทำความสะอาดแล้วแก่บริษัทยา บริษัทประกัน และผู้พัฒนา AI เป็นประจำ

ผู้เขียนท้าทายแม้แต่แนวคิดเรื่อง “การลบตัวตน” ที่อยู่ในมาตรการคุ้มครองผู้ป่วยของ HIPAA พวกเขาระบุว่า แม้จะปฏิบัติตาม Safe Harbor อย่างสมบูรณ์ บันทึกที่ลบตัวตนแล้วยังคงเชื่อมโยงกับตัวตนทางสถิติผ่านความสัมพันธ์เดียวกับที่ทำให้ข้อมูลมีประโยชน์ทางคลินิก ความขัดแย้งนี้จึงเป็นปัญหาเชิงโครงสร้าง ไม่ใช่เพียงปัญหาทางเทคนิค

นักวิจัยเห็นว่ากรอบการลบตัวตนที่สอดคล้องกับ HIPAA ในปัจจุบันยังเปิดช่องทางเบื้องหลังสองทางสำหรับการโจมตีแบบเชื่อมโยงข้อมูล

แผนภาพเหตุในงานวิจัยแสดงให้เห็นว่า การลบตัวตนแบบ HIPAA กำจัดคุณลักษณะอ่อนไหวโดยตรง แต่ยังคงความสัมพันธ์ที่ผูกกับตัวตนไว้ จึงอาจอนุมานผู้ป่วยผ่านข้อมูลทางการแพทย์และข้อมูลที่ดูเหมือนไม่อ่อนไหวได้ ที่มา

ในตัวอย่างของผู้เขียน การตั้งครรภ์ทำให้อนุมานเพศชีวภาพได้ ส่วนงานอดิเรกขี่ม้าแบบเดรสซาจบ่งชี้ว่าผู้ป่วยอาจอยู่ในย่านมั่งคั่ง แม้วันเกิดและรหัสไปรษณีย์ถูกลบไปแล้ว เนื้อหาที่เหลือยังทำให้อนุมานได้ว่าเธอเป็นผู้หญิงวัยผู้ใหญ่และประมาณสถานที่อยู่อาศัยของเธอ

ในการทดลองหนึ่ง บันทึกทางคลินิกมากกว่า 220,000 รายการจากผู้ป่วย NYU Langone 170,000 คนยังมีสัญญาณเพียงพอให้อนุมานลักษณะประชากรศาสตร์ หลังจากลบตัวระบุโดยตรงแล้ว

เจาะลึก

โมเดลที่ใช้ BERT ถูกปรับแต่งให้คาดการณ์คุณลักษณะหกอย่างจากบันทึกที่ลบตัวตนแล้ว โมเดลทำได้ดีกว่าการเดาสุ่มแม้ใช้ตัวอย่างฝึกเพียง 1,000 รายการ โดยระบุเพศชีวภาพได้แม่นยำกว่า 99.7% และแม้แต่สัญญาณที่อ่อนกว่า เช่น เดือนที่เขียนบันทึก ก็ยังคาดการณ์ได้ดีกว่าความบังเอิญ

เพื่อจำลองการโจมตีจริง คุณลักษณะที่อนุมานได้ถูกนำไปเชื่อมโยงกับฐานข้อมูลผู้ป่วย Langone ความเสี่ยงสูงสุดของการระบุตัวบุคคลเพียงรายเดียวอยู่ที่ 0.34% หรือราว 37 เท่าของเส้นฐานที่ใช้คลาสส่วนใหญ่ หากนำอัตรานี้ไปใช้กับประชากรสหรัฐฯ การโจมตีนี้เพียงอย่างเดียวอาจระบุตัวผู้ป่วยได้ประมาณ 800,000 คน

ผู้เขียนเรียกสิ่งนี้ว่า “ความย้อนแย้ง” เพราะความเสี่ยงส่วนใหญ่ไม่ได้มาจากข้อมูลสุขภาพที่ได้รับการคุ้มครองซึ่งถูกลบออก แต่มาจากเนื้อหาทางการแพทย์และเนื้อหาที่ถือว่าไม่อ่อนไหวจึงยังอนุญาตให้แบ่งปัน

แผนที่เขตต่าง ๆ ของนครนิวยอร์กแสดงความแตกต่างของอัตราการเสียชีวิตในโรงพยาบาล ระยะเวลาพักรักษาเฉลี่ย และระดับรายได้ ความแตกต่างตามพื้นที่เช่นนี้อาจทิ้งเบาะแสด้านตำแหน่งไว้แม้ในบันทึกที่ลบตัวตนแล้ว ดูตัวอย่างเพิ่มเติมได้จากบทความต้นฉบับ

บทความระบุว่ากฎ Safe Harbor ของ HIPAA ไม่ทำงานตามที่ผู้กำหนดนโยบายเคยคาดไว้ การลบตัวระบุ 18 รายการอาจตรงตามตัวบทกฎหมาย แต่ไม่สามารถหยุดโมเดลภาษาสมัยใหม่จากการอนุมานตัวตนด้วยข้อความทางการแพทย์ทั่วไป

ผู้ที่น่าจะได้ประโยชน์จากจุดอ่อนนี้มากที่สุดอาจเป็นบริษัทขนาดใหญ่ที่เกี่ยวข้องกับประกันสุขภาพ มากกว่าแฮ็กเกอร์หรือผู้ขู่กรรโชกตามความหมายทั่วไป ตลาดบันทึกทางคลินิกที่ลบตัวตนแล้วซึ่งมีมูลค่าหลายพันล้านดอลลาร์สร้างแรงจูงใจให้คงการไหลเวียนของข้อมูล และหลีกเลี่ยงวิธีคุ้มครองความเป็นส่วนตัวที่ลดประโยชน์ของข้อมูลหรือต้องลงทุนโครงสร้างพื้นฐานราคาแพง

งานนี้เป็นบทความเสนอจุดยืนและไม่ได้ให้คำตอบที่ชัดเจน อย่างไรก็ตาม ผู้เขียนเสนอให้งานวิจัยเรื่องการลบตัวตนหันไปให้ความสำคัญกับสัญญาทางสังคมและผลทางกฎหมายเมื่อเกิดการละเมิด แทนที่จะพึ่งวิธีแก้ทางเทคนิคเพียงอย่างเดียว บทความชื่อ Paradox of De-identification: A Critique of HIPAA Safe Harbour in the Age of LLMs จัดทำโดยนักวิจัยสี่คนจากมหาวิทยาลัยนิวยอร์กและโรงพยาบาล NYU Langone

วิธีการ

เพื่อทดสอบสมมติฐาน ผู้เขียนสร้างการโจมตีแบบเชื่อมโยงสองขั้นตอนด้วยบันทึกทางคลินิกที่มีตัวตน 222,949 รายการจากผู้ป่วย NYU Langone 170,283 คน บันทึกทั้งหมดถูกแบ่งตามผู้ป่วยเป็นชุดฝึก 80% ชุดตรวจสอบ 10% และชุดทดสอบ 10% เพื่อป้องกันการปนกันระหว่างชุด

ชุดข้อมูลนี้มีขนาดใหญ่กว่า MIMIC-IV ซึ่งเป็นชุดเวชระเบียนอิเล็กทรอนิกส์สาธารณะที่ใหญ่ที่สุดถึง 3.34 เท่า ด้วยเหตุผลด้านความเป็นส่วนตัว ชุดข้อมูล Langone จะไม่ถูกเผยแพร่ แต่โครงการมีคลังโค้ดสำหรับสร้างข้อมูลสังเคราะห์เพื่อให้ทดลองหลักการของวิธีนี้ได้

นักวิจัยเลือกคุณลักษณะประชากรศาสตร์หกอย่างให้ใกล้เคียงกับชุดสามตัวระบุแบบคลาสสิก ได้แก่ เพศชีวภาพ ย่านที่อยู่อาศัย ปีของบันทึก เดือนของบันทึก รายได้ในพื้นที่ และประเภทประกัน

คุณลักษณะหกอย่างที่อนุมานจากบันทึก NYU Langone ที่ลบตัวตนแล้ว ได้แก่ เพศชีวภาพ ย่านที่อยู่อาศัย ปีและเดือนของบันทึก รายได้ในพื้นที่ และประเภทประกัน ซึ่งเลือกมาเพื่อจำลองชุดตัวระบุเฉพาะจากงานวิจัยก่อนหน้า

บันทึกถูกลบตัวตนด้วย UCSF philter จากนั้นจึงปรับแต่ง BERT-base-uncased ขนาด 110 ล้านพารามิเตอร์แยกสำหรับแต่ละคุณลักษณะ โมเดลนี้ผ่านการฝึกล่วงหน้าด้วยข้อความทั่วไปเพื่อหลีกเลี่ยงการเคยเห็นข้อมูลทางคลินิก และใช้ GPU NVIDIA A100 40 GB จำนวนแปดตัว หรือ H100 80 GB ฝึกสูงสุดสิบ epoch

การปรับค่าใช้ AdamW อัตราการเรียนรู้ 2×10⁻⁵ และขนาดแบตช์ที่มีผล 256 ความสามารถในการใช้กับข้อมูลใหม่บนชุดทดสอบวัดด้วย Accuracy และ ROC-AUC แบบถ่วงน้ำหนัก เพื่อรองรับความไม่สมดุลของคลาส

เพื่อให้การโจมตีสมจริงขึ้น ระบบไม่ได้ถือว่าค่าที่โมเดลทำนายเป็นคำตอบเดียว แต่เก็บค่า k อันดับแรกที่มีโอกาสสูงสุดสำหรับแต่ละคุณลักษณะ แล้วกรองฐานข้อมูลหาผู้ป่วยทุกคนที่ตรงกับลักษณะเหล่านั้น จึงได้รายชื่อผู้สมัครสำหรับบันทึกแต่ละรายการ

การประเมินความเสี่ยง

ความเสี่ยงถูกคำนวณเป็นสองขั้นตอน ได้แก่ วัดว่าผู้ป่วยจริงปรากฏในรายชื่อผู้สมัครบ่อยเพียงใด และประเมินโอกาสเลือกคนที่ถูกต้องจากกลุ่มนั้น เพราะขั้นสุดท้ายสมมติว่าผู้โจมตีสุ่มเลือกชื่อหนึ่งจากผลลัพธ์ที่ตรงกัน ตัวเลขที่รายงานจึงเป็นค่าประมาณแบบระมัดระวัง และผู้โจมตีที่มีความมุ่งมั่นอาจทำได้ดีกว่า

การทดลองสมมติว่าผู้โจมตีเข้าถึงประชากรผู้ป่วยทั้งหมดในฐานข้อมูลภายนอก นี่เป็นสถานการณ์เลวร้ายที่สุดแต่สมจริงสำหรับสถาบันขนาดใหญ่หรือนายหน้าข้อมูลที่มีเวชระเบียนครอบคลุมกว้าง แทนที่จะเป็นบุคคลที่มีข้อมูลจำกัด

ผลลัพธ์

ความเสี่ยงวัดสามระดับ ได้แก่ อัตราที่ผู้ป่วยจริงอยู่ในกลุ่มผู้สมัคร โอกาสเลือกบุคคลที่ถูกต้องหลังพบกลุ่มนั้น และความน่าจะเป็นของการระบุตัวบุคคลเพียงรายเดียว ซึ่งเป็นผลคูณของสองค่าแรก

ความแม่นยำในการคาดการณ์เพศชีวภาพ ย่าน ปี เดือน รายได้ และประเภทประกัน BERT-base-uncased ที่ฝึกด้วยบันทึกซึ่งผ่าน UCSF philter ทำได้ดีกว่าการเดาสุ่มตั้งแต่ตัวอย่าง 1,000 รายการ และแม่นยำขึ้นอย่างต่อเนื่องเมื่อข้อมูลเพิ่มถึง 178,000 รายการ

ในคุณลักษณะทั้งหกและทุกขนาดข้อมูลตั้งแต่ 1,000 ถึง 177,000 ตัวอย่าง โมเดลภาษาทำได้ดีกว่าเส้นฐานแบบสุ่มเสมอ ผลนี้ยืนยันว่ากระบวนการลบตัวตนยังคงสัญญาณที่ใช้ประโยชน์ได้ผ่านช่องทางเบื้องหลังสองทาง ความเสี่ยงเกิดขึ้นทันที: เพศชีวภาพเปิดเผยมากที่สุดด้วยความแม่นยำกว่า 99.7% และแม้แต่เดือนของบันทึกก็ยังคาดการณ์ได้ดีกว่าการสุ่ม

กราฟเปรียบเทียบความถี่ที่รายชื่อผู้สมัครมีผู้ป่วยจริงกับความง่ายในการเลือกคนที่ถูกต้อง โมเดลภาษาสร้างความเสี่ยงรวมสูงกว่าการเดาอย่างง่าย โดยแตะ 0.34% เทียบกับ 0.0091% ของเส้นฐานที่แข็งแรงที่สุด

ยิ่งผู้ป่วยจริงปรากฏบ่อยและรายชื่อสั้นลง ความเสี่ยงก็ยิ่งสูง ที่จุดสูงสุด โมเดลสร้างโอกาสระบุตัวบุคคลเพียงรายเดียว 0.34% สูงกว่าเส้นฐานที่ดีที่สุดราว 37 เท่า ผู้ป่วยที่มีประวัติทางการแพทย์หายากหรือมีอัตลักษณ์ชายขอบเผชิญความเสี่ยงสูงกว่าอีก

ผู้เขียนเรียกร้องให้ประเมิน Safe Harbor ใหม่อย่างจริงจัง HIPAA ใช้คำจำกัดความแบบทวิภาคว่าข้อมูลมีตัวตนหรือถูกลบตัวตนแล้ว และสมมติว่าการลบรายการโทเคนคงที่จะตัดเรื่องราวทางคลินิกออกจากตัวตน แต่การวิเคราะห์เหตุและผลและผลทดลองชี้ว่าการแยกนี้เป็นเพียงภาพลวงตา การวินิจฉัยและเรื่องราวที่ไม่ถูกลบเป็นผลจากเส้นทางชีวิตเฉพาะของบุคคล จึงก่อเป็นลายเซ็นหลายมิติที่เชื่อมกลับไปยังเจ้าของได้

กฎปัจจุบันเน้นลบตัวระบุชุดคงที่ แต่ละเลยรูปแบบที่เหลือในข้อความ ขณะที่โมเดลภาษาขนาดใหญ่ถูกสร้างมาเพื่อตรวจหาและรวมรูปแบบเหล่านี้ ทำให้รายละเอียดทางคลินิกธรรมดาเริ่มทำหน้าที่เป็น “ตัวระบุทางอ้อม”

ข้อเสนอแนะยังรวมถึงการไม่ถือว่าการปรับแต่งด้วยข้อมูลสังเคราะห์หรือข้อมูลที่ “ยกเลิกชั้นความลับ” เป็นทางแก้อัตโนมัติ เพราะข้อมูลสังเคราะห์อาจยังรักษาความเสี่ยงจากข้อมูลจริงที่ใช้สร้างมัน ส่วนข้อมูลที่ยกเลิกชั้นความลับตั้งอยู่บนสมมติฐานว่ามาตรฐานคุ้มครองเดิมของ HIPAA ยังมีประสิทธิภาพ

สรุป

เนื่องจากช่องทางเบื้องหลังลักษณะนี้เป็นประโยชน์ต่อองค์กรใหญ่ เช่น บริษัทประกันภัย มากที่สุด กำแพงทางกฎหมายแบบ DMCA ที่ห้ามการหลบเลี่ยงมาตรการป้องกันโดยไม่คำนึงถึงเทคโนโลยีอาจไม่มีประสิทธิภาพเพียงพอ หากการใช้ประโยชน์เกิดขึ้นอย่างลับ ๆ และไม่เปิดเผย

บริษัทประกันภัยมีแรงจูงใจที่จะเข้าถึงข้อมูลประเภทนี้ และทั้งโดยตรงหรือผ่านนายหน้าข้อมูล บริษัทเหล่านี้มีระดับการเข้าถึงเวชระเบียนส่วนตัวที่สูงอยู่แล้ว ยิ่งบริษัทใหญ่ ฐานข้อมูลลูกค้าของตนก็ยิ่งกว้าง หากข้อจำกัดของ HIPAA กำลังกลายเป็น “ข้อตกลงสุภาพบุรุษ” มากกว่ากำแพงที่มีประสิทธิภาพต่อการแสวงหาประโยชน์ของบริษัท ก็ถึงเวลาทบทวนอย่างจริงจัง

* การอ้างอิงในเนื้อหาของผู้เขียนถูกแปลงเป็นลิงก์เมื่อจำเป็น

เผยแพร่ครั้งแรกวันพุธที่ 11 กุมภาพันธ์ 2026

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai