Anderson의 관점
HIPAA는 AI가 환자 데이터를匿名化하지 못하는 경우가 증가하고 있다.

병원에서 이름과 우편번호를 제거한 후에도 현대적인 AI는 때때로 환자들이 누구인지 여전히 알아낼 수 있습니다. 보험 회사에게는 좋은 소식이지만 의료 수혜자에게는 그렇지 않습니다.
뉴욕 대학교의 새로운 연구에 따르면, 미국 환자의 의료 기록은 이름과 기타 HIPAA 식별자를 제거한 후에도 환자들이 재식별에 노출될 수 있습니다. 실제 환자 기록의 큰 корпус에서 AI 언어 모델을 훈련시킴으로써, 身分을 정의하는 세부 정보가 남아 있으며,บาง 경우 환자의 근처 지역을 진단만으로 추론할 수 있습니다.
이 새로운 연구는 탈 匿名화된 의료 데이터의 수익성 시장의 맥락에서 이 위험을 위치시킵니다. 여기서 병원과 데이터 브로커는 정화된 임상 기록을 제약 회사, 보험 회사 및 AI 개발자에게 정기적으로 판매 또는 라이선스합니다.
이 새로운 연구의 저자들은 실제로 ‘탈 匿명화’라는 개념에 도전합니다. 이는 HIPAA에 의해 설정된 환자 보호에서 제정되었습니다. 1997년에 매사추세츠 주지사 윌리엄 웰드의 의료 데이터가 匿명화되지 않은 경우입니다:
‘[就算] 완벽한 Safe Harbor 규정하에서, “탈 匿명화된” 기록은 여전히 身分과 통계적으로 연결되어 있습니다. 이는 임상적인 유용성을 확인하는 상관관계를 통해 이루어집니다. 이 충돌은 기술적인 것이 아니라 구조적인 것입니다.’
연구자들은 현재 HIPAA 규정 준수 탈 匿명화 프레임워크가 두 개의 백도어를 링크 공격에 사용할 수 있다고 주장합니다.

새로운 논문에서, HIPAA 스타일의 탈 匿명화가 명시적인 민감한 속성을 제거하는 동안 身分과 연결된 상관관계를 유지하는 것을 보여주는 인과 다이어그램. 이는 비민감한 정보와 의료 정보를 통해 환자 身分을 추론할 수 있습니다.
위의 예에서 우리는 환자가 임신한 것뿐만 아니라, 연구자들이 말하는 것처럼, 저소득층과 관련되지 않은 취미를 가지고 있다는 것을 볼 수 있습니다:
‘보호된 속성(DOB 및 ZIP 코드)이 편집되어 있지만, 우리는 여전히 임신으로 인해 환자가 성인 여성이라는 것을 추론할 수 있으며, 승마와 같은 취미로 인해 부유한 지역에 거주한다는 것을 알 수 있습니다.’
한 실험에서, 환자 식별자가 제거된 후에도, 170,000명의 NYU 랑고네 환자로부터 220,000개의 임상 기록은 여전히 身分을 추론할 수 있는 충분한 신호를 가지고 있었습니다.
Drilling Down
BERT 기반 모델은 미세 조정되어 6개의 속성을 탈 匿명화된 기록에서 예측했습니다. 그리고 논문은 1,000개의 훈련 예제만으로도 랜덤 추측을 초과하는 성능을 나타냅니다. 생물학적 성은 99.7% 이상의 정확도로 회복되었으며, 약한 신호인 기록 월도 랜덤 추측보다 높은 정확도로 예측되었습니다.
실험을 위해, 추론된 특성은 랑고네 데이터베이스에 대한 링크 공격에서 사용되었습니다. 이는 최대 0.34%의 고유 재식별 위험을 생성했습니다. 이는 단순한 다수결 기준선보다 약 37배 더 높습니다.
저자들은 이 문제를 ‘모순’으로 프레임합니다. 탈 匿명화된 환자 기록에 남아 있는 것은 명백히 탈 匿명화 공격의 기반이기 때문입니다:
‘대부분의 재식별 위험은 보호된 건강 정보에서 비롯되지 않고, 우리는 안전하다고 생각하는 비민감한 정보와 의료 내용에서 비롯됩니다.’

뉴욕시의 병원 사망률, 평균 입원 기간, 1인당 소득을 보여주는 지구별 지도, 이는 임상 결과와 부유함이 지역에 따라 어떻게 달라지는지 보여주며, 탈 匿명화된 의료 기록에서 위치와 연결된 단서를 남길 수 있습니다.
논문은 HIPAA의 Safe Harbor 규칙이 더 이상 정책입안자가 의도한 방식으로 작동하지 않는다고 주장합니다: 18개의 식별자를 제거하는 것은 법의 문자를 충족할 수 있지만, 저자들은 이것이 身分을 추론하는 것을 방지하지 않는다고 주장합니다. 그들은 시스템 자체가 구식 가정을 기반으로 구축되었으며, 이는 현재 언어 모델이 의료 텍스트에서 무엇을 추론할 수 있는지에 대한 것입니다.
이 연구는 또한 이러한 약점으로부터 이익을 얻을 가능성이 높은 대기업이 의료 보험과 관련된 회사일 것이라고 제안합니다. 즉, 정형적으로 정의된 범죄적实体(해커, 협박자, 사회 공학자 등)가 아니라:
‘Safe Harbor의 지속은 알려진 제한에도 불구하고, 이는 시스템의 오버사이트가 아니라 기능입니다. 데이터 유동성보다는 환자 보호를 위해 최적화된 시스템입니다. 탈 匿명화된 임상 기록은 수십억 달러의 시장입니다. 이는 의료 기관이 개인 정보 보호를 유지하는 대체 솔루션을 채택하거나 비싼 인프라 투자를 요구하는 것을 방지하는 구조적인 불이익을 생성합니다. ‘
‘이 불이익을 조심스럽게 조사하고, 이해하고, 해결해야 할 긴급성이 있습니다.’
이것은 명확한答案이 없는 위치 논문입니다. 그러나 저자들은 탈 匿명화 연구가 기술적인 솔루션보다는 사회적 계약과 위반의 법적 결과를 향해 전환해야 한다고 제안합니다(이는 DMCA가 지적 재산 보호된 작품의 복사를 제한하는 데 사용하는 것과 같은 접근방식입니다. 기술적인 솔루션이 실패했을 때).
Method
저자들은 자신의 이론을 테스트하기 위해 2단계 링크 공격을 개발했습니다. 이는 170,283명의 환자로부터 222,949개의 식별된 임상 기록을 사용했습니다. 모든 기록은 환자별로 80% 훈련, 10% 검증, 10% 테스트 세트로 분할되었습니다. 이는 교차 오염을 방지하기 위해 사용되었습니다.
이 컬렉션은 MIMIC-IV 데이터셋보다 3.34배 더 큽니다. 이는 가장 큰 공개적으로 사용 가능한 전자 건강 기록(EHR) 컬렉션입니다. 개인 정보 보호 이유로 인해 랑고네 데이터셋은 어떤 형태로도 공개되지 않을 것입니다. 그러나 사용자는 프로젝트의 원리를 GitHub 리포지토리를 통해 실험할 수 있습니다. 이 리포지토리는 합성 데이터를 생성합니다.
6개의 인구 통계 속성이 구식 재식별 트리오를 근사하기 위해 큐레이션되었습니다. 이는 영향력 있는 이전 연구에서 확인되었습니다: 생물학적 성; 이웃; 기록 연도; 기록 월; 지역 소득; 및 보험 유형:

UCSF philter 탈 匿명화된 NYU 랑고네 임상 기록에서 추론된 인구 통계 속성, 이는 생물학적 성, 이웃, 기록 연도, 기록 월, 지역 소득, 보험 유형을 포함합니다. 이는 ‘Simple Demographics Often Identify People Uniquely’ – https://dataprivacylab.org/projects/identifiability/paper1.pdf에 설명된 고유 식별자 트리오를 근사하기 위해 선택되었습니다.
기록은 UCSF philter를 사용하여 탈 匿명화되었습니다.
BERT-base-uncased 모델은 110백만 파라미터를 가지며, 일반 도메인 텍스트에서 사전 훈련되었으며, 임상 데이터에 대한 이전 노출을 피하기 위해 각 속성별로 별도로 미세 조정되었습니다. 8개의 NVIDIA A100 GPU 또는 80GB 메모리의 H100 GPU를 사용하여 최대 10개의 에포크까지 최적화되었습니다. AdamW를 사용하여 최적화되었으며, 2×10−5의 학습률과 256의 효과적인 배치 크기를 가졌습니다.
일반화는 정확도와 가중 ROC-AUC를 사용하여 평가되었습니다. 이는 클래스 불균형을 고려하기 위해 후자를 선택했습니다.
모델의 예측은 단일 확정적答案으로 처리되지 않았습니다. 대신, 각 속성에 대해, 최상위 k개 가장 가능성이 높은 값을 유지했으며, 환자 데이터베이스를 해당 예측된 특성을 가진 사람으로 필터링했습니다. 이는 각 기록에 대한 가능한 身分의 단축된 목록을 생성했으며, 단일 추측이 아닌 것입니다.
Risk Assessment
재식별 위험은 두 단계로 계산되었습니다: 실제 환자가 모델의 단축된 그룹 내에서 얼마나 자주 나타나는지 측정하고, 해당 그룹 내에서 올바른 사람을 선택할 확률을 추정했습니다.
마지막 단계는 단순히 이름을 임의로 모델의 단축된 목록에서 선택한다고 가정했기 때문에, 보고된 숫자는 보수적인 추정치이며, 결심된 공격자는 더 잘할 수 있습니다.
이 실험은 외부 데이터베이스에서 전체 환자 인구에 대한 접근을 가정했습니다. 이는 대규모 기관 또는 데이터 브로커가 환자 기록에 대한 광범위한 커버리지를 가지고 링크를 시도하는 실제 시나리오를 반영하며, 저자들이 해결하고 있는 위험의 특성을 더욱 강조합니다.
Results
위험은 세 가지 수준으로 측정되었습니다: 그룹 재식별 성공률은 모델의 단축된 후보군에 실제 환자가 얼마나 자주 포함되는지 측정했습니다. 이는 모든 속성에 대한 올바른 상위 k개 예측을 기반으로 했습니다. 개인 재식별은 해당 그룹이 식별된 후 올바른 사람을 선택할 확률을 측정했습니다. 고유 재식별 확률은 두 가지를 곱하여 탈 匿명화된 기록에서 환자를 고유하게 식별할 가능성을 산출했습니다:

생물학적 성, 이웃, 연도, 월, 소득, 보험 유형에 대한 예측 정확도, 이는 BERT-base-uncased 모델이 UCSF philter 탈 匿명화된 NYU 랑고네 기록에서 1,000개의 훈련 예제만으로도 랜덤 추측을 초과하는 것을 보여줍니다. 정확도는 데이터셋이 178,000 샘플로 증가함에 따라 점진적으로 개선됩니다.
이 초기 결과에 대해 저자들은 다음과 같이 말합니다:
‘그림에 나타난 대로, 탈 匿명화된 임상 기록은 속성 예측에 취약합니다. 모든 6개의 속성과 모든 데이터 체제(1k에서 177k 예제)에서 언어 모델(빨간색)은 일관되게 랜덤 기준선(회색)을 초과합니다. ‘
‘이 결과는 경험적으로 탈 匿명화 프로세스가 두 개의 백도어 경로에서 활용 가능한 신호를 유지한다는 것을 지원합니다. ‘
‘재식별 위험은 즉각적입니다. 모델은 1,000개의 훈련 예제만으로도 랜덤 성능을 초과합니다. 생물학적 성은 99.7% 이상의 정확도로 회복되었으며, 약한 신호인 기록 월도 랜덤 추측보다 높은 정확도로 예측되었습니다.’
두 번째 결과 그래프에서 한 방향은 모델이 실제 환자를 얼마나 자주 포함하는지 보여주며, 다른 방향은 해당 단축된 목록이 얼마나 작는지 보여줍니다:

모델의 단축된 목록에 실제 환자가 포함되는 빈도와 해당 목록에서 올바른 사람을 선택할 수 있는 쉬움을 플로팅하여, 언어 모델이 단순한 추측보다 더 높은 전체 재식별 위험을 생성하며, 이는 0.34%에 달하며, 이는 가장 강한 기준선의 0.0091%보다 약 37배 더 높습니다.
실제 환자가 포함되는 빈도와 단축된 목록의 크기가 클수록 위험은 더 높습니다. 저자의 언어 모델은 두 가지 측면에서 단순한 다수결 추측을 초과했습니다. 이는 0.34%의 고유 재식별 확률로 번역되며, 이는 가장 강한 기준선보다 약 37배 더 높습니다.
저자들은 특이한 의료 기록이나 소수자 身分을 가진 환자에게 재식별 위험이 더 높으며, HIPAA Safe Harbor 표준의 심각한 재평가를 추천합니다:
‘HIPAA Safe Harbor 표준은 이진적인 개인 정보 정의를 운영합니다. 데이터는 “식별된” 또는 “탈 匿명화된” 것입니다. HIPAA는 정적 토큰 목록을 제거하면 데이터가 “안전”하다고 가정합니다. 이는 임상 기록을 환자의 身分과 분리합니다. ‘
‘그러나 우리의 인과 그래프 분석과 경험적 결과는 이 분리가 환상임을 시사합니다. ‘
‘임상 기록은 본질적으로 身分과 얽혀 있습니다. 환자의 의료 진단과 비편집된 내러티브는 환자의 고유한 삶의 궤적의 직접적인 산물입니다. 이는 환자에게 고유한 서명을 생성하며, 이를 통해 환자 身分을 다시 매핑할 수 있습니다.’
저자들은 또한 현재 탈 匿명화 규칙이 정적인 식별자 목록을 제거하는 데 중점을 두고 있지만, 남아 있는 텍스트에 남겨진 패턴을 무시한다고 강조합니다. 대규모 언어 모델은 이러한 패턴을 감지하고 결합하도록 설계되었으며, 이는 임상 세부 정보가 간접 식별자로 작동할 수 있음을 의미합니다.
이 논문은 몇 가지 추천 사항을 포함하며, 그 중 하나는 합성 데이터 또는 ‘탈분류’ 데이터에 모델을 미세 조정하는 것을 중단해야 한다는 것입니다. 전자는 실제 데이터에 대한 개인 정보 보호 위험을 유지하며, 후자는 HIPAA 시대 이전의 보호 표준이 여전히 효과적이라고 가정합니다.
Conclusion
이러한 ‘백도어’가 명백히 대규모 기관, 즉 보험 회사와 같은 회사에게 가장 유익할 것이라는 사실은, 이러한 회사들이 이러한 백도어를 은밀하게 사용할 것이며, 이는 공개되지 않을 것임을 시사합니다. 따라서 DCMA 스타일의 ‘법적 블록’은 효과적인 접근방식이 아닙니다.
보험 회사들이 이러한 정보에 접근하고 싶어하는 것은 잘 알려져 있으며, 직접적으로 또는 데이터 브로커와의 연관성을 통해, 그들은 사적 의료 기록에 대한 접근을 가지고 있습니다. 또한, 더 큰 회사일수록, 그들의 네이티브 고객 데이터베이스가 더 클 것입니다.
따라서 HIPAA의 엄격함과 방어가 더 이상 효과적인 장벽이 아니라, 더 이상 신사 협정과 같은 것이 된다면, 검토는 시의적절합니다.
* 저자의 인라인 인용을 하이퍼링크로 변환한 것입니다.
2026년 2월 11일 처음 게시되었습니다.












