사상 리더
검증되지 않은 LLM과 헬스케어 규정 복잡성

산업 전반에 걸쳐 생성적 인공지능(GenAI)은 비교적 짧은 기간 내에 빠른 발전을 이루어 왔습니다. 이러한 발전은 기초 모델에 의해 주도되며, The California Report on Frontier AI Policy에서는 이를 “자원 집약적이며 개발에 상당한 양의 데이터와 컴퓨팅 파워가 필요하여 다양한 다운스트림 AI 애플리케이션을 구동할 수 있는 일반 목적 기술의 한 클래스”로 정의합니다.
이러한 일반 목적的大語言모델(LLM), 즉 Gemini 및 ChatGPT와 같은 모델은 데이터 분석, 글쓰기, 추론 등에서 인간의 인지 능력을 복제하고 초과하는 능력을 보여주고 있습니다. 특히 헬스케어 분야에서는 GenAI의 채택이 증가하고 있으며, 임상 진료와 행정 업무의 부담을 줄이고 운영을 가속화하며 임상 의사 결정 지원 등에 기술을 활용하고 있습니다.
그러나 기술이 약속하는 것만큼 헬스케어에서 GenAI의 채택은 책임감 있게 구현되지 않으면 규정 위험을 초래할 수 있습니다. 특히 일반 목적 LLM의 사용은 의료 기관이 완전히 이해해야 하는 특정 규정 우려를 초래합니다. 이러한 모델은 검증되지 않은 데이터 소스를 사용하거나 환자 건강 정보를 승인되지 않은 방식으로 활용하거나 편향 또는 부정확한 정보를 퍼뜨릴 수 있습니다.
환자 데이터 개인 정보를 보호하고 규정의 발전을 따라가며 비용이 많이 드는 위험을 최소화하기 위해 헬스케어 리더들은 “검증되지 않은” LLM 사용의 규정 “시간 폭탄”을 해제하기 위해 결단을 내릴 수 있어야 합니다.
헬스케어에서 일반 목적 LLM 사용의 현재 상태
헬스케어 전반에서 직원들은 행정 업무부터 환자 커뮤니케이션까지 일상 업무를 지원하기 위해 점점 더 많이 LLM을 활용하고 있습니다. 다중 모달 LLM은 또한 이러한 애플리케이션을 확장하여 텍스트, 이미지, 오디오를 쉽게 처리할 수 있는 능력으로 인해 더욱 확대되고 있습니다. 행정 지원 외에도 임상 작업을 지원하기 위해 기술을 활용하는 제공자의 증가도 보이고 있습니다.
이러한 모델은 이미 일부에서는 인상적인 결과를 보여주고 있으며, 여러 연구에서 LLM의 성능이 특정 영역에서 인간의 능력과 일치하거나 초과하는 것으로 나타났습니다. 예를 들어, GPT-4 모델은 전체 점수 86.7%로 미국 의사 면허 시험에 통과했습니다.
하이브리드 AI는 헬스케어에서 GenAI 사용에 대한 또 다른 새로운 접근 방식으로, 기계 학습(Machine Learning, ML)과 LLM을 결합하여 복잡한 분석을 처리하고 결과를 일반 언어로 번역합니다. 이 접근 방식은 LLM의 약점을 극복하고 강점을 발휘하도록 설계되었습니다. 에이전트 AI는 또한 자동화된 작업을 수행하는 데 사용되며, 환자 메시지에 응답하거나 약속을 예약하는 등의 작업을 수행할 수 있습니다.
그러나 이러한 기술의 잠재력은 또한 더 적극적인 거버넌스의 필요성을 강조합니다. 이러한 도구가 헬스케어 운영에 더 깊이 통합될수록 정확성, 안전성, 규정 준수를 보장하는 데 대한 배팅이 더 높아집니다.
헬스케어에서 일반 목적 LLM의 규정 위험
디지털 채택은 헬스케어에서 새로운 가능성을 열어주었지만, 동시에 주요 취약점을 노출시켰습니다. 예를 들어, 2023년 11월 1일부터 2024년 10월 31일까지 헬스케어 부문은 1,710건의 보안 사고를 경험했으며, 그 중 1,542건은 확인된 데이터 공개를 포함했습니다.
AI 시대는 데이터 개인 정보와 보안에 대한 새로운 복잡성을 추가합니다. 특히 헬스케어에서 일반 목적 LLM의 사용은 몇 가지 주요 규정 위험을 초래합니다:
위험 #1: 불투명한 개발은 지속적인 모니터링 또는 검증을 방해합니다
닫힌 모델은 투명성이 부족합니다. 개발 프로세스, 모델에 사용된 특정 데이터 소스, 업데이트가 어떻게 수행되는지 등에 대한 정보가 없습니다. 이러한 불투명성으로 인해 개발자와 연구자는 모델 내부를 조사하여 안전성 위험의 원인을 파악하거나 의사 결정 프로세스를 파악할 수 없습니다. 따라서 닫힌 LLM은 검증되지 않은 의료 데이터 소스를 사용하거나 안전성 취약점을 무시할 수 있습니다.
위험 #2: 환자 데이터 유출
LLM은 항상 비식별화된 환자 데이터를 사용하지 않습니다. 특수한 프롬프트 또는 상호 작용은 식별 가능한 건강 정보를 우발적으로 공개할 수 있습니다. 이는 잠재적인 HIPAA 위반을 초래할 수 있습니다.
위험 #3: 편향 및 부정확한 정보의 확산
한 실험에서 연구자들은 생물의학 모델의 지식 베이스에 일부 잘못된 사실을 주입했습니다. 모델의 출력에서 잘못된 정보가 전파되는 것을 발견했습니다. 이는 LLM이 잘못된 정보 공격에 취약하다는 것을 보여줍니다.
기초 모델의 결함은 모든 채택된 모델과 응용 프로그램에 의해 상속됩니다. 출력의 차이는 건강 불평등을悪화시킬 수 있습니다.
위험 #4: 규정 불일치
일반 목적 LLM의 사용은 HIPAA, GDPR 또는 발전하는 AI 관련 규정과 일치하지 않을 수 있습니다. 특히 벤더가 훈련 데이터를 검증할 수 없는 경우 이러한 위험은 더 커집니다. 이러한 위험은 헬스케어 기관 직원이 승인되지 않은 또는 모니터링되지 않은 AI 도구를 사용하거나 그림자 AI를 사용할 때 더욱 커집니다. IBM에 따르면, 조사된 조직의 20%는 그림자 AI 관련 보안 사고로 인해 침해를 겪었습니다.
궁극적으로, 헬스케어에서 일반 목적 LLM의 위험은 실제로 법적 조치, 명성 손상, 환자 신뢰 손실, 소송 비용 등 실질적인 결과를 초래할 수 있습니다.
최선의 관행: LLM 지침 및 고려 사항
책임감 있게 GenAI를 채택하기 위해, 헬스케어 리더들은 환자와 조직을 모두 보호하는 명확한 가이드를 설정해야 합니다. 다음 최선의 관행은 헬스케어 기관이 책임감 있는 AI 사용을 위한 기초를 마련하는 데 도움이 될 수 있습니다:
최선의 관행 #1: AI 기술을 신중하게 선택하십시오
벤더로부터 AI 기술 개발 및 사용된 데이터 소스에 대한 명확성을 요구하십시오. 전문가가 검증한 의료 콘텐츠만을 사용하고 의사 결정 프로세스가 투명하며 환자 건강 정보를 훈련에 사용하지 않는 도구를 우선적으로 선택하십시오.
최선의 관행 #2: 인간 중심의 안전 장치를 구축하십시오
임상 의사들이 AI 생성 출력을 검토하여 치료 결정에 영향을 미칠 수 있도록 하십시오. AI는 강력한 도구이지만, 환자 생명을 직접적으로影响하는 산업에서 임상 감독은 책임감 있는 사용과 AI 지원 정보의 정확성을 보장하는 데 핵심입니다.
최선의 관행 #3: 훈련 및 인력 준비
임상 의사와 직원들을 AI 사용의 이점과 위험에 대해 교육하십시오. 헬스케어 직원들은 복잡한 인력 부족과 고갈로 인해 어려움을 겪고 있습니다. AI 교육 과정을 단순화하면 추가적인 부담 없이 규정 준수를 보장하는 데 도움이 될 수 있습니다.
최선의 관행 #4: 거버넌스 문화를 구축하십시오
AI 솔루션의 안전성, 신뢰성, 규정 준수를 확인하기 위해 제3자 평가를 통합하십시오. 동시에, AI 사용, 승인, 모니터링을 정의하는 조직 전체적인 프레임워크를 구현하여 기술에 대한 신뢰를 강화하고 직원이 승인되지 않은 도구를 사용하지 않도록 합니다.
최선의 관행 #5: AI 관리에 대한 리더십과 협력
FDA 및 ONC의 지침과 발전하는 규정에 앞서기 위해 리더십과 협력하십시오. 규정 노력은 주 수준에서 나타나고 있습니다. 예를 들어, 캘리포니아는 프론티어 AI 투명성 법을 제정했으며, 이는 특히 헬스케어 환경에서 위험 공개, 투명성, 완화 등을 강조합니다. 또한 콜로라도 인공지능법 (CAIA)이 있으며, 이는 알고리즘적 차별을 방지하기 위한 것입니다.
최선의 관행 #6: 지속적인 모니터링 및 피드백 루프
헬스케어 환경에서 AI 사용은 “설정하고忘れる” 마음가짐으로 접근해서는 안 됩니다. 지속적인 모니터링을 설정하면 AI 도구의 정확성, 책임성, 규정 준수를 시간이 지남에 따라 보장하는 데 도움이 될 수 있습니다.
최선의 관행 #7: 감독 및 연구를 최적화하기 위한 파트너십
헬스케어 기관은 규제 기관 및 공공 부문과 파트너십을 맺어 감독을 최대화하고, 안전 표준에 대한 산업 관점을 기여하며, 전문 자원을 결합해야 합니다.
규정 리더십을 통해 신뢰 구축
헬스케어에서 AI 솔루션의 차별화는 전문 콘텐츠의 품질, 평가 프로세스의 무결성, 임상 워크플로에의 책임감 있는 통합에越来越 많이 의존할 것입니다. AI 채택의 다음 단계는 코드보다 규정 리더십에 더 많이 의존할 것입니다.
신뢰는 규정 준수만큼 중요합니다. 기술이真正로 효과적이기 위해서는 환자와 제공자가 AI가 안전하고 높은 품질의 윤리적인 치료와 일치한다는 것을 믿어야 합니다. 규정 리더십은 방어적인 조치만이 아니라 전략적인 이점입니다. 앞으로 보이는 조직이 초기에 가드레일을 설정하면, 유해한 사고가 발생하기 전에, AI 기반의 미래의 헬스케어에서 자신을 차별화할 수 있습니다.












