Anderson의 관점
‘하우스’ 드라마를 이용한 AI의 진단 능력 개발

희귀병 진단은 AI에게도 인간에게도 특히 어려운 도전이지만, 인기 있는 언어 모델인 ChatGPT와 Gemini는 인기 있는 의학 드라마 ‘하우스’의 진단 사례에 대한 훈련에서 약속하는 성능을 보여주고 있습니다.
건강 과학 학생 중 거의 절반이 의학 드라마인 하우스, 그레이 아나토미, 스크럽스를 정기적으로 시청합니다. 이러한 종류의 자료는 많은 필터링과 프레임워크가 필요하기 때문에 정보를 전달하는 데만 사용할 수 있지만, 의학적 조건을 특징으로 하는 드라마의 연구 표준은 khá 높습니다(그러나 정확도는 제작에 따라 다르다).
의사들은 종종 TV 의학 드라마를 제작하거나, 조언하거나, 쓰기 때문에, 이러한 경우에는 의학적 지식이 많을수록 의학적 문제를 정확하게 전달하고, 새로운 및 흥미로운 스토리 라인을 제안하는 데 유리합니다.
최근 ‘골든 에이지’의 가장 연구가 잘 된 의학 드라마 중 하나는 하우스(aka 하우스 MD)입니다. 여기서 주인공의 특이성과 지원 캐릭터의 큰 변동은 ‘질병의 주’에 비해 두 번째로 중요했습니다.
사실, 8시즌 동안 방영된 177개의 에피소드 중 하우스는 176개의 진단 사례 연구를 제공했습니다. 이 쇼는 2012년에 끝났지만, 2015년까지 이미 교육 도구로 사용되었습니다. 특수 Dr. 하우스 세미나는 표준 세미나보다 더 좋은 결과를 보여주었습니다. 학생들은 크레딧을 받지 못했지만, 세미나에 참석했습니다.
![2015년 연구에서 의학 학생들이 '하우스' TV 쇼 정보를 사용한 진단 세미나에 참석하기 원하는 다양한 이유. 출처 [ https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]](https://www.unite.ai/wp-content/uploads/2025/11/house-seminar.jpg)
2015년 연구에서 의학 학생들이 ‘하우스’ TV 쇼 정보를 사용한 진단 세미나에 참석하기 원하는 다양한 이유. 세미나는 의도적으로 어려운 시간에 예정되었으며, 학점을 제공하지 않았지만, 이니셔티브는 성공적이었습니다. 출처
하우스와 AI
의학 드라마를 사용하여 학습을 보조하는 것은 여러 연구에서 입증된 효과적인 방법이지만, 기계 학습 контек스트에서 이러한 접근 방식은 아직 시도되지 않았습니다.
펜실베니아 주립 대학의 새로운 논문은 이 방향으로 초기 연구를 수행했으며, 176개의 하우스 사례 연구를 특징으로 하는 데이터 세트를 개발하여, 나레이티브 驅動 진단 구조로 평가하고, OpenAI와 Google의 인기 있는 LLM을 평가했습니다.
尽管 이 도전이 어려웠지만(이것은 생물학의 가장 어려운 분야 중 하나입니다), 연구자들은 ChatGPT와 Gemini의 최신 버전이 이전 버전보다 향상된 성능을 보여주었으며, 모델 개발의 진화 트렌드는 시간이 지남에 따라 진단 프로세스에 효과적으로 기울어질 것이라고 나타났습니다.
논문은 다음과 같이 말합니다:
‘결과는 16.48%에서 38.64%까지의 정확도에서 상당한 변화를 보여주며, 최신 모델 세대는 2.3배의 향상을 보여줍니다. 모든 모델은 희귀병 진단에 대한重大한 도전을 직면하지만, 관찰된 향상은 향후 개발에 대한 약속하는 방향을 제시합니다. ‘
‘우리의 교육적으로 검증된 벤치마크는 내러티브 의학적推論을 위한 기준 성능 지표를 설정하고, AI 지원 진단 연구를 발전시키기 위한 공개적으로 접근 가능한 평가 프레임워크를 제공합니다.’
새로운 데이터 세트는 기존 의학 데이터 세트의 내러티브 프로세스의 부족을 해결하며, 쉽게 접근할 수 있으며, 표준 의학 데이터 세트의 게이트 킵 문화와 대조적으로 공개적으로 제공됩니다.
새로운 연구는 Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D로 제목이 붙여졌으며, 펜 스테이트의 4명의 연구자에 의해 수행되었습니다.
데이터
데이터 세트를 채우기 위해, 저자들은 잘 알려진 하우스 위키 팬 사이트의 공개 자료를 사용했습니다. 내러티브 콘텐츠는 Beautiful Soup 프레임워크를 사용하여 추출 및 정제되었습니다.
기본 내러티브가 이렇게 수집된 후, 4개의 LLM을 사용하여 출력을 표준화된 사례 형식으로 변환했습니다. 사용된 모델은 GPT-4o 미니, GPT-5 미니, Gemini 2.5 플래시, Gemini 2.5 프로였습니다. 마지막으로, 품질 필터링을 적용하여 데이터 세트가 적절한 임상 세부 사항과 최신 의학적推論의 상태와 일치하는지 확인했습니다.
저자들은 ‘고아’ 질병(희귀병)이 표준 의학 데이터베이스에서 과소 대표된다는 것을 관찰했습니다. 어떤 경우에는 하우스 쇼에서 이러한 질병의 커버리지가 전체 커버리지의 비정상적으로 높은 비율을 나타낼 수 있습니다.
저자들은 이러한 종류의 데이터 소스의 유용성이 예술적 자유도에 대한주의와 함께 다루어져야 한다는 것을 인정합니다:
‘우리의 데이터 세트는 허구 콘텐츠의 한계를 반영하지만, 이러한 특징은 모델의 강건성을 테스트하는 어려운 에지 케이스를 제공함으로써 평가에 유리할 수 있습니다.’
‘의학 전문가에 의한 하우스 MD의 교육적 검증은 추출된 시나리오가 AI 평가에 적합한 임상적으로 의미 있는 정보를 포함한다는 것을 보장합니다.’
![프로젝트를 위해 생성된 데이터 세트의 예시. 출처 [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
프로젝트를 위해 생성된 데이터 세트의 예시. 출처
테스트
내러티브 진단 작업에서의 모델 정확도를 평가하기 위해, 저자들은 프롬프트 생성, 모델 추론, 및 스코어링을 결합한 단순한 파이프라인을 설계했습니다.
4개의 LLM이 테스트되었으며, 각 모델은 0(결정론적 출력을 보장함)으로 설정된 온도와 1,500 토큰의 최대 길이로 구성되었습니다. 추가 시스템 프롬프트는 사용되지 않았습니다.
프롬프트 자체는 의학적 사례 프레젠테이션 형식을 따랐습니다. 각 프롬프트는 인구 통계적 세부 사항, 증상 타임라인, 관련 의료 기록, 및 초기 진단 결과를 포함하는 임상 내러티브를 제시했습니다. 모델은 주요 진단을 식별하고, 그 결론을 이유로 제시하도록 지시받았습니다.
각 모델은 일회성으로 진단 응답을 생성했으며, 반복적인 개선 없이 응답이 수집되었습니다.

Gemini 2.5 Pro 테스트에 사용된 내러티브 임상 프롬프트 및 해당 그라운드 트루스 진단의 예시. 출처
메트릭으로, 예측은 Python의 SequenceMatcher 라이브러리를 사용하여 ‘模糊’ 문자열 매칭 절차로 평가되었습니다. 접근 방식은 0.8의 유사성 임계값으로 시작하여 정확한 하위 문자열 매칭에서 시작하여 필요한 경우 토큰별 비교로 돌아갔습니다. 정확도는 이러한 조건下的 올바르게 분류된 사례의 비율로 계산되었습니다.

연구자들이 사용한 ‘模糊 매칭’ 워크플로우.
저자들은 ‘模糊 매칭’이 의미적으로 동일한 진단이 다른 용어를 사용하는 경우를 놓칠 수 있음을 지적하지만, 접근 방식은 프로젝트의 제약 조건을 모두 충족하는 가장 재현 가능한 접근 방식이라고 주장합니다.
결과
진단 정확도는 모델에 따라 크게 달랐으며, Gemini 2.5 Pro는 38.64%로最高의 성능을 보였으며, GPT-5 미니는 36.93%, Gemini 2.5 플래시는 32.95%, GPT-4o 미니는 16.48%를 기록했습니다. 이러한 차이에도 불구하고, 모든 모델은 희귀병의 진단에 어려움을 겪었습니다.

테스트된 4개의 모델의 진단 정확도 결과.
저자들은 또한 성능이 쇼의 시즌에 따라 달라진다는 것을 관찰했습니다.

다양한 시즌의 하우스에서 정확도에 대한 변화.
논문은 다음과 같이 말합니다:
‘1시즌은 56.52%의最高의 정확도를 달성했으며, 5시즌은 20.83%의 최저 정확도를 보였습니다. 이러한 변이는 시리즈 내에서 진단 복잡성이 다를 수 있음을 시사하며, 후반 시즌은 더 어려운 희귀병 사례를 특징으로 할 수 있습니다. ‘
‘그러나 8시즌의 비교적 강한 성능(52.38%)은 시간적 진행만이 정확도 차이를 완전히 설명하지 않는다는 것을 나타냅니다. 사례별 진단 복잡성이 주요 운전자로 나타납니다.’
모델은 일반적인 조건을 진단할 때 더 안정적인 성능을 보였으며, 이러한 조건에는 뇌수막염, 심근경색, 및 폐색塞 등이 포함되었습니다. 그러나 희귀병, 신경구균증, 에르하임-체스터병, 및 시스템성 루푸스 에리테마토서스와 같은 복잡한 자가 면역 질환을 진단할 때는 일관되게 어려움을 겪었습니다. 또한 독성학적 사례에서 노출 기록을 임상적 징후와 연결해야 할 때 성능이 저하되었습니다.
저자들은 모델 간의 정확도 차이가 아키텍처와 훈련 전략의 차이를 의미하며, GPT-5 미니와 Gemini 2.5 프로의 더 나은 성능은 최신 LLM 세대가 향상된 추론 능력을 가지며, 이러한 결과는 복잡한 진단 작업을 처리하는 데 여전히 한계가 있음을 보여줍니다.
저자들은 결과가 내러티브 기반 희귀병 진단을 위한 기준 메트릭을 제공하며, 현재 언어 모델이 의학적으로 유용한 추론 능력을 보여주기 시작하고 있음을 강하게 시사한다고 주장합니다.
저자들은 GPT-4o 미니의 16.48%에서 Gemini 2.5 프로의 38.64%로의 성능의 급격한 상승은 임상적으로 적용 가능한 AI 지원 도구로의 지속적인 진행을 나타낸다고 결론지었습니다.
연구자들은 정확도 수준이 여전히 MODEST하다고 인정하지만, 벤치마크는 일반적으로 훈련된 의사들에게도 도전적인 복잡한 사례에만 집중하고 있으며, 이러한 어려운 예 중 약 40%에서 진단을 올바르게 식별하는 능력은 진정한 추론 능력을 나타내며, 향후 개선에 대한 기초를 마련한다고 주장합니다.
결론
의학 드라마의 내러티브를 실제 의학 데이터 세트로 재사용하는 것은 명백한 위험이 있습니다. 이러한 소스 물질은 높은 수준의 의학적 기여와 감사를 가지고 있는 경우에도, 하우스와 같은 경우입니다.
의학 드라마의 한 에피소드는 효과적으로 일련의 의학적 진단을 요약하는 기계로 작용할 수 있으며, 이러한 정보는 일반적으로 인터넷에서 접근할 수 없거나, 非线性的 방식으로 제공되는 데이터 소스에서 찾을 수 있습니다.
의사가 실제로 에피소드의 시나리오를 작성하는 경우, 이는 내용에 대한 ‘승인’으로 사용될 수 있습니다. 그러나 이것은 예술적 자유도가 때때로 의학적 진단의 표현에 우선할 수 있다는 사실을 무시합니다.
이로 인해 데이터는 다른 잠재적으로 유용한 훈련 데이터 소스와 마찬가지로, 비싼, 자격 있는 인간의 감시가 필요합니다.
* 이 논문은 일반적인 템플릿을 따르지 않으며, 이를 고려하여 커버리지를 조정했습니다.
최초로 게시된 날: 2025년 11월 17일












