Kąt Andersona

Wykorzystanie serialu “House” do rozwijania diagnostycznych możliwości sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Chociaż diagnozowanie rzadkich chorób jest szczególnie trudnym wyzwaniem dla sztucznej inteligencji (tak jak dla ludzi), popularne modele językowe ChatGPT i Gemini pokazują obiecujące wyniki, gdy są szkolone na przypadkach diagnostycznych z popularnego medycznego dramatu “House”.

 

Niemal połowa wszystkich studentów nauk o zdrowiu regularnie ogląda medyczne dramaty, takie jak House, Grey’s Anatomy i Scrubs. Chociaż ten rodzaj materiału może być używany tylko do celów dydaktycznych z dużą filtracją i ramowaniem, ze względu na ryzyko rozpowszechniania niebezpiecznych dezinformacji, poziom badań dla dramatów z udziałem chorób medycznych ma tendencję do bycia dość wysoki (chociaż dokładność różni się w zależności od produkcji).

Niespodziewanie, lekarze często pochodzą, doradzają i/lub piszą medyczne dramaty telewizyjne. W takich przypadkach, obszerna wiedza medyczna jest korzystna nie tylko do dokładnego przekazywania problemów medycznych, ale także do pomysłów nowych i interesujących fabuł.

Jednym z najbardziej starannie zbadanych medycznych seriali ostatniej “złotej ery” telewizji jest House (znany również jako House MD), w którym ekscentryczność postaci głównej i duże wahania w obsadzie aktorskiej, interesujące jak były, zajmowały drugie miejsce wobec “choroby tygodnia”.

W rzeczywistości, spośród 177 odcinków wyemitowanych w ciągu ośmiu sezonów, House zapewnił 176 starannie opracowanych studiów przypadków diagnostycznych. Chociaż serial zakończył się w 2012 roku, do 2015 roku był już używany jako narzędzie dydaktyczne, z specjalnym seminariem Dr. House, który oferował lepsze wyniki w porównaniu z standardowymi seminariami, nawet jeśli uczestnictwo nie dawało punktów studentom:

Z badań z 2015 roku, różne powody, dla których studenci medycyny chcieli uczestniczyć w seminariach diagnostycznych, które wykorzystywały informacje z serialu “House”. Seminaria były zaplanowane w celowo trudnym terminie i nie dawały punktów studenckich; pomimo tych czynników, inicjatywa była sukcesem. Źródło

House i sztuczna inteligencja

Chociaż użycie House i innych różnych seriali telewizyjnych zostało udowodnione w wielu badaniach jako skuteczne narzędzie pomocnicze do nauki, dla studentów medycyny, niewiele z tego podejścia zostało dotychczas spróbowane w kontekście sztucznej inteligencji.

Teraz nowy artykuł z Pennsylvania State University uczynił pierwszy krok w tym kierunku, opracowując zestaw danych zawierający wszystkie użyteczne 176 przypadki House, sformułowane w narracyjnej strukturze diagnostycznej, a następnie ocenione na popularnych modelach językowych OpenAI i Google.

Pomimo trudności tego wyzwania (które charakteryzuje się jako jeden z najtrudniejszych obszarów w biologicznych naukach), badacze stwierdzili, że nowsze wersje ChatGPT i Gemini pokazały poprawę w porównaniu ze starszymi wersjami, co wskazuje, że trend rozwoju modeli jest prawdopodobnie skuteczny w procesach diagnostycznych w czasie.

Artykuł stwierdza:

‘Wyniki pokazują znaczącą zmienność w wynikach, od 16,48% do 38,64% dokładności, przy czym nowsze generacje modeli pokazują 2,3-krotną poprawę. Chociaż wszystkie modele stają przed znaczącymi wyzwaniami w diagnozowaniu rzadkich chorób, zaobserwowana poprawa w architekturach wskazuje na obiecujące kierunki rozwoju w przyszłości.

‘Nasza edukacyjnie zwalidowana baza danych ustanawia podstawowe wskaźniki wydajności dla narracyjnego rozumowania medycznego i zapewnia publicznie dostępny framework oceny dla zaawansowanego badania diagnostyki wspomaganej przez sztuczną inteligencję.’

Ponad ustanowieniem wskaźników wydajności, autorzy zauważają, że nowy zestaw danych – który udostępniają publicznie – rozwiązuje brak narracyjnego procesu w istniejących zestawach danych medycznych i jest łatwo dostępny, w przeciwieństwie do kultury standardowych zestawów danych medycznych, które są ograniczone.

Nowa praca nowy artykuł nosi tytuł Ocena dużych modeli językowych w diagnozowaniu rzadkich chorób: studium przypadku z użyciem House M.D. i pochodzi od czterech badaczy z Penn State*.

Dane

Aby zaludnić ich zestaw danych, autorzy użyli publicznie dostępnych materiałów z długo utrwalonej House Wiki strony fandom. Treści narracyjne zostały wyodrębnione i destylowane za pomocą popularnego Beautiful Soup framework, który może wyodrębnić dane strukturalne z kodu HTML stron internetowych.

Po wyodrębnieniu podstawowych narracji w ten sposób, cztery modele językowe zostały użyte do transformacji danych wyjściowych w standardowe przypadki. Modele użyte to GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; i Gemini 2.5 Pro. Na koniec, zastosowano filtrowanie jakości, aby zapewnić, że zestaw danych miał odpowiednią zawartość kliniczną i zgodność z obecnym stanem sztuki w rozumowaniu medycznym.

Autorzy zauważają, że ‘sierociniec’ chorób (tj. rzadkie choroby) są niedoreprezentowane w standardowych bazach danych medycznych; w pewnych przypadkach, ich pokrycie w serialu House może stanowić nietypowy odsetek ich łącznej istniejącej pokrycia.

Autorzy przyznają, że użyteczność źródła danych tego typu musi być ostrożnie oceniona w odniesieniu do artystycznej licencji, która może być priorytetem w rozwoju dramatu medycznego:

‘Chociaż nasz zestaw danych odzwierciedla ograniczenia fikcyjnego contenu, w tym dramatyczne przesadzenie i złożone przypadki, te cechy mogą korzystać z oceny, dostarczając wymagające przypadki, które testują wytrzymałość modelu.

‘Edukacyjna walidacja House M.D. przez profesjonalistów medycznych daje pewność, że wyodrębnione scenariusze zawierają klinicznie istotne informacje odpowiednie dla oceny sztucznej inteligencji.’

Przykłady z zestawu danych wygenerowanego dla projektu. Źródło [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]

Przykłady z zestawu danych wygenerowanego dla projektu. Źródło

Testy

Aby ocenić dokładność modelu w narracyjnych zadaniach diagnostycznych, autorzy zaprojektowali prosty pipeline łączący generowanie prompty, inferencję modelu i ocenę.

Cztery powyższe modele językowe zostały przetestowane, z każdym modelem skonfigurowanym z temperaturą ustawioną na zero (co zapewnia deterministyczne zamiast “kreatywne” dane wyjściowe), a z maksymalną długością tokenu 1,500 – co pozwoliło na zaakceptowanie złożonego rozumowania diagnostycznego. Nie użyto dodatkowych systemowych prompty, aby dalej ramować zapytania.

Same prompty przestrzegały standardowego, strukturalnego formatu prezentacji przypadku medycznego – rodzaju, który widzowie są najbardziej zaznajomieni z medycznymi dramatami, gdy nowy pacjent/chór jest wprowadzony, a lekarz podsumowuje przegląd dla innych lekarzy obecnych (skutecznie, choć, dla widzów).

Każdy prompt składał się z narracji klinicznej, obejmującej dane demograficzne; chronologię objawów; istotną historię medyczną; oraz wczesne wyniki diagnostyczne. Model został poinstruowany, aby zidentyfikować pojedynczą podstawową diagnozę i uzasadnić swoje wnioski rozumowaniem.

Każdy model wygenerował swoją odpowiedź diagnostyczną w jednej przejściu, bez żadnego iteracyjnego udoskonalenia; i odpowiedzi zostały zebrane w sposób ciągły we wszystkich 176 przypadkach:

Ilustracyjny przykład oceny, pokazujący narracyjny prompt kliniczny i jego odpowiadającą podstawową diagnozę, używaną do testowania Gemini 2.5 Pro. Źródło [ https://arxiv.org/pdf/2511.10912 ]

Ilustracyjny przykład pokazujący narracyjny prompt kliniczny i jego odpowiadającą podstawową diagnozę, używaną do testowania Gemini 2.5 Pro. Źródło

Do metryk, przewidywania zostały ocenione przy użyciu procedury dopasowania ciągu “fuzzy” zaprojektowanej w celu uwzględnienia niejasności w terminologii medycznej. Zastosowano bibliotekę SequenceMatcher Pythona, z progiem podobieństwa 0,8, rozpoczynając od dokładnego dopasowania podciągu i przechodząc do porównania tokenów, gdy było to konieczne. Dokładność została obliczona jako proporcja przypadków sklasyfikowanych poprawnie w tych warunkach:

Przepływ pracy 'fuzzy matching' używany przez badaczy.

Przepływ pracy ‘fuzzy matching’ używany przez badaczy.

Autorzy zauważają, że dopasowanie “fuzzy” może oznaczać, że semantycznie identyczne diagnozy, które używają różnej terminologii, mogą być pomijane, ale przedstawiają swoje podejście jako najbardziej reprodukowalne, które może spełnić wszystkie ograniczenia projektu.

Wyniki

Dokładność diagnostyczna różniła się znacznie w zależności od modelu, z Gemini 2.5 Pro, który osiągnął najlepszy wynik na poziomie 38,64%, a następnie GPT-5 Mini z wynikiem 36,93%, Gemini 2.5 Flash z wynikiem 32,95%, i GPT-4o Mini z wynikiem 16,48%. Pomimo tych różnic, wszystkie modele miały trudności z wymaganiami rozumowania diagnostycznego dla rzadkich chorób:

Wyniki dla dokładności diagnostycznej w czterech modelach.

Wyniki dla dokładności diagnostycznej w czterech modelach.

Autorzy zauważają również, że wyniki różnią się w zależności od sezonów serialu:

Zmieniająca się dokładność w różnych sezonach House, ale bez żadnej oczywistej krzywej lub wyraźnego powodu.

Zmieniająca się dokładność w różnych sezonach House, ale bez żadnej oczywistej krzywej lub wyraźnego powodu.

Artykuł stwierdza:

‘Sezon 1 osiągnął najwyższą dokładność na poziomie 56,52%, podczas gdy sezon 5 pokazał najniższą na poziomie 20,83%. Ta zmienność sugeruje, że złożoność diagnostyczna różni się w całej serii, a późniejsze sezony mogą zawierać bardziej wymagające przypadki rzadkich chorób.

‘Jednak dość dobra wydajność w sezonie 8 (52,38%) wskazuje, że postęp czasowy nie w pełni wyjaśnia różnice w dokładności; wydaje się, że przypadkowa złożoność diagnostyczna jest głównym czynnikiem.’

Modele działały bardziej niezawodnie, gdy diagnozowały powszechne choroby z rozpoznawalnymi objawami, takimi jak zapalenie opon mózgowych, zawał serca i zator płucny – ale konsekwentnie miały trudności z rzadkimi chorobami, takimi jak neurocysticerkoza i choroba Erdheima-Chestera, a także złożonymi chorobami autoimmunologicznymi, takimi jak toczeń rumieniowaty i sarkoidoza. Wyniki również spadły w przypadkach toksykologicznych, które wymagały połączenia historii narażenia z objawami klinicznymi.

Autorzy sugerują, że zmienność dokładności między modelami wskazuje na istotne różnice w architekturze i strategii szkolenia, przy czym lepsza wydajność GPT-5 Mini i Gemini 2.5 Pro wskazuje, że nowsze generacje modeli językowych korzystają z ulepszonych możliwości rozumowania – chociaż ich wyniki nadal ujawniają wyraźne ograniczenia w radzeniu sobie z złożonymi zadaniach diagnostycznymi.

Wyniki, twierdzą autorzy, dostarczają podstawowe metryki dla narracyjnej diagnozy rzadkich chorób, silnie wskazując, że obecne modele językowe zaczynają pokazywać użyteczne zdolności rozumowania medycznego.

Skok w wydajności od GPT-4o Mini na poziomie 16,48% do Gemini 2.5 Pro na poziomie 38,64% wskazuje, że artykuł kończy się na stabilnym postępie w kierunku klinicznie stosowalnych narzędzi wspomagania sztucznej inteligencji.

Chociaż badacze przyznają, że poziomy dokładności pozostają skromne, benchmark koncentruje się wyłącznie na bardzo złożonych przypadkach, które rutynowo wyzwają nawet przeszkolonych lekarzy, a zdolność do poprawnej identyfikacji diagnozy w niemal 40% tych trudnych przypadków wskazuje na prawdziwą zdolność rozumowania, tworząc podstawę do przyszłych ulepszeń za pomocą ukierunkowanego doskonalenia, integracji wiedzy medycznej lub hybrydowych strategii rozumowania.

Wnioski

Istnieją oczywiste niebezpieczeństwa w ponownym wykorzystaniu narracji serialu telewizyjnego do tworzenia rzeczywistych zestawów danych medycznych – nawet w przypadkach, takich jak House, gdzie materiał źródłowy ma wysoki poziom wykwalifikowanych wkładów i/lub nadzoru medycznego.

Warto zauważyć, że typowy odcinek House skutecznie działa jako maszyna do podsumowywania serii wpisów medycznych, które mogą nie być bezpośrednio dostępne w Internecie dla przeciętnej osoby lub źródeł danych, które prezentują informacje w bardziej fragmentaryczny i nieliniowy sposób.

Mając lekarza, który naprawdę pisał scenariusz odcinka, jak to często miało miejsce w House, można by to uznać za pewnego rodzaju “pieczęć” na treści; jednak to ignoruje fakt, że względy artystyczne mogły mieć wpływ na prezentację choroby w odcinku.

To pozostawia dane w stanie wielu innych potencjalnie użytecznych źródeł danych do szkolenia: w potrzebie świeżej warstwy drogiej, wykwalifikowanej nadzoru ludzkiego.

 

* Proszę zauważyć, że ten bardzo krótki artykuł nie podąża za zwyczajową szablonem, a ja dostosowałem relacjonowanie, aby uwzględnić to.

Pierwotnie opublikowane w poniedziałek, 17 listopada 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai