Andersonův úhel
Použití televizního seriálu ‘House’ pro rozvoj diagnostických schopností AI

Přestože je diagnostika vzácných onemocnění zvláště obtížným úkolem pro AI (stejně jako pro lidi), populární jazykové modely ChatGPT a Gemini ukazují slibné výsledky, když jsou trénovány na diagnostických případech z populárního lékařského dramatu ‘House’.
Téměř polovina všech studentů zdravotnických věd pravidelně sleduje lékařské dramaty, jako je House, Grey’s Anatomy a Scrubs. Přestože tento typ materiálu lze použít pouze pro didaktické účely s velkou filtrací a rámcováním, kvůli riziku šíření nebezpečných dezinformací, úroveň výzkumu pro dramaty s lékařskými podmínkami tenduje být bastante vysoká (i když přesnost se liší napříč produkčními společnostmi).
Nečekaně, lékaři často pocházejí, poradí na a/nebo píší televizní lékařské dramaty. V takových případech je rozsáhlé lékařské znalosti výhodné nejen pro přesné vyjádření lékařských problémů, ale také pro návrh nových a zajímavých příběhů.
Jedno z nejpečlivěji prozkoumaných lékařských pořadů nedávné ‘zlaté éry’ televize je House (také známý jako House MD), ve kterém excentricita hlavní postavy a obrovské fluktuace v podpůrném obsazení, zábavné jako tyto byly, byly druhotné vůči ‘nemoci týdne’.
Ve skutečnosti, z 177 epizod vysílaných po dobu osmi sezón, House poskytl 176 diagnostických studií. Přestože seriál skončil v roce 2012, do roku 2015 již byl používán jako pedagogický nástroj, s zvláštním Dr. House seminářem, který nabídl lepší výsledky ve srovnání se standardními semináři, i když účast na něm nebyla udělena žádné studentovi kredity:

Z výzkumu z roku 2015, různé důvody, proč studenti medicíny chtěli navštívit diagnostický seminář, který využívá informace z televizního seriálu ‘House’. Semináře byly naplánovány na záměrně náročné časy a nezískaly žádné kredity; přestože tyto faktory, iniciativa byla úspěšná. Zdroj
House a AI
Přestože použití House a dalších rozmanitých televizních pořadů bylo prokázáno v několika studiích jako účinný pomocný nástroj pro učení, pro studenty medicíny, málo z tohoto přístupu bylo dosud pokoušeno v kontextu strojového učení.
Nyní, nová práce z Pensylvánské státní univerzity provedla prvotní krok v tomto směru, vytvořením datové sady obsahující všechny 176 použitelné diagnostické studie House, formulované do narativně-řízené diagnostické struktury, následované hodnocením na populárních LLM z OpenAI a Google.
Přestože je tato výzva obtížná (což charakterizuje jednu z nejobtížnějších oblastí biologických věd), výzkumníci zjistili, že novější verze ChatGPT a Gemini ukázaly zlepšení oproti starším verzím, což naznačuje, že trend vývoje modelů bude pravděpodobně účinně směřovat do diagnostických procesů v průběhu času.
Práce uvádí:
‘Výsledky ukazují významné rozdíly v výkonu, pohybující se od 16,48 % do 38,64 % přesnosti, s novějšími generacemi modelů demonstrujícími 2,3násobné zlepšení. Přestože všechny modely čelí podstatným výzvám s diagnostikou vzácných onemocnění, pozorované zlepšení napříč architekturami naznačuje slibné směry pro budoucí vývoj.
‘Naše vzdělávací validace zavedla základní metriky výkonu pro narativní lékařské uvažování a poskytuje veřejně přístupný evaluační rámec pro pokrok v AI-pomáhající diagnostice výzkumu.’
Kromě stanovení základních metrik výkonu, autoři poznamenávají, že nová datová sada – kterou činí veřejně dostupnou – řeší nedostatek narativního procesu uvnitř stávajících lékařských datových sad, a je snadno dostupná, na rozdíl od kultury standardních lékařských datových sad.
Nová práce je nazvána Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D, a pochází od čtyř výzkumníků z Penn State*.
Data
Pro vytvoření datové sady, autoři použili veřejně dostupný materiál z dlouho zavedené House Wiki fandom stránky. Narativní obsah byl extrahován a destilován pomocí populárního Beautiful Soup frameworku, který může extrahovat strukturální data z HTML zdroje webových stránek.
Po extrahování základních narativů tímto způsobem, čtyři LLM byly použity k transformaci výstupu do standardizovaného formátu případů. Modely použité byly GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; a Gemini 2.5 Pro. Nakonec, byla aplikována kvalitativní filtrace, aby se zajistilo, že datová sada má odpovídající klinické detaily a soulad se současným stavem lékařského uvažování.
Autoři pozorují, že ‘sirotčí’ onemocnění (tj. vzácná onemocnění) jsou nedostatečně reprezentována ve standardních lékařských databázích; v určitých případech, jejich pokrytí v seriálu House může představovat neobvyklý procentní podíl jejich celkového stávajícího pokrytí.
Autoři uznávají, že užitelnost zdroje dat tohoto typu musí být temperována s opatrností ve vztahu k umělecké licenci, která může být upřednostňována v některých případech při vývoji lékařského dramatu:
‘Zatímco naše datová sada odráží omezení fiktivního obsahu, včetně dramatické exagerace a komplexních případů, tyto charakteristiky mohou prospět hodnocení tím, že poskytují náročné edge případy, které testují robustnost modelu.
‘Vzdělávací validace House M.D. lékařskými profesionály poskytuje důvěru, že extrahované scénáře obsahují klinicky významné informace vhodné pro hodnocení AI.’
![Příklad z datové sady vygenerované pro projekt. Zdroj [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]](https://www.unite.ai/wp-content/uploads/2025/11/dataset-examples.jpg)
Příklad z datové sady vygenerované pro projekt. Zdroj
Testy
Pro hodnocení přesnosti modelů na narativních diagnostických úkolech, autoři navrhli jednoduchý pipeline kombinující generaci podnětů, modelové inference a hodnocení.
Čtyři výše uvedené LLM byly testovány, s každým modelem nakonfigurovaným s teplotou nastavenou na nulu (zajišťující deterministické spíše než ‘kreativní’ výstup), a s maximální token délkou 1 500 – povolení navržené pro komplexní diagnostické uvažování. Žádné další systémové podněty nebyly použity pro další rámcování dotazů.
Podněty samy o sobě dodržovaly standardní strukturovaný formát prezentace lékařského případu – typ, se kterým diváci budou nejvíce familiarizováni z lékařských dramat, když je představen nový pacient/onemocnění a lékař shrnuje přehled pro ostatní lékaře (efektivně, ale pro diváky).
Každý podnět představoval klinický narativ skládající se z demografických údajů; časové osy symptomů; relevantní lékařské historie; a raných diagnostických zjištění. Model je informován, aby identifikoval jednu primární diagnózu a aby ospravedlnil své závěry uvažováním.
Každý model vygeneroval svou diagnostickou odpověď v jednom průchodu, bez jakékoli iterativní úpravy; a odpovědi byly shromážděny za konzistentních podmínek napříč všemi 176 případy:
![Ilustrativní evaluační příklad, ukazující narativní klinický podnět a jeho odpovídající ground truth diagnózu, jak je použito pro testování Gemini 2.5 Pro. Zdroj [ https://arxiv.org/pdf/2511.10912 ]](https://www.unite.ai/wp-content/uploads/2025/11/table-2-1.jpg)
Ilustrativní příklad ukazující narativní klinický podnět a jeho odpovídající ground truth diagnózu, jak je použito pro testování Gemini 2.5 Pro. Zdroj
Pro metriky, předpovědi byly hodnoceny pomocí ‘fuzzy’ string-matching procedury navržené pro účely zohlednění ambiguit v lékařské terminologii. Přístup používal Pythonův SequenceMatcher knihovnu, se similarity prahem 0,8, začínající s přesným substring matching a padající na token-wise comparison když je to nutné. Přesnost byla vypočtena jako proporce případů klasifikovaných správně za těchto podmínek:

The ‘fuzzy matching’ workflow použitý výzkumníky.
Autoři poznamenávají, že fuzzy matching může znamenat, že semanticky identické diagnózy, které používají odlišnou terminologii, mohou být vynechány, ale prezentují svůj přístup jako nejreproducibilnější, který mohl splnit všechny omezení projektu.
Výsledky
Diagnostická přesnost se výrazně lišila napříč modely, s Gemini 2.5 Pro, který dosáhl nejlepšího výsledku 38,64 %, následovaného GPT-5 Mini na 36,93 %, Gemini 2.5 Flash na 32,95 % a GPT-4o Mini na 16,48 %. Přestože tyto rozdíly existují, všechny modely bojovaly s nároky diagnostického uvažování pro vzácná onemocnění:

Výsledky pro diagnostickou přesnost napříč čtyřmi modely.
Autoři také poznamenávají, že výkon se lišil napříč sezónami seriálu:

Lišící se přesnost napříč různými sezónami House, ale bez zjevné křivky nebo jasného důvodu.
Práce uvádí:
‘První sezóna dosáhla nejvyšší přesnosti 56,52 %, zatímco pátá sezóna ukázala nejnižší 20,83 %. Tento rozdíl naznačuje, že diagnostická složitost se liší v průběhu série, s pozdějšími sezónami, které mohou obsahovat náročnější vzácná onemocnění.
‘Nicméně, relativně silný výkon v osmé sezóně (52,38 %) naznačuje, že časový posun sám o sobě plně neexplikuje rozdíly v přesnosti; případově specifická diagnostická složitost se zdá být primárním řidičem.’
Modely fungovaly spolehlivěji, když diagnostikovaly běžné podmínky s rozpoznatelnými symptomy, jako je meningitida, infarkt myokardu a plicní embolie – ale konzistentně bojovaly se vzácnými onemocněními, jako je neurocysticerkóza a Erdheim-Chesterova choroba, stejně jako komplexními autoimunitními poruchami, jako je systémový lupus erythematodes a sarkoidóza. Výkon také poklesl u toxikologických případů, které vyžadovaly propojení historie expozice s klinickými známkami.
Autoři sugerují, že variace v přesnosti mezi modely naznačuje významné rozdíly v architektuře a tréninkové strategii, s lepším výkonem GPT-5 Mini a Gemini 2.5 Pro, které naznačují, že novější generace LLM profitují z vylepšených uvažovacích schopností – přestože jejich výsledky stále odhalují zjevná omezení při zvládání složitých diagnostických úkolů.
Výsledky, které autoři prezentují, poskytují základní metriky pro narativní diagnostiku vzácných onemocnění, silně naznačují, že současné jazykové modely začínají ukazovat užitečné lékařské uvažovací schopnosti.
Skok v výkonu z GPT-4o Mini na 16,48 % na Gemini 2.5 Pro na 38,64 %, práce uzavírá, signalizuje stálý pokrok směrem k klinicky aplikovatelným AI nástrojům.
Přestože autoři uznávají, že úrovně přesnosti zůstávají skromné, benchmark se zaměřuje výhradně na vysoce komplexní případy, které běžně vyzývají i trénované lékaře, a schopnost správně identifikovat diagnózu v téměř 40 % těchto obtížných příkladů naznačuje skutečnou uvažovací kapacitu, vytvářející základ pro budoucí zlepšení prostřednictvím cíleného jemného ladění, integrace strukturovaných lékařských znalostí nebo hybridních uvažovacích strategií.
Závěr
Existují zjevná nebezpečí při opětovném použití televizních seriálových narativů do reálných lékařských datových sad – dokonce i v případech, jako je House, kde je zdrojový materiál vysoce kvalitní a má kvalifikované lékařské příspěvky a/nebo dohled.
Je zajímavé poznamenat, že typický díl House efektivně funguje jako shrnující stroj pro řadu lékařských záznamů, které nemusí být přímo přístupné na internetu pro průměrnou osobu, nebo pro zdroje dat, které prezentují informace ve více fragmentovaném a ne-lineárním způsobem.
Mít lékaře, který skutečně píše scénář pro díl, jak se často stalo s House, by mohl být použit výzkumníky jako určitá forma ‘schválení’ obsahu; nicméně toto ignoruje fakt, že umělecké úvahy mohly ovlivnit prezentaci onemocnění v dílu.
To zanechává data ve stavu mnoha dalších potenciálně užitečných zdrojů dat pro trénink: ve stavu, který potřebuje čerstvou vrstvu drahé, kvalifikované lidské kontroly.
* Pokud si všimnete, že tato velmi krátká práce nepodléhá obvyklému šablonu, a přizpůsobil jsem pokrytí, aby se přizpůsobilo tomu.
Poprvé publikováno v pondělí, 17. listopadu 2025












