Andersons vinkel

Användning av TV-serien “House” för att utveckla AI:s diagnostiska förmågor

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Även om diagnos av sällsynta sjukdomar är en särskilt svår utmaning för AI (liksom för människor), visar populära språkmodeller som ChatGPT och Gemini lovande prestanda när de tränas på diagnostiska fall från den populära medicinska dramaserien “House”.

 

Nästan hälften av alla studenter inom hälsovetenskap tittar regelbundet på medicinska dramaser som House, Grey’s Anatomy och Scrubs. Även om detta material bara kan användas för didaktiska ändamål med mycket filter och ram, på grund av risken för att sprida farlig desinformation, tenderar forskningsstandarden för dramaser med medicinska tillstånd att vara ganska hög (även om noggrannheten varierar mellan produktioner).

Det är inte förvånande att läkare ofta skapar, rådgiver om och/eller skriver manus för medicinska dramaser. I sådana fall är omfattande medicinsk kunskap fördelaktig inte bara för att korrekt förmedla medicinska problem, utan också för att komma med förslag på nya och intressanta handlingar.

En av de mest noggrant forskade medicinska showerna under den senaste “guldåldern” för TV är House (även känd som House MD), där den excentriska huvudkaraktären och den stora fluktuationen i den understödjande rollbesättningen, underhållande som de var, kom i andra hand till “sjukdomen veckan”.

I själva verket tillhandahöll House 176 diagnostiska fallstudier under sina åtta säsonger, trots att showen avslutades 2012. Redan 2015 användes den som ett undervisningsverktyg, med ett särskilt Dr. House-seminarium som gav bättre resultat jämfört med standardseminarier, även om deltagande inte gav några studentpoäng:

Från en studie 2015, olika skäl till varför medicinska studenter ville delta i ett diagnostiskt seminarium som utnyttjade information från TV-serien “House”. Seminarierna var schemalagda vid en medvetet utmanande tid, och förmedlade inga studiepoäng; trots dessa faktorer var initiativet en succé. Källa

House och AI

Även om användningen av House och andra olika TV-serier har visat sig i flera studier vara en effektiv hjälpmedel för inlärning för medicinska studenter, har detta tillvägagångssätt knappast försökts i en maskinlärandekontext.

Nu har en ny artikel från Pennsylvania State University gjort ett första försök i denna riktning, genom att utveckla en dataset som består av alla 176 användbara House-fallstudier, formulerade i en berättelsedriven diagnostisk struktur, och sedan utvärderade på populära LLM från OpenAI och Google.

Trots svårigheten i denna utmaning (som kännetecknar ett av de svåraste områdena inom biologiska vetenskaper), fann forskarna att nyare versioner av ChatGPT och Gemini visade förbättring jämfört med äldre versioner, vilket tyder på att utvecklingstrenden för modellutveckling sannolikt kommer att fungera effektivt i diagnostiska processer över tiden.

Artikeln säger:

‘Resultaten visar betydande variation i prestanda, från 16,48% till 38,64% noggrannhet, med nyare modellgenerationer som visar en 2,3 gånger förbättring. Medan alla modeller möter betydande utmaningar med sällsynta sjukdomar, tyder den observerade förbättringen över arkitekturer på lovande riktningar för framtida utveckling.

‘Vår utbildningsvaliderade benchmark etablerar baslinjeprestandamått för narrativ medicinsk resonemang och tillhandahåller en offentligt tillgänglig utvärderingsram för att främja AI-assisterad diagnostikforskning.’

Förutom att etablera prestandabaslinjer mot vilka framtida insatser kan utvärderas, noterar författarna att den nya dataseten – som de gör offentligt tillgänglig – löser bristen på narrativ process i befintliga medicinska dataset, och är lättillgänglig, till skillnad från den gatekeeper-kultur som finns i standardmedicinska dataset.

Det nya arbetet heter Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D, och kommer från fyra forskare vid Penn State*.

Data

För att fylla i sin dataset använde författarna offentligt tillgängligt material från den etablerade House Wiki-fansiten. Narrativt innehåll extraherades och destillerades med hjälp av den populära Beautiful Soup-ramverket, som kan extrahera strukturerad data från HTML-källan för webbsidor.

Efter att de grundläggande berättelserna hade skördats på detta sätt, användes fyra LLM för att omvandla utdata till standardiserad fallformulering. Modellerna som användes var GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; och Gemini 2.5 Pro. Slutligen tillämpades kvalitetsfilter för att säkerställa att dataseten hade lämplig klinisk detalj och överensstämmelse med den aktuella tillståndet i konsten inom medicinsk resonemang.

Författarna observerar att ‘föräldralösa’ sjukdomar (dvs. sällsynta sjukdomar) är underrepresenterade i standardmedicinska databaser; i vissa fall kan deras täckning i House-serien representera en ovanlig andel av deras totala befintliga täckning.

Författarna medger att nyttan av en datakälla av detta slag måste tempereras med försiktighet i fråga om den konstnärliga friheten som kan prioriteras ibland i utvecklingen av medicinska dramaser:

‘Medan vår dataset reflekterar begränsningarna i fiktivt innehåll, inklusive dramatisk överdrift och komplexa fallfokus, kan dessa egenskaper vara till nytta för utvärdering genom att tillhandahålla utmanande gränsfall som testar modellens robusthet.

‘Den pedagogiska valideringen av House M.D. av medicinska proffs ger förtroende för att de extraherade scenarierna innehåller kliniskt meningsfull information som är lämplig för AI-utvärdering.’

Exempel från datasetet som genererades för projektet. Källa [   https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download    ]

Exempel från datasetet som genererades för projektet.  Källa

Tester

För att utvärdera modellens noggrannhet vid narrativa diagnostiska uppgifter, utformade författarna en enkel pipeline som kombinerade promptgenerering, modellinferens och poängsättning.

De fyra ovannämnda LLM testades, med varje modell konfigurerad med temperatur inställd på noll (vilket säkerställde deterministisk snarare än “kreativ” utdata), och med en maximal token-längd på 1 500 – en tillåtelse som var avsedd att kunna hantera komplex diagnostisk resonemang. Inga ytterligare systemprompt användes för att ytterligare ramla in frågorna.

Prompten i sig följde en standardiserad strukturerad medicinsk fallpresentation – den typ av presentation som tittarna är mest bekanta med från medicinska dramaser när en ny patient/sjukdom introduceras, och en läkare sammanfattar en översikt för fördelarna med andra läkare som är närvarande (i praktiken dock för tittarnas fördel).

Varje prompt presenterade en klinisk berättelse som bestod av demografiska detaljer; en tidsaxel för symtom; relevant medicinsk historia; och tidiga diagnostiska fynd. Modellen instruerades att identifiera en enda primär diagnos, och att motivera sin slutsats med resonemang.

Varje modell genererade sin diagnostiska respons i ett enda steg, utan någon iterativ förfining; och svar samlades in under konsekventa förhållanden för alla 176 fall:

En illustrativ utvärderingsexempel, som visar en narrativ klinisk prompt och dess motsvarande grundtruth-diagnos, som användes för testning av Gemini 2.5 Pro. Källa [  https://arxiv.org/pdf/2511.10912  ]

En illustrativ exempel som visar en narrativ klinisk prompt och dess motsvarande grundtruth-diagnos, som användes för testning av Gemini 2.5 Pro. Källa

För metriker utvärderades förutsägelser med hjälp av en “fuzzig” strängmatchningsprocedur som var avsedd att ta hänsyn till tvetydighet i medicinsk terminologi. Tillvägagångssättet använde Python’s SequenceMatcher-bibliotek, med en likhetsgräns på 0,8, som började med exakt understrängsmatching och föll tillbaka till tokenvis jämförelse när det var nödvändigt. Noggrannhet beräknades som andelen fall som klassificerades korrekt under dessa förhållanden:

Den 'fuzziga matchnings'-arbetsflödet som användes av forskarna.

Den ‘fuzziga matchnings’-arbetsflödet som användes av forskarna.

Författarna noterar att fuzzy matching kan innebära att semantiskt identiska diagnoser som använder olika terminologi kan missas, men presenterar sitt tillvägagångssätt som det mest reproducerbara som kunde möta alla projektets begränsningar.

Resultat

Diagnostisk noggrannhet varierade kraftigt mellan modellerna, med Gemini 2.5 Pro som presterade bäst med 38,64%, följt av GPT-5 Mini med 36,93%, Gemini 2.5 Flash med 32,95% och GPT-4o Mini med 16,48%. Trots dessa skillnader kämpade alla modeller med kraven på diagnostiskt resonemang för sällsynta sjukdomar:

Resultat för diagnostisk noggrannhet över de fyra modellerna som testades.

Resultat för diagnostisk noggrannhet över de fyra modellerna som testades.

Författarna noterar också att prestanda varierade över säsonger av serien:

Varierande noggrannhet över de olika säsongerna av House, men utan någon uppenbar kurva eller tydlig anledning.

Varierande noggrannhet över de olika säsongerna av House, men utan någon uppenbar kurva eller tydlig anledning.

Artikeln säger:

‘Säsong 1 uppnådde den högsta noggrannheten med 56,52%, medan säsong 5 visade den lägsta med 20,83%. Denna variation tyder på att diagnostisk komplexitet varierar under serien, med senare säsonger som potentiellt innehåller mer utmanande sällsynta sjukdomsfall.

‘Men den relativt starka prestandan i säsong 8 (52,38%) indikerar att tidsmässig progression inte fullständigt förklarar noggrannhets skillnader, snarare verkar fallspecifik diagnostisk komplexitet vara den primära drivkraften.’

Modellerna presterade mer tillförlitligt när de diagnostiserade vanliga tillstånd med igenkännliga symtom, såsom meningit, hjärtinfarkt och lungemboli – men kämpade konsekvent med sällsynta sjukdomar som neurocysticercos och Erdheim-Chester-sjukdom, samt komplexa autoimmuna störningar som systemisk lupus erythematosus och sarkoidos. Prestanda sjönk också i toxikologiska fall som krävde länkning av exponeringshistoria till kliniska tecken.

Författarna föreslår att variationen i noggrannhet mellan modellerna pekar på meningsfulla skillnader i arkitektur och utbildningsstrategi, med den starkare prestandan hos GPT-5 Mini och Gemini 2.5 Pro som indikerar att nyare generationer av LLM har förbättrade resonemangsförmågor – även om deras resultat fortfarande avslöjar tydliga begränsningar i hantering av komplexa diagnostiska uppgifter.

Resultaten, menar de, tillhandahåller baslinjemått för narrativbaserad sällsynt sjukdomsdiagnos, och tyder starkt på att nuvarande språkmodeller börjar visa användbara medicinska resonemangsförmågor.

Hoppet i prestanda från GPT-4o Mini med 16,48% till Gemini 2.5 Pro med 38,64%, avslutar artikeln, signalerar stadig framsteg mot kliniskt tillämpliga AI-stödverktyg.

Medan forskarna medger att noggrannhetsnivåerna fortfarande är blygsamma, fokuserar benchmarken uteslutande på högt komplexa fall som regelbundet utmanar även utbildade läkare, och förmågan att korrekt identifiera diagnosen i nästan 40% av dessa svåra exempel pekar på äkta resonemangsförmåga, och lägger grunden för framtida förbättringar genom riktad finjustering, strukturerad medicinsk kunskapsintegration eller hybridresonemangstrategier.

Slutsats

Det finns uppenbara faror med att återanvända TV-seriens berättelser till verkliga medicinska dataset – även i fall där källmaterialet, som med House, har en hög nivå av kvalificerade medicinska bidrag och/eller tillsyn.

Det är intressant att notera att ett typiskt avsnitt av House effektivt fungerar som en sammanfattningsmaskin för en serie medicinska poster som kanske inte är direkt tillgängliga på internet för en genomsnittsperson, eller för datakällor som presenterar informationen på ett mer fragmenterat och icke-linjärt sätt.

Att ha en läkare som skriver manus för ett avsnitt, som ofta hände med House, kunde användas av forskare som en form av “godkännande” av innehållet; men detta ignorerar det faktum att konstnärliga överväganden kan ha påverkat presentationen av sjukdomen i avsnittet.

Detta lämnar data i tillståndet av så många andra potentiellt användbara datakällor för utbildning: i behov av ett färskt lager av dyrt, kvalificerat mänskligt tillsyn.

 

* Vänligen notera att denna mycket korta artikel inte följer den sedvanliga mallen, och jag har anpassat täckningen för att tillgodose detta.

Publicerad första gången måndagen den 17 november 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]