Andersons vinkel
Brug af ‘House’ TV-serien til at udvikle AI’s diagnostiske evner

Selvom diagnose af sjældne sygdomme er en særlig stor udfordring for AI (ligesom for mennesker), viser populære sprogmodeller som ChatGPT og Gemini lovende resultater, når de trænes på diagnostiske tilfælde fra den populære medicinske drama ‘House’.
Næsten halvdelen af alle studerende på sundhedsvidenskab ser regelmæssigt medicinske dramaer som House, Grey’s Anatomy og Scrubs. Selvom dette materiale kun kan bruges til didaktiske formål med en masse filtrering og rammer, på grund af risikoen for at sprede farlig fejlinformation, er standarden for forskning i dramaer med medicinske tilstande generelt ret høj (selvom nøjagtigheden varierer mellem produktioner).
Det er ikke overraskende, at læger ofte skaber, rådfører på og/eller skriver manuskripter til medicinske dramaer. I sådanne tilfælde er omfattende medicinsk domæneviden ikke kun fordelagtig for at konveyere medicinske problemer nøjagtigt, men også for at ideere forslag til nye og interessante historier.
En af de mest grundigt forskede medicinske shows i den seneste ‘gyldne æra’ for tv er House (også kendt som House MD), hvor ekscentriciteterne hos hovedpersonen og de store fluktuationer i den sekundære rollebesætning, underholdende som de var, kom i anden række efter ‘sygdommen ugen’.
I virkeligheden leverede House i løbet af sine 8 sæsoner og 177 afsnit 176 diagnostiske sagstudier. Selvom serien sluttede i 2012, var den allerede i 2015 i brug som et undervisningsværktøj, med et specielt Dr. House-seminar, der gav bedre resultater i sammenligning med standardseminarernes fag, selvom det ikke gav studiepoint.

House og AI
Selvom brugen af House og andre forskellige tv-serier er blevet bevist i flere studier til at være en effektiv hjælp til læring for medicinstuderende, er der ikke meget, der er forsøgt i denne retning inden for maskinlæring endnu.
Nu har en ny artikel fra Pennsylvania State University lavet en første forsøg i denne retning ved at udvikle en dataset, der indeholder alle 176 House-sagstudier, formuleret i en narrativ-dreven diagnostisk struktur, derefter evalueret på populære LLM’er fra OpenAI og Google.
Trods vanskeligheden ved denne udfordring (som kendetegner en af de mest vanskelige felter i biologiske videnskaber), fandt forskerne, at nyere versioner af ChatGPT og Gemini viste forbedring i forhold til ældre versioner, hvilket tyder på, at udviklingstrenden for modeller sandsynligvis vil være effektiv i diagnostiske processer over tid.
Artiklen siger:
‘Resultaterne viser betydelig variation i præcision, fra 16,48% til 38,64% nøjagtighed, med nyere modellergenerationer, der viser en 2,3 gange forbedring. Selvom alle modeller står over for betydelige udfordringer med sjældne sygdomme, tyder den observerede forbedring på tværs af arkitekturer på lovende retninger for fremtidig udvikling.
‘Vores uddannelsesvaliderede benchmark etablerer baselinepræstationsmål for narrativ medicinsk argumentation og giver en offentligt tilgængelig evalueringsskema for fremme af AI-assisteret diagnoseforskning.’
Ud over at etablere baselinepræstationsmål, som fremtidige bestræbelser kan vurderes på, bemærker forfatterne, at den nye dataset – som de gør offentligt tilgængelig – løser manglen på narrativ proces i eksisterende medicinske datasets og er let tilgængelig i modsætning til den lukkede kultur omkring standard medicinske datasets.
Det nye arbejde er titlen Evaluering af store sprogmodeller på sjældne sygdomme: En case-studie ved hjælp af House M.D. og kommer fra fire forskere fra Penn State*.
Data
For at befolke deres dataset brugte forfatterne offentligt tilgængeligt materiale fra den langvarige House Wiki-fandom-side. Narrativt indhold blev udtrukket og destilleret ved hjælp af den populære Beautiful Soup-ramme, der kan udtrække struktureret data fra HTML-kilden til web sider.
Efter at de grundlæggende narrativer var høstet på denne måde, blev fire LLM’er brugt til at omdanne outputtet til standardiseret sagformatering. Modellerne, der blev brugt, var GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; og Gemini 2.5 Pro. Til sidst blev kvalitetsfiltrering anvendt for at sikre, at datasettet havde passende klinisk detalje og tilpasning til den nuværende tilstand af kunsten i medicinsk argumentation.
Forfatterne bemærker, at ‘forældreløse’ sygdomme (dvs. sjældne sygdomme) er underrepræsenterede i standard medicinske databaser; i visse tilfælde kan deres dækning i House-serien repræsentere en usædvanlig høj procentdel af deres samlede eksisterende dækning.
Forfatterne indrømmer, at nyttigheden af en datakilde af denne type skal tempereres med forsigtighed i forhold til den kunstneriske frihed, der kan prioriteres på visse tidspunkter i udviklingen af medicinske dramaer:
‘Selvom vores dataset afspejler begrænsninger i fiktivt indhold, herunder dramatisk overdrivelse og komplekse sagfokus, kan disse karakteristika være til fordel ved evaluering, da de giver udfordrende edge-cases, der tester modellens robusthed.
‘Den uddannelsesmæssige validering af House M.D. af medicinske fagfolk giver tillid til, at de udtrukne scenarier indeholder klinisk meningsfuld information, der er egnet til AI-vurdering.’

Tests
For at evaluere modellens nøjagtighed på narrativ-diagnostiske opgaver designede forfatterne en simpel pipeline, der kombinerer promptgenerering, modelinference og scoring.
De fire ovennævnte LLM’er blev testet, hvor hver model var konfigureret med temperatur sat til nul (hvilket sikrer deterministisk i stedet for ‘kreativ’ output), og med en maksimal token-længde på 1.500 – en tilladelse designet til at kunne rumme komplekse diagnostiske overvejelser. Der blev ikke anvendt yderligere systemprompts til at ramme spørgsmålene yderligere.
Promptene selv fulgte en standardstruktureret medicinsk sagpræsentationsformat – den type, som seerne er mest fortrolige med fra medicinske dramaer, når en ny patient/sygdom bliver introduceret, og en læge summerer en oversigt for andre læger (effektivt, men for seernes skyld).
Hver prompt præsenterede en klinisk narrativ, der bestod af demografiske detaljer; en tidsplan over symptomer; relevante medicinsk historie; og tidlige diagnostiske fund. Modellen blev briefet til at identificere en enkelt primær diagnose og at begrunde sin konklusion med argumentation.
Hver model genererede sin diagnostiske respons i en enkelt omgang, uden nogen iterativ forbedring; og responserne blev indsamlet under ensartede betingelser på tværs af alle 176 tilfælde:

Til metrics blev forudsigelser evalueret ved hjælp af en ‘fuzzy’ string-matching-procedure designet til at tage højde for tvetydighed i medicinsk terminologi. Tilgangen anvendte Python’s SequenceMatcher-bibliotek, med en lighedstrøskel på 0,8, startende med nøjagtig understrengmatchning og faldende tilbage til token-vis sammenligning, når det var nødvendigt. Nøjagtighed blev beregnet som proportionen af tilfælde, der blev klassificeret korrekt under disse betingelser:

Forfatterne bemærker, at fuzzy matching kunne betyde, at semantisk identiske diagnoser, der bruger forskellig terminologi, kunne blive overset, men præsenterer deres tilgang som den mest reproducerbare, der kunne opfylde alle projektets begrænsninger.
Resultater
Diagnostisk nøjagtighed varierede bredt på tværs af modeller, med Gemini 2.5 Pro, der opnåede den bedste præstation på 38,64%, efterfulgt af GPT-5 Mini på 36,93%, Gemini 2.5 Flash på 32,95% og GPT-4o Mini på 16,48%. Trods disse forskelle kæmpede alle modeller med kravene til diagnostisk argumentation for sjældne sygdomme:

Forfatterne bemærker også, at præstationen varierede på tværs af seriens sæsoner:

Artiklen siger:
‘Sæson 1 opnåede den højeste nøjagtighed på 56,52%, mens sæson 5 viste den laveste på 20,83%. Denne variation tyder på, at diagnostisk kompleksitet varierer på tværs af serien, med senere sæsoner, der potentielt kan have mere udfordrende sjældne sygdomme.
‘Men den relativt stærke præstation i sæson 8 (52,38%) indikerer, at tidsmæssig progression alene ikke fuldt ud forklarer nøjagtighedsforskelle, men snarere sag-specifik diagnostisk kompleksitet synes at være den primære driver.’
Modellerne opførte sig mere pålideligt, når de diagnostiserede almindelige tilstande med genkendelige symptomer, såsom meningitis, myocardieinfarkt og lungeemboli – men kæmpede konsekvent med sjældne sygdomme som neurocysticercose og Erdheim-Chester-sygdom, samt komplekse autoimmune lidelser som systemisk lupus erythematosus og sarkoidose. Præstationen faldt også på toksikologiske tilfælde, der krævede en sammenkædning af eksponeringshistorie til kliniske tegn.
Forfatterne foreslår, at variationen i nøjagtighed mellem modellerne peger på betydelige forskelle i arkitektur og træningsstrategi, med den stærkere præstation af GPT-5 Mini og Gemini 2.5 Pro, der indikerer, at nyere generationer af LLM’er har forbedrede argumentationsfærdigheder – selvom deres resultater stadig afslører klare begrænsninger i håndtering af komplekse diagnostiske opgaver.
Resultaterne, som de hævder, giver baseline-mål for narrativ-baseret sjælden sygdomsdiagnose, og peger stærkt på, at nuværende sprogmodeller er begyndt at vise nyttige medicinske argumentationsfærdigheder.
Springet i præstation fra GPT-4o Mini på 16,48% til Gemini 2.5 Pro på 38,64% tyder, ifølge artiklen, på en stadig fremgang mod klinisk anvendelige AI-værktøjer.
Selvom forskerne indrømmer, at nøjagtighedsniveauerne stadig er beskedne, fokuserer benchmarket udelukkende på ekstremt komplekse tilfælde, der udfordrer selv trænede læger, og evnen til at korrekt identificere diagnosen i næsten 40% af disse svære eksempler peger på en reel argumentationsfærdighed, der lægger grundlag for fremtidige forbedringer gennem målrettede finjusteringer, struktureret medicinsk videnintegration eller hybrid argumentationsstrategier.
Konklusion
Der er nogle åbenlyse farer ved at genbruge tv-seriens narrativer til virkelige medicinske datasets – selv i tilfælde, hvor kildematerialet har et højt niveau af kvalificerede medicinske bidrag og/eller tilsyn.
Det er interessant at bemærke, at et typisk afsnit af House effektivt fungerer som en sammenfatningsmaskine for en række medicinske indlæg, der måske ikke er direkte tilgængelige på internettet for den gennemsnitlige person eller for datakilder, der præsenterer informationen på en langt mere fragmenteret og ikke-lineær måde.
At have en læge, der skriver manuskriptet til et afsnit, som ofte skete med House, kunne bruges af forskere som en slags ‘godkendelse’ af indholdet; men dette ignorerer faktum, at kunstneriske overvejelser kan have påvirket præsentationen af sygdommen i afsnittet.
Dette efterlader data i tilstanden af så mange andre potentielt nyttige datakilder til træning: i behov for et nyt lag af dyrt, kvalificeret menneskeligt tilsyn.
* Vær venlig at bemærk, at denne meget korte artikel ikke følger den sædvanlige skabelon, og jeg har tilpasset dækningen for at tilpasse dette.
Offentliggjort mandag, den 17. november 2025












