Andersons vinkel

Brug af ‘House’ TV-serien til at udvikle AI’s diagnostiske evner

mm
Føj Unite.AI til dine foretrukne kilder på Google
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Selvom diagnose af sjældne sygdomme er en særlig stor udfordring for AI (ligesom for mennesker), viser populære sprogmodeller som ChatGPT og Gemini lovende resultater, når de trænes på diagnostiske tilfælde fra den populære medicinske drama ‘House’.

 

Næsten halvdelen af alle studerende på sundhedsvidenskab ser regelmæssigt medicinske dramaer som House, Grey’s Anatomy og Scrubs. Selvom dette materiale kun kan bruges til didaktiske formål med en masse filtrering og rammer, på grund af risikoen for at sprede farlig fejlinformation, er standarden for forskning i dramaer med medicinske tilstande generelt ret høj (selvom nøjagtigheden varierer mellem produktioner).

Det er ikke overraskende, at læger ofte skaber, rådfører på og/eller skriver manuskripter til medicinske dramaer. I sådanne tilfælde er omfattende medicinsk domæneviden ikke kun fordelagtig for at konveyere medicinske problemer nøjagtigt, men også for at ideere forslag til nye og interessante historier.

En af de mest grundigt forskede medicinske shows i den seneste ‘gyldne æra’ for tv er House (også kendt som House MD), hvor ekscentriciteterne hos hovedpersonen og de store fluktuationer i den sekundære rollebesætning, underholdende som de var, kom i anden række efter ‘sygdommen ugen’.

I virkeligheden leverede House i løbet af sine 8 sæsoner og 177 afsnit 176 diagnostiske sagstudier. Selvom serien sluttede i 2012, var den allerede i 2015 i brug som et undervisningsværktøj, med et specielt Dr. House-seminar, der gav bedre resultater i sammenligning med standardseminarernes fag, selvom det ikke gav studiepoint.

Fra en studie i 2015, diverse årsager til, at medicinstuderende ønskede at deltage i et diagnostisk seminar, der udnyttede information fra 'House' TV-serien. Kilde [  https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]

Fra en studie i 2015, diverse årsager til, at medicinstuderende ønskede at deltage i et diagnostisk seminar, der udnyttede information fra ‘House’ TV-serien. Kilde

House og AI

Selvom brugen af House og andre forskellige tv-serier er blevet bevist i flere studier til at være en effektiv hjælp til læring for medicinstuderende, er der ikke meget, der er forsøgt i denne retning inden for maskinlæring endnu.

Nu har en ny artikel fra Pennsylvania State University lavet en første forsøg i denne retning ved at udvikle en dataset, der indeholder alle 176 House-sagstudier, formuleret i en narrativ-dreven diagnostisk struktur, derefter evalueret på populære LLM’er fra OpenAI og Google.

Trods vanskeligheden ved denne udfordring (som kendetegner en af de mest vanskelige felter i biologiske videnskaber), fandt forskerne, at nyere versioner af ChatGPT og Gemini viste forbedring i forhold til ældre versioner, hvilket tyder på, at udviklingstrenden for modeller sandsynligvis vil være effektiv i diagnostiske processer over tid.

Artiklen siger:

‘Resultaterne viser betydelig variation i præcision, fra 16,48% til 38,64% nøjagtighed, med nyere modellergenerationer, der viser en 2,3 gange forbedring. Selvom alle modeller står over for betydelige udfordringer med sjældne sygdomme, tyder den observerede forbedring på tværs af arkitekturer på lovende retninger for fremtidig udvikling.

‘Vores uddannelsesvaliderede benchmark etablerer baselinepræstationsmål for narrativ medicinsk argumentation og giver en offentligt tilgængelig evalueringsskema for fremme af AI-assisteret diagnoseforskning.’

Ud over at etablere baselinepræstationsmål, som fremtidige bestræbelser kan vurderes på, bemærker forfatterne, at den nye dataset – som de gør offentligt tilgængelig – løser manglen på narrativ proces i eksisterende medicinske datasets og er let tilgængelig i modsætning til den lukkede kultur omkring standard medicinske datasets.

Det nye arbejde er titlen Evaluering af store sprogmodeller på sjældne sygdomme: En case-studie ved hjælp af House M.D. og kommer fra fire forskere fra Penn State*.

Data

For at befolke deres dataset brugte forfatterne offentligt tilgængeligt materiale fra den langvarige House Wiki-fandom-side. Narrativt indhold blev udtrukket og destilleret ved hjælp af den populære Beautiful Soup-ramme, der kan udtrække struktureret data fra HTML-kilden til web sider.

Efter at de grundlæggende narrativer var høstet på denne måde, blev fire LLM’er brugt til at omdanne outputtet til standardiseret sagformatering. Modellerne, der blev brugt, var GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; og Gemini 2.5 Pro. Til sidst blev kvalitetsfiltrering anvendt for at sikre, at datasettet havde passende klinisk detalje og tilpasning til den nuværende tilstand af kunsten i medicinsk argumentation.

Forfatterne bemærker, at ‘forældreløse’ sygdomme (dvs. sjældne sygdomme) er underrepræsenterede i standard medicinske databaser; i visse tilfælde kan deres dækning i House-serien repræsentere en usædvanlig høj procentdel af deres samlede eksisterende dækning.

Forfatterne indrømmer, at nyttigheden af en datakilde af denne type skal tempereres med forsigtighed i forhold til den kunstneriske frihed, der kan prioriteres på visse tidspunkter i udviklingen af medicinske dramaer:

‘Selvom vores dataset afspejler begrænsninger i fiktivt indhold, herunder dramatisk overdrivelse og komplekse sagfokus, kan disse karakteristika være til fordel ved evaluering, da de giver udfordrende edge-cases, der tester modellens robusthed.

‘Den uddannelsesmæssige validering af House M.D. af medicinske fagfolk giver tillid til, at de udtrukne scenarier indeholder klinisk meningsfuld information, der er egnet til AI-vurdering.’

Eksempler fra datasettet, der blev genereret til projektet. Kilde [   https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download    ]

Eksempler fra datasettet, der blev genereret til projektet.  Kilde

Tests

For at evaluere modellens nøjagtighed på narrativ-diagnostiske opgaver designede forfatterne en simpel pipeline, der kombinerer promptgenerering, modelinference og scoring.

De fire ovennævnte LLM’er blev testet, hvor hver model var konfigureret med temperatur sat til nul (hvilket sikrer deterministisk i stedet for ‘kreativ’ output), og med en maksimal token-længde på 1.500 – en tilladelse designet til at kunne rumme komplekse diagnostiske overvejelser. Der blev ikke anvendt yderligere systemprompts til at ramme spørgsmålene yderligere.

Promptene selv fulgte en standardstruktureret medicinsk sagpræsentationsformat – den type, som seerne er mest fortrolige med fra medicinske dramaer, når en ny patient/sygdom bliver introduceret, og en læge summerer en oversigt for andre læger (effektivt, men for seernes skyld).

Hver prompt præsenterede en klinisk narrativ, der bestod af demografiske detaljer; en tidsplan over symptomer; relevante medicinsk historie; og tidlige diagnostiske fund. Modellen blev briefet til at identificere en enkelt primær diagnose og at begrunde sin konklusion med argumentation.

Hver model genererede sin diagnostiske respons i en enkelt omgang, uden nogen iterativ forbedring; og responserne blev indsamlet under ensartede betingelser på tværs af alle 176 tilfælde:

Et illustrativt evalueringseksempel, der viser en narrativ klinisk prompt og dens tilsvarende grundsandssygdom, som blev brugt til test af Gemini 2.5 Pro. Kilde [  https://arxiv.org/pdf/2511.10912  ]

Et illustrativt eksempel, der viser en narrativ klinisk prompt og dens tilsvarende grundsandssygdom, som blev brugt til test af Gemini 2.5 Pro. Kilde


Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]