Andersonin kulma

Käyttäen ‘House’ -televisiosarjaa kehittämään AI:n diagnostiikkaa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
A screen capture from the NBC TV show 'House, S04E02., 'The Right Stuff'

Vaikka harvinaisten sairauksien diagnosointi on erityisen haasteellista AI:lle (kuten myös ihmisille), suositut kielen mallit ChatGPT ja Gemini osoittavat lupaavaa suorituskykyä, kun ne on koulutettu diagnostisista tapauksista suositusta ‘House’ -lääketieteellisestä draamasta.

 

Lähes puolet kaikista terveydenhuollon opiskelijoista katsoo säännöllisesti lääketieteellisiä draamoja, kuten House, Grey’s Anatomy ja Scrubs. Vaikka tällaista materiaalia voidaan käyttää vain didaktisiin tarkoituksiin suurella suodatuksella ja kehyksellä, johtuen vaarasta levittää vaarallista virheellistä tietoa, tutkimuksen taso draamoissa, jotka esittävät lääketieteellisiä olosuhteita, on yleensä hyvin korkea (vaikka tarkin varioi tuotannoissa).

Odottamattomasti, lääkärit usein alkavat, neuvovat ja/tai kirjoittavat lääketieteellisiä draamoja. Näissä tapauksissa, laaja lääketieteellinen alueen tietämys on edullista ei vain tarkasti välittää lääketieteellisiä ongelmia, vaan myös ideoida ehdotuksia uusille ja mielenkiintoisille juonille.

Yksi tutkimuksellisesti tutkittu lääketieteellinen näytös viimeaikaisen ‘kultaisen ajan’ televisiossa on House (tunnetaan myös nimellä House MD), jossa päähenkilön erikoisuudet ja suuren tukijoukon suuret määrät, viihdyttävät olivat toissijaisia ‘sairaus viikossa’.

Todella, 177:stä lähetyksestä, jotka esitettiin kahdeksan kauden aikana, House tarjosi ahkeran 176 diagnostisen tutkimuksen. Vaikka ohjelma päättyi vuonna 2012, vuoteen 2015 mennessä se oli jo käytössä opetusvälineenä, jossa erityinen Dr. House -seminaari tarjosi parannettuja tuloksia verrattuna standardi-seminaariin, vaikka osallistuminen ei tarjonnut opiskelijoiden luottamuksia:

Vuoden 2015 tutkimuksesta, moninaiset syyt, miksi lääketieteelliset opiskelijat halusivat osallistua diagnostiseen seminaariin, joka hyödynsi tietoja 'House' -televisiosarjasta. Lähde [ https://journals.plos.org/plosone/article/file?id=10.1371/journal.pone.0193972&type=printable ]

Vuoden 2015 tutkimuksesta, moninaiset syyt, miksi lääketieteelliset opiskelijat halusivat osallistua diagnostiseen seminaariin, joka hyödynsi tietoja ‘House’ -televisiosarjasta. Seminaarit oli suunniteltu tietoisesti haasteelliseen aikaan, eikä ne tarjonnut opiskelijoiden luottamuksia; näistä tekijöistä huolimatta aloite oli menestys. Lähde

Talo ja AI

Vaikka House -näytöksen ja muiden moninaisten televisio-ohjelmien käyttö on osoittanut useissa tutkimuksissa olevan tehokas apuväline opiskelijoille, lääketieteellisille opiskelijoille, vähän tätä lähestymistapaa on yritetty tähän asti koneoppimisen kontekstissa.

Nyt, uusi tutkimus Pennsylvanian osavaltion yliopistosta on tehnyt alkujaan tähän suuntaan, kehittämällä tietokannan, joka sisältää kaikki 176 House -tapausta, muotoiltuna kertomukselliseen diagnostiseen rakenteeseen, arvioitu suositulla LLM:llä OpenAI:sta ja Googlelta.

Vaikka tämän haasteen vaikeus (joka luonnehtii yhtä vaikeimmista biologian aloista), tutkijat havaitsivat, että uudempia versioita ChatGPT:stä ja Gemini:stä osoittivat parannuksen vanhempiin versioihin, osoittaen, että mallin kehityksen evolutiivinen suunta on todennäköisesti tehokas diagnostisiin prosesseihin ajan myötä.

Tutkimus sanoo:

‘Tulokset osoittavat merkittävän vaihtelun suorituskyvyssä, vaihdellen 16,48%:sta 38,64%:iin, uudempien mallien sukupolven osoittaen 2,3-kertaisen parannuksen. Vaikka kaikki mallit kohtaavat merkittäviä haasteita harvinaisten sairauksien diagnosoinnissa, havaittu parannus arkkitehtuureissa osoittaa lupaavia suuntia tulevaisuuden kehitykselle.

‘Meidän koulutettu benchmark perustaa perus-suorituskyky-mittaukset kertomukselliseen lääketieteelliseen päättelyyn ja tarjoaa julkisesti saatavissa olevan arviointikehyksen edistää AI-tukea diagnosoinnissa tutkimusta.’

Lisäksi perus-suorituskyvyn perustamisesta, jota voidaan arvioida tulevien ponnistelujen, kirjailijat huomauttavat, että uusi tietokanta – jota he tekevät julkisesti saatavissa – ratkaisee olemassa olevien lääketieteellisten tietokantojen puutteen kertomuksellisessa prosessissa, ja on helposti saatavissa, toisin kuin standardien lääketieteellisten tietokantojen portaitten kulttuuri.

Uusi tutkimus on nimeltään Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D, ja se tulee neljältä tutkijalta Penn Statesta*.

Data

Tietokannan populaatioon, kirjailijat käyttivät julkisesti saatavissa olevaa materiaalia pitkäaikaisesta House Wiki -fandom-sivustosta. Kertomuksellinen sisältö extrahoidaan ja tiivistetään suositun Beautiful Soup -kehyksen avulla, joka voi extrahoida rakenteellista dataa verkkosivujen HTML-lähteestä.

Jälkeen perus-kertomuksia oli poimittu tällä tavoin, neljä LLM:ää käytettiin muuttaa tulosteen standardoituun case-muotoon. Käytetyt mallit olivat GPT-4o mini; GPT-5 Mini; Gemini 2.5 Flash; ja Gemini 2.5 Pro. Lopuksi, laadun suodatus sovellettiin, varmistaakseen, että tietokanta oli sopiva kliininen yksityiskohta, ja yhdenmukainen nykyisen lääketieteellisen päättelyn tilan kanssa.

Kirjailijat huomauttavat, että ‘orpo’-sairaudet (tunnetaan myös nimellä harvinaiset sairaudet) ovat aliedustettuina standardien lääketieteellisissä tietokannoissa; tietyissä tapauksissa, heidän kattavuutensa House -näytöksessä voi edustaa epätavallista prosenttia heidän kokonaan olemassa olevasta kattavuudesta.

Kirjailijat myöntävät, että tällaisen tietolähteen hyödyllisyys on oltava varovainen suhtautuminen taiteelliseen lupaamaan, joka voidaan priorisoida ajoittain lääketieteellisen draaman kehittämisessä:

‘Vaikka tietokantamme heijastaa fiktiivisen sisällön rajoituksia, mukaan lukien dramatisointia ja monimutkaisia tapauksia, nämä ominaisuudet voivat hyödyttää arviointia tarjoamalla haasteellisia reunatapauksia, jotka testaavat mallin robustisuutta.

‘Lääketieteellisen validoinnin House M.D. lääketieteellisten ammattilaisten toimesta antaa luottamusta, että poimitut skenaariot sisältävät kliinisesti merkityksellistä tietoa, joka on sovellettavissa AI-arviointiin.’

Esimerkkejä tietokannasta, joka generoitiin hankkeelle. Lähde [ https://www.kaggle.com/datasets/arshgupta23/housemd-data-for-rare-disease-accuracy-using-llms?resource=download ]

Esimerkkejä tietokannasta, joka generoitiin hankkeelle. Lähde

Testit

Mallien diagnostisen tarkkuuden arvioimiseksi kertomuksellisissa diagnostisissa tehtävissä, kirjailijat suunnittelivat yksinkertaisen putken, joka yhdisti kehys-generoinnin, mallin inference-n ja scoringin.

Neljä edellä mainittua LLM:ää testattiin, ja kunkin mallin konfigurointi tehtiin lämpötilan asettamiseksi nollaan (varmistaen deterministisen tuloksen, eikä ‘luovaa’ tulosta), ja enimmäinen token -pituus oli 1 500 – joka oli sallittu kompleksisten diagnostisten päättelyjen kattamiseksi. Lisäksi ei käytetty järjestelmän kehys-kysymyksiä.

Kehykset noudattivat standardoitua strukturoitua lääketieteellistä tapausten esittämismuotoa – tyyppi, jota katsojat ovat eniten tottuneet lääketieteellisistä draamoista, kun uusi potilas/sairaus esitetään, ja lääkäri tiivistää yleiskatsauksen muiden lääkärien hyväksi (vaikka tehokkaasti, katsojien hyväksi).

Kunkin kehyksen esitteli kliinisen kertomuksen, joka koostui demograafisista yksityiskohtia; oireiden aikajana; merkityksellisestä lääketieteellisestä historiasta; ja varhaisista diagnostisista löydöistä. Malli ohjeistettiin tunnistamaan yksittäinen primäärinen diagnosi, ja perustelemaan johtopäätöksensä päättelyllä.

Kunkin malli generoi diagnostisen vastauksensa yhdessä kulussa, ilman mitään iteratiivista tarkennusta; ja vastaukset kerättiin samanoloissa olosuhteissa kaikkien 176 tapauksien kohdalla:

Esittävä arviointi-esimerkki, joka osoittaa kertomuksellisen kliinisen kehyksen ja sen vastaavan ground truth -diagnosin, jota käytettiin testaamaan Gemini 2.5 Pro:ta. Lähde [ https://arxiv.org/pdf/2511.10912 ]

Esittävä esimerkki, joka osoittaa kertomuksellisen kliinisen kehyksen ja sen vastaavan ground truth -diagnosin, jota käytettiin testaamaan Gemini 2.5 Pro:ta. Lähde

Mittojen osalta, ennusteet arvioitiin ‘fuzzy’ -merkkijonon vertailumenetelmällä, joka on suunniteltu ottaen huomioon epävarmuus lääketieteellisessä terminologiassa. Menetelmä käytti Pythonin SequenceMatcher -kirjastoa, jossa oli yhtenäisyys-kynnysarvo 0,8, aloittaen täsmällisestä alijonon vertailusta ja palauttaen token-kohtaisen vertailun, kun tarpeen. Tarkkuus laskettiin oikein luokiteltujen tapausten suhteena näihin olosuhteisiin:

Tutkijoiden 'fuzzy matching' -työkalu.

Tutkijoiden ‘fuzzy matching’ -työkalu.

Kirjailijat huomauttavat, että ‘fuzzy matching’ voi tarkoittaa, että semanttisesti identtiset diagnoosit, jotka käyttävät eri terminologiaa, voidaan jättää huomiotta, mutta esittävät lähestymistapansa olevan reproduktiivisin, joka voi täyttää kaikki hankkeen rajoitukset.

Tulokset

Diagnostinen tarkkuus vaihteli laajasti malleja, joissa Gemini 2.5 Pro suoritti parhaiten 38,64%:lla, seurattuna GPT-5 Minillä 36,93%:lla, Gemini 2.5 Flashilla 32,95%:lla ja GPT-4o Minillä 16,48%:lla. Vaikka nämä erot, kaikki mallit kamppailivat diagnostisen päättelyn vaatimuksilla harvinaisissa sairauksissa:

Neljän mallin diagnostisen tarkkuuden tulokset.

Neljän mallin diagnostisen tarkkuuden tulokset.

Kirjailijat huomauttavat myös, että suorituskyky vaihteli House -näytöksen eri tuotantokausien aikana:

Vaihteleva tarkkuus eri tuotantokausien aikana, ilman selvää kaarta tai selkeää syytä.

Vaihteleva tarkkuus eri tuotantokausien aikana, ilman selvää kaarta tai selkeää syytä.

Tutkimus sanoo:

‘Tuotantokausi 1 saavutti korkeimman tarkkuuden 56,52%:lla, kun taas tuotantokausi 5 osoitti alhaisimman 20,83%:lla. Tämä vaihtelu osoittaa, että diagnostinen monimutkaisuus vaihtelee sarjan aikana, ja myöhemmät tuotantokaudet saattavat sisältää haasteellisempia harvinaisia sairauksia.

‘Kuitenkin, suhteellisen vahva suorituskyky tuotantokaudella 8 (52,38%) osoittaa, että aikajatkuvuus yksin ei selitä tarkkuuseroja; tapauskohtainen diagnostinen monimutkaisuus näyttää olevan ensisijainen ajuri.’

Mallit suorittivat luotettavammin, kun diagnosoiden yleisiä olosuhteita, joilla oli tunnistettavissa olevat oireet, kuten aivokalvontulehdus, sydäninfarkti ja keuhkoembolia – mutta kamppailivat jatkuvasti harvinaisten sairauksien, kuten neurocysticercosin ja Erdheim-Chesterin taudin, sekä monimutkaisten autoimmuunisairauksien, kuten systemaattisen lupus erythematosuksen ja sarkoidoosin, kanssa. Suorituskyky laski myös toksiologia-tapauksissa, jotka vaativat altistumisen historian ja kliinisten oireiden yhdistämistä.

Kirjailijat ehdottavat, että suorituskyvyn vaihtelu malleja osoittaa merkittäviä eroja arkkitehtuureissa ja koulutusstrategiassa, ja GPT-5 Minin ja Gemini 2.5 Pro:n vahvempi suorituskyky osoittaa, että uudempia LLM-sukupolvia hyödyttää parannetuista päättelykyvyistä – vaikka heidän tuloksensa paljastavat edelleen selvät rajoitukset monimutkaisten diagnostisten tehtävien käsittelyssä.

Tulokset, he väittävät, tarjoavat perus-mittaukset kertomukselliselle harvinaisten sairauksien diagnosoinnille, osoittaen vahvasti, että nykyiset kielen mallit ovat aloittamassa näyttämään hyödyllisiä lääketieteellisiä päättelykykyjä.

Tulokset, he väittävät, tarjoavat perus-mittaukset kertomukselliselle harvinaisten sairauksien diagnosoinnille, osoittaen vahvasti, että nykyiset kielen mallit ovat aloittamassa näyttämään hyödyllisiä lääketieteellisiä päättelykykyjä.

Hyppy suorituskyvyssä GPT-4o Miniltä 16,48%:sta Gemini 2.5 Pro:lle 38,64%:iin, tutkimus johtaa, osoittaa tasaisen edistymistä kohti kliinisesti soveltuvia AI-tukea työkaluja.

Vaikka tutkijat myöntävät, että tarkkuustasot ovat edelleen kohtuullisia, perus-mittaus keskittyy yksinomaan hyvin monimutkaisiin tapauksiin, jotka haastavat jatkuvasti koulutettuja lääkäreitä, ja kyky tunnistaa diagnosin oikein lähes 40%:ssa näistä haasteellisista esimerkeistä osoittaa aitoa päättelykykyä, luoden perustan tuleville parannuksille kohdennetun hienosäätelyn, strukturoituun lääketieteelliseen tietämyksen integroinnin tai hybridisen päättelystrategian kautta.

Johtopäätös

On selvää vaaroja televisio-ohjelmien kertomuksellisen sisällön uudelleenohjauksessa todellisiin lääketieteellisiin tietokantoihin – jopa tapauksissa, kuten House, jossa lähdeaineisto on korkealla tasolla lääketieteellistä osaamista ja/tai valvontaa.

On mielenkiintoista huomata, että tyypillinen House -jakso toimii tehokkaasti lääketieteellisten merkintöjen tiivistäjänä, jotka eivät välttämättä ole suoraan saatavilla internetissä keskivertopotilaalle tai tietolähteille, jotka esittävät tiedon hyvin sirpin ja epälineaarisessa muodossa.

Sillä, että lääkäri kirjoittaa käsikirjoituksen jaksoon, kuten usein tapahtui House -näytöksessä, voidaan tutkijoiden toimesta käyttää jonkinlaista ‘hyväksymistä’ sisällölle; mutta tämä jättää huomiotta sen, että taiteelliset huomioonpanot voivat vaikuttaa sairauden esittämiseen jaksossa.

Tämä jättää datan tilaan, jossa on niin monia muista potentiaalisesti hyödyllisiä tietolähteitä koulutukseen: tarvitsee tuoreen kerroksen kallista, pätevää ihmisen valvontaa.

 

* Huomaa, että tämä lyhyt tutkimus ei noudata tavallista mallia, ja olen sopeuttanut kattavuuden mukautumaan tähän.

Julkaistu ensimmäisen kerran maanantaina, 17. marraskuuta 2025

Kirjailija tekoälystä, alan erikoismies ihmisen kuvien synteesistä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: [email protected]