Terveydenhuolto
Joukkoistettu tekoälyhaaste rintamammografian parantamiseksi päättyy

Rintamammografiat ovat tärkeitä naisten terveyden vuoksi ja varhaisen rintasyövän havaitsemiseksi. Niiden tulkitseminen vaatii kuitenkin ihmisten osallistumisen, ja jopa korkeasti koulutetut asiantuntijat tekevät virheitä. Arvioiden mukaan rintamammografioiden virheellisen positiivisen tuloksen osuus on noin 10 prosenttia Yhdysvalloissa. Jotta voidaan luoda järjestelmiä, jotka antavat tarkemman tuloksen rintamammografeista, Digital Mammography (DM) Dream Challenge on luonut joukkoistetun hankkeen kehittääkseen uusia rintamammografian lukemisalgoritmeja.
PhysicsWorldin mukaan tietokoneen näkötekniikat ja syväoppimisalgoritmit ovat kehittyneet viime vuosina, tutkijat ja insinöörit kääntyvät kohti tekoälyn käyttämistä rintamammografioiden tulkitsemiseen, tavoitteena parantaa tarkkuutta. Digital Mammography (DM) Dream Challenge järjesti kilpailun tutkimaan tekoälyalgoritmien käyttöä rintasyövän mahdollisten merkkien tunnistamisessa.
DM Dream -haaste on suurin koskaan tehty syväoppimisalgoritmien tutkimus rintamammografian tulkitsemisessa. DREAM -haasteiden puheenjohtaja Justin Guinney selitti, että haasteen syy on, että se mahdollistaa useiden syväoppimismallien järjestelmällisen arvioinnin kahdella eri tietokannalla. Haasteen osallistujien piti suunnitella algoritmeja, jotka voitiin kouluttaa rintamammografia-aineistolla ja antaa todennäköisyysluokka, jonka mukaan potilas saisi rintasyöpädiagnoosin vuoden kuluessa. Lisäksi toissijainen haasteolosuhteiden mukainen tehtävä. Toisessa tehtävässä algoritmit saivat koulutuksessa käyttää lisätietoja, kuten demograafisia riskitietoja, kliinisiä tietoja ja aiemmista seulontatutkimuksista kerättyjä kuvia.
Koulutukseen käytettiin kahta tietokantaa. Ensimmäinen tietokanta oli Kaiser Permanente Washington (KPW) -tietokanta, jonka kokosivat yhdysvaltalaiset tutkijat. Samaan aikaan ruotsalaiset tutkijat Karolinska-instituutissa kokosivat toisen tietokannan.
Yli 1100 osallistujaa liittyi haasteeseen, jaettuna 126 eri ryhmään, ja he edustivat ihmisiä ympäri maailmaa. Haasteen ensimmäisessä osassa mallit koulutettiin KPW-aineistolla, joka sisälsi yli 140 000 seulontatutkimuksen kuvia. Toisen haasteen tuloksia verrattaessa havaittiin, että pääsy lisäominaisuuksiin, kuten kliinisiin tietoihin, ei parantanut merkittävästi algoritmien erottelukykyä. DM Dream -tiimi ehdotti kuitenkin, että tulevaisuuden algoritmien kehittämisessä tulisi ottaa huomioon aiempien potilaskuvien analyysi, ja arveli, että osallistujat eivät olleet täysin hyödyntäneet aineistoa.
Health IT Analyticsin mukaan DR Dream -tiimi haluaa, että kahdeksan parasta suorittanutta ryhmää yhdistyvät ja suunnittelevat yhteisen luokittelumallin, jotta voidaan nähdä, voittaako tämä malli yksittäisiä malleja. Haasteen koordinaattorit käyttivät eri algoritmien ennusteiden painotettua yhdistelmää, luoden Haasteen Ensemble -mallin (CEM). CEM-mallin todennäköisyysennusteita verrattiin röntgenhoitajien tulkintoihin, joita arvioitiin spesifisyyden avulla. Röntgenhoitajat saavuttivat 90,5 prosentin spesifisyyden, kun taas CEM-malli saavutti vain 76,1 prosentin spesifisyyden. Vaikka tulokset vaikuttavat pettyneiltä, CEM-mallin ja röntgenhoitajan tulkinnan yhdistäminen toiseen malliin (CEM+R) paransi spesifisyyttä 92 prosenttiin.
Verrattavat tulokset saavutettiin KI-testitietokannalla, jota käytettiin ainoastaan mallien validointiin ja joka sisälsi yli 166 000 tutkimuksen kuvia. CEM-malli oli hieman heikompi kuin röntgenhoitajat (92,5 prosentin spesifisyyden verrattuna 96,7 prosentin spesifisyyteen), mutta CEM+R saavutti paremman tuloksen (98,5 prosentin spesifisyyden).
Ei yksikään yksittäinen malli pystynyt ylittämään ihmisten asiantuntijoiden suorituskykyä, mutta CEM+R-malli näki lievän etulyöntiä verrattuna pelkästään röntgenhoitajien tulkintaan. On mahdollista, että yhdistämällä ihmisten intuitio tekoälyavustajan kanssa voidaan parantaa tarkkuutta.












