Helse

Crowdsourced AI-utfordring for å forbedre mammografi-analyse avsluttet

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Mammografier er viktige for kvinner og for å oppdage tidlige tegn på brystkreft. Imidlertid krever mammografier at menneskelige spesialister tolker dem, og selv høyt utdannede spesialister gjør feil. Det estimeres at feilpositiv raten for mammografier er omtrent 10% i USA. For å skape systemer som gir mer nøyaktige lesninger av mammografier, har Digital Mammography (DM) Dream Challenge nylig lansert en crowdsourced innsats for å utvikle nye mammografi-lesingsalgoritmer

Ifølge PhysicsWorld, har datavisjonsteknikker og dyptlæringsalgoritmer blitt mer avanserte de siste årene, og forskere og ingeniører vender seg nå mot å bruke AI til å tolke mammografier, med mål om å øke nøyaktigheten. Digital Mammography (DM) Dream Challenge lanserte en konkurranse for å undersøke bruken av AI-algoritmer til å gjenkjenne mulige tegn på brystkreft.

DM Dream-utfordringen er den største studien av dyptlæringsalgoritmer for mammografi-tolkning hittil. Justin Guinney, president for DREAM-utfordringene, forklarte at grunnen til utfordringene er at det tillater en strukturert vurdering av dusinvis av dyptlæringsmodeller på to forskjellige databaser. Deltakerne i utfordringen måtte designe algoritmer som kunne trenes på mammografi-data og utgangspunkt for en sannsynlighetspoengsum som en pasient ville bli diagnostisert med brystkreft innen ett år. Det var også en sekundær utfordringsbetingelse. I den andre oppgaven var algoritmene tillatt å bli trenet på ekstra informasjon som demografisk risikodata, klinisk data og bilder samlet inn fra tidligere skjermeundersøkelser.

Det ble brukt to datasett for å trene modellene. Det første datasett var Kaiser Permanente Washington (KPW)-datasett, samlet inn av forskere fra USA. Et annet datasett ble samlet inn av svenske forskere ved Karolinska Instituttet (KI).

Over 1100 deltakere deltok i utfordringen, fordelt på 126 forskjellige lag og bestående av mennesker fra hele verden. Under den første delen av utfordringen ble modellene trenet ved hjelp av KPW-datasett, som inkluderte bilder fra over 140 000 skjermeundersøkelser. Når sammenlignet med resultatene fra den andre utfordringen, ble det funnet at tilgang til flere funksjoner som klinisk data ikke betydningfullt forbedret diskrimineringskraften til algoritmene. Imidlertid foreslo DM Dream-teamet at fremtidig algoritmeutvikling burde inkludere analyse av tidligere bilder for pasienter, og antydet at deltakerne kanskje ikke hadde fullt utnyttet dataene.

Ifølge Health IT Analytics, ønsker DR Dream-teamet å få de åtte beste teamene til å samarbeide og designe en ensemble-klassifiseringsmodell, for å se om denne modellen kunne potensielt overgå de enkelte modellene. Utfordringskoordinatorerne brukte deretter en vektet aggregasjon av forutsagn fra de forskjellige algoritmene og lagde Challenge Ensemble Model (CEM). De probabilistiske forutsagnene fra CEM-modellen ble sammenlignet med tolkninger fra radiologer, som ble evaluert ved hjelp av spesifisitet. Radiologene oppnådde 90,5% spesifisitet, mens CEM-modellen bare oppnådde 76,1% spesifisitet. Selv om resultatene ser skuffende ut, ble spesifisiteten forbedret til 92% når forutsagnene fra CEM-modellen og radiolog-tolkningene ble aggregert i en annen modell (CEM+R).

Lignende resultater ble oppnådd på KI-testdatasett, som ble brukt eksklusivt til å validere modellene, og som inneholdt bilder fra over 166 000 undersøkelser. CEM-modellen var litt dårligere enn radiologer (92,5% spesifisitet sammenlignet med 96,7% spesifisitet), men CEM+R oppnådde bedre resultater (98,5% spesifisitet).

Ingens av de enkelte modellene kunne overgå menneskelige spesialister, men CEM+R-modellen så en liten fordel sammenlignet med tolkningene fra radiologer alene. Det kan være mulig at kombinasjonen av menneskelig intuition og en AI-assistent kan forbedre nøyaktigheten.

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.