Sănătate
Provocarea Crowdsourced AI pentru îmbunătățirea analizei mamografiei s-a încheiat

Mamografiile sunt importante pentru sănătatea femeilor și pentru detectarea precoce a cancerului de sân. Cu toate acestea, mamografiile necesită specialiști umani pentru interpretare, iar chiar și specialiștii foarte bine instruiți fac greșeli. Se estimează că rata fals pozitivă a mamografiei este de aproximativ 10% în Statele Unite. Pentru a crea sisteme care să ofere citiri mai precise ale mamografiei, Digital Mammography (DM) Dream Challenge a creat recent o inițiativă crowdsourced pentru dezvoltarea de algoritmi noi de citire a mamografiei
După cum raportează PhysicsWorld, tehniciile de vedere computerizată și algoritmii de învățare profundă au devenit mai sofisticați în ultimii ani, cercetătorii și inginerii se îndreaptă spre utilizarea inteligenței artificiale pentru interpretarea mamografiei, cu scopul de a crește acuratețea. Digital Mammography (DM) Dream Challenge a lansat o competiție pentru a investiga utilizarea algoritmilor de inteligență artificială pentru recunoașterea semnelor posibile de cancer de sân.
DM Dream Challenge este cel mai mare studiu al algoritmilor de învățare profundă referitor la interpretarea mamografiei până în prezent. Justin Guinney, președintele provocărilor DREAM, a explicat că motivul pentru care s-au organizat aceste provocări a fost acela că a permis o evaluare structurată a zecilor de algoritmi de învățare profundă pe două baze de date diferite. Participanții la provocare au fost obligați să proiecteze algoritmi care puteau fi antrenați pe date de mamografie și să producă un scor de probabilitate care să indice că un pacient va fi diagnosticat cu cancer de sân în decurs de un an. A existat și o a doua condiție pentru provocare. În a doua sarcină, algoritmilor li s-a permis să fie antrenați pe informații suplimentare, cum ar fi date demografice de risc, date clinice și imagini colectate din examene de screening anterioare.
Au fost utilizate două seturi de date pentru antrenarea modelelor. Primul set de date a fost setul de date Kaiser Permanente Washington (KPW), asamblat de cercetători din Statele Unite. Între timp, un al doilea set de date a fost asamblat de cercetători suedezi de la Institutul Karolinska (KI).
Peste 1100 de participanți s-au alăturat provocării, împărțiți în 126 de echipe diferite și compuși din oameni din toată lumea. În timpul primei părți a provocării, modelele au fost antrenate utilizând setul de date KPW, care a inclus imagini din peste 140.000 de examene de screening. Atunci când s-a comparat cu rezultatele celui de-al doilea concurs, s-a constatat că accesul la mai multe caracteristici, cum ar fi datele clinice, nu a îmbunătățit semnificativ puterea discriminatorie a algoritmilor. Cu toate acestea, echipa DM Dream a sugerat că dezvoltarea viitoare a algoritmilor ar trebui să includă analiza imaginilor anterioare ale pacienților, presupunând că participanții nu au utilizat pe deplin datele.
Conform Health IT Analytics, echipa DR Dream dorește ca primele opt echipe care au obținut cele mai bune rezultate să colaboreze și să proiecteze un model de clasificare ensemble, pentru a vedea dacă acest model ar putea depăși performanța modelelor individuale. Coordonatorii provocării au utilizat apoi o agregare ponderată a predicțiilor diverselor algoritmi, creând Modelul de Provocare Ensemble (CEM). Predicțiile probabilitare ale modelului CEM au fost comparate cu interpretările radiologilor, evaluate utilizând specificitatea. Radiologii au obținut o specificitate de 90,5%, în timp ce modelul CEM a obținut o specificitate de doar 76,1%. Deși rezultatele par dezamăgitoare, atunci când ghicirile modelului CEM și interpretarea radiologilor au fost agregate într-un alt model (CEM+R), specificitatea a fost îmbunătățită la 92%.
Au fost obținute rezultate comparabile pe setul de date de test KI, utilizat exclusiv pentru validarea modelelor, care a conținut imagini din peste 166.000 de examene, modelul CEM fiind ușor inferior radiologilor (92,5% specificitate comparativ cu 96,7% specificitate), dar CEM+R a obținut rezultate mai bune (98,5% specificitate).
Niciunul dintre modelele individuale nu a reușit să depășească specialiștii umani, dar modelul CEM+R a avut un avantaj ușor comparativ cu interpretarea radiologilor singuri. Este posibil ca combinarea intuiției umane cu un asistent de inteligență artificială să poată îmbunătăți acuratețea.












