Ochrona zdrowia
Wyzwanie crowdsourcingowe AI do poprawy analizy mammografii dobiegło końca

Mammografia jest ważna dla zdrowia kobiet i do wczesnego wykrywania raka piersi. Jednak mammografia wymaga interpretacji przez specjalistów, a nawet wysoko wykwalifikowani specjaliści popełniają błędy. Szacuje się, że fałszywa pozytywna wartość mammografii wynosi około 10% w USA. W celu stworzenia systemów, które dają bardziej dokładne odczyty mammografii, Digital Mammography (DM) Dream Challenge niedawno utworzył crowdsourcingowy projekt rozwoju nowych algorytmów odczytu mammografii
Jak donosi PhysicsWorld, techniki widzenia komputerowego i algorytmy głębokiego uczenia stały się bardziej zaawansowane w ciągu ostatnich kilku lat, badacze i inżynierowie zwracają się ku wykorzystaniu AI do interpretacji mammografii, aby zwiększyć dokładność. Digital Mammography (DM) Dream Challenge uruchomił konkurs, aby zbadać wykorzystanie algorytmów AI do rozpoznawania możliwych objawów raka piersi.
DM Dream Challenge jest największym dotąd badaniem algorytmów głębokiego uczenia w zakresie interpretacji mammografii. Justin Guinney, prezes DREAM challenges, wyjaśnił, że powodem tych wyzwań jest to, że umożliwiają one ustrukturyzowaną ocenę dziesiątek modeli głębokiego uczenia na dwóch różnych bazach danych. Uczestnicy wyzwania musieli zaprojektować algorytmy, które mogłyby być szkolone na danych mammograficznych i wyjść z wynikiem w postaci prawdopodobieństwa, że pacjentka zostanie zdiagnozowana z rakiem piersi w ciągu roku. Istniał również warunek dodatkowego wyzwania. W drugim zadaniu algorytmy mogły być szkolone na dodatkowych informacjach, takich jak dane demograficzne, dane kliniczne i obrazy zebrane z poprzednich badań przesiewowych.
Wykorzystano dwa zestawy danych do szkolenia modeli. Pierwszy zestaw danych to Kaiser Permanente Washington (KPW), zebrany przez badaczy z USA. Drugi zestaw danych został zebrany przez szwedzkich badaczy w Instytucie Karolinska (KI).
Ponad 1100 uczestników wzięło udział w wyzwaniu, podzielonych na 126 różnych zespołów i składających się z ludzi z całego świata. Podczas pierwszej części wyzwania modele były szkolone przy użyciu zestawu danych KPW, który zawierał obrazy z ponad 140 000 badań przesiewowych. Porównując wyniki z wynikami drugiego wyzwania, stwierdzono, że dostęp do więcej cech, takich jak dane kliniczne, nie poprawił znacząco dyskryminacyjnej mocy algorytmów. Jednak zespół DM Dream zasugerował, że przyszły rozwój algorytmów powinien obejmować analizę poprzednich obrazów pacjentów, zakładając, że uczestnicy mogli nie w pełni wykorzystać danych.
Według Health IT Analytics, zespół DR Dream chce, aby najlepsze osiem zespołów współpracowało i zaprojektowało model klasyfikacji ensemble, aby sprawdzić, czy ten model mógłby potencjalnie przewyższyć indywidualne modele. Koordynatorzy wyzwania użyli ważonej agregacji przewidywań różnych algorytmów, tworząc Model Zespołu Wyzwania (CEM). Przewidywania modelu CEM zostały porównane z interpretacjami radiologów, ocenianymi przy użyciu swoistości. Radiolodzy osiągnęli 90,5% swoistości, podczas gdy model CEM osiągnął tylko 76,1% swoistości. Chociaż wyniki wydają się rozczarowujące, gdy przypuszczenia modelu CEM i interpretacja radiologów zostały zunifikowane w inny model (CEM+R), swoistość poprawiła się do 92%.
Porównywalne wyniki zostały osiągnięte na teście KI, wykorzystanym wyłącznie do walidacji modeli, który zawierał obrazy z ponad 166 000 badań. Model CEM był nieznacznie gorszy od radiologów (92,5% swoistości w porównaniu z 96,7% swoistości), ale model CEM+R osiągnął lepsze wyniki (98,5% swoistości).
Chociaż żaden z indywidualnych modeli nie był w stanie przewyższyć specjalistów ludzkich, model CEM+R miał nieznaczną przewagę w porównaniu z interpretacją radiologów samych. Możliwe, że łączenie intuicji ludzkiej z asystentem AI może poprawić dokładność.












