Kąt Andersona
Krytyka popularnego zestawu danych COVIDx przez brytyjskich badaczy

Zespół badawczy z Wielkiej Brytanii skrytykował zaufanie do otwartych zestawów danych wykorzystywanych do analizy rentgenogramów klatki piersiowej pacjentów z COVID-19, koncentrując się na popularnym otwartym zestawie danych COVIDx.
Badacze, którzy przetestowali COVIDx w różnych modelach szkoleniowych AI, twierdzą, że nie jest on “reprezentatywny dla prawdziowego problemu klinicznego”, że wyniki uzyskane za jego pomocą są “nadmierne”, a modele “nie generalizują się dobrze” do danych z świata rzeczywistego.
Autorzy zauważają również niekonsekwencję danych, które tworzą COVIDx, gdzie oryginalne obrazy mają różne rozdzielczości, które są automatycznie przekształcane przez głęboki workflow uczenia maszynowego w spójne rozmiary niezbędne do szkolenia, i obserwują, że ten proces może wprowadzać mylące artefakty związane z algorytmem przekształcania obrazu, a nie z aspektem klinicznym danych.
Artykuł nosi tytuł Pułapki korzystania z otwartych danych do tworzenia rozwiązań głębokiego uczenia maszynowego do wykrywania COVID-19 w rentgenogramach klatki piersiowej, i jest współpracą między Centrum Obrazowania Komputerowego i Symulacji w Biomedycynie (CISTIB) na Uniwersytecie w Leeds, a badaczami z pięciu innych organizacji w tym samym mieście, w tym Leeds Teaching Hospitals NHS Trust.
Badania szczegółowo opisują, między innymi, “niewłaściwe użycie etykiet” w zestawie danych COVIDx, a także “wysokie ryzyko stronniczości i zakłóceń”. Własne eksperymenty badaczy z przepuszczaniem zestawu danych przez trzy różne modele głębokiego uczenia maszynowego skłoniły ich do wniosku, że “niezwykła wydajność, o której szeroko donoszono w całej dziedzinie, jest nadmierna, wyniki wydajności modeli są nieprawidłowo przedstawione, a modele nie generalizują się dobrze do danych klinicznie realistycznych”.
Pięć różnych zestawów danych w jednym
Raport* zauważa, że większość obecnych metod opartych na sztucznej inteligencji w tej dziedzinie opiera się na “niejednorodnej” kolekcji danych z różnych otwartych repozytoriów, obserwując, że pięć zestawów danych o wyraźnie różnych cechach zostało połączonych w zestaw danych COVIDx, pomimo (według badaczy) niewystarczającej równości jakości i rodzaju danych.
Zestaw danych COVIDx został opublikowany w maju 2020 roku jako współpraca konsorcjum pod przewodnictwem Wydziału Inżynierii Systemów na Uniwersytecie w Waterloo w Kanadzie, a dane udostępniono w ramach Inicjatywy Otwartego Źródła COVID-Net.
Pięć kolekcji, które tworzą COVIDx, to: kolekcja danych obrazowych COVID-19 (otwarty zestaw danych z Montrealu); inicjatywa zestawu danych rentgenogramów klatki piersiowej COVID-19; zestaw danych rentgenogramów klatki piersiowej COVID-19 Actualmed; baza danych radiografii COVID-19; oraz zestaw danych wyzwania wykrywania pneumonii RSNA, jeden z wielu zestawów danych przed-COVID, które zostały wykorzystane w kryzysie pandemicznym.
(RICORD – patrz poniżej – został później dodany do COVIDx, ale ponieważ został uwzględniony po modelach interesujących w badaniu, został wykluczony z danych testowych, a w każdym razie miałby tendencję do dalszego zróżnicowania COVIDx, co jest główną skargą autorów badania.)
Badacze twierdzą, że COVIDx jest “największym i najczęściej używanym” zestawem danych tego rodzaju w społeczności naukowej związanej z badaniami COVID, i że dane importowane do COVIDx z zewnętrznych zestawów danych nie są wystarczająco zgodne z trójczęściową schemą zestawu danych COVIDx (tj. “normalny”, “pneumonia” i “COVID-19”).
Czyżby wystarczająco blisko..?
Podczas badania pochodzenia i przydatności danych przyczyniających się do COVIDx w czasie badania, badacze stwierdzili “niewłaściwe użycie” danych RSNA, gdzie dane jednego rodzaju zostały, zdaniem badaczy, przyporządkowane do innej kategorii:
‘Repozytorium RSNA, które wykorzystuje publicznie dostępne dane rentgenogramów klatki piersiowej z NIH Chestx-ray8 [**], zostało zaprojektowane do zadania segmentacji i jako takie zawiera trzy klasy obrazów, ‘Lung Opacity’, ‘No Lung Opacity/Not Normal’, i ‘Normal’, z dostępnymi bounding boxami dla przypadków ‘Lung Opacity’.
‘W trakcie tworzenia COVIDx wszystkie rentgenogramy klatki piersiowej z klasy ‘Lung Opacity’ zostały uwzględnione w klasie pneumonii.’
Skutecznie, artykuł twierdzi, że metodyka COVIDx rozszerza definicję “pneumonii” na “wszystkie podobne do pneumonii nieprzezroczystości płuc”. W związku z tym, wartość porównywalna różnych typów danych jest (prawdopodobnie) zagrożona. Badacze stwierdzają:
‘ […] klasa pneumonii w zestawie danych COVIDx zawiera rentgenogramy klatki piersiowej z różnymi innymi patologiami, w tym, wysiękiem opłucnowym, infiltracją, konsolidacją, rozedmą i guzami. Konsolidacja jest radiologiczną cechą możliwej pneumonii, a nie klinicznym rozpoznaniem. Użycie konsolidacji jako substytutu pneumonii bez udokumentowania tego może być mylące.’

Alternatywne patologie (poza COVID-19) związane z COVIDx. Źródło: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf
Raport stwierdza, że tylko 6,13% 4 305 przypadków pneumonii pochodzących z RSNA zostało dokładnie oznaczonych, co stanowi zaledwie 265 prawdziwych przypadków pneumonii.
Ponadto, wiele przypadków niepneumonii uwzględnionych w COVIDx reprezentowało choroby współistniejące – powikłania innych chorób lub wtórne problemy medyczne w stanach, które niekoniecznie są związane z pneumonią.
Nie “normalne”
Raport sugeruje dalej, że wpływ zestawu danych wyzwania RSNA na COVIDx spowodował zaburzenie empiricalnej stabilności danych. Badacze obserwują, że COVIDx faworyzuje klasę “normalną” danych RSNA, efektywnie wykluczając wszystkie klasy “bez nieprzezroczystości płuc/nienormalne” w szerszym zestawie danych. Artykuł mówi:
‘Podczas gdy jest to zgodne z tym, co się spodziewa się w ramach etykiety “normalnej”, rozszerzając klasę pneumonii i używając tylko “normalnych” rentgenogramów klatki piersiowej, zamiast przypadków negatywnych dla pneumonii, znacznie upraszcza zadanie klasyfikacji.
‘W efekcie końcowym jest to zestaw danych, który odzwierciedla zadanie, które jest oddalone od prawdziwego problemu klinicznego.’
Potencjalne stronniczości z powodu niezgodnych standardów danych
Artykuł wskazuje na kilka innych rodzajów stronniczości w COVIDx, zauważając, że niektóre z danych przyczyniających się miesza obrazy rentgenogramów klatki piersiowej dzieci z obrazami dorosłych, i dalej obserwuje, że te dane są jedynym “znaczącym” źródłem obrazów pediatrycznych w COVIDx.
Ponadto, obrazy z zestawu danych RSNA mają rozdzielczość 1024×1024, podczas gdy inny zestaw danych dostarcza obrazy o rozdzielczości tylko 299×299. Ponieważ modele uczenia maszynowego zawsze zmieniają rozmiar obrazów, aby dopasować się do dostępnego miejsca szkoleniowego (ukrytego miejsca), oznacza to, że obrazy 299×299 będą skalowane w górę w trakcie szkolenia (potencjalnie prowadząc do artefaktów związanych z algorytmem skalowania, a nie patologią), a większe obrazy będą skalowane w dół. To znowu przeciwdziała jednorodnym standardom danych niezbędnym do analizy komputerowej opartej na sztucznej inteligencji.
Dalej, dane ActMed uwzględnione w COVIDx zawierają “markery dyskowe” w rentgenogramach klatki piersiowej COVID-19, cechę powtarzalną, która nie jest spójna z szerszym zestawem danych, i która wymagałaby obsługi jako “powtarzalnego odstępstwa”.
To jest rodzaj problemu, który zwykle jest rozwiązywany przez oczyszczanie lub pomijanie danych, ponieważ powtarzalność markerów jest wystarczająca, aby zarejestrować się jako “cecha” w trakcie szkolenia, ale nie wystarczająco częsta, aby użytecznie uogólnić w szerszym schemacie zestawu danych. Bez mechanizmu dyskontowania wpływu sztucznych markerów, mogą one potencjalnie być uznane przez metodykę systemu uczenia maszynowego za zjawiska patologiczne.
Szkolenie i testowanie
Badacze przetestowali COVIDx w porównaniu z dwoma innymi zestawami danych przy użyciu trzech modeli. Dwa dodatkowe zestawy danych to RICORD, który zawiera 1096 rentgenogramów klatki piersiowej COVID-19 u 361 pacjentów, pochodzących z czterech krajów; oraz CheXpert, publiczny zestaw danych
Trzy modele użyte w badaniu to COVID-Net, CoroNet i DarkCovidNet. Wszystkie trzy modele wykorzystują sieci neuronowe zwane CNN, chociaż CoroNet składa się z dwuetapowego procesu klasyfikacji obrazów, z autoencoderami, które przekazują dane wyjściowe do klasyfikatora CNN.
Testy wykazały “gwałtowny spadek” wydajności wszystkich modeli na zestawach danych nie-COVIDx w porównaniu z 86% dokładnością, wynikającą z użycia danych COVIDx. Jednakże, jeśli dane są błędnie oznaczone lub pogrupowane, są to skutecznie fałszywe wyniki. Badacze zanotowali znacznie obniżone wyniki dokładności na porównywalnych zewnętrznych zestawach danych, które artykuł proponuje jako bardziej realistyczne i prawidłowo sklasyfikowane dane.
Ponadto, artykuł obserwuje:
‘Przegląd kliniczny 500 map saliency generowanych przez predykcję na danych testowych COVIDx wykazał tendencję znaczenia w klinicznie nieistotnych cechach. Często obejmowało to focus na strukturach kostnych i tkankach miękkich zamiast rozproszonej bilateralnej nieprzezroczystości płuc, która jest typowa dla zakażenia COVID-19.’

To jest rentgenogram potwierdzonego przypadku COVID-19, który otrzymał prawdopodobieństwo predykcji 0,938 po przeszkoleniu na DarkCovidNet z COVIDx.
Wnioski
Badacze krytykują brak danych demograficznych lub klinicznych związanych z obrazami rentgenogramów klatki piersiowej w COVIDx, argumentując, że bez nich nie można uwzględnić “czynników zakłócających” takich jak wiek.
Stwierdzają również, że problemy znalezione w zestawie danych COVIDx mogą być stosowane do innych zestawów danych, które zostały podobnie pozyskane (tj. poprzez mieszanie przed-COVID baz danych radiologicznych z niedawnymi danymi rentgenogramów klatki piersiowej COVID-19 bez odpowiedniej architektury danych, rekompensaty zmienności i jasnego zakresu ograniczeń tego podejścia).
Podsumowując niedociągnięcia COVIDx, badacze podkreślają nierównomierne uwzględnienie “czystych” pediatrycznych rentgenogramów klatki piersiowej, a także ich postrzeganie niewłaściwego użycia etykiet i wysokiego ryzyka stronniczości i zakłóceń w COVIDx, twierdząc, że ‘niezwykła wydajność [COVIDx] zgłoszona szeroko w całej dziedzinie jest nadmierna, wyniki wydajności modeli są nieprawidłowo przedstawione, a modele nie generalizują się dobrze do danych klinicznie realistycznych’.
Raport kończy się słowami:
‘Brak dostępnych danych szpitalnych w połączeniu z niewystarczającą oceną modeli w całej dziedzinie pozwolił na użycie otwartych danych, aby zmylić społeczność badawczą. Kontynuacja publikacji nadmiernych wskaźników wydajności modeli ryzykuje uszkodzenie wiarygodności badań nad sztuczną inteligencją w diagnostyce medycznej, szczególnie w przypadku chorób o dużym zainteresowaniu publicznym. Jakość badań w tej dziedzinie musi się poprawić, aby temu zapobiec, musi to rozpocząć się od danych.’
*Chociaż badacze twierdzą, że udostępnili dane, pliki i kod nowego artykułu online, dostęp wymaga logowania, a na czas pisania, nie ma ogólnego dostępu publicznego do plików.
** ChestX-ray8: Baza danych szpitala i benchmarki słabo nadzorowanej klasyfikacji i lokalizacji powszechnych chorób klatki piersiowej – https://arxiv.org/pdf/1705.02315.pdf












