Andersonův úhel

Kritika populární datové sady COVIDx ze strany britských výzkumníků

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumný konsorcium z Velké Británie kritizuje rozsah vědecké důvěry vkládané do otevřených datových sad používaných pro počítačovou analýzu rentgenových snímků plic pacientů s COVID-19, se zaměřením na populární otevřenou datovou sadu COVIDx.

Výzkumníci, kteří otestovali COVIDx v různých modelech umělé inteligence, tvrdí, že není „reprezentativní pro skutečný klinický problém“, že výsledky získané pomocí něj jsou „nafouknuté“ a že modely „se dobře negeneralizují“ na reálná data.

Autorům také nevadí nekonzistence přispívaných dat, která tvoří COVIDx, kde původní obrázky pocházejí v různých rozlišeních, která jsou automaticky přeformátována hlubokým učením do konzistentních velikostí nezbytných pro školení, a pozorují, že tento proces může zavést klamavé artefakty související s algoritmem změny velikosti obrázku, spíše než klinickým aspektem dat.

Článek se jmenuje Past na použití otevřených dat pro vývoj hlubokých učících se řešení pro detekci COVID-19 na rentgenových snímcích a je spoluprací mezi Centrem pro počítačové zobrazování a simulaci v biomedicíně (CISTIB) na Univerzitě v Leedsu, spolu s výzkumníky z pěti dalších organizací ve stejném městě, včetně Leeds Teaching Hospitals NHS Trust.

Výzkum podrobně popisuje, mimo jiné negativní postupy, „zneužívání štítků“ v datové sadě COVIDx, jakož i „vysoké riziko zkreslení a konfliktů“. Experimenty výzkumníků s procházením datové sady přes tři životaschopné modely hlubokého učení je vedly k závěru, že „výjimečné výsledky hlášené široce napříč problémem jsou nafouknuté, že výsledky modelu jsou špatně prezentovány a že modely se dobře negeneralizují na klinicky realistická data.“

Pět kontrastních datových sad v jedné

Zpráva* uvádí, že většina současných metod založených na umělé inteligenci v tomto oboru závisí na „heterogenní“ sbírce dat z různých otevřených repozitářů, přičemž pět datových sad s výrazně odlišnými charakteristikami bylo sloučeno do datové sady COVIDx, ačkoli (podle názoru výzkumníků) s nedostatečnou paritou kvality a typu dat.

Datová sada COVIDx byla vydána v květnu 2020 jako konsorciální úsilí vedené katedrou systémového designu a inženýrství na Univerzitě v Waterloo v Kanadě, s daty dostupnými jako součást otevřené iniciativy COVID-Net.

Pět sbírek, které tvoří COVIDx, jsou: sbírka obrazových dat COVID-19 (otevřená sada od výzkumníků z Montrealu); iniciativa datové sady COVID-19 pro rentgenové snímky hrudníku; datová sada COVID-19 pro rentgenové snímky hrudníku Actualmed; databáze radiografie COVID-19; a datová sada RSNA pro detekci pneumonie, jedna z mnoha předkovidových sad, které byly využity pro pandemickou krizi.

(RICORD – viz níže – byl později přidán do COVIDx, ale protože byl zahrnut po modelech zajímavých pro studii, byl vyloučen z testovacích dat a v každém případě by měl tendenci dále variovat COVIDx, což je hlavní stížnost autorů studie.)

Výzkumníci tvrdí, že COVIDx je „největší a nejčastěji používanou“ datovou sadou svého druhu ve vědecké komunitě související s výzkumem COVID, a že data importovaná do COVIDx z externích datových sad se dostatečně nepřizpůsobují trojitému schématu datové sady COVIDx (tj. „normální“, „pneumonie“ a „COVID-19“).

Dostatečně blízko..?

Při zkoumání původu a vhodnosti přispívaných datových sad pro COVIDx v době studie výzkumníci zjistili „zneužívání“ dat RSNA, kde data jednoho typu byla, podle tvrzení výzkumníků, zařazena do jiné kategorie:

„Repozitář RSNA, který používá veřejně dostupné rentgenové snímky hrudníku z NIH Chestx-ray8 [**], byl navržen pro úkol segmentace a jako takový obsahuje tři třídy obrázků, ‘Lung Opacity’, ‘No Lung Opacity/Not Normal’, a ‘Normal’, s dostupnými bounding boxy pro ‘Lung Opacity’ případy.

„Při sestavení do COVIDx jsou všechny rentgenové snímky z ‘Lung Opacity’ třídy zahrnuty do třídy pneumonie.“

Efektivně, podle tvrzení článku, metodika COVIDx rozšiřuje definici „pneumonie“ tak, aby zahrnovala „všechny pneumonie-podobné lung opacity“. V důsledku toho je srovnatelná hodnota srovnatelných typů dat (presumably) ohrožena. Výzkumníci uvádějí:

„ […] třída pneumonie v datové sadě COVIDx obsahuje rentgenové snímky s různými jinými patologiemi, včetně pleurálního výpotku, infiltrace, konsolidace, emfyzému a mas. Konsolidace je radiologickou vlastností možného zápalem plic, ne klinickou diagnózou. Použít konsolidaci jako náhradu za pneumonii bez dokumentace je potenciálně zavádějící.“

Alternativní patologie (kromě COVID-19) spojené s COVIDx.

Alternativní patologie (kromě COVID-19) spojené s COVIDx. Zdroj: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Zpráva zjistila, že pouze 6,13 % z 4 305 případů pneumonie získaných z RSNA bylo přesně označeno, což představuje pouze 265 skutečných případů pneumonie.

Kromě toho mnoho případů, které nejsou pneumonií, zahrnutých v COVIDx, představovalo komorbiditu – komplikace jiných nemocí nebo jinak sekundární zdravotní problémy, které nejsou nutně spojeny s pneumonií.

Není „normální“

Zpráva dále naznačuje, že vliv datové sady RSNA v COVIDx zkreslil empirickou stabilitu dat. Výzkumníci pozorují, že COVIDx upřednostňuje „normální“ třídu dat RSNA, efektivní vyřazuje všechny „no lung opacity/not normal“ třídy ve širší datové sadě. Článek uvádí:

„Zatímco to je v souladu s tím, co se očekává v rámci ‘normálního’ štítku, rozšiřování třídy pneumonie a používání pouze ‘normálních’ rentgenových snímků, spíše než případů negativních na pneumonii, značně zjednodušuje klasifikační úkol.

„Výsledkem je datová sada, která odráží úkol, který je vzdálen od skutečného klinického problému.“

Potenciální zkreslení z neslučitelných standardů dat

Článek rozpoznává několik dalších typů zkreslení v COVIDx, přičemž uvádí, že některá přispívaná data kombinuje pediatrické rentgenové snímky hrudníku s snímky dospělých pacientů, a dále pozoruje, že tato data jsou jediným „významným“ zdrojem pediatrických snímků v COVIDx.

Kromě toho snímky z datové sady RSNA mají rozlišení 1024×1024, zatímco jiná přispívaná datová sada poskytuje snímky pouze s rozlišením 299×299. Jelikož modely strojového učení budou неизběhně měnit velikost snímků, aby se přizpůsobily dostupnému školicímu prostoru (latentnímu prostoru), to znamená, že snímky 299×299 budou zvětšeny v tréninkovém pracovním postupu (potenciálně vedoucích k artefaktům souvisejícím se škálováním algoritmu, spíše než patologií), a větší snímky zmenšeny. Opět to jde proti homogenním standardům dat nezbytným pro analýzu počítačového vidění založenou na umělé inteligenci.

Dále data ActMed vložená do COVIDx obsahují „diskové značky“ v rentgenových snímcích COVID-19, recidivující rys, který je nekonzistentní se širší datovou sadou, a který by musel být zpracován jako „opakovatelný outlier“.

To je typ problému, který je obvykle řešen buď čištěním nebo vynecháním dat, protože recidiva značek je dostatečná k registraci jako „funkce“ ve školení, ale není dostatečně častá, aby se obecně využila v širším schématu datové sady. Bez mechanismu pro diskontování vlivu umělých značek by mohly být potenciálně považovány metodikou systému strojového učení za patologické jevy.

Školení a testování

Výzkumníci otestovali COVIDx proti dvěma komparativním datovým sadám napříč třemi modely. Další dvě datové sady byly RICORD, která obsahuje 1096 rentgenových snímků COVID-19 napříč 361 pacienty, pocházející ze čtyř zemí; a CheXpert, veřejná datová sada.

Tři modely, které byly použity, byly COVID-Net, CoroNet a DarkCovidNet. Všechny tři modely využívají sítě s konvolucemi (CNN), ačkoli CoroNet sestává z dvoustupňového procesu klasifikace obrazů, s autoencoderem, který předává výstup do klasifikátoru CNN.

Testování ukázalo „prudký pokles“ ve výkonu všech modelů na ne-COVIDx datové sadách ve srovnání s 86% přesností, která vyplývá z použití dat COVIDx. Nicméně, pokud jsou data špatně označena nebo seskupena, jsou to efektivní falešné výsledky. Výzkumníci zaznamenali výrazně sníženou přesnost výsledků na srovnatelných externích datové sadách, které článek navrhuje jako více realistické a správně klasifikované údaje.

Kromě toho článek uvádí:

„Klinická revize 500 grad-CAM saliencí map generovaných předpovědí na testovacích datech COVIDx ukázala trend významnosti v klinicky irelevantních funkcích. To zahrnovalo častěji zaměření na kostní struktury a měkké tkáně místo difuzní bilaterální opacifikace plic, typické pro infekci COVID-19.“

Toto je rentgenový snímek potvrzeného případu COVID-19, přiřazený pouhé 0,938 předpovědní pravděpodobnosti z COVIDx školeného na DarkCovidNet. Zdroj: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Toto je rentgenový snímek potvrzeného případu COVID-19, přiřazený pouhé 0,938 předpovědní pravděpodobnosti z COVIDx školeného na DarkCovidNet.

Závěr

Výzkumníci kritizují nedostatek demografických nebo klinických údajů souvisejících s rentgenovými snímky v COVIDx, argumentujíce, že bez nich je nemožné zohlednit „konfliktní faktory“ jako věk.

Také pozorují, že problémy nalezené v datové sadě COVIDx mohou být aplikovatelné na další datové sady, které byly obdobně zdrojovány (tj. smícháním předkovidových radiologických databází s nedávnými daty rentgenových snímků COVID bez dostatečné architektury dat, kompenzace variability a jasného rozsahu omezení tohoto přístupu).

Při shrnutí nedostatků COVIDx výzkumníci zdůrazňují nesymetrické zahrnutí „čistých“ pediatrických rentgenových snímků, stejně jako jejich vnímání zneužívání štítků a vysoké riziko zkreslení a konfliktů v COVIDx, tvrdíce, že „výjimečné výsledky“ [COVIDx] „hlášené široce napříč problémem jsou nafouknuté, že výsledky modelu jsou špatně prezentovány a že modely se dobře negeneralizují na klinicky realistická data.“

Zpráva uzavírá:

„Nedostatek dostupných hospitalizačních dat v kombinaci s nedostatečnou evaluací modelů napříč problémem umožnil použití otevřených dat k oklamání výzkumné komunity. Pokračující publikace nafouknutých metrik výkonu modelů riskuje poškození důvěryhodnosti výzkumu umělé inteligence v medicínské diagnostice, zejména tam, kde je nemoc velkého veřejného zájmu. Kvalita výzkumu v tomto oboru musí zlepšit, aby se tomu zabránilo, a to musí začít s daty.“

 

 

*Ačkoli autoři studie tvrdí, že udělali data, soubory a kód pro novou práci dostupné online, přístup vyžaduje přihlášení, a v době psaní této zprávy není obecný veřejný přístup k souborům k dispozici.
** ChestX-ray8: Hospital-scale Chest X-ray Database and Benchmarks on Weakly-Supervised Classification and Localization of Common Thorax Diseases – https://arxiv.org/pdf/1705.02315.pdf

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai