Andersons vinkel

Populær COVIDx-dataset kritiseret af britiske forskere

mm
Føj Unite.AI til dine foretrukne kilder på Google

En forskningskonsortium fra Storbritannien har rettet kritik mod omfanget af den videnskabelige tillid, der er tillagt åbne kildedatasæt, der bruges til computerbaseret analyse af COVID-19-patienters bryst-røntgenbilleder, med fokus på det populære åbne kildedatasæt COVIDx.

Forskerne, der har testet COVIDx i forskellige AI-træningsmodeller, hævder, at det ikke er “repræsentativt for det virkelige kliniske problem”, at resultaterne, der er opnået ved at bruge det, er “inflaterede”, og at modellerne “ikke generaliserer godt” til virkelige data.

Forfatterne bemærker også inkonsistensen i de bidragne data, der udgør COVIDx, hvor originale billeder kommer i en række opløsninger, der automatisk omformateres af den dybe læringsworkflow til de konsekvente størrelser, der er nødvendige for træning, og observerer, at denne proces kan introducere bedragende artefakter relateret til billedomformateringsalgoritmen, snarere end det kliniske aspekt af data.

Rapporten hedder De fælder ved at bruge åbne data til at udvikle dyb læringsløsninger til COVID-19-detection i bryst-røntgenbilleder, og er en samarbejdsprojekt mellem Center for Computational Imaging & Simulation in Biomedicine (CISTIB) på University of Leeds, sammen med forskere fra fem andre organisationer i samme by, herunder Leeds Teaching Hospitals NHS Trust.

Forskningen detaljer, blandt andet, de negative praksisser, såsom “misbrug af mærker” i COVIDx-datasættet, samt en “høj risiko for bias og konfundering”. Forskerne egne eksperimenter med at sætte datasættet igennem tre anvendelige dyb læringsmodeller fik dem til at konkludere, at ‘den ekstraordinære præstation, der er rapporteret bredt over problemområdet, er inflateret, at modelpræstationsresultaterne er misrepræsenteret, og at modellerne ikke generaliserer godt til klinisk-realisticke data.’

Fem modsatrettede datasæt i ét

Rapporten* bemærker, at de fleste nuværende AI-baserede metoder i dette felt afhænger af en “heterogen” samling af data fra forskellige åbne kilderepositorier, og observerer, at fem datasæt med bemærkelsesværdigt forskellige karakteristika er blevet kombineret i COVIDx-datasættet, på trods af (ifølge forskerne) utilstrækkelig lighed i datasættets kvalitet og type.

COVIDx-datasættet blev frigivet i maj 2020 som et konsortiumsprojekt ledet af Department of Systems Design Engineering på University of Waterloo i Canada, med data gjort tilgængelig som en del af COVID-Net Open Source Initiative.

De fem samlinger, der udgør COVIDx, er: COVID-19 Image Data Collection (en åben kilde fra Montreal-forskere); COVID-19 Chest X-ray Dataset initiativ; Actualmed COVID-19 Chest X-ray datasæt; COVID-19 Radiography Database; og RSNA Pneumonia Detection Challenge datasæt, et af de mange præ-COVID-sæt, der er blevet presset i tjeneste for pandemikrisen.

(RICORD – se nedenfor – er siden blevet tilføjet til COVIDx, men da det blev inkluderet efter de modeller, der var af interesse i studiet, blev det ekskluderet fra testdata, og i hvert fald ville det have en tendens til at variere COVIDx endnu mere, hvilket er det centrale klagepunkt for studiets forfattere.)

Forskerne hævder, at COVIDx er det ‘største og mest anvendte’ datasæt af sin art inden for den videnskabelige fællesskab relateret til COVID-forskning, og at data, der importeres til COVIDx fra de konstituerende eksterne datasæt, ikke tilstrækkeligt overholder det tredelte schema for COVIDx-datasættet (dvs. ‘normal’, ‘pneumoni’ og ‘COVID-19’).

Nær nok..?

Ved at undersøge oprindelsen og egnetheden af de bidragne datasæt til COVIDx på tidspunktet for studiet, fandt forskerne ‘misbrug’ af RSNA-data, hvor data af en type er blevet ført ind i en anden kategori:

‘RSNA-repositoriet, der bruger offentligt tilgængelige bryst-røntgenbilleder fra NIH Chestx-ray8 [**], var designet til en segmenteringsopgave og indeholder derfor tre klasser af billeder, ‘Lung Opacity’, ‘No Lung Opacity/Not Normal’, og ‘Normal’, med bounding boxes tilgængelige for ‘Lung Opacity’-sager.

‘Ved at kombinere det med COVIDx er alle bryst-røntgenbilleder fra ‘Lung Opacity’-klassen inkluderet i pneumoni-klassen.’

Effektivt, hævder rapporten, udvider COVIDx-metoden definitionen af ‘pneumoni’ til at omfatte ‘alle pneumoni-lignende lung-opaciteter’. Derved truer det sammenligneligheden af sammenlignelige datatyper. Forskerne fastslår:

‘ […] pneumoni-klassen i COVIDx-datasættet indeholder bryst-røntgenbilleder med en samling af mange andre patologier, herunder pleural effusion, infiltration, konsolidering, emfysem og masses. Konsolidering er en radiologisk egenskab af mulig pneumoni, ikke en klinisk diagnose. At bruge konsolidering som erstatning for pneumoni uden at dokumentere dette kan være potentielt misvisende.’

Alternative patologier (ud over COVID-19) associeret med COVIDx.

Alternative patologier (ud over COVID-19) associeret med COVIDx. Kilde: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Rapporten finder, at kun 6,13% af de 4.305 pneumoni-sager fra RSNA var korrekt mærket, svarende til kun 265 ægte pneumoni-sager.

Yderligere var mange af de ikke-pneumoni-sager, der var inkluderet i COVIDx, komorbiditeter – komplicationer af andre sygdomme eller sekundære medicinske problemer i tilfælde, der ikke nødvendigvis er relateret til pneumoni.

Ikke ‘Normal’

Rapporten foreslår yderligere, at indflydelsen fra RSNA-udfordringsdatasættet i COVIDx har forvrænget den empiriske stabilitet af data. Forskerne observerer, at COVIDx prioriterer ‘normal’-klassen af RSNA-data, effektivt udelukkende alle ‘no lung opacity/not normal’-klasser i det bredere datasæt. Rapporten siger:

‘Dette er i overensstemmelse med, hvad der forventes inden for ‘normal’-mærket, men udvider pneumoni-klassen og bruger kun ‘normal’ bryst-røntgenbilleder, snarere end pneumoni-negative sager, simplificerer klassificeringsopgaven betydeligt.

‘Det endelige resultat af dette er et datasæt, der reflekterer en opgave, der er fjernet fra det virkelige kliniske problem.’

Potentiale forvrængninger fra inkompatible datastandarder

Rapporten påviser en række andre typer af forvrængninger i COVIDx, herunder, at nogle af de bidragne data kombinerer pediatriske bryst-røntgenbilleder med X-ray-billeder af voksne patienter, og observerer yderligere, at denne data er den eneste “betydelige” kilde til pediatriske billeder i COVIDx.

Også billeder fra RSNA-datasættet har en opløsning på 1024×1024, mens et andet bidragende datasæt kun tilbyder billeder i en opløsning på 299×299. Da maskinlæringsmodeller vil ændre billedstørrelsen for at tilpasse den tilgængelige træningsplads (latent plads), betyder dette, at 299×299-billederne vil blive opskaleret i en træningsworkflow (potentielt førende til artefakter relateret til en skaleringsalgoritme snarere end patologi), og de større billeder nedskaleret. Dette går imod den homogene datastandard, der er nødvendig for AI-baseret computer-vision-analyse.

Yderligere indeholder ActMed-data, der er indtaget i COVIDx, ‘disk-formedige mærker’ i COVID-19-bryst-røntgenbilleder, en tilbagevendende funktion, der er inkonsistent med det bredere datasæt, og som ville kræve en håndtering som en ‘gentagen outlier’.

Dette er den type problem, der normalt håndteres ved at rense eller udelade data, da tilbagevendelsen af mærkerne er nok til at registrere som en “funktion” i træning, men ikke hyppig nok til at generalisere brugbart i datasættets bredere skema. Uden en mekanisme til at diskontere indflydelsen af de kunstige mærker, kunne de potentielt blive betragtet af maskinlæringsmetodens metodik som patologiske fænomener.

Træning og test

Forskerne testede COVIDx mod to sammenlignelige datasæt over tre modeller. De to ekstra datasæt var RICORD, der indeholder 1096 COVID-19-bryst-røntgenbilleder over 361 patienter, fra fire lande; og CheXpert, et offentligt datasæt

De tre modeller, der blev brugt, var COVID-Net, CoroNet og DarkCovidNet. Alle tre modeller anvender Convolutional Neural Networks (CNN), selvom CoroNet består af en to-trins image-klassificeringsproces, med autoencoders, der sender output til en CNN-klassificator.

Testningen viste en ‘stejl nedgang’ i alle modellers præstation på ikke-COVIDx-datasæt i forhold til den 86% nøjagtighed, der resulterede, da COVIDx-data blev brugt. Men hvis data er forkert mærket eller forkert grupperet, er disse effektivt falske resultater. Forskerne bemærkede betydeligt lavere nøjagtighed på de sammenlignelige eksterne datasæt, som rapporten foreslår som mere realistiske og korrekt klassificerede data.

Yderligere observerer rapporten:

‘En klinisk gennemgang af 500 grad-CAM-saliency-kort, der er genereret af forudsigelser på COVIDx-testdata, viste en tendens til betydning i klinisk irrelevante funktioner. Dette inkluderede ofte en fokus på ben-strukturer og bløde væv i stedet for diffuse bilaterale opaciteter i lungernes felt, der er typiske for COVID-19-infektion.’

Dette er et røntgenbillede af en bekræftet COVID-19-sag, der er tildelt en nøjagtighed på 0,938 fra COVIDx trænet på DarkCovidNet. Kilde: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Dette er et røntgenbillede af en bekræftet COVID-19-sag, der er tildelt en nøjagtighed på 0,938 fra COVIDx trænet på DarkCovidNet.

Konklusion

Forskerne kritiserer manglen på demografiske eller kliniske data relateret til røntgenbillederne i COVIDx, og argumenterer for, at uden disse, er det umuligt at tage hensyn til ‘konfunderingsfaktorer’ såsom alder.

De observerer også, at problemerne, der er fundet i COVIDx-datasættet, kan være anvendelige på andre datasæt, der er tilsvarende kildedatasæt (dvs. ved at kombinere præ-COVID-radiologiske billedbasen med ny COVID-røntgenbilleddata uden tilstrækkelig dataarkitektur, varians-kompensation og klar beskrivelse af begrænsningerne i denne tilgang).

I sammenfattende kortlægning af svigtene i COVIDx, fremhæver forskerne den ensidige inklusion af ‘klare’ pediatriske røntgenbilleder, samt deres opfattelse af misbrug af mærker og høj risiko for bias og konfundering i COVIDx, og hævder, at ‘den ekstraordinære præstation [af COVIDx] rapporteret bredt over problemområdet er inflateret, at modelpræstationsresultaterne er misrepræsenteret, og at modellerne ikke generaliserer godt til klinisk-realisticke data.’

Rapporten slutter:

‘Mangel på tilgængelige hospitalsdata kombineret med utilstrækkelig model-evaluering over problemområdet har tilladt brugen af åbne data til at mislede forskningssamfundet. Fortsat offentliggørelse af inflaterede modelpræstationsmetrikker risikerer at skade troværdigheden af AI-forskning i medicinske diagnoser, især hvor sygdommen er af stor offentlig interesse. Forskningens kvalitet i dette område må forbedres for at forhindre dette i at ske, og dette må starte med data.’

 

 

*Selvom forskerne bag studiet hævder, at de har gjort data, filer og kode for den nye rapport tilgængelig online, kræver adgang login, og på tidspunktet for skrivningen var der ingen generel offentlig adgang til filerne.
** ChestX-ray8: Hospital-skala Bryst-røntgen Database og Benchmarks for svagt-overvåget Klassificering og Lokalisering af almindelige Thorax-sygdomme –
https://arxiv.org/pdf/1705.02315.pdf

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai