Andersons vinkel

Populära COVIDx-databasen kritiserad av brittiska forskare

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En forskningskonsortium från Storbritannien har riktat kritik mot den vetenskapliga tillförlitlighet som investeras i öppen källkods-databaser som används för datorseende-baserad analys av COVID-19-patienters bröst-röntgenbilder, med fokus på den populära öppna källkods-databasen COVIDx.

Forskarna, som har testat COVIDx i olika AI-träningsmodeller, hävdar att den “inte är representativ för det verkliga kliniska problemet”, att resultaten som erhålls genom att använda den är “överdrivna” och att modellerna “inte generaliserar väl” till verkliga data.

Författarna noterar också inkonsekvensen i de bidragande data som utgör COVIDx, där ursprungsbilder kommer i en mängd olika upplösningar som automatiskt omformateras av den djupa inlärnings-workflown till de konsekventa storlekar som krävs för träning, och observerar att denna process kan introducera bedrägliga artefakter relaterade till bild-omstorlekningsalgoritmen, snarare än den kliniska aspekten av data.

Den rapporten heter De fallgropar som används för att utveckla djupinlärningslösningar för COVID-19-detektering i bröst-röntgenbilder, och är ett samarbete mellan Centrum för beräkningsbaserad avbildning och simulering inom biomedicin (CISTIB) vid University of Leeds, tillsammans med forskare från fem andra organisationer i samma stad, inklusive Leeds Teaching Hospitals NHS Trust.

Forskningen detaljerar, bland annat negativa metoder, “missbruk av etiketter” i COVIDx-databasen, samt en “hög risk för bias och sammanblandning”. Forskarnas egna experiment med att köra databasen genom tre olika djupinlärningsmodeller ledde dem till att dra slutsatsen att ‘den exceptionella prestationen som rapporteras över hela problemområdet är överdriven, att modellprestationsresultaten är missrepresenterade, och att modellerna inte generaliserar väl till kliniskt realistiska data.’

Fem kontrasterande databaser i en

Rapporten* noterar att de flesta nuvarande AI-baserade metoder inom detta område är beroende av en “heterogen” samling av data från olika öppna källkods-repositorier, och observerar att fem databaser med olika egenskaper har samlats in i COVIDx-databasen trots (enligt forskarnas bedömning) otillräcklig likvärdighet i datakvalitet och typ.

COVIDx-databasen släpptes i maj 2020 som ett konsortie-ansträngning lett av Institutionen för systemdesign-teknik vid University of Waterloo i Kanada, med data tillgänglig som en del av COVID-Net Open Source Initiative.

De fem samlingar som utgör COVIDx är: COVID-19 Image Data Collection (en öppen källkods-samling från Montreal-forskare); COVID-19 Chest X-ray Dataset initiativ; Actualmed COVID-19 Chest X-ray databas; COVID-19 Radiography Databas; och RSNA Pneumonia Detection Challenge databas, en av de många pre-COVID-samlingar som har pressats in i tjänst för pandemikrisen.

(RICORD – se nedan – har sedan lagts till i COVIDx, men eftersom det lades till efter de modeller som studerades i studien, uteslöts det från testdata, och i alla fall skulle det ha tenderat att variera COVIDx ännu mer, vilket är den centrala klagomålet från studiens författare.)

Forskarna hävdar att COVIDx är den ‘största och mest använda’ databasen av sitt slag inom den vetenskapliga gemenskapen relaterad till COVID-forskning, och att data som importeras till COVIDx från de bidragande externa databaserna inte tillräckligt anpassar sig till den tredelade schemat för COVIDx-databasen (dvs. ‘normal’, ‘pneumoni’ och ‘COVID-19’).

Tillräckligt nära..?

Vid undersökning av ursprunget och lämpligheten för de bidragande databaserna för COVIDx vid tidpunkten för studien, fann forskarna ‘missbruk’ av RSNA-data, där data av en typ har, enligt forskarna, herdat in i en annan kategori:

‘RSNA-repositoriet, som använder offentligt tillgängliga bröst-röntgenbilder från NIH Chestx-ray8 [**], var utformat för en segmenteringsuppgift och innehåller därför tre klasser av bilder, ‘Lung Opacity’, ‘No Lung Opacity/Not Normal’, och ‘Normal’, med begränsningsrutor tillgängliga för ‘Lung Opacity’-fall.

‘När det samlas in i COVIDx inkluderas alla bröst-röntgenbilder från ‘Lung Opacity’-klassen i pneumoni-klassen.’

Effektivt, hävdar rapporten, utvidgar COVIDx-metodiken definitionen av ‘pneumoni’ för att inkludera ‘alla pneumoni-liknande lung-opaciteter’. Följaktligen, hävdar forskarna, hotas den lik-värde-värde av jämförbara data typer.

‘ […] pneumoni-klassen inom COVIDx-databasen innehåller bröst-röntgenbilder med en samling av många andra patologier, inklusive pleurautgjutning, infiltration, konsolidering, emfysem och massor. Konsolidering är en radiologisk egenskap av möjlig pneumoni, inte en klinisk diagnos. Att använda konsolidering som en ersättning för pneumoni utan att dokumentera detta är potentiellt vilseledande.’

Alternativa patologier (förutom COVID-19) associerade med COVIDx.

Alternativa patologier (förutom COVID-19) associerade med COVIDx. Källa: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Rapporten finner att endast 6,13% av de 4 305 pneumoni-fallen som hämtats från RSNA var korrekt etiketterade, vilket representerar endast 265 äkta pneumoni-fall.

Ytterligare, många av de icke-pneumoni-fall som ingår i COVIDx representerade komorbiditeter – komplikationer av andra sjukdomar, eller annars sekundära medicinska problem i tillstånd som inte nödvändigtvis är relaterade till pneumoni.

Inte ‘Normal’

Rapporten föreslår vidare att inflytandet från RSNA-utmanings-databasen i COVIDx har snedvridit den empiriska stabiliteten i data. Forskarna observerar att COVIDx prioriterar ‘normal’-klassen i RSNA-data, effektivt uteslutande alla ‘no lung opacity/not normal’-klasser i den bredare databasen. Rapporten säger:

‘Medan detta är i överensstämmelse med vad som förväntas inom ‘normal’-etiketten, utvidgar pneumoni-klassen och använder endast ‘normala’ bröst-röntgenbilder, snarare än pneumonia-negativa fall, förenklar detta avsevärt klassificeringsuppgiften.

‘Det slutliga resultatet av detta är en databas som reflekterar en uppgift som är avlägsen från det verkliga kliniska problemet.’

Potentiella bias från oförenliga datastandarder

Rapporten påvisar ett antal andra typer av bias i COVIDx, och noterar att vissa av de bidragande data blandar pediatriska bröst-röntgenbilder med vuxna patienters röntgenbilder, och observerar att denna data är den enda “signifikanta” källan till pediatriska bilder i COVIDx.

Även bilder från RSNA-databasen har en upplösning på 1024×1024, medan en annan bidragande databas endast tillhandahåller bilder med en upplösning på 299×299. Eftersom maskinlärningsmodeller kommer att omforma bilder för att anpassa sig till den tillgängliga träningsutrymmet (latent utrymme), innebär detta att 299×299-bilderna kommer att skalas upp i en tränings-workflow (potentiellt leder till artefakter relaterade till en skalningsalgoritm snarare än patologi), och de större bilderna skalas ner. Återigen, detta motverkar den homogena datastandard som krävs för AI-baserad datorseende-analys.

Dessutom innehåller ActMed-data som ingår i COVIDx “skivformade markörer” i COVID-19-bröst-röntgenbilder, en återkommande funktion som är inkonsekvent med den bredare databasen, och som skulle behöva hanteras som en “återkommande outlier”.

Detta är den typ av problem som vanligtvis hanteras genom att rensa eller utelämna data, eftersom återkomsten av markörerna är tillräcklig för att registrera som en “funktion” i träning, men inte tillräckligt frekvent för att generalisera användbart i den bredare databasen. Utan en mekanism för att diskontera inflytandet av de artificiella markörerna, kunde de potentiellt betraktas av maskinlärnings-systemets metod som patologiska fenomen.

Träning och testning

Forskarna testade COVIDx mot två jämförbara databaser över tre modeller. De extra två databaserna var RICORD, som innehåller 1096 COVID-19-bröst-röntgenbilder över 361 patienter, hämtade från fyra länder; och CheXpert, en offentlig databas

De tre modellerna som användes var COVID-Net, CoroNet och DarkCovidNet. Alla tre modellerna använder Convolutional Neural Networks (CNN), även om CoroNet består av en två-stegs bild-klassificeringsprocess, med autoencoders som skickar utdata till en CNN-klassificerare.

Testningen visade en “brant nedgång” i alla modellprestationer på icke-COVIDx-databaser jämfört med den 86% noggrannhet som resulterade när COVIDx-data användes. Men, om data är felaktigt etiketterade eller felgrupperade, är dessa effektivt falska resultat. Forskarna noterade kraftigt minskade noggrannhetsresultat på de jämförbara externa databaserna, som rapporten föreslår som mer realistiska och korrekt klassificerade data.

Rapporten observerar vidare:

‘En klinisk granskning av 500 grad-CAM-saliens-kartor som genererats av förutsägelse på COVIDx-testdata visade en trend av signifikans i kliniskt irrelevanta funktioner. Detta inkluderade ofta fokus på benvävnad och mjukvävnad istället för diffus bilateral opacification av lungfält som är typiska för COVID-19-infektion.’

Detta är en röntgenbild av ett bekräftat COVID-19-fall, tilldelat en förväntad sannolikhet på 0,938 från COVIDx tränad på DarkCovidNet. Källa: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Detta är en röntgenbild av ett bekräftat COVID-19-fall, tilldelat en förväntad sannolikhet på 0,938 från COVIDx tränad på DarkCovidNet.

Slutsatser

Forskarna kritiserar bristen på demografisk eller klinisk data relaterad till röntgenbilderna i COVIDx, och hävdar att utan dessa är det omöjligt att ta hänsyn till “sammanblandningsfaktorer” som ålder.

De observerar också att de problem som påträffats i COVIDx-databasen kan vara tillämpliga på andra databaser som samlades in på ett liknande sätt (dvs. genom att blanda pre-COVID-radiologiska bild-databaser med nyliga COVID-röntgenbildsdata utan tillräcklig data-arkitektur, varians-kompensation och tydlig omfattning av begränsningarna i denna metod).

I sammanfattning av bristerna i COVIDx, betonar forskarna den ensidiga inklusionen av “klara” pediatriska röntgenbilder, samt deras uppfattning om missbruk av etiketter och hög risk för bias och sammanblandning i COVIDx, och hävdar att ‘den exceptionella prestationen [av COVIDx] som rapporteras över hela problemområdet är överdriven, att modellprestationsresultaten är missrepresenterade, och att modellerna inte generaliserar väl till kliniskt realistiska data.’

Rapporten sluts:

‘En brist på tillgängliga sjukhusdata kombinerad med otillräcklig modellutvärdering över problemområdet har tillåtit användningen av öppen källkods-data att vilseleda forskarsamhället. Fortsatt publicering av överdrivna modellprestationsmått riskerar att skada tillförlitligheten i AI-forskning inom medicinsk diagnostik, särskilt där sjukdomen är av stort allmänt intresse. Forskningens kvalitet inom detta område måste förbättras för att förhindra att detta sker, och detta måste börja med data.’

 

 

*Även om forskarna i studien hävdar att de har gjort data, filer och kod för den nya rapporten tillgänglig online, krävs inloggning, och vid tidpunkten för skrivandet fanns ingen allmän tillgång till filerna tillgänglig.
** ChestX-ray8: Hospital-scale Chest X-ray Database and Benchmarks on Weakly-Supervised Classification and Localization of Common Thorax Diseases – https://arxiv.org/pdf/1705.02315.pdf

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai