Andersonin kulma
Suosittu COVIDx-tietokanta arvosteltiin Yhdistyneen kuningaskunnan tutkijoiden toimesta

Tutkimuskonsortio Yhdistyneestä kuningaskunnasta on esittänyt arvostelua avoimien tietokantojen tieteellisen luotettavuuden laajuudesta, joita käytetään tietokoneavusteisen analyysin toteuttamiseen COVID-19-potilaiden röntgenkuvissa, keskittyen suositulle avoimeen lähdekoodiin perustuvaan COVIDx-tietokantaan.
Tutkijat, jotka ovat testanneet COVIDx:ää useissa tekoälymallissa, väittävät, että se “ei ole edustava todellista kliinistä ongelmaa”, että siitä saatavat tulokset ovat “ylilyöntejä” ja että mallit “eivät yleisty hyvin” todellisen maailman tietoihin.
Kirjoittajat huomauttavat myös alkuperäisen tietokannan epäjohdonmukaisuutta, joka koostuu monista eri resoluutioista olevista alkuperäisistä kuvista, jotka muunnetaan automaattisesti syvän oppimisen työnkulun mukaisesti yhdenmukaisiksi kokoiksi, jotka ovat välttämättömiä koulutusta varten, ja toteavat, että tämä prosessi voi aiheuttaa petollisia artefakteja, jotka liittyvät kuvan muuttamisalgoritmiin, eikä tietojen kliiniseen puoleen.
Tutkimus on nimeltään Avointen tietojen käytön haitat syvän oppimisen ratkaisujen kehittämisessä COVID-19-taudin havaitsemiseksi röntgenkuvissa, ja se on yhteistyö Unite.AIn kanssa, yhdessä viiden muun järjestön kanssa samasta kaupungista, mukaan lukien Leedsin opetus sairaalat NHS Trust.
Tutkimuksessa käydään läpi muun muassa COVIDx-tietokannan “väärinkäytön” sekä “korkean riskin harhaa ja sekaantumista”. Tutkijoiden omat kokeet tietokannan käytöstä kolmessa toimivassa syvän oppimisen mallissa johtivat siihen, että “poikkeuksellinen suorituskyky, jota on laajasti raportoitu ongelman alueella, on ylilyönti, mallin suorituskyvyn tulokset ovat väärin esitettyjä, ja mallit eivät yleisty hyvin kliinisesti realistisiin tietoihin.”
Vielä lähellä..?
Tutkijat tutkivat osallistuvien tietokantojen alkuperää ja soveltuvuutta COVIDx:ään tutkimuksen aikana ja löysivät “väärinkäytön” RSNA-tietokannasta, jossa tietoja yhdistettiin toiseen luokkaan:
‘RSNA-repositorio, joka käyttää julkisesti saatavilla olevia röntgenkuvia NIH Chestx-ray8:sta [**], oli suunniteltu segmentointitehtävää varten ja sisälsi kolme kuvien luokkaa, ‘Lung Opacity’, ‘No Lung Opacity/Not Normal’, ja ‘Normal’, joissa oli saatavilla reunakkeet ‘Lung Opacity’ -tapauksille.
‘Kun se koottiin COVIDx:ään, kaikki röntgenkuvat ‘Lung Opacity’ -luokasta sisällytettiin keuhkokuumeen luokkaan.’
Tutkijat toteavat, että COVIDx-menetelmä laajentaa keuhkokuumeen määritelmän kattamaan “kaikki keuhkokuumeen kaltaiset ilmavaivat”. Tämä uhkaa vertailukelpoisuuden arvoa eri tietotyyppien välillä. Tutkijat toteavat:
‘ […] keuhkokuumeen luokka COVIDx-tietokannassa sisältää röntgenkuvia, joissa on joukko muita patologioita, mukaan lukien pleuraeffuusio, infiltraatio, konsolidaatio, emfyseema ja massat. Konsolidaatio on radiologinen piirre, joka mahdollisesti johtuu keuhkokuumeesta, ei kliininen diagnosi. Käyttää konsolidaatiota keuhkokuumeen korvikkeena ilman asiakirjaa on mahdollisesti harhaanjohtava.’

Vaihtoehtoiset patologiat (pl. COVID-19) liittyvät COVIDx:ään. Lähde: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf
Tutkimus osoittaa, että vain 6,13 % 4305 keuhkokuumeen tapauksesta, jotka peräisin RSNA:sta, oli oikein merkitty, edustaen vain 265 aitoa keuhkokuumeen tapausta.
Lisäksi monet ei-keuhkokuumeen tapauksista, jotka sisältyvät COVIDx:ään, edustavat komorbiditeetteja – muita sairauksien komplikaatioita tai toissijaisia lääketieteellisiä ongelmia, joita ei välttämättä liity keuhkokuumeeseen.
Ei ‘normaalia’
Tutkimus ehdottaa myös, että RSNA-haasteen tietokannan vaikutus COVIDx:ään on vinouttanut tietojen empiirisen vakauden. Tutkijat huomauttavat, että COVIDx priorisoi RSNA-tietokannan “normaalin” luokan, jättäen kaikki “ei keuhko-epätavallisuus/ei normaali” -luokat laajempaan tietokantaan. Tutkimus toteaa:
‘Vaikka tämä on sopusoinnussa siitä, mitä odotetaan ‘normaaliluokan’ sisällä, keuhkokuumeen luokan laajentaminen ja ainoastaan ‘normaaleiden’ röntgenkuville keskittyminen yksinkertaistaa luokittelutehtävää.
‘Lopputuloksena on tietokanta, joka heijastaa tehtävää, joka on poissa todellisesta kliinisestä ongelmanratkaisusta.’
Potential Biases From Incompatible Data Standards
Tutkimus huomauttaa useita muita tietokannan vinoumia, huomauttaen, että osa tietokannan osista yhdistää lasten röntgenkuvat aikuisten potilaiden kuviin, ja toteaa, että tämä tieto on ainoa “merkittävä” lähde lasten kuvista COVIDx:ään.
Tutkijat toteavat myös, että RSNA-tietokannan kuvat ovat 1024×1024 resoluutiota, kun taas toinen tietokanta tarjoaa kuvia vain 299×299 resoluutiota. Koska tekoälymallit muuttavat kuvat aina sopimaan saatavilla olevaan koulutusavaruuteen (latenttiavaruus), tämä tarkoittaa, että 299×299 kuvat skaalataan ylös koulutusprosessissa (mahdollisesti johtuen skaalauksesta aiheutuvista artefakteista), ja suuremmat kuvat pienennetään. Tämä taas vaikuttaa epäedullisesti homogeenisten tietokannan standardien tarpeeseen tekoälypohjaisessa tietokoneavusteisessa analyysissä.
Lisäksi ActMed-tietokanta, joka on sisällytetty COVIDx:ään, sisältää “levymäisiä merkintöjä” COVID-19-röntgenkuvissa, toistuvan piirteen, joka on ristiriidassa laajemman tietokannan kanssa, ja joka vaatisi käsittelyä “toistuvana poikkeuksellisena”.
Tämä on ongelma, jota yleensä käsitellään puhdistamalla tai poistamalla tietoa, koska merkintöjen toistuminen on tarpeeksi rekisteröityä “piirre” koulutuksessa, mutta ei tarpeeksi usein yleistää laajemmassa tietokannassa. Ilman mekanismia, jolla voidaan vähentää näiden merkintöjen vaikutusta, ne voivat potentiaalisesti johtaa tekoälyjärjestelmän menetelmän mukaan patologisiin ilmiöihin.
Koulutus ja testaus
Tutkijat testasivat COVIDx:ää kahteen vertailutietokantaan kolmessa mallissa. Kaksi muuta tietokantaa olivat RICORD, joka sisältää 1096 COVID-19-röntgenkuvaa 361 potilaalta neljästä maasta, ja CheXpert, joka on julkinen tietokanta
Kolme mallia, joita käytettiin, olivat COVID-Net, CoroNet ja DarkCovidNet. Kaikki kolme mallia käyttävät konvoluutio-neuroverkkoja (CNN), vaikka CoroNet koostuu kahden vaiheen kuvien luokitteluprosessista, jossa autoenkooderit siirtävät tulokset CNN-luokittelijalle.
Testaus osoitti “jyrkkään laskuun” kaikkien mallien suorituskyvyssä ei-COVIDx-tietokannoissa verrattuna 86 %:n tarkkuuteen, joka saavutettiin käyttämällä COVIDx-tietokantaa. Tutkijat huomauttivat kuitenkin, että jos tietoja on väärin merkitty tai ryhmitelty, nämä ovat tehokkaasti virheellisiä tuloksia. Tutkimus ehdotti myös, että mallien suorituskyky oli paljon heikompaa vertailukelpoisissa ulkoisissa tietokannoissa, joita tutkimus esittää realistisempana ja oikein luokiteltuna tietona.
Lisäksi tutkimus toteaa:
‘Kliininen tarkastelu 500 grad-CAM-salienssikartasta, jotka on generoitu ennusteen avulla COVIDx-testidatalle, osoitti merkittävän suunnan, joka liittyi kliinisesti merkityksettömiin piirteisiin. Tämä sisälsi usein fokusoitumisen luurankorakenteisiin ja pehmeisiin kudoksiin sijaan hajaantuneen bilateraalisen keuhkojen peittävyyden, joka on tyypillistä COVID-19-infektioon.’

Tämä on röntgenkuva vahvistetusta COVID-19-tapauksesta, jolle on annettu vain 0,938 ennustus todennäköisyys COVIDx:stä, joka on koulutettu DarkCovidNetillä.
Johtopäätökset
Tutkijat arvostelevat röntgenkuvien demograafisten tai kliinisten tietojen puutetta COVIDx:ään, väittäen, että ilman näitä tietoja on mahdoton ottaa huomioon “sekaantumisen tekijöitä”, kuten ikää.
He toteavat myös, että ongelmat, joita havaittiin COVIDx-tietokannassa, voivat olla sovellettavissa muihin tietokantoihin, jotka on koottu samalla tavoin (yhdistämällä pre-COVID-radiologiset tietokannat COVID-19-röntgenkuviin ilman riittävää tietoarkkitehtuuria, varianssikorjausta ja selkeää rajauksen määrittelyä).
Tutkijat yhteenvedon COVIDx-tietokannan puutteista toteavat, että tutkijat katsovat, että ‘poikkeuksellinen suorituskyky [COVIDx:stä] on raportoitu laajasti ongelman alueella, on ylilyönti, mallin suorituskyvyn tulokset ovat väärin esitettyjä, ja mallit eivät yleisty hyvin kliinisesti realistisiin tietoihin.’
Tutkimus päättyy:
‘Saatavissa olevan sairaalatiedon puute yhdistettynä riittämättömään mallin arviointiin ongelman alueella on sallinut avoimen lähdekoodin tietojen käytön harhaanjohtamaan tutkimusyhteisöä. Jatkuvasti julkaistujen mallin suorituskyvyn mittareiden inflaatio uhkaa vahingoittaa tekoälytutkimuksen luotettavuutta lääketieteellisissä diagnostiikoissa, erityisesti silloin, kun tauti on suurella yleisön mielenkiinnon kohteena. Tämän alan tutkimuksen on parannuttava laatuaan estääkseen tämän tapahtumisen, ja tämä on aloitettava tiedoista.’
*Vaikka tutkijat väittävät, että he ovat tehneet datan, tiedostot ja koodin uudesta tutkimuksesta verkkoon, pääsy vaatii kirjautumisen, ja kirjoitushetkellä ei ole yleistä pääsyä tiedostoihin.
** ChestX-ray8: Sairaala-asteen röntgenkuvaus- ja benchmark-tietokanta heikosti valvottujen yleisten rintakehän sairauksien luokittelun ja lokalisaation osalta – https://arxiv.org/pdf/1705.02315.pdf












