Unghiul lui Anderson

Baza de date COVIDx populară criticată de cercetătorii britanici

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Un consorțiu de cercetare din Regatul Unit a criticat nivelul de încredere științifică acordat seturilor de date deschise utilizate pentru analiza bazată pe inteligență artificială a radiografiilor toracice ale pacienților cu COVID-19, concentrându-se pe setul de date deschis popular COVIDx.

Cercetătorii, care au testat COVIDx în diverse modele de antrenare AI, afirmă că acesta nu este “reprezentativ pentru problema clinică reală”, că rezultatele obținute prin utilizarea sa sunt “inflamate” și că modelele “nu se generalizează bine” la datele din lumea reală.

Autorii notează, de asemenea, inconsistena datelor contribuite care alcătuiesc COVIDx, unde imaginile originale vin într-o varietate de rezoluții care sunt reformate automat de fluxul de lucru de învățare profundă în dimensiunile consistente necesare pentru antrenare și observă că acest proces poate introduce artefacte înșelătoare legate de algoritmul de redimensionare a imaginii, mai degrabă decât aspectul clinic al datelor.

Articolul se numește Căderile utilizării datelor deschise pentru a dezvolta soluții de învățare profundă pentru detectarea COVID-19 în radiografii toracice și este o colaborare între Centrul de Imagistică Computațională și Simulare în Biomedicină (CISTIB) de la Universitatea din Leeds, împreună cu cercetători de la alte cinci organizații din același oraș, inclusiv Leeds Teaching Hospitals NHS Trust.

Cercetarea detaliază, printre alte practici negative, “abuzul de etichete” în setul de date COVIDx, precum și “un risc ridicat de bias și confundare”. Experimentele proprii ale cercetătorilor în testarea setului de date prin trei modele viabile de învățare profundă i-au determinat să concluzioneze că “performanța excepțională raportată pe scară largă în domeniu este inflată, că rezultatele performanței modelului sunt reprezentate în mod greșit și că modelele nu se generalizează bine la date clinice realiste.”

Cinci seturi de date contrastante într-unul

Raportul* notează că majoritatea metodologiilor actuale bazate pe IA din acest domeniu depind de o “asortiment heterogen” de date din depozite deschise disparate, observând că cinci seturi de date cu caracteristici notabil de diferite au fost aglomerate în setul de date COVIDx, în ciuda (în considerarea cercetătorilor) lipsei de paritate a calității și tipului de date.

Setul de date COVIDx a fost lansat în mai 2020 ca efort de consorțiu condus de Departamentul de Proiectare a Sistemelor de la Universitatea din Waterloo, Canada, cu datele puse la dispoziție ca parte a Inițiativei COVID-Net Open Source.

Cele cinci colecții care constituie COVIDx sunt: colecția de date de imagine COVID-19 (un set deschis de la cercetători din Montreal); inițiativa setului de date de radiografie toracică COVID-19 inițiativă; setul de date de radiografie toracică COVID-19 Actualmed dataset; baza de date de radiografie COVID-19 Database; și setul de date al concursului de detectare a pneumoniei RSNA dataset, unul dintre multele seturi pre-COVID care au fost folosite pentru criza pandemică.

(RICORD – așa cum se menționează mai jos – a fost adăugat ulterior la COVIDx, dar deoarece a fost inclus după modelele de interes în studiu, a fost exclus din datele de test și, în orice caz, a tendința de a varia COVIDx și mai mult, ceea ce este plângerea centrală a autorilor studiului.)

Cercetătorii susțin că COVIDx este “cel mai mare și cel mai utilizat” set de date de acest tip în cadrul comunității științifice legate de cercetarea COVID, și că datele importate în COVIDx din seturile de date externe constitutive nu se conformează adecvat schemei tripartite a setului de date COVIDx (adică “normal”, “pneumonie” și “COVID-19”).

Aproape suficient..?

În examinarea provenienței și a adecvării seturilor de date contributive pentru COVIDx la momentul studiului, cercetătorii au găsit “abuz” de datele RSNA, unde date de un anumit tip au fost, după cum afirmă cercetătorii, încadrate într-o altă categorie:

‘Depozitul RSNA, care utilizează date de radiografie toracică publice de la NIH Chestx-ray8 [**], a fost conceput pentru o sarcină de segmentare și, ca atare, conține trei clase de imagini, ‘Opacitate pulmonară’, ‘Fără opacitate pulmonară/Ne-normal’ și ‘Normal’, cu cutii de delimitare disponibile pentru cazurile ‘Opacitate pulmonară’.

‘În compilația sa în COVIDx, toate radiografiile toracice din clasa ‘Opacitate pulmonară’ sunt incluse în clasa pneumonie.’

Eficient, articolul afirmă că metodologia COVIDx extinde definiția “pneumoniei” pentru a include “toate opacitățile pulmonare asemănătoare pneumoniei”. În consecință, valoarea comparativă a tipurilor de date este (presupus) amenințată. Cercetătorii afirmă:

‘ […] clasa pneumonie din setul de date COVIDx conține radiografii toracice cu o varietate de alte patologii, inclusiv efuziune pleurală, infiltrare, consolidare, emfizem și mase. Consolidarea este o caracteristică radiologică a posibilei pneumonii, nu o diagnosticare clinică. A folosi consolidarea ca substitut pentru pneumonie fără a documenta acest lucru este potențial înșelător.’

Patologii alternative (în afara COVID-19) asociate cu COVIDx.

Patologii alternative (în afara COVID-19) asociate cu COVIDx. Sursă: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Raportul constată că doar 6,13% din cele 4.305 cazuri de pneumonie sursă din RSNA au fost etichetate corect, reprezentând doar 265 de cazuri reale de pneumonie.

Mai mult, multe dintre cazurile non-pneumonice incluse în COVIDx reprezentau comorbidități – complicații ale altor boli sau, altfel, probleme medicale secundare în condiții care nu sunt necesar legate de pneumonie.

Nu este “normal”

Raportul sugerează, de asemenea, că influența setului de date de provocare RSNA în COVIDx a afectat stabilitatea empirică a datelor. Cercetătorii observă că COVIDx prioritizează clasa “normală” a datelor RSNA, excluzând efectiv toate clasele “fără opacitate pulmonară/ne-normal” din setul de date mai larg. Articolul spune:

‘În timp ce acest lucru este în conformitate cu ceea ce se așteaptă în cadrul etichetei “normale”, extinderea clasei pneumonie și utilizarea numai a radiografiilor toracice “normale”, mai degrabă decât cazurile negative de pneumonie, simplifică în mod semnificativ sarcina de clasificare.

‘Rezultatul final al acestui fapt este un set de date care reflectă o sarcină care este îndepărtată de problema clinică reală.’

Potențiale prejudecăți din cauza standardelor de date incompatibile

Articolul identifică o serie de alte tipuri de prejudecăți în COVIDx, notând că unele dintre datele contributive amestecă imagini de radiografie toracică pediatrică cu radiografiile toracice ale pacienților adulți și observă, de asemenea, că aceste date sunt singura “sursă semnificativă” de imagini pediatrică în COVIDx.

De asemenea, imaginile din setul de date RSNA au o rezoluție de 1024×1024, în timp ce un alt set de date contributive oferă imagini cu o rezoluție de numai 299×299. Deoarece modelele de învățare automată vor redimensiona în mod inevitabil imaginile pentru a se potrivi cu spațiul de antrenare disponibil (spațiu latent), acest lucru înseamnă că imaginile 299×299 vor fi mărite într-un flux de lucru de antrenare (posibil conducând la artefacte legate de un algoritm de redimensionare, mai degrabă decât de patologie), iar imaginile mai mari vor fi reduse. Din nou, acest lucru se împotrivește standardelor omogene de date necesare pentru analiza de vedere a computerului bazată pe IA.

Mai mult, datele ActMed incluse în COVIDx conțin “markeri discuri” în radiografiile toracice COVID-19, o caracteristică recurentă care este incompatibilă cu setul de date mai larg și care ar trebui să fie tratată ca “outlier repetitiv”.

Acesta este felul de problemă care este de obicei abordată prin curățarea sau omisiunea datelor, deoarece recurența markerilor este suficientă pentru a fi înregistrată ca “caracteristică” în antrenare, dar nu este suficient de frecventă pentru a se generaliza util în schema mai largă a setului de date. Fără un mecanism pentru a disconta influența markerilor artificiali, aceștia ar putea fi considerați de metodologia sistemului de învățare automată ca fenomene patologice.

Antrenare și testare

Cercetătorii au testat COVIDx împotriva a două seturi de date comparative prin trei modele. Celelalte două seturi de date au fost RICORD, care conține 1096 de radiografii toracice COVID-19 la 361 de pacienți, sursă din patru țări; și CheXpert, un set de date public

Modelele utilizate au fost COVID-Net, CoroNet și DarkCovidNet. Toate cele trei modele utilizează rețele neuronale convolutive (CNN), deși CoroNet constă într-un proces de clasificare a imaginilor în două etape, cu auto-encoderi care transmit ieșirea către un clasificator CNN.

Testarea a arătat o “scădere bruscă” a performanței tuturor modelelor pe seturile de date non-COVIDx comparativ cu acuratețea de 86% care rezultă atunci când se utilizează datele COVIDx. Cu toate acestea, dacă datele sunt etichetate greșit sau grupate greșit, acestea sunt, în esență, rezultate false. Cercetătorii au observat o scădere semnificativă a acurateței pe seturile de date externe comparabile, pe care articolul le propune ca fiind mai realiste și corect etichetate.

Mai mult, articolul observă:

‘O revizuire clinică a 500 de hărți de saliență grad-CAM generate de predicția pe datele de test COVIDx a arătat o tendință de semnificație în caracteristici clinic irelevante. Acest lucru a inclus adesea o focalizare pe structuri osoase și țesuturi moi, în loc de opacifierea difuză bilaterală a câmpurilor pulmonare, care este tipică pentru infecția COVID-19.’

Aceasta este o radiografie a unui caz confirmat de COVID-19, atribuită o probabilitate de predicție de 0,938 de la DarkCovidNet antrenat pe COVIDx. Sursă: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

Aceasta este o radiografie a unui caz confirmat de COVID-19, atribuită o probabilitate de predicție de 0,938 de la DarkCovidNet antrenat pe COVIDx.

Concluzii

Cercetătorii critică lipsa de date demografice sau clinice legate de imaginile radiografice din COVIDx, susținând că, fără acestea, este imposibil să se țină cont de “factori de confuzie” precum vârsta.

De asemenea, observă că problemele găsite în setul de date COVIDx pot fi aplicabile și altor seturi de date care au fost sursă în mod similar (adică prin amestecarea bazelor de date radiologice pre-COVID cu date recente de radiografie COVID, fără o arhitectură de date adecvată, compensarea varianței și o definiție clară a limitărilor acestei abordări).

În rezumat, cercetătorii subliniază incluziunea unilaterală a radiografiilor toracice pediatrică “clare”, precum și percepția lor asupra abuzului de etichete și a riscului ridicat de bias și confundare în COVIDx, susținând că ‘performanța excepțională [a COVIDx] raportată pe scară largă în domeniu este inflată, că rezultatele performanței modelului sunt reprezentate în mod greșit și că modelele nu se generalizează bine la date clinice realiste.’

Raportul concluzionează:

‘Lipsa datelor disponibile din spitale, combinată cu evaluarea inadecvată a modelului pe întreg domeniul, a permis utilizarea datelor deschise pentru a înșela comunitatea de cercetare. Publicarea continuă a metricilor de performanță a modelului inflat riscă să submineze încrederea în cercetarea IA în diagnostica medicală, în special acolo unde boala este de mare interes public. Calitatea cercetării în acest domeniu trebuie să se îmbunătățească pentru a preveni acest lucru, și acest lucru trebuie să înceapă cu datele.’

 

 

*Deși cercetătorii studiului afirmă că au făcut datele, fișierele și codul pentru noul articol disponibile online, accesul necesită autentificare, și, la momentul scrierii, nu există acces public general la fișiere.
** ChestX-ray8: Bază de date de radiografie toracică la scară spitalicească și repere pentru clasificarea slab supravegheată și localizarea bolilor toracice comune –
https://arxiv.org/pdf/1705.02315.pdf

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai