Η γωνία του Anderson
Λειτουργία του δημοφιλούς συνόλου δεδομένων COVIDx από ερευνητές του Ηνωμένου Βασιλείου

Ένα ερευνητικό консόρτιο από το Ηνωμένο Βασίλειο έχει επιτεθεί στην έκταση της επιστημονικής εμπιστοσύνης που έχει ανατεθεί σε ανοιχτά συνόλα δεδομένων που χρησιμοποιούνται για ανάλυση με βάση την υπολογιστική όραση των ακτίνων Χ των ασθενών με COVID-19, επικεντρώνοντας στο δημοφιλές ανοιχτό σύνολο δεδομένων COVIDx.
Οι ερευνητές, έχοντας δοκιμάσει το COVIDx σε διάφορους μοντέλους εκπαίδευσης AI, ισχυρίζονται ότι δεν είναι «αντιπροσωπευτικό του πραγματικού κλινικού προβλήματος», ότι τα αποτελέσματα που λαμβάνονται με τη χρήση του είναι «περίεργα» και ότι τα μοντέλα «δεν γενικεύουν καλά» σε πραγματικά δεδομένα.
Οι συγγραφείς σημειώνουν επίσης την ασυνέπεια των δεδομένων που συνεισφέρουν στο COVIDx, όπου τα αρχικά εικόνια προέρχονται σε eine ποικιλία ανάλυσεων που αναμορφώνονται αυτόματα από τη διαδικασία του βαθύ μαθηματικού μοντέλου σε συνεχή μεγέθη που απαιτούνται για την εκπαίδευση, και παρατηρούν ότι αυτή η διαδικασία μπορεί να εισαγάγει παραπλανητικά артеφάκτα που σχετίζονται με τον αλγόριθμο αναδιαμόρφωσης εικόνας, αντί για το κλινικό аспект των δεδομένων.
Το έγγραφο ονομάζεται Οι παγίδες της χρήσης ανοιχτών δεδομένων για την ανάπτυξη λύσεων βαθιάς μάθησης για την ανίχνευση COVID-19 σε ακτίνες Χ, και είναι μια συνεργασία μεταξύ του Κέντρου Υπολογιστικής Εικόνας και Προσομοίωσης στη Βιοϊατρική (CISTIB) στο Πανεπιστήμιο του Λιντς, μαζί με ερευνητές από πέντε άλλες οργανώσεις στην ίδια πόλη, συμπεριλαμβανομένου του Leeds Teaching Hospitals NHS Trust.
Η έρευνα περιλαμβάνει, μεταξύ άλλων, τις «κακές πρακτικές» της χρήσης ετικετών στο σύνολο δεδομένων COVIDx, καθώς και «υψηλό κίνδυνο προκατάληψης και σύγκρουσης». Οι πειράματα των ερευνητών με την τοποθέτηση του συνόλου δεδομένων σε τρία εφικτά μοντέλα βαθιάς μάθησης τους οδήγησαν στο συμπέρασμα ότι «η εξαιρετική απόδοση που αναφέρεται ευρέως σε ολόκληρο το πρόβλημα είναι φουσκωμένη, ότι τα αποτελέσματα της απόδοσης του μοντέλου είναι λανθασμένα και ότι τα μοντέλα δεν γενικεύουν καλά σε κλινικά πραγματικά δεδομένα».
Πέντε αντίθετα συνόλα δεδομένων σε ένα
Η αναφορά σημειώνει ότι η πλειοψηφία των τρέχοντων μεθοδολογιών AI σε αυτό το πεδίο βασίζεται σε «ετερογενή» συλλογή δεδομένων από διαφορετικές ανοιχτές πηγές, παρατηρώντας ότι πέντε συνόλα δεδομένων με αξιοσημείωτα διαφορετικά χαρακτηριστικά έχουν συγχωνευθεί στο σύνολο δεδομένων COVIDx, παρά την ανεπαρκή ομοιομορφία της ποιότητας και του τύπου των δεδομένων.
Το σύνολο δεδομένων COVIDx κυκλοφόρησε τον Μάιο του 2020 ως μια προσπάθεια συνόρων με επικεφαλής το Τμήμα Σχεδιασμού Συστημάτων στο Πανεπιστήμιο του Γουότερλου στο Καναδά, με τα δεδομένα διαθέσιμα ως μέρος της Πρωτοβουλίας Ανοιχτού Κώδικα COVID-Net.
Τα πέντε συλλογικά που αποτελούν το COVIDx είναι: η Συλλογή Εικόνων COVID-19 (μια ανοιχτή πηγή από ερευνητές του Μόντρεαλ); η Συλλογή Ακτίνων Χ COVID-19 προσπάθεια; η Συλλογή Ακτίνων Χ COVID-19 Actualmed δεδομένων; η Βάση Δεδομένων Ραδιογραφίας COVID-19 δεδομένων; και η Συλλογή Δεδομένων RSNA για την Ανίχνευση Πνευμονίας αγώνισμα, ένα από τα πολλά προ-COVID συνόλα δεδομένων που έχουν χρησιμοποιηθεί για την κρίση πανδημίας.
(RICORD – δείτε παρακάτω – έχει προστεθεί στο COVIDx, αλλά επειδή προστέθηκε μετά τα μοντέλα που μελετήθηκαν, αποκλείστηκε από τα δεδομένα δοκιμής και σε κάθε περίπτωση θα είχε την τάση να ποικιλόμορφη το COVIDx ακόμη περισσότερο, το οποίο είναι η κεντρική καταγγελία των συγγραφέων της μελέτης.)
Οι ερευνητές ισχυρίζονται ότι το COVIDx είναι το «μεγαλύτερο και πιο ευρέως χρησιμοποιούμενο» σύνολο δεδομένων του είδους του εντός της επιστημονικής κοινότητας που σχετίζεται με την έρευνα COVID, και ότι τα δεδομένα που εισάγονται στο COVIDx από τα συντελεστικά εξωτερικά συνόλα δεδομένων δεν συμμορφώνονται επαρκώς με το τριμερή σχήμα του συνόλου δεδομένων COVIDx (δηλ. «κανονικό», «πνευμονία» και «COVID-19»).
Ικανοποιητικά…;
Εξετάζοντας την προέλευση και την καταλληλότητα των συντελεστικών συνόλων δεδομένων για το COVIDx την εποχή της μελέτης, οι ερευνητές βρήκαν «κακή χρήση» των δεδομένων RSNA, όπου τα δεδομένα ενός τύπου έχουν, σύμφωνα με τους ερευνητές, οδηγηθεί σε μια διαφορετική κατηγορία:
‘Η αποθήκη RSNA, η οποία χρησιμοποιεί δημόσια διαθέσιμες ακτίνες Χ από το NIH Chestx-ray8 [**], σχεδιάστηκε για μια εργασία διαχωρισμού και ως τέτοια περιέχει τρεις κατηγορίες εικόνων, ‘Λυκόφως Πνεύμονα’, ‘Όχι Λυκόφως Πνεύμονα/Όχι Κανονικό’, και ‘Κανονικό’, με διαθέσιμες θυρίδες για ‘Λυκόφως Πνεύμονα’ περιπτώσεις.
‘Στη συλλογή του στο COVIDx όλες οι ακτίνες Χ από την κατηγορία ‘Λυκόφως Πνεύμονα’ περιλαμβάνονται στην κατηγορία πνευμονίας.’
Επιδράσεις, το έγγραφο ισχυρίζεται, η μεθοδολογία του COVIDx επεκτείνει την έννοια της «πνευμονίας» για να περιλαμβάνει «όλες τις πνευμονικές αδιαφανείς». Συνέπεια, οι ερευνητές λένε:
‘ […] η κατηγορία πνευμονίας στο σύνολο δεδομένων COVIDx περιέχει ακτίνες Χ με μια ποικιλία πολλών άλλων παθολογιών, συμπεριλαμβανομένων, πλευρικής εκχύσεως, διείσδυσης, συσσώρευσης, εμφύσηματος και μαζών. Η συσσώρευση είναι μια ακτινολογική ιδιότητα πιθανής πνευμονίας, όχι κλινική διάγνωση. Η χρήση της συσσώρευσης ως υποκατάστατου για πνευμονία χωρίς τεκμηρίωση είναι потенτικά παραπλανητική.’

Εναλλακτικές παθολογίες (εκτός από COVID-19) που σχετίζονται με το COVIDx. Πηγή: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf
Η αναφορά βρίσκει ότι μόνο το 6,13% των 4.305 περιπτώσεων πνευμονίας που προέρχονται από το RSNA ήταν ακριβώς ετικεταρισμένες, αντιπροσωπεύοντας μόλις 265 πραγματικές περιπτώσεις πνευμονίας.
Πολυάριθμες από τις μη-πνευμονικές περιπτώσεις που περιλαμβάνονται στο COVIDx αντιπροσώπευαν συν-νοσολογίες – επιπλοκές άλλων ασθενειών, ή άλλες δευτερεύουσες ιατρικές υποθέσεις σε καταστάσεις που δεν σχετίζονται απαραίτητα με πνευμονία.
Όχι ‘Κανονικό’
Η αναφορά προτείνει επίσης ότι η επιρροή του συνόλου δεδομένων RSNA στο COVIDx έχει στρεβλώσει την εμπειρική σταθερότητα των δεδομένων. Οι ερευνητές παρατηρούν ότι το COVIDx προτιμά την κατηγορία «κανονικό» των δεδομένων RSNA, αποκλείοντας αποτελεσματικά όλες τις κατηγορίες «όχι λυκόφως πνεύμονα/όχι κανονικό» στο ευρύτερο σύνολο δεδομένων. Το έγγραφο λέει:
‘Ενώ αυτό είναι σύμφωνο με αυτό που αναμένεται εντός της ετικέτας ‘κανονικό’, η επέκταση της κατηγορίας πνευμονίας και η χρήση μόνο ‘κανονικών’ ακτίνων Χ, αντί για περιπτώσεις πνευμονίας-αρνητικών, απλοποιεί σημαντικά την εργασία ταξινόμησης.
‘Το τελικό αποτέλεσμα αυτού είναι ένα σύνολο δεδομένων που αντανακλά μια εργασία που απομακρύνεται από το πραγματικό κλινικό πρόβλημα.’
Πιθανές Προκαταλήψεις από Ασυμβίβαστες Πρότυπα Δεδομένων
Το έγγραφο διακρίνει eine σειρά από άλλους τύπους προκατάληψης στο COVIDx, σημειώνοντας ότι κάποια από τα συντελεστικά δεδομένα αναμιγνύουν εικόνες ακτίνων Χ παιδιών με τις εικόνες ακτίνων Χ ενηλίκων ασθενών, και παρατηρεί ότι αυτά τα δεδομένα είναι η μόνη «σημαντική» πηγή εικόνων παιδιών στο COVIDx.
Επίσης, οι εικόνες από το σύνολο δεδομένων RSNA έχουν ανάλυση 1024×1024, ενώ ένα άλλο συντελεστικό σύνολο δεδομένων παρέχει εικόνες μόνο με ανάλυση 299×299.既然 τα μοντέλα της μηχανικής μάθησης θα αναμορφώσουν τις εικόνες για να ταιριάζουν στο διαθέσιμο χώρο εκπαίδευσης (λατέντ χώρος), αυτό σημαίνει ότι οι εικόνες 299×299 θα αναμορφωθούν σε μια διαδικασία εκπαίδευσης (πотεντικά οδηγώντας σε αρτεφάκτα που σχετίζονται με τον αλγόριθμο αναδιαμόρφωσης), και οι μεγαλύτερες εικόνες θα μειωθούν. Πάλι, αυτό μετριάζει ενάντια στα ομοιόμορφα πρότυπα δεδομένων που απαιτούνται για την ανάλυση υπολογιστικής όρασης με βάση την AI.
Επιπλέον, τα δεδομένα ActMed που έχουν ενσωματωθεί στο COVIDx περιέχουν «δισκοειδείς δείκτες» στις ακτίνες Χ COVID-19, μια επαναλαμβανόμενη ιδιότητα που δεν είναι σύμφωνη με το ευρύτερο σύνολο δεδομένων, και η οποία θα χρειαζόταν να αντιμετωπιστεί ως «επαναλαμβανόμενη εξαιρετική περίπτωση».
Αυτό είναι το είδος του ζητήματος που συνήθως αντιμετωπίζεται είτε με την очистή είτε με την παραμέληση των δεδομένων,既然 η επανάληψη των δεικτών είναι αρκετή για να καταγραφεί ως «ιδιότητα» στην εκπαίδευση, αλλά όχι αρκετά συχνή για να γενικεύσει χρήσιμα στο ευρύτερο σχήμα του συνόλου δεδομένων. Χωρίς einen μηχανισμό για την απομείωση της επιρροής των τεχνητών δεικτών, θα μπορούσαν να θεωρηθούν από τη μεθοδολογία του συστήματος μηχανικής μάθησης ως παθολογικά φαινόμενα.
Εκπαίδευση και Δοκιμή
Οι ερευνητές δοκιμάζουν το COVIDx σε σχέση με δύο συγκριτικά συνόλα δεδομένων σε τρία μοντέλα. Τα δύο επιπλέον συνόλα δεδομένων ήταν το RICORD, το οποίο περιέχει 1096 ακτίνες Χ COVID-19 σε 361 ασθενείς από τέσσερις χώρες, και το CheXpert, ένα δημόσιο σύνολο δεδομένων
Τα τρία μοντέλα που χρησιμοποιήθηκαν ήταν το COVID-Net, το CoroNet και το DarkCovidNet. Όλα τα τρία μοντέλα χρησιμοποιούν Συνελικτικά Νευρωνικά Δίκτυα (CNNs), αν και το CoroNet αποτελείται από μια διπλή διαδικασία ταξινόμησης εικόνων, με αυτο-κωδικοποιητές που περνούν έξοδο σε einen ταξινομητή CNN.
Η δοκιμή έδειξε μια «απότομη πτώση» στην απόδοση όλων των μοντέλων σε μη-COVIDx συνόλα δεδομένων σε σύγκριση με την ακρίβεια 86% που προκύπτει όταν χρησιμοποιείται το COVIDx. Ωστόσο, αν τα δεδομένα είναι εσφαλμένα ετικεταρισμένα ή ομαδοποιημένα, αυτά είναι αποτελεσματικά ψευδή αποτελέσματα. Οι ερευνητές σημείωσαν σημαντικά μειωμένες ακρίβειες στα συγκριτικά εξωτερικά συνόλα δεδομένων, τα οποία το έγγραφο προτείνει ως πιο ρεαλιστικά και σωστά-ταξινομημένα δεδομένα.
Επιπλέον, το έγγραφο παρατηρεί:
‘Μια κλινική ανασκόπηση 500 grad-CAM σαλιενčních χαρτών που παράγονται από πρόβλεψη στο COVIDx δοκιμαστικό δεδομένο έδειξε μια τάση σημασίας σε κλινικά αδιάφορα χαρακτηριστικά. Αυτό συχνά περιελάμβανε εστίαση σε οστέινα και μαλακά ιστία αντί για διαχυτική διπλή αδιαφάνεια των πνευμόνων που είναι τυπική για την μόλυνση COVID-19.’

Αυτή είναι μια ακτίνα Χ ενός επιβεβαιωμένου περιστατικού COVID-19, που έχει ανατεθεί μια προβλεπόμενη πιθανότητα 0,938 από το COVIDx εκπαιδευμένο στο DarkCovidNet.
Συμπεράσματα
Οι ερευνητές κριτικάρουν την έλλειψη δημογραφικών ή κλινικών δεδομένων που σχετίζονται με τις ακτίνες Χ στο COVIDx, ισχυριζόμενοι ότι χωρίς αυτά, είναι αδύνατο να λογαριαστούν «παραπλανητικοί παράγοντες» όπως η ηλικία.
Επίσης, παρατηρούν ότι τα προβλήματα που βρέθηκαν στο σύνολο δεδομένων COVIDx μπορεί να ισχύουν και για άλλα συνόλα δεδομένων που προέρχονται με παρόμοιο τρόπο (δηλ. με ανάμιξη προ-COVID βάσεων δεδομένων ακτίνων Χ με πρόσφατα δεδομένα ακτίνων Χ COVID-19 χωρίς επαρκή αρχιτεκτονική δεδομένων, αντιστάθμιση διακύμανσης και σαφή οριοθέτηση των περιορισμών αυτής της προσέγγισης).
Συνοψίζοντας τις ελλείψεις του COVIDx, οι ερευνητές τονίζουν την αンバLANCED ένταξη «καθαρών» παιδιατρικών ακτίνων Χ, καθώς και την αντίληψή τους για την κακή χρήση ετικετών και τον υψηλό κίνδυνο προκατάληψης και σύγκρουσης στο COVIDx, ισχυριζόμενοι ότι ‘η εξαιρετική απόδοση [του COVIDx] που αναφέρεται ευρέως σε ολόκληρο το πρόβλημα είναι φουσκωμένη, ότι τα αποτελέσματα της απόδοσης του μοντέλου είναι λανθασμένα και ότι τα μοντέλα δεν γενικεύουν καλά σε κλινικά πραγματικά δεδομένα.’
Η αναφορά καταλήγει:
‘Μια έλλειψη διαθέσιμων νοσοκομειακών δεδομένων σε συνδυασμό με ανεπαρκή αξιολόγηση του μοντέλου σε ολόκληρο το πρόβλημα έχει επιτρέψει τη χρήση ανοιχτών δεδομένων να εξαπατήσει την ερευνητική κοινότητα. Η συνεχής δημοσίευση φουσκωμένων μετρικών απόδοσης μοντέλου κινδυνεύει να βλάψει την αξιοπιστία της έρευνας AI στις ιατρικές διαγνώσεις, ιδιαίτερα όπου η ασθένεια είναι του μεγάλου δημόσιου ενδιαφέροντος. Η ποιότητα της έρευνας σε αυτό το πεδίο πρέπει να βελτιωθεί για να αποφευχθεί αυτό, και αυτό πρέπει να αρχίσει από τα δεδομένα.’
*Αν και οι ερευνητές της μελέτης ισχυρίζονται ότι έχουν κάνει τα δεδομένα, τα αρχεία και τον κώδικα για το νέο έγγραφο διαθέσιμα online, η πρόσβαση απαιτεί σύνδεση, και στην εποχή της γραφής, δεν υπάρχει γενική δημόσια πρόσβαση στα αρχεία.
** ChestX-ray8: Hospital-scale Chest X-ray Database and Benchmarks on Weakly-Supervised Classification and Localization of Common Thorax Diseases – https://arxiv.org/pdf/1705.02315.pdf












