Υγεία

Μοντέλα AI Εκπαιδευμένα σε Δεδομένα με Σεξουαλικό Προσδιορισμό Επιδίδουν Χειρότερα στη Διάγνωση Νοσημάτων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Πρόσφατα, μια μελέτη που δημοσιεύθηκε στο περιοδικό PNAS και διεξήχθη από ερευνητές από την Αργεντινή, υποδήλωσε ότι η παρουσία σεξουαλικά προκατειλημμένων δεδομένων εκπαίδευσης οδηγεί σε χειρότερη απόδοση του μοντέλου όταν διαγιγνώσκονται νοσήματα και άλλα ιατρικά προβλήματα. Όπως αναφέρθηκε από το Statnews, η ομάδα των ερευνητών πειραματίστηκε με την εκπαίδευση μοντέλων όπου οι θηλυκοί ασθενείς ήταν αξιοσημείωτα υποαντιπροσωπεύονται ή εξαιρούνται εντελώς, και βρήκαν ότι ο αλγόριθμος εκτελούσε σημαντικά χειρότερα όταν διαγνώσκονταν. Το ίδιο ίσχυε και για περιπτώσεις όπου οι αρσενικοί ασθενείς εξαιρούνταν ή υποαντιπροσωπεύονταν.

Τις τελευταίες πέντε χρόνια, καθώς τα μοντέλα AI και η μηχανική μάθηση έγιναν πιο διαδεδομένα, περισσότερη προσοχή δόθηκε στα προβλήματα των προκατειλημμένων συνόλων δεδομένων και των προκατειλημμένων μοντέλων μηχανικής μάθησης που προκύπτουν από αυτά. Η προκατειλημμένη δεδομένων στη μηχανική μάθηση μπορεί να οδηγήσει σε άβολα, κοινωνικά επιζήμια και αποκλειστικά εφαρμογές AI, αλλά όταν πρόκειται για ιατρικές εφαρμογές, ζωές μπορεί να κινδυνεύουν. Ωστόσο, παρά την γνώση του προβλήματος, λίγες μελέτες έχουν προσπαθήσει να ποσοτικοποιήσουν πόσο επιζήμια μπορεί να είναι τα προκατειλημμένα σύνολα δεδομένων. Η μελέτη που διεξήχθη από την ερευνητική ομάδα βρήκε ότι η προκατειλημμένη δεδομένων μπορεί να έχει πιο ακραίες επιπτώσεις από ό,τι πολλοί εμπειρογνώμονες είχαν προηγουμένως εκτιμήσει.

Μια από τις πιο δημοφιλείς χρήσεις του AI τα τελευταία χρόνια, σε ιατρικούς контext, ήταν η χρήση μοντέλων AI για τη διάγνωση ασθενών με βάση ιατρικές εικόνες. Η ερευνητική ομάδα ανάλυσε μοντέλα που χρησιμοποιούνται για την ανίχνευση της παρουσίας διαφόρων ιατρικών καταστάσεων όπως πνευμονία, καρδιομεγαλία ή κήλη από ακτίνες Χ. Η ερευνητική ομάδα μελέτησε τρεις ανοιχτού κώδικα αρχιτεκτονικές μοντέλων: Inception-v3, ResNet και DenseNet-121. Τα μοντέλα εκπαιδεύτηκαν σε ακτίνες Χ που προέρχονταν από δύο ανοιχτού κώδικα σύνολα δεδομένων από το Πανεπιστήμιο του Στάνφορντ και τα Εθνικά Ινστιτούτα Υγείας. Αν και τα σύνολα δεδομένων είναι相当 ισορροπημένα όσον αφορά την σεξουαλική αναπαράσταση, οι ερευνητές τεχνητά προκάλεσαν προκαταβολή στα δεδομένα με το να τα χωρίσουν σε υποσύνολα όπου υπήρχε σεξουαλική ανισορροπία.

Η ερευνητική ομάδα δημιούργησε πέντε διαφορετικά σύνολα δεδομένων εκπαίδευσης, το καθένα αποτελούμενο από διαφορετικά ποσοστά ανδρικών/θηλυκών σκαν. Τα πέντε σύνολα εκπαίδευσης χωρίστηκαν ως εξής:

  • Όλες οι εικόνες ήταν ανδρικών ασθενών
  • Όλες οι εικόνες ήταν θηλυκών ασθενών
  • 25% ανδρικοί ασθενείς και 75% θηλυκοί ασθενείς
  • 75% θηλυκοί ασθενείς και 25% ανδρικοί ασθενείς
  • Μισοί ανδρικοί ασθενείς και μισοί θηλυκοί ασθενείς

Μετά την εκπαίδευση του μοντέλου σε ένα από τα υποσύνολα, το μοντέλο δοκιμάστηκε σε μια συλλογή σκαν από ανδρικούς και θηλυκούς ασθενείς. Υπήρχε μια αξιοσημείωτη τάση που ήταν παρόντα σε διάφορες ιατρικές καταστάσεις, η ακρίβεια των μοντέλων ήταν πολύ χειρότερη όταν τα δεδομένα εκπαίδευσης ήταν σημαντικά σεξουαλικά προκατειλημμένα. Ένα ενδιαφέρον σημείο να σημειωθεί είναι ότι αν ένα φύλο ήταν υπερπροσδιορισμένο στα δεδομένα εκπαίδευσης, αυτό το φύλο δεν φαινόταν να επωφελείται από την υπερπροσδιορισμό. Ανεξάρτητα από το αν το μοντέλο εκπαιδεύτηκε σε δεδομένα προκατειλημμένα για ένα φύλο ή το άλλο, δεν εκτελούσε καλύτερα σε αυτό το φύλο σε σύγκριση με όταν εκπαιδεύτηκε σε ένα περιεκτικό σύνολο δεδομένων.

Ο старший συγγραφέας της μελέτης, Enzo Ferrante, αναφέρθηκε από το Statnews ως εξηγώντας ότι η μελέτη υπογραμμίζει πόσο σημαντικό είναι τα δεδομένα εκπαίδευσης να είναι διαφορετικά και αντιπροσωπευτικά για όλους τους πληθυσμούς που σκοπεύετε να δοκιμάσετε το μοντέλο.

Δεν είναι εντελώς σαφές γιατί τα μοντέλα που εκπαιδεύονται σε ένα φύλο τείνουν να εκτελούν χειρότερα όταν εφαρμόζονται σε ένα άλλο φύλο. Κάποια από τις διακρίσεις μπορεί να οφείλονται σε φυσιολογικές διαφορές, αλλά διάφορα κοινωνικά και πολιτιστικά παράγοντες θα μπορούσαν επίσης να ευθύνονται για κάποια από τις διαφορές. Για παράδειγμα, οι γυναίκες μπορεί να λάβουν ακτίνες Χ σε ένα διαφορετικό στάδιο εξέλιξης της νόσου τους σε σύγκριση με τους άνδρες. Αν αυτό ήταν αλήθεια, θα μπορούσε να επηρεάσει τα χαρακτηριστικά (και επομένως τα πρότυπα που μάθει το μοντέλο) που βρέθηκαν στις εικόνες εκπαίδευσης. Αν αυτό είναι η περίπτωση, καθιστά πολύ πιο δύσκολο για τους ερευνητές να αποπροκαταβάλλουν τα σύνολα δεδομένων τους, καθώς η προκαταβολή θα ήταν εγκιβωτισμένη στο σύνολο δεδομένων μέσω των μηχανισμών συλλογής δεδομένων.

Ακόμη και ερευνητές που προσεχτικά παρακολουθούν τη διαφορετικότητα των δεδομένων μερικές φορές δεν έχουν άλλη επιλογή παρά να εργαστούν με δεδομένα που είναι προκατειλημμένα ή προκαταβεβλημένα. Καταστάσεις όπου μια ανισότητα υπάρχει στο πώς διαγιγνώσκονται ιατρικές καταστάσεις θα οδηγήσουν συχνά σε μη ισορροπημένα δεδομένα. Για παράδειγμα, δεδομένα για ασθενείς με καρκίνο του μαστού συλλέγονται σχεδόν εξ ολοκλήρου από γυναίκες. Παρόμοια, ο αυτισμός εκδηλώνεται διαφορετικά μεταξύ γυναικών και ανδρών, και ως αποτέλεσμα, η κατάσταση διαγιγνώσκεται σε πολύ υψηλότερο ποσοστό σε αγόρια παρά σε κορίτσια.

Παρά τα πάντα, είναι εξαιρετικά σημαντικό για τους ερευνητές να ελέγχουν τα προκατειλημμένα δεδομένα και την προκαταβολή δεδομένων με οποιονδήποτε τρόπο μπορούν. Για αυτόν τον σκοπό, μελλοντικές μελέτες θα βοηθήσουν τους ερευνητές να ποσοτικοποιήσουν την επίδραση των προκατειλημμένων δεδομένων.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.