Η γωνία του Anderson

Ένας Καρτέλ Επηρεαστικών Δεδομένων Κυριαρχεί στην Έρευνα Μηχανικής Μάθησης, Υποδεικνύει Μια Νέα Μελέτη

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια νέα εργασία από το Πανεπιστήμιο της Καλιφόρνιας και την Google Research έχει βρει ότι ένας μικρός αριθμός ‘βασικών’ συνόλων δεδομένων μηχανικής μάθησης, σε μεγάλο βαθμό από επηρεαστικές δυτικές ιδρύματα και συχνά από κυβερνητικές οργανώσεις, κυριαρχούν ολοένα και περισσότερο στον τομέα της έρευνας της τεχνητής νοημοσύνης.

Οι ερευνητές καταλήγουν στο συμπέρασμα ότι αυτή η τάση να ‘επιλέγουν’ δημοφιλή ανοιχτά συνόλα δεδομένων, όπως το ImageNet, δημιουργεί μια σειρά από πρακτικά, ηθικά και ακόμη και πολιτικά προβλήματα.

Μεταξύ των ευρημάτων τους – με βάση τα βασικά δεδομένα από το project Papers With Code (PWC) της Facebook – οι συγγραφείς υποστηρίζουν ότι ‘τα ευρέως χρησιμοποιούμενα συνόλα δεδομένων εισάγονται από μόνο quelques ελίτ ιδρύματα’, και ότι αυτή η ‘συσπείρωση’ έχει αυξηθεί στο 80% τα τελευταία χρόνια.

‘[Βρίσκουμε ότι] υπάρχει αυξανόμενη ανισότητα στη χρήση συνόλων δεδομένων παγκοσμίως, και ότι περισσότερο από το 50% όλων των χρήσεων συνόλων δεδομένων στη δείγμα μας από 43.140 ανταποκρίνεται σε συνόλα δεδομένων που εισάγονται από δώδεκα ελίτ, κυρίως δυτικά, ιδρύματα.’

Μια χάρτα μη-ειδικών συνόλων δεδομένων τις τελευταίες δέκα χρόνια. Κριτήριο ένταξης είναι το ιδρύματα ή οι εταιρείες που αντιπροσωπεύουν περισσότερο από το 50% των γνωστών χρήσεων. Δεξιά φαίνεται ο συντελεστής Gini για τη συγκέντρωση συνόλων δεδομένων με την πάροδο του χρόνου για ιδρύματα και συνόλα δεδομένων. Πηγή: https://arxiv.org/pdf/2112.01716.pdf

Μια χάρτα μη-ειδικών συνόλων δεδομένων τις τελευταίες δέκα χρόνια. Κριτήριο ένταξης είναι το ιδρύματα ή οι εταιρείες που αντιπροσωπεύουν περισσότερο από το 50% των γνωστών χρήσεων. Δεξιά φαίνεται ο συντελεστής Gini για τη συγκέντρωση συνόλων δεδομένων με την πάροδο του χρόνου για ιδρύματα και συνόλα δεδομένων. Πηγή: https://arxiv.org/pdf/2112.01716.pdf

Τα κυρίαρχα ιδρύματα περιλαμβάνουν το Πανεπιστήμιο του Στάνφορντ, τη Microsoft, το Πρίνστον, την Facebook, τη Google, το Ινστιτούτο Μαξ Πλανκ και την AT&T. Τέσσερις από τις δέκα κορυφαίες πηγές συνόλων δεδομένων είναι εταιρικά ιδρύματα.

Η εργασία χαρακτηρίζει επίσης την αυξανόμενη χρήση αυτών των ελίτ συνόλων δεδομένων ως ‘ένα όχημα για την ανισότητα στην επιστήμη’. Αυτό συμβαίνει επειδή οι ερευνητικές ομάδες που ζητούν κοινωνική έγκριση είναι πιο мотιβées να επιτύχουν αποτελέσματα κατάσταση-of-the-τέχνη (SOTA) σε σχέση με ένα σταθερό σύνολο δεδομένων, παρά να δημιουργήσουν πρωτότυπα συνόλα δεδομένων που δεν έχουν τέτοια θέση και τα οποία θα απαιτούσαν από τους ομίλους να προσαρμοστούν σε νέους δείκτες αντί για τυποποιημένους δείκτες.

Σε κάθε περίπτωση, όπως αναφέρει η εργασία, η δημιουργία του δικού σου συνόλου δεδομένων είναι μια απαγορευτικά δαπανηρή διέξοδος για λιγότερο εφοδιασμένα ιδρύματα και ομάδες.

‘Η πραγματική επιστημονική εγκυρότητα που παρέχεται από το SOTA benchmarking είναι γενικά συγχέεται με την κοινωνική πιστότητα που οι ερευνητές αποκτούν με το να δείξουν ότι μπορούν να ανταγωνιστούν σε ένα ευρέως αναγνωρισμένο σύνολο δεδομένων, ακόμη και αν ένα πιο контекστο-ειδικό benchmark θα ήταν πιο τεχνικά κατάλληλο.

‘Υποθέτουμε ότι αυτές οι δυναμικές δημιουργούν ένα “Matthew Effect” (δηλαδή “οι πλούσιοι γίνονται πλουσιότεροι και οι φτωχοί φτωχότεροι”) όπου τα επιτυχημένα benchmarks και τα ελίτ ιδρύματα που τα εισάγουν, κερδίζουν υπερβολική σπουδαιότητα στον τομέα.

Η εργασία έχει τον τίτλο Μειωμένα, Επανειλημμένα και Ανακυκλωμένα: Η Ζωή ενός Συνόλου Δεδομένων στην Έρευνα Μηχανικής Μάθησης, και προέρχεται από τους Bernard Koch και Jacob G. Foster στο UCLA, και τους Emily Denton και Alex Hanna στην Google Research.

Η εργασία θέτει μια σειρά από ζητήματα σχετικά με την αυξανόμενη τάση προς τη συσπείρωση που καταγράφει, και έχει λάβει γενική έγκριση στο Open Review. Ένας κριτής από το NeurIPS 2021 σχολίασε ότι η εργασία είναι ‘εξαιρετικά σχετική με οποιονδήποτε που ασχολείται με την έρευνα μηχανικής μάθησης.’ και προέβλεψε την ένταξή της ως ανάγνωσμα σε πανεπιστημιακούς κύκλους.

Από την Ανάγκη στην Διαφθορά

Οι συγγραφείς σημειώνουν ότι ο τρέχων πολιτισμός του ‘beat-the-benchmark’ εμφανίστηκε ως ένα αντίδοτο για την έλλειψη αντικειμενικών εργαλείων αξιολόγησης που προκάλεσε την πτώση του ενδιαφέροντος και της επένδυσης στην τεχνητή νοημοσύνη για δεύτερη φορά πάνω από τριάντα χρόνια πριν, μετά την πτώση του ενθουσιασμού των επιχειρήσεων για τις νέες έρευνες στα ‘ΕξPERT Συστήματα’:

‘Τα benchmarks τυπικά формαλίζουν một συγκεκριμένη εργασία μέσω ενός συνόλου δεδομένων και ενός συνδεδεμένου ποσοτικού μετρητή αξιολόγησης. Η πρακτική εισήχθη αρχικά στην έρευνα μηχανικής μάθησης μετά τον “Χειμώνα της Τεχνητής Νοημοσύνης” της δεκαετίας του 1980 από κυβερνητικούς χρηματοδότες, οι οποίοι ζήτησαν να αξιολογήσουν πιο ακριβώς την αξία που λαμβάνουν από τις χορηγίες.’

Η εργασία υποστηρίζει ότι τα αρχικά πλεονεκτήματα αυτής της ανεπίσημης κουλτούρας της τυποποίησης (μειώνοντας τους φραγμούς συμμετοχής, συνεπή μετρητές και περισσότερες ευκαιρίες για ανάπτυξη) αρχίζουν να υπερβαίνονται από τα μειονεκτήματα που φυσικά προκύπτουν όταν ένα σύνολο δεδομένων γίνεται αρκετά ισχυρό ώστε να ορίζει αποτελεσματικά τους ‘όρους χρήσης’ και το πεδίο επιρροής του.

Οι συγγραφείς προτείνουν, σύμφωνα με πολλές πρόσφατες σκέψεις της βιομηχανίας και της ακαδημαϊκής κοινότητας για το ζήτημα, ότι η ερευνητική κοινότητα δεν θέτει πλέον νέα προβλήματα αν αυτά δεν μπορούν να αντιμετωπιστούν με τα υπάρχοντα συνόλα δεδομένων.

Επιπλέον, σημειώνουν ότι η τυφλή πίστη σε αυτόν τον μικρό αριθμό ‘χρυσοφόρων’ συνόλων δεδομένων ενθαρρύνει τους ερευνητές να επιτύχουν αποτελέσματα που είναι υπερπροσαρμοσμένα (δηλαδή, που είναι ειδικά για το σύνολο δεδομένων και δεν είναι πιθανό να λειτουργήσουν τόσο καλά σε πραγματικά δεδομένα, σε νέα ακαδημαϊκά ή πρωτότυπα συνόλα δεδομένων, ή ακόμη και αναγκαστικά σε διαφορετικά συνόλα δεδομένων στο ‘χρυσοφόρο’ πρότυπο).

‘Δεδομένου του παρατηρηθέντος υψηλού βαθμού συγκέντρωσης της έρευνας σε ένα μικρό αριθμό συνόλων δεδομένων, πιστεύουμε ότι η διευθέτηση των μορφών αξιολόγησης είναι ιδιαίτερα σημαντική για να αποφευχθεί η υπερπροσαρμογή στα υπάρχοντα συνόλα δεδομένων και η λανθασμένη αναπαράσταση της πρόοδου στον τομέα.’

Κυβερνητική Επίδραση στην Έρευνα Οπτικής Υπολογιστή

Σύμφωνα με την εργασία, η έρευνα Οπτικής Υπολογιστή επηρεάζεται περισσότερο από το σύνδρομο που περιγράφει από άλλους τομείς, με τους συγγραφείς να σημειώνουν ότι η έρευνα της Φυσικής Γλώσσας (NLP) επηρεάζεται λιγότερο. Οι συγγραφείς υποστηρίζουν ότι αυτό μπορεί να οφείλεται στο ότι οι κοινότητες NLP είναι ‘πιο συνεκτικές’ και μεγαλύτερες σε μέγεθος, και ότι τα συνόλα δεδομένων NLP είναι πιο προσιτά και πιο εύκολα να συλλεχθούν, καθώς και να είναι μικρότερα και λιγότερο πόρων-εντατικά σε σχέση με τη συλλογή δεδομένων.

Στην Οπτική Υπολογιστή, και ιδιαίτερα σε σχέση με τα συνόλα δεδομένων Αναγνώρισης Προσώπου (FR), οι συγγραφείς υποστηρίζουν ότι εταιρικά, κρατικά και ιδιωτικά συμφέροντα συχνά συγκρούονται:

‘Εταιρικά και κυβερνητικά ιδρύματα έχουν αντικειμενικούς που μπορεί να έρθουν σε σύγκρουση με την ιδιωτικότητα (π.χ., επιτήρηση), και το βάρος αυτών των προτεραιοτήτων είναι πιθανό να είναι διαφορετικό από εκείνα που κατέχουν οι ακαδημαϊκοί ή οι ευρύτεροι κοινωνικοί μέτοχοι της ΤΝ.’

Για τις εργασίες αναγνώρισης προσώπου, οι ερευνητές βρήκαν ότι η συχνότητα των καθαρά ακαδημαϊκών συνόλων δεδομένων πέφτει δραματικά σε σχέση με τον μέσο όρο:

‘[Τέσσερα] από τα οκτώ συνόλα δεδομένων (33.69% του συνόλου των χρήσεων) χρηματοδοτούνταν αποκλειστικά από εταιρικά, το αμερικανικό στρατό ή την κινεζική κυβέρνηση (MS-Celeb-1M, CASIA-Webface, IJB-A, VggFace2). Το MS-Celeb-1M αποσύρθηκε τελικά λόγω της διαμάχης σχετικά με την αξία της ιδιωτικότητας για τους verschiedenen μετόχους.’

Τα κορυφαία συνόλα δεδομένων που χρησιμοποιούνται στις κοινότητες Εργασιών Εικόνας και Αναγνώρισης Προσώπου.

Τα κορυφαία συνόλα δεδομένων που χρησιμοποιούνται στις κοινότητες Εργασιών Εικόνας και Αναγνώρισης Προσώπου.

Στον παραπάνω γράφο, όπως σημειώνουν οι συγγραφείς, βλέπουμε επίσης ότι ο σχετικά πρόσφατος τομέας της Γεννήτριας Εικόνας (ή Συνθέτης Εικόνας) βασίζεται σε μεγάλο βαθμό σε υπάρχοντα, πολύ παλαιότερα συνόλα δεδομένων που δεν προορίζονταν για αυτήν τη χρήση.

Στην πραγματικότητα, η εργασία παρατηρεί μια αυξανόμενη τάση για τη ‘μεταφορά’ των συνόλων δεδομένων μακριά από τον αρχικό σκοπό τους, θέτοντας υπό αμφισβήτηση την καταλληλότητά τους για τις ανάγκες νέων ή περιφερειακών ερευνητικών τομέων, και το βαθμό στον οποίο οι περιορισμοί του προϋπολογισμού μπορεί να ‘γενικεύουν’ το πεδίο των φιλοδοξιών των ερευνητών σε ένα στενότερο πλαίσιο που παρέχεται τόσο από τα διαθέσιμα υλικά όσο και από μια κουλτούρα που είναι τόσο εθισμένη στα ετήσια βαθμολογικά ratings που τα νέα συνόλα δεδομένων έχουν δυσκολία να κερδίσουν έδαφος.

‘Τα ευρήματά μας δείχνουν επίσης ότι τα συνόλα δεδομένων μεταφέρονται τακτικά μεταξύ διαφορετικών κοινοτήτων εργασιών. Στο πιο ακραίο σημείο, η πλειοψηφία των συνόλων δεδομένων που κυκλοφορούν για ορισμένες κοινότητες εργασιών δημιουργήθηκαν για άλλες εργασίες.’

Σχετικά με τους λουμινάρες της μηχανικής μάθησης (συμπεριλαμβανομένου του Andrew Ng) που έχουν ολοένα και περισσότερο ζητήσει μεγαλύτερη ποικιλία και επιμέλεια των συνόλων δεδομένων τα τελευταία χρόνια, οι συγγραφείς υποστηρίζουν τη σκέψη, αλλά πιστεύουν ότι αυτό το είδος της προσπάθειας, ακόμη και αν είναι επιτυχημένο, θα μπορούσε να υπονομευθεί από την τρέχουσα κουλτούρα που εξαρτάται από τα SOTA-αποτελέσματα και τα καθιερωμένα συνόλα δεδομένων:

‘Η έρευνά μας υποδηλώνει ότι απλώς να ζητήσουμε από τους ερευνητές της ΤΝ να αναπτύξουν περισσότερα συνόλα δεδομένων και να μεταφέρουμε τις δομές κινήτρων ώστε η ανάπτυξη συνόλων δεδομένων να αξιολογείται και να ανταμείβεται, μπορεί να μην είναι αρκετό για να διευρύνουμε τη χρήση συνόλων δεδομένων και τις προοπτικές που τελικά διαμορφώνουν και ορίζουν τις ατζέντες έρευνας της ΤΝ.

‘Εκτός από την ενθάρρυνση της ανάπτυξης συνόλων δεδομένων, υποστηρίζουμε πολιτικές παρεμβάσεις που προωθούν την ισότητα και που δίνουν προτεραιότητα στη σημαντική χρηματοδότηση για άτομα σε λιγότερο εφοδιασμένα ιδρύματα για να δημιουργήσουν υψηλής ποιότητας συνόλα δεδομένων. Αυτό θα διευρύνει — από μια κοινωνική και πολιτιστική προοπτική — τα συνόλα δεδομένων που χρησιμοποιούνται για την αξιολόγηση των σύγχρονων μεθόδων ΤΝ.’

 

 6η Δεκεμβρίου 2021, 4:49μμ GMT+2 – Διορθώθηκε κατοχικός στο τίτλο. – MA

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai