Μοντέλα και πλατφόρμες AI
Νίτιν Μάντναϊ, Ανώτερος Ερευνητικός Επιστήμονας στην ETS – Σειρά Συνεντεύξεων

Ο Νίτιν Μάντναϊ είναι Ανώτερος Ερευνητικός Επιστήμονας με την ομάδα έρευνας της επεξεργασίας φυσικής γλώσσας (NLP) στην Εκπαιδευτική Υπηρεσία Διαγνωστικών Τεστ (ETS). Η ETS ιδρύθηκε το 1947 και είναι ο μεγαλύτερος ιδιωτικός μη κερδοσκοπικός οργανισμός εκπαιδευτικής αξιολόγησης στον κόσμο.
Μπορείτε να αρχίσετε εξηγώντας ποιο είναι το όραμα της ETS;
Το όραμα της ETS είναι να προωθήσει την ποιότητα και την ισότητα στην εκπαίδευση για όλους τους μαθητές παγκοσμίως. Αυτό το όραμα υποστηρίζει τα προϊόντα, τις υπηρεσίες, την έρευνα και τις προσπάθειες ανάπτυξης μας, με στόχο την προώθηση της μάθησης, την υποστήριξη της εκπαίδευσης, την επαγγελματική ανάπτυξη και τη μέτρηση της γνώσης και των δεξιοτήτων, για όλους.
Πιστεύουμε ότι ο καθένας, όπου και αν βρίσκεται, μπορεί να κάνει τη διαφορά στη ζωή του μέσω της μάθησης και η δουλειά της ETS στην έρευνα, την αξιολόγηση, τη μέτρηση και την πολιτική μπορεί να παίξει σημαντικό ρόλο στην καθιστά αυτή τη μάθηση δυνατή.
Τι είναι αυτό που σας κάνει इतनό ενθουσιασμένο με την NLP;
Όλες οι ανθρώπινες γλώσσες είναι τόσο όμορφα σύνθετες και ακατάστατες. Επιτρέπουν να εκφράσουμε ένα εύρος συναισθημάτων στη ομιλία και ακόμη και στη γραφή και εξελίσσονται με τον καιρό. Από την άλλη πλευρά, ένας υπολογιστής είναι τόσο детерμινιστικός και κλινικός στη επεξεργασία των εισόδων του. Η επεξεργασία φυσικής γλώσσας (NLP) είναι ένα πεδίο της τεχνητής νοημοσύνης που προσπαθεί να κάνει αυτή τη μη ανθρώπινη συσκευή να καταλάβει τις όμορφες复잡ότητες της ανθρώπινης γλώσσας, συνδυάζοντας τεχνικές από την Επιστήμη των Υπολογιστών, τη Γλωσσολογία και την Στατιστική. Πώς δεν θα ήταν αυτό fascinující;
Οι επιστήμονες NLP και ομιλίας της ETS έχουν αναπτύξει πρόσφατα το RSMTool. Μπορείτε να μας μιλήσετε για το τι κάνει το RSMTool;
Όπως έχουμε δει τα τελευταία χρόνια, όλα τα μοντέλα μηχανικής μάθησης μπορούν να εμφανίσουν προκατειλημμένη συμπεριφορά, ανεξάρτητα από το πεδίο στο οποίο εφαρμόζονται, η εκπαίδευση δεν είναι εξαίρεση. Τα αυτόματα συστήματα βαθμολόγησης που χρησιμοποιούνται για να ανατεθούν βαθμοί ή βαθμολογίες σε μαθητές σε τεστ ή σε τάξεις συχνά χρησιμοποιούν μοντέλα μηχανικής μάθησης. Έτσι, είναι απόλυτα δυνατό για τέτοια συστήματα να συμπεριφερθούν με προκατάληψη. Αυτή η προκατάληψη μπορεί να έχει σοβαρές συνέπειες, ιδιαίτερα αν οι βαθμοί από τέτοια συστήματα χρησιμοποιούνται για να ληφθούν υψηλών επιπτώσεων αποφάσεις.
RSMTool είναι ένα ανοικτό εργαλείο που αναπτύχθηκε από τον συνάδελφό μου Αναστασία Λουκίνα (παλαιότερα παρουσιάστηκε στο Unite.AI) και εγώ στην ETS για να βοηθήσουμε να διασφαλίσουμε ότι οποιαδήποτε συστηματική, επιζήμια προκατάληψη στα αυτόματα συστήματα βαθμολόγησης αναγνωρίζεται όσο το δυνατόν νωρίτερα, ελπίζοντας ακόμη και πριν από την ανάπτυξη των συστημάτων στον πραγματικό κόσμο. Το RSMTool είναι σχεδιασμένο να παρέχει μια綜合τική αξιολόγηση των μηχανών βαθμολόγησης AI, συμπεριλαμβανομένων όχι μόνο των τυπικών μετρικών της προβλεπτικής ακρίβειας, αλλά και μετρικών της ισότητας του μοντέλου και μετρικών που βασίζονται στη θεωρία του τεστ, βοηθώντας τους développers των κινητήρων να αναγνωρίσουν πιθανές προκαταλήψεις ή άλλα προβλήματα στα συστήματά τους.
Πόθεν προέρχεται το όνομα RSMTool;
Στον τομέα της εκπαιδευτικής αξιολόγησης, κάποιος που αναθέτει βαθμό (ή “βαθμολογεί”) σε ένα δοκίμιο συχνά αναφέρεται ως “βαθμολογητής”. Υπάρχουν ανθρώπινοι βαθμολογητές καθώς και αυτόματοι βαθμολογητές. Το RSMTool – συντομογραφία του Rater Scoring Modeling Tool – είναι σχεδιασμένο να βοηθήσει στην κατασκευή (και αξιολόγηση) των μοντέλων βαθμολόγησης που χρησιμοποιούνται από τους αυτόματους βαθμολογητές.
Πώς μπορεί αυτό το εργαλείο να βοηθήσει τους développers να αναγνωρίσουν πιθανή προκατάληψη ή άλλα προβλήματα στα αυτόματα συστήματα βαθμολόγησης;
Τις τελευταίες πέντε δεκαετίες, οι επιστήμονες της εκπαιδευτικής μέτρησης – συμπεριλαμβανομένων πολλών συναδέλφων μας στην ETS – έχουν διεξαγάγει πολύτιμη έρευνα σχετικά με το τι κάνει τα αυτόματα συστήματα βαθμολόγησης δίκαια. Jako μέρος αυτής της έρευνας, έχουν αναπτύξει πολλές στατιστικές και ψυχομετρικές αναλύσεις για τον υπολογισμό δεικτών συστηματικής προκατάληψης. Ωστόσο,由于 η ψυχομετρική και NLP κοινότητες σπάνια αλληλεπιδρούν, υπάρχει λίγη ευκαιρία για διασταύρωση ιδεών. Το αποτέλεσμα είναι ότι οι ερευνητές και développers NLP που κατασκευάζουν πραγματικά αυτόματα συστήματα βαθμολόγησης – ιδιαίτερα οι μεμονωμένοι ερευνητές και εκείνοι στις μικρές εταιρείες – δεν έχουν εύκολη πρόσβαση στις ψυχομετρικές αναλύσεις που θα πρέπει να χρησιμοποιούν για να ελέγξουν τα συστήματά τους για προκατάληψη. Το RSMTool προσπαθεί να λύσει αυτό το πρόβλημα παρέχοντας ένα μεγάλο, διαφορετικό σύνολο ψυχομετρικών αναλύσεων σε ένα單ο, εύχρηστο Python πακέτο που μπορεί να ενσωματωθεί εύκολα από οποιοδήποτε ερευνητή NLP στη έρευνά του ή στη λειτουργική του διαδικασία.
Σε ένα τυπικό σενάριο χρήσης, ένας ερευνητής θα παρέχει ως είσοδο ένα αρχείο ή ένα πλαίσιο δεδομένων με τους αριθμούς του συστήματος, τα χρυσά (ανθρώπινα) βαθμοί και τα μεταδεδομένα, εάν υπάρχουν. Το RSMTool επεξεργάζεται αυτά τα δεδομένα και παράγει einen HTML αναφορά που περιέχει μια綜合τική αξιολόγηση, συμπεριλαμβανομένων περιγραφικών στατιστικών και πολλαπλών μετρικών της απόδοσης του συστήματος και της ισότητας μεταξύ άλλων. Một δείγμα αναφοράς RSMTool μπορεί να βρεθεί στο https://bit.ly/fair-tool. Το RSMTool μπορεί να λειτουργήσει με παραδοσιακά μοντέλα μηχανικής μάθησης (π.χ. από τη βιβλιοθήκη scikit-learn) και με μοντέλα deep learning. Αν και η πρωταρχική έξοδος του RSMTool είναι η HTML αναφορά που κάνει για εύκολη κοινή χρήση, παράγει επίσης πίνακες αρχείων δεδομένων (σε μορφή CSV, TSV ή XLSX) ως ενδιάμεσες εξόδους για πιο προηγμένους χρήστες. Τέλος, για να διατηρήσουμε τα πράγματα εξαιρετικά προσαρμόσιμα, το RSMTool υλοποιεί κάθε τμήμα της αναφοράς του ως ένα Jupyter notebook, έτσι ώστε οι χρήστες να μπορούν όχι μόνο να επιλέξουν ποια τμήματα είναι σχετικά με τα συστήματά τους, αλλά και να υλοποιήσουν εύκολα προσαρμοσμένες αναλύσεις και να τις συμπεριλάβουν στην αναφορά με πολύ λίγη δουλειά.
Υπάρχουν πολλές πρόσφατες μελέτες σχετικά με την αυτόματη βαθμολόγηση που έχουν χρησιμοποιήσει το RSMTool για να αξιολογήσουν τα προτεινόμενα μοντέλα βαθμολόγησής τους.
Ποια είναι τα κοινά είδη προκατάληψης που μπορεί να επηρεάσουν τα αυτόματα συστήματα βαθμολόγησης;
Το πιο κοινό είδος προκατάληψης που επηρεάζει ένα αυτόματο σύστημα βαθμολόγησης είναι η διαφορετική υποομάδα απόδοσης, δηλαδή όταν το αυτόματο σύστημα αποδίδει διαφορετικά για διαφορετικές υποομάδες πληθυσμού. Για παράδειγμα, ένα προκατειλημμένο σύστημα βαθμολόγησης θα μπορούσε να παράγει συστηματικά χαμηλότερους βαθμούς για δοκίμια γραμμένα από, για παράδειγμα, μαύρες γυναίκες σε σύγκριση με εκείνες για λευκούς άνδρες, ακόμη και αν δεν υπάρχει συστηματική διαφορά στις πραγματικές δεξιότητες γραφής που εμφανίζονται από αυτές τις δύο υποομάδες στα δοκίμια, όσο ένα ανθρώπινο είναι.
Η ETS έχει eine πλούσια ιστορία διεξαγωγής ερευνών σχετικά με την ισότητα για τα αυτόματα συστήματα βαθμολόγησης. Για παράδειγμα, έχουμε δείτε αν το e-rater® – το αυτόματο σύστημα βαθμολόγησης AI μας – εμφανίζει οποιαδήποτε διαφορετική απόδοση για υποομάδες που ορίζονται από εθνοτική ομάδα, φύλο και χώρα (βρήκαν κάποιες μικρές διαφορές που διορθώθηκαν από μεταγενέστερες αλλαγές πολιτικής). Οι μελέτες έχουν επίσης δείτε αν το e-rater® αντιμετωπίζει συστηματικά διαφορετικά τις απαντήσεις που γράφονται από εξεταστές GRE® με αναπηρίες μάθησης και/ή ADHD (δεν το κάνει). Πρόσφατα, μια συσχετισμένη μελέτη εξετάζει αν ένα αυτόματο σύστημα βαθμολόγησης για την ομιλία εμφανίζει συστηματική προκατάληψη προς εξεταστές που υποχρεώθηκαν να φορούν μάσκες προσώπου έναντι εκείνων που δεν φορούσαν μάσκες (δεν το κάνει). Το RSMTool περιέχει πολλές ψυχομετρικές αναλύσεις που προσπαθούν να ποσοτικοποιήσουν την υποομάδα της διαφορετικής απόδοσης πάνω από τις υποομάδες που ορίζει ο χρήστης πάνω στα δικά του δεδομένα.
Η ETS επέλεξε να κάνει το RSMTool ανοικτό, μπορείτε να εξηγήσετε τη σκέψη και τη σημασία πίσω από αυτό;
Ναι, το RSMTool είναι διαθέσιμο στο GitHub με άδεια Apache 2.0. Πιστεύουμε ότι είναι σημαντικό για ένα τέτοιο εργαλείο να είναι ανοικτό και μη ιδιωτικό, ώστε η κοινότητα να μπορεί (α) να ελέγξει τον κώδικα των αναλύσεων που είναι ήδη διαθέσιμες για να διασφαλίσει τη συμμόρφωσή τους με τα πρότυπα ισότητας και (β) να συνεισφέρει νέες αναλύσεις καθώς τα πρότυπα εξελίσσονται και αλλάζουν. Θέλουμε επίσης να κάνουμε εύκολη για τους ερευνητές και développers NLP να χρησιμοποιούν το RSMTool στη δουλειά τους και να μας βοηθήσουν να το κάνουμε καλύτερο. Το να κάνουμε το RSMTool ανοικτό είναι ένα σαφές παράδειγμα της συνεχούς δέσμευσης της ETS για την υπεύθυνη χρήση της AI στην εκπαίδευση.
Τι είναι κάποια από τα μαθήματα που έμαθαν από την ανάπτυξη και τη διατήρηση του RSMTool;
Κατά τη διάρκεια των τελευταίων πέντε ετών που η Αναστασία και εγώ αναπτύξαμε και διατήρησαμε το RSMTool – με τη βοήθεια πολλών συναδέλφων μας στην ETS και μη-ETS συνεισφερόντων στο GitHub – μάθαμε δύο γενικές μαθήματα. Το πρώτο είναι ότι διαφορετικοί χρήστες έχουν διαφορετικές ανάγκες και ότι η προσέγγιση “ένα μέγεθος για όλους” δεν θα λειτουργήσει για διαθεματικά λογισμικά όπως το RSMTool. Το δεύτερο μάθημα που μάθαμε ήταν ότι, για να κάνετε πιο πιθανό να υιοθετηθεί το ανοικτό λογισμικό, πρέπει πραγματικά να πάτε το επιπλέον μίλι για να το κάνετε όσο το δυνατόν πιο robust.
Κατά τη διάρκεια της θητείας μας ως διατηρητές του RSMTool, έχουμε αναγνωρίσει πολλούς τύπους χρηστών του RSMTool. Κάποιοι από αυτούς είναι “power users” (π.χ. ερευνητές και développers NLP) που θέλουν να επιλέξουν συγκεκριμένες λειτουργίες του RSMTool για να τις ενσωματώσουν στη δική τους διαδικασία μηχανικής μάθησης, ενώ χρησιμοποιούν επίσης άλλα πακέτα Python. Για να ικανοποιήσουμε τέτοιους χρήστες, δημιουργήσαμε μια綜合τική API για να εκθέσουμε διάφορες προ- και μετα-επεξεργασίες λειτουργίες καθώς και προσαρμοσμένες μετρικές που περιέχονται στο RSMTool. Άλλη ομάδα χρηστών είναι αυτά που ονομάζουμε “minimalists”: αναλυτές δεδομένων και μηχανικοί που μπορεί να λείπουν της στατιστικής ή προγραμματιστικής εμπειρίας για να αλληλεπιδράσουν με την API και προτιμούν μια εξ’ ολοκλήρου διαδικασία. Για να ικανοποιήσουμε τέτοιους χρήστες, έχουμε δημιουργήσει εργαλεία γραμμής εντολών που μπορούν να καούν εύκολα σε wrapper shell scripts, για παράδειγμα. Έχουμε επίσης βρει ότι οι χρήστες minimalists είναι συχνά απρόθυμοι να διαβάσουν το (αυτή την ώρα μεγάλο) κατάλογο των επιλογών ρυθμίσεων του RSMTool. Για αυτό, έχουμε δημιουργήσει einen διαδραστικό γεννήτορα ρυθμίσεων με αυτοσυμπλήρωση που μπορεί να βοηθήσει τέτοιους χρήστες να δημιουργήσουν αρχεία ρυθμίσεων με βάση τις συγκεκριμένες ανάγκες τους.
Για να ικανοποιήσουμε τις ανάγκες όλων των ομάδων χρηστών μας, abbiamo Dove να υιοθετήσουμε πρακτικές που πιστεύαμε ότι ήταν απαραίτητες για να κάνουμε το RSMTool robust. Τι εννοούμε με robust λογισμικό; Για να είναι robust, οποιοδήποτε κομμάτι λογισμικού πρέπει να πληροί τα ακόλουθα κριτήρια: η επίδραση οποιασδήποτε αλλαγής κώδικα στην ακρίβεια και την απόδοση του μπορεί να μετρηθεί (καλά ελεγχόμενο), η τεκμηρίωσή του είναι πάντα ενημερωμένη (καλά τεκμηριωμένο) και το λογισμικό (μαζί με τις εξαρτήσεις του) είναι εύκολα εγκαταστάσιμο από τους χρήστες. Για το RSMTool, abbiamo αξιοποιήσει πολλά ανοικτά εργαλεία και υπηρεσίες για να το κάνουμε να πληροί την ορισμό μας. Έχουμε ένα綜合τικό σύνολο δοκιμών (>90% κάλυψη κώδικα) που τρέχουμε αυτόματα μέσω συνεχούς ενοποίησης για όλες τις αλλαγές που υποβάλλονται στον κώδικα. Διατηρούμε εκτεταμένη τεκμηρίωση (συμπεριλαμβανομένων πολλών πραγματικών tutorials) και οποιαδήποτε νέα λειτουργικότητα που προτείνεται για το RSMTool πρέπει να περιλαμβάνει ένα τμήμα τεκμηρίωσης που εξετάζεται επίσης ως μέρος της κριτικής κώδικα. Τέλος, κυκλοφορούμε το RSMTool ως πακέτα που μπορούν να εγκατασταθούν εύκολα (είτε μέσω pip είτε μέσω conda) και όλες οι εξαρτήσεις που χρειάζονται εγκαταστάθηκαν αυτόματα.
Τι ελπίζει η ETS να επιτύχει με την κυκλοφορία του RSMTool;
Ο τομέας της εκπαίδευσης έχει δει μια από τις πιο σημαντικές επεκτάσεις της AI τα τελευταία χρόνια, με την αυτόματη βαθμολόγηση κειμένου και ομιλίας να γίνεται μια όλο και πιο συχνή εφαρμογή της NLP. Η ETS έχει υπάρξει ηγέτης στον τομέα της αυτόματης βαθμολόγησης και, από την ίδρυσή της, έχει δεσμευτεί να κατασκευάσει δίκαια προϊόντα και αξιολογήσεις που είναι σχεδιασμένες να υπηρετούν τους μαθητές παγκοσμίως. Με την κυκλοφορία του RSMTool, που αναπτύχθηκε σε στενή συνεργασία μεταξύ επιστημόνων NLP και ψυχομετρητών, η ETS θέλει να συνεχίσει την προώθηση της υπεύθυνης χρήσης της AI στην εκπαίδευση με ένα πολύ συγκεκριμένο τρόπο: συγκεκριμένα, θέλουμε να κάνουμε σαφές ότι όταν οι ερευνητές AI σκέφτονται την “απόδοση” ενός αυτόματου συστήματος βαθμολόγησης, πρέπει να λάβουν υπόψη όχι μόνο τα τυπικά μέτρα της προβλεπτικής ακρίβειας (π.χ. συσχετίζοντας Pearson) αλλά και εκείνα της ισότητας του μοντέλου. Πιο γενικά, θα θέλαμε το RSMTool να χρησιμεύσει ως ένα παράδειγμα των τρόπων με τους οποίους οι ερευνητές NLP και ψυχομετρητές μπορούν και πρέπει να συνεργαστούν.
Υπάρχει κάτι άλλο που θα ήθελε να μοιραστεί σχετικά με το RSMTool;
Θέλουμε να ενθαρρύνουμε τους αναγνώστες να μας βοηθήσουν να βελτιώσουμε το RSMTool! Δεν χρειάζεται να είναι ψυχομετρητής ή ειδικός NLP για να συνεισφέρει. Έχουμε πολλά ανοιχτά ζητήματα σχετικά με την τεκμηρίωση και την προγραμματιστική γλώσσα Python που θα ήταν ιδανικά για οποιοδήποτε αρχάριο έως μεσαίο προγραμματιστή Python. Θέλουμε επίσης να προσκαλέσουμε συνεισφορές στο SKLL (Scikit-Learn Laboratory), – ένα άλλο ανοικτό πακέτο της ETS για την αποτελεσματική εκτέλεση των διαμορφωμένων, batched πειραμάτων μηχανικής μάθησης – που χρησιμοποιείται από το RSMTool.












