Μοντέλα και πλατφόρμες AI

Το Μέλλον της Αξιολόγησης Ομιλίας – Ηγετικά Στελέχη

mm mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Σε όλο τον κόσμο, ο αριθμός των μαθητών της αγγλικής γλώσσας συνεχίζει να αυξάνεται. Τα εκπαιδευτικά ιδρύματα και οι εργοδότες πρέπει να είναι σε θέση να αξιολογήσουν την ικανότητα της αγγλικής γλώσσας των μαθητών – ιδιαίτερα, την ικανότητα ομιλίας,既然 η ομιλία παραμένει μια από τις πιο σημαντικές γλωσσικές ικανότητες. Η πρόκληση, τόσο για τους dévelopers αξιολόγησης όσο και για τους τελικούς χρήστες, είναι να βρουν έναν τρόπο να το κάνουν αυτό με ακρίβεια, ταχύτητα και οικονομική βιωσιμότητα. Jako μέρος αυτής της πρόκλησης, η αξιολόγηση αυτών των αξιολογήσεων συνοδεύεται από το δικό της σύνολο παραγόντων, ιδιαίτερα όταν λαμβάνουμε υπόψη τις διαφορετικές περιοχές (ομιλία, γραφή, κ.λπ.) στις οποίες αξιολογούμε. Με την αυξανόμενη ζήτηση για αγγλικές γλωσσικές ικανότητες σε όλο τον κόσμο, τι θα πρέπει να είναι το μέλλον της αξιολόγησης ομιλίας για να ικανοποιήσει αυτές τις ανάγκες;

Η απάντηση σε αυτό το ερώτημα, εν μέρει, βρίσκεται στην εξέλιξη της αξιολόγησης ομιλίας μέχρι σήμερα. Η αξιολόγηση των κατασκευασμένων προφορικών απαντήσεων ιστορικά γινόταν χρησιμοποιώντας ανθρώπινους αξιολογητές. Αυτή η διαδικασία, ωστόσο, έχει την τάση να είναι ακριβή και αργή, και έχει πρόσθετες προκλήσεις, συμπεριλαμβανομένης της κλιμάκωσης και των verschiedenen ελαττωμάτων των ανθρώπινων αξιολογητών (π.χ. υποκειμενικότητα ή προκατάληψη). Όπως συζητείται στο βιβλίο μας Automated Speaking Assessment: Using Language Technologies to Score Spontaneous Speech, για να αντιμετωπιστούν αυτές οι προκλήσεις, ένας αυξανόμενος αριθμός αξιολογήσεων χρησιμοποιεί τώρα τεχνολογία αυτόματης αξιολόγησης ομιλίας ως την唯一 πηγή αξιολόγησης ή σε συνδυασμό με ανθρώπινους αξιολογητές. Πριν από την ανάπτυξη αυτόματων μηχανισμών αξιολόγησης, ωστόσο, η απόδοσή τους πρέπει να αξιολογηθεί πλήρως, ιδιαίτερα σε σχέση με την αξιοπιστία, την εγκυρότητα (μετρά το σύστημα αυτό που πρέπει;) και την αξιοκρατία (δηλ. το σύστημα δεν πρέπει να εισάγει προκατάληψη σχετικά με υποομάδες πληθυσμού όπως το φύλο ή η μητρική γλώσσα).

Από το 2006, ο δικός μας μηχανισμός αξιολόγησης ομιλίας, SpeechRater®, έχει λειτουργήσει στο TOEFL® Practice Online (TPO) αξιολόγηση (χρησιμοποιείται από μελλοντικούς εξεταζόμενους για να προετοιμαστούν για την αξιολόγηση TOEFL iBT®), και από το 2019, ο SpeechRater έχει επίσης χρησιμοποιηθεί, μαζί με ανθρώπινους αξιολογητές, για την αξιολόγηση του τμήματος ομιλίας της αξιολόγησης TOEFL iBT®. Ο μηχανισμός αξιολογεί ένα ευρύ φάσμα ικανοτήτων ομιλίας για προφορική μη μητρική ομιλία, συμπεριλαμβανομένης της προφορά και της ροής, του εύρους του λεξιλογίου και της γραμματικής, και υψηλότερων ικανοτήτων ομιλίας σχετικών με την εγκυρότητα και την πρόοδο των ιδεών. Αυτά τα χαρακτηριστικά υπολογίζονται χρησιμοποιώντας τεχνολογίες επεξεργασίας φυσικής γλώσσας (NLP) και ομιλίας. Ένα στατιστικό μοντέλο εφαρμόζεται затем σε αυτά τα χαρακτηριστικά για να ανατεθεί ένα τελικό σκορ στην απάντηση του εξεταζόμενου.

Ενώ αυτό το μοντέλο έχει εκπαιδευτεί σε προηγουμένως παρατηρημένα δεδομένα που αξιολογήθηκαν από ανθρώπινους αξιολογητές, επίσης αναθεωρείται από ειδικούς περιεχομένου για να μεγιστοποιήσει την εγκυρότητά του. Εάν μια απάντηση βρεθεί να είναι μη αξιολογήσιμη λόγω ποιότητας ήχου ή άλλων ζητημάτων, ο μηχανισμός μπορεί να την σημάνει για περαιτέρω αναθεώρηση για να αποφευχθεί η δημιουργία eines potenciálně αβεβαιού ή άκυρου σκορ. Οι ανθρώπινοι αξιολογητές συμμετέχουν πάντα στην αξιολόγηση των προφορικών απαντήσεων στην αξιολόγηση TOEFL iBT®.

Καθώς οι ανθρώπινοι αξιολογητές και ο SpeechRater χρησιμοποιούνται τώρα μαζί για την αξιολόγηση των απαντήσεων των εξεταζόμενων σε αξιολογήσεις υψηλού κινδύνου, και οι δύο παίζουν ρόλο στο τι θα είναι το μέλλον της αξιολόγησης της αγγλικής γλώσσας. Οι ανθρώπινοι αξιολογητές έχουν την ικανότητα να κατανοούν το περιεχόμενο και την οργάνωση της ομιλίας σε βάθος. Αντίθετα, οι αυτόματοι μηχανισμοί αξιολόγησης ομιλίας μπορούν να μετρήσουν πιο ακριβώς ορισμένα λεπτά χαρακτηριστικά της ομιλίας, όπως η ροή ή η προφορά, να επιδείξουν τέλεια συνεχήτητα με την πάροδο του χρόνου, να μειώσουν τον συνολικό χρόνο και το κόστος αξιολόγησης, και να είναι πιο εύκολα κλιμακωτοί για να υποστηρίξουν μεγάλους όγκους εξετάσεων. Όταν οι ανθρώπινοι αξιολογητές και οι αυτόματοι μηχανισμοί αξιολόγησης ομιλίας συνδυάζονται, το αποτέλεσμα μπορεί να επωφεληθεί από τα πλεονεκτήματα κάθε προσέγγισης αξιολόγησης.

Για να εξελιχθούν συνεχώς οι αυτόματοι μηχανισμοί αξιολόγησης ομιλίας, η έρευνα και ανάπτυξη πρέπει να επικεντρωθούν στις ακόλουθες πτυχές, μεταξύ άλλων:

  • Κατασκευή αυτόματων συστημάτων αναγνώρισης ομιλίας με υψηλότερη ακρίβεια:既然 τα περισσότερα χαρακτηριστικά ενός συστήματος αξιολόγησης ομιλίας εξαρτώνται trực tiếp ή έμμεσα από αυτό το συστατικό του συστήματος που μετατρέπει την ομιλία του εξεταζόμενου σε κείμενο, η υψηλή ακρίβεια της αυτόματης αναγνώρισης ομιλίας είναι απαραίτητη για την απόκτηση έγκυρων χαρακτηριστικών;
  • Εξερεύνηση νέων τρόπων συνδυασμού ανθρώπινων και αυτόματων σκορ: Για να αποκτήσετε πλήρως τα πλεονεκτήματα των ανθρώπινων αξιολογητών και των αυτόματων μηχανισμών αξιολόγησης, πρέπει να εξερευνηθούν περισσότεροι τρόποι συνδυασμού αυτών των στοιχείων;
  • Λογιστική για ανωμαλίες στις απαντήσεις, τόσο τεχνικές όσο και συμπεριφορικές: Υψηλής απόδοσης φίλτρα που μπορούν να σημάνουν τέτοιες απαντήσεις και να τις εξαιρέσουν από την αυτόματη αξιολόγηση είναι απαραίτητα για να διασφαλίσουν την εγκυρότητα και την αξιοπιστία των αποτελεσμάτων της αξιολόγησης;
  • Αξιολόγηση της προφορικής ή διαλογικής ομιλίας που συμβαίνει πιο συχνά στην καθημερινή ζωή: ενώ η αυτόματη αξιολόγηση τέτοιων διαδραστικών ομιλιών είναι ένα σημαντικό στόχο, αυτά τα στοιχεία παρουσιάζουν πολλές προκλήσεις αξιολόγησης, συμπεριλαμβανομένης της συνολικής αξιολόγησης και σκορ;
  • Εξερεύνηση των τεχνολογιών βαθιάς μάθησης για την αυτόματη αξιολόγηση ομιλίας: Αυτή η σχετικά πρόσφατη παραλλαγή της μηχανικής μάθησης έχει παράγει σημαντικές βελτιώσεις στην απόδοση σε πολλές εργασίες τεχνητής νοημοσύνης (π.χ. αυτόματη αναγνώριση ομιλίας, αναγνώριση εικόνων) τα τελευταία χρόνια, και因此 είναι πιθανό ότι η αυτόματη αξιολόγηση ομιλίας μπορεί επίσης να επωφεληθεί από την उपयोगηση αυτής της τεχνολογίας. Ωστόσο,既然 τα περισσότερα από αυτά τα συστήματα μπορούν να θεωρηθούν “μαύρες κούκλες” προσεγγίσεις, η προσοχή στην ερμηνευσιμότητα του αποτελέσματος είναι σημαντική για να διατηρήσει κάποιο επίπεδο διαφάνειας.

Για να ικανοποιήσει μια αυξανόμενη και μεταβαλλόμενη πληθυσμό μαθητών αγγλικής γλώσσας, τα συστήματα αξιολόγησης ομιλίας της επόμενης γενιάς πρέπει να επεκτείνουν την αυτοματοποίηση και το εύρος των μετρήσεων, επιτρέποντας τη συνεχήτητα και την κλιμάκωση. Αυτό δεν σημαίνει ότι το ανθρώπινο στοιχείο θα αφαιρεθεί, ιδιαίτερα για αξιολογήσεις υψηλού κινδύνου. Οι ανθρώπινοι αξιολογητές θα παραμείνουν απαραίτητοι για την καταγραφή ορισμένων аспектων της ομιλίας που θα παραμείνουν δύσκολο να αξιολογηθούν ακριβώς από αυτόματους μηχανισμούς αξιολόγησης για ένα διάστημα. Η χρήση αυτόματων συστημάτων αξιολόγησης ομιλίας σε απομόνωση για αξιολογήσεις υψηλού κινδύνου επίσης διακινδυνεύει να μην αναγνωρίσει προβληματικές απαντήσεις από τους εξεταζόμενους – για παράδειγμα, απαντήσεις που είναι εκτός θέματος ή πλαγιάρουν, και ως αποτέλεσμα, μπορεί να οδηγήσει σε μειωμένη εγκυρότητα και αξιοπιστία. Η χρήση και των ανθρώπινων αξιολογητών και των αυτόματων συστημάτων αξιολόγησης σε συνδυασμό μπορεί να είναι ο καλύτερος τρόπος για την αξιολόγηση ομιλίας σε αξιολογήσεις υψηλού κινδύνου για το προβλέψιμο μέλλον, ιδιαίτερα εάν αξιολογείται προφορική ή διαλογική ομιλία.

Γραμμένο από: Keelan Evanini, Διευθυντής Ερευνών Ομιλίας, ETS & Klaus Zechner, Managing Senior Research Scientist, Speech, ETS

Η ETS συνεργάζεται με εκπαιδευτικά ιδρύματα, επιχειρήσεις και κυβερνήσεις για να διεξάγει έρευνα και να αναπτύσσει προγράμματα αξιολόγησης που παρέχουν σημαντικές πληροφορίες που μπορούν να βασιστούν για να αξιολογήσουν άτομα και προγράμματα. Η ETS αναπτύσσει, διεξάγει και αξιολογεί περισσότερες από 50 εκατομμύρια εξετάσεις ετησίως σε περισσότερες από 180 χώρες και σε περισσότερες από 9.000 τοποθεσίες σε όλο τον κόσμο. Σχεδιάζουμε τις αξιολογήσεις μας με προηγμένα επιτεύγματα, αυστηρή έρευνα και μια αμετάκλητη δέσμευση στην ποιότητα, ώστε να μπορούμε να βοηθήσουμε τις εκπαιδευτικές και εργασιακές κοινότητες να λάβουν ενημερωμένες αποφάσεις. Για να μάθετε περισσότερα, επισκεφθείτε ETS.

Διευθυντής Ερευνών Λόγου στην Έρευνα και Ανάπτυξη στο Educational Testing Service (ETS).

Managing Senior Research Scientist, Speech, in Research and Development at Educational Testing Service
(ETS).