Μοντέλα και πλατφόρμες AI
Ερευνητές Επιδιώκουν την Επέκταση της Αυτόματης Αναγνώρισης Ομιλίας σε 2.000 Γλώσσες
Μια ομάδα ερευνητών στο Πανεπιστήμιο Carnegie Mellon επιδιώκει να επεκτείνει την αυτόματη αναγνώριση ομιλίας σε 2.000 γλώσσες. Μέχρι τώρα, μόνο ένα τμήμα των περίπου 7.000 έως 8.000 ομιλούμενων γλωσσών στον κόσμο θα ωφεληθούν από σύγχρονες γλωσσικές τεχνολογίες όπως η μεταγραφή φωνής-κειμένου ή η αυτόματη υποτιτλισμός.
Ο Xinjian Li είναι φοιτητής διδακτορικού στο Ινστιτούτο Γλωσσικών Τεχνολογιών (LTI) της Σχολής Επιστημών Υπολογιστών.
«Πολλοί άνθρωποι σε αυτόν τον κόσμο μιλούν διαφορετικές γλώσσες, αλλά τα εργαλεία γλωσσικής τεχνολογίας δεν αναπτύσσονται για όλες τις γλώσσες», είπε. «Η ανάπτυξη τεχνολογίας και ενός καλού γλωσσικού μοντέλου για όλους τους ανθρώπους είναι ένας από τους στόχους αυτής της έρευνας».
Ο Li ανήκει σε μια ομάδα εμπειρογνωμόνων που επιδιώκουν να απλοποιήσουν τις απαιτήσεις δεδομένων που χρειάζονται οι γλώσσες για να αναπτύξουν ένα μοντέλο αναγνώρισης ομιλίας.
Η ομάδα περιλαμβάνει επίσης μέλη του διδακτικού προσωπικού του LTI, τους Shinji Watanabe, Florian Metze, David Mortensen και Alan Black.
Η έρευνα με τίτλο «ASR2K: Αναγνώριση Ομιλίας για Περίπου 2.000 Γλώσσες Χωρίς Ήχο» παρουσιάστηκε στο Interspeech 2022 στη Νότια Κορέα.
Η πλειονότητα των υφιστάμενων μοντέλων αναγνώρισης ομιλίας απαιτούν συνόλους δεδομένων κειμένου και ήχου. Ενώ τα δεδομένα κειμένου υπάρχουν για χιλιάδες γλώσσες, το ίδιο δεν ισχύει για τα δεδομένα ήχου. Η ομάδα θέλει να εξαλείψει την ανάγκη για δεδομένα ήχου εστιάζοντας σε γλωσσικά στοιχεία που είναι κοινά σε πολλές γλώσσες.
Οι τεχνολογίες αναγνώρισης ομιλίας συνήθως εστιάζουν στο φωνήεν μιας γλώσσας, τα οποία είναι διακριτά ήχοι που τη διακρίνουν από άλλες γλώσσες. Αυτά είναι μοναδικά για κάθε γλώσσα. Ταυτόχρονα, οι γλώσσες έχουν phones που περιγράφουν πώς ακούγεται μια λέξη φυσικά, και πολλά phones μπορούν να ανταποκριθούν σε ένα μόνο φωνήεν. Ενώ διαφορετικές γλώσσες μπορούν να έχουν διαφορετικά φωνήεντα, τα υποκείμενα phones θα μπορούσαν να είναι τα ίδια.
Η ομάδα δουλεύει σε ένα μοντέλο αναγνώρισης ομιλίας που βασίζεται λιγότερο στα φωνήεντα και περισσότερο στις πληροφορίες σχετικά με το πώς τα phones μοιράζονται μεταξύ των γλωσσών. Αυτό βοηθά στη μείωση της προσπάθειας που απαιτείται για την κατασκευή ξεχωριστών μοντέλων για κάθε ξεχωριστή γλώσσα. Ζευγαρώνοντας το μοντέλο με ένα φυλογενετικό δέντρο, το οποίο είναι ένας χάρτης που χαρτογραφεί τις σχέσεις μεταξύ γλωσσών, βοηθά με τους κανόνες προφοράς. Το μοντέλο της ομάδας και η δομή του δέντρου έχουν επιτρέψει να προσεγγιστεί το μοντέλο ομιλίας για χιλιάδες γλώσσες ακόμη και χωρίς δεδομένα ήχου.
«Προσπαθούμε να αφαιρέσουμε αυτήν την απαίτηση δεδομένων ήχου, η οποία μας βοηθά να μεταβούμε από 100 έως 200 γλώσσες σε 2.000», είπε ο Li. «Αυτή είναι η πρώτη έρευνα που στοχεύει σε इतनό grandiό αριθμό γλωσσών και είμαστε η πρώτη ομάδα που στοχεύει να επεκτείνει τα εργαλεία γλώσσας σε这个ν πεδίο».
Η έρευνα, αν και ακόμη βρίσκεται σε πρώιμο στάδιο, έχει βελτιώσει τα υπάρχοντα εργαλεία προσέγγισης γλώσσας κατά 5%.
«Κάθε γλώσσα είναι ένα πολύ σημαντικό παράγοντας στον πολιτισμό της. Κάθε γλώσσα έχει τη δική της ιστορία και αν δεν προσπαθήσουμε να διατηρήσουμε τις γλώσσες, αυτές οι ιστορίες μπορεί να χαθούν», είπε ο Li. «Η ανάπτυξη αυτού του είδους συστήματος αναγνώρισης ομιλίας και αυτού του εργαλείου είναι ένα βήμα για να προσπαθήσουμε να διατηρήσουμε αυτές τις γλώσσες».












