Μοντέλα και πλατφόρμες AI
Νέο Μοντέλο Πνευμονικής Νοημοσύνης Λειτουργεί με Ευρύτερη Ποικιλία Ανθρώπινων Γλωσσών
Ερευνητές στο Πανεπιστήμιο του Γουότερλου έχουν αναπτύξει ένα μοντέλο πνευμονικής νοημοσύνης που επιτρέπει στους υπολογιστές να επεξεργάζονται ευρύτερη ποικιλία ανθρώπινων γλωσσών. Αυτό είναι ένα σημαντικό βήμα προς τα εμπρός στο πεδίο, δεδομένου του πόσες γλώσσες συχνά παραμελούνται στη διαδικασία προγραμματισμού. Οι αφρικανικές γλώσσες συχνά δεν εστιάζονται από τους επιστήμονες υπολογιστών, γεγονός που έχει οδηγήσει σε περιορισμένες ικανότητες επεξεργασίας φυσικής γλώσσας (NLP) στην ήπειρο.
Το νέο γλωσσικό μοντέλο αναπτύχθηκε από μια ομάδα ερευνητών στο Τμήμα Επιστήμης Υπολογιστών του Πανεπιστημίου Γουότερλου.
Η έρευνα παρουσιάστηκε στο Εργαστήριο Πολυγλωσσικής Αντιπροσώπευσης Μάθησης στο Συνέδριο για τις Εμπειρικές Μέθοδους στη Φυσική Γλώσσα, το 2021.
Το μοντέλο играει κρίσιμο ρόλο στη βοήθεια των υπολογιστών να αναλύουν κείμενο στις αφρικανικές γλώσσες για πολλές χρήσιμες εργασίες, και ονομάζεται AfriBERTa. Χρησιμοποιεί τεχνικές βαθιάς μάθησης για να επιτύχει εντυπωσιακά αποτελέσματα για γλώσσες με περιορισμένα δεδομένα.
Εργασία με 11 Αφρικανικές Γλώσσες
Η AfriBERTa εργάζεται με 11 συγκεκριμένες αφρικανικές γλώσσες, συμπεριλαμβανομένων των Amharic, Hausa και Swahili, οι οποίες ομιλούνται από περισσότερους από 400 εκατομμύρια ανθρώπους. Το μοντέλο έχει δείξει ποιότητα εξόδου που είναι συγκρίσιμη με τα καλύτερα υπάρχοντα μοντέλα, και το έπραξε αυτό ενώ μάθαινε μόνο από ένα γιγαμπάιτ κειμένου. Άλλα παρόμοια μοντέλα συχνά απαιτούν χιλιάδες φορές περισσότερα δεδομένα.
Ο Kelechi Ogueji είναι φοιτητής στο μεταπτυχιακό πρόγραμμα επιστήμης υπολογιστών στο Γουότερλου.
«Τα προ-εκπαιδευμένα γλωσσικά μοντέλα έχουν μεταμορφώσει τον τρόπο με τον οποίο οι υπολογιστές επεξεργάζονται και αναλύουν δεδομένα κειμένου για εργασίες που κυμαίνονται από τη μηχανική μετάφραση μέχρι την απάντηση σε ερωτήσεις», είπε ο Ogueji. «Δυστυχώς, οι αφρικανικές γλώσσες έχουν λάβει μικρή προσοχή από την ερευνητική κοινότητα.»
«Μια από τις προκλήσεις είναι ότι τα νευρωνικά δίκτυα είναι απίστευτα κτηνωδικά και υπολογιστικά-εντατικά για να χτιστούν. Και αντίθετα με τα αγγλικά, τα οποία έχουν τεράστιες ποσότητες διαθέσιμου κειμένου, οι περισσότερες από τις 7.000 περίπου γλώσσες που ομιλούνται παγκοσμίως μπορούν να χαρακτηριστούν ως γλώσσες με περιορισμένα δεδομένα, επειδή υπάρχει έλλειψη δεδομένων διαθέσιμων για να τροφοδοτήσουν τα δεδομένα-πείνα νευρωνικά δίκτυα.»
Τεχνική Προ-Εκπαίδευσης
Τα περισσότερα από αυτά τα μοντέλα βασίζονται σε μια τεχνική προ-εκπαίδευσης, η οποία περιλαμβάνει τον ερευνητή να παρουσιάζει το μοντέλο με κείμενο που έχει κάποια από τα λόγια κρυφά ή μασκαρευμένα. Το μοντέλο πρέπει να μαντέψει τα κρυφά λόγια, και συνεχίζει να επαναλαμβάνει αυτή τη διαδικασία δισεκατομμύρια φορές. Τελικά, μαθαίνει τις στατιστικές συσχετίσεις μεταξύ των λέξεων, οι οποίες είναι παρόμοιες με τη γνώση της γλώσσας του ανθρώπου.
Ο Jimmy Lin είναι ο Καθηγητής Cheriton στην Επιστήμη Υπολογιστών και σύμβουλος του Ogueji.
«Η δυνατότητα να προ-εκπαιδεύσουμε μοντέλα που είναι εξίσου ακριβή για ορισμένες εργασίες, αλλά χρησιμοποιώντας πολύ μικρότερα δεδομένα, έχει πολλά πλεονεκτήματα», είπε ο Lin. «Η ανάγκη για λιγότερα δεδομένα για την εκπαίδευση του γλωσσικού μοντέλου σημαίνει ότι λιγότερη υπολογιστική ισχύς απαιτείται και, ως εκ τούτου, χαμηλότερες εκπομπές αερίων θερμοκηπίου που συνδέονται με τη λειτουργία μεγάλων κέντρων δεδομένων. Τα μικρότερα σύνολα δεδομένων καθιστούν επίσης τη διατήρηση των δεδομένων πιο πρακτική, η οποία είναι μια προσέγγιση για να μειώσει τις προκαταλήψεις που υπάρχουν στα μοντέλα.»
«Αυτό το έργο αποτελεί ένα μικρό αλλά σημαντικό βήμα για την εισαγωγή ικανοτήτων επεξεργασίας φυσικής γλώσσας σε περισσότερους από 1,3 δισεκατομμύρια ανθρώπους στην αφρικανική ήπειρο.»
Η έρευνα περιελάμβανε επίσης τον Yuxin Zhu, ο οποίος πρόσφατα ολοκλήρωσε το πτυχίο του στην επιστήμη υπολογιστών στο πανεπιστήμιο.












