Μοντέλα και πλατφόρμες AI

Η Facebook Δημιουργεί Μοντέλο Μηχανικής Μετάφρασης που Μπορεί Να Μεταφράζει Απευθείας Μεταξύ 100 Διαφορετικών Γλωσσών

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Facebook (META ) έχει αναπτύξει πρόσφατα ένα νέο μοντέλο μηχανικής μετάφρασης που μπορεί να μεταφράσει κείμενο μεταξύ οποιουδήποτε ζευγαριού γλωσσών από ένα σύνολο 100 γλωσσών. Ενώ υπάρχουν άλλα συστήματα μηχανικής μετάφρασης, τα περισσότερα άλλα συστήματα μετάφρασης AI λειτουργούν μεταφράζοντας πρώτα το κείμενο στα αγγλικά και στη συνέχεια μετατρέποντας το κείμενο από εκεί. Όπως ανέφερε το Engadget, το σύστημα μετάφρασης AI της Facebook λειτουργεί χωρίς τη χρήση της αγγλικής γλώσσας ως μεσάζοντα και αναφέρεται ότι μπορεί να επιτύχει ακρίβεια περίπου 90%.

Τα δεδομένα εκπαίδευσης του μοντέλου AI της Facebook αποτελούνταν από περίπου 7,5 δισεκατομμύρια ζευγάρια προτάσεων, κατανεμημένα σε 100 διαφορετικές γλώσσες. Τα δεδομένα συλλέχθηκαν από το διαδίκτυο χρησιμοποιώντας μια σειρά από web crawlers και οι γλώσσες που παρουσιάζονταν στα συλλεγμένα δεδομένα αναγνωρίστηκαν χρησιμοποιώντας ένα γλωσσικό μοντέλο που ονομάζεται FastText. Μόλις συλλέχθηκαν τα δεδομένα, εκτελέστηκαν μέσω eines εργαλείου που ονομάζεται LASER 2.0 για την εξαγωγή της σημασίας των διαφορετικών δειγμάτων προτάσεων και για την αντιστοίχηση προτάσεων σε διαφορετικές γλώσσες με βάση τη σημασία τους. Το LASER 2.0 αναπτύχθηκε από τη Facebook και χρησιμοποιεί αλγόριθμους μη επιτηρούμενης μάθησης για τη δημιουργία ενσωματώσεων. Οι ενσωματώσεις προτάσεων περιέχουν πληροφορίες σχετικά με τις σχέσεις μεταξύ των διαφορετικών προτάσεων με βάση χαρακτηριστικά όπως η συχνότητα χρήσης και η εγγύτητα των προτάσεων. Το LASER 2.0 μπορεί στη συνέχεια να δημιουργήσει ζευγάρια προτάσεων που έχουν πολύ παρόμοια σημασία.

Τα δεδομένα εκπαίδευσης δεν ήταν μόνο ζευγαρωμένα με βάση τη σημασία των προτάσεων. Οι γλώσσες ομαδοποιήθηκαν μαζί. Ο στόχος ήταν να σχεδιαστεί ένα σύστημα που δεν θα χρειαζόταν να χρησιμοποιηθεί η αγγλική γλώσσα ως μεσάζων μεταξύ δύο γλωσσών, με την Angela Fan της Facebook, η οποία ηγήθηκε του έργου, να σημειώνει ότι πολλές περιοχές σε όλο τον κόσμο μιλούν δύο γλώσσες που δεν είναι αγγλικά. Οι μηχανικοί της Facebook πραγματοποίησαν την εκπαίδευση εστιάζοντας στην ομαδοποίηση γλωσσών που μεταφράζονται συνήθως η μία στην άλλη. Δημιουργήθηκαν δεκατέσσερις διαφορετικές γλωσσικές ομάδες, με βάση μεταβλητές όπως η κουλτούρα, οι γλωσσικές ομοιότητες και η γεωγραφία. Για παράδειγμα, μια από τις γλωσσικές ομάδες που δημιουργήθηκαν από τους ερευνητές περιείχε τις πιο συχνές γλώσσες στην Ινδία, που περιλαμβάνουν τις γλώσσες Ουρντού, Ταμίλ, Χίντι και Μπενγκάλι. Αυτό έγινε για να ληφθούν υψηλής ποιότητας μεταφράσεις για τις συνήθως ζευγαρωμένες γλώσσες.

Η μεθοδος εκπαίδευσης που εστιάζει στις γλωσσικές ομάδες οδήγησε σε κάποια ενδιαφέροντα αποτελέσματα. Βρέθηκε ότι το μοντέλο μετάφρασης που προέκυψε είχε μεγαλύτερη ακρίβεια από τα υπάρχοντα μοντέλα για κάποια ζευγάρια γλωσσών. Για παράδειγμα, όταν μεταφράζεται από τα αγγλικά στα белαρουσιανά, το AI ήταν σε θέση να εφαρμόσει κάποια μοτίβα που είχε μάθει όταν μεταφράζεται από τα ρωσικά, επειδή τα белαρουσιανά έχουν γλωσσικές ομοιότητες με τα ρωσικά. Παρόμοια, οι προσπάθειες μετάφρασης μεταξύ ισπανικών και πορτογαλικών βελτιώθηκαν, επειδή τα ισπανικά είναι η δεύτερη πιο ομιλούμενη γλώσσα και υπήρχε ένα σημαντικό όγκο δεδομένων εκπαίδευσης για αυτήν την εργασία.

Υπάρχουν περίπου εξήντα γλώσσες που το σύστημα μετάφρασης δεν καλύπτει ακόμη και η ακρίβεια του μοντέλου σε γλώσσες χωρίς πολλά δεδομένα εκπαίδευσης πρέπει να βελτιωθεί πριν από τη χρήση. Πολλές γλώσσες στη Νοτιοανατολική Ασία και την Αφρική δεν έχουν τον όγκο δεδομένων που απαιτείται για την εκπαίδευση ενός αξιόπιστου μοντέλου. Η ερευνητική ομάδα πρέπει να βρει έναν τρόπο να αντιμετωπίσει την έλλειψη αυτών των δεδομένων. Η ερευνητική ομάδα πρέπει επίσης να καθορίσει πώς να ελέγξει τυχόν ρατσιστικά, σεξιστικά ή ασεβή μοτίβα που το μοντέλο μπορεί να έχει μάθει. Ενώ η ερευνητική ομάδα έχει χρησιμοποιήσει ένα φίλτρο ασεβειών, το φίλτρο λειτουργεί κυρίως στα αγγλικά δεδομένα.

Το σύστημα μετάφρασης δεν έχει ακόμη χρησιμοποιηθεί στην πλατφόρμα κοινωνικών μέσων της Facebook. Το τρέχον μοντέλο είναι μόνο για ερευνητικούς σκοπούς. Ωστόσο, η Facebook προετοιμάζεται να σχεδιάσει παρόμοια μοντέλα και να τα χρησιμοποιήσει για την επεξεργασία των περίπου 20 δισεκατομμυρίων αιτημάτων μετάφρασης που λαμβάνει η ιστοσελίδα κάθε μέρα.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.