Η γωνία του Anderson

Η λύση της Apple για τη μετάφραση γλωσσών με γένη

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

Η Apple δημοσίευσε πρόσφατα μια εργασία, σε συνεργασία με το USC, που εξετάζει τις μεθόδους μηχανικής μάθησης που χρησιμοποιούνται για να δώσουν στους χρήστες του λειτουργικού συστήματος iOS18 περισσότερες επιλογές σχετικά με το γένος κατά τη μετάφραση.

Στο iOS18, οι χρήστες μπορούν να επιλέξουν εναλλακτικές προτάσεις γένους για μια μεταφρασμένη λέξη στην εφαρμογή Translate. Πηγή: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Στο iOS18, οι χρήστες μπορούν να επιλέξουν εναλλακτικές προτάσεις γένους για μια μεταφρασμένη λέξη στην εφαρμογή Translate. Πηγή: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Αν και τα προβλήματα που αντιμετωπίζονται στην εργασία (η οποία έχει ανακοινωθεί εδώ) ασχολούνται, σε κάποιο βαθμό, με τις τρέχουσες συζητήσεις γύρω από τις ορισμούς του γένους, επικεντρώνονται σε ένα πολύ παλαιότερο πρόβλημα: το γεγονός ότι 84 από τις 229 γνωστές γλώσσες στον κόσμο χρησιμοποιούν ένα σύστημα γένους που βασίζεται στο φύλο.

Οι κόκκινες κουκκίδες υποδεικνύουν γλώσσες που χρησιμοποιούν ένα σύστημα γένους που βασίζεται στο φύλο. Πηγή: https://wals.info/feature/31A#map

Οι κόκκινες κουκκίδες υποδεικνύουν γλώσσες που χρησιμοποιούν ένα σύστημα γένους που βασίζεται στο φύλο. Πηγή: https://wals.info/feature/31A#map

Επιπλέον, η αγγλική γλώσσα ανήκει στην κατηγορία των γλωσσών που βασίζονται στο φύλο, επειδή αναθέτει αρσενικά ή θηλυκά ενικά αντωνυμία.

Αντίθετα, όλες οι Ρομανικές γλώσσες (συμπεριλαμβανομένων περισσότερων από μισό δισεκατομμύριο ομιλητών της ισπανικής) – και πολλές άλλες δημοφιλείς γλώσσες, όπως η ρωσική – απαιτούν συμφωνία γένους με τρόπους που αναγκάζουν τα συστήματα μετάφρασης να αντιμετωπίσουν την ανάθεση φύλου στη γλώσσα.

Η νέα εργασία εικονογραφεί αυτό, παρατηρώντας όλες τις πιθανές ισπανικές μεταφράσεις της πρότασης Ο γραμματέας ήταν θυμωμένος με τον αφεντικό:

Από την νέα εργασία, ένα παράδειγμα των πιθανών αναθέσεων γένους στην πρόταση 'Ο γραμματέας ήταν θυμωμένος με τον αφεντικό', μεταφρασμένη από τα αγγλικά στα ισπανικά. Πηγή: https://arxiv.org/pdf/2407.20438

Από την νέα εργασία, ένα παράδειγμα των πιθανών αναθέσεων γένους στην πρόταση ‘Ο γραμματέας ήταν θυμωμένος με τον αφεντικό’, μεταφρασμένη από τα αγγλικά στα ισπανικά. Πηγή: https://arxiv.org/pdf/2407.20438

Η αμελή μετάφραση είναι μακράν ανεπαρκής για μεγαλύτερα κείμενα, τα οποία μπορεί να καθορίσουν το γένος στην αρχή (‘Αυτός’, ‘Αυτή’, κ.λπ.) και στη συνέχεια να μην αναφέρουν ξανά το γένος. Παρόλα αυτά, η μετάφραση πρέπει να θυμάται την ανατεθείσα αναφορά γένους του συμμετέχοντα σε όλο το κείμενο.

Αυτό μπορεί να είναι προκλητικό για προσεγγίσεις που βασίζονται σε διακριτά τμήματα, και να κινδυνεύουν να χάσουν την αναφορά γένους καθ’ όλη τη διάρκεια του περιεχομένου.

Χειρότερα, τα συστήματα που παρέχουν εναλλακτικές μεταφράσεις για προκατειλημμένες αναθέσεις γένους δεν μπορούν να το κάνουν αδιακρίτως, δηλαδή, με την απλή αντικατάσταση του ουσιαστικού γένους, αλλά πρέπει να διασφαλίσουν ότι όλα τα άλλα μέρη της γλώσσας συμφωνούν με το αναθεωρημένο ουσιαστικό γένους.

Σε αυτό το παράδειγμα από την εργασία Apple/USC, βλέπουμε ότι αν και ο Γραμματέας έχει ανατεθεί αρσενικό γένος, το ενικώ ενεστώτα ήταν έχει μείνει θηλυκό (έσταζε):

Οι βίαιες αντικαταστάσεις γένους μπορούν να παραμελήσουν την αναγκαία συμφωνία γένους. Σε αυτό το παράδειγμα, η λέξη 'ενοτζάδα' πρέπει να είναι 'ενοτζάδος', για να συμφωνήσει με το αρσενικό 'Ο Γραμματέας'.

Οι βίαιες αντικαταστάσεις γένους μπορούν να παραμελήσουν την αναγκαία συμφωνία γένους. Σε αυτό το παράδειγμα, η λέξη ‘ενοτζάδα’ πρέπει να είναι ‘ενοτζάδος’, για να συμφωνήσει με το αρσενικό ‘Ο Γραμματέας’.

Ζητήματα γένους

Στην νέα εργασία, με τίτλο Γεννήτριες εναλλακτικών γένους στη μηχανική μετάφραση, οι ερευνητές της Apple και του USC προτείνουν μια ημι-εποπτική μέθοδο για τη μετατροπή αμφίσημων οντοτήτων σε μια σειρά εναλλακτικών οντοτήτων.

Το σύστημα, που χρησιμοποιήθηκε για να ενημερώσει τη μετάφραση από την εφαρμογή Translate του iOS18, κατασκευάζει ένα σχήμα γλώσσας με τη χρήση μεγάλων μοντέλων γλώσσας (LLMs) και με την παραμετροποίηση προ-εκπαιδευμένων ανοιχτών μοντέλων μηχανικής μετάφρασης.

Τα αποτελέσματα από τις μεταφράσεις αυτών των συστημάτων εκπαιδεύτηκαν σε μια αρχιτεκτονική που περιέχει δομές γένους – ομάδες φράσεων που περιέχουν διαφορετικές μορφές ουσιαστικών γένους που αντιπροσωπεύουν την ίδια οντότητα.

Η εργασία αναφέρει*:

‘Οι προκαταλήψεις γένους που υπάρχουν στα δεδομένα εκπαίδευσης είναι γνωστό ότι διαρρέουν στα συστήματα επεξεργασίας φυσικής γλώσσας (NLP), με αποτέλεσμα τη διάδοση και πιθανή ενίσχυση αυτών των προκαταλήψεων. Αυτές οι προκαταλήψεις είναι συχνά η ρίζα των λαθών.

‘Ένα σύστημα μηχανικής μετάφρασης (MT) μπορεί, για παράδειγμα, να μεταφράσει τον γιατρό στο ισπανικό όρο médico (αρσενικό) αντί για médica (θηλυκό), δεδομένου του εισαγωγικού κειμένου “Ο γιατρός ζήτησε από τη νοσοκόμα να τον βοηθήσει στη διαδικασία”.

‘Για να αποφευχθεί η λανθασμένη ανάθεση γένους, τα συστήματα MT πρέπει να αποσαφηνίσουν το γένος μέσω του контекστού. Όταν το σωστό γένος δεν μπορεί να καθοριστεί μέσω του контекστού, η παροχή πολλών εναλλακτικών μεταφράσεων που καλύπτουν όλα τα έγκυρα γένη είναι ένας λογικός προσεγγισμός.’

Η προσέγγιση που έφτασαν οι ερευνητές μετατρέπει αποτελεσματικά μια μετάφραση από ένα單ο token σε μια πίνακα ελεγχόμενη από τον χρήστη.

Η εργασία αναφέρει*:

‘Το σύστημα μας μπορεί να βελτιωθεί με την ενσωμάτωση των επιλογών του χρήστη σε μεταγενέστερες ιτεράσεις του μοντέλου.’

Διπλή ματιά

Για περιπτώσεις όπου ανιχνεύονται αμφίσημες οντότητες γένους, οι ερευνητές της Apple και του USC εξέτασαν δύο μεθόδους – την παραμετροποίηση προ-εκπαιδευμένων μοντέλων γλώσσας και τη χρήση LLMs.

Σχετικά με την πρώτη μέθοδο, η εργασία αναφέρει:

‘Παραμετροποιούμε ένα προ-εκπαιδευμένο μοντέλο MT M σε ένα διττό κείμενο που εξαγεται από το σύνολο δεδομένων G-Trans. Οι προτάσεις πηγής αυτού του διττού κειμένου περιέχουν αμφίσημες οντότητες που σημειώνονται ως αρσενικές ή θηλυκές χρησιμοποιώντας / ετικέτες, και η μεταφρασμένη πρόταση έχει σωστές προσανατολισμοί γένους δεδομένης της ετικέτας γένους.’

Εικονογράφηση του σχήματος για την εξαγωγή διττού κειμένου από το σύνολο δεδομένων G-Trans.

Εικονογράφηση του σχήματος για την εξαγωγή διττού κειμένου από το σύνολο δεδομένων G-Trans.

Για αυτήν την προσέγγιση, οι ερευνητές χρησιμοποίησαν μια μεθοδολογία επανεπεξεργασίας πλέγματος από μια πρότερη εργασία του 2020. Για να διασφαλίσουν ότι μόνο το στόχο τομέα (γένος) αντιμετωπίστηκε, χρησιμοποιήθηκε μια περιορισμένη αναζήτηση δέσμης ως φίλτρο.

Για τη μέθοδο LLM, οι ερευνητές ανέπτυξαν μια στρατηγική που χρησιμοποιεί ένα LLM ως επεξεργαστή, επαναγράφοντας τις μεταφρασμένες προτάσεις για να παρέχει αναθέσεις γένους.

Το LLM προrompted χρησιμοποιώντας ένα εντός контекστού παράδειγμα για να ανατεθεί γένος.

Το LLM προrompted χρησιμοποιώντας ένα εντός контεκστού παράδειγμα για να ανατεθεί γένος.

Δεδομένα και δοκιμές

Ο ανιχνευτής αμφίσημων οντοτήτων που χρησιμοποιήθηκε για το έργο αναπτύχθηκε με την παραμετροποίηση του μοντέλου xlm-roberta-large της Facebook AI, χρησιμοποιώντας μετασχηματιστές. Για αυτό, χρησιμοποιήθηκε το συνδυασμένο G-Tag σε όλες τις πέντε γλωσσικές ζεύξεις.

Στην πρώτη από τις δύο προσεγγίσεις, το μοντέλο M2M 1.2B εκπαιδεύτηκε στο Fairseq, μαζί με διττό κείμενο από το σύνολο δεδομένων G-Trans, με προσανατολισμοί γένους που παρέχονται από το Wiktionary.

Για τη μέθοδο LLM, οι ερευνητές χρησιμοποίησαν το GPT-3.5-turbo. Για τη συμφωνία δομών γένους, χρησιμοποιήθηκε ξανά το xlm-roberta-large, αυτή τη φορά με προσανατολισμοί γένους που εξάγονται από το G-Trans.

Οι ερευνητές καταλήγουν στο συμπέρασμα ότι η εργασία τους είναι ένα «δυνατό όργανο» για μελλοντικές εξερευνήσεις σε μία από τις πιο προκλητικές περιοχές της μηχανικής μετάφρασης.

Η εργασία ολοκληρώνεται με την ανακοίνωση ότι τα δεδομένα και οι δοκιμές για το έργο έχουν αναρτηθεί στο GitHub.

Τέλος, οι ερευνητές εκπαιδεύουν διάφορα «βαριά» πολυγλωσσικά μοντέλα σε «βαριά» διττά κείμενα. Τα συνεισφέρωντα σύνολα δεδομένων ήταν το WikiMatrix, το WikiTitles, το Multi-UN, το NewsCommentary και το Tilde.

Δύο επιπλέον «βαριά» μοντέλα εκπαιδεύτηκαν, ένα που ενσωματώνει το σύνολο δεδομένων G-Trans με την προκαταρκτική ετικέτα <γένος>, η οποία χρησιμοποιήθηκε ως η εποπτική βάση: και ένα τρίτο, που ενσωματώνει δομές γένους και συμφωνίες (στο μικρότερο τοπικό μοντέλο, επειδή η χρήση της API του GPT θα ήταν πολύ ακριβή για αυτόν τον σκοπό).

Τα μοντέλα δοκιμάστηκαν ενάντια στο σύνολο δεδομένων FloRes του 2022.

Τελικά μοντέλα μηχανικής μετάφρασης που δοκιμάστηκαν (Π = ακρίβεια, Ρ = ανακληση).

Τελικά μοντέλα μηχανικής μετάφρασης που δοκιμάστηκαν (Π = ακρίβεια, Ρ = ανακληση).

Η εργασία αναφέρει*:

‘Το μοντέλο μας δεν μπορεί να παράγει εναλλακτικές και εμφανίζει μια τεράστια προκατάληψη προς την παραγωγή αρσενικών μορφών (δ-BLEU που κυμαίνεται από 5.3 έως 12.5 πόντους).’

‘Αυτή η προκατάληψη μειώνεται σημαντικά από την εποπτική βάση. Το μοντέλο που εκπαιδεύτηκε σε aumented δεδομένα μειώνει περαιτέρω την προκατάληψη και επιτυγχάνει την καλύτερη απόδοση σε σχέση με τις εναλλακτικές μετρικές, τη συμφωνία και το δ-BLEU.

‘Αυτό δείχνει την αποτελεσματικότητα της διαδικασίας aumento δεδομένων. Τα aumento δεδομένα επίσης μας επιτρέπουν να εκπαιδεύσουμε ένα ανταγωνιστικό σύστημα για την αγγλο-ιταλική γλώσσα, η οποία δεν έχει εποπτική βάση.’

Τέλος, οι ερευνητές καταλήγουν στο συμπέρασμα ότι η επιτυχία του μοντέλου τους πρέπει να θεωρηθεί στο ευρύτερο контέκστο της NLP, η οποία ακόμα παλεύει να ρacionalize την ανάθεση γένους σε μια μέθοδο μετάφρασης: και σημειώνουν ότι αυτό παραμένει ένα ανοιχτό πρόβλημα.

Αν και οι ερευνητές πιστεύουν ότι τα αποτελέσματα που έλαβαν δεν επιτύχουν πλήρως τον στόχο της γεννήτριας οντοτήτων γένους και/ή της αποσαφήνισης γένους, πιστεύουν ότι η εργασία τους είναι ένα «δυνατό όργανο» για μελλοντικές εξερευνήσεις σε μία από τις πιο προκλητικές περιοχές της μηχανικής μετάφρασης.

* Η μετατροπή των εσωτερικών αναφορών των συγγραφέων σε υπερσύνδεσμους

Πρώτη δημοσίευση την Τρίτη, 8 Οκτωβρίου 2024

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]