Η γωνία του Anderson

Το Υψηλό Εκτυπωτικό Ίχνος του Γερμανικού Αυτόματου Μοντέλου Μετάφρασης

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Νέα έρευνα σχετικά με το εκτυπωτικό ίχνος που δημιουργείται από τα μοντέλα μετάφρασης μηχανικής μάθησης δείχνει ότι η γερμανική γλώσσα μπορεί να είναι η πιο ενεργοβόρα δημοφιλής γλώσσα για εκπαίδευση, αν και δεν είναι εντελώς σαφές το γιατί. Η νέα αναφορά έχει ως στόχο να ανοίξει επιπλέον δρόμους έρευνας για πιο ενεργοοικονομικές μεθόδους εκπαίδευσης του AI, στο контέκστ της αυξανόμενης ευαισθητοποίησης σχετικά με το βαθμό στον οποίο τα συστήματα μηχανικής μάθησης καταναλώνουν ηλεκτρική ενέργεια.

Το προ-έντυπο έγγραφο έχει τον τίτλο Περιορισμός των Εκπομπών Ανθρακικού, και προέρχεται από ερευνητές στο Ινστιτούτο Τεχνολογίας Manipal της Ινδίας.

Οι συγγραφείς έκαναν δοκιμές χρόνων εκπαίδευσης και υπολόγισαν τις τιμές εκπομπών ανθρακικού για διάφορες πιθανές δια-γλωσσικές μεταφραστικές μοντέλα, και βρήκαν ‘μια αξιοσημείωτη διαφορά’ μεταξύ του χρόνου που benötείται για τη μετάφραση των τριών πιο ενεργοβόρων γλωσσικών ζευγών, και των τριών πιο ενεργοοικονομικών μοντέλων.

Μέσος όρος εκπομπών ανθρακικού που απελευθερώνονται κατά τη διάρκεια 10 επαναλήψεων εκπαίδευσης. Στα αριστερά, αποτελέσματα με τη χρήση ConvSeq (βλέπε παρακάτω), στα δεξιά, Transformers. Πηγή: https://arxiv.org/pdf/2109.12584.pdf

Μέσος όρος εκπομπών ανθρακικού που απελευθερώνονται κατά τη διάρκεια 10 επαναλήψεων εκπαίδευσης. Στα αριστερά, αποτελέσματα με τη χρήση ConvSeq (βλέπε παρακάτω), στα δεξιά, Transformers. Πηγή: https://arxiv.org/pdf/2109.12584.pdf

Το έγγραφο βρήκε ότι τα πιο ‘οικολογικά’ γλωσσικά ζεύγη για εκπαίδευση είναι τα Αγγλικά>Γαλλικά, Γαλλικά>Αγγλικά και, παραδόξως, Γερμανικά>Αγγλικά, ενώ τα Γερμανικά εμφανίζονται σε όλα τα υψηλότερα καταναλωτικά ζεύγη: Γαλλικά>Γερμανικά, Αγγλικά>Γερμανικά και Γερμανικά>Γαλλικά.

Σύνθετο Έντονο

Τα ευρήματα δείχνουν ότι η λεξική ποικιλία ‘είναι直接 αναλογική στο χρόνο εκπαίδευσης για την επίτευξη ενός επαρκούς επιπέδου απόδοσης’, και σημειώνουν ότι η γερμανική γλώσσα έχει το υψηλότερο λεξικό ποικιλία σκορ μεταξύ των τριών δοκιμασμένων γλωσσών, όπως εκτιμάται από το Type-Token Ratio (TTR) – ένα μέτρο του μεγέθους του λεξικού βασισμένο στο μήκος του κειμένου.

Οι αυξημένες απαιτήσεις επεξεργασίας της γερμανικής γλώσσας σε μοντέλα μετάφρασης δεν αντικατοπτρίζονται στα δεδομένα που χρησιμοποιήθηκαν για το πείραμα. Στην πραγματικότητα, τα γερμανικά λεκτικά σύμβολα που παράγονται από τα δεδομένα έχουν λιγότερα (299445) παράγονται σύμβολα από τα αγγλικά (320108), και πολύ λιγότερα από τα γαλλικά (335917).

Η πρόκληση, από την πλευρά της Φυσικής Γλωσσικής Επεξεργασίας (NLP), είναι να αναλύσει σύνθετα γερμανικά λεκτικά σε συνιστώσες λέξεις. Τα συστήματα NLP συχνά πρέπει να το κάνουν αυτό για τη γερμανική γλώσσα χωρίς τις προ-διαχωρισμένες γλωσσικές ή контекστοποιημένες ενδείξεις που μπορούν να βρεθούν σε γλώσσες με χαμηλότερα TTR σκορ, όπως τα αγγλικά. Η διαδικασία ονομάζεται σύνθετη διάσπαση ή αποσύνθεση.

Η γερμανική γλώσσα έχει κάποια από τα μακρύτερα ατομικά λεκτικά στον κόσμο, αν και το 2013 έχασε την επίσημη αναγνώριση του 65-χαρακτήρων πρώην ρεκόρ-κατόχου, που είναι αρκετά μακρύ για να απαιτεί τη δική του γραμμή σε αυτό το άρθρο:

Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz

Η λέξη αναφέρεται σε ένα νόμο που αναθέτει την παρακολούθηση ετικετών βοείου κρέατος, αλλά εξαφανίστηκε λόγω μιας αλλαγής στις ευρωπαϊκές κανονιστικές προδιαγραφές εκείνη τη χρονιά, παραχωρώντας τη θέση σε άλλα δημοφιλή σταθερά, όπως ‘χήρα του καπετάνιου μιας ατμοπλοϊκής εταιρείας στο Δούναβη’ (49 χαρακτήρες):

Donaudampfschifffahrtsgesellschaftskapitaenswitwe

Γενικά, η συντακτική δομή της γερμανικής γλώσσας απαιτεί μια απομάκρυνση από τις υποθέσεις σχετικά με τη σειρά των λέξεων που υποστηρίζουν τις πρακτικές NLP σε πολλές δυτικές γλώσσες, με το δημοφιλές (Βερολίνο-βασισμένο) πλαίσιο NLP spaCY να υιοθετεί τη δική του εγγενή γλώσσα το 2016.

Προβολικές αντιστοιχίες σε μια αγγλική και γερμανική φράση δείχνουν τις σύνθετες αλληλεπιδράσεις μεταξύ λεξικών στοιχείων στη γερμανική γλώσσα. Πηγή: https://explosion.ai/blog/german-model

Προβολικές αντιστοιχίες σε μια αγγλική και γερμανική φράση δείχνουν τις σύνθετες αλληλεπιδράσεις μεταξύ λεξικών στοιχείων στη γερμανική γλώσσα. Πηγή: https://explosion.ai/blog/german-model

Δεδομένα και Δοκιμές

Για τα δεδομένα, οι ερευνητές χρησιμοποίησαν το Multi30k σύνολο δεδομένων, που περιέχει 30.000 δείγματα σε γαλλική, γερμανική και αγγλική γλώσσα.

Το πρώτο από τα δύο μοντέλα που χρησιμοποιήθηκαν από τους ερευνητές ήταν το Convolutional Sequence to Sequence (ConvSeq) της Facebook AI, ένα νευρωνικό δίκτυο που περιέχει στρωματικές στρώσεις αλλά που δεν έχει ανακυκλικές μονάδες, και αντίθετα χρησιμοποιεί φίλτρα για να εξαγάγει χαρακτηριστικά από το κείμενο. Αυτό επιτρέπει όλες τις επιχειρήσεις να diễnραθούν σε μια παραλληλή και υπολογιστικά αποτελεσματική μορφή.

Η δεύτερη προσέγγιση που χρησιμοποιήθηκε ήταν η αρχιτεκτονική Transformers της Google, επίσης από το 2017. Οι Transformers χρησιμοποιούν γραμμικές στρώσεις, μηχανισμούς προσοχής και ρουτίνες κανονικοποίησης. Ομολογουμένως, το αρχικό μοντέλο που κυκλοφόρησε έχει έρθει υπό κριτική για την ανεπάρκεια του άνθρακα, με ισχυρισμούς που αμφισβητούν τις επόμενες βελτιώσεις.

Οι δοκιμές διεξήχθησαν στο Google Colab, ομοιόμορφα σε ένα Tesla K80 (TSLA ) GPU. Οι γλώσσες συγκρίθηκαν χρησιμοποιώντας einen BLEU (Bilingual Evaluation Understudy) μετρικό και τον CodeCarbon Machine Learning Emissions Calculator. Τα δεδομένα εκπαιδεύτηκαν για 10 επαναλήψεις.

Ευρήματα

Οι ερευνητές βρήκαν ότι ήταν η παρατεταμένη διάρκεια εκπαίδευσης για γερμανικά ζεύγη γλωσσών που έστρεψε την ισορροπία προς υψηλότερη κατανάλωση άνθρακα. Αν και κάποια άλλα γλωσσικά ζεύγη, όπως τα Αγγλικά>Γαλλικά και Γαλλικά>Αγγλικά, είχαν ακόμη υψηλότερη κατανάλωση άνθρακα, εκπαιδεύτηκαν πιο γρήγορα και λύθηκαν πιο εύκολα, με αυτές τις εκρήξεις κατανάλωσης που χαρακτηρίζονται από τους ερευνητές ως ‘σχετικά αμελητέες’ σε σχέση με την κατανάλωση από γλωσσικά ζεύγη που περιλαμβάνουν τη γερμανική γλώσσα.

Ανάλυση των γλωσσικών ζευγών από τις εκπομπές του κωδικοποιητή/αποκωδικοποιητή.

Ανάλυση των γλωσσικών ζευγών από τις εκπομπές του κωδικοποιητή/αποκωδικοποιητή.

Οι ερευνητές καταλήγουν στο συμπέρασμα:

‘Τα ευρήματά μας παρέχουν σαφείς ενδείξεις ότι κάποια γλωσσικά ζεύγη είναι πιο ενεργοβόρα για εκπαίδευση από άλλα, μια τάση που διαρκεί σε διάφορες αρχιτεκτονικές.’

Συνεχίζουν:

‘Ωστόσο, υπάρχουν ακόμη απαντημένες ερωτήσεις σχετικά με το γιατί υπάρχουν τέτοιες δραματικές διαφορές στην εκπαίδευση μοντέλων για ένα συγκεκριμένο γλωσσικό ζεύγος από ένα άλλο, και αν διαφορετικές αρχιτεκτονικές μπορεί να είναι πιο κατάλληλες για αυτά τα ενεργοβόρα γλωσσικά ζεύγη, και γιατί θα ήταν έτσι αν ήταν αλήθεια.’

Το έγγραφο τονίζει ότι οι λόγοι για την ανισότητα της κατανάλωσης άνθρακα σε μοντέλα εκπαίδευσης δεν είναι εντελώς σαφείς. Αναμένουν να αναπτύξουν αυτή τη γραμμή έρευνας με μη λατινικές γλώσσες.

1.20pm GMT+2 – Διορθώθηκε λάθος κειμένου.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai