Ηγέτες σκέψης
Η Γεννητική Νοημοσύνη Δεν Είναι Μια Θανατική Προταση για τις Απειλούμενες Γλώσσες
Σύμφωνα με την UNESCO, μέχρι το 2100, το ήμισυ των γλωσσών μπορεί να εξαφανιστεί. Πολλοί άνθρωποι λένε ότι η γεννητική νοημοσύνη συμβάλλει σε αυτή τη διαδικασία.
Η μείωση της γλωσσικής ποικιλότητας δεν ξεκίνησε με την τεχνητή νοημοσύνη ή το Διαδίκτυο. Αλλά η τεχνητή νοημοσύνη βρίσκεται σε μια θέση να επιταχύνει το τέλος των ιθαγενών και των γλωσσών με περιορισμένες πηγές.
Οι περισσότερες από τις 7.000+ γλώσσες του κόσμου δεν έχουν επαρκείς πηγές για την εκπαίδευση μοντέλων τεχνητής νοημοσύνης και πολλές δεν έχουν γραπτή μορφή. Αυτό σημαίνει ότι μερικές μεγάλες γλώσσες κυριαρχούν στο μετοχικό κεφάλαιο της ανθρωπότητας για δυνητικά δεδομένα εκπαίδευσης τεχνητής νοημοσύνης, ενώ οι περισσότερες είναι σε θέση να μείνουν πίσω στην επανάσταση της τεχνητής νοημοσύνης και μπορεί να εξαφανιστεί完全.
Ο απλός λόγος είναι ότι τα περισσότερα διαθέσιμα δεδομένα εκπαίδευσης τεχνητής νοημοσύνης είναι στα αγγλικά. Τα αγγλικά είναι ο κύριος οδηγός των μεγάλων γλωσσικών μοντέλων (LLM) και οι άνθρωποι που μιλούν λιγότερο συχνές γλώσσες βρίσκονται σε μια θέση να μην αντιπροσωπεύονται στην τεχνολογία της τεχνητής νοημοσύνης.
Συμβουλέψτε αυτές τις στατιστικές από το Παγκόσμιο Οικονομικό Φόρουμ:
- Δύο τρίτα όλων των ιστοσελίδων είναι στα αγγλικά.
- Πολύ από τα δεδομένα που μαθαίνει η GenAI είναι σκαμμένα από το διαδίκτυο.
- Λιγότερο από το 20% του παγκόσμιου πληθυσμού μιλάει αγγλικά.
Όσο η τεχνητή νοημοσύνη γίνεται πιο ενσωματωμένη στη ζωή μας, πρέπει όλοι να σκεφτόμαστε για την ισότητα των γλωσσών. Η τεχνητή νοημοσύνη έχει ασύγκριτο δυναμικό να λύνει προβλήματα σε μεγάλη κλίμακα και η υπόσχεσή της δεν πρέπει να περιορίζεται στον αγγλόφωνο κόσμο. Η τεχνητή νοημοσύνη δημιουργεί ανέσεις και εργαλεία που βελτιώνουν τη ζωή των ανθρώπων σε πλούσιες, ανεπτυγμένες χώρες.
Οι ομιλητές των γλωσσών με περιορισμένες πηγές είναι συνηθισμένοι να βρίσκουν έλλειψη αντιπροσώπευσης στην τεχνολογία – από το να μην βρίσκουν ιστοσελίδες στη γλώσσα τους μέχρι το να μην αναγνωρίζουν την διάλεκτό τους από τη Siri. Πολύ από το κείμενο που υπάρχει για την εκπαίδευση της τεχνητής νοημοσύνης σε γλώσσες με περιορισμένες πηγές είναι καλής ποιότητας (μεταφρασμένο με αμφισβητούμενη ακρίβεια) και στενό στην εμβέλεια.
Πώς μπορεί η κοινωνία να διασφαλίσει ότι οι γλώσσες με περιορισμένες πηγές δεν θα μείνουν πίσω από την εξίσωση της τεχνητής νοημοσύνης; Πώς μπορούμε να διασφαλίσουμε ότι η γλώσσα δεν είναι ένα εμπόδιο στην υπόσχεση της τεχνητής νοημοσύνης;
Σε μια προσπάθεια για την ενσωμάτωση της γλώσσας, ορισμένοι μεγάλοι παίκτες της τεχνολογίας έχουν πρωτοβουλίες για την εκπαίδευση μεγάλων πολυγλωσσικών γλωσσικών μοντέλων (MLM). Η Microsoft (MSFT ) Translate, για παράδειγμα, έχει δεσμευτεί να υποστηρίξει “κάθε γλώσσα, παντού”. Και η Meta έχει μια υπόσχεση “Κανένα Γλώσσα Πίσω”. Αυτά είναι αξιοθαύμαστα, αλλά είναι πραγματικά;
Στοχεύοντας σε ένα μοντέλο που χειρίζεται κάθε γλώσσα στον κόσμο ευνοεί τους προνομιούχους επειδή υπάρχουν πολύ μεγαλύτερα όγκοι δεδομένων από τις μεγάλες γλώσσες του κόσμου. Όταν αρχίζουμε να ασχολούμαστε με γλώσσες με περιορισμένες πηγές και γλώσσες με μη-λατινικούς χαρακτήρες, η εκπαίδευση μοντέλων τεχνητής νοημοσύνης γίνεται πιο δύσκολη, χρονοβόρα – και πιο ακριβή. Σκεφτείτε το ως μια ανεπιθύμητη φόρο στις υποαπανθρακωμένες γλώσσες.
Προσπάθειες στη Γλωσσική Τεχνολογία
Τα μοντέλα της τεχνητής νοημοσύνης εκπαιδεύονται σε μεγάλο βαθμό σε κείμενο, το οποίο φυσικά ευνοεί τις γλώσσες με βαθύτερες αποθήκες κειμένου. Η γλωσσική ποικιλότητα θα ήταν καλύτερα υποστηριζόμενη με συστήματα που δεν εξαρτώνται από το κείμενο. Η ανθρώπινη αλληλεπίδραση κάποτε ήταν εξ ολοκλήρου βασισμένη στη ομιλία και πολλές κουλτούρες διατηρούν αυτή την προφορική εστίαση. Για να εξυπηρετήσουμε καλύτερα ένα παγκόσμιο κοινό, η βιομηχανία της τεχνητής νοημοσύνης πρέπει να προχωρήσει από τα δεδομένα κειμένου σε δεδομένα ομιλίας.
Η έρευνα πραγματοποιεί τεράστιες προόδους στη τεχνολογία ομιλίας, αλλά ακόμη παραμένει πίσω από τις τεχνολογίες που βασίζονται στο κείμενο. Η έρευνα στην επεξεργασία ομιλίας προχωρά, αλλά η άμεση τεχνολογία ομιλίας-προς-ομιλία είναι ακόμη μακριά από την ωριμότητα. Η πραγματικότητα είναι ότι η βιομηχανία τείνει να κινείται προσεκτικά και μόνο όταν μια τεχνολογία προχωρήσει σε ένα bestimmten βαθμό.
Η πλατφόρμα ερμηνείας GlobalLink Live της TransPerfect χρησιμοποιεί τις πιο ώριμες μορφές της τεχνολογίας ομιλίας – την αυτόματη αναγνώριση ομιλίας (ASR) και την τεχνολογία κειμένου-προς-ομιλία (TTS) – και πάλι, επειδή τα άμεσα συστήματα ομιλίας-προς-ομιλία δεν είναι ακόμη ώριμα σε αυτό το σημείο. Όμως, οι ερευνητικές μας ομάδες προετοιμάζονται για την ημέρα όταν οι πλήρεις πipelines ομιλίας-προς-ομιλία θα είναι έτοιμες για prime time.
Τα μοντέλα μετάφρασης ομιλίας-προς-ομιλία προσφέρουν τεράστιο δυναμικό για τη διατήρηση των προφορικών γλωσσών. Το 2022, η Meta ανακοίνωσε το πρώτο σύστημα μετάφρασης ομιλίας-προς-ομιλία που βασίζεται στην τεχνητή νοημοσύνη για τη γλώσσα Χοκκιέν, μια γλώσσα που ομιλείται κυρίως από περίπου 46 εκατομμύρια ανθρώπους στη διασπορά της Κίνας. Είναι μέρος του προγράμματος Universal Speech Translator της Meta, το οποίο αναπτύσσει νέα μοντέλα τεχνητής νοημοσύνης που ελπίζει να ermögουν τη μετάφραση ομιλίας-προς-ομιλία σε πραγματικό χρόνο σε πολλές γλώσσες. Η Meta επέλεξε να ανοίξει το μοντέλο μετάφρασης Χοκκιέν, τα δεδομένα αξιολόγησης και τις ερευνητικές εργασίες ώστε να μπορέσουν άλλοι να αναπαραγάγουν και να χτίσουν πάνω στη δουλειά της.
Μάθηση με Λιγότερα
Το γεγονός ότι ως παγκόσμια κοινότητα μας λείπουν πόρους γύρω από ορισμένες γλώσσες δεν είναι μια θανατική πρόταση για αυτές τις γλώσσες. Αυτό είναι το πού τα μοντέλα πολλών γλωσσών έχουν ένα πλεονέκτημα, επειδή οι γλώσσες μαθαίνουν η μια από την άλλη. Όλες οι γλώσσες ακολουθούν μοτίβα. Λόγω της μεταφοράς γνώσεων μεταξύ γλωσσών, η ανάγκη για δεδομένα εκπαίδευσης μειώνεται.
Υποθέστε ότι έχετε ένα μοντέλο που μαθαίνει 90 γλώσσες και θέλετε να προσθέσετε την Ινουίτ (μια ομάδα ιθαγενών γλωσσών της Βόρειας Αμερικής). Λόγω της μεταφοράς γνώσεων, θα χρειαστείτε λιγότερα δεδομένα Ινουίτ. Βρίσκουμε τρόπους να μαθαίνουμε με λιγότερα. Η ποσότητα δεδομένων που χρειάζεται για την εκπαίδευση των μηχανών είναι χαμηλότερη.
Είμαι αισιόδοξος για ένα μέλλον με πιο ενσωματωμένη τεχνητή νοημοσύνη. Δεν πιστεύω ότι είμαστε καταδικασμένοι να δούμε πλήθεις γλώσσες να εξαφανίζονται – ούτε πιστεύω ότι η τεχνητή νοημοσύνη θα παραμείνει το domaine του αγγλόφωνου κόσμου. Ήδη, βλέπουμε περισσότερη ευαισθητοποίηση γύρω από το ζήτημα της γλωσσικής ισότητας. Από τη συλλογή πιο ποικιλόμορφων δεδομένων μέχρι την κατασκευή πιο γλωσσικών μοντέλων, κάνουμε πρόοδο.
Σκεφτείτε τη γλώσσα Φον, που ομιλείται από περίπου 4 εκατομμύρια ανθρώπους στο Μπενίν και στις γειτονικές αφρικανικές χώρες. Δεν ήταν πολύ καιρό πριν, ένα δημοφιλές μοντέλο τεχνητής νοημοσύνης περιέγραψε τη γλώσσα Φον ως μια μυθική γλώσσα. Ένας επιστήμονας υπολογιστών ονόματι Bonaventure Dosseau, της οποίας η μητέρα μιλάει Φον, ήταν συνηθισμένος σε αυτό το είδος εξαιρέσεων. Ο Dosseau, ο οποίος μιλάει γαλλικά, μεγάλωσε χωρίς κανένα πρόγραμμα μετάφρασης για να βοηθήσει στην επικοινωνία με τη μητέρα του. Σήμερα, μπορεί να επικοινωνήσει με τη μητέρα του χάρη σε ένα μεταφραστή Φον-Γαλλικών που построίσε με προσοχή. Σήμερα, υπάρχει επίσης ένα νεαρό Φον Βικιπαίδεια.
Σε μια προσπάθεια να χρησιμοποιήσουμε την τεχνολογία για τη διατήρηση των γλωσσών, ο τουρκικός καλλιτέχνης Refik Anadol ξεκίνησε τη δημιουργία eines ανοιχτού κώδικα εργαλείου τεχνητής νοημοσύνης για τους ιθαγενείς. Στο Παγκόσμιο Οικονομικό Σύμφωνο, ρώτησε: “Πώς στη γη μπορούμε να δημιουργήσουμε μια τεχνητή νοημοσύνη που δεν γνωρίζει όλη την ανθρωπότητα;”
Δεν μπορούμε, και δεν θα το κάνουμε.












