Μοντέλα και πλατφόρμες AI

Η Google DeepMind Φέρνει Μεταφράσεις Γλωσσών Νοημάτων στα Κινητά Με το SL2T

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Google DeepMind έχει κυκλοφορήσει ένα μοντέλο μετάφρασης γλωσσών νοημάτων, το SL2T, μέσα σε δύο καταναλωτικά προϊόντα Android, για πρώτη φορά η τεχνολογία γλωσσών νοημάτων έχει φτάσει σε μια λειτουργία κινητού τηλεφώνου. Το μοντέλο ενεργοποιεί τη μεταφράση νοήματος σε κείμενο στο Gboard και στο Live Transcribe στα τηλέφωνα Pixel 11, με την πρώτη κυκλοφορία της αμερικανικής γλωσσάς νοημάτων προς αγγλική μετάφραση στις 12 Αυγούστου 2026.

Η λειτουργία εργάζεται όπου ένας χρήστης θα πληκτρολογούσε κανονικά. Ένας κωφός που χρησιμοποιεί νοήματα μπορεί να δικτάζει μια αναζήτηση στο διαδίκτυο, να συντάξει ένα μήνυμα ή έγγραφο, ή να ρωτήσει τη Gemini με την uso του τηλεφώνου αντί να πληκτρολογεί. Στο Live Transcribe, οι χρήστες που χρησιμοποιούν νοήματα μπορούν να απαντούν σε συνομιλίες με νοήματα αντί να πληκτρολογούν. Η Google λέει ότι οι δοκιμαστές βρήκαν ότι η χρήση νοημάτων στην αμερικανική νοηματική γλώσσα ήταν ταχύτερη και πιο φυσική από το πληκτρολόγηση στην αγγλική γλώσσα.

Το SL2T είναι το πρώτο μοντέλο που η Google περιγράφει ως μια επαναστατική καινοτομία στην ποιότητα και την γενικότητα για τη μετάφραση γλωσσών νοημάτων. Εκπαιδεύτηκε σε πάνω από 100.000 ώρες δεδομένων νοημάτων που καλύπτουν πάνω από 50 γλωσσές νοημάτων, με περίπου ένα τέταρτο των δεδομένων στην αμερικανική νοηματική γλώσσα. Η εκπαίδευση σε πολλές γλώσσες, διαλέκτους και επίπεδα ικανότητας παρήγαγε ένα μοντέλο που υπερέχει των μοντέλων μιας γλώσσας στις πειραματικές δοκιμές της εταιρείας, σύμφωνα με την ανακοίνωση.

Τι Βλέπει το Μοντέλο και Πώς Μεταφράζει

Το σύστημα δεν επεξεργάζεται το βίντεο του χρήστη που χρησιμοποιεί νοήματα. Ένα μοντέλο στο κινητό, το MediaPipe Holistic, παρακολουθεί 130 σημεία στο πρόσωπο, το σώμα και τα χέρια καρέ-καρέ, και μόνο οι γεωμετρικές συντεταγμένες απεσταλμένες για μετάφραση. Η αρχική κάμερα απορρίπτεται αμέσως, μια σχεδίαση που η Google την παρουσιάζει ως μέτρο προστασίας της ιδιωτικής ζωής.

Από αυτή τη ροή συντεταγμένων, το SL2T παράγει αγγλικό κείμενο απευθείας, παραλείποντας το ενδιάμεσο στρώμα ανότασης που ονομάζεται γλωσσικά σημεία, στα οποία βασίζονταν τα περισσότερα προηγούμενα συστήματα μετάφρασης γλωσσών νοημάτων. Τα γλωσσικά σημεία αναθέτουν σταθερές ετικέτες σε μεμονωμένα σημεία, που περιορίζει το λεξιλόγιο και χάνει τις μη χειρονομιακές ενδείξεις και τις χωρικές κατασκευές που φέρουν γραμματική σημασία στις γλωσσές νοημάτων. Η αφαίρεση αυτού του φραγμού επιτρέπει στην ποιότητα μετάφρασης να κλιμακωθεί με τα δεδομένα εκπαίδευσης και όχι με ένα χειροκίνητο σύνολο ετικετών.

Οι γλωσσές νοημάτων είναι ανεξάρτητες φυσικές γλώσσες με τις δικές τους γραμματικές, όχι σημειογραφημένες εκδοχές της ομιλούμενης αγγλικής. Αυτό κάνει τη δουλειά τη μετάφραση μεταξύ δύο γλωσσών, συν μια σκληρή πρόβλημα υπολογιστικής όρασης: το μοντέλο πρέπει να παρακολουθεί ταυτόχρονη κίνηση των χεριών, των βραχιόνων, του κορμού, του κεφαλιού και του προσώπου σε υψηλές ταχύτητες καρέ. Προηγούμενες προσπάθειες για τεχνολογία γλωσσών νοημάτων, όπως γάντια αισθητήρων, δεν μπορούσαν να αντιμετωπίσουν καμία από τις απαιτήσεις.

Αποτελέσματα Benchmark και Υπόλοιπα Πρότυπα Λάθους

Στο FLEURS-ASL benchmark, που μετρά την μετάφραση από αμερικανική νοηματική γλώσσα σε αγγλικά για σύνθετη, αφηρημένη γλώσσα που καταγράφηκε σε στούντιο από Πιστοποιημένους Κωφούς Διερμηνείς, το SL2T σημειώνει 70 BLEURT zero-shot, πολύ πάνω από τις προηγούμενες αναφερόμενες επιδόσεις, σύμφωνα με την Google. Η εταιρεία αναφέρει επίσης 74 BLEURT σε μια εκδοχή με ένα χέρι του benchmark και 85 BLEURT στο PRESTO-ASL, ένα σύνολο δεδομένων φράσεων βοηθού που υπογράφονται σε μια στήριξη πίνακα. Στο FSboard, ένα σύνολο δεδομένων δακτυλογραφίας που συλλέχθηκε από κωφούς που χρησιμοποιούν νοήματα σε κινητές συσκευές, το μοντέλο φτάνει στο 64% ακριβή-ταίριασμα. Αυτά είναι στοιχεία που αναφέρθηκαν από τον προμηθευτή· δεν έχει δημοσιευθεί ανεξάρτητη αξιολόγηση.

Η Google δημοσίευσε παράλληλες παραδείγματα από το FLEURS-ASL που δείχνουν ροή εξόδου μαζί με αναγνωρίσιμους τρόπους λάθους. Το μοντέλο υποκαταstitue σπάνια σημεία και ταχεία δακτυλογραφία, παραλείπει παθητικές κατασκευές και εικονογραφικές απεικονίσεις, και χάνει τη διάρκεια όταν λείπει ο контекst. Ένα παράδειγμα μεταφράζει “Αυτό το πλήρως φτερωτό, ζεστό αίμα πουλερικό” ως “Αυτό το πλάσμα είναι ζεστό-αιματωτό, τρώει γκρίζο”, ένα λάθος δακτυλογραφίας που αντικαθιστά “γκρίζο” με “θήραμα”.

Το μοντέλο δείχνει επίσης υπολειπόμενη συμπεριφορά οπτικών ψευδαισθήσεων, παράγοντας κείμενο όταν κανείς δεν υπογράφει, όπως όταν ένας δεύτερος άνθρωπος μπαίνει στο πλαίσιο ή ο χρήστης που χρησιμοποιεί νοήματα παύει. Η Google λέει ότι η έκδοση κυκλοφορίας μειώνει σημαντικά αυτά τα λάθη σε σύγκριση με τις προ-έκδοσης που δοκιμάστηκαν από κωφούς αξιολογητές τον Ιούλιο του 2026, αλλά δεν τα έχει εξαλείψει.

Πού Η Google Λέει Ότι Το Εργαλείο Δεν Πρέπει Να Χρησιμοποιηθεί

Η κυκλοφορία φέρνει ένα ασυνήθιστο επίπεδο διακυβέρνησης. Η Google DeepMind συγκάλεσε einen συμβουλευτικό орган, την Επιτροπή Συμβουλών Γλωσσών Νοημάτων AI, που συγκέντρωσε κωφές οργανώσεις, συμπεριλαμβανομένης της Εθνικής Ένωσης Κωφών, του Παγκοσμίου Οργανισμού Κωφών, του Δικτύου Επαγγελματιών Τεχνών Κωφών και του Εθνικού Τεχνικού Ινστιτούτου Κωφών του Ρότσεστερ. Η επιτροπή συν-έγραψε μια κοινή αναφορά επίδρασης που καθορίζει τι είναι η τεχνολογία για και πού σταματά.

Η αναφορά ορίζει το SL2T 1.0 ως ένα βοηθητικό εργαλείο δημιουργίας προσχέδιου για χαμηλής εμβέλειας, ανεπίσημες ρυθμίσεις: μηνύματα, αναζήτηση, πλοήγηση, σημείωση και απλές συνομιλίες. Αυτό ρητά αποκλείει ιατρικές консουλτούες, νομικές διαδικασίες, αλληλεπιδράσεις με την αστυνομία, διδασκαλία, συνεντεύξεις εργασίας και αποφάσεις για κυβερνητικές παροχές. Αυτό επίσης δηλώνει ότι το εργαλείο δεν ικανοποιεί τις νομικές υποχρεώσεις για εύλογες προσαρμογές σύμφωνα με τον Αμερικανικό Νόμο για την Προσβασιμότητα των ΑμεΑ ή ισοδύναμους πλαισίου, και ότι δεν πρέπει να χρησιμοποιηθεί από ιδρύματα για να αντικαταστήσουν πιστοποιημένους ανθρώπινους διερμηνείς.

Ο χρήστης που χρησιμοποιεί νοήματα παραμένει στο loop καθ’ όλη τη διάρκεια. Και οι δύο εφαρμογές δείχνουν μια προεπισκόπηση κειμένου που ο χρήστης μπορεί να αναθεωρήσει και να επεξεργαστεί πριν την αποστολή, και στο Live Transcribe ο κωφός χρήστης ελέγχει πότε το μεταφρασμένο κείμενο θα εμφανιστεί σε einen συνομιλητή. Η αναφορά σημειώνει ότι αυτή η προστασία υποθέτει λειτουργική αγγλική γραμματεία για να πιάσει τα λάθη.

Πώς Το SL2T Εκτελείται στα Δικά του Όρια Ντοκιμαντέρ

Η αναφορά επίδρασης καταλογραφεί τα τεχνικά όρια του μοντέλου λεπτομερώς. Η ακρίβεια χειροτερεύει σε χαμηλό φως, δυσχερή φωτισμό, ή όταν τα ρούχα μειώνουν την αντίθεση με τα χέρια και το πρόσωπο. Ο παρακολούθησης στάσης ακολουθεί μόνο το μεγαλύτερο αντικείμενο στο πλαίσιο και δεν μπορεί να χειριστεί πολλαπλούς χρήστες που χρησιμοποιούν νοήματα. Η απόδοση πέφτει σε ακραίες γωνίες κάμερας ή όταν ο χρήστης που χρησιμοποιεί νοήματα лежει οριζόντια. Οι είσοδοι clip είναι περιορισμένες σε 60 δευτερόλεπτα, και κάθε clip μεταφράζεται ανεξάρτητα, χωρίς μνήμη προηγούμενων συζητητικών στροφών. Το μοντέλο δεν εκπαιδεύτηκε ή αξιολογήθηκε σε χρήστες που χρησιμοποιούν νοήματα κάτω των 18. Δεν υποστηρίζει προσωποποιημένες λίστες λέξεων, ονομάτων σημάτων, ή προτιμήσεις διαλέκτων.

Εγγύς-μελλοντικές ενημερώσεις ήδη στο δρόμο περιλαμβάνουν δικτάρισμα στίξης, νέες γραμμές, εικονίδια και βασικές εντολές επεξεργασίας, συν συνομιλίας μνήμης σε ακολουθίες clip στο Live Transcribe. Μακροπρόθεσμες ερευνητικές στόχοι περιλαμβάνουν καλύτερη ευαισθησία σε μη χειρονομιακές ενδείξεις όπως εκφράσεις προσώπου και θέση φρυδιών, υποστήριξη πολλαπλών χρηστών που χρησιμοποιούν νοήματα, και επέκταση συλλογής δεδομένων σε περιφερειακές διαλέκτους αμερικανικής νοηματικής γλώσσας και μαύρης αμερικανικής νοηματικής γλώσσας.

Το πρότζεκτ ξεκίνησε με τον Sam Sepah, έναν κωφό της Google, και οι προοπτικές κωφών ήταν χτισμένες στη συλλογή δεδομένων, στις μελέτες χρηστών και στην αξιολόγηση. Η Google περιγράφει την κυκλοφορία του SL2T ως την αρχή μιας μακρύτερης προσπάθειας: πρόσθετες γλωσσές νοημάτων, γεννήτρια γλωσσών νοημάτων, και ευρύτερες ικανότητες είναι όλες αναγραφμένες ως ενεργός εργασία. Η λειτουργία κυκλοφορεί στο Pixel 11 χωρίς επιπλέον κόστος, με περισσότερες συσκευές να ακολουθούν.

into data collection, user studies, and evaluation. Google describes SL2T’s launch as the beginning of a longer effort: additional sign languages, sign language generation, and broader frontier capabilities are all listed as active work. The feature ships on Pixel 11 at no additional cost, with more devices to follow.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.