Modele și platforme AI
Google DeepMind aduce traducerea limbajului semnelor la telefoane cu SL2T

Google DeepMind a lansat un model de traducere a limbajului semnelor, SL2T, în două produse Android pentru consumatori, pentru prima dată când tehnologia de recunoaștere a limbajului semnelor a ajuns la o funcție de telefon. Modelul permite dictarea de la semne la text în Gboard și Live Transcribe pe telefoanele Pixel 11, lansând cu traducerea din limba americană a semnelor în engleză, începând cu 12 august 2026.
Funcția funcționează oriunde un utilizator ar trebui să tasteze în mod normal. Un semnificator surd poate dicta o căutare pe web, redacta un mesaj sau un document, sau poate întreba Gemini prin semne către camera telefonului, în loc să tasteze. În Live Transcribe, semnificatorii pot răspunde în conversație semnată, în loc să tasteze înainte și înapoi. Google spune că testatorii au găsit semnarea în ASL mai rapidă și mai naturală decât tastarea în engleză.
SL2T este primul model pe care Google îl descrie ca o înfrângere a calității și generalității pentru traducerea limbajului semnelor. A fost antrenat pe peste 100.000 de ore de date de semne, cuprinzând peste 50 de limbi semnelor, cu aproximativ o pătrime din datele în ASL. Antrenarea comună pe limbi, dialecte și niveluri de competență a produs un model care depășește sistemele cu o singură limbă în experimentele companiei, conform anunțului.
Ce vede modelul și cum traduce
Sistemul nu procesează videoul brut al semnificatorului. Un model pe dispozitiv, MediaPipe Holistic, urmărește 130 de puncte cheie pe față, corp și mâini, cadru cu cadru, și doar aceste coordonate geometrice părăsesc dispozitivul pentru traducere. Fluxul de cameră original este eliminat imediat, o decizie pe care Google o prezintă ca o măsură de siguranță a confidențialității.
De la acel flux de coordonate, SL2T generează text în engleză direct, ocolind stratul intermediar de anotare cunoscut sub numele de glosar, pe care majoritatea sistemelor anterioare de traducere a limbajului semnelor s-au bazat. Glosarul atribuie etichete fixe unor semne individuale, ceea ce limitează vocabularul și pierde markerii ne-manuali și construcțiile spațiale care poartă sensul gramatical în limbile semnelor. Eliminarea acestei stângăciuni permite calității traducerii să crească odată cu datele de antrenament, și nu cu un set de etichete create manual.
Limbile semnelor sunt limbi naturale independente, cu gramatici proprii, și nu versiuni semnate ale limbii vorbite. Acest lucru face ca sarcina să fie traducerea automată între două limbi, plus o problemă dificilă de vedere a computerului: modelul trebuie să urmărească mișcarea simultană a mâinilor, brațelor, toracelui, capului și feței la rate de cadre ridicate. Încercările anterioare de tehnologie a limbajului semnelor, cum ar fi mănușile cu senzori, nu au putut aborda niciuna dintre aceste cerințe.
Rezultatele benchmark-ului și modelele de eroare rămase
Pe benchmark-ul FLEURS-ASL, care măsoară traducerea din ASL în engleză a limbajului complex, abstract, înregistrat în condiții de studio de către interpreți surzi certificați, SL2T obține 70 BLEURT zero-shot, mult peste rezultatele raportate anterior, conform Google. Compania raportează, de asemenea, 74 BLEURT pe o variantă de semnare cu o mână a benchmark-ului și 85 BLEURT pe PRESTO-ASL, un set de date de fraze asistente semnate către o tabletă conectată. Pe FSboard, un set de date de semne fingerspellate colectate de la semnificatori surzi pe dispozitive mobile, modelul atinge 64 la sută acuratețe exactă. Acestea sunt cifre raportate de furnizor; nu a fost publicată nicio evaluare independentă.
Google a publicat exemple alăturate din FLEURS-ASL, care arată ieșiri fluente alături de moduri de eroare identificabile. Modelul înlocuiește, ocazional, semne rare și fingerspelling rapid, elimină construcții pasive și reprezentări de clasificare, și pierde timpul atunci când contextul lipsește. Un exemplu traduce “Această pasăre cu pene, încălzită cu sânge, de pradă” ca “Această creatură este încălzită cu sânge, mănâncă gri”, o eroare de fingerspelling care înlocuiește “gri” cu “pradă”.
Modelul prezintă, de asemenea, un comportament rezidual de halucinație, generând text atunci când nimeni nu semnează, cum ar fi atunci când o a doua persoană intră în cadru sau semnificatorul se oprește. Google spune că versiunea de lansare a redus semnificativ aceste erori în comparație cu versiunile pre-lansare testate de evaluatori surzi în iulie 2026, dar nu le-a eliminat.
Unde Google spune că instrumentul nu trebuie utilizat
Lansarea vine cu un strat neobișnuit de guvernanță. Google DeepMind a convocat un comitet consultativ, Comitetul consultativ pentru limbajul semnelor AI, care a adunat organizații surde, inclusiv Asociația Națională a Surzilor, Federația Mondială a Surzilor, Rețeaua profesională de arte surde și Institutul Național de Tehnologie din Rochester. Comitetul a co-autorizat un raport de impact comun care stabilește ce este tehnologia și unde se oprește.
Raportul definește SL2T 1.0 ca un instrument de generare a proiectelor asistive pentru setări informale, cu stări joase: mesagerie, căutare, navigare, luarea de notițe și conversații casuale unu-la-unu. Interzice explicit consultări medicale, proceduri legale, interacțiuni cu poliția, instruirea în clasă, interviuri de lucru și determinarea beneficiilor guvernamentale. De asemenea, afirmă că instrumentul nu îndeplinește obligațiile legale pentru adaptări rezonabile în conformitate cu Legea americană cu privire la persoanele cu dizabilități sau cadre echivalente, și că nu trebuie utilizat de instituții pentru a înlocui interpreții umani certificați.
Semnificatorul rămâne în buclă pe tot parcursul. Ambele aplicații afișează o previzualizare a textului pe care utilizatorul o poate revizui și edita înainte de a trimite, și în Live Transcribe, utilizatorul surd controlează când textul tradus este afișat unui partener de conversație. Raportul notează că această măsură de siguranță presupune alfabetizare funcțională în engleză pentru a prinde erorile.
Cum SL2T funcționează în documentul limitelor modelului
Raportul de impact cataloghează limitele tehnice ale modelului în detaliu. Acuratețea se deteriorează în lumina slabă, iluminare puternică sau atunci când îmbrăcămintea reduce contrastul cu mâinile și fața. Următorul de poziție urmărește doar subiectul cel mai mare din cadru și nu poate gestiona mai mulți semnificatori. Performanța scade la unghiuri extreme de cameră sau atunci când semnificatorul se află culcat. Clipurile de intrare sunt limitate la 60 de secunde, și fiecare clip este tradus independent, fără a-și aminti de conversațiile anterioare. Modelul nu a fost antrenat sau evaluat pe semnificatori sub 18 ani. Nu acceptă liste de cuvinte personalizate, semne de nume și preferințe de dialect.
Actualizări pe termen scurt, deja pe drum, includ dictarea punctuației, a noi linii, a emoticonurilor și a comenzilor de editare de bază, plus memoria conversației între clipuri secvențiale în Live Transcribe. Țintele de cercetare pe termen lung includ o sensibilitate mai bună la markerii ne-manuali, cum ar fi expresiile faciale și poziția sprâncenelor, suport pentru mai mulți semnificatori și extinderea colecției de date pe dialecte regionale ASL și ASL negru.
Proiectul a început cu Sam Sepah, un Googler surd, și perspectivele surde au fost integrate în colecția de date, studii de utilizatori și evaluare. Google descrie lansarea SL2T ca începutul unui efort mai lung: limbaje semnelor suplimentare, generarea limbajului semnelor și capacități de frontieră mai largi sunt toate enumerate ca lucrări active. Funcția este livrată pe Pixel 11, fără costuri suplimentare, cu mai multe dispozitive care urmează.
Proiectul a fost inițiat de Sam Sepah, un angajat surd al Google, iar perspectivele surzilor au fost integrate în colecția de date, studii de utilizatori și evaluare. Google descrie lansarea SL2T ca începutul unui efort mai lung: limbaje semnelor suplimentare, generarea limbajului semnelor și capacități de frontieră mai largi sunt toate enumerate ca lucrări active. Funcția este livrată pe Pixel 11, fără costuri suplimentare, cu mai multe dispozitive care urmează să fie lansate în curând, intrând în colecția de date, studii de utilizatori și evaluare, Google descrie SL2T ca începutul unui efort mai lung: limbaje semnelor suplimentare, generarea limbajului semnelor și capacități de frontieră mai largi sunt toate enumerate ca lucrări active. Funcția este livrată pe Pixel 11, fără costuri suplimentare, cu mai multe dispozitive care urmează.












