AI-modeller og plattformer
Google DeepMind bringer tegnspråk-oversettelse til telefoner med SL2T

Google DeepMind har lansert en tegnspråk-til-tekst-modell, SL2T, i to forbruker-Android-produkter, første gang tegnspråk-AI har nådd en shipping-telefon-funksjon. Modellen gir tegn-til-tekst-diktering i Gboard og Live Transcribe på Pixel 11-telefoner, og lanseres med amerikansk tegnspråk-til-engelsk oversettelse den 12. august 2026.
Funksjonen fungerer overalt hvor en bruker vanligvis skriver. En døv tegner kan diktere en nett-søk, utarbeide en melding eller dokument, eller spørre Gemini ved å tegne til telefonens kamera i stedet for å skrive. I Live Transcribe kan tegnere svare i tegnet samtale i stedet for å skrive frem og tilbake. Google sier at testere fant tegning i ASL raskere og mer naturlig enn å skrive på engelsk.
SL2T er den første modellen Google beskriver som et gjennombrudd i kvalitet og generellhet for tegnspråk-oversettelse. Den ble trent på over 100 000 timer med tegning-data som omfatter over 50 tegnspråk, med omtrent en fjerdedel av dataene på ASL. Trening sammen over språk, dialekter og ferdighetsnivåer produserte en modell som overgår enkelt-språk-systemer i selskapets eksperimenter, ifølge annonsen.
Hva modellen ser og hvordan den oversetter
Systemet prosesserer ikke rå video av tegneren. En på-enhet-modell, MediaPipe Holistic, sporer 130 nøkkel-punkter på ansiktet, kroppen og hendene ramme for ramme, og bare disse geometriske koordinatene forlater enheten for oversettelse. Den opprinnelige kamera-feeden blir umiddelbart forkastet, en design som Google rammer som en personvernsikring.
Fra denne koordinat-strømmen genererer SL2T engelsk tekst direkte, og hopper over den midlertidige annoterings-lag som de fleste tidligere tegnspråk-oversettelses-systemer avhengig av. Denne bottleneck lar oversettelses-kvaliteten skala med trening-data i stedet for med en hånd-bygget merke-sett.
Tegnspråk er uavhengige naturlige språk med sine egne grammatikker, ikke tegnet versjoner av tale-engelsk. Dette gjør oppgaven maskin-oversettelse mellom to språk, pluss et hardt datamaskin-problem: modellen må spore samtidig bevegelse av hendene, armene, torsoen, hodet og ansiktet i høye rammer. Tidligere forsøk på tegnspråk-teknologi, som sensor-hansker, kunne ikke håndtere noen av disse kravene.
Benchmark-resultater og gjenværende feil-mønster
På FLEURS-ASL-benchmark, som måler ASL-til-engelsk oversettelse av komplekse, abstrakte språk innspilt i studio-forhold av sertifiserte døve-tolker, scorer SL2T 70 BLEURT zero-shot, langt over tidligere rapporterte resultater, ifølge Google. Selskapet rapporterer også 74 BLEURT på en en-hånd-tegning-variant av benchmarken og 85 BLEURT på PRESTO-ASL, en datasett av assistent-stil-fraser tegnet til en dokket tablet. På FSboard, en fingerspelling-datasett samlet fra døve-tegnere på mobile enheter, når modellen 64 prosent eksakt-match-akkuratesse. Disse er leverandør-rapporterte figurer; ingen uavhengig evaluering har blitt publisert.
Google publiserte side-ved-side-eksempler fra FLEURS-ASL som viser flytende utgang sammen med identifiserbare feil-mønster. Modellen erstatter sjelden tegn og raske fingerspelling, dropper passive konstruksjoner og klassifikator-beskrivelser, og mister tense når konteksten mangler. Et eksempel oversetter “Dette fullt fjærdekte, varmblodige fugl av bytte” som “Dette vesenet er varmblodig, spiser grå”, en fingerspelling-feil som erstatter “grå” med “bytte”.
Modellen viser også resterende hallucinasjons-atferd, genererer tekst når ingen tegner, som når en annen person går inn i rammen eller tegneren pauser. Google sier at lanserings-versjonen betydelig reduserte disse feilene sammenlignet med pre-lanserings-bygninger som døve-evaluatorene testet i juli 2026, men har ikke eliminert dem.
Hvor Google sier at verktøyet ikke skal brukes
Lanseringen bærer en uvanlig lag av styring. Google DeepMind samlet en rådgivende komité, AI-tegnspråk-rådgivende komité, som samlet døve-organisasjoner, inkludert National Association of the Deaf, World Federation of the Deaf, Deaf Professional Arts Network og Rochester Institute of Technologys National Technical Institute for the Deaf. Komitéen var med-forfatter av en felles påvirknings-rapport som definerer hva teknologien er for og hvor den stopper.
Rapporten definerer SL2T 1.0 som et assistent-draft-genererings-verktøy for lav-utsatte, uformelle settinger: meldinger, søk, navigasjon, notat-tak og uformelle en-til-en-samtaler. Den eksplisitt utelukker medisinske konsultasjoner, juridiske prosedyrer, politi-samtaler, klasserom-instruksjon, jobb-intervjuer og regjerings-ytelses-bestemminger. Den fastslår også at verktøyet ikke oppfyller lovlige forpliktelser for rimelige tiltak under Americans with Disabilities Act eller tilsvarende rammer, og at det ikke skal brukes av institusjoner til å erstatte sertifiserte menneskelige tolker.
Tegneren forblir i løkken gjennom hele prosessen. Begge appene viser en tekst-forhåndsvisning som brukeren kan se over og redigere før sending, og i Live Transcribe kontrollerer den døve brukeren når oversatt tekst vises til en samtale-partner. Rapporten bemerker at denne sikkerheten antar funksjonell engelsk litteratur for å fange feil.
Hvordan SL2T fungerer i modellens egne grenser-dokument
Påvirknings-rapporten katalogiserer modellens tekniske grenser i detalj. Nøyaktigheten forringes i lavt lys, hardt baklys eller når klær reduserer kontrast mot hendene og ansiktet. Posesporingen følger bare den største subjektet i rammen og kan ikke håndtere flere tegnere. Ytelsen synker i ekstreme kamera-vinkler eller når tegneren ligger på siden. Inndata-klipp er begrenset til 60 sekunder, og hvert klipp oversettes uavhengig, uten minne av tidligere samtale-omganger. Modellen ble ikke trent eller evaluert på tegnere under 18 år. Den støtter ingen tilpassede ord-lister, ingen navn-tegn, og ingen dialekt-preferanser.
Nær-framtidige oppdateringer som allerede er på vei inkluderer diktering av punktum, nye linjer, emojier og grunnleggende redigerings-kommandoer, pluss samtale-minne over sekvensielle klipp i Live Transcribe. Lengre-framtidige forsknings-mål inkluderer bedre sensitivitet til ikke-manuelle markører som ansikts-uttrykk og øyebryn-plassering, multi-tegner-støtte og utvidet data-innsamling over regionale ASL-dialekter og Black ASL.
Prosjektet oppstod med Sam Sepah, en døv Googler, og døve perspektiver ble bygget inn i data-innsamling, bruker-studier og evaluering. Google beskriver SL2T-lanseringen som begynnelsen på en lengre innsats: ytterligere tegnspråk, tegnspråk-generering og bredere grense-egenskaper er alle listet som aktive arbeid. Funksjonen leveres på Pixel 11 uten ekstra kostnad, med flere enheter som skal følge.












