AI-modeller och plattformar
Google DeepMind tar med sig teckenspråk till telefoner med SL2T

Google DeepMind har lanserat en teckenspråk-till-text-modell, SL2T, i två konsument-Android-produkter, vilket är första gången teckenspråk-AI har nått en färdig telefonfunktion. Modellen möjliggör tecken-till-text-diktering i Gboard och Live Transcribe på Pixel 11-telefoner, som lanseras med amerikanskt teckenspråk till engelsk översättning den 12 augusti 2026.
Funktionen fungerar var som helst en användare normalt skulle skriva. En döv tecknare kan diktera en webbsökning, skriva ett meddelande eller ett dokument eller fråga Gemini genom att teckna till kameran i stället för att skriva. I Live Transcribe kan tecknare svara i tecknad konversation i stället för att skriva fram och tillbaka. Google säger att testare fann att teckna på amerikanskt teckenspråk var snabbare och mer naturligt än att skriva på engelska.
SL2T är den första modellen som Google beskriver som en genombrott i kvalitet och allmänhet för teckenspråk-översättning. Den tränades på mer än 100 000 timmar av teckningsdata som omfattar över 50 teckenspråk, med ungefär en fjärdedel av datan på amerikanskt teckenspråk. Träning över språk, dialekter och färdighetsnivåer resulterade i en modell som överträffar en-språkssystem i företagets experiment, enligt tillkännagivandet.
Vad modellen ser och hur den översätter
Systemet bearbetar inte råvideo av tecknaren. En modell på enheten, MediaPipe Holistic, spårar 130 nyckelpunkter på ansikte, kropp och händer ram för ram, och endast dessa geometriska koordinater lämnar enheten för översättning. Den ursprungliga kamerafeeden kasseras omedelbart, en design som Google beskriver som en säkerhetsåtgärd.
Från den koordinatströmmen genererar SL2T engelsk text direkt, utan den mellanliggande annoteringslagret som kallas glosser som de flesta tidigare teckenspråksöversättnings-system förlitade sig på. Glosser tilldelar fasta etiketter till enskilda tecken, vilket begränsar ordförrådet och förlorar de icke-manuella markörerna och rumsliga konstruktionerna som bär grammatisk betydelse i teckenspråk. Att ta bort den flaskhalsen låter översättningskvaliteten skalas med träningsdata snarare än med en handbyggd etikettuppsättning.
Teckenspråk är oberoende naturliga språk med sina egna grammatik, inte tecknade versioner av talat engelska. Det gör uppgiften till maskinöversättning mellan två språk, plus ett svårt datortekniskt problem: modellen måste spåra samtidig rörelse av händer, armar, torso, huvud och ansikte i höga ramar per sekund. Tidigare försök till teckenspråksteknologi, som sensorgloves, kunde inte hantera något av kraven.
Benchmark-resultat och kvarstående felmönster
På FLEURS-ASL-benchmarken, som mäter ASL-till-engelsk översättning av komplex, abstrakt språk som spelats in i studioförhållanden av certifierade döva tolkar, uppnår SL2T 70 BLEURT zero-shot, betydligt högre än tidigare rapporterade resultat, enligt Google. Företaget rapporterar också 74 BLEURT på en en-hands-teckningsvariant av benchmarken och 85 BLEURT på PRESTO-ASL, en dataset av assistent-stil-fraser som tecknas till en dockad surfplatta. På FSboard, en fingerspelnings-dataset som samlats in från döva tecknare på mobila enheter, uppnår modellen 64 procents exakt-matchningsnoggrannhet. Dessa är leverantörsrapporterade siffror; ingen oberoende utvärdering har publicerats.
Google publicerade exempel från FLEURS-ASL som visar flytande utdata bredvid identifierbara felmoder. Modellen ersätter ibland sällsynta tecken och snabb fingerspelningsfel, tappar passiva konstruktioner och klassificeringsbeskrivningar och förlorar tempus när kontexten saknas. Ett exempel översätter “Denna fullt utvecklade, varmblodiga rovfågel” som “Denna varelse är varmblodig, äter grå”, ett fingerspelningsfel som ersätter “grå” med “rovfågel”.
Modellen visar också kvarstående hallucinationsbeteende, genererar text när ingen tecknar, till exempel när en andra person kommer in i ramen eller tecknaren pausar. Google säger att release-versionen betydligt minskade dessa fel jämfört med för-release-byggnader som döva utvärderare testade i juli 2026, men har inte eliminerat dem.
Där Google säger att verktyget inte ska användas
Släppet har ett ovanligt lager av styrning. Google DeepMind sammankallade en rådgivande kommitté, AI-teckenspråkskommittén, som samlade döva organisationer, inklusive National Association of the Deaf, World Federation of the Deaf, Deaf Professional Arts Network och Rochester Institute of Technologys National Technical Institute for the Deaf. Kommittén var medförfattare till en gemensam påverkansrapport som specificerar vad tekniken är till för och var den slutar.
Rapporten definierar SL2T 1.0 som ett assistivt utkast-genereringsverktyg för låg-stakes, informella miljöer: meddelanden, sökning, navigering, anteckningar och informella en-till-en-samtal. Den utesluter uttryckligen medicinska konsultationer, rättsliga förfaranden, poliskontakter, klassrumsundervisning, jobbintervjuer och regeringsförmånsbestämningar. Den anger också att verktyget inte uppfyller lagliga skyldigheter för rimliga anpassningar enligt Americans with Disabilities Act eller liknande ramverk, och att det inte får användas av institutioner för att ersätta certifierade mänskliga tolkar.
Tecknaren förblir i loopet under hela processen. Båda apparna visar en textförhandsgranskning som användaren kan granska och redigera innan de skickar, och i Live Transcribe kontrollerar den döva användaren när översatt text visas för en samtalspartner. Rapporten noterar att denna säkerhetsåtgärd förutsätter fungerande engelsk läskunnighet för att upptäcka fel.
Hur SL2T presterar i modellens egna begränsningsdokument
Påverkansrapporten katalogiserar modellens tekniska gränser i detalj. Noggrannheten försämras i låg belysning, hård bakgrundsbelysning eller när kläder minskar kontrasten mot händer och ansikte. Positions-spåraren följer endast den största ämnet i ramen och kan inte hantera flera tecknare. Prestandan minskar vid extrema kameravinklar eller när tecknaren ligger på sidan. Inmatningsklipp är begränsade till 60 sekunder, och varje klipp översätts oberoende, utan minne av tidigare samtalsvarv. Modellen tränades eller utvärderades inte på tecknare under 18. Den stöder inga anpassade ordlistor, inga namntecken och inga dialektpreferenser.
Nära-framtida uppdateringar som redan är på väg inkluderar diktering av punktering, nylinjer, emojis och grundläggande redigeringskommandon, plus samtalsminne över sekventiella klipp i Live Transcribe. Längre forskning mål inkluderar bättre känslighet för icke-manuella markörer som ansiktsuttryck och ögonbrynsläge, flera tecknare-stöd och utökad datainsamling över regionala ASL-dialekter och Black ASL.
Projektet började med Sam Sepah, en döv Googler, och döva perspektiv byggdes in i datainsamling, användarstudier och utvärdering. Google beskriver SL2T:s lansering som början på en längre ansträngning: ytterligare teckenspråk, teckenspråksgenerering och bredare gränsförmågor är alla listade som aktivt arbete. Funktionen levereras på Pixel 11 utan extra kostnad, med fler enheter som ska följa, och går in i datainsamling, användarstudier och utvärdering. Google beskriver SL2T:s lansering som början på en längre ansträngning: ytterligare teckenspråk, teckenspråksgenerering och bredare gränsförmågor är alla listade som aktivt arbete. Funktionen levereras på Pixel 11 utan extra kostnad, med fler enheter som ska följa, och går in i datainsamling, användarstudier och utvärdering.












