AI-modeller og platforme

Google DeepMind bringer tegnsprogsøversættelse til telefoner med SL2T

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google DeepMind har udgivet en tegnsprogsøversættelsesmodel, SL2T, i to forbruger-Android-produkter, hvilket er første gang, tegnsprogs-AI har nået et skibbar telefonfunktion. Modellen aktiverer tegn-til-tekst-diktering i Gboard og Live Transcribe på Pixel 11-telefoner, der lanceres med amerikansk tegnsprog til engelsk oversættelse den 12. august 2026.

Funktionen virker overalt, hvor en bruger normalt ville skrive. En døv tegnsprogbruger kan diktere en web-søgning, udarbejde en besked eller dokument, eller spørge Gemini ved at tegne til telefonens kamera i stedet for at skrive. I Live Transcribe kan tegnsprogbrugere svare i tegnet samtale i stedet for at skrive frem og tilbage. Google siger, at testere fandt tegnsprog i ASL hurtigere og mere naturligt end at skrive på engelsk.

SL2T er den første model, som Google beskriver som en gennembrud i kvalitet og generel tegnsprogsøversættelse. Den blev trænet på mere end 100.000 timers tegnsprogsdata, der dækker over 50 tegnsprog, med cirka en fjerdedel af data i ASL. Træning over sprog, dialekter og kompetenceniveauer producerede en model, der overgår enkelt-sprogssystemer i virksomhedens eksperimenter, ifølge meddelelsen.

Hvad modellen ser og hvordan den oversætter

Systemet behandler ikke rå video af tegnsprogbrugeren. En på-enhed-model, MediaPipe Holistic, sporer 130 nøglepunkter på ansigtet, kroppen og hænderne ramme for ramme, og kun disse geometriske koordinater forlader enheden til oversættelse. Den originale kamerafeed kasseres straks, en design, som Google fremstiller som en beskyttelse af privatlivet.

Fra denne koordinatstrøm genererer SL2T direkte engelsk tekst, uden at gå gennem den mellemliggende annotationslag, der kaldes glosser, som de fleste tidligere tegnsprogsøversættelsessystemer afhængigt af. Glosser tildeler faste mærker til enkelttegn, hvilket begrænser ordforrådet og taber de ikke-manuelle markører og rumlige konstruktioner, der bærer grammatisk betydning i tegnsprog. Fjernelse af denne flaskehals tillader oversættelseskvalitet at skala med træningsdata snarere end med en håndbygget mærkesæt.

Tegnsprog er uafhængige naturlige sprog med deres eget grammatik, ikke tegnede versioner af talte engelsk. Det gør opgaven maskinoversættelse mellem to sprog, plus et hårdt computer-vision-problem: modellen må spore samtidig bevægelse af hænder, arme, torso, hoved og ansigt i høje rammehastigheder. Tidligere forsøg på tegnsprogteknologi, såsom sensorhandsker, kunne ikke imødekomme nogen af disse krav.

Benchmark-resultater og resterende fejlmoder

FLEURS-ASL-benchmarket, som måler ASL-til-engelsk oversættelse af komplekse, abstrakte sprog optaget i studieforhold af certificerede døve tolke, scorer SL2T 70 BLEURT zero-shot, langt over tidligere rapporterede resultater, ifølge Google. Virksomheden rapporterer også 74 BLEURT på en en-håndet tegnsprogsvariant af benchmarket og 85 BLEURT på PRESTO-ASL, en dataset af assistent-stil-fraser tegnet til en docket tablet. På FSboard, en fingerspelling-dataset samlet fra døve tegnsprogbrugere på mobile enheder, når modellen 64 procent nøjagtig-matchningsnøjagtighed. Disse er leverandør-rapporterede cifre; ingen uafhængig evaluering er offentliggjort.

Google har offentliggjort side-ved-side-eksempler fra FLEURS-ASL, der viser flydende output sammen med identificerbare fejlmoder. Modellen erstatter lejlighedsvis sjældne tegn og hurtig fingerspelling, dropper passive konstruktioner og klassificeringsafbildninger og taber tid, når konteksten mangler. Et eksempel oversætter “Dette fuldt fjerklædte, varmblodige fugl af bytte” som “Denne skabning er varmblodig, spiser gråt”, en fingerspelling-fejl, der erstatter “gråt” med “bytte”.

Modellen viser også resterende hallucinationsadfærd, hvor den genererer tekst, når ingen tegner, såsom når en anden person kommer ind i billedet eller tegnsprogbrugeren pauserer. Google siger, at udgivelsesversionen betydeligt reducerede disse fejl i forhold til præ-udgivelsesbygningerne, som døve evalueringer testede i juli 2026, men har ikke elimineret dem.

Hvor Google siger, at værktøjet ikke må bruges

Udgivelsen medfører et usædvanligt lag af styring. Google DeepMind indkaldte et rådgivende organ, AI Tegnsprog Rådet, der samlede døve organisationer, herunder National Association of the Deaf, World Federation of the Deaf, Deaf Professional Arts Network og Rochester Institute of Technology’s National Technical Institute for the Deaf. Rådet var medforfatter til en fælles påvirkningsrapport, der fastlægger, hvad teknologien er til og hvor den stopper.

Rapporten definerer SL2T 1.0 som et assistent-draft-genereringsværktøj til lav-risiko, uformelle sammenhænge: beskeder, søgning, navigation, notering og uformelle en-til-en-samtaler. Den udelukker uttrykkeligt medicinske konsultationer, retslige forhandlinger, politi-sammenstød, klasserundervisning, jobsamtaler og regeringsydelses-beslutninger. Den fastslår også, at værktøjet ikke opfylder lovlige forpligtelser til rimelige tilpasninger under Americans with Disabilities Act eller tilsvarende rammer, og at det ikke må bruges af institutioner til at erstatte certificerede menneskelige tolke.

Tegnsprogbrugeren forbliver i løkken hele tiden. Begge apps viser en tekstforhåndsvisning, som brugeren kan gennemse og redigere, før den sendes, og i Live Transcribe kontrollerer den døve bruger, hvornår oversat tekst vises til en samtalepartner. Rapporten bemærker, at denne sikkerhedsforanstaltning antager fungerende engelsk læsefærdighed for at fange fejl.

Hvor SL2T fungerer i modellens egne begrænsninger-dokument

Påvirkningsrapporten katalogiserer modellens tekniske grænser i detaljer. Nøjagtigheden forringes i lavt lys, hårdt baglys eller når tøj reducerer kontrast mod hænder og ansigt. Positurens sporingsfunktion følger kun den største objekt i billedet og kan ikke håndtere multiple tegnsprogbrugere. Ydelsen falder ved ekstreme kamera-vinkler eller når tegnsprogbrugeren ligger på siden. Indput-klip er begrænset til 60 sekunder, og hver klip oversættes uafhængigt, uden nogen hukommelse for tidligere samtaleomgange. Modellen blev ikke trænet eller vurderet på tegnsprogbrugere under 18 år. Den understøtter ingen brugerdefinerede ordlister, ingen navne-tegn og ingen dialekt-præferencer.

Nærige opdateringer, der allerede er på vej, inkluderer diktering af tegnpunktion, nye linjer, emojis og grundlæggende redigeringsfunktioner, samt samtalehukommelse på tværs af sekventielle klip i Live Transcribe. Længerevarende forskningsmål inkluderer bedre følsomhed over for ikke-manuelle markører, såsom ansigtsudtryk og øjenbrynposition, multi-tegnsprogbruger-understøttelse og udvidet dataindsamling på tværs af regionale ASL-dialekter og Black ASL.

Projektet oprindeligt med Sam Sepah, en døv Googler, og døve perspektiver blev bygget ind i dataindsamling, brugerstudier og evaluering. Google beskriver SL2T’s lanceringsstart som begyndelsen på en længere bestræbelse: yderligere tegnsprog, tegnsprogs-generering og bredere frontiers-kapaciteter er alle nævnt som aktivt arbejde. Funktionen leveres på Pixel 11 uden ekstra omkostninger, med flere enheder til at følge.

into data collection, user studies, and evaluation. Google describes SL2T’s launch as the beginning of a longer effort: additional sign languages, sign language generation, and broader frontier capabilities are all listed as active work. The feature ships on Pixel 11 at no additional cost, with more devices to follow.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.