AI-modellen en platforms

Google DeepMind Brengt Gebarentaalvertaling naar Telefoons met SL2T

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Google DeepMind heeft een gebarentaal-naar-tekstmodel, SL2T, uitgebracht in twee consumenten-Android-producten, voor het eerst heeft gebarentaal-AI een verzonden telefoongebruik bereikt. Het model activeert gebaar-naar-tekstdictatie in Gboard en Live Transcribe op Pixel 11-telefoons, met een lancering met Amerikaanse Gebarentaal naar Engelse vertaling op 12 augustus 2026.

Het kenmerk werkt overal waar een gebruiker normaal zou typen. Een dove gebarentaler kan een webzoekopdracht dicteren, een bericht of document opstellen of Gemini vragen door te gebaren naar de camera van de telefoon in plaats van te typen. In Live Transcribe kunnen gebarentalers reageren in een gebarentaalgesprek in plaats van heen en weer te typen. Google zegt dat testers vonden dat gebaren in ASL sneller en natuurlijker was dan typen in het Engels.

SL2T is het eerste model dat Google beschrijft als een doorbraak in kwaliteit en algemeenheid voor gebarentaalvertaling. Het werd getraind op meer dan 100.000 uur aan gebarentaalgegevens, waarvan ongeveer een kwart in ASL. Het trainen van het model over meerdere talen, dialecten en vaardigheidsniveaus produceerde een model dat single-language-systemen in het bedrijf overtrof, volgens de aankondiging.

Hoe het Model Ziet en Vertaalt

Het systeem verwerkt geen ruwe video van de gebarentaler. Een model op het apparaat, MediaPipe Holistic, volgt 130 sleutelpunten op het gezicht, lichaam en handen kader voor kader, en alleen die geometrische coördinaten verlaten het apparaat voor vertaling. De oorspronkelijke camerafeed wordt onmiddellijk verwijderd, een ontwerp dat Google beschrijft als een waarborg voor de privacy.

Vanuit die coördinatenstroom genereert SL2T direct Engelse tekst, zonder tussenliggende annotatielaag, die bekend staat als glosses, waarop de meeste eerdere gebarentaalvertalingssystemen vertrouwden. Glosses wijzen vaste labels toe aan individuele gebaren, wat de woordenschat beperkt en de niet-manuele markers en ruimtelijke constructies verliest die grammaticale betekenis dragen in gebarentalen. Het verwijderen van die bottleneck laat de vertaalingskwaliteit schalen met trainingsgegevens in plaats van met een handmatig opgebouwd labelset.

Gebarentalen zijn onafhankelijke natuurlijke talen met hun eigen grammatica, niet getekende versies van gesproken Engels. Dat maakt de taak machinevertaling tussen twee talen, plus een moeilijk computerprobleem: het model moet de gelijktijdige beweging van handen, armen, torso, hoofd en gezicht volgen bij hoge kadersnelheden. Eerdere pogingen tot gebarentaaltechnologie, zoals sensorgloves, konden geen van beide vereisten aan.

Benchmarkresultaten en Resterende Foutpatronen

Op de FLEURS-ASL-benchmark, die ASL-naar-Engelse vertaling van complexe, abstracte taal meet, opgenomen in studio-omstandigheden door gecertificeerde dove tolken, scoort SL2T 70 BLEURT zero-shot, ver boven eerder gerapporteerde resultaten, volgens Google. Het bedrijf rapporteert ook 74 BLEURT op een eenhandige variant van de benchmark en 85 BLEURT op PRESTO-ASL, een dataset van assistent-stijlfrases die naar een aangesloten tablet worden getekend. Op FSboard, een vingerspellingdataset verzameld van dove gebarentalers op mobiele apparaten, bereikt het model 64 procent exacte overeenkomst. Dit zijn door de leverancier gerapporteerde cijfers; geen onafhankelijke evaluatie is gepubliceerd.

Google publiceert naast elkaar voorbeelden van FLEURS-ASL, waarbij vloeiende uitvoer naast identificeerbare foutmodi wordt getoond. Het model vervangt soms zeldzame gebaren en snelle vingerspelling, laat passieve constructies en classifier-weergaven vallen en verliest spanning wanneer de context ontbreekt. Een voorbeeld vertaalt “Deze volledig gevederde, warmbloedige roofvogel” als “Dit wezen is warmbloedig, eet grijs”, een vingerspellingfout die “grijs” vervangt door “roofvogel”.

Het model toont ook resterend hallucinatiegedrag, waarbij tekst wordt gegenereerd wanneer niemand gebaart, zoals wanneer een tweede persoon het kader binnenkomt of de gebarentaler pauzeert. Google zegt dat de releaseversie deze fouten aanzienlijk heeft verminderd in vergelijking met de pre-release-builds die dove evaluatoren in juli 2026 hebben getest, maar heeft ze niet geëlimineerd.

Waar Google Zegt dat het Hulpmiddel niet Moet Worden Gebruikt

De release bevat een ongebruikelijke laag van governance. Google DeepMind heeft een adviesorgaan opgericht, de AI Gebarentaal Adviescommissie, waarin dove organisaties zijn vertegenwoordigd, waaronder de Nationale Vereniging van de Doven, de Wereldfederatie van de Doven, het Dove Professionele Kunstennetwerk en het Nationale Technische Instituut voor de Doven van het Rochester Institute of Technology. De commissie heeft een gezamenlijk impactrapport opgesteld dat uiteenzet waar de technologie voor is en waar het ophoudt.

Het rapport definieert SL2T 1.0 als een hulpmiddel voor het opstellen van assistentie in informele, lage-stakesituaties: messaging, zoekopdrachten, navigatie, notities en informele een-op-een-gesprekken. Het sluit expliciet medische consulten, juridische procedures, politie-interacties, klasinstructie, sollicitatiegesprekken en overheidsvoordelenbepalingen uit. Het rapport vermeldt ook dat het hulpmiddel niet voldoet aan de wettelijke verplichtingen voor redelijke accommodaties op grond van de Americans with Disabilities Act of vergelijkbare kaders en dat het niet door instellingen mag worden gebruikt om in de plaats te komen van gecertificeerde menselijke tolken.

De gebarentaler blijft gedurende het hele proces betrokken. Beide apps tonen een voorbeeld van de tekst die de gebruiker kan controleren en bewerken voordat hij deze verstuurt, en in Live Transcribe heeft de dove gebruiker de controle over wanneer de vertaalde tekst aan een gesprekspartner wordt getoond. Het rapport merkt op dat deze waarborg ervan uitgaat dat de gebruiker functionele Engelse geletterdheid heeft om fouten te detecteren.

Hoe SL2T Presteert in de Eigen Limieten van het Model

Het impactrapport catalogiseert de technische grenzen van het model in detail. De nauwkeurigheid neemt af in lage lichtomstandigheden, harde tegenlichten of wanneer kleding de contrast tegen de handen en het gezicht vermindert. De pose-tracker volgt alleen het grootste onderwerp in het kader en kan geen meerdere gebarentalers aan. De prestaties nemen af bij extreme camerahoeken of wanneer de gebarentaler op zijn zij ligt. De invoerclips zijn beperkt tot 60 seconden en elke clip wordt onafhankelijk vertaald, zonder geheugen van eerdere gespreksronden. Het model is niet getraind of geëvalueerd op gebarentalers onder de 18. Het ondersteunt geen aangepaste woordenlijsten, geen naamgebaren en geen dialectvoorkeuren.

Nabije updates die al op de roadmap staan, zijn dictatie van leestekens, nieuwe regels, emoji’s en basisbewerkingen, evenals gespreksgeheugen over opeenvolgende clips in Live Transcribe. Langere termijn onderzoeksdoelen zijn onder meer betere gevoeligheid voor niet-manuele markers zoals gezichtsuitdrukkingen en wenkbrauwpositie, ondersteuning voor meerdere gebarentalers en uitgebreide gegevensverzameling over regionale ASL-dialecten en Black ASL.

Het project is ontstaan met Sam Sepah, een dove Googler, en dove perspectieven zijn opgenomen in gegevensverzameling, gebruikersstudies en evaluatie. Google beschrijft de lancering van SL2T als het begin van een langere inspanning: extra gebarentalen, gebarentaalgeneratie en bredere frontier-capaciteiten zijn allemaal actief werk. De functie wordt geleverd op Pixel 11 zonder extra kosten, met meer apparaten die volgen.

Google beschrijft de lancering van SL2T als het begin van een langere inspanning: extra gebarentalen, gebarentaalgeneratie en bredere frontier-capaciteiten zijn allemaal actief werk. De functie wordt geleverd op Pixel 11 zonder extra kosten, met meer apparaten die volgen, into data collection, user studies, and evaluation. Google beschrijft SL2T’s lancering als het begin van een langere inspanning: additional sign languages, sign language generation, and broader frontier capabilities are all listed as active work. The feature ships on Pixel 11 at no additional cost, with more devices to follow.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.