Modely a platformy AI

Google DeepMind přináší překlad znakového jazyka do telefonů se SL2T

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Google DeepMind spustil model znakového jazyka, SL2T, uvnitř dvou spotřebitelských produktů Android, poprvé kdy znakový jazyk AI dosáhl funkce telefonu. Model umožňuje přepis znakového jazyka do textu v Gboard a Live Transcribe na telefonech Pixel 11, které budou spuštěny s překladem amerického znakového jazyka do angličtiny od 12. srpna 2026.

Funkce funguje všude, kde uživatel normálně píše. Neslyšící člověk může diktovat webovou stránku, napsat zprávu nebo dokument, nebo se zeptat Gemini znakováním do kamery telefonu místo psaní. V Live Transcribe mohou uživatelé znakového jazyka reagovat v hovoru znakováním místo psaní. Google říká, že testovací uživatelé našli znakování v ASL rychlejší a přirozenější než psaní v angličtině.

SL2T je prvním modelem, který Google popisuje jako průlom v kvalitě a obecnosti pro překlad znakového jazyka. Byl vyškolen na více než 100 000 hodinách znakování, pokrývajících více než 50 znakových jazyků, s přibližně čtvrtinou dat v ASL. Společné školení napříč jazyky, dialekty a úrovněmi dovedností vyprodukovalo model, který překonává systémy jednoho jazyka v experimentech společnosti, podle ohlášení.

Co model vidí a jak překládá

Systém nezpracovává surový video znakování. Modelem na zařízení, MediaPipe Holistic, sleduje 130 klíčových bodů na obličeji, těle a rukou snímek po snímku, a pouze tyto geometrické souřadnice opouštějí zařízení pro překlad. Původní kamerový tok je okamžitě odstraněn, návrh, který Google popisuje jako bezpečnostní opatření.

Ze tohoto toku souřadnic generuje SL2T anglický text přímo, přeskočením mezilehlé anotační vrstvy známé jako glosses, na které se většina předchozích systémů překladu znakového jazyka spoléhala. Glosses přiřazují pevné štítky jednotlivým znakováním, což omezuje slovní zásobu a ztrácí ne-manuální značky a prostorové konstrukce, které nesou gramatický význam ve znakových jazycích. Odstranění této lávky umožňuje, aby kvalita překladu škálovala s trénovacími daty, spíše než s ručně vytvořenou sadou štítků.

Znаковacím jazykům jsou nezávislé přirozené jazyky se svými vlastními gramatikami, ne znakovými verzemi anglického jazyka. To činí úkol strojovým překladem mezi dvěma jazyky, plus tvrdým počítačovým problémem: model musí sledovat současný pohyb rukou, paží, trupu, hlavy a obličeje ve vysokých snímcích. Předchozí pokusy o technologii znakového jazyka, jako jsou senzorické rukavice, nemohly řešit ani jednu z těchto požadavků.

Výsledky benchmarku a zbývající chybové vzory

Na FLEURS-ASL benchmarku, který měří překlad ASL do angličtiny komplexního, abstraktního jazyka zaznamenaného ve studiových podmínkách certifikovanými tlumočníky pro neslyšící, SL2T dosahuje 70 BLEURT zero-shot, výrazně nad dříve uváděnými výsledky, podle Google. Společnost také uvádí 74 BLEURT na variantě benchmarku s jedním ručním znakováním a 85 BLEURT na PRESTO-ASL, datové sadě asistentských frází znakováním na dokovaném tabletu. Na FSboard, datové sadě znakování prstů shromážděné z neslyšících uživatelů na mobilních zařízeních, model dosahuje 64 procent přesné shody. Tyto jsou údaje hlášené dodavatelem; nebyla zveřejněna žádná nezávislá hodnocení.

Google zveřejnil vedle sebe příklady z FLEURS-ASL, které ukazují plynulý výstup spolu s identifikovatelnými chybovými vzory. Model občas nahrazuje vzácná znakování a rychlé znakování prstů, vynechává pasivní konstrukce a klasifikační znázornění a ztrácí čas, když je kontext chybí. Jeden příklad překládá “Tento plně opeřený, teplý krevní pták” jako “Tato bytost je teplá, jí šedou”, chyba znakování prstů, která nahrazuje “šedou” za “ptáka”.

Model také ukazuje zbytkové halucinační chování, generuje text, když nikdo neznačí, jako když druhá osoba vstoupí do rámečku nebo znakovatel přestane. Google říká, že verze vydání významně snížila tyto chyby ve srovnání s předchozími buildy, které testovali neslyšící uživatelé v červenci 2026, ale je nevyeliminovala.

Kde Google říká, že nástroj nesmí být použit

Vydání nese neobvyklou vrstvu řízení. Google DeepMind sestavil poradenský orgán, AI Sign Language Advisory Committee, který spojil neslyšící organizace, včetně National Association of the Deaf, World Federation of the Deaf, Deaf Professional Arts Network a Rochester Institute of Technology’s National Technical Institute for the Deaf. Výbor spolupracoval na společné zprávě o dopadu, která definuje, k čemu je technologie určena a kde končí.

Zpráva definuje SL2T 1.0 jako pomocný nástroj pro generování konceptů pro nízké úrovně, neformální prostředí: zprávy, vyhledávání, navigaci, poznámky a neformální konverzace jeden na jednoho. Explicitně vylučuje lékařské konzultace, právní řízení, policejní interakce, výuku ve třídě, pracovní pohovory a určení vládních výhod. Také uvádí, že nástroj nesplňuje právní povinnosti pro rozumná ubytování podle zákona o Američanech se zdravotním postižením nebo ekvivalentních rámců a že by neměl být použit institucemi jako náhrada za certifikované lidské tlumočníky.

Znаковatel zůstává v smyčce po celou dobu. Obě aplikace ukazují náhled textu, který uživatel může zkontrolovat a upravit před odesláním, a v Live Transcribe má neslyšící uživatel kontrolu nad tím, kdy je překládaný text zobrazen konverzačnímu partnerovi. Zpráva uvádí, že toto bezpečnostní opatření předpokládá funkční anglickou gramotnost pro zachycení chyb.

Jak SL2T funguje v rámci svých vlastních limitů

Zpráva o dopadu katalogizuje technické hranice modelu podrobně. Přesnost se zhoršuje ve slabém světle, tvrdém osvětlení nebo když oblečení snižuje kontrast proti rukám a obličeji. Sledovač postoje sleduje pouze největší předmět v rámečku a nemůže zpracovat více znakovatelů. Výkon klesá v extrémních úhlech kamery nebo když znakovatel leží na boku. Vstupní klipy jsou omezeny na 60 sekund a každý klip je překládaný nezávisle, bez paměti předchozích konverzačních tahů. Model nebyl vyškolen nebo vyhodnocen na znakovatelích mladších 18 let. Nepodporuje žádná vlastní slovníky, žádná jména znakování nebo preference dialektů.

Bližší aktualizace jsou již na cestě, včetně diktování interpunkce, nových řádků, emotikonů a základních příkazů pro editaci, plus konverzační paměť napříč sekvenčními klipy v Live Transcribe. Dlouhodobější cíle výzkumu zahrnují lepší citlivost na ne-manuální značky, jako jsou výrazy obličeje a poloha obočí, podporu více znakovatelů a rozšířenou sběr dat napříč regionálními dialekty ASL a Black ASL.

Projekt vznikl se Samem Sepahem, neslyšícím Googlerem, a perspektivy neslyšících byly zahrnuty do sběru dat, uživatelských studií a hodnocení. Google popisuje spuštění SL2T jako začátek delšího úsilí: další znakové jazyky, generace znakového jazyka a širší možnosti hranic jsou všechny uvedeny jako aktivní práce. Funkce je dodávána na telefonech Pixel 11 bez dalších nákladů, s dalšími zařízeními, která budou následovat.

Projekt vstoupil do fáze sběru dat, uživatelských studií a hodnocení. Google popisuje spuštění SL2T jako začátek delšího úsilí: další znakové jazyky, generace znakového jazyka a širší možnosti hranic jsou všechny uvedeny jako aktivní práce. Funkce je dodávána na telefonech Pixel 11 bez dalších nákladů, s dalšími zařízeními, která budou následovat do sběru dat, uživatelských studií a hodnocení.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.