AI-mallit ja alustat
Google DeepMind tuo viittomiskielen käännöksen puhelimiin SL2T:n avulla

Google DeepMind on julkaissut viittomiskielen käännösmaalimman, SL2T:n, kahdessa kuluttajaluokan Android-tuotteessa, ja se on ensimmäinen kerta, kun viittomiskielen AI on saavuttanut laivan puhelinominaisuuden. Malli mahdollistaa viittomisesta tekstiin dictationin Gboardissa ja Live Transcribessa Pixel 11 -puhelimissa, ja se käynnistyy amerikkalaisen viittomiskielen käännöksellä englanniksi 12. elokuuta 2026.
Ominaisuus toimii kaikkialla, missä käyttäjä normaalisti kirjoittaa. Kuuro viittomisvoi diktaattaa verkkohakuja, luonnoksia tai asiakirjoja tai kysyä Geminiä viittomalla puhelimen kameraan kirjoittamisen sijaan. Live Transcribessa viittomisvoi vastata viittomalla keskustelussa kirjoittamisen sijaan. Google sanoo, että testaajat löysivät viittomisen nopeamman ja luonnollisemman kuin kirjoittaminen englanniksi.
SL2T on ensimmäinen malli, jonka Google kuvailee läpimurtona laadussa ja yleisyydessä viittomiskielen käännöksessä. Se on koulutettu yli 100 000 tunnin viittomisaineistolla, joka kattaa yli 50 viittomiskieltä, ja noin neljännes aineistosta on amerikkalaisessa viittomiskielessä. Koulutus yhdessä useiden kielten, murreten ja taitotason kanssa tuotti mallin, joka ylittää yksikieliset järjestelmät yrityksen kokeissa, kuten julkaisussa mainitaan.
Mikä malli näkee ja miten se kääntää
Järjestelmä ei prosessoi raakaa videota viittomisesta. Laitekohtainen malli, MediaPipe Holistic, seuraa 130 avainkohtaa kasvoilla, keholla ja käsillä kehys kehyksestä, ja vain nämä geometriset koordinaatit jättävät laitteen käännökseen. Alkuperäinen kameravirran hylätään välittömästi, ja Google kuvaa tämän suunnittelun yksityisyyden turvallisena.
Tästä koordinaatista SL2T generoi suoraan englanninkielisen tekstin, ohittaen välikäsisen annotaatiokerroksen, jota useimmat aiemmat viittomiskielen käännösjärjestelmät ovat riippuvaisia. Glossat määrittävät kiinteät merkinnät yksittäisille merkeille, mikä rajoittaa sanastoa ja menettää ei-manuaaliset merkit ja spatiaaliset rakenteet, jotka kantavat kieliopillista merkitystä viittomiskielissä. Tämän pullonkaulan poistaminen mahdollistaa käännöksen laadun skaalautumisen koulutusaineiston mukaan eikä käsin rakennetun merkintäjoukon mukaan.
Viittomiskielet ovat itsenäisiä luonnollisia kieliä, joilla on omat kieliopit, eivätkä ne ole vain kirjoitettuja englannin kieliä. Tämä tekee tehtävästä konekäännöksen kahden kielen välillä, ja samalla se on vaikea tietokoneen näköongelma: mallin on seurattava samanaikaisesti käsiä, käsiä, vartaloa, päätä ja kasvoja korkeilla kehysnopeuksilla. Aikaisemmat viittomiskielen teknologian yritykset, kuten anturinähdit, eivät voineet koskea kumpaakaan vaatimusta.
Vertailutulokset ja jääneet virhekuviot
FLEURS-ASL-benchmarkissa, joka mitää amerikkalaisen viittomiskielen käännöstä englanniksi monimutkaisista, abstrakteista kielistä, jotka on tallennettu studio-olosuhteissa sertifioitujen kuurojen tulkkien toimesta, SL2T saa 70 BLEURT zero-shot, selvästi korkeamman kuin aiemmin raportoidut tulokset, kuten Google kertoo. Yritys raportoi myös 74 BLEURT yhden käden viittomisvariantissa ja 85 BLEURT PRESTO-ASL: ssä, joka on aineisto apufraseja, jotka on allekirjoitettu kiinni olevaan tauluun. FSboardilla, sormien kirjoittamisaineistossa, joka on kerätty kuuroilta allekirjoittajilta mobiililaitteilla, malli saavuttaa 64 prosentin täsmätarkkuuden. Nämä ovat toimittajan ilmoittamia lukuja; riippumaton arviointi ei ole julkaistu.
Google julkaisi rinnakkaisia esimerkkejä FLEURS-ASL: stä, jotka osoittavat sujuvan tulosteen rinnalla tunnistettavissa olevat virhetilat. Malli korvaa toisinaan harvinaisia merkkejä ja nopeaa sormien kirjoittamista, pudottaa passiivisia rakenteita ja luokittelijakuvia ja menettää jännityksen, kun konteksti puuttuu. Yksi esimerkki kääntää “Tämä täysin siipipukuisen, lämminverisen petolinnun” “Tämä olento on lämminverinen, syö harmaata”, sormien kirjoittamisvirhe, joka korvaa “prey” “harmaalla”.
Malli näyttää myös jäännöshallusinaatiokäyttäytymistä, luoden tekstin, kun kukaan ei viittomis, kuten kun toinen henkilö astuu kehykseen tai viittomisvoi pysähtyy. Google sanoo, että julkaisuversio vähensi näitä virheitä verrattuna ennen julkaisemiseen testattuihin rakennuksiin, joita kuurot arvioitsijat testasivat heinäkuussa 2026, mutta ei ole poistanut niitä.
Mistä Google sanoo, että työkalua ei saa käyttää
Julkaisu sisältää epätavallisen hallinnon kerroksen. Google DeepMind kutsui neuvonantajan, AI Sign Language Advisory Committee, johon kuuluvat kuurojen järjestöt, kuten National Association of the Deaf, World Federation of the Deaf, Deaf Professional Arts Network ja Rochester Institute of Technologyn National Technical Institute for the Deaf. Komitea laati yhteisen vaikutusraportin, joka määrittää, mitä teknologiaa on tarkoitettu ja missä se loppuu.
Raportti määrittää SL2T 1.0: n avustavaksi luonnosgeneraattoriksi matalan riskin, epävirallisten asioiden: viestintä, hakeminen, navigointi, muistiinpanot ja epäviralliset yksityiskeskustelut. Se kieltää nimenomaisesti lääketieteelliset konsultoinnit, oikeudelliset menettelyt, poliisiin välikappaleet, luokkaopetus, työhaastattelut ja hallituksen etuja määritykset. Se myös toteaa, että työkalu ei täytä kohtuullisten mukautusten velvoitteita Americans with Disabilities Actin tai vastaavien kehysten mukaan, ja että sitä ei saa käyttää laitoksissa korvaamaan sertifioituja ihmisten tulkkia.
Viittomisvoi pysyy silmukassa koko ajan. Molemmat sovellukset näyttävät tekstien esikatselun, jonka käyttäjä voi tarkastella ja muokata ennen lähettämistä, ja Live Transcribessa kuuro käyttäjä hallitsee, milloin käännetyt tekstit näytetään keskustelukumppanille. Raportti toteaa, että tämä suojaus olettaa toimivan englannin kielen lukutaitoa virheiden havaitsemiseksi.
Miten SL2T suoriutuu mallin omassa rajoissa
Vaikutusraportti katalogisoi mallin tekniset rajat yksityiskohtaisesti. Tarkkuus heikkenee heikossa valaistuksessa, karhussa taustavalossa tai kun vaatetus vähentää kontrastia käsillä ja kasvoilla. Asennusseuranta seuraa vain suurinta aiheuttaa kehyksessä eikä voi käsitellä useita viittomisvoita. Suorituskyky laskee äärimmäisissä kamerakulmissa tai kun viittomisvoi makaa sivuttain. Syöteklipit on rajoitettu 60 sekuntiin, ja kunkin klipin käännös on riippumaton, eikä siinä ole muistia aiemmista keskustelusta. Malli ei ollut koulutettu tai arvioitu alle 18-vuotiaiden viittomisvoille. Se ei tue mukautettuja sanalistaa, nimiä tai murteita.
Lähiaikojen päivitykset ovat jo tiekartaan, mukaan lukien pisteiden, uusien rivien, emojisien ja perusmuokkausohjeiden diktaatio, sekä keskustelumuuisti peräkkäisissä klipissä Live Transcribessa. Pitkän aikavälin tutkimuskohteita ovat parempi herkkyyttä ei-manuaalisiin merkkeihin, kuten kasvojen ilmeisiin ja kulmien asentoon, useiden viittomisvoitten tuki ja laajempi aineiston kerääminen alueellisten amerikkalaisen viittomiskielen murteiden ja mustan viittomiskielen yli.
Projekti alkoi Sam Sepahilta, kuurosta googlailijasta, ja kuurojen näkökulmat olivat sisäänrakennettu aineiston keräämiseen, käyttäjätutkimuksiin ja arviointiin. Google kuvailee SL2T: n julkaisun pidemmän pyrkimyksen aloittamisena: lisää viittomiskieliä, viittomiskielen generointi ja laajemmat eturintamahyökkäyskyvyt ovat kaikki aktiivisia töitä. Ominaisuus toimitetaan Pixel 11: lle ilman lisäkustannuksia, ja muita laitteita seuraa.
Google kuvailee SL2T: n julkaisun pidemmän pyrkimyksen aloittamisena: lisää viittomiskieliä, viittomiskielen generointi ja laajemmat eturintamahyökkäyskykyjen kehittäminen ovat kaikki aktiivisia töitä. Ominaisuus toimitetaan Pixel 11: lle ilman lisäkustannuksia, ja muita laitteita seuraa. Tätä seuraa tieteen, käyttäjätutkimusten ja arvioinnin kehittäminen.












