Andersons vinkel

En AI-driven osynlig mobil tangentbord som låter dig skriva 157% snabbare

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från Sydkorea har använt maskinlärningstekniker för att utveckla ett “osynligt” tangentbord för mobilenheter med begränsat utrymme, som låter användare skriva 157,5% snabbare, trots att inget tangentbord syns på skärmen.

Användarresponsen till den nya metoden – som kallas enkelt Invisible Mobile Keyboard (IMK) – rapporteras vara mycket positiv, med testanvändare som rapporterar låga nivåer av fysisk, mental och tidsmässig belastning medan de använder tangentbordet. När det gäller effektivitet överträffar IMK lätt den senaste alternativa inmatningsmetoden, med en vanguard-poäng på 51,6 ord per minut.

Det osynliga tangentbordet

För att börja generera inmatning kan användare enkelt börja skriva på skärmen, som om ett tangentbord var synligt (även om inget är). Ingenting poppar upp för att blockera vyerna av innehållet, och de skrivna orden kommer att visas i valfri textruta där skrivandet startar, och eventuellt som en tunn ström av text som användaren kan kontrollera för korrekthet.

Systemet kalibrerar sig själv från och med att det känner igen inmatning. Därför kan användaren ha den mobila enheten i landskaps- eller porträttläge och använda hela den tillgängliga skärmytan för att skriva ut sin text.

I en tillhörande video (se slutet av artikeln, och bild direkt nedan) illustrerar författarna till artikeln hur åtgärden fungerar, även om de förtydligar att inget verkligt tangentbord visas under inmatning (det visas bara för illustrativa ändamål i videon):

Detta är ett exempel på IMK under datainsamlingsstadiet, men det fungerar identiskt i slutanvändning. Tangentbordet som visas är bara för illustrativa ändamål och visas inte för användaren under datainsamlingen eller i slutanvändning av gränssnittet. Källa: https://www.youtube.com/watch?v=PuhiVGOfIR0

Detta är ett exempel på IMK under datainsamlingsstadiet, men det fungerar identiskt i slutanvändning. Tangentbordet som visas är bara för illustrativa ändamål och visas inte för användaren under datainsamlingen eller i slutanvändning av gränssnittet. Källa: https://www.youtube.com/watch?v=PuhiVGOfIR0

Skrivning som ett koordinatsystem

Forskningen kommer från Korea Advanced Institute of Science and Technology (KAIST) och utnyttjar vår naturliga förmåga att “plotta” var nästa tangent är på ett tangentbord. Även om det kan verka kontraintuitivt att dölja tangentbordet och förvänta sig att en användares finger hittar nästa önskad tangent, hittar i själva verket även en genomsnittlig skrivare instinktivt rätt tecken.

Effektivt behandlar IMK tangentbordet som en plotmatris, och författarna har sammanställt en omfattande databas med användarindata för att förse systemets Self-Attention Neural Character Decoder (SA-NCD) med data för att träna mot.

SA-NCD kommer att notera positionen för en “tangentnedfall” och beräkna sannolikheten för vilken tangent som avsågs. När ord byggs upp genom tangentnedfall kan SA-NCD sammanställa och bryta ner tecknen i deras beståndsdelar till avsedda ord, rensa inmatningen i realtid.

Nätverksarkitekturen för SA-NCD, där Q/K/V står för fråga, tangent och värde för självuppmärksamhet. Källa: https://arxiv.org/pdf/2108.09030.pdf

Nätverksarkitekturen för SA-NCD, där Q/K/V står för fråga, tangent och värde för självuppmärksamhet. Källa: https://arxiv.org/pdf/2108.09030.pdf

SA-NCD väntar inte på att en möjlig mening är komplett, eftersom den inte vet när meningsinmatningen kommer att sluta, och när ett ord eller flera ord läggs till i frasen, kan den återbesöka och om skriva tidigare tolkningar av meningen i ljuset av den senaste inmatningen.

Database

För att driva träningsprocessen samlade forskarna in cirka två miljoner par av beröringspunkter och text från testpersoner, som använde en enkel webbaserad gränssnitt som nås från beröringsbara mobila enheter.

Databasen innehåller användarens initialer, skärmstorleken på deras enhet, deras ålder, typen av mobil enhet som används (t.ex. surfplatta, smartphone osv.), och x- och y-koordinatvärdena för varje registrerad tangentnedfall.

Genomsnittliga positioner för tangentnedfall bland användare, med prickar av samma färg som betecknar tangentnedfall från samma användare. Att identifiera samma användardata hjälper till att optimera databasen och undvika överanpassning genom att jämföra genomsnittliga tangentnedfallssamlingar från enskilda användare, snarare än att träna en användares tangentnedfall mot varandra.

Genomsnittliga positioner för tangentnedfall bland användare, med prickar av samma färg som betecknar tangentnedfall från samma användare. Att identifiera samma användardata hjälper till att optimera databasen och undvika överanpassning genom att jämföra genomsnittliga tangentnedfallssamlingar från enskilda användare, snarare än att träna en användares tangentnedfall mot varandra.

Träningen måste ta hänsyn till de betydande variationerna i genomsnittlig pixelavstånd mellan streck bland användare. Vissa användare, kanske de som är vana vid mycket trånga programtangentbord, upprätthöll ett genomsnittligt avstånd mellan tangenter på endast 50 pixlar på z-axeln, medan andra genomsnittligt 300 pixlar.

Dessa skillnader är avgörande, eftersom i fallet med y-axeln, ett fel skulle placera tangentnedfallet på fel rad, och ersätta till exempel en “I” eller en “M” med den avsedda “K”-strecket.

Arkitektur och utbildning

SA-NCD består av två dekodermoduler: en geometrisk dekoder, som beräknar var på det osynliga tangentbordet en tangentnedfall är avsedd att falla; och en semantisk dekoder, som hanterar live-tolkning av inmatad text.

Den geometriska dekodern använder Bidirectional GRU (BiGRU), med GRU antagen som ett Recurrent Neural Network (RNN), med framåt- och bakåtriktade passager som underlättar en ständigt föränderlig tolkning av meningen.

Den semantiska komponenten använder en Transformer-arkitektur, som tolkar inmatad text efter att den har passerat genom en “förtroendemaskerings”-process som är utformad för att jämföra genomsnittligt användande mot den nya specifika tangentnedfallet. Den semantiska dekodern tränades som en maskerad teckenspråksmodell mot One Billion Word Benchmark, ett samarbete mellan Google, Cambridge University och University of Edinburgh från 2014.

Resultat

I tester kunde användare skriva 157,5% snabbare med IMK än med tredjepartsprogramtangentbord på sina egna smartphones. Dessutom visade det sig att IMK överträffade resultaten från rivaliserande nya metoder, såsom gestbaserade, beröringsbaserade och tiofingers textinmatningsmetoder från de senaste åren. Artikeln rapporterar att användare visade hög tillfredsställelse med systemet.

Se författarnas video nedan för att lära dig mer om IMK.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai