Andersonův úhel

Umělé inteligence poháněná neviditelnou mobilní klávesnicí, která umožňuje psát 157% rychleji

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Jižní Koreje použili techniky strojového učení k vývoji „neviditelné“ klávesnice pro mobilní zařízení s omezeným prostorem, která umožňuje uživatelům psát 157,5 % rychleji, a to i přesto, že na obrazovce není klávesnice zobrazena.

Uživatelé reagovali na novou metodu – nazvanou jednoduše Invisible Mobile Keyboard (IMK) – velmi pozitivně, přičemž testovací uživatelé uváděli nízkou úroveň fyzické, mentální a časové zátěže při používání klávesnice. Z hlediska efektivity IMK lehce překonává nejnovější alternativní metodu vstupu, dosahující skóre 51,6 slov za minutu.

Fantomová klávesnice

Chcete-li začít generovat vstup, uživatelé mohou jednoduše začít psát na obrazovce, jako by tam byla klávesnice (i když tam žádná není). Nic se nezobrazí, aby zakrylo pohled na obsah, a zadané slovo se objeví v libovolném textovém poli, kde se psaní začalo, a případně jako tenký proud textu, který uživatel může zkontrolovat na přesnost.

Systém se sám kalibruje od okamžiku, kdy rozpozná vstup. Uživatel může mít mobilní zařízení v režimu na šířku nebo na výšku a použít celý dostupný prostor obrazovky pro psaní textu.

V doprovodném videu (viz konec článku a obrázek přímo níže) autoři článku ilustrují, jak akce funguje, ačkoli zdůrazňují, že během vstupu se žádná klávesnice nezobrazí (zobrazuje se pouze pro ilustrační účely ve videu):

Toto je příklad IMK ve fázi sběru dat, i když funguje identicky v konečné podobě. Klávesnice, která se zobrazuje, je pouze pro ilustrační účely a nezobrazuje se uživateli během sběru dat ani během finálního použití rozhraní. Source: https://www.youtube.com/watch?v=PuhiVGOfIR0

Toto je příklad IMK ve fázi sběru dat, i když funguje identicky v konečné podobě. Klávesnice, která se zobrazuje, je pouze pro ilustrační účely a nezobrazuje se uživateli během sběru dat ani během finálního použití rozhraní. Source: https://www.youtube.com/watch?v=PuhiVGOfIR0

Psaní jako souřadnicový systém

Výzkum pochází z Korejského institutu pro pokročilé studium (KAIST) a využívá naší přirozené schopnosti „zaměřit“ se na místo, kde je další klávesa na klávesnici. Ačkoli by se mohlo zdát, že skrýt klávesnici a očekávat, že uživatelův prst najde další požadovanou klávesu, je proti intuici, ve skutečnosti i průměrný pisatel instinktivně směřuje k správné znaku.

IMK efektivnícky zachází s klávesnicí jako s maticí souřadnic a autoři vytvořili rozsáhlou databázi uživatelských vstupů, aby poskytli data pro systém Self-Attention Neural Character Decoder (SA-NCD) pro trénink.

SA-NCD zaznamená pozici „pádu klávesy“ a vypočítá pravděpodobnost, která klávesa byla požadována. Jak se slova skládají z klávesových stisků, SA-NCD může složit a rozdělit znaky na jejich složené zamýšlené slova, čistí vstup v reálném čase.

Architektura sítě SA-NCD, kde Q/K/V stojí za dotaz, klíč a hodnotu sebe-pozornosti. Source: https://arxiv.org/pdf/2108.09030.pdf

Architektura sítě SA-NCD, kde Q/K/V stojí za dotaz, klíč a hodnotu sebe-pozornosti. Source: https://arxiv.org/pdf/2108.09030.pdf

SA-NCD nečeká na dokončení možné věty, protože nemá žádnou představu, kdy vstup věty skončí, a jakmile je přidán jeden nebo více slov do fráze, může znovu vyhodnotit a přepsat dřívější interpretace z věty ve světle nejnovějšího vstupu.

Databáze

Pro napájení procesu tréninku shromáždili výzkumníci kolem dvou milionů párů dotykových bodů a textu od testovacích subjektů, kteří používali jednoduché webové rozhraní přístupné z dotykových mobilních zařízení.

Databáze obsahuje iniciály jména uživatele, velikost obrazovky zařízení, věk, typ mobilního zařízení (tj. tablet, smartphone atd.) a x a y souřadnicové hodnoty každého registrovaného pádu klávesy.

Průměrné pozice pádů kláves mezi uživateli, se stejnými barvami, které označují pády kláves od stejných uživatelů. Identifikace stejného uživatelského data pomáhá optimalizovat databázi a避ovat přeučení tím, že srovnává průměrné skupiny pádů kláves od jednotlivých uživatelů, místo trénování klávesových stisků jednoho uživatele proti sobě.

Průměrné pozice pádů kláves mezi uživateli, se stejnými barvami, které označují pády kláves od stejných uživatelů. Identifikace stejného uživatelského data pomáhá optimalizovat databázi a避ovat přeučení tím, že srovnává průměrné skupiny pádů kláves od jednotlivých uživatelů, místo trénování klávesových stisků jednoho uživatele proti sobě.

Trénink musel zohlednit pozoruhodné rozdíly v průměrné vzdálenosti pixelů mezi tahy mezi uživateli. Někteří uživatelé, možná ti, kteří jsou zvyklí na velmi stísněné softwarové klávesnice, udržovali průměrnou vzdálenost mezi klávesami pouze 50 pixelů na ose z, zatímco jiní průměrně 300 pixelů.

Tyto rozdíly jsou kritické, protože v případě osy y by chyba umístila pád klávesy na špatný řádek, nahrazující, například, „I“ nebo „M“ místo zamýšleného tahů „K“.

Architektura a trénink

SA-NCD se skládá ze dvou dekodérů: geometrického dekodéru, který vypočítává, kde na neviditelné klávesnici byl zamýšlený klávesový stisk; a semantického dekodéru, který zpracovává živou interpretaci vstupního textu.

Geometrický dekodér používá Bidirectional GRU (BiGRU), s GRU přijatým jako Recurrent Neural Network (RNN), s předním a zadním průchodem, který usnadňuje neustále se měnící interpretaci věty.

Semantická složka používá architekturu Transformer, která interpretuje vstup po jeho průchodu „maskovací procesem“, který je navržen pro srovnání průměrného použití proti novému konkrétnímu pádu klávesy. Semantický dekodér byl trénován jako maskovaný jazykový model znaků proti One Billion Word Benchmark, spolupráci z roku 2014 mezi Google, Cambridgeskou univerzitou a Univerzitou v Edinburghu.

Výsledky

V testech byli uživatelé schopni psát 157,5 % rychleji pomocí IMK než pomocí softwarových klávesnic třetích stran na svých vlastních smartphonech. Kromě toho bylo zjištěno, že IMK překonal výsledky získané rivalními novými metodami, jako jsou gestová, dotyková a desetiprstová metoda vstupu textu z posledních let. Článek uvádí, že uživatelé projevili vysokou spokojenost se systémem.

Podívejte se na video autorů níže, abyste se dozvěděli více o IMK.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai