Погляд Anderson

Штучний інтелект, який дозволяє друкувати 157% швидше на невидимій клавіатурі для мобільних пристроїв

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Південної Кореї використали техніки машинного навчання, щоб розробити “невидиму” клавіатуру для мобільних пристроїв з обмеженим простором, яка дозволяє користувачам друкувати 157,5% швидше, навіть якщо на екрані не видно клавіатури.

Користувачі відгукнулися про новий метод – званий просто Невидима Мобільна Клавіатура (IMK) – дуже позитивно, повідомляючи про низький рівень фізичних, психічних і тимчасових вимог під час використання клавіатури. За ефективністю IMK трохи перевершує найновішу альтернативну методу введення даних, досягнувши результату 51,6 слова на хвилину.

Призрачна Клавіатура

Щоб почати генерувати введення, користувачі можуть просто почати друкувати на екрані, як якщо б клавіатура була видима (хоча її немає). Нічого не з’являється, щоб завадити перегляду вмісту, і введені слова будуть відображатися в будь-якому текстовому полі, де відбувається введення, і опційно як тонкий потік тексту, який користувач може перевірити на точність.

Система самокалібрується з моменту розпізнавання введення. Тому користувач може тримати мобільний пристрій у ландшафтному або портретному режимі та використовувати весь доступний простір екрана для введення тексту.

У супровідному відео (див. кінець статті та зображення нижче) автори статті демонструють, як працює дія, хоча вони уточнюють, що жодна клавіатура не з’являється під час введення (вона є тільки для ілюстрації у відео):

Це приклад IMK на етапі збору даних, хоча він працює ідентично у кінцевому використанні. Клавіатура, яка з'являється, тільки для ілюстрації та не з'являється користувачеві під час процесу збору даних або у кінцевому використанні інтерфейсу. Джерело: https://www.youtube.com/watch?v=PuhiVGOfIR0

Це приклад IMK на етапі збору даних, хоча він працює ідентично у кінцевому використанні. Клавіатура, яка з’являється, тільки для ілюстрації та не з’являється користувачеві під час процесу збору даних або у кінцевому використанні інтерфейсу. Джерело: https://www.youtube.com/watch?v=PuhiVGOfIR0

Друкування як Координатна Система

Дослідження походять з Корейського інституту передових технологій (KAIST) та використовують нашу природну здатність “прокладати” місце наступної клавіші на клавіатурі. Хоча це може здаватися контрінтуїтивним – ховати клавіатуру та очікувати, що палець користувача знайде наступну бажану клавішу, насправді навіть середній друкар інстинктивно рухається до правильного символу.

Ефективно IMK обробляє клавіатуру як матрицю координат, та автори скомпільовані велику базу даних введення користувачів, щоб надати дані для навчання системи Self-Attention Neural Character Decoder (SA-NCD).

SA-NCD буде відзначати позицію “падіння клавіші” та розрахувати ймовірність того, яку клавішу було бажано натиснути. Як слова будуються через натискання клавіш, SA-NCD може скомпілювати та розбити символи на їхні складові слова, очищаючи введення в режимі реального часу.

Архітектура мережі SA-NCD, де Q/K/V позначають запит, ключ та значення самоуваги. Джерело: https://arxiv.org/pdf/2108.09030.pdf

Архітектура мережі SA-NCD, де Q/K/V позначають запит, ключ та значення самоуваги. Джерело: https://arxiv.org/pdf/2108.09030.pdf

SA-NCD не чекає завершення можливого речення, оскільки не знає, коли введення речення закінчиться, та як слово чи слова додаються до фрази, воно може повернутися та переписати попередні інтерпретації речення у світлі останнього введення.

База Даних

Щоб забезпечити процес навчання, дослідники зібрали близько двох мільйонів пар дотиків та тексту від тестових суб’єктів, які використовували простий веб-інтерфейс, доступний з сенсорних мобільних пристроїв.

База даних містить ініціали імені користувача, розмір екрана його пристрою, вік, тип мобільного пристрою (наприклад, планшет, смартфон тощо) та координати x та y кожного зареєстрованого падіння клавіші.

Середні позиції падінь клавіш серед користувачів, з крапками однакового кольору, що позначають падіння клавіш від тих самих користувачів. Визначення даних одного користувача допомагає оптимізувати базу даних та уникнути переобучення шляхом порівняння середніх груп падінь клавіш від окремих користувачів, а не навчання натискань однієї людини проти інших.

Середні позиції падінь клавіш серед користувачів, з крапками однакового кольору, що позначають падіння клавіш від тих самих користувачів. Визначення даних одного користувача допомагає оптимізувати базу даних та уникнути переобучення шляхом порівняння середніх груп падінь клавіш від окремих користувачів, а не навчання натискань однієї людини проти інших.

Навчання мало враховувати помітні відмінності у середній відстані між ударами серед користувачів. Деякі користувачі, можливо, ті, хто звик до дуже тісних програмних клавіатур, підтримували середню відстань між клавішами лише 50 пікселів на осі z, тоді як інші мали середню відстань 300 пікселів.

Ці відмінності критичні, оскільки у випадку осі Y помилка поставить падіння клавіші на неправильний рядок, замінивши, наприклад, “I” або “M” на бажане натискання клавіші “K”.

Архітектура та Навчання

SA-NCD складається з двох модулів декодера: геометричного декодера, який розраховуємо, де на невидимій клавіатурі було бажано натиснути клавішу; та семантичного декодера, який обробляє інтерпретацію введеного тексту в режимі реального часу.

Геометричний декодер використовує двонаправлений GRU (BiGRU), з GRU, прийнятим як рекурентна нейронна мережа (RNN), з прямими та зворотними проходами, що забезпечують постійно змінювану інтерпретацію речення.

Семантичний компонент використовує архітектуру Transformer, яка інтерпретує введення після проходження через процес “конфіденційного маскування”, призначений для порівняння середнього використання з новим конкретним падінням клавіші. Семантичний декодер був навчений як маскована мова модель проти One Billion Word Benchmark, співробітництва 2014 року між Google, Кембриджським університетом та Університетом Единбурга.

Результати

У тестах користувачі могли друкувати 157,5% швидше за допомогою IMK, ніж за допомогою сторонніх програмних клавіатур на своїх смартфонах. Крім того, було виявлено, що IMK перевершує результати, отримані за допомогою нових методів введення даних, таких як жести, дотик та метод введення тексту десятьма пальцями останніх років. У статті повідомляється, що користувачі показали високий рівень задоволення системою.

Перегляньте відео авторів нижче, щоб дізнатися більше про IMK.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai