Anderson’un Açısı

Görünmez Bir Mobil Klavye ile 157% Daha Hızlı Yazma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Güney Koreli araştırmacılar, makine öğrenimi tekniklerini kullanarak, ekranın görünür bir klavye olmadan da kullanıcıların 157,5% daha hızlı yazmasına olanak tanıyan bir “görünmez” klavye geliştirdiler.

Kullanıcıların yeni yönteme – basitçe Görünmez Mobil Klavye (IMK) olarak adlandırılan yönteme – tepkisi çok olumlu oldu ve test kullanıcıları, klavyeyi kullanırken fiziksel, zihinsel ve zaman açısından düşük seviyelerde talep bildirdiler. Verimlilik açısından IMK, en recent alternatif girdi yöntemlerini hafifçe geride bırakarak, 51,6 kelime/dakika vanguard puanına ulaştı.

Görünmez Klavye

Giriş üretmeye başlamak için kullanıcılar, ekranın üzerine bir klavye varmış gibi yazmaya başlayabilirler (her ne kadar görünür bir klavye olmasa da). Hiçbir şey içeriğin görünümünü engellemez ve yazılan kelimeler, yazma işleminin başladığı herhangi bir metin kutusunda görünür ve ayrıca kullanıcı tarafından doğruluğu kontrol edilebilecek ince bir metin akışı olarak da görünür.

Sistem, girdi tanıdığı anda kendiliğinden kalibre edilir. Bu nedenle kullanıcı, mobil cihazını manzara veya portre modunda kullanabilir ve metin yazmak için ekranın tüm kullanılabilir alanını kullanabilir.

Makalenin sonunda bulunan (ve aşağıdaki resimdeki) videosunda yazarlar, eylemin nasıl çalıştığını gösterirler, ancak gerçek bir klavye görünmez (sadece video için illüstratif amaçlarla kullanılır):

Bu, veri toplama aşamasındaki IMK örneğidir, ancak son kullanım aşamasında da aynı şekilde çalışır. Görünen klavye, yalnızca video için illüstratif amaçlarla kullanılır ve kullanıcıya veri toplama veya arayüzün nihai kullanımı sırasında görünmez.

Bu, veri toplama aşamasındaki IMK örneğidir, ancak son kullanım aşamasında da aynı şekilde çalışır. Görünen klavye, yalnızca video için illüstratif amaçlarla kullanılır ve kullanıcıya veri toplama veya arayüzün nihai kullanımı sırasında görünmez.

Yazma Koordinat Sistemi Olarak

Araştırma, Kore İleri Bilim ve Teknoloji Enstitüsü’nden (KAIST) geliyor ve klavyedeki bir sonraki tuşun nereye konumlandırılacağını “çizme” yeteneğimizi kullanıyor. Bir klavyeyi gizleyip bir kullanıcının parmağının doğru karakteri bulmasını beklemek karşılaştırmalı olarak mantıksız görünse de, aslında ortalama bir yazıcı bile doğru karakteri bulmak için doğal bir eğilim gösterir.

Aslında IMK, klavyeyi bir plot matrisi olarak ele alır ve yazarlar, sistemin Self-Attention Neural Character Decoder (SA-NCD) için eğitim verisi olarak kullanmak üzere geniş bir kullanıcı girişi veritabanı derledi.

SA-NCD, bir “tuş düşüşü”nün konumunu not alır ve hangi tuşun istenildiği olasılığını hesaplar. Kelimeler karakter girişleri aracılığıyla oluşurken, SA-NCD karakterleri anlık olarak derleyip temizleyerek canlı olarak yorumlayabilir.

SA-NCD'nin ağ mimarisi, Q/K/V sorgu, anahtar ve self-attention değerlerini gösterir. Kaynak: https://arxiv.org/pdf/2108.09030.pdf

SA-NCD’nin ağ mimarisi, Q/K/V sorgu, anahtar ve self-attention değerlerini gösterir. Kaynak: https://arxiv.org/pdf/2108.09030.pdf

SA-NCD, bir cümle girişinin tamamlanmasını beklemez, çünkü cümle girişinin ne zaman sona ereceğini bilmez ve bir kelime veya kelimeler cümleye eklendikçe, daha önceki yorumları yeni girişin ışığında yeniden ziyaret edebilir ve yeniden yazabilir.

Veritabanı

Eğitim sürecini beslemek için araştırmacılar, yaklaşık iki milyon dokunma noktası ve metin çiftini test katılımcılarından topladı. Katılımcılar, dokunma özellikli mobil cihazlardan erişilebilen basit bir web tabanlı arayüze sahipti.

Veri kümesi, kullanıcının adının baş harflerini, cihazının ekran boyutunu, yaşını, kullanılan mobil cihaz türünü (örneğin tablet, akıllı telefon vb.) ve her kayıtlı tuş düşüşünün x ve y koordinat değerlerini içerir.

Kullanıcılar arasında tuş düşüşlerinin ortalama konumları, aynı renkli noktalar aynı kullanıcıların tuş düşüşlerini gösterir. Aynı kullanıcı verilerini tanımlamak, veritabanını optimize etmeye ve aşırı uyumu önlemek için bireysel kullanıcıların ortalama tuş düşüşü gruplarını birbirleriyle karşılaştırmaya yardımcı olur.

Kullanıcılar arasında tuş düşüşlerinin ortalama konumları, aynı renkli noktalar aynı kullanıcıların tuş düşüşlerini gösterir. Aynı kullanıcı verilerini tanımlamak, veritabanını optimize etmeye ve aşırı uyumu önlemek için bireysel kullanıcıların ortalama tuş düşüşü gruplarını birbirleriyle karşılaştırmaya yardımcı olur.

Eğitim, kullanıcılar arasındaki ortalama piksel mesafesi arasındaki önemli varyasyonları hesaba katmak zorundaydı. Bazı kullanıcılar, belki de çok dar yazılımlı klavyelere alışık olanlar, yalnızca 50 piksel z ekseninde ortalama bir mesafe tuttururken, diğerleri 300 piksel ortalama tutturdu.

Bu farklılıklar kritiktir, çünkü Y ekseninde bir hata, tuş düşüşünü yanlış satıra yerleştirecek, örneğin ‘I’ veya ‘M’ yerine istenen ‘K’ vuruşunu değiştirecektir.

Mimari ve Eğitim

SA-NCD, iki decoder modülünden oluşur: bir geometrik decoder, görünmez klavyede bir tuş vuruşunun nereye düşmesi amaçlandığını hesaplar; ve bir semantic decoder, girdi metninin canlı yorumunu gerçekleştirir.

Geometrik decoder, Bidirectional GRU (BiGRU) kullanır, GRU bir Recurrent Neural Network (RNN) olarak benimsenir ve ileri ve geri geçişler, cümlenin sürekli değişen yorumuna olanak tanır.

Семantik bileşen, Transformer mimarisi kullanır, girdi, “güvenilirlik maskesi” süreci aracılığıyla ortalama kullanım ile yeni específik tuş düşüşünü karşılaştıran bir işlem sonrasında yorumlanır. Semantic decoder, One Billion Word Benchmark karşı bir masked karakter dil modeli olarak eğitildi, bu 2014 yılında Google, Cambridge Üniversitesi ve Edinburgh Üniversitesi arasında bir işbirliği idi.

Sonuçlar

Testlerde, kullanıcılar IMK ile üçüncü taraf yazılımlı klavyelere kıyasla 157,5% daha hızlı yazabildiler. Ayrıca, IMK son yılların jest tabanlı, dokunmatik tabanlı ve on parmaklı metin girişi yöntemleri gibi rakip yeni yöntemlerin sonuçlarını geride bıraktı. Makale, kullanıcıların sistemle yüksek düzeyde memnun olduğunu bildirdi.

IMK hakkında daha fazla bilgi edinmek için lütfen aşağıdaki videoyu izleyin.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai