Yapay zeka modelleri ve platformları
EchoSpeech: Silent-Speech Recognition Teknolojisiyle İletişimi Devrimleştirme

Cornell Üniversitesi’ndeki araştırmacılar, EchoSpeech adlı bir sessiz-speech tanıma arayüzü geliştirdiler. Bu arayüz, akustik algılama ve yapay zeka kullanarak, dudak ve ağız hareketlerine dayalı olarak 31’e kadar seslendirilmemiş komutu sürekli olarak tanıyabilir. Bu düşük güç, giyilebilir arayüz bir akıllı telefonda çalıştırılabilir ve komut tanıma için yalnızca birkaç dakika kullanıcı eğitim verisi gerektirir.
Bilgi bilimlerinin doktora öğrencisi Ruidong Zhang, “EchoSpeech: Minimally-obtrusive Eyewear Powered by Acoustic Sensing ile Sürekli Sessiz Konuşma Tanıma” adlı makalenin baş yazarıdır. Bu makale, bu ay Hamburg, Almanya’da gerçekleştirilecek İnsan Bilgisayar Etkileşimi Konferansı’nda (CHI) sunulacak.
“Ses çıkaramayan insanlar için bu sessiz konuşma teknolojisi, bir ses sentezleyici için mükemmel bir girdi olabilir. Hastalara seslerini geri verebilir” dedi Zhang, teknolojinin potansiyel uygulamalarını vurgulayarak.
Gerçek Dünya Uygulamaları ve Gizlilik Avantajları
EchoSpeech, şu anda, gürültülü restoranlar veya sessiz kütüphaneler gibi sesli konuşmanın uygun veya uygun olmadığı ortamlarda akıllı telefon aracılığıyla başkalarıyla iletişim kurmak için kullanılabilir. Sessiz konuşma arayüzü, ayrıca bir stylus ile eşleştirilebilir ve tasarım yazılımları gibi CAD ile birlikte kullanılabilir, bu da klavye ve fare ihtiyacını önemli ölçüde azaltır.
EchoSpeech gözlükleri, kurşun kalem silgisinden daha küçük mikrofonlar ve hoparlörlerle donatılmıştır ve bir giyilebilir AI güçlendirilmiş sonar sistemi olarak çalışır, yüz boyunca ses dalgaları gönderir ve alır ve ağız hareketlerini tespit eder. Derin öğrenme algoritması daha sonra bu yankı profillerini gerçek zamanlı olarak yaklaşık %95 doğrulukla analiz eder.
“Vücutta sonarı taşıyoruz” dedi Cheng Zhang, bilgi bilimlerinin yardımcı profesörü ve Cornell’in Gelecek Etkileşimler için Akıllı Bilgisayar Arayüzleri (SciFi) Laboratuvarı müdürü.
Mevcut sessiz konuşma tanıma teknolojisi genellikle sınırlı bir dizi önceden belirlenmiş komutlara dayanır ve kullanıcının bir kamera karşısında oturması veya bir kamera takması gerekir. Cheng Zhang, bunun ne pratik ne de uygulanabilir olduğunu ve aynı zamanda hem kullanıcı hem de başkaları için önemli gizlilik endişeleri doğurduğunu açıkladı.
EchoSpeech’in akustik algılama teknolojisi, giyilebilir video kameralarına olan ihtiyacı ortadan kaldırır. Ayrıca, ses verilerinin görüntü veya video verilerine göre daha küçük olması nedeniyle, işlenmek için daha az bant genişliği gerektirir ve François Guimbretière’nin belirttiğine göre, gerçek zamanlı olarak bir akıllı telefona Bluetooth aracılığıyla iletilebilir.
“Ve çünkü veriler bulut yerine akıllı telefonda yerel olarak işlenmektedir” dedi, “gizlilik duyarlı bilgileri asla kontrolünüzden çıkmaz.”












