Моделі та платформи ШІ
EchoSpeech: Революціонізування Комунікації з Допомогою Технології Розпізнавання Німої Речі

Дослідники з Корнелльського університету розробили EchoSpeech, інтерфейс розпізнавання німої мови, який використовує акустичне чуття та штучний інтелект для безперервного розпізнавання до 31 невокалізованих команд на основі рухів губ і рота. Цей низькопотужний, носимий інтерфейс можна експлуатувати на смартфоні та вимагає лише декілька хвилин даних тренування користувача для розпізнавання команд.
Ruidong Zhang, аспірант інформаційних наук, є головним автором статті “EchoSpeech: Континуюче Розпізнавання Німої Речі на Мінімально-інвазивному Очкові, Оснащеному Акустичним Чуттям“, яка буде представлена на Конференції з людських факторів у комп’ютерних системах (CHI) цього місяця в Гамбурзі, Німеччина.
“Для людей, які не можуть вокалізувати звук, ця технологія німої мови могла б бути відмінним входом для синтезатора голосу. Вона могла б повернути пацієнтам їхні голоси”, – сказав Zhang, підкреслюючи потенційні застосування цієї технології при подальшому розвитку.
Практичні Застосування та Переваги Конфіденційності
У своїй поточній формі EchoSpeech можна використовувати для спілкування з іншими через смартфон в середовищах, де розмова є незручною або неприйнятною, наприклад, у шумних ресторанах або тихих бібліотеках. Інтерфейс німої мови також можна поєднати зі стилусом та використовувати з програмним забезпеченням для дизайну, таким як CAD, значно зменшуючи потребу в клавіатурі та миші.
Оснащений мікрофонами та динаміками меншими за олівці, окуляри EchoSpeech функціонують як носимий штучний інтелект-сонар, надсилаючий та приймаючий звукові хвилі через обличчя та виявляючи рухи рота. Алгоритм глибокого навчання потім аналізує ці профілі ехо в режимі реального часу з приблизною точністю 95%.
“Ми переносимо сонар на тіло”, – сказав Cheng Zhang, асистент професора інформаційних наук та директор лабораторії Smart Computer Interfaces for Future Interactions (SciFi) Корнелльського університету.
Існуюча технологія розпізнавання німої мови зазвичай залежить від обмеженого набору попередньо визначених команд та вимагає, щоб користувач звернувся до або носив камеру. Cheng Zhang пояснив, що це ні практично, ні доцільно, а також викликає суттєві проблеми конфіденційності як для користувача, так і для тих, з ким він взаємодіє.
Технологія акустичного чуття EchoSpeech усуває потребу в носимих відеокамерах. Крім того, оскільки аудіодані менші за зображення чи відеодані, їм потрібно менше смуги пропускання для обробки та їх можна передавати на смартфон через Bluetooth в режимі реального часу, згідно з Франсуа Гімбрет’є, професором інформаційних наук.
“І оскільки дані обробляються локально на вашому смартфоні, а не завантажуються в хмару”, – сказав він, “інформація, що стосується конфіденційності, ніколи не залишає вашого контролю”.












