Modèles et plateformes d’IA
EchoSpeech : Révolutionner la communication avec la technologie de reconnaissance de la parole silencieuse

Les chercheurs de l’Université Cornell ont développé EchoSpeech, une interface de reconnaissance de la parole silencieuse qui utilise la détection acoustique et l’intelligence artificielle pour reconnaître en continu jusqu’à 31 commandes non vocalisées en fonction des mouvements des lèvres et de la bouche. Cette interface portable à faible consommation d’énergie peut être exploitée sur un smartphone et nécessite seulement quelques minutes de données d’entraînement de l’utilisateur pour la reconnaissance des commandes.
Ruidong Zhang, un étudiant diplômé en sciences de l’information, est l’auteur principal de “EchoSpeech: Reconnaissance continue de la parole silencieuse sur des lunettes peu intrusives alimentées par la détection acoustique“, qui sera présenté à la Conférence de l’Association for Computing Machinery sur les facteurs humains dans les systèmes informatiques (CHI) ce mois-ci à Hambourg, en Allemagne.
“Pour les personnes qui ne peuvent pas vocaliser des sons, cette technologie de parole silencieuse pourrait être une excellente entrée pour un synthétiseur vocal. Elle pourrait rendre la voix aux patients”, a déclaré Zhang, soulignant les applications potentielles de la technologie avec un développement ultérieur.
Applications et avantages de confidentialité dans le monde réel
Dans sa forme actuelle, EchoSpeech pourrait être utilisé pour communiquer avec d’autres personnes via un smartphone dans des environnements où la parole est inconveniente ou inappropriée, tels que des restaurants bruyants ou des bibliothèques silencieuses. L’interface de parole silencieuse peut également être associée à un stylet et utilisée avec des logiciels de conception tels que CAD, réduisant considérablement le besoin d’un clavier et d’une souris.
Équipées de microphones et de haut-parleurs plus petits que des crayons, les lunettes EchoSpeech fonctionnent comme un système de sonar portable alimenté par l’intelligence artificielle, envoyant et recevant des ondes sonores à travers le visage et détectant les mouvements de la bouche. Un algorithme d’apprentissage profond analyse ensuite ces profils d’écho en temps réel avec une précision d’environ 95%.
“Nous déplaçons le sonar sur le corps”, a déclaré Cheng Zhang, professeur agrégé de sciences de l’information et directeur du laboratoire Smart Computer Interfaces for Future Interactions (SciFi) de Cornell.
La technologie de reconnaissance de la parole silencieuse existante repose généralement sur un ensemble limité de commandes prédéterminées et nécessite que l’utilisateur fasse face ou porte une caméra. Cheng Zhang a expliqué que cela n’est ni pratique ni réalisable et soulève également des préoccupations importantes en matière de confidentialité pour l’utilisateur et les personnes avec lesquelles il interagit.
La technologie de détection acoustique d’EchoSpeech élimine le besoin de caméras vidéo portables. De plus, puisque les données audio sont plus petites que les données d’image ou de vidéo, elles nécessitent moins de bande passante pour être traitées et peuvent être transmises à un smartphone via Bluetooth en temps réel, selon François Guimbretière, professeur de sciences de l’information.
“Et parce que les données sont traitées localement sur votre smartphone au lieu d’être téléchargées sur le cloud”, a-t-il déclaré, “les informations sensibles en matière de confidentialité ne quittent jamais votre contrôle.”












