KI-Modelle und Plattformen

EchoSpeech: Revolutionierung der Kommunikation mit Silent-Speech-Recognition-Technologie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Forscher an der Cornell University haben EchoSpeech entwickelt, eine Silent-Speech-Recognition-Schnittstelle, die akustische Sensoren und künstliche Intelligenz nutzt, um kontinuierlich bis zu 31 unartikulierte Befehle basierend auf Lippen- und Mundbewegungen zu erkennen. Diese low-power-Tragbare Schnittstelle kann auf einem Smartphone betrieben werden und benötigt nur wenige Minuten Benutzerschulungsdaten für die Befehlserkennung.

Ruidong Zhang, ein Doktorand der Informationswissenschaft, ist der Hauptautor von “EchoSpeech: Kontinuierliche Silent-Speech-Recognition auf minimally-invasiver Eyewear mit akustischer Sensierung“, das auf der Association for Computing Machinery-Konferenz über Human Factors in Computing Systems (CHI) diesen Monat in Hamburg, Deutschland, präsentiert wird.

“Für Menschen, die keinen Laut von sich geben können, könnte diese Silent-Speech-Technologie eine hervorragende Eingabe für einen Sprachsynthesizer sein. Sie könnte Patienten ihre Stimmen zurückgeben”, sagte Zhang und hob die potenziellen Anwendungen der Technologie bei weiterer Entwicklung hervor.

Praktische Anwendungen und Datenschutzvorteile

In seiner aktuellen Form könnte EchoSpeech für die Kommunikation mit anderen über ein Smartphone in Umgebungen verwendet werden, in denen Sprechen unpraktisch oder unangebracht ist, wie z.B. in lauten Restaurants oder stillen Bibliotheken. Die Silent-Speech-Schnittstelle kann auch mit einem Stylus kombiniert und mit Design-Software wie CAD verwendet werden, wodurch der Bedarf an einer Tastatur und einer Maus erheblich reduziert wird.

Die EchoSpeech-Brille ist mit Mikrofonen und Lautsprechern ausgestattet, die kleiner sind als Bleistifte, und funktioniert als tragbares AI-gestütztes Sonarsystem, das Schallwellen über das Gesicht sendet und empfängt und Mundbewegungen erkennt. Ein Deep-Learning-Algorithmus analysiert diese Echo-Profile in Echtzeit mit einer Genauigkeit von etwa 95%.

“Wir bringen Sonar auf den Körper”, sagte Cheng Zhang, Assistant Professor für Informationswissenschaft und Leiter des Cornell Smart Computer Interfaces for Future Interactions (SciFi) Lab.

Bestehende Silent-Speech-Recognition-Technologien verlassen sich in der Regel auf einen begrenzten Satz vordefinierter Befehle und erfordern, dass der Benutzer eine Kamera trägt oder vor einer Kamera sitzt. Cheng Zhang erklärte, dass dies weder praktisch noch machbar sei und auch erhebliche Datenschutzbedenken für den Benutzer und die Personen, mit denen er interagiert, aufwerfe.

Die akustische Sensierungstechnologie von EchoSpeech eliminiert die Notwendigkeit von tragbaren Videokameras. Darüber hinaus erfordert Audio-Daten weniger Bandbreite zur Verarbeitung und kann in Echtzeit über Bluetooth an ein Smartphone übertragen werden, laut François Guimbretière, Professor für Informationswissenschaft.

“Und weil die Daten lokal auf Ihrem Smartphone verarbeitet werden, anstatt in die Cloud hochgeladen zu werden”, sagte er, “verlassen datenschutzsensitive Informationen niemals Ihre Kontrolle.”

Alex McFarland ist ein KI-Journalist und Schriftsteller, der die neuesten Entwicklungen im Bereich der künstlichen Intelligenz erforscht. Er hat mit zahlreichen KI-Startups und Veröffentlichungen weltweit zusammengearbeitet.