AI-modellen en platforms

EchoSpeech: Revolutionaire Communicatie met Silent-Speech Recognition Technologie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers aan de Cornell University hebben EchoSpeech ontwikkeld, een silent-speech recognition interface die akoestische sensoren en kunstmatige intelligentie gebruikt om continu tot 31 onuitgesproken commando’s te herkennen op basis van lip- en mondgebaren. Deze draagbare interface met lage stroomverbruik kan op een smartphone worden bediend en vereist slechts enkele minuten gebruikersgegevens voor commandoherkenning.

Ruidong Zhang, een doctoraalstudent in de informatie wetenschap, is de hoofdauteur van “EchoSpeech: Continue Silent Speech Recognition op Minimale Eyewear met Acoustic Sensing,” dat deze maand op de Association for Computing Machinery Conference on Human Factors in Computing Systems (CHI) in Hamburg, Duitsland, wordt gepresenteerd.

“Voor mensen die geen geluid kunnen uitspreken, kan deze silent speech technologie een uitstekende invoer zijn voor een spraaksynthesizer. Het kan patiënten hun stem teruggeven,” zei Zhang, waarbij hij de potentiële toepassingen van de technologie benadrukte met verdere ontwikkeling.

Praktische Toepassingen en Privacyvoordelen

In zijn huidige vorm kan EchoSpeech worden gebruikt voor communicatie met anderen via smartphone in omgevingen waar spraak onhandig of ongepast is, zoals lawaaierige restaurants of stille bibliotheken. De silent speech interface kan ook worden gekoppeld aan een stylus en gebruikt worden met ontwerpprogramma’s zoals CAD, waardoor het gebruik van een toetsenbord en muis aanzienlijk wordt verminderd.

De EchoSpeech-bril is uitgerust met microfoons en luidsprekers die kleiner zijn dan potloden, en fungeert als een draagbaar AI-gebaseerd sonarsysteem dat geluidsgolven over het gezicht verstuurt en mondgebaren detecteert. Een diepe leer algoritme analyseert deze echo-profielen in real-time met een nauwkeurigheid van ongeveer 95%.

“We brengen sonar naar het lichaam,” zei Cheng Zhang, assistent-professor in de informatie wetenschap en directeur van het Smart Computer Interfaces for Future Interactions (SciFi) Lab van Cornell.

Bestaande silent-speech recognition technologie is meestal afhankelijk van een beperkte set vooraf bepaalde commando’s en vereist dat de gebruiker naar of draagt een camera. Cheng Zhang legde uit dat dit niet praktisch of haalbaar is en ook aanzienlijke privacyproblemen oplevert voor zowel de gebruiker als degenen met wie hij communiceert.

De akoestische sensortechnologie van EchoSpeech elimineert de noodzaak voor draagbare videocamera’s. Bovendien, aangezien audiogegevens kleiner zijn dan beeld- of videogegevens, vereist het minder bandbreedte om te verwerken en kan het via Bluetooth in real-time naar een smartphone worden verzonden, volgens François Guimbretière, professor in de informatie wetenschap.

“En omdat de gegevens lokaal op uw smartphone worden verwerkt in plaats van naar de cloud te worden geüpload,” zei hij, “blijft privacygevoelige informatie altijd onder uw controle.”

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.