AI-modeller og platforme

EchoSpeech: Revolutionerer kommunikation med stille-talegenkendelsesteknologi

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere ved Cornell University har udviklet EchoSpeech, en stille-talegenkendelsesgrænseflade, der anvender akustisk-sensing og kunstig intelligens til kontinuerligt at genkende op til 31 uudtalte kommandoer baseret på læbe- og mundbevægelser. Denne lavstrøms-, bærbare grænseflade kan betjenes på en smartphone og kræver kun få minutters brugerdatabehandling for kommandogenkendelse.

Ruidong Zhang, en ph.d.-studerende i informationsvidenskab, er hovedforfatteren til “EchoSpeech: Continuous Silent Speech Recognition on Minimally-obtrusive Eyewear Powered by Acoustic Sensing“, som vil blive præsenteret på Association for Computing Machinery Conference on Human Factors in Computing Systems (CHI) denne måned i Hamburg, Tyskland.

“Til mennesker, der ikke kan udtrykke sig med lyd, kan denne stille tale-teknologi være en fremragende indgang til en tale-synthesizer. Det kan give patienterne deres stemmer tilbage,” sagde Zhang, og fremhævede teknologiens potentiale med yderligere udvikling.

Virkelige anvendelser og privatlivsfordele

I sin nuværende form kan EchoSpeech anvendes til kommunikation med andre via smartphone i miljøer, hvor tale er uheldigt eller upassende, såsom støjende restauranter eller stille biblioteker. Den stille tale-grænseflade kan også kombineres med en stylus og anvendes med designsoftware som CAD, hvilket betydeligt reducerer behovet for et tastatur og en mus.

Udstyret med mikrofoner og højttalere mindre end blyanter, fungerer EchoSpeech-brillerne som et bærbart AI-drevet sonarsystem, der sender og modtager lydbølger over ansigtet og registrerer mundbevægelser. En dyb læringsalgoritme analyserer derefter disse ekko-profiler i realtid med en nøjagtighed på ca. 95%.

“Vi flytter sonar til kroppen,” sagde Cheng Zhang, adjunkt i informationsvidenskab og direktør for Cornells Smart Computer Interfaces for Future Interactions (SciFi) Lab.

Den eksisterende stille tale-genkendelsesteknologi afhænger typisk af en begrænset mængde forudbestemte kommandoer og kræver, at brugeren vender ansigtet mod eller bærer en kamera. Cheng Zhang forklarede, at dette hverken er praktisk eller gennemførligt og også rejser betydelige privatlivsproblemer for både brugeren og de personer, de interagerer med.

EchoSpeech’s akustisk-sensing-teknologi eliminerer behovet for bærbare videokameraer. Desuden kræver audio-data mindre båndbredde til behandling og kan overføres til en smartphone via Bluetooth i realtid, ifølge François Guimbretière, professor i informationsvidenskab.

“Og fordi dataene behandles lokalt på din smartphone i stedet for at blive uploaded til skyen,” sagde han, “forbliver privatlivssensitive oplysninger altid under din kontrol.”

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.