AI-modeller og plattformer
EchoSpeech: Revolusjonerer kommunikasjon med stille-tale gjenkjennelsesteknologi

Forskere ved Cornell University har utviklet EchoSpeech, et stille-tale gjenkjennelsesgrensesnitt som bruker akustisk sansning og kunstig intelligens for å kontinuerlig gjenkjenne opptil 31 uutsagt kommandoer basert på lepp- og munnbevegelser. Dette lavkraft, bærbare grensesnitt kan opereres på en smartphone og krever bare noen minutters brukeropplæringsdata for kommandogjenkjenning.
Ruidong Zhang, en doktorgradsstudent i informasjonsvitenskap, er hovedforfatter av “EchoSpeech: Kontinuerlig stille talegjenkjenning på minimalt obstruktivt øyeutstyr drevet av akustisk sansning“, som skal presenteres på Association for Computing Machinery-konferansen om menneskelige faktorer i datavitenskap (CHI) denne måneden i Hamburg, Tyskland.
“For mennesker som ikke kan uttale lyd, kan denne stille-taleteknologien være et utmerket innputt for en talesyntesator. Det kan gi pasientene deres stemmer tilbake,” sa Zhang, og fremhet teknologiens potensielle anvendelser med videre utvikling.
Reelle verden anvendelser og personvernsfordeler
I sin nåværende form kan EchoSpeech brukes til å kommunisere med andre via smartphone i miljøer hvor tale er upassende eller uønsket, som støyende restauranter eller stille biblioteker. Det stille talegrensesnittet kan også kombineres med en stylus og brukes med designprogramvare som CAD, noe som betydelig reduserer behovet for et tastatur og en mus.
Utstyrt med mikrofoner og høyttalere mindre enn blyanter, fungerer EchoSpeech-brillene som et bærbart AI-drevet sonarsystem, som sender og mottar lydbølger over ansiktet og detekterer munnbevegelser. En dyptlæring salgoritme analyserer deretter disse ekko-profilene i sanntid med omtrent 95% nøyaktighet.
“Vi flytter sonar til kroppen,” sa Cheng Zhang, assistentprofessor i informasjonsvitenskap og direktør for Cornell’s Smart Computer Interfaces for Future Interactions (SciFi) Lab.
Eksisterende stille-tale gjenkjennelsesteknologi avhenger vanligvis av en begrenset mengde forhåndsdefinerte kommandoer og krever at brukeren må se eller bære en kamera. Cheng Zhang forklarte at dette ikke er praktisk eller gjennomførbart og også raiser betydelige personvernsproblemer for både brukeren og de de interagerer med.
EchoSpeechs akustisk sansningsteknologi eliminerer behovet for bærbare videokameraer. Dessuten, siden lyddata er mindre enn bilde- eller videodata, krever det mindre båndbredde til å prosessere og kan overføres til en smartphone via Bluetooth i sanntid, ifølge François Guimbretière, professor i informasjonsvitenskap.
“Og fordi dataene prosesseres lokalt på din smartphone i stedet for å lastes opp til skyen,” sa han, “forblir personlig informasjon alltid under din kontroll.”












