Modele i platformy AI
EchoSpeech: Rewolucja w komunikacji dzięki technologii rozpoznawania mowy bezgłosowej

Naukowcy z Uniwersytetu Cornell opracowali EchoSpeech, interfejs rozpoznawania mowy bezgłosowej, który wykorzystuje czujniki akustyczne i sztuczną inteligencję do ciągłego rozpoznawania do 31 nieartykułowanych poleceń na podstawie ruchów warg i ust. Ten niskomocowy, noszony interfejs może być obsługiwany na smartfonie i wymaga tylko kilku minut danych szkoleniowych użytkownika do rozpoznawania poleceń.
Ruidong Zhang, doktorant nauk informatycznych, jest głównym autorem pracy “EchoSpeech: Continuous Silent Speech Recognition on Minimally-obtrusive Eyewear Powered by Acoustic Sensing“, która zostanie przedstawiona na Konferencji Association for Computing Machinery Conference on Human Factors in Computing Systems (CHI) w tym miesiącu w Hamburgu, w Niemczech.
“Dla osób, które nie mogą artykułować dźwięku, ta technologia rozpoznawania mowy bezgłosowej może być doskonałym wejściem dla syntezatora głosu. Mogłaby przywrócić pacjentom ich głos”, powiedział Zhang, podkreślając potencjalne zastosowania tej technologii po dalszym rozwoju.
Realne zastosowania i zalety prywatności
W obecnej formie EchoSpeech może być wykorzystywany do komunikacji z innymi za pomocą smartfona w środowiskach, w których mowa jest niewygodna lub nieodpowiednia, takich jak głośne restauracje lub ciche biblioteki. Interfejs mowy bezgłosowej może być również połączony z piórem i wykorzystywany z oprogramowaniem projektowym, takim jak CAD, znacznie redukując potrzebę klawiatury i myszy.
Wyposażone w mikrofony i głośniki mniejsze niż ołówki, okulary EchoSpeech działają jako noszony system sonarowy zasilany sztuczną inteligencją, wysyłający i odbierający fale dźwiękowe na twarzy i wykrywający ruchy ust. Głęboki algorytm uczenia rozpoznaje te profile echo w czasie rzeczywistym z dokładnością około 95%.
“Przenosimy sonar na ciało”, powiedział Cheng Zhang, asystent profesora nauk informatycznych i dyrektor laboratorium Smart Computer Interfaces for Future Interactions (SciFi) na Uniwersytecie Cornell.
Istniejąca technologia rozpoznawania mowy bezgłosowej zazwyczaj opiera się na ograniczonej liczbie predeterminowanych poleceń i wymaga, aby użytkownik stał lub nosił kamerę. Cheng Zhang wyjaśnił, że jest to niepraktyczne i niewykonalne, a także budzi znaczne obawy dotyczące prywatności zarówno dla użytkownika, jak i osób, z którymi wchodzi w interakcje.
Technologia czujników akustycznych EchoSpeech eliminuje potrzebę noszenia kamer wideo. Ponadto, ponieważ dane audio są mniejsze niż dane obrazu lub wideo, wymagają one mniejszej szerokości pasma do przetwarzania i mogą być przesyłane do smartfona za pomocą Bluetooth w czasie rzeczywistym, zgodnie z oświadczeniem François Guimbretière, profesora nauk informatycznych.
“A ponieważ dane są przetwarzane lokalnie na Twoim smartfonie, zamiast być przesyłane do chmury”, powiedział, “informacje wrażliwe na prywatność nigdy nie opuszczają Twojej kontroli.”












