Modely a platformy AI
EchoSpeech: Revoluce v komunikaci s technologií rozpoznávání němého projevu

Výzkumníci z Cornellovy univerzity vyvinuli EchoSpeech, rozhraní pro rozpoznávání němého projevu, které využívá akustického snímání a umělé inteligence k nepřetržitému rozpoznávání až 31 nevyslovených příkazů na základě pohybů rtů a úst. Tento nízkoenergetický, nositelný interface lze ovládat na smartphone a vyžaduje pouze několik minut tréninkových dat uživatele pro rozpoznání příkazů.
Ruidong Zhang, doktorand informačních věd, je hlavním autorem článku “EchoSpeech: Kontinuální rozpoznávání němého projevu na minimálně nápadném oblečení s akustickým snímáním“, který bude prezentován na konferenci Association for Computing Machinery Conference on Human Factors in Computing Systems (CHI) tento měsíc v Hamburku, Německo.
“Pro lidi, kteří nemohou artikulovat zvuky, může tato technologie němého projevu být vynikajícím vstupem pro syntetizátor hlasu. Může pacientům vrátit jejich hlasy,” řekl Zhang, zdůrazňující potenciální aplikace této technologie s dalšími vývojovými možnostmi.
Reálné aplikace a výhody ochrany osobních údajů
V jeho současné podobě může být EchoSpeech použit pro komunikaci s ostatními prostřednictvím smartphone v prostředích, kde je řeč nevhodná nebo nepříjemná, jako jsou hlučné restaurace nebo tiché knihovny. Rozhraní němého projevu lze také spárovat se stylusem a využít s designovým softwarem, jako je CAD, což významně snižuje potřebu klávesnice a myši.
EchoSpeech brýle jsou vybaveny mikrofony a reproduktory menšími než tužka, fungují jako nositelný systém umělé inteligence, který vysílá a přijímá zvukové vlny přes obličej a detekuje pohyby úst. Algoritmus hlubokého učení poté analyzuje tyto echo profily v reálném čase s aproximativní přesností 95%.
“Přesouváme sonar na tělo,” řekl Cheng Zhang, asistent profesora informačních věd a ředitel laboratoře Smart Computer Interfaces for Future Interactions (SciFi) na Cornellově univerzitě.
Stávající technologie rozpoznávání němého projevu obvykle spoléhá na omezenou sadu předem stanovených příkazů a vyžaduje, aby uživatel čelil nebo nosil kameru. Cheng Zhang vysvětlil, že to není praktické ani proveditelné a také vyvolává významné obavy o ochranu osobních údajů pro uživatele i ty, s nimiž komunikují.
Technologie akustického snímání EchoSpeech eliminuje potřebu nositelných videokamer. Kromě toho, protože audio data jsou menší než obrazová nebo video data, vyžadují méně šířky pásma pro zpracování a mohou být přenášena na smartphone prostřednictvím Bluetooth v reálném čase, podle François Guimbretière, profesora informačních věd.
“A protože data jsou zpracovávána místně na vašem smartphone, místo aby byla nahrána do cloudu,” řekl, “citlivá informace o ochraně osobních údajů nikdy neopouští vaši kontrolu.”












