Modely a platformy AI

EchoSpeech: Revoluce v komunikaci s technologií rozpoznávání němého projevu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Cornellovy univerzity vyvinuli EchoSpeech, rozhraní pro rozpoznávání němého projevu, které využívá akustického snímání a umělé inteligence k nepřetržitému rozpoznávání až 31 nevyslovených příkazů na základě pohybů rtů a úst. Tento nízkoenergetický, nositelný interface lze ovládat na smartphone a vyžaduje pouze několik minut tréninkových dat uživatele pro rozpoznání příkazů.

Ruidong Zhang, doktorand informačních věd, je hlavním autorem článku “EchoSpeech: Kontinuální rozpoznávání němého projevu na minimálně nápadném oblečení s akustickým snímáním“, který bude prezentován na konferenci Association for Computing Machinery Conference on Human Factors in Computing Systems (CHI) tento měsíc v Hamburku, Německo.

“Pro lidi, kteří nemohou artikulovat zvuky, může tato technologie němého projevu být vynikajícím vstupem pro syntetizátor hlasu. Může pacientům vrátit jejich hlasy,” řekl Zhang, zdůrazňující potenciální aplikace této technologie s dalšími vývojovými možnostmi.

Reálné aplikace a výhody ochrany osobních údajů

V jeho současné podobě může být EchoSpeech použit pro komunikaci s ostatními prostřednictvím smartphone v prostředích, kde je řeč nevhodná nebo nepříjemná, jako jsou hlučné restaurace nebo tiché knihovny. Rozhraní němého projevu lze také spárovat se stylusem a využít s designovým softwarem, jako je CAD, což významně snižuje potřebu klávesnice a myši.

EchoSpeech brýle jsou vybaveny mikrofony a reproduktory menšími než tužka, fungují jako nositelný systém umělé inteligence, který vysílá a přijímá zvukové vlny přes obličej a detekuje pohyby úst. Algoritmus hlubokého učení poté analyzuje tyto echo profily v reálném čase s aproximativní přesností 95%.

“Přesouváme sonar na tělo,” řekl Cheng Zhang, asistent profesora informačních věd a ředitel laboratoře Smart Computer Interfaces for Future Interactions (SciFi) na Cornellově univerzitě.

Stávající technologie rozpoznávání němého projevu obvykle spoléhá na omezenou sadu předem stanovených příkazů a vyžaduje, aby uživatel čelil nebo nosil kameru. Cheng Zhang vysvětlil, že to není praktické ani proveditelné a také vyvolává významné obavy o ochranu osobních údajů pro uživatele i ty, s nimiž komunikují.

Technologie akustického snímání EchoSpeech eliminuje potřebu nositelných videokamer. Kromě toho, protože audio data jsou menší než obrazová nebo video data, vyžadují méně šířky pásma pro zpracování a mohou být přenášena na smartphone prostřednictvím Bluetooth v reálném čase, podle François Guimbretière, profesora informačních věd.

“A protože data jsou zpracovávána místně na vašem smartphone, místo aby byla nahrána do cloudu,” řekl, “citlivá informace o ochraně osobních údajů nikdy neopouští vaši kontrolu.”

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.