AI-modeller och plattformar
EchoSpeech: Revolutionerar kommunikation med tyst taligenkänningsteknologi

Forskare vid Cornell University har utvecklat EchoSpeech, ett gränssnitt för tyst taligenkänning som använder akustisk avkänning och artificiell intelligens för att kontinuerligt känna igen upp till 31 outtalade kommandon baserat på läpp- och munrörelser. Detta lågeffektsbärbara gränssnitt kan opereras på en smartphone och kräver endast några minuters användarträningsdata för kommandogenkänning.
Ruidong Zhang, en doktorand i informationsvetenskap, är huvudförfattare till “EchoSpeech: Kontinuerlig tyst taligenkänning på minimalt påträngande ögonlock driven av akustisk avkänning“, som kommer att presenteras på Association for Computing Machinery-konferensen om mänskliga faktorer i datavetenskap (CHI) den här månaden i Hamburg, Tyskland.
“För personer som inte kan uttala ljud kan denna tysta talteknologi vara en utmärkt ingång för en röstsyntax. Den kunde ge patienterna tillbaka deras röster”, sa Zhang och betonade teknologins potentiella tillämpningar med ytterligare utveckling.
Verkliga tillämpningar och integritetsfördelar
I dess nuvarande form kan EchoSpeech användas för kommunikation med andra via smartphone i miljöer där tal är olämpligt eller störande, som bullriga restauranger eller tysta bibliotek. Det tysta talgränssnittet kan också paras ihop med en stylus och användas med designprogram som CAD, vilket avsevärt minskar behovet av tangentbord och mus.
Utrustad med mikrofoner och högtalare som är mindre än blyertspennor fungerar EchoSpeech-glasögonen som ett bärbart AI-drivet sonarsystem, som sänder och tar emot ljudvågor över ansiktet och upptäcker munrörelser. Ett djupinlärningsalgoritm analyserar sedan dessa ekoprofiler i realtid med cirka 95 procents noggrannhet.
“Vi flyttar sonar till kroppen”, sa Cheng Zhang, biträdande professor i informationsvetenskap och chef för Cornells Smart Computer Interfaces for Future Interactions (SciFi) Lab.
Existerande tyst taligenkänningsteknologi förlitar sig vanligtvis på en begränsad uppsättning fördefinierade kommandon och kräver att användaren möter eller bär en kamera. Cheng Zhang förklarade att detta varken är praktiskt eller genomförbart och också väcker betydande integritetsproblem för både användaren och de de interagerar med.
EchoSpeechs akustiska avkänningsteknologi eliminerar behovet av bärbara videokameror. Dessutom, eftersom ljuddata är mindre än bild- eller videodata, kräver det mindre bandbredd för bearbetning och kan överföras till en smartphone via Bluetooth i realtid, enligt François Guimbretière, professor i informationsvetenskap.
“Och eftersom data bearbetas lokalt på din smartphone istället för att laddas upp till molnet”, sa han, “lämnar integritetskänslig information aldrig din kontroll.”












