AI-mallit ja alustat
EchoSpeech: vallankumous tekemässä hiljaisen puheen tunnistamisen teknologian avulla

Tutkijat Cornellin yliopistossa ovat kehittäneet EchoSpeechin, hiljaisen puheen tunnistamisliittymän, joka käyttää akustista anturia ja tekoälyä jatkuvasti tunnistamaan jopa 31 äänettöntä käskyä huulien ja suun liikkeiden perusteella. Tämä matalatehoinen, kannettava liittymä voidaan käyttää älypuhelimen kanssa ja vaatii vain muutaman minuutin käyttäjän koulutusdataa käskyjen tunnistamiseen.
Ruidong Zhang, tietojenkäsittelytieteen tohtorikoulutettava, on ensisijainen tekijä artikkelissa “EchoSpeech: Jatkuva hiljainen puheentunnistus vähäisiin häiriöihin perustuvilla silmälaseilla, joissa on akustinen anturi“, joka esitetään tänä kuuna Association for Computing Machineryn konferenssissa ihmisen ja tietokoneen vuorovaikutuksesta (CHI) Hampurissa, Saksassa.
“Niille, jotka eivät voi ääntää ääntä, tämä hiljainen puheen teknologia voisi olla erinomainen syöte äänisyntesaattorille. Se voisi antaa potilaille heidän äänensä takaisin”, Zhang sanoi korostamalla teknologian potentiaalisia sovelluksia edelleen kehittämisen myötä.
Reaalielämän sovellukset ja yksityisyyden edut
Sen nykyisessä muodossa EchoSpeech voidaan käyttää viestintään älypuhelimen kanssa ympäristöissä, joissa puhuminen on epämukavaa tai sopimatonta, kuten meluisissa ravintoloissa tai hiljaisissa kirjastoissa. Hiljainen puheen liittymä voidaan myös yhdistää stylus-kynän kanssa ja käyttää suunnittelusoftwaren kanssa, kuten CAD, jolloin näppäimistön ja hiiren tarve vähenee merkittävästi.
Varustettuna mikrofoneilla ja kaiuttimilla, jotka ovat pienempiä kuin lyijykynän terä, EchoSpeech-lasit toimivat kannettavana tekoälyvoimaisena sonarijärjestelmänä, lähettäen ja vastaanottavan ääni-aaltoja kasvojen yli ja havaitsemalla suun liikkeet. Syväoppimisalgoritmi analysoi nämä echo-profiileja reaaliajassa noin 95 prosentin tarkkuudella.
“Me siirtämme sonarin kehoon”, sanoi Cheng Zhang, tietojenkäsittelytieteen apulaisprofessori ja Cornellin Smart Computer Interfaces for Future Interactions (SciFi) -laboratorion johtaja.
Olemassa oleva hiljainen puheen tunnistusteknologia perustuu yleensä rajoitettuun joukkoon ennalta määriteltyjä käskyjä ja edellyttää, että käyttäjä kohdistaa tai käyttää kameraa. Cheng Zhang selitti, että tämä ei ole käytännöllistä eikä toteutettavissa ja aiheuttaa myös merkittäviä yksityisyyden ongelmia sekä käyttäjälle että niille, joille he viestivät.
EchoSpeechin akustinen anturiteknologia poistaa tarpeen kannettaville videokameroille. Lisäksi, koska äänen data on pienempi kuin kuvan tai videon data, se vaatii vähemmän kaistanleveyttä prosessointiin ja voidaan lähettää älypuhelimeen Bluetoothin kautta reaaliajassa, François Guimbretièren, tietojenkäsittelytieteen professorin mukaan.
“Ja koska data prosessoidaan paikallisesti älypuhelimen kanssa eikä ladata pilveen”, hän sanoi, “yksityisyyden kannalta arkaluontoista tietoa ei koskaan jätetä ulottuvillesi.”












