Modele și platforme AI
EchoSpeech: Revoluționarea Comunicației cu Tehnologia de Recunoaștere a Vorbirii Silențioase

Cercetătorii de la Universitatea Cornell au dezvoltat EchoSpeech, o interfață de recunoaștere a vorbirii silențioase care utilizează senzori acustici și inteligență artificială pentru a recunoaște continuu până la 31 de comenzi nevocalizate pe baza mișcărilor buzelor și gurii. Această interfață purtabilă cu putere redusă poate fi operată pe un smartphone și necesită doar câteva minute de date de antrenament ale utilizatorului pentru recunoașterea comenzilor.
Ruidong Zhang, student doctorand în știința informației, este autorul principal al “EchoSpeech: Recunoașterea Continuă a Vorbirii Silențioase pe Accesoriu Minim Invaziv cu Putere Acustică“, care va fi prezentat la Conferința Asociației pentru Calcul și Mașini pentru Sisteme de Calcul (CHI) din acest lună la Hamburg, Germania.
“Pentru persoanele care nu pot vocaliza sunete, această tehnologie de vorbire silențioasă ar putea fi un excelent intrare pentru un sintetizator de voce. Ar putea să le redea vocile”, a spus Zhang, subliniind potențialele aplicații ale tehnologiei cu dezvoltarea ulterioară.
Aplicații Practice și Avantaje de Confidențialitate
În forma sa actuală, EchoSpeech poate fi utilizat pentru comunicarea cu alții prin smartphone în medii în care vorbirea este inconvenabilă sau inadecvată, cum ar fi restaurante zgomotoase sau biblioteci liniștite. Interfața de vorbire silențioasă poate fi, de asemenea, asociată cu un stylus și utilizată cu software de proiectare, cum ar fi CAD, reducând semnificativ nevoia de tastatură și mouse.
Dotate cu microfoane și difuzoare mai mici decât radiera unui creion, ochelarii EchoSpeech funcționează ca un sistem sonar purtabil cu putere acustică, trimițând și primind undele sonore pe față și detectând mișcările buzelor. Un algoritm de învățare profundă analizează apoi aceste profiluri de ecou în timp real cu o precizie de aproximativ 95%.
“Ne mutăm sonarul pe corp”, a spus Cheng Zhang, asistent profesor de știința informației și director al Laboratorului de Interfețe Computaționale Inteligente pentru Interacțiuni Viitoare (SciFi) de la Cornell.
Tehnologia de recunoaștere a vorbirii silențioase existentă se bazează de obicei pe un set limitat de comenzi predefinite și necesită ca utilizatorul să se confrunte sau să poarte o cameră. Cheng Zhang a explicat că acest lucru nu este nici practic, nici fezabil și ridică, de asemenea, semnificative preocupări de confidențialitate atât pentru utilizator, cât și pentru cei cu care interacționează.
Tehnologia de detectare acustică a EchoSpeech elimină nevoia de camere video purtabile. Mai mult, deoarece datele audio sunt mai mici decât datele de imagine sau video, necesită o lățime de bandă mai mică pentru procesare și pot fi transmise la un smartphone prin Bluetooth în timp real, conform lui François Guimbretière, profesor de știința informației.
“Și pentru că datele sunt procesate local pe smartphone-ul dvs., în loc de a fi încărcate în cloud”, a spus el, “informațiile confidențiale nu părăsesc niciodată controlul dvs.”












