Modele și platforme AI

Cercetători Dezvoltă Model de Recunoaștere a Vorbirii Umane Cu Rețele Neuronale Adânci

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Un grup de cercetători din Germania explorează un nou model de recunoaștere a vorbirii umane bazat pe învățare automată și rețele neuronale adânci. Noul model ar putea ajuta la îmbunătățirea semnificativă a recunoașterii vorbirii umane.

Algoritmii de asistență auditivă sunt de obicei utilizați pentru a îmbunătăți recunoașterea vorbirii umane și sunt evaluați prin diverse experimente care determină raportul semnal-zgomot la care un anumit număr de cuvinte sunt recunoscute. Cu toate acestea, aceste experimente sunt adesea consumatoare de timp și costisitoare.

Noul model a fost detaliat în cercetarea publicată în The Journal of the Acoustical Society of America.

Prezentări pentru Ascultători cu Deficiențe de Auz

Jana Roßbach este una dintre autorii de la Universitatea Carl Von Ossietzky.

„Noutatea modelului nostru constă în faptul că oferă previziuni bune pentru ascultătorii cu deficiențe de auz pentru tipuri de zgomot cu complexitate foarte diferită și arată atât erori scăzute, cât și corelații ridicate cu datele măsurate”, a spus Roßbach.

Echipa de cercetători a calculat câte cuvinte pe propoziție ar putea înțelege un ascultător prin recunoaștere automată a vorbirii (ASR). Uneltele de recunoaștere a vorbirii, cum ar fi Alexa și Siri, se bazează pe această ASR, care este larg disponibilă.

Studiul și Rezultatele

Studiul efectuat de echipă a implicat opt persoane cu auz normal și 20 de persoane cu deficiențe de auz. Ascultătorii au fost expuși la multe zgomote complexe care ascundeau vorbirea, iar persoanele cu deficiențe de auz au fost împărțite în trei grupuri, în funcție de nivelul de pierdere a auzului legată de vârstă.

Prin noul model, cercetătorii au putut prevedea performanța recunoașterii vorbirii umane a ascultătorilor cu deficiențe de auz cu grade diferite de pierdere a auzului. Ei au putut face aceste previziuni pentru diverse masche de zgomot cu complexități diferite în modularea temporală și în funcție de similaritatea cu vorbirea reală. Toate acestea au permis ca fiecare persoană să fie observată și analizată individual în ceea ce privește posibila pierdere a auzului.

“Am fost cel mai mult surprinși că previziunile au funcționat bine pentru toate tipurile de zgomot. Ne așteptam ca modelul să aibă probleme atunci când se utilizează un singur vorbitor concurent. Cu toate acestea, nu a fost cazul”, a spus Roßbach.

Deoarece modelul a fost concentrat pe auzul cu un singur ureche, echipa va căuta acum să creeze un model binaural pentru auzul cu două urechi. Ei spun, de asemenea, că noul model ar putea fi utilizat pentru a prevedea efortul de ascultare sau calitatea vorbirii, de asemenea.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.