AI-modeller och plattformar
Forskare utvecklar modell för mänsklig taligenkänning med djupa neurala nätverk
En grupp forskare från Tyskland undersöker en ny modell för mänsklig taligenkänning baserad på maskinlärning och djupa neurala nätverk. Den nya modellen kan hjälpa till att avsevärt förbättra mänsklig taligenkänning.
Algoritmer för hörapparater används vanligtvis för att förbättra mänsklig taligenkänning, och de utvärderas genom olika experiment som bestämmer signal-brus-förhållandet vid vilket ett visst antal ord kan kännas igen. Dessa experiment kan dock vara tidskrävande och dyra.
Den nya modellen presenterades i en studie publicerad i The Journal of the Acoustical Society of America.
Prognoser för hörselskadade lyssnare
Jana Roßbach är en av författarna från Carl Von Ossietzky Universitet.
“Nyhetsvärdet i vår modell är att den ger bra prognoser för hörselskadade lyssnare för buller med mycket olika komplexitet och visar både låga fel och höga korrelationer med de uppmätta data”, sa Roßbach.
Forskarteamet beräknade hur många ord per mening en lyssnare kunde förstå genom automatisk taligenkänning (ASR). Taligenkänningssystem som Alexa och Siri förlitar sig på denna ASR, som är allmänt tillgänglig.
Studien och resultaten
Studien som utfördes av teamet involverade åtta personer med normal hörsel och 20 personer med hörselskada. Lyssnarna utsattes för många olika komplexa buller som dolde talet, och de hörselskadade lyssnarna delades in i tre grupper beroende på deras nivå av åldersrelaterad hörselskada.
Genom den nya modellen kunde forskarna förutsäga prestationen för mänsklig taligenkänning hos hörselskadade lyssnare med skilda grader av hörselskada. De kunde göra dessa förutsägelser för olika buller med olika komplexitet i tidsmodulering och hur lika de var i förhållande till riktigt tal. Allt detta möjliggjorde att varje person kunde observeras och analyseras individuellt i fråga om eventuell hörselskada.
“Vi var mest förvånade över att förutsägelserna fungerade bra för alla typer av buller. Vi förväntade oss att modellen skulle ha problem när den använde en enda konkurrerande talare. Men det var inte fallet”, sa Roßbach.
Eftersom modellen fokuserade på enkelt öra, kommer teamet nu att försöka skapa en binaural modell för tvåördigt hörsel. De säger också att den nya modellen kan användas för att förutsäga lyssningsansträngning eller taltalighet.












