Modele i platformy AI
Naukowcy opracowują model rozpoznawania mowy ludzkiej z wykorzystaniem głębokich sieci neuronowych
Grupa naukowców z Niemiec bada nowy model rozpoznawania mowy ludzkiej oparty na uczeniu maszynowym i głębokich sieciach neuronowych. Nowy model może znacznie poprawić rozpoznawanie mowy ludzkiej.
Algoritmy słuchawkowe są zwykle używane do poprawy rozpoznawania mowy ludzkiej i są oceniane za pomocą różnych eksperymentów, które określają stosunek sygnału do szumu, przy którym rozpoznawane jest określona liczba słów. Jednak te eksperymenty są często czasochłonne i drogie.
Nowy model został opisany w badaniach opublikowanych w The Journal of the Acoustical Society of America.
Prognozy dla słuchaczy z uszkodzonym słuchem
Jana Roßbach jest jednym z autorów z Uniwersytetu Carla Von Ossietzky.
„Nowość naszego modelu polega na tym, że zapewnia dobre prognozy dla słuchaczy z uszkodzonym słuchem dla typów hałasu o bardzo różnej złożoności i wykazuje niskie błędy oraz wysoką korelację z pomierzonymi danymi”, powiedział Roßbach.
Zespół naukowców obliczył, ile słów na zdanie słuchacz mógł zrozumieć za pomocą automatycznego rozpoznawania mowy (ASR). Narzędzia rozpoznawania mowy, takie jak Alexa i Siri, opierają się na tym ASR, które jest powszechnie dostępne.
Badanie i wyniki
Badanie przeprowadzone przez zespół obejmowało ośmiu osób ze słuchem normalnym i 20 osób z uszkodzonym słuchem. Słuchacze byli narażeni na wiele różnych złożonych hałasów, które maskowały mowę, a słuchacze z uszkodzonym słuchem zostali podzielili na trzy grupy w zależności od stopnia ich starczego uszkodzenia słuchu.
Za pomocą nowego modelu naukowcy mogli przewidzieć wyniki rozpoznawania mowy ludzkiej przez słuchaczy z uszkodzonym słuchem o różnym stopniu uszkodzenia słuchu. Mogli oni również przewidzieć te wyniki dla różnych maskujących hałasów o różnej złożoności w modulacji czasowej i podobieństwie do prawdziwej mowy. To wszystko umożliwiło obserwację i analizę każdej osoby w odniesieniu do możliwego uszkodzenia słuchu.
“Byliśmy najbardziej zaskoczeni, że prognozy działały dobrze dla wszystkich typów hałasu. Spodziewaliśmy się, że model będzie miał problemy z użyciem jednego konkurującego mówcy. Jednak nie było to przypadku”, powiedział Roßbach.
Ponieważ model był ukierunkowany na słuch jednego ucha, zespół będzie teraz pracował nad stworzeniem modelu binauralnego dla słuchu dwuuszowego. Twierdzą również, że nowy model może być użyty do przewidywania wysiłku słuchowego lub jakości mowy.












