AI-modeller og plattformer
Forskere utvikler modell for gjenkjennelse av menneskelig tale med dype neurale nettverk
En gruppe forskere fra Tyskland utforsker en ny modell for gjenkjennelse av menneskelig tale basert på maskinlæring og dype neurale nettverk. Den nye modellen kan bidra til å forbedre gjenkjennelsen av menneskelig tale.
Algoritmer for hørselsapparater brukes vanligvis til å forbedre gjenkjennelsen av menneskelig tale, og de evalueres gjennom ulike eksperimenter som bestemmer signal-støy-forholdet ved hvilket et visst antall ord gjenkjennes. Disse eksperimentene er ofte tidskrevende og dyre.
Den nye modellen ble detaljert i en studie publisert i The Journal of the Acoustical Society of America.
Forutsigelser for hørselshemmede lyttere
Jana Roßbach er en av forfatterne fra Carl Von Ossietzky Universitet.
“Nyskapningen i vår modell er at den gir gode forutsigelser for hørselshemmede lyttere for støytyper med svært ulik kompleksitet og viser både lave feil og høye korrelasjoner med målte data,” sa Roßbach.
Forskergruppen beregnet hvor mange ord per setning en lytter kunne forstå gjennom automatisk talegjenkjenning (ASR). Talegjenkjenning-verktøy som Alexa og Siri er avhengige av denne ASR, som er vidt tilgjengelig.
Studien og resultater
Studien som ble utført av forskergruppen, inkluderte åtte personer med normal hørsel og 20 hørselshemmede personer. Lytterne ble utsatt for mange ulike komplekse støy som skjulte tale, og de hørselshemmede lytterne ble kategorisert i tre grupper avhengig av deres nivå av aldersrelatert hørselstap.
Gjennom den nye modellen, kunne forskerne forutsi menneskelig talegjenkjenning-prestasjonen til hørselshemmede lyttere med ulike grader av hørselstap. De kunne gjøre disse forutsigelsene for ulike støy-maskere med ulik kompleksitet i tidsmodulasjon og hvor lik de var til virkelig tale. Dette gjorde det mulig for hver person å bli observert og analysert individuelt i forhold til mulig hørselstap.
“Vi var mest overrasket over at forutsigelsene fungerte bra for alle støytyper. Vi ventet at modellen ville ha problemer når det ble brukt en enkelt konkurranse-taler. Men det var ikke tilfelle,” sa Roßbach.
Ettersom modellen var fokusert på enkelt-ørehørsel, vil forskergruppen nå se på å lage en binaural modell for to-ørehørsel. De sier også at den nye modellen kan brukes til å forutsi lytteinnsats eller talekvalitet.












