AI-modeller og platforme

Forskere udvikler menneskeligt talegenkendelsesmodel med dybe neurale netværk

mm
Føj Unite.AI til dine foretrukne kilder på Google

En gruppe forskere fra Tyskland er i gang med at udvikle et nyt menneskeligt talegenkendelsesmodel baseret på maskinel læring og dybe neurale netværk. Det nye model kan hjælpe med at betydeligt forbedre menneskeligt talegenkendelse.

Høreapparat-algoritmer bruges normalt til at forbedre menneskeligt talegenkendelse, og de vurderes gennem forskellige eksperimenter, der bestemmer signal-støj-forholdet, hvorved et bestemt antal ord kan genkendes. Disse eksperimenter kan dog ofte være tidskrævende og dyre.

Det nye model blev detaljeret i en forskning offentliggjort i The Journal of the Acoustical Society of America.

Forudsigelser for høretabte lyttere

Jana Roßbach er en af forfatterne fra Carl Von Ossietzky Universitet.

“Nytænkningen i vores model er, at den giver gode forudsigelser for høretabte lyttere for støjtyper med meget forskellig kompleksitet og viser både lav fejl og høj korrelation med målte data,” sagde Roßbach.

Forskerholdet beregnede, hvor mange ord per sætning en lytter kunne forstå gennem automatisk talegenkendelse (ASR). Talegenkendelsesværktøjer som Alexa og Siri afhænger af denne ASR, som er bredt tilgængelig.

Studiet og resultaterne

Studiet, der blev udført af forskerholdet, involverede otte personer med normal hørelse og 20 personer med høretab. Lytterne blev udsat for mange forskellige komplekse støj, der skjulte tale, og personer med høretab blev inddelt i tre grupper afhængigt af deres niveau af aldersrelateret høretab.

Gennem det nye model kunne forskerne forudsige menneskeligt talegenkendelsespræstation for høretabte lyttere med forskellige grader af høretab. De kunne gøre disse forudsigelser for forskellige støjmasker med forskellig kompleksitet i tidsmæssig modulation og hvor lignende de var til rigtig tale. Dette gjorde det muligt for hver person at blive observeret og analyseret individuelt i forhold til muligt høretab.

“Vi var mest overraskede over, at forudsigelserne fungerede godt for alle støjtyper. Vi havde forventet, at modellen ville have problemer, når der blev brugt en enkelt konkurrerende taler. Men det var ikke tilfældet,” sagde Roßbach.

Da modellen var fokuseret på enkeltøret hørelse, vil forskerholdet nu se på at oprette en binaural model for tohøret hørelse. De siger også, at den nye model kunne bruges til at forudsige lytningindsats eller talekvalitet samt.

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.