AI-modeller og platforme

Forskere søger at udvide automatisk talegenkendelse til 2.000 sprog

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et hold af forskere ved Carnegie Mellon University søger at udvide automatisk talegenkendelse til 2.000 sprog. For nuværende tid er det kun en del af de anslåede 7.000 til 8.000 tale-sprog i verden, der kan drage fordel af moderne sprogteknologier som tale-til-tekst-transkription eller automatisk undertekstning.

Xinjian Li er en ph.d.-studerende på School of Computer Science’s Language Technologies Institute (LTI).

“Mange mennesker i verden taler forskellige sprog, men sprogteknologiværktøjer udvikles ikke til alle af dem,” sagde han. “At udvikle teknologi og et godt sprogmodel for alle mennesker er et af målene for denne forskning.”

Li er en del af et hold af eksperter, der søger at simplificere datakravene til sprog, der skal udvikle en talegenkendelsesmodel.

Holdet inkluderer også LTI-facultetsmedlemmerne Shinji Watanabe, Florian Metze, David Mortensen og Alan Black.

Forskningen med titlen “ASR2K: Talegenkendelse for omkring 2.000 sprog uden lyd” blev præsenteret på Interspeech 2022 i Sydkorea.

De fleste eksisterende talegenkendelsesmodeller kræver tekst- og lyddata. Mens tekstdata findes for tusinder af sprog, er det samme ikke sandt for lyd. Holdet ønsker at eliminere behovet for lyddata ved at fokusere på lingvistiske elementer, der er fælles for mange sprog.

Talegenkendelsesteknologier fokuserer normalt på et sprogs fonem, der er distinkte lyde, der adskiller det fra andre sprog. Disse er unikke for hvert sprog. Samtidig har sprog telefoner, der beskriver, hvordan et ord lyder fysisk, og flere telefoner kan svarer til et enkelt fonem. Mens separate sprog kan have forskellige fonemer, kan de underliggende telefoner være de samme.

Holdet arbejder på en talegenkendelsesmodel, der afhænger mindre af fonemer og mere af information om, hvordan telefoner deles mellem sprog. Dette hjælper med at reducere den indsats, der kræves for at bygge separate modeller for hvert enkelt sprog. Ved at parre modellen med en fylogenetisk træ, der er et diagram, der viser relationerne mellem sprog, hjælper det med udtale-regler. Holdets model og træstrukturen har enablede dem til at approksimere talemodellen for tusinder af sprog, selv uden lyddata.

“Vi prøver at fjerne dette krav om lyddata, som hjælper os med at gå fra 100 til 200 sprog til 2.000,” sagde Li. “Dette er den første forskning, der sigter mod så mange sprog, og vi er det første hold, der søger at udvide sprogværktøjer til denne omfang.”

Forskningen, der endnu er i en tidlig fase, har forbedret eksisterende sprogapproksimationsværktøjer med 5%.

“Hvert sprog er en meget vigtig faktor i dets kultur. Hvert sprog har sin egen historie, og hvis man ikke prøver at bevare sprogene, kan disse historier gå tabt,” sagde Li. “At udvikle denne type talegenkendelsessystem og dette værktøj er et skridt for at prøve at bevare disse sprog.”

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.