AI-modeller og plattformer

Forskere søker å utvide automatisk talegjenkjenning til 2 000 språk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et team av forskere ved Carnegie Mellon University søker å utvide automatisk talegjenkjenning til 2 000 språk. For tiden er det bare en del av de anslåtte 7 000 til 8 000 talte språk i verden som kan dra nytte av moderne språkteknologier som tale-til-tekst-transkription eller automatisk underteksting.

Xinjian Li er en ph.d.-student ved School of Computer Science’s Language Technologies Institute (LTI).

“Mange mennesker i verden snakker forskjellige språk, men språkteknologien utvikles ikke for alle av dem,” sa han. “Å utvikle teknologi og et godt språkmodell for alle mennesker er ett av målene med denne forskningen.”

Li tilhører et team av eksperter som søker å forenkle datakravene språkene trenger for å utvikle en talegjenkjenningmodell.

Teamet inkluderer også LTI-ansatte Shinji Watanabe, Florian Metze, David Mortensen og Alan Black.

Forskningen med tittelen “ASR2K: Speech Recognition for Around 2,000 Languages Without Audio” ble presentert på Interspeech 2022 i Sør-Korea.

De fleste eksisterende talegjenkjenningmodellene krever tekst- og lyddata. Mens tekstdata finnes for tusenvis av språk, er det ikke tilfelle med lyd. Teamet ønsker å eliminere behovet for lyddata ved å fokusere på lingvistiske elementer som er felles for mange språk.

Talegjenkjenningsteknologier fokuserer vanligvis på et språks fonem, som er distinkte lyder som skiller det fra andre språk. Disse er unike for hvert språk. Samtidig har språkene fonemer som beskriver hvordan et ord lyder fysisk, og flere fonemer kan korrespondere til ett enkelt fonem. Mens separate språk kan ha forskjellige fonemer, kan de underliggende fonemene være de samme.

Teamet arbeider med en talegjenkjenningmodell som avhenger mindre av fonemer og mer av informasjon om hvordan fonemene deles mellom språk. Dette hjelper med å redusere arbeidet som trengs for å bygge separate modeller for hvert enkelt språk. Ved å kombinere modellen med en fylogenetisk tre, som er en diagram som kartlegger forholdet mellom språk, hjelper det med uttaleregler. Teamets modell og trestrukturen har gjort det mulig for dem å approksimere talemodellen for tusenvis av språk, selv uten lyddata.

“Vi prøver å fjerne dette kravet om lyddata, som hjelper oss å gå fra 100 til 200 språk til 2 000,” sa Li. “Dette er den første forskningen som tar mål på så mange språk, og vi er det første teamet som søker å utvide språkverktøy til denne omfang.”

Forskningen, som fortsatt er i et tidlig stadium, har forbedret eksisterende språkapproksimasjonsverktøy med 5%.

“Hvert språk er en viktig faktor i sin egen kultur. Hvert språk har sin egen historie, og hvis du ikke prøver å bevare språkene, kan disse historiene gå tapt,” sa Li. “Å utvikle denne type talegjenkjenningssystem og dette verktøyet er et skritt for å prøve å bevare disse språkene.”

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.