Modely a platformy AI
Výzkumníci se snaží rozšířit automatické rozpoznávání řeči na 2 000 jazyků
Tým výzkumníků z Carnegie Mellon University se snaží rozšířit automatické rozpoznávání řeči na 2 000 jazyků. V současné době pouze část odhadovaných 7 000 až 8 000 mluvených jazyků na světě by mohla využít moderních jazykových technologií, jako je přepis řeči nebo automatické titulkování.
Xinjian Li je doktorand na School of Computer Science’s Language Technologies Institute (LTI).
“Mnoho lidí na světě mluví rozmanitými jazyky, ale jazykové technologie nejsou vyvíjeny pro všechny z nich,” řekl. “Vyvíjet technologii a dobrý jazykový model pro všechny lidi je jedním z cílů tohoto výzkumu.”
Li patří do týmu odborníků, kteří se snaží zjednodušit požadavky na data, která jazyky potřebují k vývoji modelu rozpoznávání řeči.
Tým také zahrnuje členy LTI fakulty Shinji Watanabe, Florian Metze, David Mortensen a Alan Black.
Výzkum s názvem „ASR2K: Speech Recognition for Around 2,000 Languages Without Audio“ byl prezentován na Interspeech 2022 v Jižní Koreji.
Velká většina stávajících modelů rozpoznávání řeči vyžaduje textová a audio data. Zatímco textová data existují pro tisíce jazyků, stejné není pravda pro audio. Tým se snaží eliminovat potřebu audio dat zaměřením se na lingvistické prvky, které jsou společné pro mnoho jazyků.
Technologie rozpoznávání řeči se obvykle zaměřují na foném, který je distinctivní zvuk, který odlišuje jeden jazyk od jiného. Tyto jsou jedinečné pro každý jazyk. Současně jazyky mají fonémy, které popisují, jak slovo zní fyzicky, a několik fonémů může odpovídat jednomu fonému. Zatímco samostatné jazyky mohou mít různé fonémy, podkladové fonémy by mohly být stejné.
Tým pracuje na modelu rozpoznávání řeči, který se méně zaměřuje na fonémy a více na informace o tom, jak jsou fonémy sdíleny mezi jazyky. To pomáhá snížit úsilí potřebné k vybudování samostatných modelů pro každý jednotlivý jazyk. Spárováním modelu s fylogenetickým stromem, který je diagramem, který mapuje vztahy mezi jazyky, pomáhá s pravidly pro výslovnost. Model týmu a struktura stromu umožnily aproximovat model řeči pro tisíce jazyků, i bez audio dat.
“Snažíme se odstranit tuto potřebu audio dat, což nám pomáhá přejít z 100 na 200 jazyků na 2 000,” řekl Li. “Toto je první výzkum, který si klade za cíl tak velký počet jazyků, a jsme první tým, který se snaží rozšířit jazykové nástroje na tento rozsah.”
Výzkum, který je stále v rané fázi, zlepšil stávající jazykové aproximace nástroje o 5%.
“Každý jazyk je velmi důležitým faktorem své kultury. Každý jazyk má svou vlastní historii, a pokud se nepokusíte zachovat jazyky, tyto příběhy by mohly být ztraceny,” řekl Li. “Vyvíjet tento druh systému rozpoznávání řeči a tento nástroj je krok, který se snaží zachovat tyto jazyky.”












