AI-mallit ja alustat
Tutkijat pyrkivät laajentamaan automaattista puheentunnistusta 2 000 kielen älyttämiseen
Carnegie Mellon -yliopiston tutkijaryhmä pyrkii laajentamaan automaattista puheentunnistusta 2 000 kielen älyttämiseen. Tällä hetkellä vain osa maailman arviolta 7 000 – 8 000 puhuttua kieltä hyötyisi nykyaikaisista kieliteknologioista, kuten ääni-teksti-käännöksestä tai automaattisesta tekstityksestä.
Xinjian Li on väitöskirjatutkija tietotekniikan koulun kieliteknologian instituutissa (LTI).
“Monet ihmiset puhuvat maailmassa monia kieliä, mutta kieliteknologioita ei kehitetä kaikille”, hän sanoi. “Teknologian ja hyvän kielimallin kehittäminen kaikille ihmisille on yksi tämän tutkimuksen tavoitteista.”
Li kuuluu asiantuntijaryhmään, joka pyrkii yksinkertaistamaan kielen kehittämiseen tarvittavat tiedot puheentunnistusmallin kehittämiseksi.
Ryhmään kuuluvat myös LTI:n opettajat Shinji Watanabe, Florian Metze, David Mortensen ja Alan Black.
Tutkimus, jonka otsikko on “ASR2K: Puheentunnistus noin 2 000 kielelle ilman äänitiedostoja”, esiteltiin Interspeech 2022 -konferenssissa Etelä-Koreassa.
Suurin osa olemassa olevista puheentunnistusmalleista vaatii teksti- ja äänitiedostojen olemassaolon. Vaikka tekstidatat ovat olemassa tuhansien kielten kohdalla, sama ei pidä paikkaansa äänitiedostojen osalta. Ryhmä haluaa poistaa äänitiedostojen tarpeen keskittymällä kielten yhteisiin kielitieteellisiin elementteihin.
Puheentunnistusteknologiat keskittyvät yleensä kielen fonemiin, jotka ovat erottuvia ääniä, jotka erottavat sen muista kielistä. Nämä ovat yksilöllisiä kullekin kielelle. Samalla kielet ovat foneja, jotka kuvaavat, miten sana kuulostaa fyysisesti, ja useita foneja voi vastata yhtä fonemia. Vaikka eri kielet voivat olla erilaisia fonemeja, foneja voi olla samanlaisia.
Ryhmä työskentelee puheentunnistusmallin parissa, joka perustuu vähemmän fonemeihin ja enemmän tietoihin siitä, miten foneja jaetaan kielen välillä. Tämä auttaa vähentämään vaivaa, joka tarvitaan erillisten mallien luomiseen kullekin kielelle. Parittamalla malli kielten välisten suhteiden puuhun, joka on kaavio, joka kartoittaa kielten välisiä suhteita, se auttaa ääntämisen säännöissä. Ryhmän malli ja puurakenne ovat mahdollistaneet heille arvioida puheentunnistusmallin tuhansien kielten kohdalla ilman äänitiedostoja.
“Yritämme poistaa tämän äänitiedoston vaatimuksen, joka auttaa meitä siirtymään 100-200 kielestä 2 000 kielen älyttämiseen”, Li sanoi. “Tämä on ensimmäinen tutkimus, joka kohdistuu niin suureen määrään kieliä, ja olemme ensimmäinen ryhmä, joka pyrkii laajentamaan kielityökaluja tähän laajuuteen.”
Tutkimus, joka on edelleen varhaisessa vaiheessa, on parantanut olemassa olevia kielten arviointityökaluja 5 %.
“Jokainen kieli on tärkeä tekijä kulttuurissaan. Jokaisella kielellä on oma tarinansa, ja jos et yritä säilyttää kieliä, ne tarinat voivat hävitä”, Li sanoi. “Tämänkaltaisen puheentunnistusjärjestelmän ja työkalun kehittäminen on askel kielen säilyttämiseen.”












