AI-mallit ja alustat

Uusi tekoälymalli toimii laajemman valikoiman ihmisten kielien kanssa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Waterloon yliopiston tutkijat ovat kehittäneet tekoälymallin, joka mahdollistaa tietokoneiden prosessoinnin laajemman valikoiman ihmisten kieliä. Tämä on tärkeä askel eteenpäin alalla, jossa useat kielet usein jäävät ohjelmointiprosessin ulkopuolelle. Afrikan kielet eivät usein ole tietokoneiden tutkijoiden fokuksessa, mikä on johtanut siihen, että luonnollisen kielen prosessointikapasiteetit ovat rajoitetut mantereella.

Uusi kielimalli kehitettiin Waterloon yliopiston David R. Cheritonin tietokoneiden tutkimuksen koulun tutkijaryhmän toimesta.

Tutkimus esiteltiin Monikielisen edustusoppimisen työpajassa 2021 Empiirisessä menetelmässä luonnollisen kielen prosessoinnissa.

Malli on keskeisessä roolissa auttaessaan tietokoneita analysoimaan tekstiä afrikan kielillä monissa hyödyllisissä tehtävissä, ja sitä kutsutaan AfriBERTaksi. Se käyttää syväoppimistekniikoita saavuttaakseen vaikuttavat tulokset vähävaraisille kielille.

Työskenteleminen 11 afrikan kielen kanssa

AfriBERTa toimii 11 eri afrikan kielen kanssa tällä hetkellä, mukaan lukien amharan, hausan ja swahilin, joita puhuu yhteensä yli 400 miljoonaa ihmistä. Malli on osoittanut tuloksen, joka on vertailukelpoinen parhaiden olemassa olevien mallien kanssa, ja se on saavuttanut tämän opettelemalla vain yhden gigatavun tekstiä. Muut samankaltaiset mallit vaativat usein tuhansia kertoja enemmän dataa.

Kelechi Ogueji on maisteriopiskelija tietokoneen tutkimuksessa Waterloossa.

“Esikoulutetut kielimallit ovat muuttaneet tapaa, jolla tietokoneet prosessoivat ja analysoivat tekstidataa tehtävistä, kuten konekäännöksestä kysymyksiin vastaamiseen”, sanoi Ogueji. “Valitettavasti afrikan kielet ovat saaneet vain vähän huomiota tutkimusyhteisöltä.”

“Yksi haasteista on, että neuroverkkomallit ovat hämmästyttävän teksti- ja tietokoneintensiivisiä rakentaa. Ja toisin kuin englanti, jolla on valtavat määrät saatavilla olevaa tekstiä, useimmat maailmanlaajuisesti puhuttavista 7 000 kielestä voidaan luokitella vähävaraisiksi, sillä niille ei ole saatavilla riittävästi dataa, jota voidaan syöttää data-nälkäisille neuroverkoille.”

Esikoulutustekniikka

Useimmat näistä malleista riippuvat esikoulutustekniikasta, joka sisältää tutkijan esittämisen mallille tekstiä, jossa on joitain sanoja piilotettu tai maskattu. Malli arvioi piilotettuja sanoja ja toistaa tätä prosessia miljardien kertoja. Se lopulta oppii tilastolliset assosiaatiot sanojen välillä, mikä on samanlainen kuin ihmisen kielen tiedon.

Jimmy Lin on Cheritonin tietokoneen tutkimuksen puheenjohtaja ja Oguejin ohjaaja.

“Pystyäksemme esikouluttaa malleja, jotka ovat yhtä tarkkoja tiettyjen alaspäin suuntautuvien tehtävien osalta, mutta käyttäen paljon vähemmän dataa, on monia etuja”, sanoi Lin. “Vähemmän dataa tarvitaan koulutukseen, jotta vähemmän laskentaa vaaditaan, ja seurauksena on alemmat hiilidioksidipäästöt, jotka liittyvät massiivisten tietokeskusten toimintaan. Pienemmät tietokannat tekevät myös datan kuratoinnin käytännöllisemmäksi, mikä on yksi tapa vähentää malleissa olevia harhoja.”

“Tämä työ on pieni mutta tärkeä askel luonnollisen kielen prosessoinnin kykyjen tuomiseksi yli 1,3 miljardille ihmiselle Afrikan mantereella.”

Tutkimukseen osallistui myös Yuxin Zhu, joka on vastikään suorittanut tietokoneen tutkimuksen alempia tutkintoja yliopistossa.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.