AI-mallit ja alustat
Facebook kehittää konekäännösmallin, joka voi kääntää suoraan 100 eri kieltä
Facebook (META ) on kehittänyt uuden konekäännösmallin, joka voi kääntää tekstejä minkä tahansa kahden kielen välillä 100 kielen joukosta. Vaikka muita konekäännösjärjestelmiä on olemassa, useimmat muut konekäännösjärjestelmät toimivat kääntämällä tekstin ensin englanniksi ja sitten muuttamalla tekstin siitä. Engadgetin mukaan Facebookin konekäännösjärjestelmä toimii ilman englannin kielen välimielessä ja on ilmoitettu saavuttaneen noin 90 prosentin tarkkuuden.
Facebookin koulutusdata konekäännösmallille koostui noin 7,5 miljardista lauseparista, jotka oli jaettu 100 eri kielelle. Data kerättiin verkosta sarjan verkkokävijöiden avulla, ja kielet tunnistettiin kielenmallilla nimeltä FastText. Kun data oli kerätty, se ajettiin työkalun nimeltä LASER 2.0 läpi, jotta voitiin poistaa lauseiden merkitys ja koota lauseparit, joilla on hyvin samanlainen merkitys. LASER 2.0 on kehitetty Facebookissa, ja se käyttää ohjaamattomia oppimisalgoritmeja luomaan upotukset. Lauseupotukset sisältävät tietoa lauseiden suhteista toisiinsa ominaisuuksien perusteella, kuten käyttötiheyden ja siinä, miten lähellä toisiaan lauseet ovat. LASER 2.0 pystyy luomaan lausepareja, joilla on hyvin samanlainen merkitys.
Koulutusdataa ei ollut pelkästään paria lauseiden merkitysten perusteella. Kielet itsessään ryhmiteltiin. Tavoitteena oli suunnitella järjestelmä, joka ei vaatisi englannin kielen välimieheksi kahden kielen välillä, ja Facebookin Angela Fan, joka johti projekti, totesi, että monilla alueilla maailmassa puhutaan kahta kieltä, jotka eivät ole englantia. Facebookin insinöörit suorittivat koulutuksen keskittyen kielen parien kouluttamiseen, jotka yleisimmin käännetään toisistaan. Neljätoista eri kielen ryhmää luotiin, jotka perustuivat muuttujiin kuten kulttuuriin, kielellisiin samankaltaisuuksiin ja maantieteeseen. Esimerkiksi yksi kielellisistä ryhmistä, jonka tutkijat loivat, sisälsi Intian yleisimpiä kieliä, kuten urdu, tamil, hindi ja bengali. Tämä tehtiin, jotta yleisimmin parien kielten käännökset saisivat korkealaatuisia käännöksiä.
Kielen ryhmittäin koulutusmenetelmä johti joistakin mielenkiintoisista tuloksista. Havaittiin, että tuloksesta konekäännösmalli oli tarkempi kuin nykyiset mallit tiettyjen kieliparien osalta. Esimerkiksi kääntäessä englannista valkovenäjäksi kone pystyi soveltamaan tiettyjä kaavoja, jotka se oli oppinut kääntäessä venäjää, koska valkovenäjässä on kielellisiä samankaltaisuuksia venäjän kanssa. Vastaavasti käännökset espanjasta portugaliksi paransivat, koska espanja on toiseksi puhutuin kieli ja siitä oli runsaasti koulutusdataa tehtävää varten.
On noin 60 kieltä, joita käännösjärjestelmä ei vielä kata, ja mallin tarkkuus kielillä, joilla ei ole paljon koulutusdataa, on parannettava, ennen kuin se on valmis käytettäväksi. Monilla kielillä Kaakkois-Aasiassa ja Afrikassa ei ole tarpeeksi dataa, jotta voidaan kouluttaa luotettava malli. Tutkimusryhmän on löydettävä keino kompensoida tämä datan puute. Tutkimusryhmän on myös määritettävä, miten hallitaan mahdollisia rasistisia, seksistisiä tai muuten sopimattomia kaavoja, jotka malli on oppinut. Vaikka tutkimusryhmä on käyttänyt sopimattomuuden suodatinta, suodatin toimii pääasiassa englannin kielellä.
Konekäännösjärjestelmää ei ole vielä käytetty Facebookin sosiaalisen median alustalla. Nykyinen malli on tutkimustarkoituksiin. Facebook kuitenkin valmistautuu suunnittelemaan samanlaisia malleja ja antamaan niiden käsitellä noin 20 miljardia käännöspyynnön, jotka sivusto vastaanottaa joka päivä.












