AI-modeller og plattformer
Facebook utvikler maskinoversettelsesmodell som kan oversette direkte mellom 100 forskjellige språk
Facebook (META ) har nylig utviklet en ny maskinoversettelsesmodell som kan oversette tekst mellom hvilket som helst gitt språkpar av en mengde på 100 språk. Mens andre maskinoversettelsessystemer eksisterer, opererer de fleste andre AI-oversettelsessystemer ved å først oversette tekst til engelsk og deretter konvertere teksten derfra. Som Engadget rapporterte, opererer Facebooks AI-oversetter uten å bruke engelsk som mellomledd, og kan angivelig oppnå omtrent 90% nøyaktighet.
Facebooks treningsdata for AI-modellen bestod av rundt 7,5 milliarder par settninger, fordelt på 100 forskjellige språk. Dataene ble samlet inn fra nettet ved hjelp av en rekke nettlesere, og språkene som var til stede i de samlede dataene, ble identifisert ved hjelp av et språkmodell kalt FastText. Når dataene var samlet inn, ble de kjørt gjennom et verktøy kalt LASER 2.0 for å trekke ut meningene til de forskjellige setningseksemplene og matche setninger i forskjellige språk sammen basert på deres mening. LASER 2.0 ble utviklet av Facebook og den bruker ubetrengte lærealgoritmer for å lage innkapslinger. Setninginnkapslingene inneholder informasjon om forholdene mellom forskjellige setninger basert på egenskaper som hyppighet og nærhet. LASER 2.0 kan deretter lage par av setninger som har svært lik mening.
Treningsdataene ble ikke bare parret basert på setningsmening. Språkene selv ble gruppert sammen. Målet var å designe et system som ikke krevde engelsk som medium mellom to språk, med Facebooks Angela Fan, som ledet prosjektet, noterte at mange regioner rundt om i verden snakker to språk som ikke er engelsk. Facebooks ingeniører utførte treningsved å fokusere på å pare språk som ofte oversettes til og fra hverandre. Fjorten forskjellige språkgrupper ble laget, basert på variabler som kultur, språklige likheter og geografi. Som et eksempel, inneholdt en av de språklige gruppene som forskerne lagde, de vanligste språkene i India, som inkluderer språkene Urdu, Tamil, Hindi og Bengali. Dette ble gjort for at vanlig parrede språk skulle få høykvalitets oversettelser.
Språkgruppe-fokusert treningsmetode ledet til noen interessante resultater. Det ble funnet at den resulterende oversettelsesmodellen hadde større nøyaktighet enn eksisterende modeller for visse språkpar. Når det gjelder oversettelse mellom engelsk og belarusisk, for eksempel, kunne AI-en bruke bestemte mønster den hadde lært når den oversatte russisk, fordi belarusisk har språklige likheter med russisk. Liksom oversettelsesforsøk mellom spansk og portugisisk forbedret, siden spansk er det nest mest talte språket og det var en betydelig mengde treningsdata for oppgaven.
Det er omtrent seksti språk som oversettelsessystemet ikke dekker ennå, og modellens nøyaktighet på språk uten mye treningsdata må forbedres før den er klar for bruk. Mange språk i Sørøst-Asia og Afrika mangler den mengden data som trengs for å trene en pålitelig modell. Forskningsgruppen må finne en måte å kompensere for denne mangelen på data. Forskningsgruppen må også finne en måte å kontrollere for eventuelle rasistiske, sexistiske eller andre upassende mønster modellen kan ha lært. Mens forkningsgruppen har brukt et banalitetsfilter, fungerer filteret hovedsakelig på engelsk data.
Maskinoversettelsessystemet er ikke blitt brukt på Facebooks sosiale medieplattform ennå. Den nåværende modellen er kun for forskningsformål. Likevel er Facebook i ferd med å designe lignende modeller og la dem håndtere omtrent 20 milliarder oversettelsesforespørsler som nettstedet mottar hver dag.












