AI-modeller og platforme

Facebook udvikler maskinoversættelsesmodel, der kan oversætte direkte mellem 100 forskellige sprog

mm
Føj Unite.AI til dine foretrukne kilder på Google

Facebook (META ) har nylig udviklet en ny maskinoversættelsesmodel, der kan oversætte tekst mellem enhver given sprogpar ud af en samling på 100 sprog. Mens andre maskinoversættelsessystemer findes, opererer de fleste andre AI-oversættelsessystemer ved først at oversætte tekst til engelsk og derefter omvende teksten derfra. Som Engadget rapporterede, fungerer Facebooks AI-oversætter uden at bruge det engelske sprog som mellemled og kan angiveligt opnå en nøjagtighed på ca. 90%.

Facebooks træningsdata til AI-modellen bestod af omkring 7,5 milliarder sæt af sætninger, fordelt over 100 forskellige sprog. Dataene blev samlet fra webben ved hjælp af en række web-crawlers, og sprogene i de indsamlede data blev identificeret ved hjælp af et sprogmodel kaldet FastText. Når dataene var indsamlet, blev de kørt igennem et værktøj kaldet LASER 2.0 for at udtrække betydningen af de forskellige sætningseksempler og matche sætninger i forskellige sprog sammen på basis af deres betydning. LASER 2.0 blev udviklet af Facebook og anvender unsupervised learning-algoritmer til at oprette indlejring. Sætningsindlejringen indeholder information om relationerne mellem forskellige sætninger på basis af funktioner som hyppighed og nærhed mellem sætninger. LASER 2.0 kan derefter oprette par af sætninger, der har meget lignende betydninger.

Træningsdataene blev ikke kun parret på basis af sætningsbetydninger. Sprogene selv blev grupperet sammen. Målet var at designe et system, der ikke krævede engelsk som medium mellem to sprog, med Facebooks Angela Fan, der ledede projektet, og bemærkede, at mange regioner rundt om i verden taler to sprog, der ikke er engelsk. Facebooks ingeniører udførte træning ved at fokusere på at parre sprog, der ofte oversættes til og fra hinanden. Fjorten forskellige sproggrupper blev oprettet på basis af variabler som kultur, lingvistiske ligheder og geografi. Eksempelvis indeholdt en af de lingvistiske grupper, som forskerne oprettede, de mest almindelige sprog i hele Indien, herunder sprogene urdu, tamil, hindi og bengali. Dette blev gjort for at sikre, at almindeligt parrede sprog ville få højkvalitetsoversættelser.

Den sproggruppe-fokuserede træningsmetode førte til nogle interessante resultater. Det blev fundet, at den resulterende oversættelsesmodel havde en højere nøjagtighed end eksisterende modeller for visse sprogpar. Når man oversætter fra engelsk til hviderussisk, for eksempel, kunne AI’en anvende visse mønstre, den havde lært, da den oversætter fra russisk, da hviderussisk har lingvistiske ligheder med russisk. Ligeledes forbedredes oversættelsesforsøg mellem spansk og portugisisk, da spansk er det andet mest talte sprog, og der var en betydelig mængde træningsdata til opgaven.

Der er omkring 60 sprog, som oversættelsessystemet endnu ikke dækker, og modellens nøjagtighed på sprog uden en stor mængde træningsdata skal forbedres, før den er klar til brug. Mange sprog i Sydøstasien og Afrika mangler den mængde data, der er nødvendig for at træne en pålidelig model. Forskningsholdet skal finde en måde at kompensere for denne mangel på data. Forskningsholdet skal også finde en måde at kontrollere for eventuelle racistiske, sexistiske eller anden upassende mønstre, modellen måtte have lært. Selvom forsningsholdet har anvendt et filter mod uartigt sprog, fungerer filtret primært på engelske data.

Oversættelsessystemet er endnu ikke blevet anvendt på Facebooks sociale medieplatform. Den nuværende model er kun til forskningsformål. Facebook er dog i gang med at designe lignende modeller og give dem til opgave at håndtere de ca. 20 milliarder oversættelsesanmodninger, som siden modtager hver dag.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.