AI-modeller och plattformar
Facebook Skapar Maskinöversättningsmodell Som Kan Översätta Direkt Mellan 100 Olika Språk
Facebook (META ) har nyligen utvecklat en ny maskinöversättningsmodell som kan översätta text mellan valfri språkpar av ett urval på 100 språk. Medan andra maskinöversättningsystem finns, fungerar de flesta andra AI-översättningssystem genom att först översätta texten till engelska och sedan konvertera texten därifrån. Som Engadget rapporterade, fungerar Facebooks AI-översättare utan att använda engelska som mellanhand och kan uppnå cirka 90 procents noggrannhet.
Facebooks träningsdata för AI-modellen bestod av cirka 7,5 miljarder par meningar, fördelade på 100 olika språk. Datat samlades in från webben med hjälp av en serie webbcrawler och språken i det insamlade datat identifierades med hjälp av en språkmodell som kallas FastText. När datat väl var insamlat kördes det genom ett verktyg som kallas LASER 2.0 för att extrahera meningarna i de olika meningsproverna och matcha meningar i olika språk baserat på deras mening. LASER 2.0 utvecklades av Facebook och använder outilsynade läralgoritm för att skapa inbäddningar. Meningsinbäddningarna innehåller information om relationerna mellan olika meningar baserat på funktioner som frekvens och hur nära meningar visas i förhållande till varandra. LASER 2.0 kan sedan skapa par av meningar som har mycket liknande meningar.
Träningsdatat grupperades inte bara baserat på meningsbetydelse. Språken i sig grupperades också. Målet var att utforma ett system som inte krävde engelska som medium mellan två språk, med Facebooks Angela Fan, som ledde projektet, noterade att många regioner runt om i världen talar två språk som inte är engelska. Facebooks ingenjörer genomförde utbildning genom att fokusera på att para språk som ofta översätts till och från varandra. Fjorton olika språkgrupper skapades, baserat på variabler som kultur, språkliga likheter och geografi. Till exempel innehöll en av de språkliga grupper som forskarna skapade de vanligaste språken i Indien, som inkluderar språken urdu, tamil, hindi och bengali. Detta gjordes så att vanligt parade språk skulle få högkvalitativa översättningar.
Den språkgruppsinriktade utbildningsmetoden ledde till vissa intressanta resultat. Det visade sig att den resulterande översättningsmodellen hade större noggrannhet än befintliga modeller för vissa språkpar. När man till exempel översatte från engelska till vitrysk kunde AI tillämpa vissa mönster som den hade lärt sig när den översatte ryska, eftersom vitrysk har språkliga likheter med ryska. På samma sätt förbättrades översättningsförsöken mellan spanska och portugisiska, eftersom spanska är det näst mest talade språket och det fanns en betydande volym träningsdata för uppgiften.
Det finns cirka sextio språk som översättningssystemet ännu inte täcker, och modellens noggrannhet för språk utan mycket träningsdata måste förbättras innan den är redo för användning. Många språk i Sydostasien och Afrika saknar den volym av data som behövs för att träna en tillförlitlig modell. Forskningsgruppen måste bestämma ett sätt att kompensera för denna brist på data. Forskningsgruppen måste också bestämma hur man ska kontrollera eventuella rasistiska, sexistiska eller på annat sätt stötande mönster som modellen kan ha lärt sig. Medan forskningsgruppen har använt en svordomfilter, fungerar filtret främst på engelska datat.
Maskinöversättningssystemet har ännu inte använts på Facebooks sociala medieplattform. Den nuvarande modellen är för forskningsändamål endast. Men Facebook förbereder sig för att utforma liknande modeller och låta dem hantera de cirka 20 miljarder översättningsförfrågningar som webbplatsen tar emot varje dag.












