Modely a platformy AI

Facebook vyvinul model strojového překladu, který může přímo překládat mezi 100 různými jazyky

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Facebook (META ) nedávno vyvinul nový model strojového překladu, který může překládat text mezi libovolnou dvojicí jazyků z набoru 100 jazyků. Zatímco jiné systémy strojového překladu existují, většina ostatních systémů AI překladu funguje tak, že nejprve překládá text do angličtiny a poté převádí text z angličtiny. Jak uvádí Engadget, AI translator Facebooku funguje bez použití angličtiny jako prostředníka a je údajně schopen dosáhnout aproximativně 90% přesnosti.

Trénovací data pro AI model Facebooku se skládala z přibližně 7,5 miliard párů vět, rozložených přes 100 různých jazyků. Data byla sestavena z webu pomocí série webových procházení a jazyky přítomné ve sbíraných datech byly identifikovány pomocí jazykového modelu zvaného FastText. Jakmile byla data shromážděna, byla spuštěna pomocí nástroje LASER 2.0 pro extrakci významu různých vzorků vět a pro párování vět v různých jazycích na základě jejich významu. LASER 2.0 byl vyvinut Facebookem a využívá nesupervizované algoritmy učení pro vytváření vložených reprezentací. Vložené reprezentace vět obsahují informace o vztazích mezi různými větami na základě funkcí, jako je frekvence použití a blízkost vět. LASER 2.0 je pak schopen vytvářet páry vět, které mají velmi podobný význam.

Trénovací data nebyla pouze párována na základě významu vět. Jazyky samy byly seskupeny dohromady. Cílem bylo navrhnout systém, který by nevyžadoval angličtinu jako prostředníka mezi dvěma jazyky, s tím, že inženýři Facebooku, vedeni Angeleou Fan, která vedla projekt, poznamenali, že mnoho regionů po celém světě mluví dvěma jazyky, které nejsou angličtinou. Inženýři Facebooku provedli trénink zaměřením na párování jazyků, které jsou běžně překládané z jednoho do druhého. Bylo vytvořeno čtrnáct různých jazykových skupin, založených na proměnných, jako je kultura, lingvistické podobnosti a geografie. Jako příklad, jedna z lingvistických skupin vytvořených výzkumníky obsahovala nejčastěji používané jazyky v Indii, které zahrnují jazyky Urdu, Tamil, Hindu a Bengál. To bylo provedeno tak, aby běžně párované jazyky obdržely vysoce kvalitní překlady.

Metoda tréninku zaměřená na jazykové skupiny vedla k některým zajímavým výsledkům. Bylo zjištěno, že výsledný model překladu měl větší přesnost než目前 existující modely pro určitá párování jazyků. Při překladu z angličtiny do běloruštiny, například, byl AI schopen aplikovat určitá schémata, která se naučil při překladu ruštiny, protože běloruština má lingvistické podobnosti s ruštinou. Podobně, překladové úsilí mezi španělštinou a portugalštinou se zlepšilo, protože španělština je druhým nejčastěji mluveným jazykem a existoval dostatek trénovacích dat pro tuto úlohu.

Existuje přibližně šedesát jazyků, které překladový systém dosud nepokrývá, a přesnost modelu na jazycích bez dostatečných trénovacích dat musí být zlepšena, než bude připraven k použití. Mnoho jazyků v jihovýchodní Asii a Africe postrádá dostatek dat pro trénování spolehlivého modelu. Výzkumný tým musí určit, jak kompenzovat tento nedostatek dat. Výzkumný tým musí také určit, jak kontrolovat rasistické, sexistické nebo jiné profánní vzorce, které model mohl naučit. Ačkoli výzkumný tým využívá filtr profanit, filtr funguje主要ně na anglických datech.

Systém strojového překladu dosud nebyl nasazen na sociální platformě Facebooku. Současný model je pouze pro výzkumné účely. Nicméně, Facebook se chystá navrhnout podobné modely a nechat je zpracovat přibližně 20 miliard překladových požadavků, které stránka obdrží každý den.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.