Modele i platformy AI

Facebook Tworzy Model Tłumaczenia Maszynowego, Który Może Bezpośrednio Tłumaczyć Między 100 Różnymi Językami

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Facebook (META ) niedawno opracował nowy model tłumaczenia maszynowego, który może tłumaczyć tekst między dowolną parą języków spośród 100 języków. Podczas gdy inne systemy tłumaczenia maszynowego istnieją, większość innych systemów tłumaczenia AI działa poprzez najpierw tłumaczenie tekstu na język angielski, a następnie konwertowanie tekstu z tego języka. Jak donosi Engadget, tłumacz AI Facebooka działa bez użycia języka angielskiego jako pośrednika i jest w stanie osiągnąć około 90% dokładności.

Dane szkoleniowe dla modelu AI Facebooka składały się z około 7,5 miliarda par zdań, rozłożonych na 100 różnych języków. Dane zostały zebrane z internetu przy użyciu serii爬虫, a języki obecne w zebranych danych zostały zidentyfikowane przy użyciu modelu językowego o nazwie FastText. Po zebraniu danych przeszły one przez narzędzie o nazwie LASER 2.0, aby wydobyć znaczenie różnych próbek zdań i dopasować zdania w różnych językach na podstawie ich znaczenia. LASER 2.0 został opracowany przez Facebooka i wykorzystuje algorytmy unsupervised learning do tworzenia wektorów. Wektory zdań zawierają informacje o relacjach między różnymi zdania na podstawie cech takich jak częstotliwość użycia i jak blisko zdania występują względem siebie. LASER 2.0 jest w stanie tworzyć pary zdań o bardzo podobnym znaczeniu.

Dane szkoleniowe nie były tylko łączone na podstawie znaczenia zdań. Same języki były grupowane razem. Celem było stworzenie systemu, który nie wymagałby użycia języka angielskiego jako pośrednika między dwoma językami, z uwagi na to, że wiele regionów na świecie mówi dwoma językami, które nie są angielskim. Inżynierowie Facebooka przeprowadzili szkolenie, koncentrując się na łączeniu języków, które są często tłumaczone na siebie nawzajem. Stworzono czternaście różnych grup językowych, opartych na zmiennych takich jak kultura, podobieństwa językowe i geografia. Przykładowo, jedna z grup językowych stworzonych przez badaczy zawierała najczęstsze języki w Indiach, w tym urdu, tamilski, hindi i bengalski. Zrobiono to, aby pary języków, które są często łączone, otrzymały wysokiej jakości tłumaczenia.

Metoda szkolenia skupiona na grupach językowych doprowadziła do interesujących wyników. Okazało się, że wynikowy model tłumaczenia miał większą dokładność niż obecnie istniejące modele dla pewnych par językowych. Przykładowo, przy tłumaczeniu z języka angielskiego na białoruski, AI był w stanie zastosować pewne wzorce, które nauczył się podczas tłumaczenia z języka rosyjskiego, ponieważ białoruski ma podobieństwa językowe z rosyjskim. Podobnie, wysiłki tłumaczeniowe między hiszpańskim a portugalskim poprawiły się, ponieważ hiszpański jest drugim najczęściej używanym językiem i było dużej objętości danych szkoleniowych do tego zadania.

Istnieje około sześćdziesięciu języków, których system tłumaczenia jeszcze nie obejmuje, a dokładność modelu na językach bez dużej ilości danych szkoleniowych musi zostać poprawiona, zanim będzie gotowy do użycia. Wiele języków w południowo-wschodniej Azji i Afryce nie ma wystarczającej ilości danych, aby trenować niezawodny model. Zespół badawczy musi znaleźć sposób, aby zrekompensować ten brak danych. Zespół badawczy musi również określić, jak kontrolować wszelkie rasistowskie, seksistowskie lub inne nieprzyzwoite wzorce, które model mógł nauczyć się. Chociaż zespół badawczy użył filtra przeciwko wulgaryzmom, filtr działa głównie na danych w języku angielskim.

System tłumaczenia maszynowego nie został jeszcze zastosowany na platformie społecznościowej Facebooka. Obecny model jest tylko do celów badawczych. Jednak Facebook przygotowuje się do stworzenia podobnych modeli i obsługi około 20 miliardów żądań tłumaczeń, które strona otrzymuje każdego dnia.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.