Модели и платформы ИИ

Facebook Создал Модель МашиNNого Перевода, Которая Может Прямо Переводить Между 100 Разными Языками

mm
Добавьте Unite.AI в избранные источники в Google

Facebook (META ) недавно разработал новую модель машинного перевода, которая может переводить текст между любой парой языков из набора из 100 языков. Хотя существуют другие системы машинного перевода, большинство других систем машинного перевода работают, переводя текст сначала на английский, а затем преобразуя текст оттуда. Как сообщает Engadget, переводчик AI Facebook работает без использования английского языка в качестве посредника и, по сообщениям, может достичь примерно 90% точности.

Тренировочные данные AI-модели Facebook состояли из примерно 7,5 миллиардов пар предложений, распределенных по 100 разным языкам. Данные были собраны из интернета с помощью серии веб-краулеров, и языки, присутствующие в собранных данных, были определены с помощью языковой модели под названием FastText. Как только данные были собраны, их пропустили через инструмент под названием LASER 2.0, чтобы извлечь смысл различных образцов предложений и сопоставить предложения на разных языках на основе их значения. LASER 2.0 был разработан Facebook и использует алгоритмы ненадзорного обучения для создания вложений. Вложения предложений содержат информацию о отношениях между различными предложениями на основе таких функций, как частота использования и близость предложений друг к другу. LASER 2.0 затем может создавать пары предложений, имеющих очень похожие значения.

Тренировочные данные не были просто сгруппированы на основе значений предложений. Языки сами были сгруппированы. Целью было создание системы, не требующей английского языка в качестве среды между двумя языками, и Анджела Фан, возглавившая проект, отметила, что многие регионы по всему миру говорят на двух языках, которые не являются английским. Инженеры Facebook провели обучение, сосредоточившись на парировании языков, которые обычно переводятся друг с друга. Были созданы четырнадцать разных языковых групп, основанных на таких переменных, как культура, лингвистические сходства и география. Например, одна из лингвистических групп, созданных исследователями, содержала наиболее распространенные языки по всей Индии, включая языки урду, тамильский, хинди и бенгали. Это было сделано для того, чтобы часто парируемые языки получали высококачественные переводы.

Метод обучения, ориентированный на языковые группы, привел к некоторым интересным результатам. Было обнаружено, что полученная модель перевода имела большую точность, чем существующие модели для определенных пар языков. Например, при переводе с английского на белорусский AI смог применить определенные закономерности, которые он выучил при переводе с русского, поскольку белорусский имеет лингвистические сходства с русским. Аналогично, усилия по переводу между испанским и португальским улучшились, поскольку испанский является вторым по распространению языком, и было большое количество тренировочных данных для этой задачи.

Существует примерно шестьдесят языков, которые система перевода еще не охватывает, и точность модели на языках с небольшим количеством тренировочных данных необходимо улучшить, прежде чем она будет готова к использованию. Многие языки в Юго-Восточной Азии и Африке не имеют необходимого объема данных для обучения надежной модели. Исследовательской команде необходимо найти способ компенсировать этот недостаток данных. Исследовательской команде также необходимо определить, как контролировать любые расистские, сексистские или другие непристойные закономерности, которые модель могла выучить. Хотя исследовательская команда использовала фильтр непристойностей, этот фильтр работает в основном на английских данных.

Система машинного перевода еще не используется на социальной платформе Facebook. Текущая модель предназначена только для исследовательских целей. Однако Facebook готовится разработать аналогичные модели и использовать их для обработки примерно 20 миллиардов запросов на перевод, которые сайт получает каждый день.

Блогер и программист с специализацией в Machine Learning и Deep Learning темах. Daniel надеется помочь другим использовать силу ИИ для социального блага.