Моделі та платформи ШІ
Facebook створив модель машинного перекладу, яка може безпосередньо перекладати між 100 різними мовами
Facebook (META ) недавно розробив нову модель машинного перекладу, яка може перекладати текст між будь-якою парою мов з набору з 100 мов. Хоча інші системи машинного перекладу існують, більшість інших систем машинного перекладу працюють, перекладając текст спочатку на англійську, а потім перетворюючи текст з неї. Як повідомляє Engadget, AI-перекладач Facebook працює без використання англійської мови як посередника, і, як повідомляється, здатний досягти приблизної точності 90%.
Тренувальні дані для моделі AI Facebook складалися з близько 7,5 мільярдів пар пропозицій, розподілених по 100 різних мов. Дані були зібрані з вебу за допомогою серії веб-кравлерів, а мови, присутні в зібраних даних, були ідентифіковані за допомогою мовної моделі під назвою FastText. Після збору даних їх пройшли через інструмент під назвою LASER 2.0, щоб витягти значення різних зразків пропозицій і зіставити пропозиції різних мов на основі їх значення. LASER 2.0 був розроблений Facebook і використовує алгоритми ненавченої освіти для створення вкладень. Вкладення пропозицій містять інформацію про відносини між різними пропозиціями на основі функцій, таких як частота використання та те, як близько пропозиції знаходяться одна від одної. LASER 2.0 потім може створювати пари пропозицій, які мають високо схожі значення.
Тренувальні дані не тільки були зіставлені на основі значень пропозицій. Мови самі були згруповані. Метою було розробити систему, яка не потребувала б англійської мови як засобу між двома мовами, з тим, що Анджела Фан, яка очолювала проєкт, відзначила, що багато регіонів по всьому світу говорять двома мовами, які не є англійською. Інженери Facebook провели навчання, зосередившись на зіставленні мов, які часто перекладаються один на одного. Було створено чотирнадцять різних мовних груп на основі таких змінних, як культура, лінгвістична схожість та географія. Наприклад, одна з лінгвістичних груп, створених дослідниками, містила найпоширеніші мови в Індії, до яких належать мови урду, тамільська, гінді та бенгальська. Це було зроблено для того, щоб часто зіставлені мови отримували високоякісні переклади.
Метод навчання, зосереджений на мовних групах, привів до деяких цікавих результатів. Було виявлено, що отримана модель перекладу мала більшу точність, ніж існуючі моделі для певних пар мов. Наприклад, переклад з англійської на білоруську мову штучний інтелект був能够 застосувати певні закономірності, які він вивчив під час перекладу російської мови, оскільки білоруська мова має лінгвістичну схожість з російською. Аналогічно, переклад з іспанської на португальську мови покращився, оскільки іспанська мова є другою за поширеністю мовою, і було достатньо великий обсяг тренувальних даних для цього завдання.
Є близько шістдесяти мов, яких система перекладу ще не покриває, і точність моделі на мовах без великого обсягу тренувальних даних потрібно покращити, перш ніж вона буде готова до використання. Багато мов у Південно-Східній Азії та Африці не мають обсягу даних, необхідного для навчання надійної моделі. Команда дослідників повинна визначити спосіб компенсації цього дефіциту даних. Команда дослідників також повинна визначити, як контролювати будь-які расистські, сексистські або інші непристойні закономірності, які модель могла б вивчити. Хоча команда дослідників використала фільтр непристойностей, цей фільтр працює в основному на англійських даних.
Система машинного перекладу ще не була використана на соціальній платформі Facebook. Поточна модель призначена лише для дослідницьких цілей. Однак Facebook готується розробити подібні моделі та використовувати їх для обробки приблизно 20 мільярдів запитів на переклад, які сайт отримує щодня.












