Лідери думок
Вплив трансформерів: чи вирішена проблема машинного перекладу?
Google недавно оголосив про випуск 110 нових мов на Google Translate у рамках ініціативи 1000 мов, запущеної у 2022 році. У 2022 році на початку вони додали 24 мови. З останніми 110 мовами тепер їх 243 мови. Ця швидка експансія стала можливою завдяки Zero-Shot Machine Translation, технології, в якій моделі машинного навчання вчаться перекладати на іншу мову без попередніх прикладів. Але в майбутньому ми побачимо разом, чи це вдосконалення може бути остаточним рішенням проблеми машинного перекладу, а поки що ми можемо дослідити, як це може статися. Але спочатку його історія.
Як було раніше?
Статистичний машинний переклад (SMT)
Це був оригінальний метод, який використовував Google Translate. Він базувався на статистичних моделях. Вони аналізували великі паралельні корпуси, колекції вирівнених перекладів речень, щоб визначити найбільш імовірні переклади. Спочатку система перекладала текст англійською мовою як проміжний крок перед перекладом на цільову мову, і їй потрібно було перехрестно посилатися на фрази з великими наборами даних з трансکریптів Організації Об’єднаних Націй та Європейського парламенту. Це відрізнялося від традиційних підходів, які вимагали складання вичерпних граматичних правил. А статистичний підхід дозволяв йому адаптуватися та навчатися на даних без залежності від статичних лінгвістичних рамок, які могли швидко ставати зовсім непотрібними.
Але є деякі недоліки цього підходу. Спочатку Google Translate використовував фразовий переклад, де система розбивала речення на фрази та перекладала їх окремо. Це було покращенням над перекладом слово за словом, але все ж таки мало обмеження, такі як незручна фразеологія та помилки контексту. Це просто не повністю розуміло нюанси, як ми. Також SMT сильно залежить від наявності паралельних корпусів, і будь-яка відносно рідкісна мова буде важко перекладена, оскільки вона не має достатньо паралельних даних.
Нейронний машинний переклад (NMT)
У 2016 році Google перейшов на Нейронний машинний переклад. Він використовує глибокі моделі навчання для перекладу цілих речень як цілісної одиниці та одночасно, надаючи більш плавні та точні переклади. NMT працює подібно до того, як у вас є складний багатомовний асистент у вашому комп’ютері. Використовуючи архітектуру послідовності до послідовності (seq2seq), NMT обробляє речення в одній мові, щоб зрозуміти його значення. Потім – генерує відповідне речення в іншій мові. Цей метод використовує величезні набори даних для навчання, на відміну від статистичного машинного перекладу, який базувався на статистичних моделях, що аналізують великі паралельні корпуси, щоб визначити найбільш імовірні переклади. На відміну від SMT, який зосереджувався на фразовому перекладі та потребував багато ручної праці для розробки та підтримки лінгвістичних правил та словників, сила NMT обробляти цілі послідовності слів дозволяє йому краще захопити нюанси контексту мови. Отже, він покращив якість перекладу для різних мовних пар, часто досягаючи рівнів плавності та точності, порівнянних з людськими перекладачами.
Насправді традиційні моделі NMT використовували рекурентні нейронні мережі – РНН – як основну архітектуру, оскільки вони призначені для обробки послідовних даних шляхом підтримки прихованого стану, який еволюціонує при обробці кожного нового входу (слова або токена). Цей прихований стан служить певним видом пам’яті, яка захоплює контекст попередніх входів, дозволяючи моделі вивчати залежності з часом. Але РНН були обчислювально дорогими та важкими для ефективної паралелізації, що обмежувало їх масштабованість.
Введення трансформерів
У 2017 році Google Research опублікував статтю під назвою “Увага – це все, що вам потрібно,” введення трансформерів у світ і позначення зворотного повороту від РНН у нейронній мережевій архітектурі.
Трансформери залежать лише від механізму уваги, – самої уваги, яка дозволяє моделям машинного перекладу вибірково зосереджуватися на найбільш критичних частинах вхідних послідовностей. На відміну від РНН, які обробляють слова в послідовності в реченні, сама увага оцінює кожен токен у всьому тексті, визначаючи, які інші токени важливі для розуміння його контексту. Ця одночасна обчислення всіх слів дозволяє трансформерам ефективно захоплювати як короткі, так і довгі залежності без залежності від рекурентних з’єднань або конволюційних фільтрів.
Отже, ліквідуючи рекурентність, трансформери пропонують кілька ключових переваг:
- Паралелізованість: Механізми уваги можуть обчислюватися паралельно по різних сегментах послідовності, що прискорює навчання на сучасному обладнанні, такому як GPU.
- Ефективність навчання: Вони також вимагають значно менше часу навчання порівняно з традиційними моделями, заснованими на РНН або CNN, надаючи кращу продуктивність у завданнях, таких як машинний переклад.
Zero-Shot Machine Translation і PaLM 2
У 2022 році Google випустив підтримку 24 нових мов за допомогою Zero-Shot Machine Translation, позначивши значний рубіж у технології машинного перекладу. Вони також оголосили про ініціативу 1000 мов, спрямовану на підтримку 1000 найпоширеніших мов світу. Тепер вони випустили 110 додаткових мов. Zero-Shot Machine Translation дозволяє переклад без паралельних даних між мовами джерела та цільовими мовами, ліквідуючи необхідність створення навчальних даних для кожної мовної пари — процесу, який раніше був дорогим і трудомістким, а для деяких мов також неможливим.
Цей прогрес став можливим завдяки архітектурі та механізмам уваги трансформерів. Спроможність моделі трансформера вивчати контекстні відносини між мовами, в поєднанні з її масштабованістю для обробки кількох мов одночасно, дозволила розробити більш ефективні та ефективні багатомовні системи перекладу. Однак моделі з нульовим зйомом загалом показують нижчу якість, ніж ті, які навчаються на паралельних даних.
Потім, спираючись на прогрес трансформерів, Google представив PaLM 2 у 2023 році, який відкрив шлях для випуску 110 нових мов у 2024 році. PaLM 2 суттєво покращив здатність Translate вивчати близькі мови, такі як авадхі та марварі (пов’язані з гінді) та французькі креольські мови, такі як сейшельська та маврикійська креольська мова. Покращення в PaLM 2, такі як оптимальне масштабування, покращені набори даних та вдосконалена конструкція, дозволили більш ефективне вивчення мов та підтримали зусилля Google щодо поліпшення мовної підтримки та розширення лінгвістичних нюансів.
Чи можна стверджувати, що проблема машинного перекладу була повністю вирішена з трансформерами?
Еволюція, про яку ми говоримо, зайняла 18 років з моменту прийняття Google SMT до недавніх 110 додаткових мов за допомогою Zero-Shot Machine Translation. Це представляє великий стрибок, який потенційно може зменшити потребу у великих паралельних корпусах — історично та дуже трудомісткому завданні, яке галузь переслідувала понад два десятиліття. Але стверджувати, що машинний переклад повністю вирішено, було б передчасним, враховуючи як технічні, так і етичні міркування.
Поточні моделі все ще борються з контекстом та узгодженням і роблять тонкі помилки, які можуть змінити значення, яке ви мали на увазі для тексту. Ці питання дуже присутні в довгих, складних реченнях, де потрібно підтримувати логічний потік та розуміти нюанси для отримання результатів. Також культурні нюанси та ідіоматичні вирази часто втрачаються або втрачають значення, викликаючи переклади, які можуть бути граматично правильними, але не мають бажаного впливу або звучать неприродньо.
Дані для попереднього навчання: PaLM 2 та подібні моделі попередньо навчаються на різноманітному багатомовному текстовому корпусі, перевершуючи свого попередника PaLM. Це покращення дозволяє PaLM 2 excelize в багатомовних завданнях, підкреслюючи продовжуючу важливість традиційних наборів даних для покращення якості перекладу.
Домен-специфічні або рідкісні мови: У спеціалізованих галузях, таких як юридична, медична чи технічна сфера, паралельні корпуси забезпечують, щоб моделі зустрічалися з конкретними термінологіями та лінгвістичними нюансами. Розвинуті моделі можуть боротися з домен-специфічним жаргоном або еволюціонуючими мовними тенденціями, що становить виклик для Zero-Shot Machine Translation. Також мови з низькими ресурсами все ще перекладаються погано, оскільки їм бракує даних, необхідних для навчання точних моделей
Бенчмаркінг: Паралельні корпуси залишаються важливими для оцінки та бенчмаркінгу продуктивності моделей перекладу, особливо складного для мов, які не мають достатньо паралельних даних. Автоматичні метрики, такі як BLEU, BLERT і METEOR, мають обмеження щодо оцінки нюансів якості перекладу, окрім граматики. Але тоді ми, люди, обмежені своїми упередженнями. Також не багато кваліфікованих оцінювачів, і знаходження ідеального двомовного оцінювача для кожної пари мов, щоб впіймати тонкі помилки.
Ресурсоємність: Ресурсоємна природа навчання та розгортання великих мовних моделей залишається бар’єром, обмежуючи доступність для деяких застосунків або організацій.
Культурна збереження. Етичний вимір глибокий. Як описує_ZERO-Shot Machine Translation Ісаак Касвелл, науковець-дослідник Google Translate: “Ви можете подумати про це як про поліглота, який знає багато мов. Але потім додатково він бачить текст на 1000 більше мов, який не перекладений. Ви можете уявити, якщо ви великий поліглот, і потім ви просто починаєте читати романи в іншій мові, ви можете почати складати, що це може означати на основі вашого знання мови в цілому”. Однак важливо враховувати довгостроковий вплив на меншини мов, які не мають паралельних корпусів, потенційно впливаючи на культурне збереження, коли залежність від мов самих себе зменшується.












