Погляд Anderson

Високий рівень викидів вуглецю німецьких моделей автоматичного перекладу

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження рівня викидів вуглецю, створеного моделями машинного перекладу, свідчать про те, що німецька мова може бути найбільш вуглець-інтенсивною популярною мовою для навчання, хоча не зовсім зрозуміло, чому. Нова доповідь призначена для відкриття додаткових напрямків дослідження більш вуглець-еффективних методів навчання штучного інтелекту в контексті зростаючої осведомленості про те, наскільки системи машинного навчання споживають електроенергію.

Доповідь називається Обмеження викидів вуглецю: оцінка викидів вуглецю в машинному перекладі і походить від дослідників Індійського технологічного інституту Маніпала.

Автори протестували час навчання і розрахували значення викидів вуглецю для різних моделей перекладу між мовами, і виявили “помітну диспропорцію” між часом, необхідним для перекладу трьох найбільш вуглець-інтенсивних мовних пар, і трьома найбільш вуглець-економічними моделями.

Середнє значення викидів вуглецю за 10 епох навчання. Зліва, результати використання ConvSeq (див. нижче), справа, Transformers. Джерело: https://arxiv.org/pdf/2109.12584.pdf

Середнє значення викидів вуглецю за 10 епох навчання. Зліва, результати використання ConvSeq (див. нижче), справа, Transformers. Джерело: https://arxiv.org/pdf/2109.12584.pdf

Доповідь виявила, що найбільш “екологічними” мовними парами для навчання є англійська>французька, французька>англійська і, парадоксально, німецька на англійську, тоді як німецька мова фігурує у всіх найбільш споживчих парах: французька>німецька, англійська>німецька і німецька>французька.

Композитний інтерес

Результати дослідження свідчать про те, що лексична різноманітність “прямо пропорційна часу навчання для досягнення прийнятного рівня продуктивності”, і відзначають, що німецька мова має найвищий рівень лексичної різноманітності серед трьох протестованих мов, оцінений за допомогою Type-Token Ratio (TTR) – міри розміру словника на основі довжини тексту.

Збільшені вимоги обробки німецької мови в моделях перекладу не відображаються в джерельних даних, використаних для експерименту. Насправді, кількість токенів німецької мови, отриманих з джерельних даних, менша (299445), ніж кількість токенів англійської мови (320108), і значно менша, ніж кількість токенів французької мови (335917).

Виклик, з точки зору обробки природної мови (NLP), полягає в тому, щоб розбити складні німецькі слова на складові слова. Системи NLP часто повинні зробити це для німецької мови без будь-яких попередніх розбитих граматичних або контекстних підказок, які можна знайти в мовах з нижчими показниками TTR, таких як англійська. Процес називається розбиття складних слів або декомпозицією.

Німецька мова має деякі з найдовших окремих слів у світі, хоча в 2013 році вона втрачила офіційне визнання свого 65-символьного колишнього рекордсмена, який достатньо довгий, щоб зайняти окрему лінію в цій статті:

Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz

Слово означає закон про делегування моніторингу маркування яловичини, але припинило своє існування через зміну європейських регуляцій того року, поступившись місцем іншим популярним прикладам, таким як “вдова капітана пароплава на Дунаї” (49 символів):

Donaudampfschifffahrtsgesellschaftskapitaenswitwe

Загалом, синтаксична структура німецької мови вимагає відходу від припущень щодо порядку слів, що лежать в основі практик NLP багатьох західних мов, з популярним (берлінським) фреймворком spaCY, який прийняв свою рідну мову у 2016 році.

Проективні відображення англійського і німецького виразу демонструють складні взаємозв'язки між лексичними елементами німецької мови. Джерело: https://explosion.ai/blog/german-model

Проективні відображення англійського і німецького виразу демонструють складні взаємозв’язки між лексичними елементами німецької мови. Джерело: https://explosion.ai/blog/german-model

Дані та тестування

Для джерельних даних дослідники використали набір даних Multi30k, який містить 30 000 зразків французької, німецької та англійської мов.

Першою з двох моделей, використаних дослідниками, була модель Facebook AI 2017 року Convolutional Sequence to Sequence (ConvSeq), нейронна мережа, яка містить конволюційні шари, але не містить рекурентних одиниць, і замість цього використовує фільтри для отримання функцій з тексту. Це дозволяє виконувати всі операції в обчислювально ефективному паралельному порядку.

Другим підходом було використання впливової архітектури Transformers від Google, також з 2017 року. Transformers використовує лінійні шари, механізми уваги та процедури нормалізації. Без сумніву, оригінальна випущена модель піддалася критиці за вуглець-не-ефективність, з твердженнями про подальші поліпшення оспорюються.

Експерименти проводилися на Google Colab, однаково на Tesla K80 GPU. Мови порівнювалися за допомогою метрики BLEU (Білінгвальне оцінювання підручника) і CodeCarbon калькулятора викидів вуглецю машинного навчання. Дані тренувалися протягом 10 епох.

Результати

Дослідники виявили, що саме тривале навчання для німецьких мовних пар призвело до вищого рівня споживання вуглецю. Хоча деякі інші мовні пари, такі як англійська>французька і французька>англійська, мали навіть вищий рівень споживання вуглецю, вони тренувалися швидше і легше, з цими сплесками споживання характеризувалися дослідниками як “відносно незначні” у порівнянні зі споживанням мовними парами, які включають німецьку.

Аналіз мовних пар за викидами вуглецю кодера/декодера.

Аналіз мовних пар за викидами вуглецю кодера/декодера.

Дослідники висновують:

‘Наші результати свідчать про те, що деякі мовні пари більш вуглець-інтенсивні для навчання, ніж інші, тенденція, яка зберігається для різних архітектур.’

Вони продовжують:

‘Однак, залишаються без відповіді питання про те, чому існують такі різкі відмінності у навчаннях моделей для певної мовної пари над іншою, і чи можуть різні архітектури бути більш підходящими для цих вуглець-інтенсивних мовних пар, і чому це буде так, якщо це правда.’

Доповідь підкреслює, що причини розбіжностей у споживанні вуглецю між моделями навчання не зовсім зрозумілі. Вони передбачають розвиток цього напрямку дослідження з не латино-основними мовами.

1.20pm GMT+2 – Виправлено текстове повідомлення про помилку.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai