Взгляд Anderson

Высокий углеродный след немецких моделей автоматического перевода

mm
Добавьте Unite.AI в избранные источники в Google

Новые исследования углеродного следа, создаваемого моделями машинного перевода, указывают на то, что немецкий язык может быть наиболее углеродоемким популярным языком для обучения, хотя не совсем ясно, почему. Новый отчет предназначен для открытия дополнительных направлений исследований более углеродоэффективных методов обучения ИИ, в контексте растущего осознания степени, в которой системы машинного обучения потребляют электричество.

Предварительный отчет озаглавлен Ограничьте свои выбросы углекислого газа: оценка выбросов углекислого газа в машинном переводе и исходит от исследователей Индийского технологического института Манипала.

Авторы протестировали время обучения и рассчитали значения выбросов углекислого газа для различных возможных моделей перевода между языками и обнаружили ‘заметную диспропорцию’ между временем, затраченным на перевод трех наиболее углеродоемких языковых пар, и тремя наиболее углеродоэффективными моделями.

Среднее количество выбросов углекислого газа за 10 эпох обучения. Слева, результаты, полученные с помощью ConvSeq (см. ниже), справа, трансформеры. Источник: https://arxiv.org/pdf/2109.12584.pdf

Среднее количество выбросов углекислого газа за 10 эпох обучения. Слева, результаты, полученные с помощью ConvSeq (см. ниже), справа, трансформеры. Источник: https://arxiv.org/pdf/2109.12584.pdf

В отчете говорится, что наиболее ‘экологически чистыми’ языковыми парами для обучения являются английский>французский, французский>английский и, парадоксально, немецкий>английский, в то время как немецкий язык входит во все пары с наивысшим потреблением: французский>немецкий, английский>немецкий и немецкий>французский.

Сложные проценты

Результаты исследования показывают, что лексическое разнообразие ‘прямо пропорционально времени обучения для достижения достаточного уровня производительности’, и отмечают, что немецкий язык имеет наивысший балл лексического разнообразия среди трех протестированных языков, оцененный по Type-Token Ratio (TTR) – измерению размера словарного запаса на основе длины текста.

Увеличенные требования к обработке немецкого языка в моделях перевода не отражаются в исходных данных, использованных для эксперимента. На самом деле, токены немецкого языка, сгенерированные из исходных данных, имеют меньше (299445) производных токенов, чем английский (320108), и намного меньше, чем французский (335917).

Проблема, с точки зрения обработки естественного языка, заключается в том, чтобы разложить сложные немецкие слова на составные слова. Системы обработки естественного языка часто должны выполнять это для немецкого языка без каких-либо предварительных ‘разделенных’ грамматических или контекстных подсказок, которые можно найти в языках с более низкими баллами TTR, таких как английский. Этот процесс называется разделением сложных слов или деокомпозицией.

Немецкий язык имеет некоторые из самых длинных отдельных слов в мире, хотя в 2013 году он потерял официальное признание своего 65-символьного бывшего рекордсмена, который достаточно длинный, чтобы требовать своей собственной строки в этой статье:

Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz

Это слово относится к закону о делегировании контроля за этикетками говядины, но перестало существовать из-за изменения европейских правил в том году, уступив место другим популярным выражениям, таким как ‘вдова капитана пароходной компании на Дунае’ (49 символов):

Donaudampfschifffahrtsgesellschaftskapitaenswitwe

В целом, синтаксическая структура немецкого языка требует отклонения от предположений о порядке слов, лежащих в основе практик обработки естественного языка во многих западных языках, с популярной (берлинской) основой spaCY для обработки естественного языка, принявшей свой собственный родной язык в 2016 году.

Проективные сопоставления в английской и немецкой фразе демонстрируют сложные взаимосвязи между лексическими элементами в немецком языке. Источник: https://explosion.ai/blog/german-model

Проективные сопоставления в английской и немецкой фразе демонстрируют сложные взаимосвязи между лексическими элементами в немецком языке. Источник: https://explosion.ai/blog/german-model

Данные и тестирование

Для исходных данных исследователи использовали набор данных Multi30k, содержащий 30 000 образцов по французскому, немецкому и английскому языкам.

Первой из двух моделей, использованных исследователями, была нейронная сеть Facebook AI 2017 года Convolutional Sequence to Sequence (ConvSeq), которая содержит свертывающие слои, но не имеет рекуррентных единиц и вместо этого использует фильтры для получения признаков из текста. Это позволяет выполнять все операции параллельно.

Второй подход использовал архитектуру Google Transformers, также из 2017 года. Transformers использует линейные слои, механизмы внимания и нормализацию. Допустим, что исходная выпущенная модель подверглась критике за нерациональное использование углерода, с утверждениями о последующих улучшениях оспариваются.

Эксперименты были проведены на Google Colab, на Tesla K80 GPU. Языки были сравнены с помощью метрики BLEU (Bilingual Evaluation Understudy) и CodeCarbon Machine Learning Emissions Calculator. Данные были обучены в течение 10 эпох.

Результаты

Исследователи обнаружили, что это было продолжительное время обучения для немецких языковых пар, что привело к более высокому потреблению углерода. Хотя некоторые другие языковые пары, такие как английский>французский и французский>английский, имели даже более высокое потребление углерода, они обучались быстрее и легче, и эти всплески потребления были охарактеризованы исследователями как ‘относительно незначительные’ по сравнению с потреблением языковыми парами, включающими немецкий.

Анализ языковых пар по выбросам углекислого газа кодировщиком/декодировщиком.

Анализ языковых пар по выбросам углекислого газа кодировщиком/декодировщиком.

Исследователи заключили:

‘Наши результаты предоставляют четкое указание на то, что некоторые языковые пары более углеродоемкие для обучения, чем другие, тенденция, которая сохраняется в разных архитектурах.’

Они продолжают:

‘Однако остаются без ответа вопросы о том, почему существуют такие резкие различия в обучении моделей для конкретной языковой пары по сравнению с другой, и могут ли разные архитектуры быть более подходящими для этих углеродоемких языковых пар, и почему это может быть так, если это правда.’

В отчете подчеркивается, что причины диспропорции потребления углерода в разных моделях обучения не совсем ясны. Они планируют развивать эту линию исследований с языками, не основанными на латыни.

1.20pm GMT+2 – Исправлена ошибка текста.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai