Взгляд Anderson
Решение Apple для перевода гендерных языков

Apple только что опубликовала статью, в сотрудничестве с USC, в которой исследуются методы машинного обучения, используемые для предоставления пользователям операционной системы iOS18 больше вариантов выбора гендера при переводе.

В iOS18 пользователи могут выбрать альтернативные предложения гендера для переведенного слова в родном приложении Translate. Источник: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
Хотя проблемы, рассматриваемые в работе (которую Apple объявила здесь), до определенной степени участвуют в текущих дебатах вокруг определений гендера, они сосредоточены на более старой проблеме: том, что 84 из 229 известных языков в мире используют систему гендера, основанную на поле.

Красные точки указывают языки, которые используют систему гендера, основанную на поле. Источник: https://wals.info/feature/31A#map
Удивительно, что английский язык попадает в категорию языков с системой гендера, основанной на поле, поскольку он присваивает мужские или женские местоимения.
Напротив, все романские языки (включая более половину миллиарда говорящих на испанском языке) – и многие другие популярные языки, такие как русский – требуют согласования гендера, что заставляет системы перевода решать проблему присвоения пола в языке.
Новая статья иллюстрирует это, наблюдая все возможные испанские переводы предложения Секретарь был зол на начальника:

Из новой статьи, пример потенциальных назначений гендера в предложении ‘Секретарь был зол на начальника’, переводящем с английского на испанский. Источник: https://arxiv.org/pdf/2407.20438
Наивный перевод далеко не достаточен для более длинных текстов, которые могут установить гендер в начале (‘Он’, ‘Она’ и т. д.) и затем не обращаться к гендеру снова. Тем не менее, перевод должен запомнить назначенный гендер участника на протяжении всего текста.
Это может быть сложно для подходов, основанных на токенах, которые решают переводы в дискретных фрагментах, и рискуют потерять контекст гендера на протяжении всего содержания.
Хуже, системы, которые предоставляют альтернативные переводы для предвзятых назначений гендера, не могут делать это бездумно, т. е. просто заменяя существительное гендера, но должны обеспечить, чтобы все другие части языка согласовывались с измененным существительным гендера.
В этом примере из статьи Apple/USC мы видим, что хотя Секретарь был назначен мужской гендер,singular прошедшее время был было оставлено как женское (естаба):

Брутфорсные замены гендера могут пренебрегать необходимым согласованием гендера. В этом примере слово ‘enojada’ должно быть ‘enojado’, чтобы согласовываться с мужским ‘El secretario’.
Система перевода также должна справляться с особенностями отдельных языков в отношении гендера. Как отмечает статья, местоимение я является гендерным в хинди, что предоставляет необычный намек на гендер.
Проблемы гендера
В новой статье, озаглавленной Генерация альтернатив гендера в машинном переводе, исследователи Apple и USC предлагают полу监督ный метод для преобразования неоднозначных сущностей гендера в массив альтернатив сущностей.
Система, которая была использована для информирования перевода из приложения Apple Translate в iOS18, строит схему языка как с помощью использования больших языковых моделей (LLM), так и с помощью тонкой настройки предварительно обученных открытых моделей машинного перевода.
Результаты переводов из этих систем были затем обучены в архитектуре, содержащей структуры гендера – группы фраз, содержащие разные формы гендерных существительных, представляющих одну и ту же сущность.
Статья гласит*:
‘Гендерные предубеждения, присутствующие в тренировочных данных, известны как проникающие в системы обработки естественного языка (NLP), в результате чего происходит распространение и потенциальное усиление этих предубеждений. Такие предубеждения часто также являются коренной причиной ошибок.
‘Система машинного перевода (MT) может, например, перевести доктор на испанский термин médico (мужской) вместо médica (женский), учитывая входные данные “Доктор попросил медсестру помочь ей в процедуре”.
‘Чтобы избежать неправильного назначения гендера, системы MT должны разъяснить гендер через контекст. Когда правильный гендер не может быть определен через контекст, предоставление нескольких альтернатив перевода, которые охватывают все допустимые варианты гендера, является разумным подходом.’
Подход, который исследователи разработали, фактически превращает перевод из одного токена в массив, контролируемый пользователем.
(Хотя статья не упоминает об этом, это открывает возможность, либо в Apple Translate, либо в подобных порталах, которые предлагают услуги перевода, для того, чтобы выбор пользователя был обратно связан с более поздними итерациями модели)
Модель, разработанная Apple и USC, была оценена на тестовых наборах GATE и MT-GenEval. GATE содержит исходные предложения с до 3 неоднозначных сущностей гендера, в то время как MT-GenEval содержит материал, в котором гендер не может быть выведен, что, по заявлению авторов, помогает понять, когда альтернативные варианты гендера не должны быть предложены пользователю.
В обоих случаях тестовые наборы должны были быть переаннотированы, чтобы соответствовать целям проекта.
Для обучения системы исследователи полагались на новый автоматический алгоритм aumentации данных, в отличие от вышеупомянутых тестовых наборов, которые были аннотированы людьми.
Вкладывающие наборы данных для кураторства Apple были Europarl; WikiTitles; и WikiMatrix. Корпус был разделен на G-Tag (с 12 000 предложениями), охватывающий предложения со главными словами для всех сущностей, вместе с аннотацией неоднозначного гендера; и G-Trans (с 50 000 предложениями), содержащий неоднозначные сущности гендера и выравнивания гендера.
Авторы утверждают*:
‘Насколько нам известно, это первый крупномасштабный корпус, содержащий неоднозначности гендера и то, как они влияют на гендерные формы в переводе.’
Наборы данных и разнообразные данные для проекта были опубликованы на GitHub. Данные содержат пять пар языков, противопоставляющих английский язык русскому, немецкому, французскому, португальскому и испанскому.
Исследователи использовали ранний подход 2019 года, чтобы наделить модель возможностью выводить выравнивания гендера, обучая с помощью перекрестной энтропии потери и дополнительной потери выравнивания.
Для алгоритма aumentации данных исследователи отказались от традиционных правил в пользу данных, центрированных подхода, тонко настраивая предварительно обученную языковую модель BERT на наборе данных G-Tag.
Второй взгляд
Для случаев, когда обнаруживаются неоднозначные сущности гендера, исследователи Apple и USC изучили два метода – тонкую настройку предварительно обученных языковых моделей и использование LLM.
В отношении первого метода статья гласит:
‘Мы тонко настраиваем предварительно обученную модель MT M на битексте, извлеченном из набора данных G-Trans. Исходные предложения этого битекста содержат неоднозначные сущности, помеченные как мужские или женские с помощью тегов <M>/<F>, и целевой перевод имеет правильные гендерные склонения, учитывая теги гендера.’

Иллюстрация схемы извлечения битекста из набора данных G-Trans.
На изображении выше мы видим тонко настроенный текст в нижней средней колонке, и желаемый вывод в правой колонке, с лежащей в основе рациональностью, проиллюстрированной выше.
Для этого подхода исследователи использовали метод пересчета решетки из более ранней работы 2020 года. Чтобы обеспечить, что только целевая область (гендер) была рассмотрена, был использован ограниченный поиск луча в качестве фильтра.
Для подхода LLM исследователи разработали стратегию, которая использует LLM в качестве редактора, переписывая предоставленные переводы для предоставления назначений гендера.

LLM запускается с помощью контекстного примера для назначения гендера.
С результатами из обоих подходов, объединенными, модель была затем тонко настроена для классификации исходных токенов как выровненных (помеченных ‘1’ в схеме ниже) или невыровненных (помеченных ‘2’ ниже).

Схема для объединения результатов из обоих подходов.
Данные и тесты
Детектор неоднозначной сущности, использованный для проекта, был разработан с помощью тонкой настройки модели xlm-roberta-large от Facebook AI, используя трансформеры. Для этого был использован объединенный набор данных G-Tag для всех пяти пар языков.
В первом из вышеупомянутых двух подходов модель M2M 1.2B была обучена на Fairseq, совместно с битекстовыми данными из набора данных G-Trans, с гендерными склонениями, предоставленными из Wiktionary.
Для подхода LLM исследователи использовали GPT-3.5-turbo. Для выравнивания структур гендера была снова использована xlm-roberta-large, на этот раз с выравниваниями гендера, извлеченными из G-Trans.
Метрики для оценки альтернатив, структуры (с точностью и полнотой), и точности выравнивания.
Хотя первые два из них являются самоочевидными, точность выравнивания измеряет процент вывода структур гендера, соответствующих известной правильной идентичности источника, и использует метод δ-BLEU, в соответствии с методологией для MT-GenEval.
Ниже приведены результаты для конвейера aumentации данных:

Результаты из тестов aumentации данных. Вверх указывающие стрелки указывают ‘выше-лучше’, вниз указывающие ‘ниже-лучше’.
Здесь исследователи комментируют*:
‘Оба M2M и GPT в основном работают на одном уровне, за исключением английского-русского, где GPT достигает намного более низкого воспоминания альтернатив (58,7 по сравнению с 89,3). Качество сгенерированных структур гендера лучше для GPT на английском-немецком и английском-португальском, и лучше для M2M на английском-испанском и английском-русском, как можно увидеть из метрик структуры.
‘Обратите внимание, что у нас нет данных G-Trans для английского-итальянского, поэтому результаты модели M2M и точность выравнивания на английском-итальянском являются чистой нулевой общей моделью моделей M2M и XLM.’
Исследователи также сравнили производительность системы aumentации данных, через M2M, с методом переписывания предложения на уровне предложения GATE, на собственных условиях GATE.

Конвейер aumentации данных Apple/USC против метода переписывания предложения на уровне предложения GATE.
Здесь статья гласит:
‘Мы видим значительные улучшения в полноте за счет относительно небольшого ухудшения точности (за исключением английского-итальянского). Наша система способна превосходить GATE на их предложенной метрике F.5 на всех трех парах языков.’
Наконец, исследователи обучили разнообразные ‘обычные’ многоязычные модели в обычный битект. Вкладывающие наборы данных были WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, и Tilde.
Две дополнительные обычные модели были обучены, одна включала набор данных G-Trans с предварительным тегом <гендер>, который был использован в качестве контроля; и третья, включала структуру гендера и выравнивания (на меньшей местной модели, поскольку использование API GPT для этой цели было бы очень дорогим).
Модели были протестированы на наборе данных FloRes 2022.

Конечные обычные модели машинного перевода, протестированные (P = точность, R = полнота).
Статья суммирует эти результаты:
‘Обычная модель не может генерировать альтернативы и показывает огромную предвзятость к генерации мужских форм (δ-BLEU варьируется от 5,3 до 12,5 баллов).
‘Эта предвзятость значительно снижается контролем. Модель, обученная на aumentированных данных, еще больше снижает предвзятость и достигает лучшей производительности в терминах метрик альтернатив, точности выравнивания и δ-BLEU.
‘Это показывает эффективность конвейера aumentации данных. Aumentированные данные также позволяют нам обучить конкурентоспособную систему для английского-итальянского, который не имеет контроля.’
Исследователи заключают, отметив, что успех модели должен быть рассмотрен в более широком контексте борьбы NLP с рационализацией назначения гендера в методе перевода; и они отмечают, что это остается открытой проблемой.
Хотя исследователи считают, что результаты, полученные, не полностью достигают цели генерации переводов на уровне сущности, нейтральных по гендеру и/или разъясняющих гендер, они считают, что работа является ‘мощным инструментом’ для будущих исследований в одной из самых сложных областей машинного перевода.
* Мое преобразование внутренних цитат авторов в гиперссылки
Опубликовано впервые во вторник, 8 октября 2024 года












