Погляд Anderson
Рішення Apple для перекладу гендерних мов

Apple опублікувала статтю у співпраці з USC, яка досліджує методи машинного навчання, що використовуються для надання користувачам операційної системи iOS18 більшого вибору щодо гендеру під час перекладу.

У iOS18 користувачі можуть вибирати альтернативні гендерні варіанти для перекладеного слова в рідному застосунці Translate. Джерело: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
Хоча питання, які розглядаються в роботі (яку Apple оголосила тут), частково стосуються сучасних дискусій щодо визначення гендеру, вони зосереджені на набагато старішій проблемі: факті, що 84 з 229 відомих мов світу використовують гендерну систему, засновану на статі.

Червоні точки позначають мови, які використовують гендерну систему, засновану на статі. Джерело: https://wals.info/feature/31A#map
Незвично, англійська мова входить до категорії статевої, оскільки вона призначає чоловічі або жіночі однини.
Натомість, всі романські мови (включно з більше половини мільярда іспанських мовців) – і багато інших популярних мов, таких як російська – вимагають узгодження гендеру способами, які змушують системи перекладу звертатися до статевої ознаки мови.
Нова стаття ілюструє це, спостерігаючи за усіма можливими іспанськими перекладами речення Секретар був розлючений з босом:

З нової статті, приклад потенційних гендерних призначень у реченні ‘Секретар був розлючений з босом’, переклад з англійської на іспанську. Джерело: https://arxiv.org/pdf/2407.20438
Наївний переклад далеко не достатній для довших текстів, які можуть встановити гендер на початку (‘Він’, ‘Вона’ тощо) і далі не звертатися до гендеру знову. Тим не менш, переклад повинен пам’ятати призначений гендер учасника на всьому тексті.
Це може бути складним для підходів, заснованих на токенах, які звертаються до перекладів у дискретних частинах, і ризикують втратити контекст гендеру протягом всього тексту.
Гірше, системи, які надають альтернативні переклади для упереджених гендерних призначень, не можуть робити це бездумно, тобто, просто заміняючи гендерну назву, але повинні забезпечувати, щоб усі інші частини мови узгоджувалися з зміненою гендерною назвою.
У цьому прикладі з статті Apple/USC ми бачимо, що хоча Секретар був призначений чоловічим гендером, однина минулого часу був залишилася жіночою (була):

Брутфорсні гендерні заміни можуть знехтувати необхідним узгодженням гендеру. У цьому прикладі слово ‘розлючена’ повинно бути ‘розлючений’, щоб узгоджуватися з чоловічим ‘Секретарем’.
Система перекладу також повинна впоратися з особливостями окремих мов щодо гендеру. Як зазначається в статті, займенник я має гендер у гінді, що надає рідкісну підказку щодо гендеру.
Проблеми гендеру
У новій статті, озаглавленій Генерація гендерних альтернатив у машинному перекладі, дослідники Apple і USC пропонують напівнагляду метод для перетворення гендерно-амбівалентних сутностей у масив сутностей рівня альтернатив.
Система, яка була використана для інформування перекладу з застосунку Apple Translate в iOS18, будує мовну схему за допомогою великих мовних моделей (LLM) та за допомогою підлаштування попередньо натренованих відкритих моделей машинного перекладу.
Результати перекладів з цих систем були потім натреновані в архітектуру, що містить гендерні структури – групи фраз, які містять різні форми гендерно-означених іменників, що представляють одну й ту ж сутність.
Стаття зазначає*:
‘Гендерні упередження, присутні в навчальних даних, відомі тим, що проникають у системи обробки природної мови (NLP), що призводить до поширення та потенційного посилення цих упереджень. Такі упередження часто також є кореневою причиною помилок.
‘Система машинного перекладу (MT) може, наприклад, перекласти лікар на іспанську як médico (чоловічий) замість médica (жіночий), якщо вхідний текст “Лікар попросив медсестру допомогти їй у процедурі”.
‘Щоб уникнути неправильного призначення гендеру, системи MT повинні розрізняти гендер через контекст. Коли правильний гендер не може бути визначений через контекст, надання декількох перекладних альтернатив, які охоплюють усі дійсні гендерні варіанти, є розумним підходом.’
Підхід, до якого прийшли дослідники, фактично перетворює переклад з одного токена на масив, керований користувачем.
(Хоча стаття не згадує про це, це відкриває можливість, як у Apple Translate, так і в подібних порталах, які пропонують послуги перекладу, для вибору користувача, який буде повернутий у пізніші ітерації моделі)
Модель, розроблена Apple і USC, була оцінена на тестових наборах GATE і MT-GenEval. GATE містить вхідні речення з до 3 гендерно-амбівалентними сутностями, тоді як MT-GenEval містить матеріал, де гендер не може бути виведений, що, як зазначають автори, допомагає зрозуміти, коли альтернативні гендерні варіанти не повинні бути запропоновані користувачеві.
У обох випадках тестові набори мали бути повторно анотовані, щоб відповідати цілям проекту.
Для навчання системи дослідники покладалися на новий автоматичний алгоритм збільшення даних, на відміну від вищезгаданих тестових наборів, які були анотовані людьми.
Вкладові набори даних для кураторської роботи Apple були Europarl; WikiTitles; і WikiMatrix. Корпус був розділений на G-Tag (з 12 000 речень), що охоплює речення з головними словами для всіх сутностей, разом з гендерно-амбівалентною анотацією; і G-Trans (з 50 000 речень), що містить гендерно-амбівалентні сутності та гендерні узгодження.
Автори стверджують:
‘На нашу думку, це перший великомасштабний корпус, який містить гендерні амбівалентності та їхній вплив на гендерні форми у перекладі.’
Набори даних і різноманітні дані для проекту були опубліковані на GitHub. Дані містять п’ять мовних пар, протиставляючи англійську російській, німецькій, французькій, португальській та іспанській.
Дослідники використали підхід 2019 року для надання моделі можливості виводити гендерні узгодження, тренуючи з перехрестною ентропійною втратою і додатковою втратою узгодження.
Для процедури збільшення даних автори відхилили традиційні правила-орієнтовані методи на користь даних-орієнтованого підходу, підлаштувавши попередньо натреновану мовну модель BERT на наборі даних G-Tag.
Подвійний огляд
Для випадків, коли виявляються амбівалентні гендерні сутності, дослідники Apple і USC дослідили два методи – підлаштування попередньо натренованих мовних моделей і використання великих мовних моделей (LLM).
Відносно першого методу стаття зазначає:
‘Ми підлаштуємо попередньо натреновану модель MT M на бі-текст, витягнутий з набору даних G-Trans. Вхідні речення цього бі-тексту містять амбівалентні сутності, позначені як чоловічі або жіночі за допомогою тегів <M>/<F>, і цільовий переклад має правильні гендерні нахили, дані гендерними тегами.’

Ілюстрація схеми для витягування бі-тексту з набору даних G-Trans.
У зображенні вище ми бачимо підлаштований текст у нижньому середньому стовпчику, і бажаний вивід у правому стовпчику, з підлягаючою раціоналією, проілюстрована вище.
Для цього підходу дослідники використали метод переоцінки латиса з ранішої роботи 2020 року. Для забезпечення того, щоб тільки цільова область (гендер) була розглянута, був використаний обмежений пошук променем як фільтр.
Для підходу LLM дослідники розробили стратегію, яка використовує LLM як редактора, переписуючи надані переклади для надання гендерних призначень.

LLM викликається за допомогою прикладу в контексті для призначення гендеру.
З результатами обидвох підходів, сконкатенованих, модель була потім підлаштована для класифікації вхідних токенів як узгоджених (позначених ‘1’ у схемі нижче) або неузгоджених (позначених ‘2’ нижче).

Схема для конкатенації результатів обидвох підходів.
Дані та тести
Детектор амбівалентної сутності, використаний для проекту, був розроблений шляхом підлаштування моделі xlm-roberta-large від Facebook AI, використовуючи трансформери. Для цього був використаний об’єднаний набір даних G-Tag по всім п’яти мовним парам.
У першому з вищезгаданих підходів модель M2M 1.2B була натренована на Fairseq, спільно з бі-текстовими даними з набору даних G-Trans, з гендерними нахилами, наданими Вікіпедією.
Для підходу LLM дослідники використали GPT-3.5-turbo. Для узгодження гендерних структур знову була використана модель xlm-roberta-large, цього разу з гендерними узгодженнями, витягнутими з набору даних G-Trans.
Метрики для оцінки альтернатив, структури (з точністю і відгуком), і точністю узгодження.
Хоча перші два з цих є самі собою зрозумілими, точність узгодження вимірює відсоток вивідних гендерних структур, які відповідають відомій правильній ідентичності джерела, і використовує метод δ-BLEU, відповідно до методології для MT-GenEval.
Нижче наведені результати для конвеєра збільшення даних:

Результати тестів збільшення даних. Вгору спрямовані стрілки вказують на ‘більше-краще’, вниз – на ‘менше-краще’.
Тут автори коментують*:
‘Обидва M2M і GPT працюють переважно на одному рівні, за винятком англійсько-російської мови, де GPT досягає значно нижчого відгуку альтернатив (58,7 порівняно з 89,3). Якість згенерованих гендерних структур краще для GPT на англійсько-німецькій і англійсько-португальській мовах, і краще для M2M на англійсько-іспанській і англійсько-російській мовах, як можна побачити з метрик структури.
‘Примітка, що у нас немає жодних даних G-Trans для англійсько-італійської мови, тому результати моделі M2M і точність узгодження на англійсько-італійській мові є суто результатом нульової загальної здатності моделей M2M і XLM.’
Дослідники також порівняли продуктивність системи збільшення даних через M2M проти методу переписування речень рівня GATE, на власних умовах GATE.

Конвеєр збільшення даних Apple/USC проти методу переписування речень рівня GATE.
Тут стаття зазначає:
‘Ми бачимо суттєві покращення відгуку за рахунок відносно малої деградації точності (крім англійсько-італійської мови). Наша система здатна випереджати GATE на їхньому запропонованому метриці F.5 на всіх трьох мовних парах.’
Нарешті, автори натренували різноманітні ‘ванільні’ багатомовні моделі у ванільний бі-текст. Вкладові набори даних були WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, і Tilde.
Дві додаткові ванільні моделі були натреновані, одна з набором даних G-Trans з префіксом тегом <гендер>, який був використаний як базовий контроль; і третя, з гендерною структурою та узгодженнями (на меншій локальній моделі, оскільки використання API-сервісів GPT було б дуже дорого для цієї мети).
Моделі були протестовані проти набору даних FloRes 2022 року.

Енд-до-енд ванільні моделі машинного перекладу були протестовані (P = точність, R = відгук).
Стаття підсумовує ці результати:
‘Ванільна модель не може генерувати альтернативи і показує великий упередження щодо генерації чоловічих форм (δ-BLEU варіюється від 5,3 до 12,5 пунктів).
‘Це упередження суттєво знижується за допомогою базового контролю. Модель, натренована на збільшених даних, ще більше знижує упередження і досягає найкращої продуктивності за альтернативними метриками, точністю узгодження та δ-BLEU.
‘Це показує ефективність конвеєра збільшення даних. Збільшені дані також дозволяють нам натренувати конкурентоспроможну систему для англійсько-італійської мови, якої бракує навчальних даних.’
Автори завершують, зазначаючи, що успіх моделі повинен бути розглянутий у ширшому контексті боротьби NLP з раціоналізацією гендерного призначення у методі перекладу; і вони зазначають, що це залишається відкритою проблемою.
Хоча дослідники вважають, що результати, отримані, не повністю досягають мети генерації сутностей рівня гендерно-нейтральних перекладів і/або роз’яснень щодо гендеру, вони вважають роботу ‘потужним інструментом’ для майбутніх досліджень однієї з найскладніших областей машинного перекладу.
* Мій переклад інлайн-цитат авторів у гіперпосилання
Перша публікація вівторка, 8 жовтня 2024 року












