Ángulo de Anderson
La solución de Apple para traducir lenguas con género

Apple acaba de publicar un artículo, en colaboración con la USC, que explora los métodos de aprendizaje automático utilizados para dar a los usuarios de su sistema operativo iOS18 más opciones sobre el género al traducir.

En iOS18, los usuarios pueden seleccionar sugerencias de género alternativas para una palabra traducida en la aplicación de traducción nativa. Fuente: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
Aunque los problemas abordados en el trabajo (que Apple ha anunciado aquí) se relacionan, en cierta medida, con debates actuales sobre definiciones de género, se centra en un problema mucho más antiguo: el hecho de que 84 de las 229 lenguas conocidas en el mundo utilizan un sistema de género basado en el sexo.

Los puntos rojos indican lenguas que utilizan un sistema de género basado en el sexo. Fuente: https://wals.info/feature/31A#map
Sorprendentemente, el idioma inglés cae en la categoría basada en el sexo, porque asigna pronombres singulares masculinos o femeninos.
Por el contrario, todas las lenguas románicas (incluyendo a más de medio billón de hablantes de español) – y múltiples lenguas populares, como el ruso – requieren acuerdo de género de maneras que obligan a los sistemas de traducción a abordar la asignación de sexo en el lenguaje.
El nuevo artículo ilustra esto observando todas las posibles traducciones al español de la oración El secretario estaba enojado con el jefe:

Del nuevo artículo, un ejemplo de las posibles asignaciones de género en la oración ‘El secretario estaba enojado con el jefe’, traduciendo del inglés al español. Fuente: https://arxiv.org/pdf/2407.20438
La traducción ingenua está lejos de ser suficiente para textos más largos, que pueden establecer el género al principio (‘Él’, ‘Ella’, etc.) y luego no referirse al género de nuevo. Sin embargo, la traducción debe recordar la asignación de género del participante en todo el texto.
Esto puede ser desafiante para los enfoques basados en tokens que abordan las traducciones en fragmentos discretos y corren el riesgo de perder el contexto de género a lo largo de la duración del contenido.
Peor aún, los sistemas que proporcionan traducciones alternativas para asignaciones de género sesgadas no pueden hacerlo indiscriminadamente, es decir, simplemente sustituyendo el sustantivo de género, sino que deben asegurarse de que todas las demás partes del lenguaje estén de acuerdo con el sustantivo de género cambiado.
En este ejemplo del artículo de Apple/USC, vemos que aunque Secretario ha sido asignado un género masculino, el verbo singular estaba ha sido dejado como femenino (estaba):

Las sustituciones de género a la fuerza pueden descuidar el acuerdo de género necesario. En este ejemplo, la palabra ‘enojada’ debería ser ‘enojado’, para estar de acuerdo con el masculino ‘El secretario’.
Un sistema de traducción también debe lidiar con las peculiaridades de lenguas particulares en cuanto al género. Como señala el artículo, el pronombre Yo es de género en hindi, lo que proporciona una pista inusual sobre el género.
Problemas de género
En el nuevo artículo, titulado Generación de alternativas de género en la traducción automática, los investigadores de Apple y la USC proponen un método semisupervisado para convertir entidades ambiguas de género en una matriz de alternativas de entidad.
El sistema, que se utilizó para informar la traducción desde la aplicación de traducción de Apple en iOS18, construye un esquema de lenguaje mediante el uso de grandes modelos de lenguaje (LLM) y la ajuste fino de modelos de traducción automática preentrenados de código abierto.
Los resultados de las traducciones de estos sistemas se entrenaron en una arquitectura que contiene estructuras de género – grupos de frases que contienen diversas formas de sustantivos de género que representan la misma entidad.
El artículo establece*:
‘Los sesgos de género presentes en los datos de entrenamiento son conocidos por filtrarse en los sistemas de procesamiento de lenguaje natural (NLP), lo que resulta en la diseminación y posible amplificación de esos sesgos. Dichos sesgos a menudo también son la causa raíz de los errores.
‘Un sistema de traducción automática (MT) podría, por ejemplo, traducir doctor al término español médico (masculino) en lugar de médica (femenino), dado el input “El doctor pidió a la enfermera que lo ayudara en el procedimiento”.
‘Para evitar prescribir una asignación de género incorrecta, los sistemas de MT necesitan desambiguar el género a través del contexto. Cuando no se puede determinar el género correcto a través del contexto, proporcionar múltiples alternativas de traducción que cubran todas las opciones de género válidas es un enfoque razonable.’
El enfoque que los investigadores llegan a efectivamente convierte una traducción de un solo token en una matriz controlada por el usuario.
(Aunque el artículo no lo menciona, esto abre la posibilidad, ya sea en Apple Translate o en portales similares que ofrecen servicios de traducción, de que las opciones del usuario se alimenten en iteraciones posteriores del modelo)
El modelo que Apple y la USC desarrollaron se evaluó en los conjuntos de prueba GATE y MT-GenEval. GATE contiene oraciones de origen con hasta 3 entidades ambiguas de género, mientras que MT-GenEval contiene material donde el género no se puede inferir, lo que, según los autores, ayuda a comprender cuándo no se deben ofrecer al usuario alternativas de género.
En ambos casos, los conjuntos de prueba tuvieron que volver a anotarse para alinearse con los objetivos del proyecto.
Para entrenar el sistema, los investigadores se basaron en un algoritmo de aumento de datos automático innovador, en contraste con los conjuntos de prueba mencionados anteriormente, que se anotaron manualmente.
Los conjuntos de datos que contribuyeron a la curación de Apple fueron Europarl; WikiTitles; y WikiMatrix. El corpus se dividió en G-Tag (con 12,000 oraciones), que abarca oraciones con palabras principales para todas las entidades, junto con una anotación ambigua de género; y G-Trans (con 50,000 oraciones), que contiene entidades ambiguas de género y alineaciones de género.
Los autores afirman:
‘Hasta donde llega nuestro conocimiento, este es el primer corpus a gran escala que contiene ambigüedades de género y cómo afectan las formas con género en la traducción.’
Los datos y los datos diversos para el proyecto se han hecho disponibles en GitHub. Los datos presentan cinco pares de lenguas, enfrentando el inglés con el ruso, el alemán, el francés, el portugués y el español.
Los autores aprovecharon un enfoque anterior de 2019 para dotar al modelo de la capacidad de producir alineaciones de género, entrenando con pérdida de entropía cruzada y una pérdida de alineación adicional.
Para la rutina de aumento de datos, los autores rechazaron los métodos tradicionales basados en reglas a favor de un enfoque centrado en los datos, ajustando finamente un modelo de lenguaje preentrenado BERT en el conjunto de datos G-Tag.
Doble toma
Para los casos en los que se detectan entidades ambiguas de género, Apple y la USC exploraron dos métodos: el ajuste fino de modelos de lenguaje preentrenados y el uso de LLM.
En cuanto al primer método, el artículo establece:
‘Ajustamos un modelo de MT preentrenado M en un bi-texto extraído del conjunto de datos G-Trans. Las oraciones de origen de este bi-texto contienen entidades ambiguas etiquetadas como masculinas o femeninas utilizando <M>/<F> etiquetas, y la traducción de destino tiene inflexiones de género correctas dadas las etiquetas de género.’

Una ilustración del esquema para extraer bi-texto del conjunto de datos G-Trans.
En la imagen anterior, vemos el texto ajustado en la columna del medio inferior, y la salida deseada en la columna de la derecha, con la razón subyacente ilustrada arriba.
Para este enfoque, los autores utilizaron un método de reevaluación de la red de un trabajo anterior de 2020. Para asegurarse de que solo se abordara el dominio de destino (género), se utilizó una búsqueda de haz restringida como filtro.
Para el enfoque de LLM, los autores diseñaron una estrategia que utiliza un LLM como editor, reescribiendo las traducciones suministradas para proporcionar asignaciones de género.

El LLM se invoca utilizando un ejemplo de contexto para asignar género.
Con los resultados de ambos enfoques concatenados, el modelo se ajustó posteriormente para clasificar tokens de origen como alineados (indicados por ‘1’ en el esquema a continuación) o no alineados (indicados por ‘2’ a continuación).

Un esquema para la concatenación de resultados de ambos enfoques.
Datos y pruebas
El detector de entidad ambigua utilizado para el proyecto se desarrolló ajustando el modelo xlm-roberta-large de Facebook AI, utilizando transformadores. Para esto, se utilizó el conjunto de datos G-Tag combinado en todos los cinco pares de lenguas.
En el primer enfoque mencionado, el modelo M2M 1.2B se entrenó en Fairseq, junto con datos de bi-texto del conjunto de datos G-Trans, con inflexiones de género proporcionadas por Wikcionario.
Para el enfoque de LLM, los autores utilizaron GPT-3.5-turbo. Para la alineación de estructuras de género, xlm-roberta-large se utilizó nuevamente, esta vez con alineaciones de género extraídas de G-Trans.
Métricas para la evaluación de alternativas, estructura (con precisión y recuerdo), y precisión de alineación.
Aunque las dos primeras son autoexplicativas, la precisión de alineación mide el porcentaje de estructuras de género de salida que se ajustan a la identidad de origen conocida, y utiliza el método δ-BLEU, de acuerdo con la metodología para MT-GenEval.
A continuación se presentan los resultados para la tubería de aumento de datos:

Resultados de las pruebas de la tubería de aumento de datos. Las flechas hacia arriba indican ‘más alto es mejor’, hacia abajo ‘más bajo es mejor’.
Aquí los autores comentan*:
‘Ambos M2M y GPT funcionan en gran medida al mismo nivel, con la excepción de inglés-ruso, donde GPT logra un recuerdo de alternativas mucho menor (58.7 en comparación con 89.3). La calidad de las estructuras de género generadas es mejor para GPT en inglés-alemán y en inglés-portugués y mejor para M2M en inglés-español y en inglés-ruso, como se puede ver en las métricas de estructura.
‘Tenga en cuenta que no tenemos datos de G-Trans para inglés-italiano, por lo que los resultados del modelo M2M y la precisión de alineación en inglés-italiano se deben únicamente a la generalización de cero disparos de los modelos M2M y XLM. ‘
Los investigadores también compararon el rendimiento del sistema de aumento de datos, a través de M2M, con el método de reescritura de género a nivel de oración de GATE, en los términos establecidos por GATE.

La tubería de aumento de datos de Apple/USC se enfrenta al método de reescritura de género a nivel de oración de GATE.
Aquí el artículo establece:
‘Vemos mejoras significativas en el recuerdo a costa de una degradación relativamente pequeña en la precisión (excepto inglés-italiano). Nuestro sistema es capaz de superar a GATE en su métrica F.5 propuesta en los tres pares de lenguas.’
Finalmente, los autores entrenaron modelos multilingües ‘vanilla’ en bi-texto ‘vanilla’. Los conjuntos de datos contribuyentes fueron WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, y Tilde.
Dos modelos ‘vanilla’ adicionales se entrenaron, uno que incorpora el conjunto de datos G-Trans con la etiqueta prefijada <género>, que se utilizó como la línea de base supervisada; y un tercero, que incorpora estructuras de género y alineaciones (en el modelo local más pequeño, ya que utilizar los servicios basados en API de GPT habría sido muy costoso para este propósito).
Los modelos se probaron contra el conjunto de datos FloRes de 2022.

Modelos de traducción automática vanilla de extremo a extremo probados (P = precisión, R = recuerdo).
El artículo resume estos resultados:
‘El modelo vanilla no puede generar alternativas y muestra un sesgo enorme hacia la generación de formas masculinas (δ-BLEU que varía de 5.3 a 12.5 puntos).
‘Este sesgo se reduce en gran medida con la línea de base supervisada. El modelo entrenado con datos aumentados reduce aún más el sesgo y obtiene el mejor rendimiento en términos de métricas de alternativas, precisión de alineación y δ-BLEU.
‘Esto muestra la efectividad de la tubería de aumento de datos. Los datos aumentados también permiten entrenar un sistema competitivo para inglés-italiano, que carece de datos supervisados.’
Los autores concluyen señalando que el éxito del modelo debe considerarse en el contexto más amplio de la lucha de NLP para racionalizar la asignación de género en un método de traducción; y señalan que esto sigue siendo un problema abierto.
Aunque los investigadores consideran que los resultados obtenidos no logran completamente el objetivo de la generación de traducciones neutras de género y/o desambiguaciones con respecto al género, creen que el trabajo es un ‘instrumento poderoso’ para futuras exploraciones en una de las áreas más desafiantes de la traducción automática.
* Mi conversión de las citas en línea de los autores a enlaces
Publicado por primera vez el martes 8 de octubre de 2024












