Ãngulo de Anderson
A SoluçÃĢo da Apple para Traduzir LÃnguas com GÊnero

A Apple acaba de publicar um artigo, em colaboraçÃĢo com a USC, que explora os mÃĐtodos de aprendizado de mÃĄquina utilizados para dar aos usuÃĄrios do seu sistema operacional iOS18 mais opçÃĩes de gÊnero ao traduzir.

No iOS18, os usuÃĄrios podem selecionar sugestÃĩes de gÊnero alternativas para uma palavra traduzida no aplicativo de traduçÃĢo nativo. Fonte: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
Embora as questÃĩes abordadas no trabalho (que a Apple anunciou aqui) sejam, em certa medida, relevantes para os debates atuais sobre definiçÃĩes de gÊnero, elas se concentram em um problema muito mais antigo: o fato de que 84 das 229 lÃnguas conhecidas no mundo utilizam um sistema de gÊnero baseado no sexo.

Os pontos vermelhos indicam lÃnguas que utilizam um sistema de gÊnero baseado no sexo. Fonte: https://wals.info/feature/31A#map
Surpreendentemente, a lÃngua inglesa cai na categoria baseada no sexo, pois atribui pronomes singulares masculinos ou femininos.
Em contraste, todas as lÃnguas romÃĒnicas (incluindo mais de meio bilhÃĢo de falantes de espanhol) â e vÃĄrias outras lÃnguas populares, como o russo â exigem concordÃĒncia de gÊnero de maneiras que forçam os sistemas de traduçÃĢo a lidar com a atribuiçÃĢo de sexo na linguagem.
O novo artigo ilustra isso observando todas as possÃveis traduçÃĩes em espanhol da frase O secretÃĄrio estava zangado com o chefe:

Do novo artigo, um exemplo das possÃveis atribuiçÃĩes de gÊnero na frase âO secretÃĄrio estava zangado com o chefeâ, traduzindo do inglÊs para o espanhol. Fonte: https://arxiv.org/pdf/2407.20438
A traduçÃĢo ingÊnua estÃĄ longe de ser suficiente para textos mais longos, que podem estabelecer o gÊnero no inÃcio (âEleâ, âElaâ, etc.) e, em seguida, nÃĢo se referir ao gÊnero novamente. No entanto, a traduçÃĢo deve lembrar o gÊnero atribuÃdo ao participante ao longo de todo o texto.
Isso pode ser desafiador para abordagens baseadas em tokens que lidam com traduçÃĩes em pedaços discretos e correm o risco de perder o contexto de gÊnero ao longo da duraçÃĢo do conteÚdo.
Pior ainda, os sistemas que fornecem traduçÃĩes alternativas para atribuiçÃĩes de gÊnero tendenciosas nÃĢo podem fazer isso indiscriminadamente, ou seja, substituindo apenas o substantivo de gÊnero, mas devem garantir que todas as outras partes da linguagem concordem com o substantivo de gÊnero alterado.
Neste exemplo do artigo da Apple/USC, vemos que, embora SecretÃĄrio tenha sido atribuÃdo um gÊnero masculino, o verbo estava foi deixado como feminino (estaba):

SubstituiçÃĩes de gÊnero forçadas podem negligenciar a concordÃĒncia de gÊnero necessÃĄria. Neste exemplo, a palavra âenojadaâ deveria ser âenojadoâ, para concordar com o masculino âEl secretarioâ.
Um sistema de traduçÃĢo tambÃĐm deve lidar com as peculiaridades de lÃnguas especÃficas em relaçÃĢo ao gÊnero. Como o artigo aponta, o pronome Eu ÃĐ genÃĐrico em hindi, o que fornece uma pista incomum para o gÊnero.
QuestÃĩes de GÊnero
No novo artigo, intitulado Gerando Alternativas de GÊnero em TraduçÃĢo AutomÃĄtica, os pesquisadores da Apple e da USC propÃĩem um mÃĐtodo semisupervisionado para converter entidades ambÃguas de gÊnero em uma matriz de alternativas de nÃvel de entidade.
O sistema, que foi utilizado para informar a traduçÃĢo do aplicativo de traduçÃĢo da Apple no iOS18, constrÃģi um esquema de linguagem tanto pela utilizaçÃĢo de grandes modelos de linguagem (LLMs), quanto pela ajuste fino de modelos de traduçÃĢo automÃĄtica prÃĐ-treinados e de cÃģdigo aberto.
Os resultados das traduçÃĩes desses sistemas foram entÃĢo treinados em uma arquitetura que contÃĐm estruturas de gÊnero â grupos de frases que contÊm diversas formas de substantivos genÃĐricos que representam a mesma entidade.
O artigo afirma*:
âOs vieses de gÊnero presentes nos dados de treinamento sÃĢo conhecidos por se infiltrar nos sistemas de processamento de linguagem natural (NLP), resultando na disseminaçÃĢo e potencial amplificaçÃĢo desses vieses. Tais vieses sÃĢo frequentemente tambÃĐm a causa raiz dos erros.
âUm sistema de traduçÃĢo automÃĄtica (MT) pode, por exemplo, traduzir mÃĐdico para o termo espanhol mÃĐdico (masculino) em vez de mÃĐdica (feminino), dado o input âO mÃĐdico pediu à enfermeira que o ajudasse no procedimentoâ.
âPara evitar prescrever a atribuiçÃĢo de gÊnero incorreta, os sistemas de MT precisam desambiguar o gÊnero por meio do contexto. Quando o gÊnero correto nÃĢo pode ser determinado pelo contexto, fornecer mÚltiplas alternativas de traduçÃĢo que cubram todas as escolhas de gÊnero vÃĄlidas ÃĐ uma abordagem razoÃĄvel.â
A abordagem que os pesquisadores desenvolveram efetivamente transforma uma traduçÃĢo de um Único token em uma matriz controlada pelo usuÃĄrio.
(Embora o artigo nÃĢo mencione, isso abre a possibilidade, seja no Apple Translate ou em portais semelhantes que oferecem serviços de traduçÃĢo, para que as escolhas do usuÃĄrio sejam alimentadas em iteraçÃĩes posteriores do modelo)
O modelo desenvolvido pela Apple e pela USC foi avaliado nos conjuntos de teste GATE e MT-GenEval. O GATE contÃĐm frases de origem com atÃĐ 3 entidades ambÃguas de gÊnero, enquanto o MT-GenEval contÃĐm material onde o gÊnero nÃĢo pode ser inferido, o que, segundo os autores, ajuda a entender quando alternativas de gÊnero nÃĢo devem ser oferecidas ao usuÃĄrio.
Em ambos os casos, os conjuntos de teste tiveram que ser reanotados para se alinharem com os objetivos do projeto.
Para treinar o sistema, os pesquisadores confiaram em um algoritmo de aumento de dados automÃĄtico, em contraste com os conjuntos de teste mencionados, que foram anotados por humanos.
Os conjuntos de dados que contribuÃram para a curaçÃĢo da Apple foram Europarl; WikiTitles; e WikiMatrix. O corpus foi dividido em G-Tag (com 12.000 frases), abrangendo frases com palavras-chave para todas as entidades, juntamente com uma anotaçÃĢo ambÃgua de gÊnero; e G-Trans (com 50.000 frases), contendo entidades ambÃguas de gÊnero e alinhamentos de gÊnero.
Os autores afirmam*:
âAtÃĐ onde sabemos, este ÃĐ o primeiro corpus em grande escala que contÃĐm ambiguidades de gÊnero e como elas afetam as formas genÃĐricas na traduçÃĢo.â
Os conjuntos de dados e os dados diversificados para o projeto foram disponibilizados no GitHub. Os dados apresentam cinco pares de lÃnguas, comparando o inglÊs com o russo, alemÃĢo, francÊs, portuguÊs e espanhol.
Os autores aproveitaram uma abordagem anterior de 2019 para dotar o modelo da capacidade de produzir alinhamentos de gÊnero, treinando com perda de entropia cruzada e uma perda de alinhamento adicional alinhamento.
Para a rotina de aumento de dados, os autores evitaram mÃĐtodos baseados em regras tradicionais em favor de uma abordagem centrada em dados, ajustando finamente um modelo de linguagem prÃĐ-treinado BERT no conjunto de dados G-Tag.
Segunda Olhada
Para os casos em que entidades ambÃguas de gÊnero sÃĢo detectadas, a Apple e a USC exploraram dois mÃĐtodos â o ajuste fino de modelos de linguagem prÃĐ-treinados e o uso de LLMs.
Quanto ao primeiro mÃĐtodo, o artigo afirma*:
âAjustamos um modelo de traduçÃĢo prÃĐ-treinado M em um bitext extraÃdo do conjunto de dados G-Trans. As frases de origem deste bitext contÊm entidades ambÃguas marcadas como masculinas ou femininas usando tags <M>/<F>, e a traduçÃĢo alvo tem inflexÃĩes de gÊnero corretas dadas as tags de gÊnero.â

IlustraçÃĢo do esquema para extrair bitext do conjunto de dados G-Trans.
Na imagem acima, vemos o texto ajustado na coluna do meio e a saÃda desejada na coluna da direita, com a lÃģgica subjacente ilustrada acima.
Para esta abordagem, os autores utilizaram um mÃĐtodo de reescalonamento de lattice de um trabalho anterior de 2020. Para garantir que apenas o domÃnio alvo (gÊnero) fosse abordado, uma busca de feixe restrita foi usada como um filtro.
Para a abordagem LLM, os autores desenvolveram uma estratÃĐgia que usa um LLM como um editor, reescrevendo as traduçÃĩes fornecidas para fornecer atribuiçÃĩes de gÊnero.

O LLM ÃĐ ativado usando um exemplo de contexto para atribuir gÊnero.
Com os resultados de ambas as abordagens concatenados, o modelo foi posteriormente ajustado para classificar tokens de origem como alinhados (indicados por â1â no esquema abaixo) ou nÃĢo alinhados (indicados por â2â abaixo).

Esquema para a concatenaçÃĢo dos resultados de ambas as abordagens.
Dados e Testes
O detector de entidades ambÃguas de gÊnero utilizado no projeto foi desenvolvido ajustando finamente o modelo xlm-roberta-large da Facebook AI, utilizando transformadores. Para isso, o conjunto de dados G-Tag combinado foi utilizado em todos os cinco pares de lÃnguas.
No primeiro dos dois mÃĐtodos mencionados, o modelo M2M 1.2B foi treinado no Fairseq, juntamente com dados de bitext do conjunto de dados G-Trans, com inflexÃĩes de gÊnero fornecidas pelo WikcionÃĄrio.
Para a abordagem LLM, os autores utilizaram GPT-3.5-turbo. Para o alinhamento de estruturas de gÊnero, o xlm-roberta-large foi utilizado novamente, desta vez com alinhamentos de gÊnero extraÃdos do G-Trans.
MÃĐtricas para a avaliaçÃĢo de alternativas, estrutura (com precisÃĢo e recall), e precisÃĢo de alinhamento.
Embora as duas primeiras sejam autoexplicativas, a precisÃĢo de alinhamento mede a porcentagem de estruturas de gÊnero de saÃda que se conformam à identidade de gÊnero correta conhecida, e usa o mÃĐtodo Îī-BLEU, de acordo com a metodologia para o MT-GenEval.
Abaixo estÃĢo os resultados para a pipeline de aumento de dados:

Resultados dos testes da pipeline de aumento de dados. Setas para cima indicam âmaior-ÃĐ-melhorâ, setas para baixo âmenor-ÃĐ-melhorâ.
Aqui os autores comentam*:
âAmbos M2M e GPT performam principalmente no mesmo nÃvel, com a exceçÃĢo de inglÊs-russo, onde GPT alcança uma recall de alternativas muito menor (58,7 em comparaçÃĢo com 89,3). A qualidade das estruturas de gÊnero geradas ÃĐ melhor para GPT em inglÊs-alemÃĢo e inglÊs-portuguÊs e melhor para M2M em inglÊs-espanhol e inglÊs-russo, como pode ser visto nas mÃĐtricas de estrutura.
âObserve que nÃĢo temos nenhum dado G-Trans para inglÊs-italiano, entÃĢo os resultados do modelo M2M e a precisÃĢo de alinhamento em inglÊs-italiano sÃĢo puramente devido à generalizaçÃĢo zero-shot dos modelos M2M e XLM.â
Os pesquisadores tambÃĐm compararam o desempenho do sistema de aumento de dados, via M2M, contra o reescritor de nÃvel de frase do GATE, nos termos estabelecidos pelo GATE.

A pipeline de aumento de dados da Apple/USC comparada ao mÃĐtodo de nÃvel de frase do GATE.
Aqui o artigo afirma*:
âVemos melhorias significativas no recall com um custo de degradaçÃĢo relativamente pequena na precisÃĢo (exceto inglÊs-italiano). Nosso sistema ÃĐ capaz de superar o GATE na mÃĐtrica F.5 proposta em todos os 3 pares de lÃnguas.â
Finalmente, os autores treinaram modelos multilÃngues âvanillaâ em bi-texto âvanillaâ. Os conjuntos de dados contribuintes foram WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, e Tilde.
Dois modelos âvanillaâ adicionais foram treinados, um incorporando o conjunto de dados G-Trans com a tag prefixada <gÊnero>, que foi empregado como a linha de base supervisionada; e um terceiro, incorporando estrutura de gÊnero e alinhamentos (no modelo local menor, pois usar os serviços baseados em API do GPT seria muito caro para este propÃģsito).
Os modelos foram testados contra o conjunto de dados FloRes de 2022.

Modelos de traduçÃĢo automÃĄtica de ponta a ponta âvanillaâ testados (P = precisÃĢo, R = recall).
O artigo resume esses resultados*:
âO modelo âvanillaâ nÃĢo pode gerar alternativas e mostra um viÃĐs enorme em direçÃĢo à geraçÃĢo de formas masculinas (Îī-BLEU variando de 5,3 a 12,5 pontos).
âEsse viÃĐs ÃĐ grandemente reduzido pela linha de base supervisionada. O modelo treinado em dados aumentados reduz ainda mais o viÃĐs e obtÃĐm o melhor desempenho em termos de mÃĐtricas de alternativas, precisÃĢo de alinhamento e Îī-BLEU.
âIsso mostra a eficÃĄcia da pipeline de aumento de dados. Dados aumentados tambÃĐm permitem treinar um sistema competitivo para inglÊs-italiano, que carece de dados supervisionados.â
Os autores concluem observando que o sucesso do modelo deve ser considerado no contexto mais amplo da luta da PNL para racionalizar a atribuiçÃĢo de gÊnero em um mÃĐtodo de traduçÃĢo; e notam que isso permanece um problema aberto.
Embora os pesquisadores considerem que os resultados obtidos nÃĢo alcançam plenamente o objetivo da geraçÃĢo de traduçÃĩes neutras de gÊnero e/ou desambiguaçÃĢo de gÊnero, eles acreditam que o trabalho seja um âinstrumento poderosoâ para futuras exploraçÃĩes em uma das ÃĄreas mais desafiadoras da traduçÃĢo automÃĄtica.
Â
* Minha conversÃĢo das citaçÃĩes em linha dos autores para hiperlinks
Publicado pela primeira vez na terça-feira, 8 de outubro de 2024












