Modelos e plataformas de IA

A Solução da Apple para Traduzir Línguas com Gênero

mm
Adicione Unite.AI às suas fontes preferidas no Google
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

A Apple (AAPL ) acaba de publicar um artigo, em colaboração com a USC, que explora os métodos de aprendizado de máquina utilizados para dar aos usuários do seu sistema operacional iOS18 mais opções de gênero ao traduzir.

No iOS18, os usuários podem selecionar sugestões de gênero alternativas para uma palavra traduzida no aplicativo de tradução nativo. Fonte: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

No iOS18, os usuários podem selecionar sugestões de gênero alternativas para uma palavra traduzida no aplicativo de tradução nativo. Fonte: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Embora as questões abordadas no trabalho (que a Apple anunciou aqui) sejam, em certa medida, relevantes para os debates atuais sobre definições de gênero, elas se concentram em um problema muito mais antigo: o fato de que 84 das 229 línguas conhecidas no mundo utilizam um sistema de gênero baseado no sexo.

Os pontos vermelhos indicam línguas que utilizam um sistema de gênero baseado no sexo. Fonte: https://wals.info/feature/31A#map

Os pontos vermelhos indicam línguas que utilizam um sistema de gênero baseado no sexo. Fonte: https://wals.info/feature/31A#map

Surpreendentemente, a língua inglesa cai na categoria baseada no sexo, pois atribui pronomes singulares masculinos ou femininos.

Em contraste, todas as línguas românicas (incluindo mais de meio bilhão de falantes de espanhol) – e várias outras línguas populares, como o russo – exigem concordância de gênero de maneiras que forçam os sistemas de tradução a lidar com a atribuição de sexo na linguagem.

O novo artigo ilustra isso observando todas as possíveis traduções em espanhol da frase O secretário estava zangado com o chefe:

Do novo artigo, um exemplo das possíveis atribuições de gênero na frase 'O secretário estava zangado com o chefe', traduzindo do inglês para o espanhol. Fonte: https://arxiv.org/pdf/2407.20438

Do novo artigo, um exemplo das possíveis atribuições de gênero na frase ‘O secretário estava zangado com o chefe’, traduzindo do inglês para o espanhol. Fonte: https://arxiv.org/pdf/2407.20438

A tradução ingênua está longe de ser suficiente para textos mais longos, que podem estabelecer o gênero no início (‘Ele’, ‘Ela’, etc.) e, em seguida, não se referir ao gênero novamente. No entanto, a tradução deve lembrar o gênero atribuído ao participante ao longo de todo o texto.

Isso pode ser desafiador para abordagens baseadas em tokens que lidam com traduções em pedaços discretos e correm o risco de perder o contexto de gênero ao longo da duração do conteúdo.

Pior ainda, os sistemas que fornecem traduções alternativas para atribuições de gênero tendenciosas não podem fazer isso indiscriminadamente, ou seja, substituindo apenas o substantivo de gênero, mas devem garantir que todas as outras partes da linguagem concordem com o substantivo de gênero alterado.

Neste exemplo do artigo da Apple/USC, vemos que, embora Secretário tenha sido atribuído um gênero masculino, o verbo estava foi deixado como feminino (estaba):

Substituições de gênero forçadas podem negligenciar a concordância de gênero necessária. Neste exemplo, a palavra 'enojada' deveria ser 'enojado', para concordar com o masculino 'El secretario'.

Substituições de gênero forçadas podem negligenciar a concordância de gênero necessária. Neste exemplo, a palavra ‘enojada’ deveria ser ‘enojado’, para concordar com o masculino ‘El secretario’.

Um sistema de tradução também deve lidar com as peculiaridades de línguas específicas em relação ao gênero. Como o artigo aponta, o pronome Eu é genérico em hindi, o que fornece uma pista incomum para o gênero.

Questões de Gênero

No novo artigo, intitulado Gerando Alternativas de Gênero em Tradução Automática, os pesquisadores da Apple e da USC propõem um método semisupervisionado para converter entidades ambíguas de gênero em uma matriz de alternativas de nível de entidade.

O sistema, que foi utilizado para informar a tradução do aplicativo de tradução da Apple no iOS18, constrói um esquema de linguagem tanto pela utilização de grandes modelos de linguagem (LLMs), quanto pela ajuste fino de modelos de tradução automática pré-treinados e de código aberto.

Os resultados das traduções desses sistemas foram então treinados em uma arquitetura que contém estruturas de gênero – grupos de frases que contêm diversas formas de substantivos genéricos que representam a mesma entidade.

O artigo afirma*:

‘Os vieses de gênero presentes nos dados de treinamento são conhecidos por se infiltrar nos sistemas de processamento de linguagem natural (NLP), resultando na disseminação e potencial amplificação desses vieses. Tais vieses são frequentemente também a causa raiz dos erros.

‘Um sistema de tradução automática (MT) pode, por exemplo, traduzir médico para o termo espanhol médico (masculino) em vez de médica (feminino), dado o input “O médico pediu à enfermeira que o ajudasse no procedimento”.

‘Para evitar prescrever a atribuição de gênero incorreta, os sistemas de MT precisam desambiguar o gênero por meio do contexto. Quando o gênero correto não pode ser determinado pelo contexto, fornecer múltiplas alternativas de tradução que cubram todas as escolhas de gênero válidas é uma abordagem razoável.’

A abordagem que os pesquisadores desenvolveram efetivamente transforma uma tradução de um único token em uma matriz controlada pelo usuário.

(Embora o artigo não mencione, isso abre a possibilidade, seja no Apple Translate ou em portais semelhantes que oferecem serviços de tradução, para que as escolhas do usuário sejam alimentadas em iterações posteriores do modelo)

O modelo desenvolvido pela Apple e pela USC foi avaliado nos conjuntos de teste GATE e MT-GenEval. O GATE contém frases de origem com até 3 entidades ambíguas de gênero, enquanto o MT-GenEval contém material onde o gênero não pode ser inferido, o que, segundo os autores, ajuda a entender quando alternativas de gênero não devem ser oferecidas ao usuário.

Em ambos os casos, os conjuntos de teste tiveram que ser reanotados para se alinharem com os objetivos do projeto.

Para treinar o sistema, os pesquisadores confiaram em um algoritmo de aumento de dados automático, em contraste com os conjuntos de teste mencionados, que foram anotados por humanos.

Os conjuntos de dados que contribuíram para a curação da Apple foram Europarl; WikiTitles; e WikiMatrix. O corpus foi dividido em G-Tag (com 12.000 frases), abrangendo frases com palavras-chave para todas as entidades, juntamente com uma anotação ambígua de gênero; e G-Trans (com 50.000 frases), contendo entidades ambíguas de gênero e alinhamentos de gênero.

Os autores afirmam*:

‘Até onde sabemos, este é o primeiro corpus em grande escala que contém ambiguidades de gênero e como elas afetam as formas genéricas na tradução.’

Os conjuntos de dados e os dados diversificados para o projeto foram disponibilizados no GitHub. Os dados apresentam cinco pares de línguas, comparando o inglês com o russo, alemão, francês, português e espanhol.

Os autores aproveitaram uma abordagem anterior de 2019 para dotar o modelo da capacidade de produzir alinhamentos de gênero, treinando com perda de entropia cruzada e uma perda de alinhamento adicional alinhamento.

Para a rotina de aumento de dados, os autores evitaram métodos baseados em regras tradicionais em favor de uma abordagem centrada em dados, ajustando finamente um modelo de linguagem pré-treinado BERT no conjunto de dados G-Tag.

Segunda Olhada

Para os casos em que entidades ambíguas de gênero são detectadas, a Apple e a USC exploraram dois métodos – o ajuste fino de modelos de linguagem pré-treinados e o uso de LLMs.

Quanto ao primeiro método, o artigo afirma*:

‘Ajustamos um modelo de tradução pré-treinado M em um bitext extraído do conjunto de dados G-Trans. As frases de origem deste bitext contêm entidades ambíguas marcadas como masculinas ou femininas usando tags <M>/<F>, e a tradução alvo tem inflexões de gênero corretas dadas as tags de gênero.’

Ilustração do esquema para extrair bitext do conjunto de dados G-Trans.

Ilustração do esquema para extrair bitext do conjunto de dados G-Trans.

Na imagem acima, vemos o texto ajustado na coluna do meio e a saída desejada na coluna da direita, com a lógica subjacente ilustrada acima.

Para esta abordagem, os autores utilizaram um método de reescalonamento de lattice de um trabalho anterior de 2020. Para garantir que apenas o domínio alvo (gênero) fosse abordado, uma busca de feixe restrita foi usada como um filtro.

Para a abordagem LLM, os autores desenvolveram uma estratégia que usa um LLM como um editor, reescrevendo as traduções fornecidas para fornecer atribuições de gênero.

O LLM é ativado usando um exemplo de contexto para atribuir gênero.

O LLM é ativado usando um exemplo de contexto para atribuir gênero.

Com os resultados de ambas as abordagens concatenados, o modelo foi posteriormente ajustado para classificar tokens de origem como alinhados (indicados por ‘1’ no esquema abaixo) ou não alinhados (indicados por ‘2’ abaixo).

Esquema para a concatenação dos resultados de ambas as abordagens.

Esquema para a concatenação dos resultados de ambas as abordagens.

Dados e Testes

O detector de entidades ambíguas de gênero utilizado no projeto foi desenvolvido ajustando finamente o modelo xlm-roberta-large da Facebook AI, utilizando transformadores. Para isso, o conjunto de dados G-Tag combinado foi utilizado em todos os cinco pares de línguas.

No primeiro dos dois métodos mencionados, o modelo M2M 1.2B foi treinado no Fairseq, juntamente com dados de bitext do conjunto de dados G-Trans, com inflexões de gênero fornecidas pelo Wikcionário.

Para a abordagem LLM, os autores utilizaram GPT-3.5-turbo. Para o alinhamento de estruturas de gênero, o xlm-roberta-large foi utilizado novamente, desta vez com alinhamentos de gênero extraídos do G-Trans.

Métricas para a avaliação de alternativas, estrutura (com precisão e recall), e precisão de alinhamento.

Embora as duas primeiras sejam autoexplicativas, a precisão de alinhamento mede a porcentagem de estruturas de gênero de saída que se conformam à identidade de gênero correta conhecida, e usa o método δ-BLEU, de acordo com a metodologia para o MT-GenEval.

Abaixo estão os resultados para a pipeline de aumento de dados:

Resultados dos testes da pipeline de aumento de dados. Setas para cima indicam 'maior-é-melhor', setas para baixo 'menor-é-melhor'.

Resultados dos testes da pipeline de aumento de dados. Setas para cima indicam ‘maior-é-melhor’, setas para baixo ‘menor-é-melhor’.

Aqui os autores comentam*:

‘Ambos M2M e GPT performam principalmente no mesmo nível, com a exceção de inglês-russo, onde GPT alcança uma recall de alternativas muito menor (58,7 em comparação com 89,3). A qualidade das estruturas de gênero geradas é melhor para GPT em inglês-alemão e inglês-português e melhor para M2M em inglês-espanhol e inglês-russo, como pode ser visto nas métricas de estrutura.

‘Observe que não temos nenhum dado G-Trans para inglês-italiano, então os resultados do modelo M2M e a precisão de alinhamento em inglês-italiano são puramente devido à generalização zero-shot dos modelos M2M e XLM.’

Os pesquisadores também compararam o desempenho do sistema de aumento de dados, via M2M, contra o reescritor de nível de frase do GATE, nos termos estabelecidos pelo GATE.

A pipeline de aumento de dados da Apple/USC comparada ao método de nível de frase do GATE.

A pipeline de aumento de dados da Apple/USC comparada ao método de nível de frase do GATE.

Aqui o artigo afirma*:

‘Vemos melhorias significativas no recall com um custo de degradação relativamente pequena na precisão (exceto inglês-italiano). Nosso sistema é capaz de superar o GATE na métrica F.5 proposta em todos os 3 pares de línguas.’

Finalmente, os autores treinaram modelos multilíngues ‘vanilla’ em bi-texto ‘vanilla’. Os conjuntos de dados contribuintes foram WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, e Tilde.

Dois modelos ‘vanilla’ adicionais foram treinados, um incorporando o conjunto de dados G-Trans com a tag prefixada <gênero>, que foi empregado como a linha de base supervisionada; e um terceiro, incorporando estrutura de gênero e alinhamentos (no modelo local menor, pois usar os serviços baseados em API do GPT seria muito caro para este propósito).

Os modelos foram testados contra o conjunto de dados FloRes de 2022.

Modelos de tradução automática de ponta a ponta 'vanilla' testados (P = precisão, R = recall).

Modelos de tradução automática de ponta a ponta ‘vanilla’ testados (P = precisão, R = recall).

O artigo resume esses resultados*:

‘O modelo ‘vanilla’ não pode gerar alternativas e mostra um viés enorme em direção à geração de formas masculinas (δ-BLEU variando de 5,3 a 12,5 pontos).

‘Esse viés é grandemente reduzido pela linha de base supervisionada. O modelo treinado em dados aumentados reduz ainda mais o viés e obtém o melhor desempenho em termos de métricas de alternativas, precisão de alinhamento e δ-BLEU.

‘Isso mostra a eficácia da pipeline de aumento de dados. Dados aumentados também permitem treinar um sistema competitivo para inglês-italiano, que carece de dados supervisionados.’

Os autores concluem observando que o sucesso do modelo deve ser considerado no contexto mais amplo da luta da PNL para racionalizar a atribuição de gênero em um método de tradução; e notam que isso permanece um problema aberto.

Embora os pesquisadores considerem que os resultados obtidos não alcançam plenamente o objetivo da geração de traduções neutras de gênero e/ou desambiguação de gênero, eles acreditam que o trabalho seja um ‘instrumento poderoso’ para futuras explorações em uma das áreas mais desafiadoras da tradução automática.

 

* Minha conversão das citações em linha dos autores para hiperlinks

Publicado pela primeira vez na terça-feira, 8 de outubro de 2024

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai