Ângulo de Anderson

As Insuficiências do Amazon Mechanical Turk Podem Ameaçar os Sistemas de Geração de Linguagem Natural

mm
Adicione Unite.AI às suas fontes preferidas no Google

Um novo estudo da Universidade de Massachusetts Amherst opôs professores de inglês a trabalhadores crowdsourced no Amazon Mechanical Turk na avaliação da saída de sistemas de Geração de Linguagem Natural (NLG), concluindo que padrões laxos e o ‘jogo’ de tarefas valorizadas entre os trabalhadores do AMT podem estar dificultando o desenvolvimento do setor.

O relatório chega a uma série de conclusões condenatórias sobre a extensão com que a terceirização em larga escala e barata de tarefas de avaliação de NLG abertas pode levar a resultados e algoritmos inferiores neste setor.

Os pesquisadores também compilaram uma lista de 45 trabalhos sobre geração de texto aberto onde a pesquisa fez uso do AMT, e descobriram que ‘a vasta maioria’ não relatou detalhes críticos sobre o uso do serviço de multidão da Amazon, tornando difícil reproduzir as descobertas dos trabalhos.

Trabalho em Condições de Suor

O relatório critica tanto a natureza de trabalho em condições de suor do Amazon Mechanical Turk, quanto os projetos acadêmicos (provavelmente limitados por orçamento) que estão dando ao AMT mais credibilidade ao usá-lo (e citá-lo) como um recurso de pesquisa válido e consistente. Os autores observam:

‘Embora o AMT seja uma solução conveniente e acessível, observamos que a grande variância entre os trabalhadores, a calibração pobre e as tarefas cognitivamente exigentes podem levar os pesquisadores a tirar conclusões científicas enganosas (por exemplo, que o texto escrito por humanos é “pior” do que o do GPT-2′).’

O relatório culpa o sistema e não os jogadores, com os pesquisadores observando:

‘Os trabalhadores da multidão são frequentemente subpagos por seu trabalho, o que prejudica a qualidade da pesquisa e, mais importante, a capacidade desses trabalhadores de ganhar um salário adequado.’

O artigo, intitulado Os Perigos de Usar o Mechanical Turk para Avaliar a Geração de Texto Aberto, conclui ainda que ‘avaliadores especializados’ como professores de língua e linguistas devem ser usados para avaliar o conteúdo de NLG artificial aberto, mesmo que o AMT seja mais barato.

Tarefas de Teste

Ao comparar o desempenho do AMT com leitores especializados menos limitados pelo tempo, os pesquisadores gastaram $144 com os serviços do AMT usados nos testes de comparação (embora muito mais tenha sido gasto em resultados ‘não utilizáveis’ – veja abaixo), exigindo que ‘turcos’ aleatórios avaliassem um dos 200 textos, divididos entre conteúdo de texto criado por humanos e texto gerado artificialmente.

Custou $187,50 para que professores profissionais fizessem o mesmo trabalho, e confirmaram seu desempenho superior (em comparação com os trabalhadores do AMT) contratando freelancers do Upwork para replicar as tarefas por um adicional de $262,50.

Cada tarefa consistia em quatro critérios de avaliação: gramática (‘Quão gramaticalmente correto é o texto do fragmento da história?’); coerência (‘Quão bem as frases do fragmento da história se encaixam?’); simpatia (‘Quão agradável você acha o fragmento da história?’); e relevância (‘Quão relevante é o fragmento da história para o prompt?’).

Gerando os Textos

Para obter material de NLG para os testes, os pesquisadores usaram o conjunto de dados de 2018 do Facebook AI Research, Geração de Histórias Neurais Hierárquica dataset, que compreende 303.358 histórias em inglês compostas por usuários no subreddit muito popular (15 milhões+ de usuários) r/writingprompts, onde as histórias dos assinantes são ‘semeadas’ por prompts de uma única frase de forma semelhante às práticas atuais em geração de texto para imagem – e, claro, em sistemas de geração de linguagem natural abertos.

200 prompts do conjunto de dados foram selecionados aleatoriamente e passados por um modelo GPT-2 de tamanho médio usando a biblioteca Hugging-Face Transformers library. Assim, dois conjuntos de resultados foram obtidos a partir dos mesmos prompts: os ensaios discursivos escritos por humanos dos usuários do Reddit e os textos gerados pelo GPT-2.

Para evitar que os mesmos trabalhadores do AMT julgassem a mesma história várias vezes, três julgamentos de trabalhadores do AMT foram solicitados por exemplo. Juntamente com experimentos sobre as capacidades de língua inglesa dos trabalhadores (veja o final do artigo) e descontando resultados de trabalhadores de baixo esforço (veja ‘Tempo Curto’ abaixo), isso aumentou o gasto total com o AMT para cerca de $1.500 USD.

Para criar um campo de jogo justo, todos os testes foram realizados em dias de semana entre 11h00-11h30 PST.

Resultados e Conclusões

O estudo abrangente cobre muito terreno, mas os principais pontos são os seguintes:

Tempo Curto

O artigo encontrou que um tempo de tarefa médio relatado oficialmente pela Amazon de 360 segundos se resumia a um tempo de trabalho real de apenas 22 segundos, e um tempo de trabalho mediano de apenas 13 segundos – um quarto do tempo necessário pelo professor de inglês mais rápido para replicar a tarefa.

Do dia 2 do estudo: os trabalhadores individuais (em laranja) passaram muito menos tempo avaliando cada tarefa do que os professores melhor pagos, e (mais tarde) os contratantes do Upwork ainda melhor pagos. Fonte: https://arxiv.org/pdf/2109.06835.pdf

Do dia 2 do estudo: os trabalhadores individuais (em laranja) passaram muito menos tempo avaliando cada tarefa do que os professores melhor pagos, e (mais tarde) os contratantes do Upwork ainda melhor pagos. Fonte: https://arxiv.org/pdf/2109.06835.pdf

Como o AMT não impõe limite ao número de Tarefas de Inteligência Humana (HITs) que um trabalhador individual pode assumir, ‘grandes batedores’ do AMT surgiram, com (lucrativas) reputações por concluir grande número de tarefas por experimento. Para compensar as tarefas aceitas pelo mesmo trabalhador, os pesquisadores mediram o tempo entre HITs consecutivamente submetidos, comparando o início e o fim de cada HIT. Dessa forma, a falta entre o tempo de trabalho relatado pelo AMT e o tempo real gasto na tarefa ficou em foco.

Como tal trabalho não pode ser realizado nesses intervalos de tempo reduzidos, os pesquisadores tiveram que compensar por isso:

‘Como é impossível ler cuidadosamente um parágrafo de história e avaliar todas as quatro propriedades em apenas 13 segundos, medimos o impacto nas classificações médias quando filtramos os trabalhadores que passam muito pouco tempo por HIT…Especificamente, removemos julgamentos de trabalhadores cujo tempo mediano é abaixo de 40s (que é uma barra baixa), e encontramos que, em média, cerca de 42% de nossas classificações são filtradas (variando de 20%-72% em todos os experimentos).’

O artigo sustenta que o tempo de trabalho real mal relatado no AMT é ‘um grande problema’ normalmente ignorado por pesquisadores que usam os serviços.

Apoio Necessário

As descobertas sugerem ainda que os trabalhadores do AMT não podem distinguir confiavelmente entre texto escrito por humanos e texto escrito por máquina, a menos que vejam ambos os textos lado a lado, o que comprometeria efetivamente um cenário de avaliação típico (onde o leitor deve ser capaz de fazer um julgamento com base em uma única amostra de texto, ‘real’ ou gerado artificialmente).

Aceitação Casual de Texto Artificial de Baixa Qualidade

Os trabalhadores do AMT classificaram consistentemente o texto artificial de baixa qualidade baseado no GPT em igualdade com o texto de alta qualidade e coerente escrito por humanos, em contraste com os professores de inglês, que foram facilmente capazes de distinguir a diferença de qualidade.

Sem Tempo de Preparação, Zero Contexto

Entrar no estado de espírito correto para uma tarefa abstrata como a avaliação da autenticidade não vem naturalmente; os professores de inglês precisaram de 20 tarefas para calibrar seus sentidos para o ambiente de avaliação, enquanto os trabalhadores do AMT normalmente não recebem ‘tempo de orientação’ algum, reduzindo a qualidade de sua entrada.

Jogando o Sistema

O relatório afirma que o tempo total que os trabalhadores do AMT passam em tarefas individuais é inflado por trabalhadores que aceitam várias tarefas simultaneamente e executam as tarefas em diferentes guias do navegador, em vez de se concentrar em uma tarefa por duração da tarefa registrada.

País de Origem é Importante

As configurações padrão do AMT não filtram os trabalhadores por país de origem, e o relatório observa trabalho anterior indicando que os trabalhadores do AMT usam VPNs para trabalhar em torno de restrições geográficas, permitindo que falantes não nativos se apresentem como falantes nativos de inglês (em um sistema que, talvez de forma um pouco ingênua, equipara a língua materna de um trabalhador com sua localização geográfica com base no IP).

Assim, os pesquisadores reexecutaram os testes de avaliação no AMT com filtros limitando os participantes potenciais a não-países de língua inglesa, encontrando que ‘trabalhadores de países não anglófonos classificaram coerência, relevância e gramática…significativamente mais baixos do que trabalhadores idênticamente qualificados de países anglófonos’.

O relatório conclui:

‘[Avaliadores especializados] como linguistas ou professores de língua devem ser usados sempre que possível, pois já foram treinados para avaliar texto escrito, e não é muito mais caro…’.

 

Publicado em 16 de setembro de 2021Atualizado em 18 de dezembro de 2021: Adicionados tags

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai