Ângulo de Anderson
São Conjuntos de Dados de IA em Hiperscale Mal Curados Piores do que a Internet em Si?

Pesquisadores da Irlanda, do Reino Unido e dos EUA alertaram que o crescimento de conjuntos de dados de treinamento de IA em hiperscale ameaça propagar os piores aspectos de suas fontes na internet, argumentando que um conjunto de dados acadêmicos recentemente lançado apresenta ‘imagens e pares de texto problemáticos e explícitos de estupro, pornografia, estereótipos malignos, insultos racistas e étnicos, e outros conteúdos extremamente problemáticos’.
Os pesquisadores acreditam que uma nova onda de conjuntos de dados multimodais (por exemplo, imagens e imagens) mal curados ou filtrados de forma inadequada são potencialmente mais prejudiciais em sua capacidade de reforçar os efeitos de tal conteúdo negativo, pois os conjuntos de dados preservam imagens e outros conteúdos que podem ter sido removidos de plataformas online por meio de reclamações de usuários, moderação local ou algoritmos.
Eles observam ainda que pode levar anos – no caso do poderoso conjunto de dados ImageNet, uma década inteira – para que reclamações sobre o conteúdo do conjunto de dados sejam atendidas, e que essas revisões posteriores nem sempre são refletidas mesmo em novos conjuntos de dados derivados deles.
O artigo, intitulado Conjuntos de dados multimodais: misoginia, pornografia e estereótipos malignos, vem de pesquisadores da University College Dublin & Lero, da Universidade de Edimburgo, e do Cientista Chefe da plataforma de autenticação UnifyID.
Embora o trabalho se concentre no lançamento recente do conjunto de dados CLIP-filtrado LAION-400M, os autores argumentam contra a tendência geral de jogar quantidades cada vez maiores de dados em estruturas de aprendizado de máquina, como o modelo de linguagem neural GPT-3, e defendem que a abordagem focada em resultados para melhor inferência (e mesmo para Inteligência Artificial Geral [AGI]) está resultando no uso ad hoc de fontes de dados prejudiciais com supervisão de direitos autorais negligente; o potencial de gerar e promover danos; e a capacidade de não apenas perpetuar dados ilegais que poderiam ter desaparecido do domínio público, mas de incorporar esses dados em implementações de IA downstream.
LAION-400M
No mês passado, o conjunto de dados LAION-400M foi lançado, acrescentando ao número crescente de conjuntos de dados linguísticos multimodais que dependem do repositório Common Crawl, que varre a internet indiscriminadamente e transfere a responsabilidade por filtragem e curação para projetos que o utilizam. O conjunto de dados derivado contém 400 milhões de pares de texto-imagem.
LAION-400M é uma variante de código aberto do conjunto de dados fechado WIT (WebImageText) da Google AI, lançado em março de 2021, e apresenta pares de texto-imagem, onde uma imagem no banco de dados foi associada a texto de acompanhamento explícito ou metadados (por exemplo, o texto alternativo de uma imagem em uma galeria de web). Isso permite que os usuários realizem recuperação de imagens baseada em texto, revelando as associações que a IA subjacente formou sobre esses domínios (por exemplo, ‘animal’, ‘bike’, ‘pessoa’, ‘homem’, ‘mulher’).
Essa relação entre imagem e texto, e a similaridade cosseno que pode incorporar viés em resultados de consulta, estão no centro do apelo do artigo por metodologias melhoradas, pois consultas muito simples ao banco de dados LAION-400M podem revelar viés.
Por exemplo, a imagem da pioneira astronauta feminina Eileen Collins na biblioteca scitkit-image recupera duas legendas associadas em LAION-400M: ‘Este é um retrato de um astronauta com a bandeira americana’ e ‘Esta é uma fotografia de uma dona de casa sorrindo em um macacão laranja com a bandeira americana’.

A astronauta americana Eileen Collins recebe duas interpretações muito diferentes sobre suas conquistas como a primeira mulher no espaço sob LAION-400M. Fonte: https://arxiv.org/pdf/2110.01963.pdf
As similaridades cossenos relatadas que tornam qualquer legenda provável de ser aplicável estão muito próximas uma da outra, e os autores argumentam que tal proximidade tornaria os sistemas de IA que usam LAION-400M relativamente propensos a apresentar qualquer um como uma legenda apropriada.
Pornografia Rises to the Top Again
LAION-400M disponibilizou uma interface de pesquisa disponível, onde desmarcar o botão ‘pesquisa segura’ revela a extensão com que imagens e associações pornográficas dominam rótulos e classes. Por exemplo, procurar por ‘freira’ (NSFW se você subsequentemente desativar o modo seguro) no banco de dados retorna resultados principalmente relacionados a horror, cosplay e fantasias, com muito poucas freiras reais disponíveis.
Desativar o Modo Seguro na mesma pesquisa revela uma série de imagens pornográficas relacionadas ao termo, que empurram qualquer imagem não pornográfica para baixo da página de resultados da pesquisa, revelando a extensão com que LAION-400M atribuiu maior peso às imagens pornográficas, porque elas são prevalentes para o termo ‘freira’ em fontes online.
O modo seguro ativado por padrão na interface de pesquisa online é enganoso, pois representa um recurso da interface do usuário, um filtro que não apenas não será necessariamente ativado em sistemas de IA derivados, mas que foi generalizado para o domínio ‘freira’ de uma maneira que não é facilmente filtrada ou distinguida dos resultados (relativamente) SFW em termos de uso algorítmico.
O artigo apresenta exemplos embaçados em vários termos de pesquisa nos materiais suplementares no final. Eles não podem ser apresentados aqui devido à linguagem no texto que acompanha as fotos embaçadas, mas os pesquisadores observam o custo que examinar e embaçar as imagens teve sobre eles, e reconhecem o desafio de curar tal material para supervisão humana de bancos de dados em larga escala:
‘Nós (assim como nossos colegas que nos ajudaram) experimentamos vários níveis de desconforto, náusea e dor de cabeça durante o processo de sondagem do conjunto de dados. Além disso, esse tipo de trabalho encontra críticas negativas significativas em toda a esfera acadêmica de IA após o lançamento, o que não apenas adiciona um ônus emocional adicional à tarefa já pesada de estudar e analisar esses conjuntos de dados, mas também desencoraja trabalhos semelhantes no futuro, muito para o detrimento do campo de IA e da sociedade em geral.’
Os pesquisadores argumentam que, embora a curação com humanos no loop seja cara e tenha custos pessoais associados, os sistemas de filtragem automatizados projetados para remover ou abordar tal material claramente não são adequados para a tarefa, pois os sistemas de PLN têm dificuldade em isolar ou descontar material ofensivo que pode dominar um conjunto de dados raspado e, subsequentemente, ser percebido como significativo devido ao volume.
Enshrining Banned Content and Stripping Copyright Protections
O artigo argumenta que conjuntos de dados mal curados dessa natureza são ‘altamente prováveis’ de perpetuar a exploração de indivíduos minoritários e abordam se projetos de dados de código aberto semelhantes têm o direito, legal ou moralmente, de transferir a responsabilidade pelo material para o usuário final:
‘Os indivíduos podem excluir seus dados de um site e supor que eles desaparecerão para sempre, enquanto eles ainda podem existir nos servidores de várias organizações e pesquisadores. Há uma questão sobre quem é responsável por remover esses dados do uso no conjunto de dados? Para LAION-400M, os criadores delegaram essa tarefa ao usuário do conjunto de dados. Dada a complexidade desses processos e que o usuário médio carece do conhecimento técnico para remover seus dados, é essa uma abordagem razoável?’
Eles argumentam ainda que LAION-400M pode não ser adequado para lançamento sob o modelo de licença Creative Common CC-BY 4.0 adotado, apesar dos benefícios potenciais para a democratização de conjuntos de dados em larga escala, anteriormente o domínio exclusivo de empresas bem financiadas como Google e OpenAI.

O domínio LAION-400M afirma que as imagens do conjunto de dados ‘estão sob seu próprio direito autoral’ – um mecanismo ‘pass-through’ amplamente habilitado por decisões judiciais e diretrizes governamentais nos últimos anos que aprovam amplamente a raspagem de web para fins de pesquisa. Fonte: https://rom1504.github.io/clip-retrieval/
Os autores sugerem que voluntários de base (ou seja, voluntários de código aberto) poderiam abordar alguns dos problemas do conjunto de dados, e que os pesquisadores poderiam desenvolver técnicas de filtragem melhoradas.
‘No entanto, os direitos do sujeito dos dados permanecem sem resposta aqui. É temerário e perigoso subestimar os danos inerentes a conjuntos de dados em larga escala e encorajar seu uso em ambientes industriais e comerciais. A responsabilidade do esquema de licença sob o qual o conjunto de dados é fornecido recai exclusivamente no criador do conjunto de dados’.
The Problems of Democratizing Hyperscale Data
O artigo argumenta que conjuntos de dados visio-linguísticos como LAION-400M eram anteriormente indisponíveis fora de empresas de tecnologia e das instituições de pesquisa limitadas que possuem os recursos para coletar, curar e processá-los. Eles saúdam o espírito do novo lançamento, enquanto criticam sua execução.
Os autores argumentam que a definição aceita de ‘democratização’, como se aplica a conjuntos de dados de código aberto em hiperscale, é muito limitada e ‘falha em considerar os direitos, o bem-estar e os interesses de indivíduos e comunidades vulneráveis, muitos dos quais provavelmente sofrerão mais com os impactos downstream desse conjunto de dados e dos modelos treinados nele’.
Já que o desenvolvimento de modelos de código aberto em escala GPT-3 é projetado para ser disseminado a milhões (e, por procuração, possivelmente bilhões) de usuários em todo o mundo, e já que projetos de pesquisa podem adotar conjuntos de dados antes que eles sejam subsequentemente editados ou até mesmo removidos, perpetuando quaisquer problemas que foram projetados para serem abordados nas modificações, os autores argumentam que lançamentos descuidados de conjuntos de dados mal curados não devem se tornar uma característica habitual em aprendizado de máquina de código aberto.
Putting the Genie Back in the Bottle
Alguns conjuntos de dados que foram suprimidos muito tempo após seu conteúdo ter passado, talvez inextricavelmente, para projetos de IA de longo prazo, incluíram o conjunto de dados Duke MTMC (Multi-Target, Multi-Camera), que foi retirado devido a reclamações repetidas de organizações de direitos humanos sobre seu uso por autoridades repressivas na China; Microsoft Celeb (MS-Celeb-1M), um conjunto de dados de 10 milhões de imagens de ‘celebridades’ que se revelou incluir jornalistas, ativistas, formuladores de políticas e escritores, cuja exposição de dados biométricos no lançamento foi fortemente criticada; e o conjunto de dados Tiny Images, retirado em 2020 por ‘vieses, imagens ofensivas e preconceituosas, e terminologia pejorativa’.
Com relação a conjuntos de dados que foram emendados em vez de retirados após críticas, exemplos incluem o conjunto de dados ImageNet extremamente popular, que, os pesquisadores observam, levou dez anos (2009-2019) para agir sobre críticas repetidas em torno de privacidade e classes não imagemáveis.
O artigo observa que LAION-400M efetivamente reverte essas melhorias, ‘ignorando em grande parte’ as revisões mencionadas na representação de ImageNet no novo lançamento, e identifica uma tendência mais ampla nesse sentido*:
‘Isso é destacado no surgimento de conjuntos de dados maiores, como o conjunto de dados de imagens ML do Tencent (em fevereiro de 2020) que abrange a maioria dessas classes não imagemáveis, a disponibilidade contínua de modelos treinados no conjunto de dados ImageNet-21k completo em repositórios como o TF-hub, a utilização contínua do ImageNet-21k não filtrado nos últimos modelos de ponta (como os modelos EfficientNetV2 do Google e os modelos CoAtNet) e os anúncios explícitos que permitem o uso do pré-treinamento ImageNet-21k não filtrado em concursos reputáveis como o desafio LVIS 2021.
‘Destacamos essa observação crucial: Uma equipe do calibre do ImageNet, que lida com menos de 15 milhões de imagens, lutou e falhou nesses esforços de desintoxicação até agora.
‘A escala de esforços cuidadosos necessários para desintoxicar completamente esse conjunto de dados multimodal maciço e os modelos downstream treinados nesse conjunto de dados, que abrange potencialmente bilhões de pares de imagem-legenda, será indiscutivelmente astronômica.’
* Minha conversão das citações em linha do autor para hiperlinks.












