Ângulo de Anderson

Os Riscos da Anotação de Imagens Baseada em ‘Vibe’

mm
Adicione Unite.AI às suas fontes preferidas no Google
A patron in the museum of banned artifacts. SDXL; Flux; Flux.1 Kontext; Firefly.

Embora sejam pagos apenas alguns dólares (ou nada), as pessoas desconhecidas que avaliam imagens por conteúdo ‘prejudicial’ podem mudar sua vida com as escolhas que fazem. Agora, um novo artigo da Google parece sugerir que esses anotadores criam suas próprias regras sobre o que é ou não é ‘prejudicial’ ou ofensivo – independentemente de quão bizarras ou pessoais sejam suas reações a qualquer imagem. O que poderia dar errado?

 

Opinião Esta semana, uma nova colaboração entre a Google Research e a Google Mind reuniu não menos de 13 contribuintes para um novo artigo que explora se os ‘sentimentos instintivos’ dos anotadores de imagens devem ser considerados quando as pessoas estão avaliando imagens para algoritmos, mesmo que suas reações não estejam de acordo com os padrões de avaliação estabelecidos.

Isso é importante para você, porque o que os avaliadores e anotadores consideram ofensivo por consenso tenderá a se tornar enshrined em sistemas de censura e moderação automatizados, e nos critérios para material ‘obsceno’ ou ‘inaceitável’, em legislações como a nova firewall NSFW* do Reino Unido (uma versão da qual está vindo para a Austrália em breve), e em sistemas de avaliação de conteúdo em plataformas de mídia social, entre outros ambientes.

Portanto, quanto mais amplos os critérios de ofensa, maior o potencial de censura.

Censura por ‘Vibe’

Essa não é a única perspectiva que o novo artigo tem a oferecer; ele também descobre que as pessoas que avaliam imagens são frequentemente mais censuradas em relação ao que elas acham que pode ofender outras pessoas além delas mesmas; e que imagens de baixa qualidade muitas vezes provocam preocupações de segurança, embora a qualidade da imagem não tenha nada a ver com o conteúdo da imagem.

No final do artigo, os autores enfatizam essas duas descobertas, como se a posição central do artigo tivesse falhado, mas os pesquisadores foram obrigados a publicar de qualquer forma.

Embora isso não seja um cenário incomum, o artigo produz, após uma leitura cuidadosa, uma corrente subjacente mais sinistra: que as práticas de anotação poderiam considerar adotar o que eu só posso descrever como anotação por ‘vibe’:

‘Nossas descobertas sugerem que os quadros existentes precisam levar em conta dimensões subjetivas e contextuais, como reações emocionais, julgamentos implícitos e interpretações culturais de dano. O uso frequente de linguagem emocional pelos anotadores e sua divergência dos rótulos de dano pré-definidos destacam lacunas nas práticas de avaliação atuais.

‘Expandir as diretrizes de anotação para incluir exemplos ilustrativos de interpretações culturais e emocionais diversas pode ajudar a abordar essas lacunas.’

O novo artigo, com poucas ilustrações, começa com exemplos que são inequívocos e simpáticos ao leitor médio, embora o material central seja mais ambíguo e convidativo a muitas perguntas. Aqui, abaixo de cada imagem, vemos as respostas emocionais dos anotadores denotadas para suas respectivas imagens. Fonte: https://arxiv.org/pdf/2507.16033

O novo artigo, com poucas ilustrações, começa com exemplos que são inequívocos e simpáticos ao leitor médio, embora o material central convidativo a muitas perguntas. Aqui, abaixo de cada imagem, vemos as respostas emocionais dos anotadores denotadas para suas respectivas imagens. Fonte: https://arxiv.org/pdf/2507.16033

No início, isso soa como uma proposta para expandir e melhor quantificar o que constitui ‘dano’ em uma imagem – uma busca louvável; mas o artigo reitera várias vezes que isso não é desejável nem (necessariamente) viável:

‘Nossas descobertas sugerem que os quadros existentes precisam levar em conta dimensões subjetivas e contextuais, como reações emocionais, julgamentos implícitos e interpretações culturais de dano. O uso frequente de linguagem emocional pelos anotadores e sua divergência dos rótulos de dano pré-definidos destacam lacunas nas práticas de avaliação atuais.

‘Expandir as diretrizes de anotação para incluir exemplos ilustrativos de interpretações culturais e emocionais diversas pode ajudar a abordar essas lacunas […]

‘[…] O processo pelo qual os anotadores raciocinam sobre imagens ambíguas muitas vezes reflete suas perspectivas pessoais, culturais e emocionais, que são difíceis de estruturar ou padronizar.’

É difícil ver como ‘Expandir as diretrizes de anotação para incluir exemplos ilustrativos de interpretações culturais e emocionais diversas’ pode se encaixar em um sistema de avaliação racional; os autores lutam para esclarecer esse ponto, ou para formular uma teoria distinta, atacando o material muitas vezes, mas nunca superando-o. Nesse sentido, o tema central em si mesmo parece ‘vibe’-gerado, mesmo enquanto lida com psicologias intangíveis.

Em resumo, parece-me que expandir o pipeline de anotação para incluir critérios desse tipo potencialmente permite a ‘cancelamento’ ou ofuscação de qualquer material (ou classe de tópico) que um anotador possa reagir fortemente.

Julgamento Binário

A extensão com que as imagens e o texto podem causar dano é de fato difícil de quantificar, não menos porque a cultura de alto nível muitas vezes se cruza com a ‘cultura baixa’ (por exemplo, com arte e romances), levando aos primeiros critérios de censura baseados em ‘vibe’: que mesmo se o material obsceno escapa à definição exata, você saberá quando o vir.

Abaixo da discussão extensa e exploratória do novo artigo sobre empatia e nuances qualitativas, o trabalho parece atacar silenciosamente a autoridade das taxonomias centralizadas e padronizadas (‘violência’, ‘nudez’, ‘ódio’, etc.) que permitem que as plataformas implementem e escalonem a moderação com margens de erro toleráveis (usualmente).

O argumento que emerge é que apenas o feedback humano subjetivo, contextual e descentralizado pode julgar adequadamente a saída do GenAI.

No entanto, isso é claramente inescalável, pois você não pode executar um pipeline de filtro de trilhões de imagens com base em ‘vibes’ e experiência vivida. É necessário quantificar o dano em propriedades diversas; definir um limite para o escopo do sistema de filtragem resultante; e esperar por novas diretrizes em ‘casos de bordo’ (assim como as partes lesadas devem às vezes esperar pela promulgação de novas leis que abordem suas próprias circunstâncias particulares).

Em vez disso, o novo artigo apresenta um mandato tácito para um pipeline de moderação automatizado que expande seu escopo automaticamente, e erra tanto do lado da cautela que mesmo a reação mais particular e não reprodutível de um anotador poderia penalizar uma imagem que não ofendeu ninguém mais.

Expansão Moral

Embora o artigo incline para a exploração em vez de adotar uma posição firme, ele incorpora elementos do método científico: os autores desenvolveram um quadro para identificar (embora não medir estritamente) um espectro mais amplo de reações dos anotadores a imagens, e para examinar como essas reações variam por gênero e outros fatores demográficos.

Além da análise dos testes sobre foco em dano†, o processo analisou ‘raciocínio moral’ nos comentários auxiliares dos participantes do teste, que foram solicitados a anotar um conjunto de teste modificado contendo imagens e prompts/textos associados.

Esse ‘autorregulador de sentimento moral’ foi projetado para capturar os valores morais Cuidado, Igualdade, Proporcionalidade, Lealdade, Autoridade, e Pureza, como definido na Teoria das Fundações Morais – uma teoria psicológica que, devido à sua natureza fluida e em evolução, é antitética à criação de definições concretas necessárias para sistemas de avaliação humana em grande escala.

Informado por essa teoria, as dimensões adicionais de segurança foram categorizadas pelos autores, incluindo medo, raiva, tristeza, nojo, confusão, e estraneza.

Os autores elaboram sobre o primeiro deles, medo:

‘Muitos anotadores usaram termos como “assustador” (por exemplo, para faces distorcidas ou imagens que sugerem violência, como uma arma apontada para uma criança), “perturbador” (por exemplo, “Absolutamente vil ver alguém ser atropelado, muito perturbador e perturbador”, ou “Perturbador e parece sangue” para tinta vermelha), ou “desagradável” (por exemplo, “A imagem do menino tem muitas distorções… Eu acho desagradável porque parece que o menino está brincando no lado errado da trilha”).

‘O [gráfico abaixo] quantifica “medo” como a emoção mais mencionada (233 menções, enquanto quase metade dessas menções estão associadas a conteúdo violento, o conteúdo considerado não prejudicial também evocou a segunda menção mais alta de medo).’

Distribuição de termos relacionados a emoções por categorias de dano, com alturas de barras indicando proporções de comentários, contagens exibidas dentro das barras e contagens totais de comentários acima de cada categoria.

Distribuição de termos relacionados a emoções por categorias de dano, com alturas de barras indicando proporções de comentários, contagens exibidas dentro das barras e contagens totais de comentários acima de cada categoria.

Com relação à inclusão dessas novas dimensões de segurança, os autores afirmam:

‘Esses temas emergentes destacam uma necessidade crítica de enriquecer os quadros de avaliação de imagens de IA, integrando elementos subjetivos, emocionais e perceptuais.’

Isso pode ser um caminho perigoso a seguir, pois parece permitir que os processos de anotação adicionem regras arbitrariamente com base em reações que o material pode provocar em qualquer anotador, em vez de exigir que todos os anotadores adiram a padrões e benchmarks estabelecidos.

Se pudéssemos atribuir um imperativo econômico a essa ideia, é que essa abordagem permite anotação humana em hipercala, na qual o processo é sem atrito, os participantes são auto-regulados e decidem quais são as regras e limites.

Sob anotação padrão, as regras são estabelecidas por consenso humano e seguidas por anotadores humanos; sob o cenário imaginado no artigo, essa camada inicial de supervisão é removida ou rebaixada: efetivamente, qualquer imagem que possa causar ofensa a alguém seria marcada (não menos, talvez, porque o consenso é caro e demorado).

Julgamentos de Rorschach

A intenção da anotação é chegar a uma descrição ou definição precisa, seja por meio de supervisão de especialistas, consenso comum entre vários anotadores, ou (idealmente) ambos. Em vez disso, expandir uma hierarquia limitada, mas bem definida, de danos em uma postura interpretativa ‘intuitiva’ e altamente pessoal, é equivalente a anotar um teste de Rorschach.

Por exemplo, alguns anotadores, conforme observado no artigo, interpretaram a baixa qualidade da imagem (como artefatos JPEG, bem como falhas técnicas sem sentido em uma imagem) como ‘perturbador’ ou ‘indicativo de dano’:

‘Isso ocorreu apesar de a tarefa omitir instruções sobre a qualidade da imagem. Além disso, os anotadores interpretaram esses artefatos de qualidade como semanticamente significativos.

‘Um anotador comentou: “A imagem não é prejudicial em nada; ele apenas tem um rosto um pouco distorcido.” Ao mesmo tempo, alguns anotadores interpretaram artefatos de qualidade como dano intencional, atribuindo significado emocional a glitches. Por exemplo, outro anotador interpretou um rosto distorcido em uma imagem diferente como “indicativo de dor”’

Ao elevar reações subjetivas, emocionais ou contextuais acima de categorias de segurança pré-definidas, as ideias apresentadas aqui abrem a porta para um regime em que qualquer coisa pode ser arbitrariamente marcada como prejudicial, e onde um ‘efeito de resfriamento’ de ad hoc retiradas ou recategorizações negativas de material (ou seja, material que pode ‘ofender’ um grupo de interesse especial) se torna uma perspectiva real.

 

 

O artigo “Just a strange pic”: Avaliando ‘segurança’ em tarefas de anotação de imagens de GenAI do ponto de vista de anotadores diversos está disponível no Arxiv.

* Um atalho, pois não é o assunto central aqui; sob a nova legislação, os sites ofensivos devem ou policiar a si mesmos; impor sistemas de revisão complexos e caros e tecnologias de verificação de idade que estão fora do alcance de todos, exceto os maiores sites; ou bloquear seus domínios para o público do Reino Unido (novamente, às suas próprias expensas).

† Expresso simplesmente na meme ‘pense nas crianças’, que satiriza a apropriação da agência moral de outra pessoa para meios aparentemente altruístas.

 

Publicado pela primeira vez na sexta-feira, 25 de julho de 2025

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai