Ãngulo de Anderson
Os Riscos da AnotaçÃĢo de Imagens Baseada em ‘Vibe’

Embora sejam pagos apenas alguns dÃģlares (ou nada), as pessoas desconhecidas que avaliam imagens por conteÚdo âprejudicialâ podem mudar sua vida com as escolhas que fazem. Agora, um novo artigo da Google parece sugerir que esses anotadores criam suas prÃģprias regras sobre o que ÃĐ ou nÃĢo ÃĐ âprejudicialâ ou ofensivo â independentemente de quÃĢo bizarras ou pessoais sejam suas reaçÃĩes a qualquer imagem. O que poderia dar errado?
Â
OpiniÃĢo Esta semana, uma nova colaboraçÃĢo entre a Google Research e a Google Mind reuniu nÃĢo menos de 13 contribuintes para um novo artigo que explora se os âsentimentos instintivosâ dos anotadores de imagens devem ser considerados quando as pessoas estÃĢo avaliando imagens para algoritmos, mesmo que suas reaçÃĩes nÃĢo estejam de acordo com os padrÃĩes de avaliaçÃĢo estabelecidos.
Isso ÃĐ importante para vocÊ, porque o que os avaliadores e anotadores consideram ofensivo por consenso tenderÃĄ a se tornar enshrined em sistemas de censura e moderaçÃĢo automatizados, e nos critÃĐrios para material âobscenoâ ou âinaceitÃĄvelâ, em legislaçÃĩes como a nova firewall NSFW* do Reino Unido (uma versÃĢo da qual estÃĄ vindo para a AustrÃĄlia em breve), e em sistemas de avaliaçÃĢo de conteÚdo em plataformas de mÃdia social, entre outros ambientes.
Portanto, quanto mais amplos os critÃĐrios de ofensa, maior o potencial de censura.
Censura por âVibeâ
Essa nÃĢo ÃĐ a Única perspectiva que o novo artigo tem a oferecer; ele tambÃĐm descobre que as pessoas que avaliam imagens sÃĢo frequentemente mais censuradas em relaçÃĢo ao que elas acham que pode ofender outras pessoas alÃĐm delas mesmas; e que imagens de baixa qualidade muitas vezes provocam preocupaçÃĩes de segurança, embora a qualidade da imagem nÃĢo tenha nada a ver com o conteÚdo da imagem.
No final do artigo, os autores enfatizam essas duas descobertas, como se a posiçÃĢo central do artigo tivesse falhado, mas os pesquisadores foram obrigados a publicar de qualquer forma.
Embora isso nÃĢo seja um cenÃĄrio incomum, o artigo produz, apÃģs uma leitura cuidadosa, uma corrente subjacente mais sinistra: que as prÃĄticas de anotaçÃĢo poderiam considerar adotar o que eu sÃģ posso descrever como anotaçÃĢo por âvibeâ:
âNossas descobertas sugerem que os quadros existentes precisam levar em conta dimensÃĩes subjetivas e contextuais, como reaçÃĩes emocionais, julgamentos implÃcitos e interpretaçÃĩes culturais de dano. O uso frequente de linguagem emocional pelos anotadores e sua divergÊncia dos rÃģtulos de dano prÃĐ-definidos destacam lacunas nas prÃĄticas de avaliaçÃĢo atuais.
âExpandir as diretrizes de anotaçÃĢo para incluir exemplos ilustrativos de interpretaçÃĩes culturais e emocionais diversas pode ajudar a abordar essas lacunas.â

O novo artigo, com poucas ilustraçÃĩes, começa com exemplos que sÃĢo inequÃvocos e simpÃĄticos ao leitor mÃĐdio, embora o material central convidativo a muitas perguntas. Aqui, abaixo de cada imagem, vemos as respostas emocionais dos anotadores denotadas para suas respectivas imagens. Fonte: https://arxiv.org/pdf/2507.16033
No inÃcio, isso soa como uma proposta para expandir e melhor quantificar o que constitui âdanoâ em uma imagem â uma busca louvÃĄvel; mas o artigo reitera vÃĄrias vezes que isso nÃĢo ÃĐ desejÃĄvel nem (necessariamente) viÃĄvel:
âNossas descobertas sugerem que os quadros existentes precisam levar em conta dimensÃĩes subjetivas e contextuais, como reaçÃĩes emocionais, julgamentos implÃcitos e interpretaçÃĩes culturais de dano. O uso frequente de linguagem emocional pelos anotadores e sua divergÊncia dos rÃģtulos de dano prÃĐ-definidos destacam lacunas nas prÃĄticas de avaliaçÃĢo atuais.
âExpandir as diretrizes de anotaçÃĢo para incluir exemplos ilustrativos de interpretaçÃĩes culturais e emocionais diversas pode ajudar a abordar essas lacunas [âĶ]
â[âĶ] O processo pelo qual os anotadores raciocinam sobre imagens ambÃguas muitas vezes reflete suas perspectivas pessoais, culturais e emocionais, que sÃĢo difÃceis de estruturar ou padronizar.â
à difÃcil ver como âExpandir as diretrizes de anotaçÃĢo para incluir exemplos ilustrativos de interpretaçÃĩes culturais e emocionais diversasâ pode se encaixar em um sistema de avaliaçÃĢo racional; os autores lutam para esclarecer esse ponto, ou para formular uma teoria distinta, atacando o material muitas vezes, mas nunca superando-o. Nesse sentido, o tema central em si mesmo parece âvibeâ-gerado, mesmo enquanto lida com psicologias intangÃveis.
Em resumo, parece-me que expandir o pipeline de anotaçÃĢo para incluir critÃĐrios desse tipo potencialmente permite a âcancelamentoâ ou ofuscaçÃĢo de qualquer material (ou classe de tÃģpico) que um anotador possa reagir fortemente.
Julgamento BinÃĄrio
A extensÃĢo com que as imagens e o texto podem causar dano ÃĐ de fato difÃcil de quantificar, nÃĢo menos porque a cultura de alto nÃvel muitas vezes se cruza com a âcultura baixaâ (por exemplo, com arte e romances), levando aos primeiros critÃĐrios de censura baseados em âvibeâ: que mesmo se o material obsceno escapa à definiçÃĢo exata, vocÊ saberÃĄ quando o vir.
Abaixo da discussÃĢo extensa e exploratÃģria do novo artigo sobre empatia e nuances qualitativas, o trabalho parece atacar silenciosamente a autoridade das taxonomias centralizadas e padronizadas (âviolÊnciaâ, ânudezâ, âÃģdioâ, etc.) que permitem que as plataformas implementem e escalonem a moderaçÃĢo com margens de erro tolerÃĄveis (usualmente).
O argumento que emerge ÃĐ que apenas o feedback humano subjetivo, contextual e descentralizado pode julgar adequadamente a saÃda do GenAI.
No entanto, isso ÃĐ claramente inescalÃĄvel, pois vocÊ nÃĢo pode executar um pipeline de filtro de trilhÃĩes de imagens com base em âvibesâ e experiÊncia vivida. à necessÃĄrio quantificar o dano em propriedades diversas; definir um limite para o escopo do sistema de filtragem resultante; e esperar por novas diretrizes em âcasos de bordoâ (assim como as partes lesadas devem à s vezes esperar pela promulgaçÃĢo de novas leis que abordem suas prÃģprias circunstÃĒncias particulares).
Em vez disso, o novo artigo apresenta um mandato tÃĄcito para um pipeline de moderaçÃĢo automatizado que expande seu escopo automaticamente, e erra tanto do lado da cautela que mesmo a reaçÃĢo mais particular e nÃĢo reprodutÃvel de um anotador poderia penalizar uma imagem que nÃĢo ofendeu ninguÃĐm mais.
ExpansÃĢo Moral
Embora o artigo incline para a exploraçÃĢo em vez de adotar uma posiçÃĢo firme, ele incorpora elementos do mÃĐtodo cientÃfico: os autores desenvolveram um quadro para identificar (embora nÃĢo medir estritamente) um espectro mais amplo de reaçÃĩes dos anotadores a imagens, e para examinar como essas reaçÃĩes variam por gÊnero e outros fatores demogrÃĄficos.
AlÃĐm da anÃĄlise dos testes sobre foco em danoâ , o processo analisou âraciocÃnio moralâ nos comentÃĄrios auxiliares dos participantes do teste, que foram solicitados a anotar um conjunto de teste modificado contendo imagens e prompts/textos associados.
Esse âautorregulador de sentimento moralâ foi projetado para capturar os valores morais Cuidado, Igualdade, Proporcionalidade, Lealdade, Autoridade, e Pureza, como definido na Teoria das FundaçÃĩes Morais â uma teoria psicolÃģgica que, devido à sua natureza fluida e em evoluçÃĢo, ÃĐ antitÃĐtica à criaçÃĢo de definiçÃĩes concretas necessÃĄrias para sistemas de avaliaçÃĢo humana em grande escala.
Informado por essa teoria, as dimensÃĩes adicionais de segurança foram categorizadas pelos autores, incluindo medo, raiva, tristeza, nojo, confusÃĢo, e estraneza.
Os autores elaboram sobre o primeiro deles, medo:
âMuitos anotadores usaram termos como âassustadorâ (por exemplo, para faces distorcidas ou imagens que sugerem violÊncia, como uma arma apontada para uma criança), âperturbadorâ (por exemplo, âAbsolutamente vil ver alguÃĐm ser atropelado, muito perturbador e perturbadorâ, ou âPerturbador e parece sangueâ para tinta vermelha), ou âdesagradÃĄvelâ (por exemplo, âA imagem do menino tem muitas distorçÃĩesâĶ Eu acho desagradÃĄvel porque parece que o menino estÃĄ brincando no lado errado da trilhaâ).
âO [grÃĄfico abaixo] quantifica âmedoâ como a emoçÃĢo mais mencionada (233 mençÃĩes, enquanto quase metade dessas mençÃĩes estÃĢo associadas a conteÚdo violento, o conteÚdo considerado nÃĢo prejudicial tambÃĐm evocou a segunda mençÃĢo mais alta de medo).â

DistribuiçÃĢo de termos relacionados a emoçÃĩes por categorias de dano, com alturas de barras indicando proporçÃĩes de comentÃĄrios, contagens exibidas dentro das barras e contagens totais de comentÃĄrios acima de cada categoria.
Com relaçÃĢo à inclusÃĢo dessas novas dimensÃĩes de segurança, os autores afirmam:
âEsses temas emergentes destacam uma necessidade crÃtica de enriquecer os quadros de avaliaçÃĢo de imagens de IA, integrando elementos subjetivos, emocionais e perceptuais.â
Isso pode ser um caminho perigoso a seguir, pois parece permitir que os processos de anotaçÃĢo adicionem regras arbitrariamente com base em reaçÃĩes que o material pode provocar em qualquer anotador, em vez de exigir que todos os anotadores adiram a padrÃĩes e benchmarks estabelecidos.
Se pudÃĐssemos atribuir um imperativo econÃīmico a essa ideia, ÃĐ que essa abordagem permite anotaçÃĢo humana em hipercala, na qual o processo ÃĐ sem atrito, os participantes sÃĢo auto-regulados e decidem quais sÃĢo as regras e limites.
Sob anotaçÃĢo padrÃĢo, as regras sÃĢo estabelecidas por consenso humano e seguidas por anotadores humanos; sob o cenÃĄrio imaginado no artigo, essa camada inicial de supervisÃĢo ÃĐ removida ou rebaixada: efetivamente, qualquer imagem que possa causar ofensa a alguÃĐm seria marcada (nÃĢo menos, talvez, porque o consenso ÃĐ caro e demorado).
Julgamentos de Rorschach
A intençÃĢo da anotaçÃĢo ÃĐ chegar a uma descriçÃĢo ou definiçÃĢo precisa, seja por meio de supervisÃĢo de especialistas, consenso comum entre vÃĄrios anotadores, ou (idealmente) ambos. Em vez disso, expandir uma hierarquia limitada, mas bem definida, de danos em uma postura interpretativa âintuitivaâ e altamente pessoal, ÃĐ equivalente a anotar um teste de Rorschach.
Por exemplo, alguns anotadores, conforme observado no artigo, interpretaram a baixa qualidade da imagem (como artefatos JPEG, bem como falhas tÃĐcnicas sem sentido em uma imagem) como âperturbadorâ ou âindicativo de danoâ:
âIsso ocorreu apesar de a tarefa omitir instruçÃĩes sobre a qualidade da imagem. AlÃĐm disso, os anotadores interpretaram esses artefatos de qualidade como semanticamente significativos.
âUm anotador comentou: âA imagem nÃĢo ÃĐ prejudicial em nada; ele apenas tem um rosto um pouco distorcido.â Ao mesmo tempo, alguns anotadores interpretaram artefatos de qualidade como dano intencional, atribuindo significado emocional a glitches. Por exemplo, outro anotador interpretou um rosto distorcido em uma imagem diferente como âindicativo de dorââ
Ao elevar reaçÃĩes subjetivas, emocionais ou contextuais acima de categorias de segurança prÃĐ-definidas, as ideias apresentadas aqui abrem a porta para um regime em que qualquer coisa pode ser arbitrariamente marcada como prejudicial, e onde um âefeito de resfriamentoâ de ad hoc retiradas ou recategorizaçÃĩes negativas de material (ou seja, material que pode âofenderâ um grupo de interesse especial) se torna uma perspectiva real.
Â
Â
O artigo âJust a strange picâ: Avaliando âsegurançaâ em tarefas de anotaçÃĢo de imagens de GenAI do ponto de vista de anotadores diversos estÃĄ disponÃvel no Arxiv.
* Um atalho, pois nÃĢo ÃĐ o assunto central aqui; sob a nova legislaçÃĢo, os sites ofensivos devem ou policiar a si mesmos; impor sistemas de revisÃĢo complexos e caros e tecnologias de verificaçÃĢo de idade que estÃĢo fora do alcance de todos, exceto os maiores sites; ou bloquear seus domÃnios para o pÚblico do Reino Unido (novamente, à s suas prÃģprias expensas).
â Expresso simplesmente na meme âpense nas criançasâ, que satiriza a apropriaçÃĢo da agÊncia moral de outra pessoa para meios aparentemente altruÃstas.
Â
Publicado pela primeira vez na sexta-feira, 25 de julho de 2025












