Ángulo de Anderson

Los Riesgos de la AnotaciÃģn de ImÃĄgenes Basada en ‘Vibe’

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
A patron in the museum of banned artifacts. SDXL; Flux; Flux.1 Kontext; Firefly.

Aunque son pagados solo con unos pocos dÃģlares (o incluso nada), las personas desconocidas que evalÚan imÃĄgenes para contenido ‘perjudicial’ pueden cambiar tu vida con las decisiones que toman. Ahora, un nuevo artículo de Google parece sugerir que estos anotadores crean sus propias reglas para determinar quÃĐ es o no ‘perjudicial’ o ofensivo, sin importar cuÃĄn extraÃąas o personales sean sus reacciones a cualquier imagen. ÂŋQuÃĐ podría salir mal?

 

OpiniÃģn Esta semana, una nueva colaboraciÃģn entre Google Research y Google Mind reuniÃģ a no menos de 13 contribuyentes para un nuevo artículo que explora si los ‘sentimientos instintivos’ de los anotadores de imÃĄgenes deberían considerarse al calificar imÃĄgenes para algoritmos, incluso si sus reacciones no se ajustan a los estÃĄndares de calificaciÃģn establecidos.

Esto es importante para ti, porque lo que los calificadores y anotadores consideran ofensivo por consenso tenderÃĄ a convertirse en ley en sistemas de censura y moderaciÃģn automatizados, y en los criterios para material ‘obsceno’ o ‘inaceptable’, en legislaciones como el nuevo firewall NSFW* del Reino Unido (una versiÃģn del cual llegarÃĄ a Australia pronto), y en sistemas de evaluaciÃģn de contenido en plataformas de redes sociales, entre otros entornos.

Por lo tanto, cuanto mÃĄs amplios sean los criterios de ofensa, mayor serÃĄ el nivel potencial de censura.

Censura por ‘Vibe’

Eso no es el Único punto de vista que ofrece el nuevo artículo; tambiÃĐn encuentra que las personas que califican imÃĄgenes a menudo son mÃĄs censorias en lo que creen que ofenderÃĄ a otros aparte de ellos mismos; y que las imÃĄgenes de baja calidad a menudo provocan preocupaciones de seguridad, aunque la calidad de la imagen no tiene nada que ver con el contenido de la imagen.

Al concluir, el artículo enfatiza estos dos hallazgos, como si la posiciÃģn central del artículo hubiera fallado, pero los investigadores estaban obligados a publicar de todos modos.

Aunque eso no es un escenario inusual, el artículo produce, al leerlo cuidadosamente, una corriente subyacente mÃĄs siniestra: que las prÃĄcticas de anotaciÃģn podrían considerar adoptar lo que solo puedo describir como anotaciÃģn por ‘vibe’:

‘Nuestros hallazgos sugieren que los marcos existentes necesitan tener en cuenta dimensiones subjetivas y contextuales, como reacciones emocionales, juicios implícitos y interpretaciones culturales del daÃąo. El uso frecuente de lenguaje emocional por parte de los anotadores y su divergencia de las etiquetas de daÃąo predefinidas destacan las lagunas en las prÃĄcticas de evaluaciÃģn actuales.

‘Ampliar las pautas de anotaciÃģn para incluir ejemplos ilustrativos de interpretaciones culturales y emocionales diversas puede ayudar a abordar estas lagunas.’

El nuevo artículo poco ilustrado comienza con ejemplos que son inequívocos y simpÃĄticos para el lector promedio, aunque el material central real es mÃĄs ambiguo e invita a muchas mÃĄs preguntas. Aquí, debajo de cada imagen, vemos las respuestas emocionales de los anotadores denotadas para sus respectivas imÃĄgenes. Fuente: https://arxiv.org/pdf/2507.16033

El nuevo artículo poco ilustrado comienza con ejemplos que son inequívocos y simpÃĄticos para el lector promedio, aunque el material central real invita a muchas mÃĄs preguntas. Aquí, debajo de cada imagen, vemos las respuestas emocionales de los anotadores denotadas para sus respectivas imÃĄgenes. Fuente: https://arxiv.org/pdf/2507.16033

Al principio, esto suena como una propuesta para ampliar y cuantificar mejor lo que constituye ‘daÃąo’ en una imagen, una bÚsqueda loable; pero el artículo reitera varias veces que esto no es deseable ni (necesariamente) factible:

‘Nuestros hallazgos sugieren que los marcos existentes necesitan tener en cuenta dimensiones subjetivas y contextuales, como reacciones emocionales, juicios implícitos y interpretaciones culturales del daÃąo. El uso frecuente de lenguaje emocional por parte de los anotadores y su divergencia de las etiquetas de daÃąo predefinidas destacan las lagunas en las prÃĄcticas de evaluaciÃģn actuales.

‘Ampliar las pautas de anotaciÃģn para incluir ejemplos ilustrativos de interpretaciones culturales y emocionales diversas puede ayudar a abordar estas lagunas [â€Ķ]

‘[â€Ķ] El proceso por el cual los anotadores razonan sobre imÃĄgenes ambiguas a menudo refleja sus perspectivas personales, culturales y emocionales, que son difíciles de estructurar o estandarizar.’

Es difícil ver cÃģmo ‘Ampliar las pautas de anotaciÃģn para incluir ejemplos ilustrativos de interpretaciones culturales y emocionales diversas’ puede encajar en un sistema de calificaciÃģn racional; los autores luchan por aclarar este punto, o para formular una teoría distinta, atacando el material muchas veces, pero nunca superÃĄndolo. En este respecto, su tema central mismo parece ‘generado por vibe’, incluso mientras trata con psicologías intangibles.

En pocas palabras, parece que extender la tubería de anotaciÃģn para incluir criterios de este tipo potencialmente permite la ‘cancelaciÃģn’ o la ofuscaciÃģn de cualquier material (o clase de tema) que un anotador podría reaccionar fuertemente.

Juicio Binario

El alcance en el que las imÃĄgenes y el texto pueden causar daÃąo es de hecho difícil de cuantificar, no menos porque la cultura alta a menudo se cruza con la ‘cultura baja’ (por ejemplo, con arte y novelas), lo que lleva a los primeros criterios de censura ‘basados en vibe’: que incluso si el material obsceno escapa a la definiciÃģn exacta, lo conocerÃĄs cuando lo veas.

Debajo de la discusiÃģn extensa y exploratoria del nuevo artículo sobre la empatía y la sutileza cualitativa, el trabajo parece atacar silenciosamente la autoridad de las taxonomías centralizadas y estandarizadas (‘violencia’, ‘nudez’, ‘odio’, etc.) que permiten a las plataformas implementar y escalar la moderaciÃģn con mÃĄrgenes de error tolerables (usualmente).

El argumento que surge es que solo la retroalimentaciÃģn humana descentralizada, subjetiva y consciente del contexto puede juzgar adecuadamente la salida de GenAI.

Sin embargo, esto es claramente no escalable, ya que no se puede ejecutar un filtro de un billÃģn de imÃĄgenes en ‘vibes’ y experiencia vivida. Hay que cuantificar el daÃąo en propiedades diversas; establecer un límite en el alcance del sistema de filtrado resultante; y esperar a nuevas directivas en ‘casos de borde’ (al igual que las partes agraviadas deben esperar a veces a la promulgaciÃģn de nuevas leyes que aborden sus circunstancias particulares).

En su lugar, el nuevo artículo presenta un mandato tÃĄcito para una tubería de moderaciÃģn automatizada que amplía su alcance automÃĄticamente, y se equivoca tanto en el lado de la precauciÃģn que incluso la reacciÃģn mÃĄs particular y no replicable de un anotador podría penalizar una imagen que no ha ofendido a nadie mÃĄs.

ExpansiÃģn Moral

Aunque el artículo se inclina hacia la exploraciÃģn en lugar de tomar una postura firme, incorpora elementos del mÃĐtodo científico: los autores desarrollaron un marco para identificar (aunque no medir estrictamente) un espectro mÃĄs amplio de reacciones de los anotadores a las imÃĄgenes, y para examinar cÃģmo estas reacciones varían a travÃĐs del gÃĐnero y otros factores demogrÃĄficos.

AdemÃĄs del anÃĄlisis de enfoque de daÃąo†, el proceso analizÃģ el ‘razonamiento moral’ en los comentarios auxiliares de los participantes en la prueba, que fueron solicitados para anotar un conjunto de datos de prueba modificado que contenía imÃĄgenes y textos/prompt asociados.

Este ‘autorregulador de sentimiento moral’ estaba diseÃąado para capturar los valores morales Cuidado, Igualdad, Proporcionalidad, Lealtad, Autoridad, y Pureza, segÚn lo definido en Teoría de Fundamentos Morales – una teoría psicolÃģgica que, debido a su naturaleza fluida y en evoluciÃģn, es antitÃĐtica a la creaciÃģn de definiciones concretas necesarias para sistemas de calificaciÃģn humana a gran escala.

Informados por esta teoría, los autores categorizaron dimensiones adicionales de seguridad, incluyendo miedo, ira, tristeza, asco, confusiÃģn, y extraÃąeza.

Los autores elaboran sobre el primero de estos, miedo:

‘Muchos anotadores usaron tÃĐrminos como “espeluznante” (por ejemplo, para caras distorsionadas o imÃĄgenes que sugieren violencia como un arma apuntando a un niÃąo), “perturbador” (por ejemplo, “Absolutamente vil ver a alguien atropellado, muy angustiante y perturbador”, o “Perturbador y parece sangre” para pintura roja), o “inquietante” (por ejemplo, “La imagen del niÃąo tiene muchas distorsionesâ€Ķ Me parece de mal gusto porque parece que el niÃąo estÃĄ jugando en el lado equivocado de las barras laterales”).

‘El [grÃĄfico a continuaciÃģn] cuantifica “miedo” como la emociÃģn mÃĄs mencionada con frecuencia (233 menciones mientras que casi la mitad de estas menciones estÃĄn asociadas con contenido violento, el contenido considerado no daÃąino tambiÃĐn evocÃģ la segunda menciÃģn mÃĄs alta de miedo).’

DistribuciÃģn de tÃĐrminos relacionados con emociones a travÃĐs de categorías de daÃąo, con alturas de barras que indican proporciones de comentarios, recuentos de comentarios mostrados dentro de las barras y recuentos totales de comentarios mostrados encima de cada categoría.

DistribuciÃģn de tÃĐrminos relacionados con emociones a travÃĐs de categorías de daÃąo, con alturas de barras que indican proporciones de comentarios, recuentos de comentarios mostrados dentro de las barras y recuentos totales de comentarios mostrados encima de cada categoría.

Con respecto a la inclusiÃģn de estas nuevas dimensiones de seguridad, los autores afirman:

‘Estos temas emergentes destacan una necesidad crítica de enriquecer los marcos de evaluaciÃģn de imÃĄgenes de IA al integrar elementos subjetivos, emocionales y perceptuales.’

Esto puede ser un camino peligroso, ya que parece permitir que los procesos de anotaciÃģn agreguen reglas arbitrariamente basadas en reacciones que el material puede provocar en cualquier anotador individual, en lugar de requerir que todos los anotadores se adhieran a estÃĄndares y puntos de referencia establecidos.

Si se pudiera asignar un imperativo econÃģmico a esta idea, es que este enfoque permite anotaciÃģn humana de hipercala, en el que el proceso es libre de fricciones, los participantes son autorregulados y ellos mismos deciden quÃĐ son las reglas y los límites.

Bajo la anotaciÃģn estÃĄndar, las reglas se establecen por consenso humano y se adhieren a ellas los anotadores humanos; bajo el escenario previsto en el artículo, esa capa inicial de supervisiÃģn se elimina o se degrada: efectivamente, cualquier imagen que podría ofender a alguien se marcaría (no menos, quizÃĄs, porque el consenso es costoso y consume tiempo).

Juicios de Rorschach

La intenciÃģn de la anotaciÃģn es llegar a una descripciÃģn o definiciÃģn precisa a travÃĐs de la supervisiÃģn de expertos, el consenso comÚn entre mÚltiples anotadores o (idealmente) ambos. En su lugar, ampliar una jerarquía limitada pero bien definida de daÃąos en una postura interpretativa ‘intuitiva’ y muy personal, es equivalente a anotar una prueba de Rorschach.

Por ejemplo, algunos anotadores, segÚn el artículo, interpretaron la mala calidad de la imagen (como artefactos JPEG, así como fallos tÃĐcnicos sin sentido en una imagen) como ‘perturbador’ o ‘indicativo de daÃąo’:

‘Esto ocurriÃģ a pesar de que la tarea omitiÃģ instrucciones sobre la calidad de la imagen. AdemÃĄs, los anotadores interpretaron estos artefactos de calidad como semÃĄnticamente significativos.

‘Un anotador comentÃģ: “La imagen no es daÃąina en absoluto; ÃĐl solo tiene una cara un poco distorsionada”. Al mismo tiempo, algunos anotadores interpretaron los artefactos de calidad de la imagen como daÃąo intencional, atribuyendo un significado emocional a los errores. Por ejemplo, otro anotador interpretÃģ una cara distorsionada en una imagen diferente como “indicativa de dolor”’

Al elevar las reacciones subjetivas, emocionales o específicas del contexto por encima de las categorías de seguridad predefinidas, las ideas presentadas aquí abren la puerta a un rÃĐgimen en el que anything puede ser marcado arbitrariamente como daÃąino, y donde un ‘efecto de enfriamiento’ de ad hoc de retiradas o recategorizaciÃģn negativa de material (es decir, material que puede ‘ofender’ a un grupo de interÃĐs especial) se convierte en una perspectiva real.

 

 

El artículo “Just a strange pic”: Evaluating ‘safety’ in GenAI Image safety annotation tasks from diverse annotators’ perspectives estÃĄ disponible en Arxiv.

* Un atajo, ya que no es el tema central aquí; bajo la nueva legislaciÃģn, los sitios ofensivos se espera que o bien se autopolicien; impongan sistemas de revisiÃģn complejos y costosos y tecnologías de verificaciÃģn de edad que estÃĄn fuera del alcance de todos excepto los sitios mÃĄs grandes; o bloqueen sus dominios para las audiencias del Reino Unido (nuevamente, a su propio costo).

† Expresado simplemente en el meme ‘piensa en los niÃąos’, que satiriza la apropiaciÃģn de la agencia moral de otro para medios aparentemente altruistas.

 

Publicado por primera vez el viernes 25 de julio de 2025

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]