Ãngulo de Anderson
Los Riesgos de la AnotaciÃģn de ImÃĄgenes Basada en ‘Vibe’

Aunque son pagados solo con unos pocos dÃģlares (o incluso nada), las personas desconocidas que evalÚan imÃĄgenes para contenido âperjudicialâ pueden cambiar tu vida con las decisiones que toman. Ahora, un nuevo artÃculo de Google parece sugerir que estos anotadores crean sus propias reglas para determinar quÃĐ es o no âperjudicialâ o ofensivo, sin importar cuÃĄn extraÃąas o personales sean sus reacciones a cualquier imagen. ÂŋQuÃĐ podrÃa salir mal?
Â
OpiniÃģn Esta semana, una nueva colaboraciÃģn entre Google Research y Google Mind reuniÃģ a no menos de 13 contribuyentes para un nuevo artÃculo que explora si los âsentimientos instintivosâ de los anotadores de imÃĄgenes deberÃan considerarse al calificar imÃĄgenes para algoritmos, incluso si sus reacciones no se ajustan a los estÃĄndares de calificaciÃģn establecidos.
Esto es importante para ti, porque lo que los calificadores y anotadores consideran ofensivo por consenso tenderÃĄ a convertirse en ley en sistemas de censura y moderaciÃģn automatizados, y en los criterios para material âobscenoâ o âinaceptableâ, en legislaciones como el nuevo firewall NSFW* del Reino Unido (una versiÃģn del cual llegarÃĄ a Australia pronto), y en sistemas de evaluaciÃģn de contenido en plataformas de redes sociales, entre otros entornos.
Por lo tanto, cuanto mÃĄs amplios sean los criterios de ofensa, mayor serÃĄ el nivel potencial de censura.
Censura por âVibeâ
Eso no es el Único punto de vista que ofrece el nuevo artÃculo; tambiÃĐn encuentra que las personas que califican imÃĄgenes a menudo son mÃĄs censorias en lo que creen que ofenderÃĄ a otros aparte de ellos mismos; y que las imÃĄgenes de baja calidad a menudo provocan preocupaciones de seguridad, aunque la calidad de la imagen no tiene nada que ver con el contenido de la imagen.
Al concluir, el artÃculo enfatiza estos dos hallazgos, como si la posiciÃģn central del artÃculo hubiera fallado, pero los investigadores estaban obligados a publicar de todos modos.
Aunque eso no es un escenario inusual, el artÃculo produce, al leerlo cuidadosamente, una corriente subyacente mÃĄs siniestra: que las prÃĄcticas de anotaciÃģn podrÃan considerar adoptar lo que solo puedo describir como anotaciÃģn por âvibeâ:
âNuestros hallazgos sugieren que los marcos existentes necesitan tener en cuenta dimensiones subjetivas y contextuales, como reacciones emocionales, juicios implÃcitos y interpretaciones culturales del daÃąo. El uso frecuente de lenguaje emocional por parte de los anotadores y su divergencia de las etiquetas de daÃąo predefinidas destacan las lagunas en las prÃĄcticas de evaluaciÃģn actuales.
âAmpliar las pautas de anotaciÃģn para incluir ejemplos ilustrativos de interpretaciones culturales y emocionales diversas puede ayudar a abordar estas lagunas.â

El nuevo artÃculo poco ilustrado comienza con ejemplos que son inequÃvocos y simpÃĄticos para el lector promedio, aunque el material central real invita a muchas mÃĄs preguntas. AquÃ, debajo de cada imagen, vemos las respuestas emocionales de los anotadores denotadas para sus respectivas imÃĄgenes. Fuente: https://arxiv.org/pdf/2507.16033
Al principio, esto suena como una propuesta para ampliar y cuantificar mejor lo que constituye âdaÃąoâ en una imagen, una bÚsqueda loable; pero el artÃculo reitera varias veces que esto no es deseable ni (necesariamente) factible:
âNuestros hallazgos sugieren que los marcos existentes necesitan tener en cuenta dimensiones subjetivas y contextuales, como reacciones emocionales, juicios implÃcitos y interpretaciones culturales del daÃąo. El uso frecuente de lenguaje emocional por parte de los anotadores y su divergencia de las etiquetas de daÃąo predefinidas destacan las lagunas en las prÃĄcticas de evaluaciÃģn actuales.
âAmpliar las pautas de anotaciÃģn para incluir ejemplos ilustrativos de interpretaciones culturales y emocionales diversas puede ayudar a abordar estas lagunas [âĶ]
â[âĶ] El proceso por el cual los anotadores razonan sobre imÃĄgenes ambiguas a menudo refleja sus perspectivas personales, culturales y emocionales, que son difÃciles de estructurar o estandarizar.â
Es difÃcil ver cÃģmo âAmpliar las pautas de anotaciÃģn para incluir ejemplos ilustrativos de interpretaciones culturales y emocionales diversasâ puede encajar en un sistema de calificaciÃģn racional; los autores luchan por aclarar este punto, o para formular una teorÃa distinta, atacando el material muchas veces, pero nunca superÃĄndolo. En este respecto, su tema central mismo parece âgenerado por vibeâ, incluso mientras trata con psicologÃas intangibles.
En pocas palabras, parece que extender la tuberÃa de anotaciÃģn para incluir criterios de este tipo potencialmente permite la âcancelaciÃģnâ o la ofuscaciÃģn de cualquier material (o clase de tema) que un anotador podrÃa reaccionar fuertemente.
Juicio Binario
El alcance en el que las imÃĄgenes y el texto pueden causar daÃąo es de hecho difÃcil de cuantificar, no menos porque la cultura alta a menudo se cruza con la âcultura bajaâ (por ejemplo, con arte y novelas), lo que lleva a los primeros criterios de censura âbasados en vibeâ: que incluso si el material obsceno escapa a la definiciÃģn exacta, lo conocerÃĄs cuando lo veas.
Debajo de la discusiÃģn extensa y exploratoria del nuevo artÃculo sobre la empatÃa y la sutileza cualitativa, el trabajo parece atacar silenciosamente la autoridad de las taxonomÃas centralizadas y estandarizadas (âviolenciaâ, ânudezâ, âodioâ, etc.) que permiten a las plataformas implementar y escalar la moderaciÃģn con mÃĄrgenes de error tolerables (usualmente).
El argumento que surge es que solo la retroalimentaciÃģn humana descentralizada, subjetiva y consciente del contexto puede juzgar adecuadamente la salida de GenAI.
Sin embargo, esto es claramente no escalable, ya que no se puede ejecutar un filtro de un billÃģn de imÃĄgenes en âvibesâ y experiencia vivida. Hay que cuantificar el daÃąo en propiedades diversas; establecer un lÃmite en el alcance del sistema de filtrado resultante; y esperar a nuevas directivas en âcasos de bordeâ (al igual que las partes agraviadas deben esperar a veces a la promulgaciÃģn de nuevas leyes que aborden sus circunstancias particulares).
En su lugar, el nuevo artÃculo presenta un mandato tÃĄcito para una tuberÃa de moderaciÃģn automatizada que amplÃa su alcance automÃĄticamente, y se equivoca tanto en el lado de la precauciÃģn que incluso la reacciÃģn mÃĄs particular y no replicable de un anotador podrÃa penalizar una imagen que no ha ofendido a nadie mÃĄs.
ExpansiÃģn Moral
Aunque el artÃculo se inclina hacia la exploraciÃģn en lugar de tomar una postura firme, incorpora elementos del mÃĐtodo cientÃfico: los autores desarrollaron un marco para identificar (aunque no medir estrictamente) un espectro mÃĄs amplio de reacciones de los anotadores a las imÃĄgenes, y para examinar cÃģmo estas reacciones varÃan a travÃĐs del gÃĐnero y otros factores demogrÃĄficos.
AdemÃĄs del anÃĄlisis de enfoque de daÃąoâ , el proceso analizÃģ el ârazonamiento moralâ en los comentarios auxiliares de los participantes en la prueba, que fueron solicitados para anotar un conjunto de datos de prueba modificado que contenÃa imÃĄgenes y textos/prompt asociados.
Este âautorregulador de sentimiento moralâ estaba diseÃąado para capturar los valores morales Cuidado, Igualdad, Proporcionalidad, Lealtad, Autoridad, y Pureza, segÚn lo definido en TeorÃa de Fundamentos Morales â una teorÃa psicolÃģgica que, debido a su naturaleza fluida y en evoluciÃģn, es antitÃĐtica a la creaciÃģn de definiciones concretas necesarias para sistemas de calificaciÃģn humana a gran escala.
Informados por esta teorÃa, los autores categorizaron dimensiones adicionales de seguridad, incluyendo miedo, ira, tristeza, asco, confusiÃģn, y extraÃąeza.
Los autores elaboran sobre el primero de estos, miedo:
âMuchos anotadores usaron tÃĐrminos como âespeluznanteâ (por ejemplo, para caras distorsionadas o imÃĄgenes que sugieren violencia como un arma apuntando a un niÃąo), âperturbadorâ (por ejemplo, âAbsolutamente vil ver a alguien atropellado, muy angustiante y perturbadorâ, o âPerturbador y parece sangreâ para pintura roja), o âinquietanteâ (por ejemplo, âLa imagen del niÃąo tiene muchas distorsionesâĶ Me parece de mal gusto porque parece que el niÃąo estÃĄ jugando en el lado equivocado de las barras lateralesâ).
âEl [grÃĄfico a continuaciÃģn] cuantifica âmiedoâ como la emociÃģn mÃĄs mencionada con frecuencia (233 menciones mientras que casi la mitad de estas menciones estÃĄn asociadas con contenido violento, el contenido considerado no daÃąino tambiÃĐn evocÃģ la segunda menciÃģn mÃĄs alta de miedo).â

DistribuciÃģn de tÃĐrminos relacionados con emociones a travÃĐs de categorÃas de daÃąo, con alturas de barras que indican proporciones de comentarios, recuentos de comentarios mostrados dentro de las barras y recuentos totales de comentarios mostrados encima de cada categorÃa.
Con respecto a la inclusiÃģn de estas nuevas dimensiones de seguridad, los autores afirman:
âEstos temas emergentes destacan una necesidad crÃtica de enriquecer los marcos de evaluaciÃģn de imÃĄgenes de IA al integrar elementos subjetivos, emocionales y perceptuales.â
Esto puede ser un camino peligroso, ya que parece permitir que los procesos de anotaciÃģn agreguen reglas arbitrariamente basadas en reacciones que el material puede provocar en cualquier anotador individual, en lugar de requerir que todos los anotadores se adhieran a estÃĄndares y puntos de referencia establecidos.
Si se pudiera asignar un imperativo econÃģmico a esta idea, es que este enfoque permite anotaciÃģn humana de hipercala, en el que el proceso es libre de fricciones, los participantes son autorregulados y ellos mismos deciden quÃĐ son las reglas y los lÃmites.
Bajo la anotaciÃģn estÃĄndar, las reglas se establecen por consenso humano y se adhieren a ellas los anotadores humanos; bajo el escenario previsto en el artÃculo, esa capa inicial de supervisiÃģn se elimina o se degrada: efectivamente, cualquier imagen que podrÃa ofender a alguien se marcarÃa (no menos, quizÃĄs, porque el consenso es costoso y consume tiempo).
Juicios de Rorschach
La intenciÃģn de la anotaciÃģn es llegar a una descripciÃģn o definiciÃģn precisa a travÃĐs de la supervisiÃģn de expertos, el consenso comÚn entre mÚltiples anotadores o (idealmente) ambos. En su lugar, ampliar una jerarquÃa limitada pero bien definida de daÃąos en una postura interpretativa âintuitivaâ y muy personal, es equivalente a anotar una prueba de Rorschach.
Por ejemplo, algunos anotadores, segÚn el artÃculo, interpretaron la mala calidad de la imagen (como artefactos JPEG, asà como fallos tÃĐcnicos sin sentido en una imagen) como âperturbadorâ o âindicativo de daÃąoâ:
âEsto ocurriÃģ a pesar de que la tarea omitiÃģ instrucciones sobre la calidad de la imagen. AdemÃĄs, los anotadores interpretaron estos artefactos de calidad como semÃĄnticamente significativos.
âUn anotador comentÃģ: âLa imagen no es daÃąina en absoluto; ÃĐl solo tiene una cara un poco distorsionadaâ. Al mismo tiempo, algunos anotadores interpretaron los artefactos de calidad de la imagen como daÃąo intencional, atribuyendo un significado emocional a los errores. Por ejemplo, otro anotador interpretÃģ una cara distorsionada en una imagen diferente como âindicativa de dolorââ
Al elevar las reacciones subjetivas, emocionales o especÃficas del contexto por encima de las categorÃas de seguridad predefinidas, las ideas presentadas aquà abren la puerta a un rÃĐgimen en el que anything puede ser marcado arbitrariamente como daÃąino, y donde un âefecto de enfriamientoâ de ad hoc de retiradas o recategorizaciÃģn negativa de material (es decir, material que puede âofenderâ a un grupo de interÃĐs especial) se convierte en una perspectiva real.
Â
Â
El artÃculo âJust a strange picâ: Evaluating âsafetyâ in GenAI Image safety annotation tasks from diverse annotatorsâ perspectives estÃĄ disponible en Arxiv.
* Un atajo, ya que no es el tema central aquÃ; bajo la nueva legislaciÃģn, los sitios ofensivos se espera que o bien se autopolicien; impongan sistemas de revisiÃģn complejos y costosos y tecnologÃas de verificaciÃģn de edad que estÃĄn fuera del alcance de todos excepto los sitios mÃĄs grandes; o bloqueen sus dominios para las audiencias del Reino Unido (nuevamente, a su propio costo).
â Expresado simplemente en el meme âpiensa en los niÃąosâ, que satiriza la apropiaciÃģn de la agencia moral de otro para medios aparentemente altruistas.
Â
Publicado por primera vez el viernes 25 de julio de 2025












