Ángulo de Anderson

Los sistemas de visión de IA a menudo no están “mirando” en realidad

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

Los sistemas de visión de IA pueden estar explicando imágenes con estereotipos en lugar de lo que realmente ven. Si se elimina la etiqueta, sus supuestas explicaciones visuales colapsan.

 

Desde que las plataformas de IA de vanguardia están constantemente sangrando dinero con la esperanza de un horizonte de eventos de IA, las pequeñas economías en su aprovisionamiento y servicios equivalen a grandes ahorros: por ejemplo, cada vez que un LLM puede proporcionar una respuesta desde su propia matriz entrenada en lugar de hacer un viaje basado en RAG a la web para obtener información actual que necesitará ser destilada y refinada, responde más rápidamente y ahorra dinero al proveedor.

Por supuesto, es más probable que alucine, sin gastar tokens y energía adicionales en contextualizar y verificar sus suposiciones.

De manera similar, incluso cuando un LLM llega a la web, muy a menudo citará URLs vagas, inapropiadas o incluso sin sentido y no relacionadas, porque ahorró energía al evaluar solo los metadatos de esas páginas en lugar de leerlas realmente.

De manera similar, si carga un PDF en un LLM y desea discutirlo, el LLM puede eventualmente borrar el contenido del PDF de su memoria y usar solo metadatos esparsos sobre él para responder a sus consultas, sin siquiera indicar que debe cargarlo nuevamente, lo que lleva a errores, suposiciones incorrectas y más alucinaciones.

Pruebas industriales

Estas son economías pragmáticas, si no del todo honestas, impuestas al usuario por motivos operativos. En el mundo upstream de recopilación de datos y capacitación de modelos, donde deben procesarse millones, incluso cientos de millones, de imágenes en masa, y no pueden ser anotadas a mano por humanos, la presión para minimizar el gasto de energía y tiempo es igualmente intensa.

Un atajo de este tipo es utilizar un modelo de lenguaje de visión intermedio como Contrastive Language Image Pretraining (CLIP), que asigna imágenes y texto a un espacio semántico compartido, para que los conceptos visuales puedan compararse utilizando lenguaje, en lugar de etiquetas explícitas.

¿Qué significa esto? Bueno, imagina a un niño que aprende de millones de imágenes con subtítulos hasta que desarrolla un sentido aproximado de qué imágenes y palabras van juntas de manera natural.

El problema es que, muy a menudo, los subtítulos fueron escritos por propietarios de sitios web y otras entidades que estaban más interesados en un buen SEO que en una buena etiquetado, lo que lleva a una gran cantidad de “ruido” o etiquetado inexacto.

Aun así, la escala a la que un concepto y una palabra relacionada se repiten en grandes conjuntos de datos generalmente significa que las palabras centrales se asociarán con la imagen correcta, ya que el número menor de etiquetas “sin sentido” se forzará normalmente a un ghetto de valores atípicos, y no se asociará normalmente con la imagen. Así que más o menos funciona, la mayoría de las veces.

La anotación de datos se hace de esta manera porque es barata y mínimamente funcional, no porque sea buena.

Etiquetas no oficiales

En este escenario problemático, un nuevo documento de Carnegie Mellon ilustra claramente que muchas etiquetas asignadas a imágenes, por ejemplo, por CLIP, son simplemente estereotipos basados en referirse a la etiqueta de texto de la imagen, en lugar de mirar activamente la imagen en sí.

En un ejemplo impactante del documento, CLIP se empareja con descriptores generados a partir del nombre de clase ImageNet fresa, y luego se prueba en ImageNet-Sketch, donde cada fresa es un dibujo en blanco y negro, sin embargo, los descriptores aún insisten en que la fruta es ‘roja’ y ‘madura’:

Los descriptores de nombre de clase fallan en ImageNet-Sketch: los priores del lenguaje dicen 'rojo' y 'maduro', mientras que los atributos basados en la imagen coinciden con el dibujo en blanco y negro. Fuente - https://arxiv.org/pdf/2607.18695

Los descriptores de nombre de clase fallan en ImageNet-Sketch: los priores del lenguaje dicen ‘rojo’ y ‘maduro’, mientras que los atributos basados en la imagen coinciden con el dibujo en blanco y negro. Fuente

Aquí, CLIP se empareja con descriptores generados solo a partir del nombre de clase fresa, a través de GPT-3 o conocimiento externo. Estos nunca ven la imagen, por lo que se defaul a rasgos canónicos como rojo y hojoso. Cuando se aplican a las ilustraciones monocromas en ImageNet-Sketch, el proceso falla.

Por el contrario, los atributos derivados de las imágenes en sí seleccionan características que permanecen verdaderas bajo el cambio, como punteado o en forma de corazón.

Así podemos ver que el objeto identificado se está anunciando no por lo que es, sino, por así decirlo, ‘por reputación’; los adjetivos ‘rojo’ y ‘hojoso’ son precisos para el subdominio fresa, pero exceden los límites de la imagen (instancia) en cuestión.

Los autores del nuevo trabajo – titulado Los atributos deben provenir de las imágenes, no de los nombres de clase: Selección de atributos condicionada por la distribución para modelos de visión-lenguaje – argumentan que este es un problema persistente y generalizado, y sugieren seleccionar atributos directamente de las imágenes en sí, para que reflejen lo que es realmente visible bajo cambio de distribución, en lugar de confiar en priores de nombre de clase.

Los autores afirman:

‘Una ruta popular para la clasificación cero-disparo interpretable pide a un gran modelo de lenguaje (LLM) que describa cada nombre de clase y promueve CLIP con los descriptores resultantes. Mostramos que estos descriptores llevan poca evidencia visual por sí mismos: eliminar el nombre de clase de la promoción colapsa la precisión de ImageNet del 59,5% al 15,5%.

‘El diagnóstico es que los descriptores están condicionados a la etiqueta en lugar de a las imágenes, por lo que describen el concepto en general y se equivocan exactamente cuando los datos cambian; un LLM insiste en que las fresas son rojas, pero cada fresa en ImageNet-Sketch es un dibujo en blanco y negro.

‘Por lo tanto, seleccionamos atributos de la colección de imágenes objetivo en lugar de eso: puntuamos una gran piscina de atributos contra las imágenes en el espacio de incrustación conjunta de CLIP y mantenemos solo los atributos con la mejor puntuación por clase.’

Su remedio propuesto es que el modelo permanece igual, pero en lugar de confiar en descripciones de nombre de clase, verifica un conjunto de atributos candidatos contra las imágenes, y mantiene solo aquellos que realmente encajan con lo que es visible.

El costo de esto es arguablemente aceptable, ya que no sugiere volver a invocar la energía ahorrada de los métodos “tramposos” que llevaron al problema en primer lugar. En lugar de eso, agrega un pase de puntuación sobre los atributos candidatos por clase, para que la latencia aumenta ligeramente, pero mucho menos que volver a entrenar o pipelines completos de estilo RAG. En teoría, el costo de energía sería aceptable, sopesado contra la mejora en la alineación.

Método

Dado que la metodología de las pruebas de los autores es particularmente arcanos, y dado que no se ganaría una comprensión adicional útil al examinarlos en profundidad, consideraremos, de manera inusual, solo una visión general abreviada de su enfoque.

El trabajo caracteriza el problema central como Confusión de nombre de clase: una situación en la que el rendimiento parece provenir de descriptores significativos, pero en realidad depende del nombre de clase en sí, con los descriptores agregando poco, y fallando tan pronto como ese soporte se elimina

El documento luego argumenta que este fracaso es inevitable, porque los descriptores generados a partir de un nombre de clase solo pueden describir lo que una cosa generalmente se parece, en lugar de lo que está realmente presente en una imagen particular. Tan pronto como los datos se desvían de esas expectativas, los descriptores se vuelven no solo inútiles, sino activamente engañosos, votando efectivamente en contra de la respuesta correcta.

Los investigadores también consideraron si CLIP podría simplemente ser pobre para detectar atributos sin la ayuda de etiquetas de clase, o si los descriptores generados por GPT eran demasiado genéricos para ser útiles. Sin embargo, sus experimentos posteriores refutarían ambas explicaciones.

Para abordar este problema, se utilizó un modelo congelado de CLIP para comparar imágenes contra una gran piscina de descriptores candidatos extraídos de VAW, LSA y salidas de GPT-3, manteniendo solo aquellos atributos que mejor coincidían con las imágenes, sin requerir capacitación adicional o supervisión de imagen-texto:

Una visión general del sistema propuesto: un modelo de CLIP congelado codifica tanto imágenes como una gran piscina de textos de atributos candidatos, utilizando la similitud del coseno para medir qué tan fuertemente cada descriptor coincide con el contenido visual. Los atributos con la puntuación más alta se retienen entonces por clase, produciendo un conjunto interpretable de promociones mientras se mantienen fijos el codificador de imagen y el codificador de texto a lo largo del proceso.

Una visión general del sistema propuesto: un modelo de CLIP congelado codifica tanto imágenes como una gran piscina de textos de atributos candidatos, utilizando la similitud del coseno para medir qué tan fuertemente cada descriptor coincide con el contenido visual. Los atributos con la puntuación más alta se retienen entonces por clase, produciendo un conjunto interpretable de promociones mientras se mantienen fijos el codificador de imagen y el codificador de texto a lo largo del proceso.

Datos y pruebas

Los experimentos de los autores utilizaron CLIP con un ResNet-50 como columna vertebral y evaluaron el rendimiento en ImageNet junto con cuatro variantes con cambio de distribución: ImageNetV2; ImageNet-Sketch; ImageNet-A; y ImageNet-R.

Los atributos se seleccionaron utilizando solo las imágenes de entrenamiento de ImageNet originales, lo que permitió que los conjuntos de datos con cambio de distribución sirvieran como una prueba fuera de la distribución de si los atributos derivados de la imagen seguían siendo útiles cuando las apariencias visuales cambiaban:

Precisión de clasificación de nivel superior en ImageNet y cuatro benchmarks con cambio de distribución. Los resultados muestran que el rendimiento sigue siendo ampliamente similar cuando se incluyen nombres de clase en las promociones, pero colapsa cuando los descriptores se ven obligados a sostenerse por sí mismos, lo que sugiere que gran parte de su aparente eficacia se deriva del etiquetado de clase en sí. Por el contrario, los atributos seleccionados directamente de las imágenes siguen siendo sustancialmente más informativos en todos los conjuntos de datos probados.

Precisión de clasificación de nivel superior en ImageNet y cuatro benchmarks con cambio de distribución. Los resultados muestran que el rendimiento sigue siendo ampliamente similar cuando se incluyen nombres de clase en las promociones, pero colapsa cuando los descriptores se ven obligados a sostenerse por sí mismos, lo que sugiere que gran parte de su aparente eficacia se deriva del etiquetado de clase en sí. Por el contrario, los atributos seleccionados directamente de las imágenes siguen siendo sustancialmente más informativos en todos los conjuntos de datos probados.

Re-seleccionar atributos de la misma piscina generada por GPT, pero condicionándolos en las imágenes de ImageNet, aumentó la precisión sin nombre de clase del 15,5% al 19,4%. Debido a que el modelo, la piscina de atributos y el protocolo de evaluación permanecieron sin cambios, la ganancia se puede atribuir enteramente a la selección condicionada a la imagen.

El resultado también indicó que CLIP puede identificar atributos sin etiquetas de clase, y que la piscina generada por GPT ya contenía descriptores útiles. El fracaso principal parecía estar en la generación condicionada a la etiqueta, que a menudo fallaba al revelar los atributos más relevantes para las imágenes en sí.

Aunque los autores continúan con una ronda de experimentos adicionales extensos, debemos remitir al lector al material de origen para obtener más detalles de estos, ya que, en lugar de ampliar el alcance de los resultados, solo confirman las hipótesis centrales esbozadas hasta ahora: que la confianza en las etiquetas puede potencialmente socavar el potencial de los datos de imagen reales en las aplicaciones modernas de visión por computadora, con una confianza barata en la probabilidad “reputacional” como un peligro para la precisión de los resultados.

Conclusión

Es interesante considerar la deuda que la IA generativa moderna tiene con los millones de imágenes descritas a mano que se ingirieron en grandes conjuntos de datos como Common Crawl, al comienzo de la era de hipercambio.

Cada vez que un sistema de reconocimiento de imágenes o de etiquetado automático intenta clasificar o volver a etiquetar una imagen antigua o nueva, el origen de ese conocimiento se remonta a algún vendedor que escribió ‘Revista caliente de los 70’ en la etiqueta alt de alguna lista de eBay en 2004, o algún evento similar.

Aunque muchos creen que la era dorada del llenado de palabras clave se desvaneció con el algoritmo PageRank más sofisticado de Google hace casi tres décadas, el enfoque de “pared de texto, esperemos que algo se pegue” sigue muy vivo: apenas ayer, encabezando el HTML de la página de lanzamiento del modelo Qwen-Image-3.0, había un arranque atávico (puede que todavía esté allí) de locura de llenado de palabras clave:

El código HTML para el lanzamiento de Qwen Image 3 es una pared de texto de palabras clave no del todo adecuada para trabajar, al menos en el momento de la escritura. Fuente - https://qwen.ai/blog?id=qwen-image-3.0

El código HTML para el lanzamiento de Qwen Image 3 es una pared de texto de palabras clave no del todo adecuada para trabajar, al menos en el momento de la escritura. Fuente

Ya sea que esta avalancha de palabras clave a menudo no aptas para trabajar en la página de Qwen Image 3 se haya extraído sistemáticamente de listas de destino o escrita a mano por especialistas en SEO, este es un ejemplo primario de los orígenes brutos del sistema de IA generativa moderna, con significado que a menudo lleva una gran carga de interés propio que luego necesitará ser eliminada o al menos contabilizada de alguna manera, cuando tales términos interfieren con o obstaculizan sistemas y aplicaciones racionales.

 

Publicado por primera vez el miércoles 22 de julio de 2026

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai