Ángulo de Anderson

Los sistemas de visiÃģn de IA a menudo no estÃĄn “mirando” en realidad

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

Los sistemas de visiÃģn de IA pueden estar explicando imÃĄgenes con estereotipos en lugar de lo que realmente ven. Si se elimina la etiqueta, sus supuestas explicaciones visuales colapsan.

 

Desde que las plataformas de IA de vanguardia estÃĄn constantemente sangrando dinero con la esperanza de un horizonte de eventos de IA, las pequeÃąas economías en su aprovisionamiento y servicios equivalen a grandes ahorros: por ejemplo, cada vez que un LLM puede proporcionar una respuesta desde su propia matriz entrenada en lugar de hacer un viaje basado en RAG a la web para obtener informaciÃģn actual que necesitarÃĄ ser destilada y refinada, responde mÃĄs rÃĄpidamente y ahorra dinero al proveedor.

Por supuesto, es mÃĄs probable que alucine, sin gastar tokens y energía adicionales en contextualizar y verificar sus suposiciones.

De manera similar, incluso cuando un LLM llega a la web, muy a menudo citarÃĄ URLs vagas, inapropiadas o incluso sin sentido y no relacionadas, porque ahorrÃģ energía al evaluar solo los metadatos de esas pÃĄginas en lugar de leerlas realmente.

De manera similar, si carga un PDF en un LLM y desea discutirlo, el LLM puede eventualmente borrar el contenido del PDF de su memoria y usar solo metadatos esparsos sobre ÃĐl para responder a sus consultas, sin siquiera indicar que debe cargarlo nuevamente, lo que lleva a errores, suposiciones incorrectas y mÃĄs alucinaciones.

Pruebas industriales

Estas son economías pragmÃĄticas, si no del todo honestas, impuestas al usuario por motivos operativos. En el mundo upstream de recopilaciÃģn de datos y capacitaciÃģn de modelos, donde deben procesarse millones, incluso cientos de millones, de imÃĄgenes en masa, y no pueden ser anotadas a mano por humanos, la presiÃģn para minimizar el gasto de energía y tiempo es igualmente intensa.

Un atajo de este tipo es utilizar un modelo de lenguaje de visiÃģn intermedio como Contrastive Language Image Pretraining (CLIP), que asigna imÃĄgenes y texto a un espacio semÃĄntico compartido, para que los conceptos visuales puedan compararse utilizando lenguaje, en lugar de etiquetas explícitas.

ÂŋQuÃĐ significa esto? Bueno, imagina a un niÃąo que aprende de millones de imÃĄgenes con subtítulos hasta que desarrolla un sentido aproximado de quÃĐ imÃĄgenes y palabras van juntas de manera natural.

El problema es que, muy a menudo, los subtítulos fueron escritos por propietarios de sitios web y otras entidades que estaban mÃĄs interesados en un buen SEO que en una buena etiquetado, lo que lleva a una gran cantidad de “ruido” o etiquetado inexacto.

Aun así, la escala a la que un concepto y una palabra relacionada se repiten en grandes conjuntos de datos generalmente significa que las palabras centrales se asociarÃĄn con la imagen correcta, ya que el nÚmero menor de etiquetas “sin sentido” se forzarÃĄ normalmente a un ghetto de valores atípicos, y no se asociarÃĄ normalmente con la imagen. Así que mÃĄs o menos funciona, la mayoría de las veces.

La anotaciÃģn de datos se hace de esta manera porque es barata y mínimamente funcional, no porque sea buena.

Etiquetas no oficiales

En este escenario problemÃĄtico, un nuevo documento de Carnegie Mellon ilustra claramente que muchas etiquetas asignadas a imÃĄgenes, por ejemplo, por CLIP, son simplemente estereotipos basados en referirse a la etiqueta de texto de la imagen, en lugar de mirar activamente la imagen en sí.

En un ejemplo impactante del documento, CLIP se empareja con descriptores generados a partir del nombre de clase ImageNet fresa, y luego se prueba en ImageNet-Sketch, donde cada fresa es un dibujo en blanco y negro, sin embargo, los descriptores aÚn insisten en que la fruta es ‘roja’ y ‘madura’:

Los descriptores de nombre de clase fallan en ImageNet-Sketch: los priores del lenguaje dicen 'rojo' y 'maduro', mientras que los atributos basados en la imagen coinciden con el dibujo en blanco y negro. Fuente - https://arxiv.org/pdf/2607.18695

Los descriptores de nombre de clase fallan en ImageNet-Sketch: los priores del lenguaje dicen ‘rojo’ y ‘maduro’, mientras que los atributos basados en la imagen coinciden con el dibujo en blanco y negro. Fuente

Aquí, CLIP se empareja con descriptores generados solo a partir del nombre de clase fresa, a travÃĐs de GPT-3 o conocimiento externo. Estos nunca ven la imagen, por lo que se defaul a rasgos canÃģnicos como rojo y hojoso. Cuando se aplican a las ilustraciones monocromas en ImageNet-Sketch, el proceso falla.

Por el contrario, los atributos derivados de las imÃĄgenes en sí seleccionan características que permanecen verdaderas bajo el cambio, como punteado o en forma de corazÃģn.

Así podemos ver que el objeto identificado se estÃĄ anunciando no por lo que es, sino, por así decirlo, ‘por reputaciÃģn’; los adjetivos ‘rojo’ y ‘hojoso’ son precisos para el subdominio fresa, pero exceden los límites de la imagen (instancia) en cuestiÃģn.

Los autores del nuevo trabajo – titulado Los atributos deben provenir de las imÃĄgenes, no de los nombres de clase: SelecciÃģn de atributos condicionada por la distribuciÃģn para modelos de visiÃģn-lenguaje – argumentan que este es un problema persistente y generalizado, y sugieren seleccionar atributos directamente de las imÃĄgenes en sí, para que reflejen lo que es realmente visible bajo cambio de distribuciÃģn, en lugar de confiar en priores de nombre de clase.

Los autores afirman:

‘Una ruta popular para la clasificaciÃģn cero-disparo interpretable pide a un gran modelo de lenguaje (LLM) que describa cada nombre de clase y promueve CLIP con los descriptores resultantes. Mostramos que estos descriptores llevan poca evidencia visual por sí mismos: eliminar el nombre de clase de la promociÃģn colapsa la precisiÃģn de ImageNet del 59,5% al 15,5%.

‘El diagnÃģstico es que los descriptores estÃĄn condicionados a la etiqueta en lugar de a las imÃĄgenes, por lo que describen el concepto en general y se equivocan exactamente cuando los datos cambian; un LLM insiste en que las fresas son rojas, pero cada fresa en ImageNet-Sketch es un dibujo en blanco y negro.

‘Por lo tanto, seleccionamos atributos de la colecciÃģn de imÃĄgenes objetivo en lugar de eso: puntuamos una gran piscina de atributos contra las imÃĄgenes en el espacio de incrustaciÃģn conjunta de CLIP y mantenemos solo los atributos con la mejor puntuaciÃģn por clase.’

Su remedio propuesto es que el modelo permanece igual, pero en lugar de confiar en descripciones de nombre de clase, verifica un conjunto de atributos candidatos contra las imÃĄgenes, y mantiene solo aquellos que realmente encajan con lo que es visible.

El costo de esto es arguablemente aceptable, ya que no sugiere volver a invocar la energía ahorrada de los mÃĐtodos “tramposos” que llevaron al problema en primer lugar. En lugar de eso, agrega un pase de puntuaciÃģn sobre los atributos candidatos por clase, para que la latencia aumenta ligeramente, pero mucho menos que volver a entrenar o pipelines completos de estilo RAG. En teoría, el costo de energía sería aceptable, sopesado contra la mejora en la alineaciÃģn.

MÃĐtodo

Dado que la metodología de las pruebas de los autores es particularmente arcanos, y dado que no se ganaría una comprensiÃģn adicional Útil al examinarlos en profundidad, consideraremos, de manera inusual, solo una visiÃģn general abreviada de su enfoque.

El trabajo caracteriza el problema central como ConfusiÃģn de nombre de clase: una situaciÃģn en la que el rendimiento parece provenir de descriptores significativos, pero en realidad depende del nombre de clase en sí, con los descriptores agregando poco, y fallando tan pronto como ese soporte se elimina

El documento luego argumenta que este fracaso es inevitable, porque los descriptores generados a partir de un nombre de clase solo pueden describir lo que una cosa generalmente se parece, en lugar de lo que estÃĄ realmente presente en una imagen particular. Tan pronto como los datos se desvían de esas expectativas, los descriptores se vuelven no solo inÚtiles, sino activamente engaÃąosos, votando efectivamente en contra de la respuesta correcta.

Los investigadores tambiÃĐn consideraron si CLIP podría simplemente ser pobre para detectar atributos sin la ayuda de etiquetas de clase, o si los descriptores generados por GPT eran demasiado genÃĐricos para ser Útiles. Sin embargo, sus experimentos posteriores refutarían ambas explicaciones.

Para abordar este problema, se utilizÃģ un modelo congelado de CLIP para comparar imÃĄgenes contra una gran piscina de descriptores candidatos extraídos de VAW, LSA y salidas de GPT-3, manteniendo solo aquellos atributos que mejor coincidían con las imÃĄgenes, sin requerir capacitaciÃģn adicional o supervisiÃģn de imagen-texto:

Una visiÃģn general del sistema propuesto: un modelo de CLIP congelado codifica tanto imÃĄgenes como una gran piscina de textos de atributos candidatos, utilizando la similitud del coseno para medir quÃĐ tan fuertemente cada descriptor coincide con el contenido visual. Los atributos con la puntuaciÃģn mÃĄs alta se retienen entonces por clase, produciendo un conjunto interpretable de promociones mientras se mantienen fijos el codificador de imagen y el codificador de texto a lo largo del proceso.

Una visiÃģn general del sistema propuesto: un modelo de CLIP congelado codifica tanto imÃĄgenes como una gran piscina de textos de atributos candidatos, utilizando la similitud del coseno para medir quÃĐ tan fuertemente cada descriptor coincide con el contenido visual. Los atributos con la puntuaciÃģn mÃĄs alta se retienen entonces por clase, produciendo un conjunto interpretable de promociones mientras se mantienen fijos el codificador de imagen y el codificador de texto a lo largo del proceso.

Datos y pruebas

Los experimentos de los autores utilizaron CLIP con un ResNet-50 como columna vertebral y evaluaron el rendimiento en ImageNet junto con cuatro variantes con cambio de distribuciÃģn: ImageNetV2; ImageNet-Sketch; ImageNet-A; y ImageNet-R.

Los atributos se seleccionaron utilizando solo las imÃĄgenes de entrenamiento de ImageNet originales, lo que permitiÃģ que los conjuntos de datos con cambio de distribuciÃģn sirvieran como una prueba fuera de la distribuciÃģn de si los atributos derivados de la imagen seguían siendo Útiles cuando las apariencias visuales cambiaban:

PrecisiÃģn de clasificaciÃģn de nivel superior en ImageNet y cuatro benchmarks con cambio de distribuciÃģn. Los resultados muestran que el rendimiento sigue siendo ampliamente similar cuando se incluyen nombres de clase en las promociones, pero colapsa cuando los descriptores se ven obligados a sostenerse por sí mismos, lo que sugiere que gran parte de su aparente eficacia se deriva del etiquetado de clase en sí. Por el contrario, los atributos seleccionados directamente de las imÃĄgenes siguen siendo sustancialmente mÃĄs informativos en todos los conjuntos de datos probados.

PrecisiÃģn de clasificaciÃģn de nivel superior en ImageNet y cuatro benchmarks con cambio de distribuciÃģn. Los resultados muestran que el rendimiento sigue siendo ampliamente similar cuando se incluyen nombres de clase en las promociones, pero colapsa cuando los descriptores se ven obligados a sostenerse por sí mismos, lo que sugiere que gran parte de su aparente eficacia se deriva del etiquetado de clase en sí. Por el contrario, los atributos seleccionados directamente de las imÃĄgenes siguen siendo sustancialmente mÃĄs informativos en todos los conjuntos de datos probados.

Re-seleccionar atributos de la misma piscina generada por GPT, pero condicionÃĄndolos en las imÃĄgenes de ImageNet, aumentÃģ la precisiÃģn sin nombre de clase del 15,5% al 19,4%. Debido a que el modelo, la piscina de atributos y el protocolo de evaluaciÃģn permanecieron sin cambios, la ganancia se puede atribuir enteramente a la selecciÃģn condicionada a la imagen.

El resultado tambiÃĐn indicÃģ que CLIP puede identificar atributos sin etiquetas de clase, y que la piscina generada por GPT ya contenía descriptores Útiles. El fracaso principal parecía estar en la generaciÃģn condicionada a la etiqueta, que a menudo fallaba al revelar los atributos mÃĄs relevantes para las imÃĄgenes en sí.

Aunque los autores continÚan con una ronda de experimentos adicionales extensos, debemos remitir al lector al material de origen para obtener mÃĄs detalles de estos, ya que, en lugar de ampliar el alcance de los resultados, solo confirman las hipÃģtesis centrales esbozadas hasta ahora: que la confianza en las etiquetas puede potencialmente socavar el potencial de los datos de imagen reales en las aplicaciones modernas de visiÃģn por computadora, con una confianza barata en la probabilidad “reputacional” como un peligro para la precisiÃģn de los resultados.

ConclusiÃģn

Es interesante considerar la deuda que la IA generativa moderna tiene con los millones de imÃĄgenes descritas a mano que se ingirieron en grandes conjuntos de datos como Common Crawl, al comienzo de la era de hipercambio.

Cada vez que un sistema de reconocimiento de imÃĄgenes o de etiquetado automÃĄtico intenta clasificar o volver a etiquetar una imagen antigua o nueva, el origen de ese conocimiento se remonta a algÚn vendedor que escribiÃģ ‘Revista caliente de los 70’ en la etiqueta alt de alguna lista de eBay en 2004, o algÚn evento similar.

Aunque muchos creen que la era dorada del llenado de palabras clave se desvaneciÃģ con el algoritmo PageRank mÃĄs sofisticado de Google hace casi tres dÃĐcadas, el enfoque de “pared de texto, esperemos que algo se pegue” sigue muy vivo: apenas ayer, encabezando el HTML de la pÃĄgina de lanzamiento del modelo Qwen-Image-3.0, había un arranque atÃĄvico (puede que todavía estÃĐ allí) de locura de llenado de palabras clave:

El cÃģdigo HTML para el lanzamiento de Qwen Image 3 es una pared de texto de palabras clave no del todo adecuada para trabajar, al menos en el momento de la escritura. Fuente - https://qwen.ai/blog?id=qwen-image-3.0

El cÃģdigo HTML para el lanzamiento de Qwen Image 3 es una pared de texto de palabras clave no del todo adecuada para trabajar, al menos en el momento de la escritura. Fuente

Ya sea que esta avalancha de palabras clave a menudo no aptas para trabajar en la pÃĄgina de Qwen Image 3 se haya extraído sistemÃĄticamente de listas de destino o escrita a mano por especialistas en SEO, este es un ejemplo primario de los orígenes brutos del sistema de IA generativa moderna, con significado que a menudo lleva una gran carga de interÃĐs propio que luego necesitarÃĄ ser eliminada o al menos contabilizada de alguna manera, cuando tales tÃĐrminos interfieren con o obstaculizan sistemas y aplicaciones racionales.

 

Publicado por primera vez el miÃĐrcoles 22 de julio de 2026

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]