Ãngulo de Anderson
Los sistemas de visiÃģn de IA a menudo no estÃĄn “mirando” en realidad

Los sistemas de visiÃģn de IA pueden estar explicando imÃĄgenes con estereotipos en lugar de lo que realmente ven. Si se elimina la etiqueta, sus supuestas explicaciones visuales colapsan.
Â
Desde que las plataformas de IA de vanguardia estÃĄn constantemente sangrando dinero con la esperanza de un horizonte de eventos de IA, las pequeÃąas economÃas en su aprovisionamiento y servicios equivalen a grandes ahorros: por ejemplo, cada vez que un LLM puede proporcionar una respuesta desde su propia matriz entrenada en lugar de hacer un viaje basado en RAG a la web para obtener informaciÃģn actual que necesitarÃĄ ser destilada y refinada, responde mÃĄs rÃĄpidamente y ahorra dinero al proveedor.
Por supuesto, es mÃĄs probable que alucine, sin gastar tokens y energÃa adicionales en contextualizar y verificar sus suposiciones.
De manera similar, incluso cuando un LLM llega a la web, muy a menudo citarÃĄ URLs vagas, inapropiadas o incluso sin sentido y no relacionadas, porque ahorrÃģ energÃa al evaluar solo los metadatos de esas pÃĄginas en lugar de leerlas realmente.
De manera similar, si carga un PDF en un LLM y desea discutirlo, el LLM puede eventualmente borrar el contenido del PDF de su memoria y usar solo metadatos esparsos sobre ÃĐl para responder a sus consultas, sin siquiera indicar que debe cargarlo nuevamente, lo que lleva a errores, suposiciones incorrectas y mÃĄs alucinaciones.
Pruebas industriales
Estas son economÃas pragmÃĄticas, si no del todo honestas, impuestas al usuario por motivos operativos. En el mundo upstream de recopilaciÃģn de datos y capacitaciÃģn de modelos, donde deben procesarse millones, incluso cientos de millones, de imÃĄgenes en masa, y no pueden ser anotadas a mano por humanos, la presiÃģn para minimizar el gasto de energÃa y tiempo es igualmente intensa.
Un atajo de este tipo es utilizar un modelo de lenguaje de visiÃģn intermedio como Contrastive Language Image Pretraining (CLIP), que asigna imÃĄgenes y texto a un espacio semÃĄntico compartido, para que los conceptos visuales puedan compararse utilizando lenguaje, en lugar de etiquetas explÃcitas.
ÂŋQuÃĐ significa esto? Bueno, imagina a un niÃąo que aprende de millones de imÃĄgenes con subtÃtulos hasta que desarrolla un sentido aproximado de quÃĐ imÃĄgenes y palabras van juntas de manera natural.
El problema es que, muy a menudo, los subtÃtulos fueron escritos por propietarios de sitios web y otras entidades que estaban mÃĄs interesados en un buen SEO que en una buena etiquetado, lo que lleva a una gran cantidad de âruidoâ o etiquetado inexacto.
Aun asÃ, la escala a la que un concepto y una palabra relacionada se repiten en grandes conjuntos de datos generalmente significa que las palabras centrales se asociarÃĄn con la imagen correcta, ya que el nÚmero menor de etiquetas âsin sentidoâ se forzarÃĄ normalmente a un ghetto de valores atÃpicos, y no se asociarÃĄ normalmente con la imagen. Asà que mÃĄs o menos funciona, la mayorÃa de las veces.
La anotaciÃģn de datos se hace de esta manera porque es barata y mÃnimamente funcional, no porque sea buena.
Etiquetas no oficiales
En este escenario problemÃĄtico, un nuevo documento de Carnegie Mellon ilustra claramente que muchas etiquetas asignadas a imÃĄgenes, por ejemplo, por CLIP, son simplemente estereotipos basados en referirse a la etiqueta de texto de la imagen, en lugar de mirar activamente la imagen en sÃ.
En un ejemplo impactante del documento, CLIP se empareja con descriptores generados a partir del nombre de clase ImageNet fresa, y luego se prueba en ImageNet-Sketch, donde cada fresa es un dibujo en blanco y negro, sin embargo, los descriptores aÚn insisten en que la fruta es ârojaâ y âmaduraâ:

Los descriptores de nombre de clase fallan en ImageNet-Sketch: los priores del lenguaje dicen ârojoâ y âmaduroâ, mientras que los atributos basados en la imagen coinciden con el dibujo en blanco y negro. Fuente
AquÃ, CLIP se empareja con descriptores generados solo a partir del nombre de clase fresa, a travÃĐs de GPT-3 o conocimiento externo. Estos nunca ven la imagen, por lo que se defaul a rasgos canÃģnicos como rojo y hojoso. Cuando se aplican a las ilustraciones monocromas en ImageNet-Sketch, el proceso falla.
Por el contrario, los atributos derivados de las imÃĄgenes en sà seleccionan caracterÃsticas que permanecen verdaderas bajo el cambio, como punteado o en forma de corazÃģn.
Asà podemos ver que el objeto identificado se estÃĄ anunciando no por lo que es, sino, por asà decirlo, âpor reputaciÃģnâ; los adjetivos ârojoâ y âhojosoâ son precisos para el subdominio fresa, pero exceden los lÃmites de la imagen (instancia) en cuestiÃģn.
Los autores del nuevo trabajo â titulado Los atributos deben provenir de las imÃĄgenes, no de los nombres de clase: SelecciÃģn de atributos condicionada por la distribuciÃģn para modelos de visiÃģn-lenguaje â argumentan que este es un problema persistente y generalizado, y sugieren seleccionar atributos directamente de las imÃĄgenes en sÃ, para que reflejen lo que es realmente visible bajo cambio de distribuciÃģn, en lugar de confiar en priores de nombre de clase.
Los autores afirman:
âUna ruta popular para la clasificaciÃģn cero-disparo interpretable pide a un gran modelo de lenguaje (LLM) que describa cada nombre de clase y promueve CLIP con los descriptores resultantes. Mostramos que estos descriptores llevan poca evidencia visual por sà mismos: eliminar el nombre de clase de la promociÃģn colapsa la precisiÃģn de ImageNet del 59,5% al 15,5%.
âEl diagnÃģstico es que los descriptores estÃĄn condicionados a la etiqueta en lugar de a las imÃĄgenes, por lo que describen el concepto en general y se equivocan exactamente cuando los datos cambian; un LLM insiste en que las fresas son rojas, pero cada fresa en ImageNet-Sketch es un dibujo en blanco y negro.
âPor lo tanto, seleccionamos atributos de la colecciÃģn de imÃĄgenes objetivo en lugar de eso: puntuamos una gran piscina de atributos contra las imÃĄgenes en el espacio de incrustaciÃģn conjunta de CLIP y mantenemos solo los atributos con la mejor puntuaciÃģn por clase.â
Su remedio propuesto es que el modelo permanece igual, pero en lugar de confiar en descripciones de nombre de clase, verifica un conjunto de atributos candidatos contra las imÃĄgenes, y mantiene solo aquellos que realmente encajan con lo que es visible.
El costo de esto es arguablemente aceptable, ya que no sugiere volver a invocar la energÃa ahorrada de los mÃĐtodos âtrampososâ que llevaron al problema en primer lugar. En lugar de eso, agrega un pase de puntuaciÃģn sobre los atributos candidatos por clase, para que la latencia aumenta ligeramente, pero mucho menos que volver a entrenar o pipelines completos de estilo RAG. En teorÃa, el costo de energÃa serÃa aceptable, sopesado contra la mejora en la alineaciÃģn.
MÃĐtodo
Dado que la metodologÃa de las pruebas de los autores es particularmente arcanos, y dado que no se ganarÃa una comprensiÃģn adicional Útil al examinarlos en profundidad, consideraremos, de manera inusual, solo una visiÃģn general abreviada de su enfoque.
El trabajo caracteriza el problema central como ConfusiÃģn de nombre de clase: una situaciÃģn en la que el rendimiento parece provenir de descriptores significativos, pero en realidad depende del nombre de clase en sÃ, con los descriptores agregando poco, y fallando tan pronto como ese soporte se elimina
El documento luego argumenta que este fracaso es inevitable, porque los descriptores generados a partir de un nombre de clase solo pueden describir lo que una cosa generalmente se parece, en lugar de lo que estÃĄ realmente presente en una imagen particular. Tan pronto como los datos se desvÃan de esas expectativas, los descriptores se vuelven no solo inÚtiles, sino activamente engaÃąosos, votando efectivamente en contra de la respuesta correcta.
Los investigadores tambiÃĐn consideraron si CLIP podrÃa simplemente ser pobre para detectar atributos sin la ayuda de etiquetas de clase, o si los descriptores generados por GPT eran demasiado genÃĐricos para ser Útiles. Sin embargo, sus experimentos posteriores refutarÃan ambas explicaciones.
Para abordar este problema, se utilizÃģ un modelo congelado de CLIP para comparar imÃĄgenes contra una gran piscina de descriptores candidatos extraÃdos de VAW, LSA y salidas de GPT-3, manteniendo solo aquellos atributos que mejor coincidÃan con las imÃĄgenes, sin requerir capacitaciÃģn adicional o supervisiÃģn de imagen-texto:

Una visiÃģn general del sistema propuesto: un modelo de CLIP congelado codifica tanto imÃĄgenes como una gran piscina de textos de atributos candidatos, utilizando la similitud del coseno para medir quÃĐ tan fuertemente cada descriptor coincide con el contenido visual. Los atributos con la puntuaciÃģn mÃĄs alta se retienen entonces por clase, produciendo un conjunto interpretable de promociones mientras se mantienen fijos el codificador de imagen y el codificador de texto a lo largo del proceso.
Datos y pruebas
Los experimentos de los autores utilizaron CLIP con un ResNet-50 como columna vertebral y evaluaron el rendimiento en ImageNet junto con cuatro variantes con cambio de distribuciÃģn: ImageNetV2; ImageNet-Sketch; ImageNet-A; y ImageNet-R.
Los atributos se seleccionaron utilizando solo las imÃĄgenes de entrenamiento de ImageNet originales, lo que permitiÃģ que los conjuntos de datos con cambio de distribuciÃģn sirvieran como una prueba fuera de la distribuciÃģn de si los atributos derivados de la imagen seguÃan siendo Útiles cuando las apariencias visuales cambiaban:

PrecisiÃģn de clasificaciÃģn de nivel superior en ImageNet y cuatro benchmarks con cambio de distribuciÃģn. Los resultados muestran que el rendimiento sigue siendo ampliamente similar cuando se incluyen nombres de clase en las promociones, pero colapsa cuando los descriptores se ven obligados a sostenerse por sà mismos, lo que sugiere que gran parte de su aparente eficacia se deriva del etiquetado de clase en sÃ. Por el contrario, los atributos seleccionados directamente de las imÃĄgenes siguen siendo sustancialmente mÃĄs informativos en todos los conjuntos de datos probados.
Re-seleccionar atributos de la misma piscina generada por GPT, pero condicionÃĄndolos en las imÃĄgenes de ImageNet, aumentÃģ la precisiÃģn sin nombre de clase del 15,5% al 19,4%. Debido a que el modelo, la piscina de atributos y el protocolo de evaluaciÃģn permanecieron sin cambios, la ganancia se puede atribuir enteramente a la selecciÃģn condicionada a la imagen.
El resultado tambiÃĐn indicÃģ que CLIP puede identificar atributos sin etiquetas de clase, y que la piscina generada por GPT ya contenÃa descriptores Útiles. El fracaso principal parecÃa estar en la generaciÃģn condicionada a la etiqueta, que a menudo fallaba al revelar los atributos mÃĄs relevantes para las imÃĄgenes en sÃ.
Aunque los autores continÚan con una ronda de experimentos adicionales extensos, debemos remitir al lector al material de origen para obtener mÃĄs detalles de estos, ya que, en lugar de ampliar el alcance de los resultados, solo confirman las hipÃģtesis centrales esbozadas hasta ahora: que la confianza en las etiquetas puede potencialmente socavar el potencial de los datos de imagen reales en las aplicaciones modernas de visiÃģn por computadora, con una confianza barata en la probabilidad âreputacionalâ como un peligro para la precisiÃģn de los resultados.
ConclusiÃģn
Es interesante considerar la deuda que la IA generativa moderna tiene con los millones de imÃĄgenes descritas a mano que se ingirieron en grandes conjuntos de datos como Common Crawl, al comienzo de la era de hipercambio.
Cada vez que un sistema de reconocimiento de imÃĄgenes o de etiquetado automÃĄtico intenta clasificar o volver a etiquetar una imagen antigua o nueva, el origen de ese conocimiento se remonta a algÚn vendedor que escribiÃģ âRevista caliente de los 70â en la etiqueta alt de alguna lista de eBay en 2004, o algÚn evento similar.
Aunque muchos creen que la era dorada del llenado de palabras clave se desvaneciÃģ con el algoritmo PageRank mÃĄs sofisticado de Google hace casi tres dÃĐcadas, el enfoque de âpared de texto, esperemos que algo se pegueâ sigue muy vivo: apenas ayer, encabezando el HTML de la pÃĄgina de lanzamiento del modelo Qwen-Image-3.0, habÃa un arranque atÃĄvico (puede que todavÃa estÃĐ allÃ) de locura de llenado de palabras clave:

El cÃģdigo HTML para el lanzamiento de Qwen Image 3 es una pared de texto de palabras clave no del todo adecuada para trabajar, al menos en el momento de la escritura. Fuente
Ya sea que esta avalancha de palabras clave a menudo no aptas para trabajar en la pÃĄgina de Qwen Image 3 se haya extraÃdo sistemÃĄticamente de listas de destino o escrita a mano por especialistas en SEO, este es un ejemplo primario de los orÃgenes brutos del sistema de IA generativa moderna, con significado que a menudo lleva una gran carga de interÃĐs propio que luego necesitarÃĄ ser eliminada o al menos contabilizada de alguna manera, cuando tales tÃĐrminos interfieren con o obstaculizan sistemas y aplicaciones racionales.
Â
Publicado por primera vez el miÃĐrcoles 22 de julio de 2026












