Ãngulo de Anderson
Llevando analogÃas visuales a la IA

Los modelos de IA actuales no reconocen las âsimilitudes relacionalesâ de las imÃĄgenes, como la similitud entre las capas de la Tierra y una melocotÃģn, lo que supone una falta de un aspecto clave de cÃģmo los humanos percibimos las imÃĄgenes.
Â
Aunque existen muchos modelos de visiÃģn por computadora capaces de comparar imÃĄgenes y encontrar similitudes entre ellas, la generaciÃģn actual de sistemas comparativos tiene poca o ninguna capacidad imaginativa. Consideremos algunas de las letras de la canciÃģn clÃĄsica de los aÃąos 60, Windmills of Your Mind:
Como un carrusel que gira, corriendo en cÃrculos alrededor de la luna
Como un reloj cuyas manecillas pasan por los minutos de su cara
Y el mundo es como una manzana que gira silenciosamente en el espacio
Las comparaciones de este tipo representan un dominio de alusiÃģn poÃĐtica que es significativo para los humanos de una manera que va mucho mÃĄs allÃĄ de la expresiÃģn artÃstica; mÃĄs bien, estÃĄ relacionado con cÃģmo desarrollamos nuestros sistemas perceptivos; a medida que creamos nuestro âdominio de objetosâ, desarrollamos una capacidad para la similitud visual, de modo que â por ejemplo â secciones transversales que muestran una melocotÃģn y el planeta Tierra, o recurrencias fractales como espirales de cafÃĐ y ramas de galaxias, se registran como anÃĄlogas para nosotros.
De esta manera, podemos deducir conexiones entre objetos y tipos de objetos aparentemente no relacionados, e inferir sistemas (como la gravedad, el momento y la cohesiÃģn superficial) que pueden aplicarse a una variedad de dominios a diferentes escalas.
Viendo las cosas
Incluso los sistemas de comparaciÃģn de imÃĄgenes de Última generaciÃģn, como LPIPS y DINO, que se informan con retroalimentaciÃģn humana, solo realizan comparaciones superficiales literales.
Su capacidad para encontrar caras donde no existen â es decir, pareidolia â no representa el tipo de mecanismos de similitud visual que los humanos desarrollan, sino que ocurre porque los algoritmos de bÚsqueda de caras utilizan caracterÃsticas de estructura de cara de bajo nivel que a veces coinciden con objetos aleatorios:

Ejemplos de falsos positivos para el reconocimiento facial en el conjunto de datos âFaces with Thingsâ. Fuente
Para determinar si las mÃĄquinas pueden desarrollar realmente nuestra capacidad imaginativa para reconocer la similitud visual a travÃĐs de dominios, los investigadores en EE. UU. han realizado un estudio sobre Similitud Visual Relacional, curando y entrenando un nuevo conjunto de datos diseÃąado para forzar la formaciÃģn de relaciones abstractas entre objetos diferentes que, sin embargo, estÃĄn unidos por una relaciÃģn abstracta:

La mayorÃa de los modelos de IA solo reconocen similitud cuando las imÃĄgenes comparten rasgos de superficie como forma o color, por lo que solo enlazarÃan el Grupo B (arriba) con la referencia. Los humanos, por otro lado, tambiÃĐn ven el Grupo A como similar â no porque las imÃĄgenes se parezcan, sino porque siguen la misma lÃģgica subyacente, como mostrar una transformaciÃģn en el tiempo. El nuevo trabajo intenta reproducir este tipo de similitud estructural o relacional, con el objetivo de acercar la percepciÃģn de la mÃĄquina a la razonamiento humano. Fuente: https://arxiv.org/pdf/2512.07833
El sistema de captionado desarrollado para el conjunto de datos facilita anotaciones abstractas inusuales, diseÃąadas para forzar a los sistemas de IA a centrarse en caracterÃsticas bÃĄsicas en lugar de detalles locales especÃficos:

Las captions âanÃģnimasâ predichas que contribuyen a la mÃĐtrica ârelsimâ de los autores.
La colecciÃģn curada y su estilo de captionado inusual alimentan la nueva mÃĐtrica propuesta por los autores, relsim, que los autores han ajustado en un modelo de visiÃģn-lenguaje (VLM).

ComparaciÃģn entre el estilo de captionado de conjuntos de datos tÃpicos, que se centra en la similitud de atributos, mientras que el enfoque relsim (fila inferior) enfatiza la similitud relacional.
El nuevo enfoque se basa en metodologÃas de la ciencia cognitiva, en particular la teorÃa de Mapeo de Estructuras de Dedre Gentner (un estudio de analogÃa) y la definiciÃģn de similitud relacional y de atributos de Amos Tversky.

Del sitio web del proyecto asociado, un ejemplo de similitud relacional. Fuente
Los autores afirman:
â[Los humanos] procesan la similitud de atributos perceptualmente, pero la similitud relacional requiere abstracciÃģn conceptual, a menudo apoyada por el lenguaje o el conocimiento previo. Esto sugiere que reconocer la similitud relacional primero requiere entender la imagen, basÃĄndose en el conocimiento y abstrayendo su estructura subyacente.â
El nuevo artÃculo se titula Similitud Visual Relacional y viene con un sitio web del proyecto (ver video incrustado al final de este artÃculo).
MÃĐtodo
Los investigadores utilizaron uno de los conjuntos de datos hiperescala mÃĄs conocidos como punto de partida para su propia colecciÃģn â LAION-2B:

Metadatos para una entrada en la colecciÃģn LAION-2B. Fuente
Se extrajeron 114,000 imÃĄgenes que probablemente contuvieran estructuras relacionales elÃĄsticas de LAION-2B, lo que implicÃģ el filtrado de las muchas imÃĄgenes de baja calidad presentes en el conjunto de datos mÃnimamente curado.
Para crear una canalizaciÃģn para este proceso de selecciÃģn, los autores utilizaron Qwen2.5-VL-7B, aprovechando 1,300 ejemplos positivos y 11,000 negativos etiquetados por humanos:

El sistema relsim se entrena en tres etapas: filtrar imÃĄgenes de LAION-2B para contenido relacional; asignar a cada grupo una caption anÃģnima compartida que capture su lÃģgica subyacente; y aprender a emparejar imÃĄgenes con esas captions utilizando una pÃĐrdida contrastiva.
El artÃculo afirma:
âLos anotadores recibieron las siguientes instrucciones: âÂŋPuede ver algÚn patrÃģn relacional, lÃģgica o estructura en esta imagen que podrÃa ser Útil para crear o enlazar con otra imagen?â. El modelo ajustado logra un 93% de acuerdo con los juicios humanos, y cuando se aplica a LAION-2B, produce N = 114k imÃĄgenes identificadas como relacionalmente interesantes.â
Para generar etiquetas relacionales, los investigadores solicitaron al modelo Qwen que describiera la lÃģgica compartida detrÃĄs de conjuntos de imÃĄgenes sin nombrar objetos especÃficos. Esta abstracciÃģn fue difÃcil de obtener cuando el modelo veÃa solo una imagen, pero se volviÃģ factible cuando mÚltiples ejemplos demostraban el patrÃģn subyacente.
Las captions de grupo resultantes reemplazaron tÃĐrminos especÃficos con marcadores de posiciÃģn como â{Sujeto}â o â{Tipo de Movimiento}â, haciÃĐndolos ampliamente aplicables.
DespuÃĐs de la verificaciÃģn humana, cada caption se emparejÃģ con todas las imÃĄgenes de su grupo. MÃĄs de 500 grupos de este tipo se utilizaron para entrenar el modelo, que luego se aplicÃģ a las 114,000 imÃĄgenes filtradas para producir un gran conjunto de muestras anotadas de manera abstracta y relacional.
Datos y pruebas
DespuÃĐs de la extracciÃģn de caracterÃsticas relacionales con Qwen2.5-VL-7B, un modelo se ajustÃģ en los datos utilizando LoRA, durante 15,000 pasos, a travÃĐs de ocho GPU A100*. Para el lado de texto, las captions relacionales se incrustaron utilizando all-MiniLM-L6-v2 de la biblioteca Sentence-Transformers.
El conjunto de datos de 114,000 imÃĄgenes con captions se dividiÃģ en 100,000 para entrenamiento y 14,000 para evaluaciÃģn. Para probar el sistema, se utilizÃģ un entorno de recuperaciÃģn: dado una imagen de consulta, el modelo debÃa encontrar una imagen diferente de un grupo de 28,000 elementos que expresara la misma idea relacional. El grupo de recuperaciÃģn incluÃa 14,000 imÃĄgenes de evaluaciÃģn y 14,000 muestras adicionales de LAION-2B, con 1,000 consultas seleccionadas aleatoriamente del conjunto de evaluaciÃģn para la evaluaciÃģn.
Para evaluar la calidad de recuperaciÃģn, se utilizÃģ GPT-4o para puntuar la similitud relacional entre cada consulta y la imagen recuperada en una escala de 0 a 10. TambiÃĐn se realizÃģ un estudio humano separado para evaluar la preferencia del usuario (ver a continuaciÃģn).
Cada participante vio una imagen de consulta anÃģnima con dos candidatas, una recuperada por el mÃĐtodo propuesto y la otra por una referencia. Los participantes fueron preguntados cuÃĄl de las imÃĄgenes era mÃĄs relacionalmente similar a la consulta, o si ambas eran igualmente cercanas. Para cada referencia, se crearon 300 tripletas y se calificaron por al menos tres personas cada una, lo que dio como resultado alrededor de 900 respuestas.
El enfoque relsim se comparÃģ con varios mÃĐtodos de similitud de imagen a imagen establecidos, incluidos el mencionado LPIPS y DINO, asà como dreamsim y CLIP-I. AdemÃĄs de las referencias que computan directamente puntuaciones de similitud entre pares de imÃĄgenes, como LPIPS, DINO, dreamsim y CLIP-I, los autores tambiÃĐn probaron mÃĐtodos basados en captions en los que Qwen se utilizÃģ para generar una caption anÃģnima o abstracta para cada imagen.; esto luego sirviÃģ como la consulta de recuperaciÃģn.
Se evaluaron dos variantes de recuperaciÃģn, con recuperaciÃģn de imagen a texto basada en CLIP (CLIP-T) para recuperaciÃģn de texto a imagen, y Qwen-T utilizando recuperaciÃģn de texto a texto. Ambas referencias basadas en captions utilizaron el modelo Qwen preentrenado original en lugar de la versiÃģn ajustada en la lÃģgica relacional. Esto permitiÃģ a los autores aislar el efecto de la capacitaciÃģn basada en grupos, ya que el modelo ajustado habÃa sido expuesto a conjuntos de imÃĄgenes, en lugar de ejemplos aislados.
MÃĐtricas existentes y similitud relacional
Los autores inicialmente probaron si las mÃĐtricas existentes podÃan capturar la similitud relacional:

ComparaciÃģn del rendimiento de recuperaciÃģn segÚn la puntuaciÃģn de GPT-4o, mostrando la puntuaciÃģn de similitud relacional promedio para cada mÃĐtodo. Las mÃĐtricas de similitud convencionales como LPIPS, DINO y CLIP-I obtuvieron puntuaciones mÃĄs bajas. Las referencias basadas en captions Qwen-T y CLIP-T tambiÃĐn tuvieron un desempeÃąo inferior. La puntuaciÃģn mÃĄs alta se logrÃģ con relsim (6.77, columna azul mÃĄs a la derecha), lo que indica que ajustar en patrones relacionales de grupo mejorÃģ la alineaciÃģn con las evaluaciones de GPT-4o.
En cuanto a estos resultados, los autores afirman**:
â[LPIPS], que se centra puramente en la similitud perceptual, logra la puntuaciÃģn mÃĄs baja (4.56). [DINO] funciona ligeramente mejor (5.14), probablemente porque se entrena Únicamente de manera auto-supervisada en datos de imÃĄgenes. [CLIP-I] produce los resultados mÃĄs fuertes entre las referencias (5.91), presumiblemente porque a veces hay alguna abstracciÃģn presente en las captions de las imÃĄgenes.
âSin embargo, CLIP-I todavÃa tiene un desempeÃąo inferior en comparaciÃģn con nuestro mÃĐtodo, ya que lograr una puntuaciÃģn mejor puede requerir la capacidad de alcanzar abstracciones de nivel aÚn mÃĄs alto, como las presentes en las captions anÃģnimas.â
En el estudio de usuarios, los humanos consistentemente prefirieron el mÃĐtodo relsim en comparaciÃģn con todas las referencias:

Puntuaciones de similitud relacional asignadas por GPT-4o para cada mÃĐtodo. Las mÃĐtricas de similitud estÃĄndar como LPIPS, DINO y CLIP-I obtuvieron puntuaciones mÃĄs bajas, y las variantes basadas en captions Qwen-T y CLIP-T tuvieron un desempeÃąo ligeramente mejor. Incluso las versiones ajustadas de DINO y CLIP no cerraron la brecha. La puntuaciÃģn mÃĄs alta, 6.77, se logrÃģ con el modelo relsim, entrenado con supervisiÃģn basada en grupos.
Los autores observan:
âEsto es muy alentador, ya que demuestra no solo que nuestro modelo, relsim, puede recuperar imÃĄgenes relacionalmente similares con ÃĐxito, sino que tambiÃĐn, nuevamente, confirma que los humanos perciben la similitud relacionalâno solo la similitud de atributos!â
Para explorar cÃģmo la similitud relacional y la similitud de atributos podrÃan complementarse entre sÃ, los investigadores utilizaron un mÃĐtodo de visualizaciÃģn combinada. Una sola imagen de consulta (âUn perro sosteniendo una cÃĄmaraâ) se comparÃģ con 3,000 imÃĄgenes aleatorias, y la similitud se calculÃģ utilizando tanto modelos relacionales como de atributos:

VisualizaciÃģn conjunta del espacio de similitud visual utilizando ejes relacionales y de atributos. Una sola imagen de consulta, que muestra a un perro usando una cÃĄmara, se comparÃģ con 3,000 otras. Los resultados se organizaron por similitud relacional (vertical) y similitud de atributos (horizontal). La regiÃģn superior derecha contiene imÃĄgenes que se parecen a la consulta en lÃģgica y apariencia, como otros perros usando herramientas. La regiÃģn superior izquierda contiene casos semÃĄnticamente relacionados pero visualmente distintos, como diferentes animales realizando acciones relacionadas con cÃĄmaras. La mayorÃa de los ejemplos restantes se agrupan en la parte inferior del espacio, reflejando una similitud mÃĄs dÃĐbil. El diseÃąo ilustra cÃģmo los modelos relacionales y de atributos resaltan aspectos complementarios de los datos visuales. Por favor, consulte el artÃculo de la fuente para una mejor resoluciÃģn.
Los resultados revelaron clusters que correspondÃan a diferentes tipos de similitud: algunas imÃĄgenes eran tanto relacional como visualmente similares, como otros perros en poses humanas; otras compartÃan lÃģgica relacional pero no apariencia, como diferentes animales imitando acciones humanas; el resto no mostraba ninguna de estas similitudes.
Este anÃĄlisis sugiere que los dos tipos de similitud desempeÃąan roles distintos y producen una estructura mÃĄs rica cuando se combinan.
Casos de uso
El artÃculo tambiÃĐn explora algunos posibles casos de uso para la similitud relacional, incluyendo recuperaciÃģn de imÃĄgenes relacionales, que permite la bÚsqueda de imÃĄgenes mÃĄs alineada con la forma creativa en que los humanos ven el mundo:

La recuperaciÃģn relacional devuelve imÃĄgenes que comparten una estructura conceptual mÃĄs profunda con la consulta, en lugar de coincidir con caracterÃsticas de superficie. Por ejemplo, un artÃculo de comida estilizado para parecerse a una cara recupera otras comidas antropomÃģrficas; un objeto cortado produce otras formas cortadas; y escenas de interacciÃģn entre adultos y descendientes devuelven imÃĄgenes con roles relacionales similares, incluso cuando las especies y la composiciÃģn difieren.
Otra posibilidad es generaciÃģn de imÃĄgenes anÃĄlogas, que permitirÃa la sÃntesis de consultas que utilizan estructuras relacionales en lugar de descripciones directas. En una comparaciÃģn de los resultados obtenidos de los modelos de texto a imagen de Última generaciÃģn, podemos ver que el resultado de tal enfoque probablemente serÃĄ mÃĄs diverso:

Dada una imagen de entrada y una consulta relacional, los modelos fueron solicitados para generar una nueva imagen que exprese el mismo concepto subyacente. Los modelos propietarios produjeron analogÃas mÃĄs fieles, preservando la lÃģgica estructural a travÃĐs de grandes cambios en la forma, mientras que los modelos de cÃģdigo abierto tendieron a regresar a coincidencias literales o estilÃsticas, fallando en transferir la idea mÃĄs profunda. Las salidas se compararon con analogÃas curadas por humanos, que ejemplificaban la transformaciÃģn pretendida.
ConclusiÃģn
Los sistemas de IA generativos, al parecer, se beneficiarÃan notablemente de la capacidad de incorporar representaciones abstractas en sus conceptualizaciones. Como estÃĄn ahora, solicitar imÃĄgenes basadas en conceptos como âiraâ o âfelicidadâ tiende a devolver imÃĄgenes estiladas a partir de las imÃĄgenes mÃĄs populares o numerosas que tenÃan esas asociaciones en el conjunto de datos; lo cual es memorizaciÃģn en lugar de abstracciÃģn.
Presumiblemente, este principio podrÃa ser aÚn mÃĄs beneficioso si se aplicara a la escritura generativa â particularmente a la salida analÃtica, especulativa o ficticia.
Pulse para reproducir. Fuente
Â
Â
* Un A100 puede tener 40Gb o 80GB de VRAM; esto no se especifica en el artÃculo.
** Las citas de los autores son redundantes y se excluyeron.
Publicado por primera vez el martes, 16 de diciembre de 2025












