Ángulo de Anderson

Llevando analogías visuales a la IA

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
AI-generated image: comparative cross-sections of a peach and the planet Earth. GPT-image-1, Firefly 3.

Los modelos de IA actuales no reconocen las ‘similitudes relacionales’ de las imÃĄgenes, como la similitud entre las capas de la Tierra y una melocotÃģn, lo que supone una falta de un aspecto clave de cÃģmo los humanos percibimos las imÃĄgenes.

 

Aunque existen muchos modelos de visiÃģn por computadora capaces de comparar imÃĄgenes y encontrar similitudes entre ellas, la generaciÃģn actual de sistemas comparativos tiene poca o ninguna capacidad imaginativa. Consideremos algunas de las letras de la canciÃģn clÃĄsica de los aÃąos 60, Windmills of Your Mind:

Como un carrusel que gira, corriendo en círculos alrededor de la luna
Como un reloj cuyas manecillas pasan por los minutos de su cara
Y el mundo es como una manzana que gira silenciosamente en el espacio

Las comparaciones de este tipo representan un dominio de alusiÃģn poÃĐtica que es significativo para los humanos de una manera que va mucho mÃĄs allÃĄ de la expresiÃģn artística; mÃĄs bien, estÃĄ relacionado con cÃģmo desarrollamos nuestros sistemas perceptivos; a medida que creamos nuestro ‘dominio de objetos’, desarrollamos una capacidad para la similitud visual, de modo que – por ejemplo – secciones transversales que muestran una melocotÃģn y el planeta Tierra, o recurrencias fractales como espirales de cafÃĐ y ramas de galaxias, se registran como anÃĄlogas para nosotros.

De esta manera, podemos deducir conexiones entre objetos y tipos de objetos aparentemente no relacionados, e inferir sistemas (como la gravedad, el momento y la cohesiÃģn superficial) que pueden aplicarse a una variedad de dominios a diferentes escalas.

Viendo las cosas

Incluso los sistemas de comparaciÃģn de imÃĄgenes de Última generaciÃģn, como LPIPS y DINO, que se informan con retroalimentaciÃģn humana, solo realizan comparaciones superficiales literales.

Su capacidad para encontrar caras donde no existen – es decir, pareidolia – no representa el tipo de mecanismos de similitud visual que los humanos desarrollan, sino que ocurre porque los algoritmos de bÚsqueda de caras utilizan características de estructura de cara de bajo nivel que a veces coinciden con objetos aleatorios:

Ejemplos de falsos positivos para el reconocimiento facial en el conjunto de datos 'Faces with Things'. Fuente - https://arxiv.org/pdf/2409.16143

Ejemplos de falsos positivos para el reconocimiento facial en el conjunto de datos ‘Faces with Things’. Fuente

Para determinar si las mÃĄquinas pueden desarrollar realmente nuestra capacidad imaginativa para reconocer la similitud visual a travÃĐs de dominios, los investigadores en EE. UU. han realizado un estudio sobre Similitud Visual Relacional, curando y entrenando un nuevo conjunto de datos diseÃąado para forzar la formaciÃģn de relaciones abstractas entre objetos diferentes que, sin embargo, estÃĄn unidos por una relaciÃģn abstracta:

La mayoría de los modelos de IA solo reconocen similitud cuando las imÃĄgenes comparten rasgos de superficie como forma o color, por lo que solo enlazarían el Grupo B (arriba) con la referencia. Los humanos, por otro lado, tambiÃĐn ven el Grupo A como similar – no porque las imÃĄgenes se parezcan, sino porque siguen la misma lÃģgica subyacente, como mostrar una transformaciÃģn en el tiempo. El nuevo trabajo intenta reproducir este tipo de similitud estructural o relacional, con el objetivo de acercar la percepciÃģn de la mÃĄquina a la razonamiento humano. Fuente: https://arxiv.org/pdf/2512.07833

La mayoría de los modelos de IA solo reconocen similitud cuando las imÃĄgenes comparten rasgos de superficie como forma o color, por lo que solo enlazarían el Grupo B (arriba) con la referencia. Los humanos, por otro lado, tambiÃĐn ven el Grupo A como similar – no porque las imÃĄgenes se parezcan, sino porque siguen la misma lÃģgica subyacente, como mostrar una transformaciÃģn en el tiempo. El nuevo trabajo intenta reproducir este tipo de similitud estructural o relacional, con el objetivo de acercar la percepciÃģn de la mÃĄquina a la razonamiento humano. Fuente: https://arxiv.org/pdf/2512.07833

El sistema de captionado desarrollado para el conjunto de datos facilita anotaciones abstractas inusuales, diseÃąadas para forzar a los sistemas de IA a centrarse en características bÃĄsicas en lugar de detalles locales específicos:

Las captions 'anÃģnimas' predichas que contribuyen a la mÃĐtrica 'relsim' de los autores.

Las captions ‘anÃģnimas’ predichas que contribuyen a la mÃĐtrica ‘relsim’ de los autores.

La colecciÃģn curada y su estilo de captionado inusual alimentan la nueva mÃĐtrica propuesta por los autores, relsim, que los autores han ajustado en un modelo de visiÃģn-lenguaje (VLM).

ComparaciÃģn entre el estilo de captionado de conjuntos de datos típicos, que se centra en la similitud de atributos, mientras que el enfoque relsim (fila inferior) enfatiza la similitud relacional.

ComparaciÃģn entre el estilo de captionado de conjuntos de datos típicos, que se centra en la similitud de atributos, mientras que el enfoque relsim (fila inferior) enfatiza la similitud relacional.

El nuevo enfoque se basa en metodologías de la ciencia cognitiva, en particular la teoría de Mapeo de Estructuras de Dedre Gentner (un estudio de analogía) y la definiciÃģn de similitud relacional y de atributos de Amos Tversky.

Del sitio web del proyecto asociado, un ejemplo de similitud relacional. Fuente - https://thaoshibe.github.io/relsim/

Del sitio web del proyecto asociado, un ejemplo de similitud relacional. Fuente

Los autores afirman:

‘[Los humanos] procesan la similitud de atributos perceptualmente, pero la similitud relacional requiere abstracciÃģn conceptual, a menudo apoyada por el lenguaje o el conocimiento previo. Esto sugiere que reconocer la similitud relacional primero requiere entender la imagen, basÃĄndose en el conocimiento y abstrayendo su estructura subyacente.’

El nuevo artículo se titula Similitud Visual Relacional y viene con un sitio web del proyecto (ver video incrustado al final de este artículo).

MÃĐtodo

Los investigadores utilizaron uno de los conjuntos de datos hiperescala mÃĄs conocidos como punto de partida para su propia colecciÃģn – LAION-2B:

Metadatos para una entrada en la colecciÃģn LAION-2B. Fuente - https://huggingface.co/datasets/laion/laion2B-en-aesthetic/viewer/default/train

Metadatos para una entrada en la colecciÃģn LAION-2B. Fuente

Se extrajeron 114,000 imÃĄgenes que probablemente contuvieran estructuras relacionales elÃĄsticas de LAION-2B, lo que implicÃģ el filtrado de las muchas imÃĄgenes de baja calidad presentes en el conjunto de datos mínimamente curado.

Para crear una canalizaciÃģn para este proceso de selecciÃģn, los autores utilizaron Qwen2.5-VL-7B, aprovechando 1,300 ejemplos positivos y 11,000 negativos etiquetados por humanos:

El sistema relsim se entrena en tres etapas: filtrar imÃĄgenes de LAION-2B para contenido relacional; asignar a cada grupo una caption anÃģnima compartida que capture su lÃģgica subyacente; y aprender a emparejar imÃĄgenes con esas captions utilizando una pÃĐrdida contrastiva.

El sistema relsim se entrena en tres etapas: filtrar imÃĄgenes de LAION-2B para contenido relacional; asignar a cada grupo una caption anÃģnima compartida que capture su lÃģgica subyacente; y aprender a emparejar imÃĄgenes con esas captions utilizando una pÃĐrdida contrastiva.

El artículo afirma:

‘Los anotadores recibieron las siguientes instrucciones: “ÂŋPuede ver algÚn patrÃģn relacional, lÃģgica o estructura en esta imagen que podría ser Útil para crear o enlazar con otra imagen?”. El modelo ajustado logra un 93% de acuerdo con los juicios humanos, y cuando se aplica a LAION-2B, produce N = 114k imÃĄgenes identificadas como relacionalmente interesantes.’

Para generar etiquetas relacionales, los investigadores solicitaron al modelo Qwen que describiera la lÃģgica compartida detrÃĄs de conjuntos de imÃĄgenes sin nombrar objetos específicos. Esta abstracciÃģn fue difícil de obtener cuando el modelo veía solo una imagen, pero se volviÃģ factible cuando mÚltiples ejemplos demostraban el patrÃģn subyacente.

Las captions de grupo resultantes reemplazaron tÃĐrminos específicos con marcadores de posiciÃģn como ‘{Sujeto}’ o ‘{Tipo de Movimiento}’, haciÃĐndolos ampliamente aplicables.

DespuÃĐs de la verificaciÃģn humana, cada caption se emparejÃģ con todas las imÃĄgenes de su grupo. MÃĄs de 500 grupos de este tipo se utilizaron para entrenar el modelo, que luego se aplicÃģ a las 114,000 imÃĄgenes filtradas para producir un gran conjunto de muestras anotadas de manera abstracta y relacional.

Datos y pruebas

DespuÃĐs de la extracciÃģn de características relacionales con Qwen2.5-VL-7B, un modelo se ajustÃģ en los datos utilizando LoRA, durante 15,000 pasos, a travÃĐs de ocho GPU A100*. Para el lado de texto, las captions relacionales se incrustaron utilizando all-MiniLM-L6-v2 de la biblioteca Sentence-Transformers.

El conjunto de datos de 114,000 imÃĄgenes con captions se dividiÃģ en 100,000 para entrenamiento y 14,000 para evaluaciÃģn. Para probar el sistema, se utilizÃģ un entorno de recuperaciÃģn: dado una imagen de consulta, el modelo debía encontrar una imagen diferente de un grupo de 28,000 elementos que expresara la misma idea relacional. El grupo de recuperaciÃģn incluía 14,000 imÃĄgenes de evaluaciÃģn y 14,000 muestras adicionales de LAION-2B, con 1,000 consultas seleccionadas aleatoriamente del conjunto de evaluaciÃģn para la evaluaciÃģn.

Para evaluar la calidad de recuperaciÃģn, se utilizÃģ GPT-4o para puntuar la similitud relacional entre cada consulta y la imagen recuperada en una escala de 0 a 10. TambiÃĐn se realizÃģ un estudio humano separado para evaluar la preferencia del usuario (ver a continuaciÃģn).

Cada participante vio una imagen de consulta anÃģnima con dos candidatas, una recuperada por el mÃĐtodo propuesto y la otra por una referencia. Los participantes fueron preguntados cuÃĄl de las imÃĄgenes era mÃĄs relacionalmente similar a la consulta, o si ambas eran igualmente cercanas. Para cada referencia, se crearon 300 tripletas y se calificaron por al menos tres personas cada una, lo que dio como resultado alrededor de 900 respuestas.

El enfoque relsim se comparÃģ con varios mÃĐtodos de similitud de imagen a imagen establecidos, incluidos el mencionado LPIPS y DINO, así como dreamsim y CLIP-I. AdemÃĄs de las referencias que computan directamente puntuaciones de similitud entre pares de imÃĄgenes, como LPIPS, DINO, dreamsim y CLIP-I, los autores tambiÃĐn probaron mÃĐtodos basados en captions en los que Qwen se utilizÃģ para generar una caption anÃģnima o abstracta para cada imagen.; esto luego sirviÃģ como la consulta de recuperaciÃģn.

Se evaluaron dos variantes de recuperaciÃģn, con recuperaciÃģn de imagen a texto basada en CLIP (CLIP-T) para recuperaciÃģn de texto a imagen, y Qwen-T utilizando recuperaciÃģn de texto a texto. Ambas referencias basadas en captions utilizaron el modelo Qwen preentrenado original en lugar de la versiÃģn ajustada en la lÃģgica relacional. Esto permitiÃģ a los autores aislar el efecto de la capacitaciÃģn basada en grupos, ya que el modelo ajustado había sido expuesto a conjuntos de imÃĄgenes, en lugar de ejemplos aislados.

MÃĐtricas existentes y similitud relacional

Los autores inicialmente probaron si las mÃĐtricas existentes podían capturar la similitud relacional:

ComparaciÃģn del rendimiento de recuperaciÃģn segÚn la puntuaciÃģn de GPT-4o, mostrando la puntuaciÃģn de similitud relacional promedio para cada mÃĐtodo. Las mÃĐtricas de similitud convencionales como LPIPS, DINO y CLIP-I obtuvieron puntuaciones mÃĄs bajas, incluyendo incluso cuando se ajustaron. Las referencias basadas en captions Qwen-T y CLIP-T tambiÃĐn tuvieron un desempeÃąo inferior. La puntuaciÃģn mÃĄs alta se logrÃģ con relsim (6.77, columna azul mÃĄs a la derecha), lo que indica que ajustar en patrones relacionales de grupo mejorÃģ la alineaciÃģn con las evaluaciones de GPT-4o.

ComparaciÃģn del rendimiento de recuperaciÃģn segÚn la puntuaciÃģn de GPT-4o, mostrando la puntuaciÃģn de similitud relacional promedio para cada mÃĐtodo. Las mÃĐtricas de similitud convencionales como LPIPS, DINO y CLIP-I obtuvieron puntuaciones mÃĄs bajas. Las referencias basadas en captions Qwen-T y CLIP-T tambiÃĐn tuvieron un desempeÃąo inferior. La puntuaciÃģn mÃĄs alta se logrÃģ con relsim (6.77, columna azul mÃĄs a la derecha), lo que indica que ajustar en patrones relacionales de grupo mejorÃģ la alineaciÃģn con las evaluaciones de GPT-4o.

En cuanto a estos resultados, los autores afirman**:

‘[LPIPS], que se centra puramente en la similitud perceptual, logra la puntuaciÃģn mÃĄs baja (4.56). [DINO] funciona ligeramente mejor (5.14), probablemente porque se entrena Únicamente de manera auto-supervisada en datos de imÃĄgenes. [CLIP-I] produce los resultados mÃĄs fuertes entre las referencias (5.91), presumiblemente porque a veces hay alguna abstracciÃģn presente en las captions de las imÃĄgenes.

‘Sin embargo, CLIP-I todavía tiene un desempeÃąo inferior en comparaciÃģn con nuestro mÃĐtodo, ya que lograr una puntuaciÃģn mejor puede requerir la capacidad de alcanzar abstracciones de nivel aÚn mÃĄs alto, como las presentes en las captions anÃģnimas.’

En el estudio de usuarios, los humanos consistentemente prefirieron el mÃĐtodo relsim en comparaciÃģn con todas las referencias:

Puntuaciones de similitud relacional asignadas por GPT-4o para cada mÃĐtodo. Las mÃĐtricas de similitud estÃĄndar como LPIPS, DINO y CLIP-I obtuvieron puntuaciones mÃĄs bajas, y las variantes basadas en captions Qwen-T y CLIP-T tuvieron un desempeÃąo ligeramente mejor. Incluso las versiones ajustadas de DINO y CLIP no cerraron la brecha. La puntuaciÃģn mÃĄs alta, 6.77, se logrÃģ con el modelo propuesto entrenado con supervisiÃģn basada en grupos.

Puntuaciones de similitud relacional asignadas por GPT-4o para cada mÃĐtodo. Las mÃĐtricas de similitud estÃĄndar como LPIPS, DINO y CLIP-I obtuvieron puntuaciones mÃĄs bajas, y las variantes basadas en captions Qwen-T y CLIP-T tuvieron un desempeÃąo ligeramente mejor. Incluso las versiones ajustadas de DINO y CLIP no cerraron la brecha. La puntuaciÃģn mÃĄs alta, 6.77, se logrÃģ con el modelo relsim, entrenado con supervisiÃģn basada en grupos.

Los autores observan:

‘Esto es muy alentador, ya que demuestra no solo que nuestro modelo, relsim, puede recuperar imÃĄgenes relacionalmente similares con ÃĐxito, sino que tambiÃĐn, nuevamente, confirma que los humanos perciben la similitud relacional–no solo la similitud de atributos!’

Para explorar cÃģmo la similitud relacional y la similitud de atributos podrían complementarse entre sí, los investigadores utilizaron un mÃĐtodo de visualizaciÃģn combinada. Una sola imagen de consulta (‘Un perro sosteniendo una cÃĄmara’) se comparÃģ con 3,000 imÃĄgenes aleatorias, y la similitud se calculÃģ utilizando tanto modelos relacionales como de atributos:

VisualizaciÃģn conjunta del espacio de similitud visual utilizando ejes relacionales y de atributos. Una sola imagen de consulta, que muestra a un perro usando una cÃĄmara, se comparÃģ con 3,000 otras. Los resultados se organizaron por similitud relacional (vertical) y similitud de atributos (horizontal). La regiÃģn superior derecha contiene imÃĄgenes que se parecen a la consulta en lÃģgica y apariencia, como otros perros usando herramientas. La regiÃģn superior izquierda contiene casos semÃĄnticamente relacionados pero visualmente distintos, como diferentes animales realizando acciones relacionadas con cÃĄmaras. La mayoría de los ejemplos restantes se agrupan en la parte inferior del espacio, reflejando una similitud mÃĄs dÃĐbil. El diseÃąo ilustra cÃģmo los modelos relacionales y de atributos resaltan aspectos complementarios de los datos visuales. Por favor, consulte el artículo de la fuente para una mejor resoluciÃģn.

VisualizaciÃģn conjunta del espacio de similitud visual utilizando ejes relacionales y de atributos. Una sola imagen de consulta, que muestra a un perro usando una cÃĄmara, se comparÃģ con 3,000 otras. Los resultados se organizaron por similitud relacional (vertical) y similitud de atributos (horizontal). La regiÃģn superior derecha contiene imÃĄgenes que se parecen a la consulta en lÃģgica y apariencia, como otros perros usando herramientas. La regiÃģn superior izquierda contiene casos semÃĄnticamente relacionados pero visualmente distintos, como diferentes animales realizando acciones relacionadas con cÃĄmaras. La mayoría de los ejemplos restantes se agrupan en la parte inferior del espacio, reflejando una similitud mÃĄs dÃĐbil. El diseÃąo ilustra cÃģmo los modelos relacionales y de atributos resaltan aspectos complementarios de los datos visuales. Por favor, consulte el artículo de la fuente para una mejor resoluciÃģn.

Los resultados revelaron clusters que correspondían a diferentes tipos de similitud: algunas imÃĄgenes eran tanto relacional como visualmente similares, como otros perros en poses humanas; otras compartían lÃģgica relacional pero no apariencia, como diferentes animales imitando acciones humanas; el resto no mostraba ninguna de estas similitudes.

Este anÃĄlisis sugiere que los dos tipos de similitud desempeÃąan roles distintos y producen una estructura mÃĄs rica cuando se combinan.

Casos de uso

El artículo tambiÃĐn explora algunos posibles casos de uso para la similitud relacional, incluyendo recuperaciÃģn de imÃĄgenes relacionales, que permite la bÚsqueda de imÃĄgenes mÃĄs alineada con la forma creativa en que los humanos ven el mundo:

La recuperaciÃģn relacional devuelve imÃĄgenes que comparten una estructura conceptual mÃĄs profunda con la consulta, en lugar de coincidir con características de superficie. Por ejemplo, un artículo de comida estilizado para parecerse a una cara recupera otras comidas antropomÃģrficas; un objeto cortado produce otras formas cortadas; y escenas de interacciÃģn entre adultos y descendientes devuelven imÃĄgenes con roles relacionales similares, incluso cuando las especies y la composiciÃģn difieren.

La recuperaciÃģn relacional devuelve imÃĄgenes que comparten una estructura conceptual mÃĄs profunda con la consulta, en lugar de coincidir con características de superficie. Por ejemplo, un artículo de comida estilizado para parecerse a una cara recupera otras comidas antropomÃģrficas; un objeto cortado produce otras formas cortadas; y escenas de interacciÃģn entre adultos y descendientes devuelven imÃĄgenes con roles relacionales similares, incluso cuando las especies y la composiciÃģn difieren.

Otra posibilidad es generaciÃģn de imÃĄgenes anÃĄlogas, que permitiría la síntesis de consultas que utilizan estructuras relacionales en lugar de descripciones directas. En una comparaciÃģn de los resultados obtenidos de los modelos de texto a imagen de Última generaciÃģn, podemos ver que el resultado de tal enfoque probablemente serÃĄ mÃĄs diverso:

Dada una imagen de entrada y una consulta relacional, los modelos fueron solicitados para generar una nueva imagen que exprese el mismo concepto subyacente. Los modelos propietarios produjeron analogías mÃĄs fieles, preservando la lÃģgica estructural a travÃĐs de grandes cambios en la forma, y los modelos de cÃģdigo abierto tendieron a regresar a coincidencias literales o estilísticas, fallando en transferir la idea mÃĄs profunda. Las salidas se compararon con analogías curadas por humanos, que ejemplificaban la transformaciÃģn pretendida.

Dada una imagen de entrada y una consulta relacional, los modelos fueron solicitados para generar una nueva imagen que exprese el mismo concepto subyacente. Los modelos propietarios produjeron analogías mÃĄs fieles, preservando la lÃģgica estructural a travÃĐs de grandes cambios en la forma, mientras que los modelos de cÃģdigo abierto tendieron a regresar a coincidencias literales o estilísticas, fallando en transferir la idea mÃĄs profunda. Las salidas se compararon con analogías curadas por humanos, que ejemplificaban la transformaciÃģn pretendida.

ConclusiÃģn

Los sistemas de IA generativos, al parecer, se beneficiarían notablemente de la capacidad de incorporar representaciones abstractas en sus conceptualizaciones. Como estÃĄn ahora, solicitar imÃĄgenes basadas en conceptos como ‘ira’ o ‘felicidad’ tiende a devolver imÃĄgenes estiladas a partir de las imÃĄgenes mÃĄs populares o numerosas que tenían esas asociaciones en el conjunto de datos; lo cual es memorizaciÃģn en lugar de abstracciÃģn.

Presumiblemente, este principio podría ser aÚn mÃĄs beneficioso si se aplicara a la escritura generativa – particularmente a la salida analítica, especulativa o ficticia.

Pulse para reproducir. Fuente

 

 

* Un A100 puede tener 40Gb o 80GB de VRAM; esto no se especifica en el artículo.

** Las citas de los autores son redundantes y se excluyeron.

Publicado por primera vez el martes, 16 de diciembre de 2025

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]