Ângulo de Anderson

Trazendo AnÃĄlogos Visuais para a IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated image: comparative cross-sections of a peach and the planet Earth. GPT-image-1, Firefly 3.

Os atuais modelos de IA falham em reconhecer semelhanças ‘relacionais’ de imagens, como a semelhança entre as camadas da Terra e uma pÊssega, perdendo um aspecto fundamental de como os humanos percebem imagens.

 

Embora existam muitos modelos de visÃĢo computacional capazes de comparar imagens e encontrar semelhanças entre elas, a geraçÃĢo atual de sistemas comparativos tem pouca ou nenhuma capacidade imaginativa. Considere algumas das letras da mÚsica clÃĄssica dos anos 60, Windmills of Your Mind:

Como um carrossel que gira, correndo em círculos ao redor da lua
Como um relÃģgio cujas mÃĢos estÃĢo passando pelos minutos de seu rosto
E o mundo ÃĐ como uma maçÃĢ girando silenciosamente no espaço

ComparaçÃĩes desse tipo representam um domínio de alusÃĢo poÃĐtica que ÃĐ significativo para os humanos de uma maneira que vai alÃĐm da expressÃĢo artística; mais precisamente, estÃĄ relacionado à forma como desenvolvemos nossos sistemas perceptivos; à medida que criamos nosso domínio de ‘objeto’, desenvolvemos uma capacidade para semelhança visual, de modo que – por exemplo – seçÃĩes transversais que mostram uma pÊssega e a Terra, ou recorrÊncias fractais como espirais de cafÃĐ e galÃĄxias, se registram como anÃĄlogas conosco.

Dessa forma, podemos deduzir conexÃĩes entre objetos e tipos de objetos aparentemente desconexos e inferir sistemas (como gravidade, momento e coesÃĢo de superfície) que podem ser aplicados a uma variedade de domínios em diferentes escalas.

Vendo Coisas

Mesmo os sistemas de comparaçÃĢo de imagens mais recentes, como a Semelhança de Patch de Imagem Perceptual Aprendida (LPIPS) e DINO, que sÃĢo informados por feedback humano, realizam apenas comparaçÃĩes superficiais literais.

Sua capacidade de encontrar faces onde nÃĢo existem – ou seja, pareidolia – nÃĢo representa o tipo de mecanismo de semelhança visual que os humanos desenvolvem, mas ocorre porque os algoritmos de busca de faces utilizam recursos de estrutura de face de baixo nível recursos que às vezes concordam com objetos aleatÃģrios:

Exemplos de falsos positivos para reconhecimento facial no conjunto de dados 'Faces with Things'. Fonte - https://arxiv.org/pdf/2409.16143

Exemplos de falsos positivos para reconhecimento facial no conjunto de dados ‘Faces with Things’. Fonte

Para determinar se as mÃĄquinas podem realmente desenvolver nossa capacidade imaginativa de reconhecer semelhança visual entre domínios, pesquisadores nos EUA realizaram um estudo sobre semelhança visual relacional, curando e treinando um novo conjunto de dados projetado para forçar a formaçÃĢo de relaçÃĩes abstratas entre objetos diferentes que, no entanto, estÃĢo ligados por uma relaçÃĢo abstrata:

A maioria dos modelos de IA sÃģ reconhece semelhança quando as imagens compartilham traços de superfície, como forma ou cor, o que ÃĐ por que eles apenas vinculam o Grupo B (acima) à referÊncia. Os humanos, por outro lado, tambÃĐm veem o Grupo A como semelhante – nÃĢo porque as imagens se parecem, mas porque seguem a mesma lÃģgica subjacente, como mostrar uma transformaçÃĢo ao longo do tempo. O novo trabalho tenta reproduzir esse tipo de semelhança estrutural ou relacional, visando trazer a percepçÃĢo da mÃĄquina mais prÃģxima da razÃĢo humana. Fonte: https://arxiv.org/pdf/2512.07833

A maioria dos modelos de IA sÃģ reconhece semelhança quando as imagens compartilham traços de superfície, como forma ou cor, o que ÃĐ por que eles apenas vinculam o Grupo B (acima) à referÊncia. Os humanos, por outro lado, tambÃĐm veem o Grupo A como semelhante – nÃĢo porque as imagens se parecem, mas porque seguem a mesma lÃģgica subjacente, como mostrar uma transformaçÃĢo ao longo do tempo. O novo trabalho tenta reproduzir esse tipo de semelhança estrutural ou relacional, visando trazer a percepçÃĢo da mÃĄquina mais prÃģxima da razÃĢo humana. Fonte: https://arxiv.org/pdf/2512.07833

O sistema de legendagem desenvolvido para o conjunto de dados facilita legendas abstratas incomuns, projetadas para forçar os sistemas de IA a se concentrar em características bÃĄsicas em vez de detalhes locais específicos:

As legendas 'anÃīnimas' previstas que contribuem para a mÃĐtrica 'relsim' dos autores.

As legendas ‘anÃīnimas’ previstas que contribuem para a mÃĐtrica ‘relsim’ dos autores.

O conjunto de dados curado e o estilo de legendagem incomum alimentam a nova mÃĐtrica proposta relsim, que os autores ajustaram em um modelo de visÃĢo-linguagem (VLM).

Uma comparaçÃĢo entre o estilo de legendagem de conjuntos de dados típicos, que se concentra na semelhança de atributos, enquanto a abordagem relsim (linha inferior) enfatiza a semelhança relacional.

Uma comparaçÃĢo entre o estilo de legendagem de conjuntos de dados típicos, que se concentra na semelhança de atributos, enquanto a abordagem relsim (linha inferior) enfatiza a semelhança relacional.

A nova abordagem se baseia em metodologias da ciÊncia cognitiva, em particular na teoria da Mapeamento de Estrutura de Dedre Gentner (um estudo de analogia) e na definiçÃĢo de Amos Tversky de semelhança relacional e de atributo.

Do site do projeto associado, um exemplo de semelhança relacional. Fonte - https://thaoshibe.github.io/relsim/

Do site do projeto associado, um exemplo de semelhança relacional. Fonte

Os autores afirmam:

‘[Os humanos] processam a semelhança de atributos perceptualmente, mas a semelhança relacional requer abstraçÃĢo conceitual, frequentemente apoiada por linguagem ou conhecimento prÃĐvio. Isso sugere que reconhecer a semelhança relacional primeiro requer entender a imagem, aproveitando o conhecimento e abstraindo sua estrutura subjacente.’

O novo artigo ÃĐ intitulado semelhança visual relacional e vem com um site do projeto (veja o vídeo incorporado no final deste artigo).

MÃĐtodo

Os pesquisadores usaram um dos conjuntos de dados de hipercala mais conhecidos como ponto de partida para sua prÃģpria coleçÃĢo – LAION-2B:

Metadados para uma entrada no conjunto de dados LAION-2B. Fonte - https://huggingface.co/datasets/laion/laion2B-en-aesthetic/viewer/default/train

Metadados para uma entrada no conjunto de dados LAION-2B. Fonte

114.000 imagens provÃĄveis de conter estruturas relacionais elÃĄsticas foram extraídas do LAION-2B, envolvendo a filtragem de muitas imagens de baixa qualidade presentes no conjunto de dados minimamente curado.

Para criar um pipeline para esse processo de seleçÃĢo, os autores utilizaram Qwen2.5-VL-7B, aproveitando 1.300 exemplos positivos e 11.000 exemplos negativos rotulados por humanos:

O sistema relsim ÃĐ treinado em trÊs etapas: filtrando imagens do LAION-2B para conteÚdo relacional; atribuindo a cada grupo uma legenda anÃīnima compartilhada que captura sua lÃģgica subjacente; e aprendendo a corresponder imagens a essas legendas usando uma perda contrastiva.

O sistema relsim ÃĐ treinado em trÊs etapas: filtrando imagens do LAION-2B para conteÚdo relacional; atribuindo a cada grupo uma legenda anÃīnima compartilhada que captura sua lÃģgica subjacente; e aprendendo a corresponder imagens a essas legendas usando uma perda contrastiva.

O artigo afirma:

‘Os anotadores foram instruídos: “VocÊ pode ver algum padrÃĢo relacional, lÃģgica ou estrutura nessa imagem que possa ser Útil para criar ou vincular a outra imagem?”. O modelo ajustado alcança 93% de concordÃĒncia com os julgamentos humanos, e quando aplicado ao LAION-2B, produz N = 114k imagens identificadas como relacionais.’

Para gerar rÃģtulos relacionais, os pesquisadores solicitaram ao modelo Qwen que descrevesse a lÃģgica compartilhada por conjuntos de imagens sem nomear objetos específicos. Essa abstraçÃĢo foi difícil de obter quando o modelo via apenas uma imagem, mas se tornou viÃĄvel quando vÃĄrios exemplos demonstravam o padrÃĢo subjacente.

As legendas de nível de grupo resultantes substituíram termos específicos por espaços reservados, como ‘{Assunto}’ ou ‘{Tipo de Movimento}’, tornando-as amplamente aplicÃĄveis.

ApÃģs verificaçÃĢo humana, cada legenda foi emparelhada com todas as imagens de seu grupo. Mais de 500 grupos foram usados para treinar o modelo, que foi aplicado às 114.000 imagens filtradas para produzir um grande conjunto de amostras anotadas relacionalmente.

Dados e Testes

ApÃģs a extraçÃĢo de recursos relacionais com Qwen2.5-VL-7B, um modelo foi ajustado nos dados usando LoRA, por 15.000 etapas, via oito GPUs A100*. Para o lado do texto, legendas relacionais foram incorporadas usando all-MiniLM-L6-v2 da biblioteca Sentence-Transformers.

O conjunto de dados de 114.000 imagens legendadas foi dividido em 100.000 para treinamento e 14.000 para avaliaçÃĢo. Para testar o sistema, um setup de recuperaçÃĢo foi usado: dado uma imagem de consulta, o modelo precisava encontrar uma imagem diferente de um pool de 28.000 itens que expressasse a mesma ideia relacional. O pool de recuperaçÃĢo incluiu 14.000 imagens de avaliaçÃĢo e 14.000 amostras adicionais do LAION-2B, com 1.000 consultas selecionadas aleatoriamente do conjunto de avaliaçÃĢo para benchmarking.

Para avaliar a qualidade da recuperaçÃĢo, GPT-4o foi usado para pontuar a semelhança relacional entre cada consulta e imagem recuperada em uma escala de 0 a 10. Um estudo humano separado tambÃĐm foi realizado para medir a preferÊncia do usuÃĄrio (veja abaixo).

Cada participante foi apresentado a uma imagem de consulta anÃīnima com dois candidatos, um recuperado pelo mÃĐtodo proposto e o outro por uma linha de base. Os participantes foram solicitados a dizer qual imagem era mais semelhante relacionalmente à consulta, ou se ambas eram igualmente prÃģximas. Para cada linha de base, 300 tripletos foram criados e avaliados por pelo menos trÊs pessoas cada, resultando em cerca de 900 respostas.

A abordagem relsim foi comparada a vÃĄrios mÃĐtodos de semelhança de imagem para imagem estabelecidos, incluindo o mencionado LPIPS e DINO, bem como dreamsim e CLIP-I. AlÃĐm das linhas de base que calculam diretamente as pontuaçÃĩes de semelhança entre pares de imagens, como LPIPS, DINO, dreamsim e CLIP-I, os autores tambÃĐm testaram mÃĐtodos baseados em legendas em que Qwen foi usado para gerar uma legenda anÃīnima ou abstrata para cada imagem; isso serviu como a consulta de recuperaçÃĢo.

Dois variantes de recuperaçÃĢo foram avaliados, com recuperaçÃĢo de texto para imagem baseada em CLIP (CLIP-T) usada para recuperaçÃĢo de texto para imagem e Qwen-T usando recuperaçÃĢo de texto para texto. Ambas as linhas de base baseadas em legendas usaram o modelo Qwen prÃĐ-treinado original em vez da versÃĢo ajustada na lÃģgica relacional. Isso permitiu que os autores isolassem o efeito do treinamento baseado em grupo, jÃĄ que o modelo ajustado havia sido exposto a conjuntos de imagens, em vez de exemplos isolados.

MÃĐtricas Existente e Semelhança Relacional

Os autores inicialmente testaram se as mÃĐtricas existentes poderiam capturar a semelhança relacional:

ComparaçÃĩes do desempenho de recuperaçÃĢo julgadas por GPT-4o, mostrando a pontuaçÃĢo de semelhança relacional mÃĐdia para cada mÃĐtodo. MÃĐtricas de semelhança convencionais, como LPIPS, DINO e CLIP-I, pontuaram mais baixo, incluindo mesmo quando ajustadas. As linhas de base baseadas em legendas Qwen-T e CLIP-T tambÃĐm tiveram um desempenho inferior. A pontuaçÃĢo mais alta foi alcançada pela abordagem relsim (6,77, coluna azul mais à direita), indicando que o ajuste em padrÃĩes relacionais de grupo melhorou a concordÃĒncia com as avaliaçÃĩes de GPT-4o.

ComparaçÃĩes do desempenho de recuperaçÃĢo julgadas por GPT-4o, mostrando a pontuaçÃĢo de semelhança relacional mÃĐdia para cada mÃĐtodo. MÃĐtricas de semelhança convencionais, como LPIPS, DINO e CLIP-I, pontuaram mais baixo. As linhas de base baseadas em legendas Qwen-T e CLIP-T tambÃĐm tiveram um desempenho inferior. A pontuaçÃĢo mais alta foi alcançada pela abordagem relsim (6,77, coluna azul mais à direita), indicando que o ajuste em padrÃĩes relacionais de grupo melhorou a concordÃĒncia com as avaliaçÃĩes de GPT-4o.

Quanto a esses resultados, os autores afirmam**:

‘[LPIPS], que se concentra puramente na semelhança perceptual, alcança a pontuaçÃĢo mais baixa (4,56). [DINO] executa apenas ligeiramente melhor (5,14), provavelmente porque ÃĐ treinado apenas de forma auto-supervisionada em dados de imagem. [CLIP-I] produz os resultados mais fortes entre as linhas de base (5,91), presumivelmente porque alguma abstraçÃĢo às vezes estÃĄ presente nas legendas de imagem.

‘No entanto, CLIP-I ainda tem um desempenho inferior em relaçÃĢo ao nosso mÃĐtodo, pois alcançar uma pontuaçÃĢo melhor pode exigir a capacidade de alcançar abstraçÃĩes de nível ainda mais alto, como as presentes em legendas anÃīnimas.’

No estudo com humanos, os humanos consistentemente preferiram a abordagem relsim em relaçÃĢo a todas as linhas de base:

PontuaçÃĩes de semelhança relacional atribuídas por GPT-4o para cada mÃĐtodo. MÃĐtricas de semelhança padrÃĢo, como LPIPS, DINO e CLIP-I, pontuaram mais baixo, e as variantes baseadas em legendas Qwen-T e CLIP-T tiveram um desempenho ligeiramente melhor. Mesmo as versÃĩes ajustadas de DINO e CLIP nÃĢo fecharam a lacuna. A pontuaçÃĢo mais alta, 6,77, foi alcançada pelo modelo proposto treinado com supervisÃĢo baseada em grupo.

PontuaçÃĩes de semelhança relacional atribuídas por GPT-4o para cada mÃĐtodo. MÃĐtricas de semelhança padrÃĢo, como LPIPS, DINO e CLIP-I, pontuaram mais baixo, e as variantes baseadas em legendas Qwen-T e CLIP-T tiveram um desempenho ligeiramente melhor. Mesmo as versÃĩes ajustadas de DINO e CLIP nÃĢo fecharam a lacuna. A pontuaçÃĢo mais alta, 6,77, foi alcançada pelo modelo relsim, treinado com supervisÃĢo baseada em grupo.

Os autores observam:

‘Isso ÃĐ muito encorajador, pois demonstra nÃĢo apenas que nosso modelo, relsim, pode recuperar imagens semanticamente semelhantes com sucesso, mas tambÃĐm, novamente, confirma que os humanos percebem a semelhança relacional – e nÃĢo apenas a semelhança de atributo!’

Para explorar como a semelhança relacional e a semelhança de atributo podem se complementar, os pesquisadores usaram um mÃĐtodo de visualizaçÃĢo combinada. Uma Única imagem de consulta (‘Um cachorro segurando uma cÃĒmera’) foi comparada com 3.000 imagens aleatÃģrias, e a semelhança foi computada usando modelos tanto relacionais quanto baseados em atributos:

VisualizaçÃĢo conjunta do espaço de semelhança visual usando eixos relacionais e de atributo. Uma Única imagem de consulta, mostrando um cachorro usando uma cÃĒmera, foi comparada com 3.000 outras. Os resultados foram organizados por semelhança relacional (vertical) e semelhança de atributo (horizontal). A regiÃĢo superior direita contÃĐm imagens que se assemelham à consulta tanto em lÃģgica quanto em aparÊncia, como outros cÃĢes usando ferramentas. A regiÃĢo superior esquerda contÃĐm casos semanticamente relacionados, mas visualmente distintos, como diferentes animais realizando açÃĩes relacionadas à cÃĒmera. A maioria dos exemplos restantes se agrupa em uma posiçÃĢo mais baixa no espaço, refletindo uma semelhança mais fraca. O layout ilustra como os modelos relacionais e de atributo destacam aspectos complementares dos dados visuais. Por favor, consulte o artigo original para uma resoluçÃĢo melhor.

VisualizaçÃĢo conjunta do espaço de semelhança visual usando eixos relacionais e de atributo. Uma Única imagem de consulta, mostrando um cachorro usando uma cÃĒmera, foi comparada com 3.000 outras. Os resultados foram organizados por semelhança relacional (vertical) e semelhança de atributo (horizontal). A regiÃĢo superior direita contÃĐm imagens que se assemelham à consulta tanto em lÃģgica quanto em aparÊncia, como outros cÃĢes usando ferramentas. A regiÃĢo superior esquerda contÃĐm casos semanticamente relacionados, mas visualmente distintos, como diferentes animais realizando açÃĩes relacionadas à cÃĒmera. A maioria dos exemplos restantes se agrupa em uma posiçÃĢo mais baixa no espaço, refletindo uma semelhança mais fraca. O layout ilustra como os modelos relacionais e de atributo destacam aspectos complementares dos dados visuais. Por favor, consulte o artigo original para uma resoluçÃĢo melhor.

Os resultados revelaram clusters correspondentes a diferentes tipos de semelhança: algumas imagens eram tanto relacionais quanto visualmente semelhantes, como outros cÃĢes em poses humanas; outras compartilhavam lÃģgica relacional, mas nÃĢo aparÊncia, como diferentes animais imitando açÃĩes humanas; o restante nÃĢo apresentava nenhuma das duas.

Essa anÃĄlise sugere que os dois tipos de semelhança desempenham papÃĐis distintos e produzem uma estrutura mais rica quando combinados.

Casos de Uso

O artigo tambÃĐm explora alguns possíveis casos de uso para a semelhança relacional, incluindo recuperaçÃĢo de imagem relacional, que permite uma busca de imagem mais alinhada com a forma criativa como os humanos olham para o mundo:

A recuperaçÃĢo relacional retorna imagens que compartilham uma estrutura conceitual mais profunda com a consulta, em vez de corresponder a recursos de superfície. Por exemplo, um item de comida estilizado para se parecer com um rosto recupera outras refeiçÃĩes antropomÃģrficas; um objeto fatiado produz outros objetos fatiados; e cenas de interaçÃĢo adulto-filho retornam imagens com papÃĐis relacionais semelhantes, mesmo quando as espÃĐcies e a composiçÃĢo diferem.

A recuperaçÃĢo relacional retorna imagens que compartilham uma estrutura conceitual mais profunda com a consulta, em vez de corresponder a recursos de superfície. Por exemplo, um item de comida estilizado para se parecer com um rosto recupera outras refeiçÃĩes antropomÃģrficas; um objeto fatiado produz outros objetos fatiados; e cenas de interaçÃĢo adulto-filho retornam imagens com papÃĐis relacionais semelhantes, mesmo quando as espÃĐcies e a composiçÃĢo diferem.

Outra possibilidade ÃĐ geraçÃĢo de imagem analÃģgica, que permitiria a síntese de consultas que usam estruturas relacionais em vez de descriçÃĩes diretas. Em uma comparaçÃĢo dos resultados obtidos com os modelos de texto para imagem de Última geraçÃĢo, podemos ver que o resultado de tal abordagem provavelmente serÃĄ mais diverso:

Dada uma imagem de entrada e um prompt relacional, os modelos foram solicitados a gerar uma nova imagem que expressa o mesmo conceito subjacente. Modelos proprietÃĄrios produziram analogias mais fiÃĐis, preservando a lÃģgica estrutural em mudanças significativas de forma, e os modelos de cÃģdigo aberto tendiam a reverter para correspondÊncias literais ou estilísticas, falhando em transferir a ideia mais profunda. As saídas foram comparadas com analogias curadas por humanos, que exemplificavam a transformaçÃĢo pretendida.

Dada uma imagem de entrada e um prompt relacional, os modelos foram solicitados a gerar uma nova imagem que expressa o mesmo conceito subjacente. Modelos proprietÃĄrios produziram analogias mais fiÃĐis, preservando a lÃģgica estrutural em mudanças significativas de forma, enquanto os modelos de cÃģdigo aberto tendiam a reverter para correspondÊncias literais ou estilísticas, falhando em transferir a ideia mais profunda. As saídas foram comparadas com analogias curadas por humanos, que exemplificavam a transformaçÃĢo pretendida.

ConclusÃĢo

Os sistemas de IA gerativos seriam, aparentemente, notavelmente aprimorados pela capacidade de incorporar representaçÃĩes abstratas em suas conceitualizaçÃĩes. Como estÃĄ, pedir imagens baseadas em conceitos, como ‘raiva’ ou ‘felicidade’, tende a retornar imagens estilizados a partir das imagens mais populares ou numerosas que tinham essas associaçÃĩes no conjunto de dados; o que ÃĐ memorizaçÃĢo em vez de abstraçÃĢo.

Presumivelmente, esse princípio poderia ser ainda mais benÃĐfico se pudesse ser aplicado à escrita gerativa – particularmente à saída analítica, especulativa ou fictícia.

Pressione para reproduzir. Fonte

 

 

* Um A100 pode ter 40Gb ou 80GB de VRAM; isso nÃĢo ÃĐ especificado no artigo.

** CitaçÃĩes dos autores redundantes e excluídas.

Publicado pela primeira vez na terça-feira, 16 de dezembro de 2025

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]