Anderson의 관점
시각적 유사성을 AI에 적용하기

현재 AI 모델은 ‘관계적’ 이미지 유사성을 인식하지 못한다. 예를 들어, 지구의 층과 복숭의 유사성은 인간이 이미지에 대해 인식하는 중요한 측면이다.
컴퓨터 비전 모델은 많지만, 현재의 비교 시스템은 상상력이 부족하다. 1960년대 클래식 노래 Windmills of Your Mind의 가사를 생각해보자:
회전하는 회전목마처럼, 달을 둘러싸는 원을 그리며
시계의 손이 시간을 가리키는 것처럼
세계는 조용히 공전하는 사과처럼
이러한 비교는 인간에게 의미 있는 시적 은유의 영역을 대표한다. 이것은 예술적 표현을 넘어서 우리가 지각 시스템을 개발하는 방식과 관련이 있다. 객체를 만들면서 우리는 시각적 유사성을 개발한다. 예를 들어, 복숭과 지구의 단면은 유사한 논리 구조를 가지고 있기 때문에 유사한 것으로 인식된다.
이러한 방식으로 우리는 서로 관련이 없는 객체와 객체 유형 사이의 연결을 유추할 수 있다. 또한 중력, 운동량, 표면 응집성과 같은 시스템을 추론할 수 있다. 이러한 시스템은 다양한 영역과 규모에서 적용할 수 있다.
보는 것
最新의 이미지 비교 AI 시스템인 LPIPS와 DINO는 인간의 피드백을 받았지만, 여전히 표면 비교만 수행한다.
이 시스템은 얼굴을 찾는 알고리즘이 사용하는 저수준 얼굴 구조 특징으로 인해 얼굴이 없는 곳에서 얼굴을 찾을 수 있다. 이것은 인간이 개발하는 시각적 유사성 메커니즘을 대표하지 않는다.

False positives for facial recognition in the ‘Faces with Things’ dataset. Source
미국 연구진은 ‘관계적 시각적 유사성’에 대한 연구를 수행했다. 새로운 데이터셋을 구축하여 추상적인 관계를 형성하도록 설계했다.

Most AI models only recognize similarity when images share surface traits such as shape or color, which is why they would link only Group B (above) to the reference. Humans, by contrast, also see Group A as similar – not because the images look alike, but because they follow the same underlying logic, such as showing a transformation over time. The new work attempts to reproduce this kind of structural or relational similarity, aiming to bring machine perception closer to human reasoning. Source: https://arxiv.org/pdf/2512.07833
데이터셋에는 114,000개의 이미지와 그에 해당하는 캡션이 포함되어 있다. 캡션은 추상적인 논리 구조를 강조하도록 설계되었다.

The predicted ‘anonymous’ captions that contribute to the authors’ ‘relsim’ metric.
캡션은 Qwen 모델을 사용하여 생성되었으며, 추상적인 논리 구조를 강조하도록 설계되었다.

A comparison between the captioning style of typical datasets, which focuses on attribute similarity, whereas the relsim approach (bottom row) emphasizes relational similarity.
새로운 접근 방식은 인지 과학의 방법론을 사용한다. 특히 Dedre Gentner의 구조 매핑 이론과 Amos Tversky의 관계적 유사성과 속성 유사성의 정의를 사용한다.

From the associated project website, an example of relational similarity. Source
연구진은 다음과 같이 말한다:
‘인간은 속성 유사성을 지각적으로 처리하지만, 관계적 유사성은 개념적 추상을 필요로 한다. 이것은 언어나 이전 지식에 의해 지원될 수 있다. 따라서 관계적 유사성을 인식하는 것은 먼저 이미지를 이해하고, 지식을 사용하여, 그 아래에 있는 구조를 추상화하는 것을 필요로 한다.’
방법
연구진은 LAION-2B 데이터셋을 사용하여 관계적 이미지 비교를 수행했다.

Metadata for an entry in the LAION-2B collection. Source
114,000개의 이미지와 그에 해당하는 캡션이 포함된 데이터셋을 구축했다. 캡션은 Qwen 모델을 사용하여 생성되었다.

The relsim system is trained in three stages: filtering images from LAION-2B for relational content; assigning each group a shared anonymous caption that captures their underlying logic; and learning to match images to those captions using a contrastive loss.
연구진은 다음과 같이 말한다:
‘주석자는 다음과 같이 지시받았다: “이 이미지에 관계적 패턴, 논리, 또는 구조를 볼 수 있나요? 이 이미지를 다른 이미지와 연결할 수 있나요?”‘
관계적 레이블을 생성하기 위해 연구진은 Qwen 모델을 사용하여 이미지 세트의 공통된 논리 구조를 설명하도록 했다.
데이터와 테스트
연구진은 Qwen2.5-VL-7B 모델을 사용하여 관계적 이미지 비교를 수행했다.
114,000개의 이미지와 그에 해당하는 캡션이 포함된 데이터셋을 구축했다. 데이터셋은 100,000개의 이미지로 훈련되고, 14,000개의 이미지로 평가되었다.
테스트를 위해 검색 설정을 사용했다. 질의 이미지를 주고, 28,000개의 이미지 풀에서 관계적 유사성을 가진 이미지를 찾도록 했다.
GPT-4o 모델을 사용하여 관계적 유사성을 평가했다. 사용자 연구도 수행했다.
각 참가자는 익명화된 질의 이미지를 두 개의 후보 이미지와 함께 보았다. 참가자는 두 이미지가 질의 이미지와 얼마나 관계적 유사성이 있는지 평가했다.
연구진은 다음과 같이 말한다:
‘이 방법은 관계적 유사성을 더 잘 캡처한다. 관계적 유사성은 인간이 이미지에 대해 인식하는 중요한 측면이다.’
기존 메트릭과 관계적 유사성
연구진은 기존 메트릭이 관계적 유사성을 캡처할 수 있는지 테스트했다.

Comparison of retrieval performance as judged by GPT-4o, showing the average relational similarity score for each method. Conventional similarity metrics such as LPIPS, DINO, and CLIP-I scored lower. Caption-based baselines Qwen-T and CLIP-T also underperformed. The highest score was achieved by relsim (6.77, right-most blue column), indicating that fine-tuning on group-based relational patterns improved alignment with GPT-4o’s assessments.
연구진은 다음과 같이 말한다:
‘LPIPS는純粋하게 지각적 유사성을 집중한다. DINO는 약간 더 잘 수행한다. CLIP-I는 가장 강한 결과를 보여준다. 그러나 relsim은最高의 점수를 얻었다. 이것은 관계적 패턴에 대한 미세 조정을 통해 GPT-4o의 평가와 더 잘 일치한다는 것을 나타낸다.’
사용 사례
연구진은 관계적 유사성이 이미지 검색과 이미지 생성에 어떻게 적용될 수 있는지 탐구했다.

Relational retrieval returns images that share a deeper conceptual structure with the query, rather than matching surface features. For example, a food item styled to resemble a face retrieves other anthropomorphic meals; a sliced object yields other sliced forms; and scenes of adult-offspring interaction return images with similar relational roles, even when species and composition differ.
또한 관계적 유사성이 이미지 생성에 어떻게 적용될 수 있는지 탐구했다.

Given an input image and a relational prompt, models were asked to generate a new image expressing the same underlying concept. Proprietary models produced more faithful analogies, preserving structural logic across large changes in form, while open-sourced models tended to regress to literal or stylistic matches, failing to transfer the deeper idea. Outputs were compared against human-curated analogies, which exemplified the intended transformation.
결론
생성 AI 시스템은 추상적인 표현을 포함하는 능력이 있으면 더 향상될 수 있다. 현재는 개념 기반 이미지를 요청하면 가장 인기 있는 이미지나 데이터셋에 있는 이미지를 반환한다. 이것은 추상화가 아니라 기억이다.
이 원리는 생성적 글쓰기에 적용될 수 있다. 특히 분석적, 추측적, 또는 허구적인 출력에 유용할 수 있다.
재생하기 출처
* A100은 40Gb 또는 80GB의 VRAM을 가질 수 있다. 그러나 이 문서에서는 지정되지 않았다.
** 연구진의 인용문은 중복되므로 생략되었다.
最初에 2025년 12월 16일에 게시되었다.












