Взгляд Anderson
Привносясь Визуальные Аналогии в ИИ

Текущие модели ИИ не могут распознавать ‘реляционные’ подобия изображений, такие как подобие слоев Земли и персика, пропуская ключевой аспект того, как люди воспринимают изображения.
Хотя существует много моделей компьютерного зрения, которые могут сравнивать изображения и находить между ними подобия, текущее поколение сравнительных систем имеет мало или совсем нет воображаемой способности. Рассмотрим некоторые строки из классической песни 1960-х годов, Ветряные мельницы твоего разума:
Как карусель, которая вращается, бегая по кругу вокруг луны
Как часы, чьи стрелки проходят мимо минут на своем лице
И мир похож на яблоко, вращающееся молча в пространстве
Такие сравнения представляют собой область поэтических аллюзий, которые имеют значение для людей далеко за пределами художественного выражения; скорее, они связаны с тем, как мы развиваем наши перцептивные системы; когда мы создаем нашу ‘объектную’ область, мы развиваем способность к визуальному подобию, так что – например – поперечные сечения, изображающие персик и планету Земля, или фрактальные рекурсии, такие как спиральные узоры кофе и ветвей галактик, регистрируются как аналогичные для нас.
Таким образом, мы можем вывести связи между, казалось бы, не связанными объектами и типами объектов и выводить системы (такие как гравитация, импульс и поверхностная когезия), которые могут применяться к различным областям на различных масштабах.
Видение
Даже последнее поколение систем сравнения изображений ИИ, таких как Изученная перцептивная подобия изображений (LPIPS) и DINO, которые информируются обратной связью человека, выполняют только буквальные поверхностные сравнения.
Их способность находить лица там, где их нет – т.е., парейдолия – не представляет собой тот тип механизмов визуального подобия, которые развивают люди, а скорее возникает потому, что алгоритмы поиска лиц используют низкоуровневые структуры лиц признаки, которые иногда совпадают с случайными объектами:

Примеры ложных положительных результатов для распознавания лиц в наборе данных ‘Лица и вещи’. Источник – https://arxiv.org/pdf/2409.16143
Чтобы определить, могут ли машины действительно развить нашу воображаемую способность к распознаванию визуального подобия, исследователи в США провели исследование вокруг Реляционного визуального подобия, курируя и обучая новый набор данных, предназначенный для того, чтобы заставить образовываться абстрактные отношения между различными объектами, которые, тем не менее, связаны абстрактным отношением:

Большинство моделей ИИ распознают подобия только тогда, когда изображения имеют общие поверхностные черты, такие как форма или цвет, поэтому они связывают только группу Б (выше) с эталонным изображением. Люди, с другой стороны, также видят группу А как подобную – не потому, что изображения похожи, а потому, что они следуют одной и той же основной логике, такой как показывающей трансформацию во времени. Новая работа пытается воспроизвести этот тип структурного или реляционного подобия, стремясь приблизить восприятие машины к человеческому рассуждению. Источник: https://arxiv.org/pdf/2512.07833
Система подписывания, разработанная для набора данных, позволяет делать необычно абстрактные аннотации, предназначенные для того, чтобы заставить системы ИИ сосредоточиться на базовых характеристиках, а не на конкретных местных деталях:

Предсказанные ‘анонимные’ подписи, которые вносят вклад в метрику ‘relsim’ авторов.
Кураторский сбор и необычный стиль подписывания питают новую предложенную метрику relsim, которую авторы тонко настроили в модель видения-языка (VLM).

Сравнение стиля подписывания типичных наборов данных, который фокусируется на подобии атрибутов, тогда как подход ‘relsim’ (нижний ряд) подчеркивает реляционное подобие.
Новый подход опирается на методологии из когнитивной науки, в частности на теорию структурированного сопоставления Дедре Гентнер (изучение аналогий) и определение Амоса Тверски реляционного подобия и подобия атрибутов.

С сайта связанного проекта, пример реляционного подобия. Источник – https://thaoshibe.github.io/relsim/
Авторы заявляют:
‘[Люди] обрабатывают подобие атрибутов перцептивно, но реляционное подобие требует концептуальной абстракции, часто поддерживаемой языком или предварительным знанием. Это предполагает, что распознавание реляционного подобия сначала требует понимания изображения, использования знаний и абстрагирования его основной структуры.’
Новая работа озаглавлена Реляционное визуальное подобие и сопровождается сайтом проекта (см. видео, встроенное в конце этой статьи).
Метод
Исследователи использовали один из наиболее известных гипермасштабных наборов данных в качестве отправной точки для своей коллекции – LAION-2B:

Метаданные для записи в коллекции LAION-2B. Источник – https://huggingface.co/datasets/laion/laion2B-en-aesthetic/viewer/default/train
114 000 изображений, которые, вероятно, содержат эластичные реляционные структуры, были извлечены из LAION-2B, включая фильтрацию многих низкокачественных изображений, присутствующих в минимально курируемом наборе данных.
Чтобы создать конвейер для этого процесса отбора, авторы использовали Qwen2.5-VL-7B, используя 1 300 положительных и 11 000 отрицательных примеров, помеченных человеком:

Система ‘relsim’ обучается в трех этапах: фильтрация изображений из LAION-2B для реляционного содержания; назначение каждой группы общей анонимной подписи, которая захватывает их основную логику; и обучение для сопоставления изображений с этими подписями с использованием контрастной ошибки.
В работе говорится:
‘Аннотаторы были инструктированы: “Можете ли вы увидеть любую реляционную закономерность, логику или структуру в этом изображении, которая могла бы быть полезна для создания или связи с другим изображением?”. Тонко настроенная модель достигает 93% согласия с человеческими суждениями, и когда она применяется к LAION-2B, она дает N = 114k изображений, определенных как реляционно интересные.’
Чтобы сгенерировать реляционные метки, исследователи побуждали модель Qwen описать общую логику за наборами изображений без указания конкретных объектов. Эта абстракция была трудна для получения, когда модель видела только одно изображение, но стала работоспособной, когда несколько примеров демонстрировали основную закономерность.
Результирующие групповые подписи заменили конкретные термины на плейсхолдеры, такие как ‘{Субъект}’ или ‘{Тип движения}’, что сделало их широко применимыми.
После верификации человеком каждая подпись была сопоставлена со всеми изображениями в своей группе. Более 500 таких групп были использованы для обучения модели, которая затем была применена к 114 000 отфильтрованным изображениям, чтобы произвести большой набор абстрактных, реляционно аннотированных образцов.
Данные и Тесты
После извлечения реляционных особенностей с помощью Qwen2.5-VL-7B модель была тонко настроена на данных с помощью LoRA, в течение 15 000 шагов, через восемь A100 GPU*. Для текстовой стороны реляционные подписи были встроены с помощью all-MiniLM-L6-v2 из Sentence-Transformers library.
Набор данных из 114 000 подписанных изображений был разделен на 100 000 для обучения и 14 000 для оценки. Чтобы протестировать систему, была использована настройка извлечения: данное запросное изображение, модель должна была найти другое изображение из пула в 28 000 элементов, которое выражает одну и ту же реляционную идею. Пул извлечения включал 14 000 оценочных изображений и 14 000 дополнительных образцов из LAION-2B, с 1 000 запросами, случайно выбранными из набора оценки для бенчмаркинга.
Чтобы оценить качество извлечения, GPT-4o был использован для оценки реляционного подобия между каждым запросом и извлеченным изображением по шкале от 0 до 10. Отдельное человеческое исследование также было проведено, чтобы оценить предпочтение пользователя (см. ниже).
Каждый участник был показан анонимное запросное изображение с двумя кандидатами, одним, извлеченным предложенным методом, и другим, базовым. Участники были попросены указать, какое изображение было более реляционно подобно запросу, или если оба были одинаково близки. Для каждого базового варианта были созданы 300 тройных наборов и оценены не менее чем тремя людьми каждый, что дало около 900 ответов.
Подход ‘relsim’ был сравнен с несколькими установленными методами сравнения изображений, включая упомянутые выше LPIPS и DINO, а также dreamsim и CLIP-I. В дополнение к базовым методам, которые напрямую вычисляют баллы подобия между парами изображений, такими как LPIPS, DINO, dreamsim и CLIP-I, авторы также протестировали методы, основанные на подписях, в которых Qwen использовался для генерации анонимной или абстрактной подписи для каждого изображения; это затем служило запросом для извлечения.
Два варианта извлечения были оценены, с использованием CLIP-основанного текст-изображение извлечения (CLIP-T) для текст-изображение извлечения и Qwen-T для текст-текст извлечения. Оба метода, основанные на подписях, использовали исходную предварительно обученную модель Qwen, а не версию, тонко настроенную на реляционную логику. Это позволило авторам выделить эффект группового обучения, поскольку тонко настроенная модель была подвергнута воздействию наборов изображений, а не отдельных примеров.
Существующие Метрики и Реляционное Подобие
Авторы изначально протестировали, могут ли существующие метрики захватить реляционное подобие:

Сравнение производительности извлечения, оцененной GPT-4o, показывающей средний балл реляционного подобия для каждого метода. Традиционные метрики подобия, такие как LPIPS, DINO и CLIP-I, получили более низкие баллы. Методы, основанные на подписях, Qwen-T и CLIP-T, также показали худшую производительность. Самый высокий балл был достигнут подходом ‘relsim’ (6,77, правый синий столбец), что указывает на то, что настройка на групповые реляционные закономерности улучшила соответствие оценкам GPT-4o.
Относительно этих результатов авторы заявляют**:
‘[LPIPS], который фокусируется исключительно на перцептивном подобии, достигает самого низкого балла (4,56). [DINO] работает только немного лучше (5,14), вероятно, потому, что он обучается исключительно в самообучаемом режиме на изображениях. [CLIP-I] дает самые сильные результаты среди базовых методов (5,91), вероятно, потому, что некоторая абстракция иногда присутствует в подписях изображений.
‘Однако CLIP-I все еще показывает худшую производительность по сравнению с нашим методом, поскольку достижение лучшего балла может потребовать способности достигать еще более высоких абстракций, таких как те, которые в анонимных подписях.’
В человеческом исследовании люди последовательно предпочитали метод ‘relsim’ во всех базовых вариантах:

Баллы реляционного подобия, присвоенные GPT-4o для каждого метода. Традиционные метрики подобия, такие как LPIPS, DINO и CLIP-I, получили более низкие баллы, и методы, основанные на подписях, Qwen-T и CLIP-T, показали только немного лучшую производительность. Даже настроенные версии DINO и CLIP не закрыли разрыв. Самый высокий балл, 6,77, был достигнут моделью ‘relsim’, обученной с групповым надзором.
Авторы отмечают:
‘Это очень обнадеживает, поскольку оно демонстрирует не только то, что наша модель, relsim, может успешно извлекать реляционно подобные изображения, но также, снова, подтверждает, что люди действительно воспринимают реляционное подобие – а не только подобие атрибутов!’
Чтобы изучить, как реляционное и атрибутное подобие могут дополнить друг друга, исследователи использовали объединенный метод визуализации. Одно запросное изображение (‘Собака, держащая камеру’) было сравнено с 3 000 случайными изображениями, и подобие было рассчитано с использованием как реляционных, так и атрибутных моделей:

Объединенная визуализация пространства визуального подобия с использованием реляционных и атрибутных осей. Одно запросное изображение, изображающее собаку, использующую камеру, было сравнено с 3 000 другими. Результаты были организованы по реляционному подобию (вертикально) и подобию атрибутов (горизонтально). Верхний правый регион содержит изображения, которые похожи на запрос как по логике, так и по виду, такие как другие собаки, использующие инструменты. Верхний левый регион содержит семантически связанные, но визуально различные случаи, такие как разные животные, выполняющие действия, связанные с камерой. Большинство остальных примеров кластеризуются ниже в пространстве, отражая более слабое подобие. Расположение иллюстрирует, как реляционные и атрибутные модели подчеркивают комплементарные аспекты визуальных данных. Пожалуйста, обратитесь к исходной работе для лучшего разрешения.
Результаты показали кластеры, соответствующие различным типам подобия: некоторые изображения были как реляционно, так и визуально подобны, такие как другие собаки в человеческих позах; другие разделяли реляционную логику, но не вид, такие как разные животные, имитирующие человеческие действия; остальные не показывали ни того, ни другого.
Этот анализ предполагает, что два типа подобия играют разные роли и дают более богатую структуру при объединении.
Случаи Использования
В работе также исследуются некоторые возможные случаи использования реляционного подобия, включая реляционное извлечение изображений, которое позволяет выполнять поиск изображений более соответствующий творческому способу восприятия мира людьми:

Реляционное извлечение возвращает изображения, которые делят более глубокую концептуальную структуру с запросом, а не совпадают по поверхностным особенностям. Например, еда, стилизованная под лицо, извлекает другие антропоморфные блюда; нарезанный объект извлекает другие нарезанные формы; и сцены взаимодействия взрослых и потомства возвращают изображения с подобными реляционными ролями, даже если вид и состав отличаются.
Другой возможностью является аналоговое генерирование изображений, которое позволило бы синтезировать запросы, использующие реляционные структуры, а не прямые описания. При сравнении результатов, полученных от текущего поколения моделей текст-изображение, мы можем увидеть, что результаты такого подхода, вероятно, будут более разнообразными:

Данное входное изображение и реляционное описание, модели были попросены сгенерировать новое изображение, выражающее одну и ту же основную концепцию. Проприетарные модели произвели более верные аналогии, сохраняя структурную логику через большие изменения формы, в то время как открытые модели склонялись к регрессии к буквальным или стилистическим совпадениям, не передавая более глубокую идею. Выходные данные были сравнены с человеческими аналогиями, которые демонстрировали предполагаемую трансформацию.
Вывод
Генеративные системы ИИ, вероятно, будут значительно улучшены, если они смогут включить абстрактное представление в свои концептуализации. Как это стоит сейчас, запрос концептуальных изображений, таких как ‘гнев’ или ‘счастье’, склоняется к возвращению изображений, стилизованных из наиболее популярных или многочисленных изображений, которые имели эти ассоциации в наборе данных; что является запоминанием а не абстракцией.
Предположительно, этот принцип может быть еще более полезным, если его можно применить к генеративному письму – особенно аналитическому, спекулятивному или художественному.
Нажмите, чтобы воспроизвести. Источник
* А100 может иметь 40 ГБ или 80 ГБ видеопамяти; это не указано в работе.
** Цитаты авторов избыточны и исключены.
Опубликовано впервые во вторник, 16 декабря 2025 года.












