Взгляд Anderson

Искусственный интеллект может тайно ранжировать изображения по бренду устройства, а не по содержанию

mm
Добавьте Unite.AI в избранные источники в Google
A robot preferring a Mac over other junked laptops in the blurred background. Flux 1D and Firefly, via Krita.

Новое исследование показывает, что популярные системы искусственного интеллекта, ориентированные на изображения, не только смотрят на то, что находится на фотографии, но также улавливают, как была сделана фотография. Спрятанные детали, такие как тип камеры или качество изображения, могут тихо повлиять на то, что искусственный интеллект думает, что видит, что приводит к неправильным результатам – просто потому, что фотография была сделана с другого устройства.

 

В 2012 году было обнаружено, что сайт путешествий регулярно показывал более высокие цены пользователям, которых можно было определить как пользователей устройств Apple, связывая бренд Apple (AAPL ) с более высокой покупательной способностью. Последующее расследование пришло к выводу, что эта ориентация на устройство “обнюхивание кошелька” стала почти обычной для сайтов электронной коммерции.

Аналогично, какой смартфон или устройство захвата было использовано для拍ания конкретной фотографии, можно определить с помощью судебно-медицинских средств, на основе известных характеристик ограниченного числа объективов в моделях. В таких случаях модель устройства захвата обычно оценивается по визуальным следам; и, как в случае 2012 года, знание того, какой тип камеры сделал изображение, является потенциально эксплуатируемой характеристикой

Хотя устройства захвата склонны встраивать значимые метаданные в изображение, эта функция может быть часто отключена пользователями; даже когда она включена, платформы распространения, такие как социальные сети, могут удалить некоторые или все метаданные, либо по логистическим, либо по причинам конфиденциальности, либо по обоим.

Тем не менее, метаданные в загружаемых пользователями изображениях часто либо переписываются/интерпретируются (а не удаляются), либо остаются неизменными, как вторичный источник информации не о том, что находится на изображении, а о том, как было сделано изображение. Как показал случай 2012 года, информация такого рода может быть ценной – не только для коммерческих платформ, но и, потенциально, для хакеров и злоумышленников.

Два взгляда

Новое исследовательское сотрудничество между Японией и Чехией показало, что следы, оставленные аппаратным обеспечением камеры и обработкой изображений (такими как качество JPEG или резкость объектива), не только обнаруживаются судебно-медицинскими инструментами, но и默но закодированы в ‘глобальном понимании’ ведущих моделей искусственного интеллекта зрения.

Это включает в себя CLIP и другие крупномасштабные визуальные кодировщики, которые широко используются во всем, от поисковых систем до модерации контента. Новая работа демонстрирует, что эти модели не только интерпретируют то, что находится на фотографии, но также могут учиться тому, как была сделана фотография; и этот скрытый сигнал может иногда превосходить видимое содержание.

Пример пар изображений из набора данных PairCams авторов, созданного для проверки того, как тип камеры влияет на модели изображений искусственного интеллекта. Каждая пара показывает один и тот же объект или сцену, сфотографированную в одно и то же время с помощью не-смартфона (слева) и смартфона (справа). Источник: https://arxiv.org/pdf/2508.10637

Пример пар изображений из набора данных PairCams авторов, созданного для проверки того, как тип камеры влияет на модели изображений искусственного интеллекта. Каждая пара показывает один и тот же объект или сцену, сфотографированную в одно и то же время с помощью не-смартфона (слева) и смартфона (справа). Источник: https://arxiv.org/pdf/2508.10637

Исследование утверждает, что даже когда модели искусственного интеллекта получают сильно маскированные или обрезанные версии изображения, они все равно могут угадать марку и модель камеры с удивительной точностью. Это означает, что представительное пространство, которое эти системы используют для оценки сходства изображений, может стать запутанным с ненужными факторами, такими как устройство пользователя, с непредсказуемыми последствиями.

Например, в задачах, таких как классификация или извлечение изображений, это нежелательное “взвешивание” может вызвать у системы предпочтение определенным типам камер, независимо от того, что изображение на самом деле показывает.

В статье говорится:

‘Метаданные, оставляющие следы в визуальных кодировщиках до такой степени, что затмевают семантическую информацию, могут привести к непредсказуемым результатам, компрометируя общность, устойчивость и потенциально подрывая достоверность моделей.

‘Более критично, этот эффект может быть использован злонамеренно; например, атака может манипулировать метаданными, чтобы намеренно ввести в заблуждение или обмануть модель, представляя риски в чувствительных областях, таких как здравоохранение, наблюдение или автономные системы.’

Статья показывает, что системы Contrastive Visual-Language (CVL), такие как CLIP, теперь одна из наиболее влиятельных кодировщиков в компьютерном зрении, особенно склонны получать такие выводы из данных:

Результаты поиска для запроса изображения, показывающие, как основные модели ранжируют подобные изображения не только по визуальному содержанию, но и по скрытым метаданным, таким как сжатие JPEG или модель камеры. Фигура отражает утверждение авторов о том, что как семантические, так и метаданные влияют на представительное пространство модели, иногда изменяя результаты извлечения.

Результаты поиска для запроса изображения, показывающие, как основные модели ранжируют подобные изображения не только по визуальному содержанию, но и по скрытым метаданным, таким как сжатие JPEG или модель камеры. Фигура отражает утверждение авторов о том, что как семантические, так и метаданные влияют на представительное пространство модели, иногда изменяя результаты извлечения.

Статья новая называется Следы обработки и приобретения в визуальных кодировщиках: Что знает CLIP о вашей камере? и исходит от шести исследователей из Университета Осаки и Чешского технического университета в Праге.

Метод и данные

Чтобы проверить влияние скрытых метаданных на визуальные кодировщики, такие как CLIP, авторы работали с двумя категориями метаданных: параметрами обработки изображений (такими как сжатие JPEG или резкость) и параметрами приобретения (такими как модель камеры или настройки экспозиции).

Вместо того, чтобы обучать новые модели, исследователи оценили 47 широко используемых визуальных кодировщиков в их замороженном, предварительно обученном состоянии, включая контрастные модели зрения-языка, такие как CLIP, самообучаемые модели, такие как DINO, и традиционно обученные сети.

Для параметров обработки исследователи применяли контролируемые преобразования к наборам данных ImageNet и iNaturalist 2018, включая шесть уровней сжатия JPEG, три настройки резкости, три масштаба изменения размера и четыре метода интерполяции.

Примеры изображений и связанных с ними аннотаций из набора данных iNaturalist. Источник: https://arxiv.org/pdf/1707.06642

Примеры изображений и связанных с ними аннотаций из набора данных iNaturalist. Источник: https://arxiv.org/pdf/1707.06642

Модели были протестированы на их способность восстановить каждую настройку преобразования, используя только содержание изображения, с успешными прогнозами, указывающими на то, что кодировщик сохраняет информацию о этих выборах обработки в своем внутреннем представлении.

Чтобы изучить параметры приобретения, исследователи составили набор данных из 356 459 изображений, называемый FlickrExif, содержащий сохраненные Exif-метаданные, и создали второй набор данных, называемый PairCams, состоящий из 730 пар изображений, сделанных одновременно с помощью смартфона и не-смартфонной камеры.

Набор данных FlickrExif был создан с помощью API Flickr для загрузки изображений с сопровождающими Exif-метаданными. Было собрано от 2000 до 4000 безопасных для работы изображений каждый месяц, датированных началом 2000 года и серединой 2024 года, и отфильтровано, чтобы включать только те, у которых были разрешительные лицензии. Чтобы предотвратить чрезмерное представление отдельными пользователями, каждый отдельный вкладчик был ограничен десятью изображениями в месяц для любого данного года.

Для набора данных PairCams каждая фотография была сделана с помощью автоматических настроек и без вспышки, что позволило сравнить, как визуальные кодировщики реагируют на различия в аппаратном обеспечении камеры, независимо от содержания изображения:

Дополнительные примеры из набора данных PairCams, созданного авторами.

Дополнительные примеры из набора данных PairCams, созданного авторами.

Авторы протестировали два набора параметров: параметры обработки изображений, такие как сжатие и цветовые преобразования; и параметры приобретения, такие как марка или модель камеры:

Параметры обработки и приобретения изображений, проанализированные с количеством классов для каждого.

Параметры обработки и приобретения изображений, проанализированные с количеством классов для каждого.

Тесты

Чтобы определить, сохраняется ли информация об обработке и типе камеры внутри представлений визуальных кодировщиков, авторы обучили классификатор для прогнозирования метаданных непосредственно из этих представлений. Если классификатор не выполнил бы лучше, чем случайное угадывание, это бы указало на то, что детали обработки или устройства не захватываются моделью.

Однако любая производительность выше случайной бы указала на то, что эти технические следы действительно закодированы и могут повлиять на последующие задачи.

Чтобы протестировать следы обработки, авторы присвоили каждому обучающему изображению случайную настройку обработки, такую как определенный уровень сжатия JPEG, в то время как все тестовые изображения в партии делили одну и ту же настройку.

Средняя точность классификации по всем настройкам была затем объединена с повторными испытаниями под разными случайными семенами, чтобы определить, сохраняют ли кодировщики информацию о технических выборах в своем внутреннем представлении:

Точность классификации для прогнозирования параметров обработки изображений из представлений кодировщиков, используя линейный классификатор, примененный к замороженным моделям. Результаты показаны для сжатия JPEG, резкости, изменения размера и интерполяции, с тремя категориями моделей, контрастными моделями зрения-языка (оранжевый), обученными (зеленый) и самообучаемыми (синий), оцененными на ImageNet (верхний ряд) и iNaturalist 2018 (нижний ряд). Базовые линии случайного угадывания отмечены пунктирными линиями.

Точность классификации для прогнозирования параметров обработки изображений из представлений кодировщиков, используя линейный классификатор, примененный к замороженным моделям. Результаты показаны для сжатия JPEG, резкости, изменения размера и интерполяции, с тремя категориями моделей, контрастными моделями зрения-языка (оранжевый), обученными (зеленый) и самообучаемыми (синий), оцененными на ImageNet (верхний ряд) и iNaturalist 2018 (нижний ряд). Базовые линии случайного угадывания отмечены пунктирными линиями.

По всем четырем параметрам обработки контрастные модели зрения-языка показали наибольшую способность распознавать скрытые манипуляции с изображениями. Некоторые из этих моделей достигли более 80% точности при прогнозировании настроек сжатия JPEG, резкости и изменения размера из представлений ImageNet.

Обученные кодировщики, особенно те, которые основаны на ConvNeXt, также показали сильную производительность, в то время как самообучаемые модели были последовательно слабее.

Интерполяция была наиболее трудным параметром для обнаружения, но лучшие модели CVL и обученные все равно достигли результатов, значительно превышающих случайную базовую линию в 25% на обоих наборах данных.

Далее, чтобы протестировать, закодирована ли информация о камере в представлениях моделей, авторы создали отдельные обучающие и тестовые наборы для каждого параметра приобретения (такого как марка камеры, модель камеры, экспозиция, диафрагма, ISO и фокусное расстояние).

Для большинства параметров использовались только классы с не менее 5000 примеров; 500 изображений были случайно отложены для тестирования, и оставшиеся примеры были недоотобраны так, чтобы каждому классу было 200 обучающих примеров. Для параметров “модель (все)” и “модель (смартфон)”, которые имели меньше данных на класс, авторы вместо этого использовали классы с не менее 500 изображений и разделили каждый класс на обучающие и тестовые подмножества в соотношении четыре к одному.

Фотографы были разделены между обучающими, проверочными и тестовыми наборами, и был обучен простой классификатор для прогнозирования информации о камере на основе особенностей изображений.

Чтобы обеспечить, что классификатор не был подвержен влиянию семантического содержания изображений, 90% каждого изображения было центромаскировано (см. примеры ниже). Авторы утверждают, что на этом уровне маскирования все визуальные кодировщики выполняют близко к случайному на ImageNet, указывая на то, что семантический сигнал был эффективно подавлен:

Точность классификации ImageNet в зависимости от коэффициента маскирования. При маскировании 90% все модели снижаются до почти случайной производительности при прогнозировании семантических меток, указывая на то, что семантические подсказки были эффективно удалены. Примеры изображений внизу иллюстрируют уровни маскирования.

Точность классификации ImageNet в зависимости от коэффициента маскирования. При маскировании 90% все модели снижаются до почти случайной производительности при прогнозировании семантических меток, указывая на то, что семантические подсказки были эффективно удалены. Примеры изображений внизу иллюстрируют уровни маскирования.

Даже при маскировании 90% каждого изображения большинство контрастных моделей зрения-языка и обученные кодировщики ConvNeXt все еще прогнозировали метки, связанные с камерой, на уровнях, значительно превышающих случайные.

Многие модели CVL превышали 70% точности при различении изображений, сделанных смартфоном и не-смартфонной камерой.

Другие обученные кодировщики, SigLIP, и все самообучаемые модели показали гораздо более низкую производительность. Когда маскирование не применялось, модели CVL снова показали наиболее сильную кластеризацию по типу камеры, подтверждая, что эти модели более глубоко кодируют информацию об приобретении, чем другие:

Визуализации t-SNE для двух визуальных кодировщиков, с цветами, указывающими, было ли изображение сделано смартфоном или не-смартфонной камерой.

Визуализации t-SNE для двух визуальных кодировщиков, с цветами, указывающими, было ли изображение сделано смартфоном или не-смартфонной камерой.

Последующая значимость

Установив, что метаданные влияют на модели таким образом, склонность скрытых следов обработки к вмешательству в интерпретацию изображений была затем оценена.

Когда две версии одного и того же изображения были обработаны по-разному, представления часто организовывались по стилю обработки rather, чем по содержанию. В нескольких случаях сильно сжатое изображение собаки было обработано как более похожее на другое изображение с тем же уровнем сжатия, чем на свою собственную несжатую версию:

Влияние параметров обработки на семантическое прогнозирование, с точностью семантической классификации для ImageNet (верх) и iNaturalist (низ) при пяти настройках обработки. В базовой линии все обучающие и тестовые изображения имеют один и тот же метаданный ярлык; в настройке all-diff тестовое изображение использует метаданный ярлык, отсутствующий в обучающем наборе; в настройках pos-same и neg-same метаданный ярлык выравнивается либо с семантически подобными, либо с семантически неподобными изображениями; в настройке uniform метаданные ярлыки случайным образом присваиваются по всему обучающему набору. Результаты сообщаются при k = 10 для ImageNet и k = 1 для iNaturalist.

Влияние параметров обработки на семантическое прогнозирование, с точностью семантической классификации для ImageNet (верх) и iNaturalist (низ) при пяти настройках обработки. В базовой линии все обучающие и тестовые изображения имеют один и тот же метаданный ярлык; в настройке all-diff тестовое изображение использует метаданный ярлык, отсутствующий в обучающем наборе; в настройках pos-same и neg-same метаданный ярлык выравнивается либо с семантически подобными, либо с семантически неподобными изображениями; в настройке uniform метаданные ярлыки случайным образом присваиваются по всему обучающему набору. Результаты сообщаются при k = 10 для ImageNet и k = 1 для iNaturalist.

Самые сильные искажения были вызваны сжатием JPEG, за которым следовали резкость и изменение размера, в то время как интерполяция произвела только незначительный эффект. Авторы утверждают, что эти результаты демонстрируют, что следы обработки могут переопределить семантическую информацию и диктовать, как понимается изображение.

В заключение, они предупреждают:

‘Хотя мы определили, что метаданные закодированы в фундаментальных визуальных кодировщиках и дали намеки о потенциальных причинах, мы не можем точно указать источник проблемы. Дальнейшее расследование этого вопроса является сложным из-за стоимости переобучения таких моделей и частого использования частных наборов данных и неопубликованных деталей реализации.

‘Хотя мы не предлагаем конкретных методов смягчения, мы подчеркиваем эту проблему как важную область для будущих исследований.’

Заключение

В литературе наблюдается растущий судебно-медицинский интерес к следам и признакам “метода над содержанием”; чем легче определить область кадрирования или конкретный набор данных, тем легче использовать эту информацию в форме, например, детекторов глубоких подделок или систем, предназначенных для категоризации происхождения или возраста данных и моделей.

Все это противоречит основной цели обучения моделей искусственного интеллекта, которая заключается в том, что центральные дистиллированные понятия должны быть собраны независимо от средств производства и не должны нести никаких следов последних. На самом деле, наборы данных и устройства захвата имеют характеристики и доменные черты, которые практически невозможно отделить от содержания, поскольку они сами представляют “историческую перспективу”.

 

* Статья имеет необычный формат, и мы будем адаптироваться к его необычному форматированию и представлению как можно лучше. Большое количество материала, которое должно было быть в (не существующем) разделе “Метод”, было перемещено в разные части приложения, предположительно для ограничения основной статьи до восьми страниц – хотя и с значительной потерей ясности. Если мы пропустили какие-либо возможности для улучшения этого, из-за нехватки времени, мы извиняемся.

Опубликовано впервые в среду, 20 августа 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai