Взгляд Anderson
Системы компьютерного зрения на основе ИИ часто не смотрят на самом деле

Системы компьютерного зрения на основе ИИ могут объяснять изображения, используя стереотипы, а не то, что они действительно видят. Если удалить метку, их предполагаемые визуальные объяснения рухнут.
Поскольку передовые платформы ИИ постоянно теряют деньги в надежде на горизонт событий ИИ, небольшие экономии в их обеспечении и услугах равны большим сбережениям: например, каждый раз, когда большая языковая модель (LLM) может предоставить ответ из своей собственной обучающей матрицы, вместо того, чтобы совершить RAG-основанное путешествие в Интернет, чтобы получить текущую информацию, которая потребует переработки и уточнения, она отвечает быстрее и экономит деньги поставщику.
Конечно, она с большей вероятностью заллусинировать, не тратя дополнительные токены и энергию на контекстуализацию и проверку своих предположений.
Аналогично, даже когда LLM обращается к Интернету, она очень часто цитирует расплывчатые, неуместные или даже бессмысленные и не связанные между собой URL-адреса, потому что она сэкономила энергию, оценив только метаданные этих страниц, вместо того, чтобы действительно их прочитать.
Аналогично, если вы загрузите PDF-файл в LLM и хотите обсудить его, LLM может в конечном итоге удалить содержимое PDF-файла из памяти и использовать только скудную метаинформацию о нем, чтобы ответить на ваши запросы, не указывая даже на то, что вам следует загрузить его снова – что приводит к ошибкам, неправильным предположениям и еще большим заллусинациям.
Промышленные испытания
Это прагматичные, если не совсем честные, экономии, наложенные на пользователя по оперативным мотивам. В мире сбора данных и обучения моделей, где миллионы – даже сотни миллионов – изображений должны быть обработаны массово, и не могут быть手опос注ированы людьми, давление на минимизацию энергетических и временных затрат равно интенсивному.
Одним из таких “обходных путей” является использование промежуточной модели компьютерного зрения и языка, такой как Contrastive Language Image Pretraining (CLIP), которая отображает как изображения, так и текст в общее семантическое пространство, так что визуальные понятия можно сравнивать с помощью языка, а не явных меток.
Что это значит? Ну, представьте себе ребенка, который учится на миллионах подписанных изображений, пока он не развивает приблизительное представление о том, какие изображения и слова естественным образом подходят друг другу.
Проблема в том, что очень часто подписи были написаны владельцами веб-сайтов и другими сущностями, которые были более заинтересованы в хорошем SEO, чем в хорошем подписывании, что привело к большому количеству “шума” или неточной подписи.
Тем не менее, масштаб, на котором понятие и связанное с ним слово повторяются в огромных наборах данных, обычно означает, что основные слова будут ассоциироваться с правильным изображением, поскольку меньшее количество “бессмысленных” меток обычно будет вынуждено в аутлиер-гетто и не будет ассоциироваться с изображением. Итак, это более или менее работает, большинство времени.
Пометка данных выполняется таким образом, потому что это дешево и минимально функционально, а не потому, что это хорошо.
Не по назначению
В эту проблемную ситуацию входит новая работа из Карнеги-Меллона, которая ярко иллюстрирует, что многие подписи, присвоенные изображениям – например, CLIP – просто стереотипы на основе ссылки на текстовую метку изображения, а не активного взгляда на изображение само по себе.
В одном ярком примере из работы CLIP парируется с дескрипторами, сгенерированными из имени класса ImageNet клубника, затем тестируется на ImageNet-Sketch, где каждая клубника является черно-белым рисунком – но дескрипторы все равно настаивают, что фрукт ‘красный’ и ‘спелый’:

Дескрипторы имени класса не работают на ImageNet-Sketch: языковые приоритеты говорят ‘красный’ и ‘спелый’, в то время как атрибуты, основанные на изображении, соответствуют черно-белому рисунку. Источник
Здесь CLIP парируется с дескрипторами, сгенерированными только из имени класса клубника, через GPT-3 или внешние знания. Они никогда не видят изображение, поэтому они по умолчанию используют канонические черты, такие как красный и листовой. Когда они применяются к монохромным линейным иллюстрациям в ImageNet-Sketch, процесс терпит неудачу.
Напротив, атрибуты, полученные из изображений самих по себе, выбирают черты, которые остаются истинными при сдвиге, такие как точечный или сердцевидный.
Таким образом, мы можем увидеть, что идентифицируемый объект рекламируется не за то, что он есть, а, так сказать, “по репутации”; прилагательные “красный” и “листовой” точны для поддомена клубника, но превышают границы изображения (экземпляра) в вопросе.
Авторы новой работы – озаглавленной Атрибуты должны исходить от изображений, а не от имен классов: выбор атрибутов, обусловленный распределением, для моделей компьютерного зрения и языка – утверждают, что это постоянная и широко распространенная проблема, и предлагают выбирать атрибуты непосредственно из изображений самих по себе, так что они отражают то, что действительно видно при сдвиге распределения, а не полагаться на приоритеты имен классов.
Авторы заявляют:
‘Популярный путь к интерпретируемой классификации с нулевым выстрелом просит большую языковую модель (LLM) описать каждое имя класса и подсказывает CLIP с полученными дескрипторами. Мы показываем, что эти дескрипторы несут мало визуальных доказательств своих собственных: удаление имени класса из подсказки сводит точность ImageNet с 59,5% до 15,5%.
‘Диагноз заключается в том, что дескрипторы обусловлены меткой, а не изображениями, поэтому они описывают понятие в целом и вводят в заблуждение именно тогда, когда данные меняются; LLM настаивает, что клубника красная, но каждая клубника в ImageNet-Sketch является бесцветным линейным рисунком.
‘Мы поэтому выбираем атрибуты из целевой коллекции изображений: мы оцениваем большой пул атрибутов против изображений в общем пространстве CLIP и сохраняем только те атрибуты, которые действительно подходят к изображениям.’
Их предложенное решение заключается в том, что модель остается прежней, но вместо того, чтобы полагаться на описания имен классов, она проверяет пул кандидатов в атрибуты против изображений и сохраняет только те, которые действительно подходят к тому, что видно.
Стоимость этого, вероятно, приемлема, поскольку она не предполагает повторного использования сэкономленной энергии “обходных” методов, которые привели к проблеме в первую очередь. Скорее, она добавляет проход оценки по кандидатам в атрибуты на класс, так что задержка немного увеличивается – но гораздо меньше, чем повторное обучение или полные RAG-стильные конвейеры. В теории энергетическая стоимость будет приемлемой, взвешенной с учетом улучшения соответствия.
Метод
Поскольку методология тестов авторов особенно арканна, и поскольку минимальная дополнительная полезная информация будет получена при изучении их в глубину, мы, необычно, рассмотрим только сокращенный обзор их подхода.
Работа характеризует основную проблему как замешательство имени класса: ситуацию, когда производительность кажется значимой, но на самом деле зависит от имени класса само по себе, с дескрипторами, добавляющими мало – и терпящими неудачу, как только эта поддержка удаляется
Затем работа утверждает, что эта неудача неизбежна, поскольку дескрипторы, сгенерированные из имени класса, могут описывать только то, как вещь обычно выглядит, а не то, что действительно присутствует в конкретном изображении. Как только данные отклоняются от этих ожиданий, дескрипторы становятся не только бесполезными, но и активно вводящими в заблуждение, эффективно голосуя против правильного ответа.
Исследователи также рассматривали, может ли CLIP просто быть плохим в обнаружении атрибутов без помощи классовых меток или могут ли дескрипторы, сгенерированные GPT, быть слишком общими, чтобы быть полезными. Однако их последующие эксперименты опровергли бы оба объяснения.
Чтобы решить эту проблему, была использована замороженная модель CLIP для сравнения изображений с большим пулом кандидатов в атрибуты, полученных из VAW, LSA и GPT-3 выходов, сохраняя только те атрибуты, которые лучше всего соответствуют изображениям, без необходимости повторного обучения или дополнительной изображение-текстовой надзора:
Обзор предложенной системы: замороженная модель CLIP кодирует как изображения, так и большой пул кандидатов в атрибуты, используя косинусную подобие для измерения того, насколько сильно каждый дескриптор соответствует визуальному контенту. Наиболее высокооцененные атрибуты затем сохраняются на основе класса, производя интерпретируемый набор подсказок, сохраняя как изображение, так и текстовые кодировщики фиксированными на протяжении всего процесса.
Данные и тесты
Эксперименты авторов использовали CLIP с ResNet-50 в качестве основы и оценивали производительность на ImageNet вместе с четырьмя вариантами сдвига распределения: ImageNetV2; ImageNet-Sketch; ImageNet-A; и ImageNet-R.
Атрибуты были выбраны, используя только исходные изображения ImageNet для обучения – позволяя сдвинутым наборам данных служить тестом вне распределения для проверки того, остаются ли атрибуты, полученные из изображений, полезными, когда визуальные appearances меняются:
Точность классификации Top-1 на ImageNet и четырех сдвинутых бенчмарках. Результаты показывают, что производительность остается в целом схожей, когда имена классов включены в подсказки, но терпит неудачу, когда дескрипторы вынуждены стоять на своих собственных ногах, что предполагает, что большая часть их предполагаемой эффективности исходит от метки класса само по себе. Напротив, атрибуты, выбранные непосредственно из изображений, остаются значительно более информативными во всех протестированных наборах данных.
Пересelection атрибутов из того же пула, сгенерированного GPT, но обусловленного изображениями ImageNet, повысила точность без имен классов с 15,5% до 19,4%. Поскольку модель, пул атрибутов и протокол оценки остались неизменными, прирост можно полностью отнести к выбору, обусловленному изображением.
Результат также указал на то, что CLIP может выявить атрибуты без классовых меток, и что пул, сгенерированный GPT, уже содержал полезные дескрипторы. Основная неудача, казалось, заключалась в обусловленном меткой поколении, которое часто не смогло раскрыть атрибуты, наиболее актуальные для изображений самих по себе.
Хотя авторы продолжают серию обширных дополнительных экспериментов, мы должны сослаться читателя на исходный материал для дальнейших деталей этих, поскольку, вместо того, чтобы расширять объем результатов, они только подтверждают центральные гипотезы, изложенные до сих пор – что зависимость от меток может потенциально подорвать потенциал реальных данных изображений в современных приложениях компьютерного зрения, с дешевой зависимостью от “репутационной” вероятности как опасностью для точности результатов.
Вывод
Интересно рассмотреть долг, который современный генеративный ИИ обязан миллионам рукописных изображений, которые были поглощены в огромные траловые наборы данных, такие как Common Crawl, в начале эры гипермасштаба.
Каждый раз, когда система распознавания изображений или автоматическая система подписи пытается классифицировать или переподписать старое или новое изображение, происхождение этого знания восходит к некоторому поставщику, который написал ‘Горячий журнал 1970-х годов!’ в alt-метке некоторого списка на eBay в 2004 году или некоторое подобное событие.
Хотя многие считают, что золотой век ключевых слов был смыт алгоритмом PageRank Google почти три десятилетия назад, подход стены текста, надеюсь, что что-то сработает остается очень живым: только вчера, в начале HTML-страницы выпуска модели Qwen-Image-3.0, был атавистический взрыв (он может все еще быть там!) ключевых слов безумия:
HTML-код выпуска Qwen Image 3 – это не совсем подходящая для СМИ стена ключевых слов, по крайней мере, на момент написания. Источник
Независимо от того, систематически ли этот лавинный ключевой текст в странице Qwen Image 3 получен из целевых списков или написан вручную SEO-специалистами, это идеальный пример сырых истоков современной системы генеративного ИИ, с значением, часто несущим огромный полезный груз собственных интересов, который позже необходимо будет удалить или хотя бы учесть каким-то образом, когда такие термины мешают или препятствуют рациональным системам и приложениям.
Опубликовано впервые в среду, 22 июля 2026 года












