Взгляд Anderson
Глубокие модели машинного обучения могут испытывать трудности с распознаванием изображений, сгенерированных ИИ

Новые исследования показывают, что современные модели ИИ значительно хуже распознают и интерпретируют изображения, сгенерированные ИИ, по сравнению с людьми. Это может стать проблемой в будущем, когда модели машинного обучения будут все чаще тренироваться на синтетических данных, и не всегда будет известно, являются ли данные “реальными” или нет.

Здесь мы видим модель предсказания resnext101_32x8d_wsl, испытывающую трудности в категории ‘бублик’. В тестах неудача распознавания считалась произошедшей, если основное целевое слово (в данном случае ‘бублик’) не было включено в топ-5 предсказанных результатов. Источник: https://arxiv.org/pdf/2208.10760.pdf
Новые исследования проверили две категории компьютерных моделей распознавания: распознавание объектов и визуальное ответ на вопросы (VQA).

Слева: успехи и неудачи системы распознавания объектов; справа: задачи VQA, предназначенные для изучения понимания ИИ сцен и изображений более исследовательским и значимым образом. Источники: https://arxiv.org/pdf/2105.05312.pdf и https://arxiv.org/pdf/1505.00468.pdf
Из десяти современных моделей, протестированных на наборах данных, сгенерированных фреймворками DALL-E 2 и Midjourney, лучшая модель смогла достичь только 60% и 80% точности в топ-5 результатов, тогда как ImageNet, обученная на реальных данных, может достичь 91% и 99% в тех же категориях, а человеческая точность обычно значительно выше.
Решая проблемы, связанные с сдвигом распределения (также известным как “дрейф модели”, когда модели предсказания испытывают снижение прогностической способности при переходе от обучающих данных к “реальным” данным), автор статьи заявляет:
‘Люди способны распознавать сгенерированные изображения и отвечать на вопросы о них легко. Мы заключаем, что а) глубокие модели испытывают трудности с пониманием сгенерированного контента и могут улучшиться после дообучения, и б) существует большой сдвиг распределения между сгенерированными изображениями и реальными фотографиями. Сдвиг распределения, кажется, зависит от категории.’
Учитывая объем синтетических изображений, уже наводнивших интернет после открытия мощной модели Stable Diffusion, возникает возможность того, что эти “фальшивые” изображения могут повлиять на точность отраслевых наборов данных, таких как Common Crawl.
Хотя синтетические данные были провозглашены как потенциальный спаситель дефицитного сектора компьютерного зрения, который часто испытывает нехватку ресурсов и бюджетов для крупномасштабной куратории, новый поток изображений Stable Diffusion (вместе с общим ростом синтетических изображений с момента появления и коммерциализации DALL-E 2) вряд ли будут сопровождаться полезными метками, аннотациями и хэштегами, отличающими их как “фальшивые” на момент, когда жадные системы машинного зрения будут их собирать из интернета.
Скорость разработки в открытом исходном коде фреймворков синтеза изображений заметно опережает нашу способность категоризировать изображения из этих систем, что привело к растущему интересу к системам обнаружения “фальшивых” изображений, аналогичных системам обнаружения глубоких фейков, но предназначенным для оценки целых изображений, а не только секций лиц.
Новая статья под названием Насколько хорошо глубокие модели понимают сгенерированные изображения написана Али Борджи из сан-францисской компании машинного обучения Quintic AI.
Данные
Исследование предшествует выпуску Stable Diffusion, и эксперименты используют данные, сгенерированные DALL-E 2 и Midjourney, по 17 категориям, включая слон, гриб, пицца, бретцель, трактор и кролик.

Примеры изображений, из которых тестируемые системы распознавания и VQA были вынуждены определить наиболее важную ключевую концепцию.
Изображения были получены через поиск в интернете и Twitter, и, в соответствии с политикой DALL-E 2 (по крайней мере, на момент исследования), не включали изображения с человеческими лицами. Были выбраны только изображения высокого качества, распознаваемые людьми.
Были созданы два набора изображений, один для задач распознавания объектов, другой для задач VQA.

Количество изображений в каждой тестируемой категории для распознавания объектов.
Тестирование распознавания объектов
Для тестов распознавания объектов были протестированы десять моделей, все обученные на ImageNet: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit и ResNext_WSL.
Некоторые классы в тестируемых системах были более детальными, чем другие, что потребовало применения усредненных подходов. Например, ImageNet содержит три класса, связанных с “часами”, и было необходимо определить некоторый种 метрики, где включение любых “часов” в топ-5 полученных меток для любого изображения считалось успехом в этом случае.

Результаты моделей по 17 категориям.
Лучшей моделью в этом раунде стала resnext101_32x8d_ws, достигшая почти 60% для топ-1 (т.е. случаев, когда ее предпочтительное предсказание из пяти попыток было правильной концепцией, воплощенной в изображении) и 80% для топ-5 (т.е. когда желаемая концепция была хотя бы перечислена где-то в пяти попытках модели).
Автор предполагает, что эта модель показала хорошую производительность благодаря тому, что она была обучена для слабо-наблюдаемого предсказания хэштегов в социальных сетях. Однако эти ведущие результаты, отмечает автор, заметно ниже того, чего может достичь ImageNet на реальных данных, т.е. 91% и 99%. Он предполагает, что это связано с большим расхождением между распределением изображений ImageNet (которые также собраны из интернета) и сгенерированными изображениями.
Пять наиболее трудных категорий для системы, в порядке трудности, были воздушный змей, черепаха, белка, очки и шлем. Статья отмечает, что класс воздушный змей часто путается с шаром, парашютом и зонтиком, хотя эти различия легко различимы для человеческих наблюдателей.
Определенные категории, включая воздушный змей и черепаху, вызвали универсальную неудачу во всех моделях, в то время как другие (заметно бретцель и трактор) привели к почти универсальному успеху во всех тестируемых моделях.

Поляризующие категории: некоторые из выбранных целевых категорий либо полностью обманули все модели, либо были довольно легко идентифицированы всеми моделями.
Авторы предполагают, что эти результаты указывают на то, что все модели распознавания объектов могут иметь схожие сильные и слабые стороны.
Тестирование визуального ответа на вопросы
Далее автор протестировал модели VQA на открытых и свободно-формулированных вопросах VQA с бинарными вопросами (т.е. вопросами, на которые можно ответить только “да” или “нет”). Статья отмечает, что современные модели VQA могут достичь 95% точности на наборе данных VQA-v2.
Для этого раунда тестирования автор создал 50 изображений и сформулировал 241 вопрос вокруг них, 132 из которых имели положительные ответы, и 109 отрицательные. Средняя длина вопроса составляла 5,12 слова.
Этот раунд использовал модель OFA, задача-агностический и модальность-агностический фреймворк для тестирования полноты задач, и недавно стал лидером в наборе данных VQA-v2 test-std. Модель OFA показала 77,27% точности на сгенерированных изображениях, по сравнению со своей собственной оценкой 94,7% в наборе данных VQA-v2 test-std.

Примеры вопросов и результатов из раздела VQA тестов. ‘GT’ означает ‘Истинное значение’, т.е. правильный ответ.
Автор статьи предполагает, что часть причины этого может заключаться в том, что сгенерированные изображения содержат семантические концепции, отсутствующие в наборе данных VQA-v2, и что вопросы, написанные для тестов VQA, могут быть более сложными, чем стандартные вопросы VQA-v2, хотя он считает, что первая причина более вероятна.
LSD в потоке данных?
Мнение
Новая распространенность ИИ-синтезированных изображений, которые могут представлять мгновенные соединения и абстракции основных концепций, не существующих в природе, и которые были бы чрезвычайно трудоемкими для производства с помощью традиционных методов, может представлять особую проблему для слабо-наблюдаемых систем сбора данных, которые могут не быть способны обрабатывать высокий объем неаннотированных синтетических данных.
В таких случаях может возникнуть риск того, что эти системы будут собирать определенный процент “странных” синтетических изображений в неправильные классы просто потому, что изображения содержат различные объекты, которые не действительно принадлежат вместе.

‘Астронавт, едущий на лошади’, возможно, стал наиболее эмблематическим визуальным представлением для нового поколения систем синтеза изображений – но такие ‘нереальные’ отношения могут войти в реальные системы обнаружения, если не принять меры. Источник: https://twitter.com/openai/status/1511714545529614338?lang=en
Если это не будет предотвращено на этапе предобработки перед обучением, такие автоматические конвейеры могут привести к тому, что в модели машинного обучения будут обучены неправдоподобные или даже уродливые ассоциации, снижая их эффективность и рискуя передать высокоуровневые ассоциации в системы нижнего уровня.
Альтернативно, разрозненные синтетические изображения могут оказать “охлаждающий” эффект на точность последующих систем, если в будущем появятся новые или измененные архитектуры, которые попытаются учесть синтетические изображения, и будут слишком широко распространены.
В любом случае синтетические изображения в эпоху после Stable Diffusion могут стать головной болью для сектора компьютерного зрения, чьи усилия сделали эти странные творения возможными – не в последнюю очередь потому, что они подвергают опасности надежды сектора на то, что сбор и куратория данных могут быть в конечном итоге намного более автоматизированы, чем сейчас, и намного менее трудоемкими и дорогостоящими.
Опубликовано впервые 1 сентября 2022 года.












