Взгляд Anderson
Как определить, когда системы синтеза изображений производят真正 оригинальный материал

Новое исследование из Южной Кореи предложило метод определения того, производят ли системы синтеза изображений真正 новые изображения или просто незначительные вариации тренировочных данных, что потенциально может противоречить цели таких архитектур (например, производству новых и оригинальных изображений).
Очень часто, как предполагает статья, последнее утверждение верно, поскольку существующие метрики, которые такие системы используют для улучшения своих генеративных возможностей в процессе обучения, вынуждены отдавать предпочтение изображениям, которые относительно близки к (не фальшивым) исходным изображениям в наборе данных.
Ведь если сгенерированное изображение «визуально близко» к исходным данным, оно, скорее всего, будет получать более высокий балл за «аутентичность», чем за «оригинальность», поскольку оно «верно» – хотя и не вдохновляюще.
В секторе, который еще слишком молод и неопробованный, чтобы его юридические последствия были еще известны, это может оказаться важным юридическим вопросом, если окажется, что коммерциализированный синтетический контент изображений не достаточно отличается от (часто) защищенных авторским правом исходных материалов, которые в настоящее время допускаются в исследовательский сектор в виде популярных веб-скрапированных наборов данных (потенциал будущих претензий по поводу нарушения авторских прав такого типа был впервые рассмотрен относительно недавно в отношении GitHub Co-Pilot AI от Microsoft ).
В плане все более связного и семантически прочного вывода из систем, таких как OpenAI’s DALL-E 2, Google’s Imagen и China’s CogView (а также менее мощных DALL-E mini), существует очень мало постфактум способов надежно проверить оригинальность сгенерированного изображения.
Действительно, поиск некоторых из самых популярных новых изображений DALL-E 2 часто приводит только к дальнейшим экземплярам этих же изображений, в зависимости от поисковой системы.

Uploading a complete 9-image DALL-E 2 output group only leads to more DALL-E 2 output groups, because the grid structure is the strongest feature. Separating and uploading the first image (from this Twitter post of 8th июнь 2022, from the ‘Weird Dall-E Generations’ account) causes Google to fixate on the basketball in the picture, taking the image-based search down a semantic blind alley. For the same image-based search, Yandex seems at least to be doing some actual pixel-based deconstruction and feature-matching.
Хотя Yandex с большей вероятностью, чем Google Search, использует фактические функции (т.е. функции, полученные/рассчитанные из изображения, а не обязательно функции лица человека) и визуальные характеристики (а не семантические) представленного изображения для поиска похожих изображений, все поисковые системы изображений либо имеют некоторую программу или практику, которая может затруднить выявление случаев плагиата «исходное>сгенерированное» через веб-поиск.
Кроме того, тренировочные данные для генеративной модели могут быть не полностью доступны публично, что еще больше препятствует судебной экспертизе оригинальности сгенерированных изображений.
Интересно, что выполнение поиска изображения в одном из синтетических изображений, представленных Google на его посвященном сайте Imagen, не находит ничего сравнимого с предметом изображения, в плане фактического просмотра изображения и беспристрастного поиска похожих изображений. Вместо этого, семантически фиксированный поиск Google не позволяет провести чистый веб-поиск изображения без добавления поисковых терминов «imagen google» в качестве дополнительного (и ограничивающего) параметра:
Yandex, с другой стороны, находит множество похожих (или, по крайней мере, визуально связанных) реальных изображений из художественного сообщества:
В целом было бы лучше, если бы новизна или оригинальность вывода систем синтеза изображений могла бы быть измерена каким-то образом, не требуя извлечения функций из каждого возможного веб-изображения в момент обучения модели или в не публичных наборах данных, которые могут использовать защищенные авторским правом материалы.
Связано с этой проблемой, исследователи из школы искусственного интеллекта Kim Jaechul в Корейском институте передовых технологий (KAIST AI) сотрудничали с глобальной ИКТ- и поисковой компанией NAVER Corp для разработки Балла редкости, который может помочь определить более оригинальные творения систем синтеза изображений.

Images here are generated via StyleGAN-FFHQ. From left to right, the columns indicate worst to best results. We can see that the ‘Truncation trick’ metric (see below) and the Realism metric have their own agendas, whilst the new ‘Rarity’ score (top row) is seeking out cohesive but original imagery (rather than just cohesive imagery). Since there are image-size limits in this article, please see the source paper for better detail and resolution. Source: https://arxiv.org/pdf/2206.08549.pdf
За пределами «дешевого трюка»
Среди предыдущих метрик, на которые опирается новая статья, есть «трюк обрезки» предложенный в 2019 году в сотрудничестве между университетом Heriot-Watt в Великобритании и Google’s DeepMind.
Трюк обрезки по сути использует другое латентное распределение для выборки, чем то, которое использовалось для обучения генеративной модели.
Исследователи, разработавшие этот метод, были удивлены, что он работает, но признают в исходной статье, что он снижает разнообразие сгенерированного вывода. Тем не менее, трюк обрезки стал эффективным и популярным в контексте того, что можно переописать как «дешевый трюк» для получения аутентичных результатов, которые не действительно ассимилируют все возможности, присутствующие в данных, и могут больше походить на исходные данные, чем желательно.
Относительно трюка обрезки авторы новой статьи отмечают:
«Он не предназначен для генерации редких образцов в тренировочных наборах данных, а скорее для синтеза типичных изображений более стабильно. Мы предполагаем, что существующие генеративные модели смогут производить образцы, более богатые реальным распределением данных, если генератор сможет быть побужден эффективно производить редкие образцы».
Общая тенденция полагаться на традиционные метрики, такие как расстояние Фрехе-Инсепшн (FID, которое подверглось интенсивной критике в декабре 2021 года), балл инсепшн (IS) и расстояние ядра Инсепшн (KID) в качестве «индикаторов прогресса» во время обучения генеративной модели, авторы дальнейшего комментария:
«Эта схема обучения приводит генератор к тому, чтобы не синтезировать много редких образцов, которые уникальны и имеют сильные характеристики, которые не составляют большую часть реального распределения изображений. Примеры редких образцов из публичных наборов данных включают людей с различными аксессуарами в FFHQ, белых животных в AFHQ и необычные статуи в Metfaces.
«Способность генерировать редкие образцы важна не только потому, что она связана с краевой возможностью генеративных моделей, но и потому, что уникальность играет важную роль в творческих приложениях, таких как виртуальные люди.
«Однако качественные результаты нескольких недавних исследований редко содержат эти редкие примеры. Мы предполагаем, что природа схемы противостоящего обучения заставляет распределение сгенерированных изображений быть подобным тому, что в тренировочном наборе данных. Следовательно, изображения с четкой индивидуальностью или редкостью занимают только небольшую часть изображений, синтезированных моделями».
Техника
Новая метрика редкости исследователей адаптирует идею, представленную в предыдущих работах – использование K-ближайших соседей (KNN) для представления массивов настоящих (тренировочных) и синтетических (выводных) данных в системе синтеза изображений.
Относительно этого нового метода анализа авторы утверждают:
«Мы предполагаем, что обычные образцы будут находиться ближе друг к другу, тогда как уникальные и редкие образцы будут разреженно расположены в пространстве функций».
Результаты изображения выше показывают наименьшие расстояния ближайших соседей (NND) до самых больших в архитектуре StyleGAN, обученной на FFHQ.
«Для всех наборов данных образцы с наименьшими NND показывают типичные и представительные изображения. Напротив, образцы с наибольшими NND имеют сильную индивидуальность и значительно отличаются от типичных изображений с наименьшими NND».
В теории, используя эту новую метрику в качестве дискриминатора, или, по крайней мере, включая ее в более сложную архитектуру дискриминатора, генеративная система могла бы быть направлена подальше от чистой имитации к более изобретательному алгоритму, сохраняя при этом необходимую связность концепций, которые могут быть важными для аутентичного производства изображений (т.е. «человек», «женщина», «машина», «церковь» и т. д.).
Сравнения и эксперименты
В тестах исследователи провели сравнение производительности метрики редкости с трюком обрезки и метрикой реализма NVIDIA 2019 года и обнаружили, что во всех рамках и наборах данных этот подход может индивидуализировать «уникальные» результаты.
Хотя результаты, представленные в статье, слишком обширны, чтобы включить их здесь, исследователи, кажется, продемонстрировали способность нового метода выявить редкость как в реальных (настоящих), так и в сгенерированных (фальшивых) изображениях в генеративной процедуре:

Select examples from the extensive visual results reproduced in the paper (see source URL above for more details). On the left, genuine examples from FFHQ that have very few near neighbors (i.e. are novel and unusual) in the original dataset; on the right, fake images generated by StyleGAN, which the new metric has identified as truly novel. Since there are image-size limits in this article, please see the source paper for better detail and resolution.
Новая метрика редкости не только позволяет определить «новые» генеративные результаты в единой архитектуре, но также, по утверждению исследователей, позволяет сравнивать генеративные модели различных архитектур (т.е. автоэнкодер, VAE, GAN и т. д.).
За пределами ограниченных задач
Хотя исследователи провели тесты на ограниченных доменных рамках (например, генератор/набор данных, предназначенный для производства изображений людей или кошек), метрика редкости потенциально может быть применена к любой произвольной процедуре синтеза изображений, где желательно определить сгенерированные примеры, которые используют распределения, полученные из обученных данных, вместо того, чтобы увеличивать аутентичность (и снижать разнообразие) путем введения посторонних латентных распределений или использования других «обходных путей», которые компрометируют новизну в пользу аутентичности.
По сути, такая метрика потенциально могла бы различать действительно новые результаты в системах, таких как серия DALL-E, используя выявленный расстояние между кажущимся «аутсайдером» результатом, тренировочными данными и результатами из подобных подсказок или входных данных (т.е. изображений-подсказок).
На практике, и в отсутствие четкого понимания степени, в которой система действительно ассимилировала визуальные и семантические концепции (часто препятствуемой ограниченными знаниями о тренировочных данных), это может быть жизнеспособным методом выявления настоящего «момента вдохновения» в генеративной системе – точки, в которой достаточное количество входных концепций и данных привели к чему-то действительно изобретательному, а не к чему-то чрезмерно производному или близкому к исходным данным.
* Мои конверсии встроенных цитат авторов в гиперссылки.
Опубликовано впервые 20 июня 2022 года.














