Взгляд Anderson

Система обнаружения чистой синтеза изображений в рамках DALL-E 2

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование из Калифорнийского университета в Беркли предлагает метод определения того, можно ли обнаружить выходные данные из нового поколения рамок синтеза изображений – таких как DALL-E 2 от Open AI, и Imagen и Parti от Google – как «не реальные», изучая геометрию, тени и отражения, которые появляются в синтезированных изображениях.

Изучая изображения, сгенерированные текстовыми подсказками в DALL-E 2, исследователи обнаружили, что, несмотря на впечатляющую реалистичность, которой способна эта архитектура, некоторые постоянные несоответствия возникают, связанные с отрисовкой глобальной перспективы, созданием и расположением теней, и особенно с отрисовкой отраженных объектов.

В статье говорится:

‘[Геометрические] структуры, отбрасываемые тени и отражения в зеркальных поверхностях не полностью согласуются с ожидаемой перспективной геометрией натуральных сцен. Геометрические структуры и тени, в целом, локально согласованы, но глобально не согласованы.

‘Отражения, с другой стороны, часто отрисовываются невероятно, предположительно потому, что они менее распространены в наборе данных обучения.’

Отсутствие согласованного пересечения между отрисованным объектом и отражением является надежным способом обнаружения изображения DALL-E 2, согласно новому исследованию. Источник: https://arxiv.org/pdf/2206.14617.pdf

Отсутствие согласованного пересечения между отрисованным объектом и отражением является надежным способом обнаружения изображения DALL-E 2, согласно новому исследованию. Источник: https://arxiv.org/pdf/2206.14617.pdf

Статья представляет собой раннюю попытку того, что может стать заметной ветвью в сообществе исследований компьютерного зрения – обнаружение синтеза изображений.

С момента появления глубоких фейков в 2017 году обнаружение глубоких фейков (в основном выходных данных автоэнкодера из пакетов such as автоэнкодера и DeepFaceLab и FaceSwap) стало активной и конкурентной академической ветвью, с различными статьями и методологиями, нацеленными на эволюционирующие «признаки» синтезированных лиц в реальных видеороликах.

Однако до недавнего появления систем гипермасштабного синтеза изображений выходные данные из текстовых подсказок, таких как CLIP, не представляли угрозы для статуса-кво «фотореализма». Авторы новой статьи считают, что это вот-вот изменится, и что даже несоответствия, которые они обнаружили в выходных данных DALL-E 2, могут не иметь большого значения для потенциала обмана зрителей.

Авторы заявляют*:

‘[Такие] неудачи могут не иметь большого значения для человеческой визуальной системы, которая оказалась удивительно неумелой в определенных геометрических суждениях, включая несоответствия в освещении, тени, отражениях, точке зрения и перспективном искажении.’

Исчезающая достоверность

Первый судебный анализ выходных данных DALL-E 2 авторов связан с проекцией перспективы – способом, которым позиционирование прямых краев в ближайших объектах и текстурах должно разрешиться равномерно до «точки исчезновения».

Слева, параллельные линии на одной плоскости разрешаются до общей точки исчезновения; справа, несколько точек исчезновения на одной и параллельных плоскостях определяют линию исчезновения (изображена красным).

Слева, параллельные линии на одной плоскости разрешаются до общей точки исчезновения; справа, несколько точек исчезновения на одной и параллельных плоскостях определяют линию исчезновения (изображена красным).

Чтобы проверить последовательность DALL-E 2 в этом отношении, авторы использовали DALL-E 2 для генерации 25 синтезированных изображений кухонь – знакомого пространства, которое, даже в хорошо оборудованных домах, обычно ограничено достаточно, чтобы обеспечить несколько возможных точек исчезновения для ряда объектов и текстур.

Изучая выходные данные из подсказки ‘фотография кухни с плиточным полом’, исследователи обнаружили, что, несмотря на общую убедительную репрезентацию в каждом случае (за исключением некоторых странных, меньших артефактов, не связанных с перспективой), объекты, изображенные на них, никогда не кажутся сходящимися правильно.

Авторы отмечают, что, хотя каждая серия параллельных линий из узора плитки последовательна и пересекается в одной точке исчезновения (синяя на изображении ниже), точка исчезновения для столешницы (циан) не согласуется с линиями исчезновения (красными) и точкой исчезновения, полученной из плитки.

Авторы наблюдают, что, даже если столешница не параллельна плитке, точка исчезновения для столешницы должна разрешиться до линии исчезновения (красной), определенной точками исчезновения пола.

В статье говорится:

‘Хотя перспектива в этих изображениях – впечатляюще – локально согласована, она не глобально согласована. Такой же шаблон был обнаружен в каждом из 25 синтезированных изображений кухонь.’

Теневая форензика

Как и любой, кто когда-либо имел дело с трассировкой лучей, тени также имеют потенциальные точки исчезновения, указывающие на источник освещения. Для внешних теней в ярком солнечном свете можно ожидать, что тени на всех гранях изображения будут разрешаться последовательно до одного источника света (солнца).

Как и в предыдущем эксперименте, исследователи создали 25 изображений DALL-E 2 с подсказкой ‘три куба на тротуаре, снятые в солнечный день’, а также еще 25 с подсказкой ‘три куба на тротуаре, снятые в облачный день’.

В верхнем ряду изображения, созданные из подсказки исследователей 'три куба на тротуаре, снятые в облачный день'; в нижнем ряду изображения, созданные из подсказки 'три куба на тротуаре, снятые в солнечный день'.

В верхнем ряду изображения, созданные из подсказки исследователей ‘три куба на тротуаре, снятые в облачный день’; в нижнем ряду изображения, созданные из подсказки ‘три куба на тротуаре, снятые в солнечный день’.

Исследователи отмечают, что при представлении облачных условий DALL-E 2 может отрисовывать связанные с этим более размытые тени в убедительном и правдоподобном виде, возможно, не в последнюю очередь потому, что этот тип теней, вероятно, более распространен в наборе данных изображений, на которых была обучена рамка.

Однако некоторые из «солнечных» фотографий, как обнаружили авторы, были не последовательны с сценой, освещенной от одного источника света.

Для вышеизображения генерации были преобразованы в оттенки серого для ясности и показывают каждый объект со своим собственным посвященным «солнцем».

Хотя средний зритель может не заметить таких аномалий, некоторые из сгенерированных изображений имели более очевидные примеры «провала теней»:

Хотя некоторые тени просто находятся не на месте, многие из них, интересно, соответствуют типу визуального несоответствия, произведенного в CGI-моделировании, когда частота выборки для виртуального света слишком низка.

Отражения в DALL-E 2

Самые разрушительные результаты в плане судебного анализа были получены, когда авторы проверили способность DALL-E 2 создавать высоко отражающие поверхности, что является трудоемким расчетом также в традиционных алгоритмах трассировки лучей и других традиционных алгоритмов рендеринга.

Для этого эксперимента авторы произвели 25 изображений DALL-E 2 с подсказкой ‘фотография игрушечного динозавра и его отражения в зеркале туалета’.

Во всех случаях авторы сообщают, что зеркальное изображение отрисованного игрушечного динозавра было каким-то образом отключено от аспекта и расположения «реального» игрушечного динозавра. Авторы заявляют, что проблема была устойчива к вариациям текстовой подсказки и, кажется, является фундаментальной слабостью системы.

Кажется, что в некоторых ошибках есть логика – первый и третий примеры в верхнем ряду кажутся показывать динозавра, который удвоен очень хорошо, но не отражен.

Авторы комментируют:

‘В отличие от отбрасываемых теней и геометрических структур в предыдущих разделах, DALL·E-2 испытывает трудности в синтезе правдоподобных отражений, предположительно потому, что такие отражения менее распространены в наборе данных обучения.’

Такие ошибки, как эти, могут быть исправлены в будущих моделях текст-изображение, которые смогут более эффективно просматривать общую семантическую логику своего выхода и которые смогут навязать абстрактные физические правила сценам, которые были, в некоторой степени, собраны из особенностей, связанных со словами, в системе латентного пространства.

В свете растущей тенденции к все более крупным архитектурам синтеза авторы заключили:

‘[Это] может быть просто вопросом времени, прежде чем двигатели синтеза изображений по тексту научатся отрисовывать изображения с полной перспективной согласованностью. До этого времени, однако, геометрический судебный анализ может оказаться полезным в анализе этих изображений.’

 

* Мое преобразование внутренних цитат авторов в гиперссылки.

Опубликовано впервые 30 июня 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai