Взгляд Anderson

Глубинная информация может раскрыть глубокие подделки в режиме реального времени

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование из Италии показало, что глубинная информация, полученная из изображений, может быть полезным инструментом для обнаружения глубоких подделок – даже в режиме реального времени.

В то время как большинство исследований по обнаружению глубоких подделок за последние пять лет было сосредоточено на идентификации артефактов (которые можно смягчить с помощью улучшенных методов или ошибочно принять за плохое сжатие видеокодека), окружающее освещение, биометрические характеристики, временные нарушения и даже человеческий инстинкт, новое исследование является первым, которое предполагает, что глубинная информация может быть ценным шифром для контента глубоких подделок.

Примеры полученных глубинных карт и различия в перцептивной глубинной информации между реальными и фальшивыми изображениями. Источник: https://arxiv.org/pdf/2208.11074.pdf

Примеры полученных глубинных карт и различия в перцептивной глубинной информации между реальными и фальшивыми изображениями. Источник: https://arxiv.org/pdf/2208.11074.pdf

Критически, разработанные для нового исследования рамки обнаружения работают очень хорошо на легкой сети, такой как Xception, и приемлемо на MobileNet, и новая статья признает, что низкая задержка вывода, предлагаемая такими сетями, может обеспечить обнаружение глубоких подделок в режиме реального времени против новой тенденции к живым глубоким подделкам, примером которой является недавняя атака на Binance.

Большая экономия времени вывода может быть достигнута потому, что система не требует полноцветных изображений, чтобы определить разницу между фальшивыми и реальными глубинными картами, но может работать удивительно эффективно только на градационных изображениях глубинной информации.

Авторы утверждают: ‘Это результат показывает, что глубина в этом случае добавляет более релевантный вклад в классификацию, чем цветовые артефакты.’

Результаты представляют часть новой волны исследований по обнаружению глубоких подделок, направленных против систем синтеза лица в режиме реального времени, таких как DeepFaceLive – область усилий, которая ускорилась заметно в последние 3-4 месяца, после предупреждения ФБР в марте о риске видео и аудио глубоких подделок в режиме реального времени.

Статья называется DepthFake: глубинно-ориентированная стратегия обнаружения видео глубоких подделок, и исходит от пяти исследователей из Сапиенцы Римского университета.

Крайние случаи

Во время обучения модели глубоких подделок на основе автоэнкодера отдают приоритет внутренним областям лица, таким как глаза, нос и рот. В большинстве случаев, на открытом исходном коде, таком как DeepFaceLab и FaceSwap (оба форка из исходного кода Reddit 2017 года до его удаления), внешние контуры лица не становятся хорошо определёнными до очень поздней стадии обучения и вряд ли будут соответствовать качеству синтеза во внутренней области лица.

Из предыдущего исследования мы видим визуализацию 'салиентных карт' лица. Источник: https://arxiv.org/pdf/2203.01318.pdf

Из предыдущего исследования мы видим визуализацию ‘салиентных карт’ лица. Источник: https://arxiv.org/pdf/2203.01318.pdf

Обычно, это не важно, поскольку наша тенденция сосредотачиваться на глазах и отдалять приоритет ‘наружу’ с уменьшающимися уровнями внимания означает, что мы вряд ли будем смущены этими спадами в периферийном качестве – особенно если мы говорим живому человеку, который фальсифицирует другую личность, что вызывает социальные конвенции и ограничения обработки не присутствуют, когда мы оцениваем ‘рендерированное’ видео глубоких подделок.

Однако, отсутствие деталей или точности в пораженных областях глубоко подделанного лица может быть обнаружено алгоритмически. В марте, система, которая опирается на периферийную область лица, была объявлена. Однако, поскольку она требует выше среднего количества обучающих данных, она предназначена только для знаменитостей, которые, вероятно, будут представлены в популярных наборах лиц (таких как ImageNet), которые имеют происхождение в текущих методах компьютерного зрения и обнаружения глубоких подделок.

Вместо этого, новая система, озаглавленная DepthFake, может работать универсально даже на малоизвестных или неизвестных личностях, различая качество оценочной глубинной информации в реальном и фальшивом видеоконтенте.

Глубже

Глубинная информация все чаще включается в смартфоны, включая AI-ассистированные стерео-реализации, которые особенно полезны для исследований компьютерного зрения. В новом исследовании, авторы использовали модель FaceDepth Национального университета Ирландии, свёрточную сеть кодирования/декодирования, которая может эффективно оценить глубинные карты из одиночных изображений.

Модель FaceDepth в действии. Источник: https://tinyurl.com/3ctcazma

Модель FaceDepth в действии. Источник: https://tinyurl.com/3ctcazma

Далее, pipeline для новой рамки извлекает 224×224 пиксельный участок лица субъекта из исходного RGB-изображения и полученной глубинной карты. Критически, это позволяет процессу копировать основной контент без изменения размера; это важно, поскольку стандартные алгоритмы изменения размера будут негативно влиять на качество целевых областей.

Используя эту информацию, из реальных и глубоко подделанных источников, исследователи затем обучили свёрточную нейронную сеть (CNN), способную различать реальные и фальшивые экземпляры, основанные на различиях в перцептивном качестве соответствующих глубинных карт.

Концептуальная pipeline для DepthFake.

Концептуальная pipeline для DepthFake.

Модель FaceDepth обучена на реалистичных и синтетических данных с помощью гибридной функции, которая предлагает большую детализацию на внешних краях лица, что делает ее хорошо подходящей для DepthFake. Она использует экземпляр MobileNet в качестве извлекателя функций и была обучена с входными изображениями 480×640, выдающими глубинные карты 240×320. Каждая глубинная карта представляет четверть четырех входных каналов, используемых в дискриминаторе нового проекта.

Глубинная карта автоматически встраивается в исходное RGB-изображение, чтобы обеспечить RGBD-изображение, полное глубинной информации, которое могут выводить современные камеры смартфонов.

Обучение

Модель была обучена на сети Xception, предварительно обученной на ImageNet, хотя архитектура потребовала некоторой адаптации, чтобы вместить дополнительную глубинную информацию, сохраняя при этом правильную инициализацию весов.

Кроме того, несоответствие в диапазонах значений между глубинной информацией и тем, что ожидает сеть, потребовало от исследователей нормализовать значения до 0-255.

Во время обучения, применялись только переворот и вращение. Во многих случаях, различные другие визуальные нарушения были бы представлены модели, чтобы развить устойчивый вывод, но необходимость сохранить ограниченную и очень хрупкую информацию глубинной карты в исходных фотографиях заставила исследователей принять упрощенную схему.

Система была также обучена на простом 2-канальном градационном, чтобы определить, насколько сложными должны быть исходные изображения, чтобы получить рабочий алгоритм.

Обучение проходило через API TensorFlow на NVIDIA GTX 1080 с 8 ГБ видеопамяти, используя оптимизатор ADAMAX, в течение 25 эпох, с размером партии 32. Разрешение входа было фиксировано на 224×224 во время обрезки, а обнаружение и извлечение лица было выполнено с помощью библиотеки dlib на C++.

Результаты

Точность результатов была протестирована против Deepfake, Face2Face, FaceSwap, Neural Texture, и полного набора данных с входами RGB и RGBD, используя FaceForensic++ framework.

Результаты точности по четырем методам глубоких подделок и против всего несplits набора данных. Результаты разделены между анализом исходных RGB-изображений и теми же изображениями с встроенной оценочной глубинной картой. Лучшие результаты выделены жирным, с процентными цифрами ниже, демонстрирующими степень, в которой информация глубинной карты улучшает результат.

Результаты точности по четырем методам глубоких подделок и против всего несplits набора данных. Результаты разделены между анализом исходных RGB-изображений и теми же изображениями с встроенной оценочной глубинной картой. Лучшие результаты выделены жирным, с процентными цифрами ниже, демонстрирующими степень, в которой информация глубинной карты улучшает результат.

Во всех случаях, глубинный канал улучшает производительность модели во всех конфигурациях. Xception получает лучшие результаты, с гибкой MobileNet близко позади. На это, авторы комментируют:

‘Это интересно отметить, что MobileNet немного хуже Xception и превосходит более глубокую ResNet50. Это заметный результат, когда учитывается цель снижения времени вывода для приложений в режиме реального времени. Хотя это не является основным вкладом этой работы, мы все равно считаем это обнадеживающим результатом для будущих разработок.’

Исследователи также отмечают постоянное преимущество RGBD и 2-канального градационного входа над RGB и прямым градационным входом, наблюдая, что градационные преобразования глубинных оценок, которые вычислительны очень дешево, позволяют модели получить улучшенные результаты с очень ограниченными местными ресурсами, что облегчает будущее развитие обнаружения глубоких подделок в режиме реального времени на основе глубинной информации.

 

Опубликовано впервые 24 августа 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai