Взгляд Anderson
Обнаружение глубоких подделок видеозвонков через освещение монитора

Новое сотрудничество между исследователем из Агентства национальной безопасности США (NSA) и Университетом Калифорнии в Беркли предлагает новый метод обнаружения контента глубоких подделок в живом видеоконтексте – наблюдая за эффектом освещения монитора на внешности человека на другом конце видеозвонка.

Популярный пользователь DeepFaceLive Druuzil Tech & Games пробует свою собственную модель Christian Bale DeepFaceLab в живой сессии со своими подписчиками, при этом меняются источники света. Источник: https://www.youtube.com/watch?v=XPQLDnogLKA
Система работает путем размещения графического элемента на экране пользователя, который меняет узкий диапазон своего цвета быстрее, чем типичная система глубоких подделок может отреагировать – даже если, как реализация потоковой передачи глубоких подделок в реальном времени DeepFaceLive (изображено выше), она имеет некоторую способность поддерживать живую передачу цвета и учитывать окружающее освещение.
Униформированное цветовое изображение, отображаемое на мониторе человека на другом конце (т.е. потенциального мошенника с глубокими подделками), циклически проходит через ограниченную вариацию изменений цвета, предназначенных для того, чтобы не активировать автоматическую белую балансировку веб-камеры и другие ад-хок системы компенсации освещения, которые бы компрометировали метод.

Из статьи, иллюстрация изменения условий освещения от монитора перед пользователем, который эффективно работает как диффузный ‘область света’. Источник: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf
Теория, лежащая в основе этого подхода, заключается в том, что живые системы глубоких подделок не могут вовремя отреагировать на изменения, изображенные в графическом элементе на экране, увеличивая ‘задержку’ эффекта глубоких подделок в определенных частях спектра цвета, что раскрывает его присутствие.
Чтобы точно измерить отраженный свет монитора, система должна учитывать и затем исключить эффект общего окружающего освещения, не связанного со светом монитора. Затем она может различать недостатки в измерении активного освещения и цвета лица пользователей, представляя временную сдвиг в 1-4 кадра между каждым:

Ограничивая вариации цвета в графическом элементе ‘детектора’ на экране и обеспечивая, чтобы веб-камера пользователя не была вынуждена автоматически регулировать свои настройки захвата из-за чрезмерных изменений освещения монитора, исследователи смогли обнаружить характерную задержку в реакции системы глубоких подделок на изменения освещения.
Статья заключает:
‘Поскольку мы разумно доверяем живым видеозвонкам, и учитывая растущую повсеместность видеозвонков в нашей личной и профессиональной жизни, мы предлагаем, что методы аутентификации видео (и аудио) звонков будут только расти в важности.’
Исследование называется Обнаружение видео глубоких подделок в реальном времени с помощью активного освещения, и было проведено Кэндис Р. Герстнер, прикладным математиком в Министерстве обороны США, и профессором Хани Фаридом из Беркли.
Эрозия доверия
Исследовательская сцена по борьбе с глубокими подделками существенно сместилась за последние шесть месяцев, от общего обнаружения глубоких подделок (т.е. нацеливания на предварительно записанные видео и порнографический контент) к обнаружению ‘живости’, в ответ на растущую волну инцидентов использования глубоких подделок в видеоконференциях, и недавнее предупреждение ФБР о растущем использовании таких технологий в заявках на удаленную работу.
Даже если видеозвонок оказывается не подделкой, растущие возможности для видеоимитаторов, управляемых ИИ, начинают генерировать паранойю.
Новая статья гласит:
‘Создание видео глубоких подделок в реальном времени [представляет] уникальные угрозы из-за общего чувства доверия, окружающего живой видео или телефонный звонок, и проблемы обнаружения глубоких подделок в реальном времени, когда звонок происходит.’
Исследовательское сообщество давно поставило перед собой цель найти неопровержимые признаки контента глубоких подделок, которые не могут быть легко компенсированы. Хотя средства массовой информации обычно характеризовали это как технологическую войну между исследователями безопасности и разработчиками глубоких подделок, большинство опровержений ранних подходов (таких как анализ моргания глаз, определение позы головы и анализ поведения) произошли просто потому, что разработчики и пользователи пытались сделать более реалистичные глубокие подделки в целом, а не конкретно решали последнюю ‘уловку’, выявленную сообществом безопасности.
Освещение живых видео глубоких подделок
Обнаружение глубоких подделок в живых видео-средах несет бремя учета плохих видеосоединений, которые очень распространены в сценариях видеоконференций. Даже без вмешивающегося слоя глубоких подделок видеоконтент может быть подвержен лагу, артефактам и другим типам ухудшения аудио и видео. Это может служить для сокрытия грубых краев в живой архитектуре глубоких подделок, как в видео, так и в аудио глубоких подделках.
Новая система авторов улучшает результаты и методы, представленные в публикации 2020 года Центра сетевых вычислений Темпльского университета в Филадельфии.

Из статьи 2020 года мы можем наблюдать изменение ‘заполненного’ освещения лица при изменении содержимого экрана пользователя. Источник: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf
Разница в новой работе заключается в том, что она учитывает, как веб-камеры реагируют на изменения освещения. Авторы объясняют:
‘Поскольку все современные веб-камеры выполняют автоматическое экспонирование, высокоинтенсивное активное освещение [используемое в предыдущей работе] вероятно вызовет автоматическое экспонирование камеры, что в свою очередь запутает записанную внешность лица. Чтобы избежать этого, мы используем активное освещение, состоящее из изолюминантного изменения цвета.
‘Хотя это избегает автоматического экспонирования камеры, оно может вызвать белую балансировку камеры, что снова запутает записанную внешность лица. Чтобы избежать этого, мы работаем в диапазоне цвета, который мы эмпирически определили как не вызывающий белую балансировку.’
Для этой инициативы авторы также рассмотрели подобные предыдущие усилия, такие как LiveScreen, который заставляет незаметный узор освещения на мониторе пользователя в попытке раскрыть контент глубоких подделок.
Хотя эта система достигла точности 94,8%, исследователи заключили, что тонкость узоров освещения сделала бы такое скрытное подход трудным для реализации в ярко освещенных средах, и вместо этого предлагают, что их собственная система, или одна, построенная по аналогичным линиям, могла бы быть включена публично и по умолчанию в популярное программное обеспечение для видеоконференций:
‘Наше предложенное вмешательство могло бы быть реализовано участником звонка, который просто делится своим экраном и отображает временно меняющийся узор, или, идеально, оно могло бы быть напрямую интегрировано в клиент видеозвонка.’
Тесты
Авторы использовали смесь синтетических и реальных субъектов для тестирования своего детектора глубоких подделок на основе Dlib. Для синтетического сценария они использовали Mitsuba, прямой и обратный рендерер из Федерального технологического института в Лозанне.

Примеры из симулированного окружения тестов, с разными тонами кожи, размером источника света, интенсивностью окружающего света и расстоянием до камеры.
Сцена включает в себя параметрическую CGI-голову, захваченную виртуальной камерой с углом обзора 90°. Головы имеют Ламбертовское отражение и нейтральные тона кожи, и расположены в 2 футах перед виртуальной камерой.
Чтобы протестировать框架 на широком диапазоне возможных тонов кожи и настроек, исследователи провели серию тестов, последовательно изменяя различные аспекты. Изменяемые аспекты включали тон кожи, расстояние и размер освещения.
Авторы комментируют:
‘В симуляции, с нашими различными предположениями, выполненными, наш предложенный метод высоко устойчив к широкому диапазону конфигураций изображения.’
Для реального сценария исследователи использовали 15 добровольцев с разными тонами кожи, в различных средах. Каждый был подвергнут двум циклам ограниченной вариации цвета, в условиях, когда частота обновления дисплея 30 Гц была синхронизирована с веб-камерой, что означало, что активное освещение будет длиться только одну секунду за раз. Результаты были в целом сравнимы с синтетическими тестами, хотя корреляции значительно увеличились с большими значениями освещения.
Будущие направления
Система, признают исследователи, не учитывает типичные лицевые окулюзии, такие как челки, очки или борода. Однако они отмечают, что маскировка такого рода может быть добавлена в более поздние системы (через маркировку и последующую семантическую сегментацию), которые могли бы быть обучены брать значения исключительно из воспринимаемых кожных областей в целевом субъекте.
Авторы также предлагают, что подобный парадигма мог бы быть использован для обнаружения подделок аудиозвонков, и что обнаруживаемый звук мог бы быть сыгран в частоте, находящейся вне нормального человеческого слухового диапазона.
Возможно, наиболее интересно, исследователи также предлагают, что расширение области оценки за пределы лица в более богатом фреймворке захвата могло бы заметно улучшить возможность обнаружения глубоких подделок*:
‘Более сложная 3-D оценка освещения вероятно обеспечила бы более богатую модель внешности, которая была бы еще более трудной для обхода мошенником. Хотя мы сосредоточились только на лице, компьютерный дисплей также освещает шею, верхнюю часть тела и окружающий фон, из которых могли бы быть сделаны подобные измерения.
‘Эти дополнительные измерения заставили бы мошенника учитывать всю 3-D сцену, а не только лицо.’
* Мое преобразование внутренних цитат авторов в гиперссылки.
Опубликовано впервые 6 июля 2022 года.












