Кибербезопасность

Обнаружение видеоконференц-деепфейков с помощью функции “вибрировать” смартфона

mm
Добавьте Unite.AI в избранные источники в Google
An AI-generated illustration: 'a gorgeous panoramic picture of a man sitting in an office, looking into his smartphone, which he is holding; the man is wearing a Guy Fawkes mask; photorealistic, UHQ' - ChatGPT 3, Tuesday, 24 сентября 2024 13:27:31

Новые исследования сингапурских ученых предложили новый метод обнаружения того, использует ли человек на другом конце видеоконференции смартфона методы, такие как DeepFaceLive, для имитации кого-то другого.

Этот новый подход, озаглавленный SFake, отказывается от пассивных методов, используемых большинством систем, и заставляет телефон пользователя вибрировать (с использованием тех же механизмов вибрации, распространенных среди смартфонов), и незаметно размыть его лицо.

Хотя системы живых деепфейков различных способностей могут имитировать размытие движения, пока размытые кадры были включены в обучающие данные или хотя бы в предварительные обучающие данные, они не могут быстро enough реагировать на неожиданное размытие этого типа и продолжают выводить неразмытые участки лиц, раскрывая существование деепфейковых конференц-звонков.

DeepFaceLive не может быстро enough имитировать размытие, вызванное вибрациями камеры. Источник: https://arxiv.org/pdf/2409.10889v1

DeepFaceLive не может быстро enough имитировать размытие, вызванное вибрациями камеры. Источник: https://arxiv.org/pdf/2409.10889v1

Результаты тестов на собственном наборе данных исследователей (поскольку нет наборов данных, в которых есть активная тряска камеры) показали, что SFake превосходит конкурирующие видео-основанные методы обнаружения деепфейков, даже в сложных обстоятельствах, таких как естественное движение руки, когда другой человек в видеоконференции держит камеру в руке, вместо использования статического крепления телефона.

Растущая необходимость видео-основанного обнаружения деепфейков

Исследования видео-основанного обнаружения деепфейков увеличились в последнее время. После нескольких лет успешных голосовых деепфейковых ограблений, в начале этого года финансовый работник был обманут и перевел 25 миллионов долларов мошеннику, который имитировал финансового директора в деепфейковом видеозвонке.

Хотя система такого типа требует высокого уровня доступа к аппаратному обеспечению, многие пользователи смартфонов уже привыкли к финансовым и другим типам услуг верификации, которые просят нас записать наши лицевые характеристики для_face-аутентификации (на самом деле, это даже часть процесса верификации LinkedIn).

Следовательно, кажется вероятным, что такие методы будут все чаще использоваться для видеоконференц-систем, поскольку этот тип преступлений продолжает попадать в заголовки.

Большинство решений, которые решают проблему реального видеоконференц-деепфейка, предполагают очень статичную ситуацию, когда коммуникант использует стационарную веб-камеру, и не ожидается никакого движения или чрезмерных изменений окружающей среды или освещения. Видеозвонок по смартфону не предлагает такой “фиксированной” ситуации.

Вместо этого SFake использует ряд методов обнаружения, чтобы компенсировать большое количество визуальных вариантов в видеоконференции на основе смартфона, и, кажется, является первым исследовательским проектом, который решает эту проблему с помощью стандартного оборудования вибрации, встроенного в смартфоны.

Статья называется Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes, и исходит от двух исследователей из Наньянского технологического университета в Сингапуре.

Метод

SFake предназначен как облачный сервис, где локальное приложение отправляет данные на удаленный API-сервис для обработки, и результаты отправляются обратно.

Однако его небольшой размер (450 МБ) и оптимизированная методология позволяют ему обрабатывать обнаружение деепфейков полностью на устройстве, в случаях, когда сетевое подключение может вызвать чрезмерное сжатие отправляемых изображений, влияя на диагностический процесс.

Выполнение “всего локально” в этом смысле означает, что система имеет прямой доступ к потоку камеры пользователя, без кодека помех, часто связанных с видеоконференциями.

Среднее время анализа требует четырехсекундного видеоклипа, во время которого пользователю предлагается оставаться неподвижным, и во время которого SFake отправляет “зонды”, чтобы вызвать вибрации камеры, на избирательно случайных интервалах, на которые системы, такие как DeepFaceLive, не могут вовремя реагировать.

(Следует еще раз подчеркнуть, что любой атакующий, который не включил размытые данные в обучающий набор, вряд ли сможет создать модель, которая сможет генерировать размытие, даже в гораздо более благоприятных обстоятельствах, и что DeepFaceLive не может просто “добавить” эту функциональность к модели, обученной на недооцененном наборе данных)

Система выбирает определенные области лица в качестве потенциальных областей содержания деепфейка, исключая глаза и брови (поскольку моргание и другие лицевые движения в этой области находятся вне области обнаружения размытия и не являются идеальным индикатором).

Концептуальная схема SFake.

Концептуальная схема SFake.

Как мы видим в концептуальной схеме выше, после выбора подходящих и непредсказуемых закономерностей вибрации, выбора лучшей фокусной длины и выполнения распознавания лица (включая обнаружение ориентиров с помощью компонента Dlib, который оценивает стандартные 68 лицевых ориентиров), SFake получает градиенты из входного лица и концентрируется на выбранных областях этих градиентов.

Последовательность дисперсии получается путем последовательного анализа каждого кадра в коротком клипе, пока не будет достигнута средняя или “идеальная” последовательность, и остальное отбрасывается.

Это обеспечивает извлеченные функции, которые можно использовать в качестве количественной оценки вероятности содержания деепфейка, на основе обученной базы данных (о которой чуть позже).

Система требует разрешения изображения 1920×1080 пикселей, а также не менее 2-кратного увеличения для объективной линзы. В статье отмечается, что такие разрешения (и даже более высокие разрешения) поддерживаются в Microsoft Teams, Skype, Zoom и Tencent Meeting.

Большинство смартфонов имеют переднюю и заднюю камеру, и часто только одна из них имеет возможности увеличения, необходимые для SFake; приложение поэтому потребует от коммуниканта использовать любую из двух камер, которая соответствует этим требованиям.

Цель состоит в том, чтобы получить правильную пропорцию лица пользователя в видеопотоке, который будет анализировать система. Статья отмечает, что среднее расстояние, на котором женщины используют мобильные устройства, составляет 34,7 см, а для мужчин – 38,2 см (как сообщается в Журнале оптометрии), и что SFake работает очень хорошо на этих расстояниях.

Поскольку стабилизация является проблемой для ручного видео, и поскольку размытие, вызванное движением руки, является препятствием для функционирования SFake, исследователи попробовали несколько методов, чтобы компенсировать. Наиболее успешным из них было расчет центральной точки оцененных ориентиров и использование ее в качестве “якоря” – по сути, алгоритмический метод стабилизации. С помощью этого метода была достигнута точность 92%.

Данные и тесты

Поскольку подходящих наборов данных не существовало, исследователи создали свой собственный:

‘[Мы] используем 8 разных брендов смартфонов, чтобы записать 15 участников разного пола и возраста, чтобы создать наш собственный набор данных. Мы помещаем смартфон на держатель телефона на расстоянии 20 см от участника и увеличиваем в два раза, чтобы охватить все лицевые черты, пока смартфон вибрирует в разных узорах.

‘Для телефонов, чьи передние камеры не могут увеличить, мы используем задние камеры в качестве замены. Мы записываем 150 длинных видео, каждое 20 секунд в длину. По умолчанию мы предполагаем, что период обнаружения длится 4 секунды. Мы обрезаем 10 клипов по 4 секунды из одного длинного видео, случайным образом выбирая время начала. Следовательно, мы получаем в общей сложности 1500 реальных клипов, каждый 4 секунды в длину.’

Хотя DeepFaceLive (ссылка на GitHub) был центральной целью исследования, поскольку это, вероятно, является основной целью преступного интереса в отношении видеоконференц-мошенничества, исследователи включили четыре других метода для обучения своей базовой модели обнаружения: Hififace; FS-GANV2; RemakerAI; и MobileFaceSwap – последний из них является особенно подходящим выбором, учитывая целевую среду.

1500 фейковых видео были использованы для обучения, вместе с таким же количеством реальных и неизмененных видео.

SFake был протестирован на нескольких разных классификаторах, включая SBI; FaceAF; CnnDetect; LRNet; DefakeHop варианты; и бесплатный онлайн-сервис обнаружения деепфейков Deepaware. Для каждого из этих методов деепфейков были обучены 1500 фейковых и 1500 реальных видео.

Для базового тестового классификатора был использован простой двухслойный нейронный сеть с функцией активации ReLU. 1000 реальных и 1000 фейковых видео были случайным образом выбраны (хотя фейковые видео были исключительно примерами DeepFaceLive).

Площадь под кривой оперативной характеристики приемника (AUC/AUROC) и точность (ACC) были использованы в качестве метрик.

Для обучения и вывода был использован NVIDIA RTX 3060, и тесты были запущены под Ubuntu. Тестовые видео были записаны с помощью Xiaomi Redmi 10x, Xiaomi Redmi K50, OPPO Find x6, Huawei Nova9, Xiaomi 14 Ultra, Honor 20, Google Pixel 6a и Huawei P60.

Чтобы соответствовать существующим методам обнаружения, тесты были реализованы в PyTorch. Основные результаты тестов представлены в таблице ниже:

Результаты SFake против конкурирующих методов.

Результаты SFake против конкурирующих методов.

Здесь авторы комментируют:

‘Во всех случаях точность обнаружения SFake превышает 95%. Среди пяти алгоритмов деепфейков, кроме Hififace, SFake работает лучше, чем другие шесть методов обнаружения, против других алгоритмов деепфейков. Поскольку наш классификатор обучен с помощью фейковых изображений, сгенерированных DeepFaceLive, он достигает最高шей скорости точности 98,8%, когда обнаруживает DeepFaceLive.

‘Когда мы сталкиваемся с фейковыми лицами, сгенерированными RemakerAI, другие методы обнаружения работают плохо. Мы предполагаем, что это может быть связано с автоматическим сжатием видео при скачивании из интернета, что приводит к потере деталей изображения и снижению точности обнаружения. Однако это не влияет на обнаружение SFake, которое достигает точности 96,8% при обнаружении RemakerAI.’

Авторы также отмечают, что SFake является наиболее эффективной системой в сценарии, когда к объективной линзе применяется двухкратное увеличение, поскольку это усиливает движение и является чрезвычайно сложной задачей. Даже в этой ситуации SFake смогла достичь точности распознавания 84% и 83% соответственно для увеличений 2,5 и 3.

Вывод

Проект, который использует слабости живой системы деепфейков против себя, является освежающим предложением в год, когда обнаружение деепфейков было доминирующим в статьях, которые просто перемешали старые подходы вокруг анализа частоты (который далек от иммунитета к инновациям в области деепфейков).

В конце 2022 года другая система использовала изменение яркости монитора в качестве детектора; и в том же году моя собственная демонстрация неспособности DeepFaceLive справиться с жесткими 90-градусными профильными видами, получила некоторый интерес сообщества.

DeepFaceLive является правильной целью для такого проекта, поскольку это, вероятно, является основной целью преступного интереса в отношении видеоконференц-мошенничества.

Однако я недавно увидел некоторые анекдотические доказательства того, что система LivePortrait, в настоящее время очень популярная в сообществе VFX, обрабатывает профильные виды гораздо лучше, чем DeepFaceLive; было бы интересно, если бы она могла быть включена в это исследование.

 

Опубликовано впервые во вторник, 24 сентября 2024 года

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai