Взгляд Anderson

Глубокие подделки могут эффективно обмануть многие крупные API “живости” лица

mm
Добавьте Unite.AI в избранные источники в Google
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

Новое исследовательское сотрудничество между США и Китаем изучило уязвимость некоторых из крупнейших систем биометрической аутентификации на основе лица в мире к глубоким подделкам и обнаружило, что большинство из них уязвимо для разработки и появления новых форм атак с использованием глубоких подделок.

Исследование провело глубокие подделки на основе проникновения с помощью индивидуальной рамки, развернутой против систем верификации “живости” лица (FLV), которые обычно поставляются крупными поставщиками и продаются в качестве услуги дочерним клиентам, таким как авиакомпании и страховые компании.

Из статьи, обзор функционирования API верификации 'живости' лица (FLV) среди крупных поставщиков. Источник: https://arxiv.org/pdf/2202.10673.pdf

Из статьи, обзор функционирования API верификации ‘живости’ лица (FLV) среди крупных поставщиков. Источник: https://arxiv.org/pdf/2202.10673.pdf

Верификация “живости” лица предназначена для защиты от использования методов, таких как враждебные атаки на изображения, использования масок и предзаписанного видео, так называемых ‘мастерских лиц’, и других форм клонирования визуальной идентификации.

Исследование заключает, что ограниченное количество модулей обнаружения глубоких подделок, развернутых в этих системах, многие из которых обслуживают миллионы клиентов, далеки от неуязвимых и могут быть сконфигурированы на методах глубоких подделок, которые сейчас устарели, или могут быть слишком специфичными для архитектуры.

Авторы отмечают:

‘[Различные] методы глубоких подделок также показывают вариации среди разных поставщиков… Без доступа к техническим деталям целевых поставщиков FLV, мы предполагаем, что такие вариации связаны с мерами защиты, развернутыми разными поставщиками. Например, некоторые поставщики могут развернуть защиты против конкретных атак глубоких подделок.’

И продолжают:

‘[Большинство] API FLV не используют обнаружение глубоких подделок; даже для тех, у которых есть такие защиты, их эффективность вызывает беспокойство (например, они могут обнаружить высококачественные синтезированные видео, но не могут обнаружить видео низкого качества).’

Исследователи наблюдают, в этом отношении, что ‘аутентичность’ относительна:

‘[Даже] если синтезированное видео нереально для людей, оно все равно может обойти текущий механизм обнаружения глубоких подделок с очень высокой скоростью успеха.’

Выше, образцы глубоких подделок, которые смогли пройти аутентификацию в экспериментах авторов. Ниже,显но более реалистичные фальшивые изображения, которые не прошли аутентификацию.

Выше, образцы глубоких подделок, которые смогли пройти аутентификацию в экспериментах авторов. Ниже,显но более реалистичные фальшивые изображения, которые не прошли аутентификацию.

Другим открытием было то, что текущая конфигурация общих систем верификации лица предвзята в сторону белых мужчин. Следовательно, женские и не-белые идентификаторы были найдены более эффективными в обходе систем верификации, что ставит клиентов в этих категориях под большую угрозу взлома с помощью методов глубоких подделок.

Отчет обнаруживает, что белые мужские идентификаторы наиболее тщательно и точно оцениваются популярными API верификации 'живости' лица. В таблице выше мы видим, что женские и не-белые идентификаторы могут быть более легко использованы для обхода систем.

Отчет обнаруживает, что белые мужские идентификаторы наиболее тщательно и точно оцениваются популярными API верификации ‘живости’ лица. В таблице выше мы видим, что женские и не-белые идентификаторы могут быть более легко использованы для обхода систем.

Статья отмечает, что ‘существуют предвзятости в [верификации “живости” лица], которые могут принести значительные риски безопасности для определенной группы людей.’

Авторы также провели этические атаки на аутентификацию лица против китайского правительства, крупной китайской авиакомпании, одной из крупнейших страховых компаний в Китае и R360, одной из крупнейших инвестиционных групп в мире, и сообщают об успехе в обходе этих организаций’ использования изучаемых API.

В случае успешного обхода аутентификации для китайской авиакомпании, дочерний API требовал от пользователя ‘покачать головой’ в качестве доказательства против потенциального материала глубоких подделок, но это не сработало против рамки, разработанной исследователями, которая включает шесть архитектур глубоких подделок.

Несмотря на оценку авиакомпании пользователя 'покачать головой', контент глубоких подделок смог пройти тест.

Несмотря на оценку авиакомпании пользователя ‘покачать головой’, контент глубоких подделок смог пройти тест.

Статья отмечает, что авторы связались с поставщиками, которые, как сообщается, признали работу.

Авторы предлагают ряд рекомендаций для улучшения текущего состояния искусства в FLV, включая отказ от аутентификации на основе одного изображения (‘Image-based FLV’), где аутентификация основана на одном кадре из камеры клиента; более гибкое и полное обновление систем обнаружения глубоких подделок в области изображений и голоса; введение необходимости синхронизации голосовой аутентификации в пользовательском видео с движениями губ (что сейчас не делается в целом); и требование от пользователей выполнения жестов и движений, которые в настоящее время трудно воспроизвести системам глубоких подделок (например, профильные виды и частичное затенение лица).

Статья называется Видеть – значит жить? Переоценка безопасности верификации ‘живости’ лица в эпоху глубоких подделок, и исходит от совместных ведущих авторов Чанцзяна Ли и Ли Вана, и пяти других авторов из Университета штата Пенсильвания, Университета Чжэцзяна и Университета Шаньдуна.

Основные цели

Исследователи нацелились на ‘шесть наиболее представительных’ поставщиков верификации “живости” лица (FLV), которые были анонимизированы с помощью криптонимов в исследовании.

Поставщики представлены следующим образом: ‘BD’ и ‘TC’ представляют собой конгломерат-поставщика с наибольшим количеством вызовов API, связанных с лицом, и самой большой долей китайских облачных услуг ИИ; ‘HW’ – ‘один из поставщиков с наибольшим [китайским] рынком публичного облака’; ‘CW’ имеет самый быстрый рост в области компьютерного зрения и занимает лидирующую позицию на рынке; ‘ST’ – один из крупнейших поставщиков компьютерного зрения; и ‘iFT’ входит в число крупнейших поставщиков программного обеспечения ИИ в Китае.

Данные и архитектура

Данные, лежащие в основе проекта, включают набор данных из 625 537 изображений из китайской инициативы CelebA-Spoof, вместе с видео из набора данных SiW-M 2019 года Университета штата Мичиган.

Все эксперименты проводились на сервере с двумя процессорами Intel Xeon E5-2640 v4 с частотой 2,40 ГГц, работающими на 256 ГБ ОЗУ с жестким диском емкостью 4 ТБ, и четырьмя оркестрованными графическими процессорами NVIDIA 1080Ti, общей емкостью 44 ГБ оперативной видеопамяти.

Шесть в одном

Рамка, разработанная авторами статьи, называется LiveBugger, и включает шесть передовых рамок глубоких подделок, направленных против четырех основных защит в системах FLV.

LiveBugger содержит различные подходы к глубоким подделкам и центрируется на четырех основных векторах атаки в системах FLV.

LiveBugger содержит различные подходы к глубоким подделкам и центрируется на четырех основных векторах атаки в системах FLV.

Шесть рамок глубоких подделок, использованных в исследовании, включают: рамку X2Face 2018 года Оксфордского университета; рамку ICface, разработанную в ходе академического сотрудничества в США; две вариации рамки FSGAN 2019 года израильского проекта; итальянскую рамку First Order Method Model (FOMM) начала 2020 года; и рамку FaceShifter, разработанную в сотрудничестве с Microsoft Research в Университете Пекина (хотя FaceShifter не является открытым, авторы были вынуждены реконструировать ее на основе опубликованных архитектурных деталей).

Методы, использованные среди этих рамок, включали использование предварительно отрендеренного видео, в котором объекты поддельного видео выполняют рутинные действия, извлеченные из требований аутентификации API в ранней оценочной модули LiveBugger, и также использование эффективной ‘кукольной’ глубокой подделки, которая переводит живые движения человека в поток глубоких подделок, вставленный в захваченный поток веб-камеры.

Примером последнего является DeepFaceLive, который дебютировал прошлым летом как дополнение к популярной DeepFaceLab, для обеспечения потоковой передачи глубоких подделок в реальном времени, но который не включен в исследование авторов.

Атака на четыре вектора

Четыре вектора атаки в типичной системе FLV включают: аутентификацию на основе изображения, которая использует одно предоставленное пользователем фото в качестве токена аутентификации против лица, записанного в системе; аутентификацию на основе молчания, которая требует от пользователя загрузить видеоклип; аутентификацию на основе действий, которая требует от пользователя выполнить действия, указанные платформой; и аутентификацию на основе голоса, которая сопоставляет речь пользователя с базой данных системы для речевого шаблона пользователя.

Первым вызовом для системы является определение степени, в которой API будет раскрывать свои требования, поскольку они могут быть предвидены и учтены в процессе глубоких подделок. Это обрабатывается модулем Intelligence Engine в LiveBugger, который собирает информацию о требованиях из публично доступной документации API и других источников.

Поскольку опубликованные требования могут быть отсутствовать (по различным причинам) в фактических процедурах API, модуль Intelligence Engine включает зонд, который собирает неявную информацию на основе результатов экспериментальных вызовов API. В исследовательском проекте это было облегчено официальными офлайн ‘тестовыми’ API, предоставленными для пользы разработчиков, и также добровольцами, которые предложили использовать свои собственные живые учетные записи для тестирования.

Модуль Intelligence Engine ищет доказательства того, что API в настоящее время использует определенный подход, который может быть полезен в атаках. Особенности этого типа могут включать обнаружение согласованности, которое проверяет, являются ли кадры в видео временно непрерывными – требование, которое может быть установлено путем отправки перемешанных кадров видео и наблюдения, способствует ли это сбою аутентификации.

Модуль также ищет обнаружение языка губ, где API может проверить, синхронизирован ли звук в видео с движениями губ пользователя (редко бывает – см. ‘Результаты’ ниже).

Результаты

Авторы обнаружили, что все шесть оцененных API не используют обнаружение согласованности на момент экспериментов, что позволяет двигателю глубоких подделок в LiveBugger просто склеить синтезированный аудио с глубокими подделками видео, основанными на материалах, предоставленных добровольцами.

Однако некоторые дочерние приложения (т. е. клиенты API-фреймворков) были найдены с добавленным обнаружением согласованности в процессе, что требует предварительной записи видео, предназначенного для обхода этого.

Кроме того, только несколько поставщиков API используют обнаружение языка губ; для большинства из них видео и аудио анализируются как отдельные величины, и нет функциональности, которая пытается сопоставить движение губ с предоставленным аудио.

Разнообразные результаты, охватывающие диапазон методов глубоких подделок, доступных в LiveBugger, против различных массивов векторов атаки в API FLV. Более высокие числа указывают на более высокую скорость успеха в проникновении FLV с помощью методов глубоких подделок. Не все API включают все возможные защиты для FLV; например, несколько из них не предлагают никакой защиты против глубоких подделок, в то время как другие не проверяют, соответствуют ли движения губ и аудио в пользовательском видео во время аутентификации.

Разнообразные результаты, охватывающие диапазон методов глубоких подделок, доступных в LiveBugger, против различных массивов векторов атаки в API FLV. Более высокие числа указывают на более высокую скорость успеха в проникновении FLV с помощью методов глубоких подделок. Не все API включают все возможные защиты для FLV; например, несколько из них не предлагают никакой защиты против глубоких подделок, в то время как другие не проверяют, соответствуют ли движения губ и аудио в пользовательском видео во время аутентификации.

Вывод

Результаты статьи и указания на будущее FLV сложны, и авторы объединили их в функциональную ‘архитектуру уязвимостей’, которая может помочь разработчикам FLV лучше понять некоторые из проблем, обнаруженных в исследовании.

Сеть рекомендаций статьи по существующей и потенциальной уязвимости процедур видеоидентификации на основе лица к атакам глубоких подделок.

Сеть рекомендаций статьи по существующей и потенциальной уязвимости процедур видеоидентификации на основе лица к атакам глубоких подделок.

Рекомендации отмечают:

‘Риски безопасности FLV широко существуют во многих реальных приложениях и, таким образом, угрожают безопасности миллионов конечных пользователей’

Авторы также наблюдают, что использование аутентификации на основе действий ‘маргинально’, и что увеличение количества действий, которые пользователи должны выполнить, ‘не может принести никакой безопасности’.

Кроме того, авторы отмечают, что сочетание распознавания голоса и временного распознавания лица (в видео) является бесполезной защитой, если только поставщики API не начнут требовать, чтобы движения губ были синхронизированы с аудио.

Статья появляется в свете недавнего предупреждения ФБР бизнесу об опасности мошенничества с глубокими подделками, почти через год после их предупреждения об использовании этой технологии в операциях по иностранному влиянию, и общих страхов, что технология живых глубоких подделок облегчит новую волну преступлений против общества, которое все еще доверяет архитектурам безопасности видеоаутентификации.

Это все еще ранние дни глубоких подделок как поверхности атаки аутентификации; в 2020 году 35 миллионов долларов были мошеннически извлечены из банка в ОАЭ с помощью технологии глубоких подделок аудио, и британский руководитель также был обманут и вынужден распределить 243 000 долларов в 2019 году.

 

Опубликовано впервые 23 февраля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai