Взгляд Anderson
Обнаружение Дипфейков на Основе Оригинальных Биометрических Черт Человека

Новая статья исследователей из Италии и Германии предлагает метод обнаружения дипфейков на основе биометрических особенностей лица и голоса, а не артефактов, созданных системами синтеза лица, дорогими решениями водяных знаков или другими более громоздкими подходами.
Фреймворк требует ввода 10 или более разнообразных, нефальшивых видеороликов субъекта. Однако он не требует специальной подготовки, переподготовки или дополнения видеороликов в каждом случае, поскольку его встроенная модель уже абстрагировала вероятные векторные расстояния между реальными и фальшивыми видеороликами в широко применимом виде.

Контрастное обучение лежит в основе подхода POI-Forensics. Векторы, полученные из исходного материала на основе каждого случая, сравниваются с теми же векторами в потенциально ложном видео, с аспектами и чертами, взятыми из обоих видео- и аудиокомпонентов потенциально фальшивого видео. Источник: https://arxiv.org/pdf/2204.03083.pdf
Названный POI-Forensics, подход полагается на движение и аудиосигналы, уникальные для реального человека, которого дипфейк.
Хотя такая система могла бы позволить полностью автоматизированные, ‘предварительно отрендеренные’ рамки аутентификации для знаменитостей, политиков, влиятельных лиц YouTube и других людей, для которых большое количество видеоматериала легко доступно, она также могла бы быть адаптирована в рамки, где обычные жертвы дипфейк-технологий потенциально могли бы иметь платформу для доказательства неаутентичности атак против них.

Визуализация извлеченных особенностей из подлинных и фальшивых видеороликов по четырем субъектам в POI-Forensics, через фреймворк t-SNE.
Авторы утверждают, что POI-Forensics достигает нового состояния искусства в обнаружении дипфейков. По разнообразным общим наборам данных в этой области фреймворк сообщает об улучшении в 3%, 10% и 7% для высококачественных, низкокачественных и ‘атакующих’ видеороликов соответственно. Исследователи обещают выпустить код вскоре.

Производительность POI-Forensics против соперничающих фреймворков pDFDC, DeepFakeTIMIT, FakeAVCelebV2 и KoDF. Обучение в каждом случае проводилось на FaceForensics++ и собственный ID-Reveal авторов на VoxCeleb2. Результаты включают высококачественные и низкокачественные видеоролики.
Авторы заявляют:
‘Обучение проводится исключительно на реальных видеороликах с говорящими лицами, поэтому детектор не зависит от какого-либо конкретного метода манипуляции и дает наивысшую способность обобщения. Кроме того, наш метод может обнаруживать как одномодальные (только аудио, только видео), так и многомодальные (аудио-видео) атаки и устойчив к низкокачественным или поврежденным видеороликам, построенным только на высокоуровневых семантических особенностях.’
Новая статья, которая включает элементы некоторых проектов авторов по ID-Reveal 2021 года, названа Обнаружение Дипфейков на Основе Биометрических Черт Человека и является совместной работой между Университетом Федерико II в Неаполе и Техническим Университетом Мюнхена.
Гонка Дипфейков
Чтобы победить систему обнаружения такого типа, дипфейк и системы синтеза человека потребуют возможности хотя бы симулировать визуальные и аудио биометрические сигналы от предполагаемого объекта синтеза – технологии, которая находится в многих годах впереди и, вероятно, останется в области дорогостоящих и проприетарных закрытых систем, разработанных компаниями VFX, которые будут иметь преимущество сотрудничества и участия предполагаемых объектов (или их наследников в случае симуляции умерших людей).

Предыдущий подход авторов, ID-Reveal, сосредоточился исключительно на визуальной информации. Источник: https://arxiv.org/pdf/2012.02512.pdf
Успешные и популярные методы дипфейков, такие как FaceSwap и DeepFaceLab/Live, в настоящее время не имеют возможности создавать такие гранулярные биометрические приближения, полагаясь на талантливых имитаторов на которых наложена фальшивая личность, и гораздо чаще на подходящую внешнюю видеозапись ‘podobных’ людей. Кроме того, структура основного кода 2017 года, который имеет мало модульности и который остается исходным источником для DFL и FaceSwap, не позволяет добавлять такую функциональность.
Эти два доминирующих пакета дипфейков основаны на автоэнкодерах. Альтернативные методы синтеза человека могут использовать подход Генеративной Соперничающей Сети (GAN) или Нейронного Радианса (NeRF) для воссоздания человеческой идентичности; но обе эти линии исследований имеют годы работы вперед, чтобы произвести полностью фотореалистичное человеческое видео.
С исключением аудио (фальшивых голосов), биометрическая симуляция очень далеко внизу списка проблем, с которыми сталкивается синтез человеческого изображения. В любом случае, воспроизведение тембра и других качеств человеческого голоса не воспроизводит его эксцентричности и ‘сигналов’, или то, как реальный субъект использует семантическую конструкцию. Следовательно, даже совершенствование симуляции голоса с помощью ИИ не решает потенциальную проблему биометрической аутентичности.
На Arxiv alone, несколько стратегий обнаружения дипфейков и инноваций выпускаются каждую неделю. Недавние подходы опирались на Гомогенность Лица и Голоса, Локальный Бинарный Паттерн Гистограммы (FF-LBPH), человеческое восприятие аудио дипфейков, анализ границ лица, учет деградации видео и ‘Форензические Баллистики’ – среди многих других.

Анализ гистограммы является одним из последних методов, предлагаемых для улучшения обнаружения дипфейков. Источник: https://arxiv.org/pdf/2203.09928.pdf
Подход, Данные и Архитектура
POI-Forensics использует многомодальный подход к верификации идентичности, опираясь на мягкие биометрические данные на основе визуальных и аудио сигналов. Фреймворк включает отдельные аудио- и видеосети, которые в конечном итоге получают характерные векторные данные, которые можно сравнить с теми же извлеченными особенностями в потенциальном дипфейк-видео под изучением.

Концептуальная архитектура POI-Forensics.
И отдельный (аудио или видео), и фьюжн-анализ может быть проведен на целевые клипы, в конечном итоге приводя к индексу подобия POI. Функция контрастной потери, используемая в этом подходе, основана на академическом сотрудничестве 2021 года между Google Research, Бостонским Университетом, Snap Inc. и MIT.
Базовый набор данных был разделен на основе идентичности. 4608 идентичностей были использованы для обучения, с 512 оставшимися для проверки. 500 идентичностей, использованных в FakeAVCelebV2 (кандидат на тестирование, см. ниже), были исключены, чтобы получить неполяризованные результаты.
Две сети были обучены в течение 12 эпох с необычно большим размером пакета 2304 пакетов на эпоху, с каждым пакетом, состоящим из 8×8 сегментов видео – 8 сегментов для 8 разных идентичностей. Оптимизатор Adam был использован с декуплированным весовым распадом на скорости обучения 10−4, и весовым распадом 0,01.
Тестирование и Результаты
Наборы данных дипфейков, протестированные для проекта, были предварительным набором данных DeepFake Detection Challenge, который включает замену лиц на 68 субъектах, из которых 44 идентичности были выбраны, имеющие более девяти связанных видеороликов, в общей сложности 920 реальных видеороликов и 2925 фальшивых видеороликов; DeepFake-TIMIT, набор данных на основе GAN, включающий 320 видеороликов 32 субъектов, в общей сложности 290 реальных видеороликов и 580 фальшивых видеороликов продолжительностью не менее четырех секунд; FakeAVCelebV2, включающий 500 реальных видеороликов из Voxceleb2, и примерно 20 000 фальшивых видеороликов из различных наборов данных, к которым были добавлены фальшивые аудиоклонирующие данные с помощью SV2TTS для совместимости; и KoDF, корейский набор данных дипфейков с 403 идентичностями, фальшивыми с помощью FaceSwap, DeepFaceLab и FSGAN, а также три модели Первого Порядка Движения (FOMM).
Последний также включает аудио-индуцированную синтезу лица ATFHP и вывод из Wav2Lip, с авторами, использующими полученный набор данных, включающий 276 реальных видеороликов и 544 фальшивых видеороликов.
Метрики, используемые для оценки, включали площадь под кривой оперативной характеристики получателя (AUC) и приближенную 10% ‘фальшивую частоту тревоги’, которая была бы проблематичной в рамках, которые включают и обучают на фальшивые данные, но которая проблема снимается тем, что POI-Forensics принимает только подлинные видеоданные в качестве входных данных.
Методы были протестированы против детектора дипфейков Seferbekov, который занял первое место в вызове Kaggle Deepfake Detection; FTCN (Полностью Временная Конволюционная Сеть), сотрудничество между Университетом Сямэнь в Китае и Исследовательским Центром Microsoft Asia; LipForensics, совместная работа 2021 года между Имперским Колледжем Лондона и Facebook; и ID-Reveal, предыдущий проект нескольких исследователей, который опускает аудио-аспект и использует 3D Морфабельные Модели в сочетании с игровой сценарием для обнаружения фальшивого вывода.
В результатах (см. таблицу выше) POI-Forensics превзошел лидера Seferbekov на 2,5% в AUC и на 1,5% в точности. Производительность была более конкурентной на других наборах данных на высоком качестве.
Однако новый подход продемонстрировал заметное лидерство над всеми конкурирующими методами для низкокачественных видеороликов, которые остаются наиболее вероятным сценарием, в котором дипфейки склонны обманывать случайных зрителей, на основе ‘реальных’ контекстов.
Авторы утверждают:
‘Действительно, в этом сложном сценарии только подходы, основанные на идентичности, продолжают обеспечивать хорошую производительность, поскольку они полагаются на высокоуровневые семантические особенности, которые довольно устойчивы к повреждениям изображения.’
Учитывая, что POI-Forensics использует только реальные видеоданные в качестве источника, достижение можно считать усиленным, и предполагает, что использование родных биометрических черт потенциальных жертв дипфейков является ценным путем вперед, чтобы избежать ‘холодной войны артефактов’ между программным обеспечением дипфейков и решениями обнаружения дипфейков.
В окончательном тесте исследователи добавили враждебный шум к входным данным, метод, который может надежно обмануть классификаторы. Теперь давно известный метод быстрого градиентного знака все еще доказывает свою эффективность в этом отношении.
Стратегии враждебных атак снижали успех во всех методах и наборах данных, с AUC, снижающейся на 10% до 38%. Однако только POI-Forensics и предыдущий метод авторов ID-Reveal смогли сохранить разумную производительность в этом сценарии атаки, что предполагает, что высокоуровневые особенности, связанные с мягкими биометрическими данными, чрезвычайно устойчивы к обнаружению дипфейков.
Авторы заключили:
‘В целом, мы считаем, что наш метод является первым шагом; в частности, использование более высоких семантических особенностей является перспективным направлением для будущих исследований. Кроме того, многомодальный анализ мог бы быть еще больше обогащен включением большего количества информации из других областей, таких как текстовые данные.’
Опубликовано впервые 8 апреля 2022 года.












