Погляд Anderson

Діпфейки можуть ефективно обманювати багато великих систем автентифікації обличчя “Liveness” API

mm
Додайте Unite.AI до бажаних джерел у Google
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

Нове дослідження, проведене у співпраці США та Китаю, вивчило вразливість деяких найбільших систем автентифікації на основі обличчя у світі до атак типу “діпфейк”, і виявило, що більшість із них вразливі до розробки та появи нових форм атак типу “діпфейк”.

Дослідження проводилося за допомогою спеціальної структури, розгорнутої проти систем верифікації живості обличчя (FLV), які широко постачаються великими постачальниками та продаються як послуга клієнтам, таким як авіакомпанії та страхові компанії.

З документа, огляд роботи систем верифікації живості обличчя (FLV) великих постачальників. Джерело: https://arxiv.org/pdf/2202.10673.pdf

З документа, огляд роботи систем верифікації живості обличчя (FLV) великих постачальників. Джерело: https://arxiv.org/pdf/2202.10673.pdf

Системи верифікації живості обличчя призначені для захисту від використання методів, таких як атаки зображень, використання масок та попередньо записаного відео, так званих ‘master faces’, та інших форм клонування візуальної ідентифікації.

Дослідження показало, що обмежена кількість модулів виявлення депфейків, розгорнутих у цих системах, далеко не досконала, і може бути сконфігурована для депфейків, які зараз застаріли, або може бути занадто залежною від архітектури.

Автори зазначають:

‘Різні методи депфейків також показують варіації серед різних постачальників… Без доступу до технічних деталей цілей FLV, ми припускаємо, що такі варіації пояснюються заходами захисту, розгорнутими різними постачальниками. Наприклад, деякі постачальники можуть розгорнути захист проти конкретних атак депфейків.’

І продовжують:

‘Більшість FLV API не використовують виявлення депфейків; навіть для тих, хто має такі захисти, їхня ефективність викликає занепокоєння (наприклад, вони можуть виявити високоякісне синтезоване відео, але не виявити низькоякісне).’

Дослідники спостерігають, у цьому відношенні, що ‘автентичність’ є відносною:

‘[Даже] якщо синтезоване відео є нереальним для людей, воно все ж може обійти поточний механізм виявлення депфейків з дуже високим рівнем успіху.’

Вгорі, зразкові зображення депфейків, які змогли автентифікуватися в експериментах авторів. Внизу, очевидно більш реалістичні підроблені зображення, які не пройшли автентифікацію.

Вгорі, зразкові зображення депфейків, які змогли автентифікуватися в експериментах авторів. Внизу, очевидно більш реалістичні підроблені зображення, які не пройшли автентифікацію.

Іншим висновком було те, що поточна конфігурація загальних систем верифікації обличчя є упередженою до білих чоловіків. Внаслідок цього жінки та люди інших національностей були виявлені більш ефективними у обході систем верифікації, що ставить клієнтів цих категорій під більшу загрозу порушення через депфейк-техніки.

Звіт показує, що білі чоловічі особи найбільш суворо та точно оцінюються популярними системами верифікації живості обличчя. У таблиці вище ми бачимо, що жінки та люди інших національностей можуть бути більш легко використані для обходу цих систем.

Звіт показує, що білі чоловічі особи найбільш суворо та точно оцінюються популярними системами верифікації живості обличчя. У таблиці вище ми бачимо, що жінки та люди інших національностей можуть бути більш легко використані для обходу цих систем.

Документ зазначає, що ‘існують упередження у системах верифікації живості обличчя, які можуть привести до значних ризиків безпеки для певної групи людей.’

Автори також провели етичні атаки автентифікації проти китайського уряду, великої китайської авіакомпанії, однієї з найбільших страхових компаній у Китаї та R360, однієї з найбільших інвестиційних груп у світі, і повідомили про успіх у обході цих організацій.

У випадку успішної автентифікації для китайської авіакомпанії, нижня API вимагала від користувача “похитати головою” як доказ проти потенційного депфейк-матеріалу, але це не спрацювало проти структури, розробленої дослідниками, яка включає шість архітектур депфейків.

Незважаючи на оцінку авіакомпанії руху голови користувача, депфейк-контент зміг пройти тест.

Незважаючи на оцінку авіакомпанії руху голови користувача, депфейк-контент зміг пройти тест.

Документ зазначає, що автори контактували з постачальниками, які підтвердили роботу.

Автори пропонують ряд рекомендацій для покращення поточного стану систем верифікації живості обличчя, включаючи відмову від автентифікації на основі одного зображення (‘Image-based FLV’), де автентифікація проводиться на основі одного кадру з камери користувача; більш гнучке та повне оновлення систем виявлення депфейків у сфері зображень та голосу; вимогу синхронізації голосової автентифікації у відео з рухом губ (що зараз не робиться загалом); і вимогу виконання жестів та рухів, які зараз важко відтворити системам депфейків (наприклад, профільні види та часткова затуляння обличчя).

Документ документ називається Seeing is Living? Rethinking the Security of Facial Liveness Verification in the Deepfake Era, і надходить від спільних авторів Чанцзяня Лі та Лі Ванга, а також п’яти інших авторів з Пенсільванського державного університету, Університету Чжецзяна та Університету Шаньдуна.

Основні цілі

Дослідники націлилися на ‘шість найбільш представницьких’ постачальників систем верифікації живості обличчя (FLV), які були анонімізовані за допомогою криптонімів у дослідженні.

Постачальники представлені таким чином: ‘BD’ і ‘TC’ представляють конгломерат постачальника з найбільшою кількістю дзвінків до API, пов’язаних з обличчям, і найбільшою часткою китайських хмарних послуг з штучного інтелекту; ‘HW’ – один з постачальників з найбільшим китайським публічним ринком хмарних послуг; ‘CW’ має найвищий темп зростання у сфері комп’ютерного бачення та здобуває лідерську позицію на ринку; ‘ST’ – один з найбільших постачальників комп’ютерного бачення; і ‘iFT’ входить до числа найбільших постачальників програмного забезпечення з штучного інтелекту у Китаї.

Дані та архітектура

Підставними даними для проекту є набір даних із 625 537 зображень з китайської ініціативи CelebA-Spoof, разом із відео з університету штату Мічиган у 2019 році SiW-M.

Усі експерименти проводилися на сервері з двома процесорами Intel Xeon E5-2640 v4 з частотою 2,40 ГГц, які працюють на 256 ГБ оперативної пам’яті з жорстким диском ємністю 4 ТБ, та чотирма оркестрованими графічними процесорами NVIDIA 1080Ti, загальною кількістю 44 ГБ робочої відеопам’яті.

Шість у одному

Структура, розроблена авторами документа, називається LiveBugger, і включає шість найновіших структур депфейків, спрямованих проти чотирьох основних захистів у системах FLV.

LiveBugger містить різноманітні підходи депфейків та центрується на чотирьох основних векторах атаки у системах FLV.

LiveBugger містить різноманітні підходи депфейків та центрується на чотирьох основних векторах атаки у системах FLV.

Шість структур депфейків, використаних у цьому дослідженні, включають: структуру Оксфордського університету 2018 року X2Face; академічну співпрацю США ICface; дві варіації ізраїльського проекту 2019 року FSGAN; італійську Перший метод моделі (FOMM), з початку 2020 року; і співпрацю Пекінського університету та дослідницького центру Microsoft FaceShifter (хоча FaceShifter не є відкритим джерелом, автори мали реконструювати його на основі опублікованих архітектурних деталей).

Методи, використані серед цих структур, включали використання попередньо відтвореного відео, у якому суб’єкти підробленого відео виконують дії, які були витягнуті з вимог до автентифікації API у попередньому оцінювальному модулі LiveBugger, а також використання ефективної “ляльковості депфейків”, яка перекладає рухи людини у потік депфейків, вставлений у відеопотік.

Приклад останнього – DeepFaceLive, який дебютував минулого літа як додаток до популярної програми DeepFaceLab, для забезпечення потокового депфейку у реальному часі, але який не включений до дослідження авторів.

Атака на чотири вектори

Чотири вектори атаки у типовій системі FLV включають: автентифікацію на основі зображення, яка використовує одне зображення, надане користувачем, як токен автентифікації проти ідентифікатора обличчя, записаного в системі; автентифікацію на основі мовчання, яка вимагає від користувача завантажити відеокліп; автентифікацію на основі дії, яка вимагає від користувача виконувати дії, диктовані платформою; і автентифікацію на основі голосу, яка порівнює промовлений голос користувача з базою даних системи для шаблону голосу користувача.

Першим викликом для системи є встановлення рівня, до якого API розкриє свої вимоги, оскільки вони можуть бути передбачені та пристосовані у процесі депфейку. Це обробляється Інтелектуальним двигуном у LiveBugger, який збирає інформацію про вимоги з публічно доступної документації API та інших джерел.

Оскільки опубліковані вимоги можуть бути відсутні (з різних причин) у фактичних процедурах API, Інтелектуальний двигун включає зонд, який збирає неявну інформацію на основі результатів дослідницьких дзвінків API. У цьому дослідженні це було здійснено за допомогою офіційних автентифікованих “тестових” API, наданих для користувачів, а також добровольців, які погодились використовувати свої особисті облікові записи для тестування.

Інтелектуальний двигун шукає ознаки того, чи використовує API певний підхід, який може бути корисним для атак. Особливості цього типу можуть включати виявлення цілісності, яке перевіряє, чи кадри у відео є тимчасово безперервними – вимога, яка може бути встановлена шляхом відправки перемішаних кадрів відео та спостереження за тим, чи це призводить до відмови у автентифікації.

Модуль також шукає виявлення мови губ, де API може перевірити, чи звук у відео синхронізований з рухом губ користувача (що рідко трапляється – див. “Результати” нижче).

Результати

Автори виявили, що всі шість оцінених API не використовують виявлення цілісності на момент експериментів, що дозволяє двигуну депфейків у LiveBugger просто склеїти синтезований аудіо з відео депфейків, заснований на матеріалі, наданому добровольцями.

Однак, деякі нижні програми (тобто клієнти API-фреймворків) були виявлені з доданим виявленням цілісності до процесу, що вимагало попереднього запису відео, щоб обійти це.

Крім того, лише кілька постачальників API використовують виявлення мови губ; для більшості з них відео та аудіо аналізуються як окремі величини, і немає функції, яка намагається зіставити рух губ з наданим аудіо.

Різноманітні результати, що охоплюють діапазон технік депфейків, доступних у LiveBugger проти різноманітних масштабів векторів атаки у системах FLV API. Вищі числа вказують на те, що атакувальник успішно проник до автентифікації, використовуючи техніки депфейків. Не всі API включають усі можливі захисти для FLV; наприклад, деякі з них не пропонують жодного захисту проти депфейків, тоді як інші не перевіряють, чи рух губ та аудіо збігаються у відео, наданому користувачем під час автентифікації.

Різноманітні результати, що охоплюють діапазон технік депфейків, доступних у LiveBugger проти різноманітних масштабів векторів атаки у системах FLV API. Вищі числа вказують на більший рівень успіху у проникненні до систем FLV, використовуючи техніки депфейків. Не всі API включають усі можливі захисти для FLV; наприклад, деякі з них не пропонують жодного захисту проти депфейків, тоді як інші не перевіряють, чи рух губ та аудіо збігаються у відео, наданому користувачем під час автентифікації.

Висновок

Результати документа та вказівки на майбутнє систем FLV API є лабіринтними, і автори об’єднали їх у функціональну “архітектуру вразливостей”, яка може допомогти розробникам систем FLV краще зрозуміти деякі з проблем, виявлених у дослідженні.

Мережа рекомендацій документа щодо існуючої та потенційної вразливості процедур відеоідентифікації на основі обличчя до атак депфейків.

Мережа рекомендацій документа щодо існуючої та потенційної вразливості процедур відеоідентифікації на основі обличчя до атак депфейків.

Рекомендації зазначають:

‘Безпекові ризики FLV широко існують у багатьох реальних додатках, і тим самим загрожують безпеці мільйонів кінцевих користувачів.’

Автори також спостерігають, що використання автентифікації на основі дії є “маргінальним”, і що збільшення кількості дій, які користувач повинен виконувати, “не може принести жодної безпекової вигоди”.

Крім того, автори зазначають, що поєднання розпізнавання голосу та тимчасового розпізнавання обличчя (у відео) є марним захистом, якщо постачальники API не починають вимагати синхронізації руху губ з аудіо.

Документ публікується у світлі недавнього попередження ФБР щодо небезпеки депфейк-фроду для бізнесу, майже через рік після їх попередження про використання цієї технології у іноземних операціях впливу, та загальних страхів того, що технологія живого депфейку сприятиме новій хвилі злочинності серед населення, яке все ще довіряє безпеці архітектури відеоавтентифікації.

Ці є ще ранні дні депфейків як поверхні атаки автентифікації; у 2020 році 35 мільйонів доларів було фальшиво витягнуто з банку в ОАЕ за допомогою технології аудіо-депфейків, а виконавчий директор у Великій Британії був аналогічно обманутий на виплату 243 000 доларів у 2019 році.

 

Перша публікація 23 лютого 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai