Погляд Anderson

Виявлення відеодзвінків Deepfake через освітлення монітора

mm
Додайте Unite.AI до бажаних джерел у Google

Нова співпраця між дослідником Національної служби безпеки США (NSA) та Університетом Каліфорнії в Берклі пропонує новий метод виявлення контенту Deepfake в живому відеоконтексті – спостерігаючи за впливом освітлення монітора на зовнішній вигляд людини на іншому кінці відеодзвінку.

Популярний користувач DeepFaceLive Druuzil Tech & Games пробує свій власний модель Christian Bale DeepFaceLab у прямому сеансі зі своїми підписниками, поки джерела світла змінюються. Джерело: https://www.youtube.com/watch?v=XPQLDnogLKA

Популярний користувач DeepFaceLive Druuzil Tech & Games пробує свій власний модель Christian Bale DeepFaceLab у прямому сеансі зі своїми підписниками, поки джерела світла змінюються. Джерело: https://www.youtube.com/watch?v=XPQLDnogLKA

Система працює шляхом розміщення графічного елемента на екрані користувача, який змінює вузький діапазон кольору швидше, ніж типова система Deepfake може відреагувати – навіть якщо, як реальна система Deepfake, вона має деяку можливість підтримувати живе передавання кольору та облік фонового освітлення.

Уніформний колірний зображення, відображений на моніторі людини на іншому кінці (тобто потенційного шахрая Deepfake), циклічно проходить через обмежену варіацію зміни кольору, призначену для того, щоб не активувати автоматичний баланс білого на вебкамері та інші системи компенсації освітлення, які могли б скомпрометувати метод.

З паперу, ілюстрація зміни умов освітлення від монітора перед користувачем, який ефективно діє як розсіяний 'область освітлення'. Джерело: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

З паперу, ілюстрація зміни умов освітлення від монітора перед користувачем, який ефективно діє як розсіяний ‘область освітлення’. Джерело: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

Теорія цієї підходу полягає в тому, що живі системи Deepfake не можуть відреагувати вчасно на зміни, зображені на графічному елементі, збільшуючи “затримку” ефекту Deepfake в певних частинах спектра кольору, що розкриває його присутність.

Щоб точно виміряти відбите світло монітора, система повинна врахувати та потім виключити вплив загального освітлення середовища, яке не пов’язане зі світлом монітора. Тоді вона може розрізнити недоліки в вимірюванні активного освітлення та кольору обличчя користувача, представляючи тимчасовий зсув 1-4 кадрів між кожним:

Обмежуючи варіації кольору в графічному елементі 'детектора' та забезпечуючи, щоб вебкамера користувача не була спровокована на авто-регулювання її налаштувань захоплення через надмірну зміну освітлення монітора, дослідники змогли розрізнити характерну затримку в调整 освітлення системи Deepfake.

Обмежуючи варіації кольору в графічному елементі ‘детектора’ та забезпечуючи, щоб вебкамера користувача не була спровокована на авто-регулювання її налаштувань захоплення через надмірну зміну освітлення монітора, дослідники змогли розрізнити характерну затримку в调整 освітлення системи Deepfake.

Папер закінчується:

‘Через довірчу ставлення до живих відеодзвінків та зростаючу універсальність відеодзвінків у нашому особистому та професійному житті, ми пропонуємо, що техніки автентифікації відео (та аудіо) дзвінків будуть тільки зростати в важливості.’

Папер називається Виявлення відео Deepfake в реальному часі за допомогою активного освітлення, і походить від Кендіс Р. Герстнер, прикладного математика в Міністерстві оборони США, та професора Хані Фарід з Берклі.

Ерозія довіри

Сцена анти-Deepfake досліджень помітно змінилася за останні шість місяців, від загального виявлення Deepfake (тобто націленого на попередньо записані відео та порнографічний контент) до виявлення “живих” відеодзвінків, у відповідь на зростаючу хвилю інцидентів використання Deepfake у відеоконференційних дзвінках, та до недавнього попередження ФБР щодо зростаючого використання таких технологій у віддаленій роботі.

Дажи якщо відеодзвінок не був Deepfake, зростаючі можливості для відеоімітаторів, керованих штучним інтелектом, починають генерувати параною.

Новий папер стверджує:

‘Створення відео Deepfake в реальному часі [представляє] унікальні загрози через загальне відчуття довіри до живого відео- або телефонного дзвінку, та виклику виявлення Deepfake в реальному часі, оскільки дзвінок розгортається.’

Дослідницька спільнота вже давно поставила собі мету знайти невідворотні ознаки контенту Deepfake, які не можуть бути легко компенсовані. Хоча ЗМІ зазвичай характеризують це як технологічну війну між дослідниками безпеки та розробниками Deepfake, більшість спростувань ранніх підходів (таких як аналіз моргання очей, розрізнення положення голови та аналіз поведінки) відбулися просто тому, що розробники та користувачі намагалися зробити більш реалістичні Deepfake загалом, а не конкретно адресували останню “ознаку”, визначену спільнотою безпеки.

Освітлення живого відео Deepfake

Виявлення Deepfake в живих відео-середовищах несе на собі тягар обліку поганих відеоз’єднань, які дуже поширені у відеоконференційних сценаріях. Дажи без втручання шару Deepfake, відеоконтент може бути підданий лагу, артефактам та іншим типам погіршення аудіо та відео. Це може служити для приховування грубих країв у живій архітектурі Deepfake, як у відео, так і в аудіо Deepfake.

Автори нової системи покращили результати та методи, представлені у публікації 2020 року Центру мережевого обчислення Університету Темпл у Філадельфії.

З паперу 2020 року, ми можемо спостерігати зміну 'заповненого' освітлення обличчя, коли вміст екрана користувача змінюється. Джерело: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

З паперу 2020 року, ми можемо спостерігати зміну ‘заповненого’ освітлення обличчя, коли вміст екрана користувача змінюється. Джерело: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

Відмінність у новій роботі полягає в тому, що вона враховує, як вебкамери реагують на зміни освітлення. Автори пояснюють:

‘Через те, що всі сучасні вебкамери виконують автоекспозицію, такий тип високої інтенсивності активного освітлення [використовуваного в попередній роботі] ймовірно спровокує автоекспозицію камери, яка в свою чергу спровокує записаний вигляд обличчя. Щоб уникнути цього, ми використовуємо активне освітлення, яке складається з ізолюмінантної зміни кольору.

‘Хоча це уникне автоекспозиції камери, це може спровокувати баланс білого, який знову спровокує записаний вигляд обличчя. Щоб уникнути цього, ми працюємо в діапазоні кольору, який ми емпірично визначили як той, який не спровокує баланс білого.’

Для цієї ініціативи автори також розглянули подібні попередні спроби, такі як LiveScreen, який примусово накладає малопомітний шаблон освітлення на монітор кінцевого користувача в спробі розкрити контент Deepfake.

Хоча ця система досягла рівня точності 94,8%, дослідники висновують, що тонкість шаблонів освітлення зробить такий прихований підхід складним для реалізації в яскраво освітлених середовищах, і натомість пропонують, що їхня власна система, або одна, створена за подібними лініями, могла б бути публічно та за замовчуванням включена до популярного відеоконференційного програмного забезпечення:

‘Наше запропоноване втручання могло б бути реалізовано учасником дзвінку, який просто поділяє свій екран та відображає тимчасово-змінюваний шаблон, або, ідеально, воно могло б бути безпосередньо інтегровано до клієнта відеодзвінку.’

Тести

Автори використали суміш синтетичних та реальних суб’єктів для тестування свого детектора Deepfake, керованого Dlib. Для синтетичного сценарію вони використали Mitsuba, форвардний та інверсний рендерер з Федеральної політехнічної школи у Лозанні.

Зразки з симульованого набору даних, що демонструють різні тони шкіри, розмір джерела світла, інтенсивність фонового освітлення та близькість до камери.

Зразки з симульованого середовища тестів, що демонструють різні тони шкіри, розмір джерела світла, інтенсивність фонового освітлення та близькість до камери.

Сцена, зображена на малюнку, включає параметричний CGI-голову, захоплену віртуальною камерою з полем зору 90°. Голови мають Ламбертове відбивання та нейтральні тони шкіри, і розташовані на відстані 2 футів перед віртуальною камерою.

Щоб протестувати каркас через ряд можливих тонів шкіри та налаштувань, дослідники провели серію тестів, послідовно змінюючи різні аспекти. Змінені аспекти включали тон шкіри, близькість та розмір джерела світла.

Автори коментують:

‘У симуляції, з нашими різними припущеннями, виконаними, наш запропонований метод є високою мірою стійким до широкого діапазону конфігурацій зображення.’

Для реального сценарію дослідники використали 15 добровольців з різними тонами шкіри, у різних середовищах. Кожен був підданий двом циклам обмеженої зміни кольору, під умов, коли частота оновлення дисплея 30 Гц синхронізувалася з вебкамерою, що означало, що активне освітлення тривало тільки одну секунду за раз. Результати були загалом порівнянними з синтетическими тестами, хоча кореляції збільшувалися помітно з більшим освітленням.

Майбутні напрямки

Система, яку дослідники визнають, не враховує типових обличних окулювань, таких як чуби, окуляри або борода. Однак вони відзначають, що маскування такого типу можна додати до пізніших систем (через маркування та подальшу семантичну сегментацію), які могли б бути навчені брати значення тільки з сприйнятих ділянок шкіри у цільовому суб’єкті.

Автори також пропонують, що подібний парадигма міг би бути використаний для виявлення аудіодзвінків Deepfake, і що необхідний для цього звук міг би бути відіграний у частоті поза нормальним людським слуховим діапазоном.

Можливо, найцікавіше, дослідники також пропонують, що розширення області оцінки за межі обличчя в багатшому каркасі захоплення могло б суттєво покращити можливість виявлення Deepfake*:

‘Більш складна 3-D оцінка освітлення ймовірно забезпечила б багатшу модель вигляду, яка була б ще складнішою для обманщика обійти. Хоча ми зосередилися тільки на обличчі, комп’ютерний дисплей також освітлює шию, верхню частину тіла та навколишнє середовище, з яких подібні вимірювання могли б бути зроблені.

‘Ці додаткові вимірювання змусили б обманщика враховувати весь 3-D сцену, а не тільки обличчя.’

 

* Моє перетворення внутрішніх цитат авторів у гіперпосилання.

Перша публікація 6 липня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai