Погляд Anderson

Глибинна інформація може розкрити глибокі підробки в реальному часі

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження італійських вчених показали, що глибинна інформація, отримана з зображень, може бути корисним інструментом для виявлення глибоких підробок – навіть у реальному часі.

Більшість досліджень щодо виявлення глибоких підробок за останні п’ять років зосереджувалася на ідентифікації артефактів (які можна пом’якшити за допомогою покращених технік або сплутати з поганим стисненням відеокодека), атмосферному освітленні, біометричних ознаках, часовому порушенні та навіть інтуїції людини. Однак нове дослідження є першим, яке припускає, що глибинна інформація може бути цінним ключем для виявлення глибоких підробок.

Приклади одержаних глибинних карт і різниці у сприйманій глибині між реальними та підробленими зображеннями. Джерело: https://arxiv.org/pdf/2208.11074.pdf

Приклади одержаних глибинних карт і різниці у сприйманій глибині між реальними та підробленими зображеннями. Джерело: https://arxiv.org/pdf/2208.11074.pdf

Критично, що розроблені для нового дослідження рамки виявлення працюють дуже добре на легкій мережі, такій як Xception, і прийнятно на MobileNet. Новий документ визнає, що низька затримка висновку, пропонована такими мережами, може дозволити виявлення глибоких підробок у реальному часі проти нового тренду щодо живих підробок, як це видно у недавній атакі на Binance.

Більша економія часу висновку може бути досягнута тому, що система не потребує повнокольорових зображень, щоб визначити різницю між підробленими та реальними глибинними картами, а може працювати досить ефективно лише на grayscale зображеннях глибинної інформації.

Автори зазначають: ‘Це результат свідчить про те, що глибина в цьому випадку робить більший внесок у класифікацію, ніж кольорові артефакти.’

Результати представляють частину нової хвилі досліджень щодо виявлення глибоких підробок, спрямованих проти систем синтезу обличчя у реальному часі, таких як DeepFaceLive – напрямок зусиль, який прискорився значно за останні 3-4 місяці, після попередження ФБР у березні про ризик глибоких підробок у реальному часі.

Документ документ називається DepthFake: глибинна стратегія для виявлення глибоких підробок і походить від п’яти дослідників університету Сапієнца у Римі.

Крайні випадки

Під час навчання автоенкодерні моделі глибоких підробок优 tiên внутрішні області обличчя, такі як очі, ніс і рот. У більшості випадків, у відкритих джерелах, таких як DeepFaceLab і FaceSwap (обидва форкнуті з оригінального коду Reddit до його видалення), зовнішні контури обличчя не стають чіткими до дуже пізнього етапу навчання, і навряд чи матимуть такий же рівень синтезу, як внутрішня область обличчя.

З попереднього дослідження, ми бачимо візуалізацію 'салієнс-карт' обличчя. Джерело: https://arxiv.org/pdf/2203.01318.pdf

З попереднього дослідження, ми бачимо візуалізацію ‘салієнс-карт’ обличчя. Джерело: https://arxiv.org/pdf/2203.01318.pdf

Зазвичай, це не важливо, оскільки наша тенденція спочатку зосереджуватися на очах і пріоритезувати ‘на зовні’ з дедалі меншим рівнем уваги означає, що ми навряд чи будемо турбуватися цією різницею в периферійній якості – особливо якщо ми говоримо вживу з людиною, яка підробляє іншу особистість, що викликає соціальні конвенції і обмеження обробки, яких немає, коли ми оцінюємо ‘рендеровані’ глибокі підробки.

Однак, відсутність деталей або точності в уражених маргінальних регіонах підробленого обличчя може бути виявлена алгоритмічно. У березні, система, яка використовує периферійну область обличчя, була оголошена. Однак, оскільки вона вимагає вище середнього рівня навчальних даних, вона призначена лише для знаменитостей, які ймовірно будуть представлені у популярних наборах обличчя (таких як ImageNet), які мають значення у сучасних комп’ютерних техніках бачення і виявленні глибоких підробок.

Натомість, нова система, названа DepthFake, може працювати загально навіть на незнайомих чи невідомих особистостях, розрізняючи якість оціненої глибинної інформації у реальному та підробленому відеоконтенті.

Глибоко

Глибинна інформація все частіше інтегрується у смартфони, включаючи AI-допоміжні стерео-виконання, які особливо корисні для комп’ютерних досліджень бачення. У новому дослідженні, автори використали модель FaceDepth Національного університету Ірландії, конволюційну мережу кодувача/декодувача, яка може ефективно оцінювати глибинні карти з одиночних зображень.

Модель FaceDepth у дії. Джерело: https://tinyurl.com/3ctcazma

Модель FaceDepth у дії. Джерело: https://tinyurl.com/3ctcazma

Далі, у трубопроводі для нового рамки італійських дослідників витягуються 224×224 пікселів ділянки обличчя з оригінального RGB-зображення та одержаної глибинної карти. Критично, це дозволяє процесу копіювати основний контент без зміни розміру; це важливо, оскільки алгоритми стандартного зміни розміру негативно впливають на якість цільових областей.

За допомогою цієї інформації, з реальних і підроблених джерел, дослідники потім тренували конволюційну нейронну мережу (CNN), здатну розрізняти реальні та підроблені екземпляри, засновані на різниці у сприйманій якості відповідних глибинних карт.

Концептуальний трубопровід для DepthFake.

Концептуальний трубопровід для DepthFake.

Модель FaceDepth тренується на реалістичних і синтетичних даних за допомогою гібридної функції, яка пропонує більшу деталізацію на зовнішніх межах обличчя, що робить її добре підходящою для DepthFake. Вона використовує екземпляр MobileNet як витягувач функцій і була тренована з 480×640 входними зображеннями, що виводять 240×320 глибинні карти. Кожна глибинна карта представляє чверть чотирьох входних каналів, використаних у новому проєкті-дискримінаторі.

Глибинна карта автоматично вкладається у оригінальне RGB-зображення, щоб надати такий же RGBD-зображення, наповнений глибинною інформацією, який можуть вивести сучасні камери смартфонів.

Тренування

Модель була тренована на мережі Xception, попередньо тренованій на ImageNet, хоча архітектура потребувала деякої адаптації, щоб вміщувати додаткову глибинну інформацію, зберігаючи при цьому правильну ініціалізацію ваг.

Крім того, розбіжність у діапазонах значень між глибинною інформацією та тим, що очікує мережа, потребувала нормалізації значень до 0-255.

Під час тренування застосовувалися лише переворот і обертання. У багатьох випадках різні візуальні порушення були представлені моделі, щоб розвинути стійкий висновок, але необхідність збереження обмеженої і дуже крихкої інформації глибинної карти у вихідних фотографіях змусила дослідників прийняти спрощений режим.

Система була додатково тренована на простих 2-канальних grayscale, щоб визначити, наскільки складними повинні бути вихідні зображення, щоб отримати робочий алгоритм.

Тренування відбувалося через API TensorFlow на NVIDIA GTX 1080 з 8 ГБ відеопам’яті, використовуючи оптимізатор ADAMAX, протягом 25 епох, з розміром пакету 32. Вхідний розширення було фіксовано на 224×224 під час обрізання, а виявлення і витягування обличчя було здійснено за допомогою бібліотеки dlib на мові C++.

Результати

Точність результатів була перевірена проти Deepfake, Face2Face, FaceSwap, Neural Texture, і повний набір даних з RGB і RGBD-входами, використовуючи FaceForensic++-рамку.

Результати точності за чотири методи глибоких підробок і проти整个 незрізаного набору даних. Результати розділені між аналізом джерельних RGB-зображень і тими ж зображеннями з вкладеною інферованою глибинною картою. Найкращі результати виділені жирним шрифтом, з відсотковими цифрами нижче, демонструючи ступінь, у якій інформація глибинної карти покращує результат.

Результати точності за чотири методи глибоких підробок і проти整个 незрізаного набору даних. Результати розділені між аналізом джерельних RGB-зображень і тими ж зображеннями з вкладеною інферованою глибинною картою. Найкращі результати виділені жирним шрифтом, з відсотковими цифрами нижче, демонструючи ступінь, у якій інформація глибинної карти покращує результат.

У всіх випадках глибинний канал покращує результати моделі у всіх конфігураціях. Xception отримує найкращі результати, з мобільним MobileNet трохи позаду. Про це автори коментують:

‘[Це] цікаво зауважити, що MobileNet трохи гірший за Xception і перевершує глибший ResNet50. Це помітний результат, коли розглядається мета зменшення часу висновку для застосунків у реальному часі. Хоча це не є основним внеском цієї роботи, ми все ж вважаємо це заохочувальним результатом для майбутніх розробок.’

Дослідники також відзначають постійну перевагу RGBD і 2-канального grayscale-входу над RGB і прямим grayscale-входом, спостерігаючи, що grayscale-перетворення глибинних висновків, які є обчислюально дуже дешевими, дозволяють моделі отримувати покращені результати з дуже обмеженими місцевими ресурсами, що сприяє майбутньому розвитку виявлення глибоких підробок у реальному часі на основі глибинної інформації.

 

Перше опублікування 24 серпня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai