Погляд Anderson
Відтворення проти реалізму у відеороликах Deepfake

Не всі практики deepfake мають одну й ту ж мету: імпульс сектора досліджень синтезу зображень – підтримуваний впливовими прихильниками, такими як Adobe, NVIDIA і Facebook – полягає у вдосконаленні стану мистецтва, щоб техніки машинного навчання могли в кінцевому підсумку відтворити або синтезувати людську діяльність у високій роздільності та під найскладнішими умовами (відтворення).
Натомість, мета тих, хто хоче використовувати технології deepfake для поширення дезінформації, полягає у створенні правдоподібних симуляцій реальних людей багатьма іншими методами, ніж просто вірогідність deepfaked облич.
Цей підхід “сліпого місця” поширюється на погіршення якості зображення відеоролика deepfake, так що весь відеоролик (а не тільки обманлива частина, представлена deepfaked обличчям) має суцільний “вигляд”, який відповідає очікуваній якості для носія.
‘Суцільний’ не означає ‘хороший’ – достатньо, щоб якість була послідовною по всьому оригіналу та вставленому, фальшивому контенту, і відповідала очікуваним вимогам.

DeepFaceLive в дії: ця потокова версія прем’єрного програмного забезпечення deepfake DeepFaceLab може забезпечити контекстний реалізм, представляючи фальшивки в контексті обмеженої якості відео, разом з проблемами відтворення та іншими періодичними артефактами з’єднання. Source: https://www.youtube.com/watch?v=IL517EgYH8U
Вбудований спад
Дійсно, дві найбільш популярні пакети deepfake (обидва похідні від суперечливого джерельного коду 2017 року) містять компоненти, призначені для інтеграції deepfaked обличчя в контексті “історичного” або низькоякісного відео шляхом погіршення згенерованого обличчя.
У DeepFaceLab параметр bicubic_degrade_power здійснює це, а у FaceSwap настройка “зерно” у конфігурації Ffmpeg також сприяє інтеграції фальшивого обличчя, зберігаючи зерно під час кодування*.

Настройка ‘зерно’ у FaceSwap сприяє автентичній інтеграції у не-HQ відеоконтент та спадковий контент, який може містити ефекти фільмового зерна, які зараз досить рідкісні.
Часто замість повного та інтегрованого відеоролика deepfake deepfakers будуть виводити ізольовану серію файлів PNG з альфа-каналами, кожне зображення показує тільки синтетичне обличчя, так що потік зображень можна перетворити у відео на платформах з більш складними можливостями “погіршення” ефектів, таких як Adobe After Effects, до того, як фальшивка та реальні елементи будуть об’єднані для остаточного відео.
Реалістичні контексти виявлення deepfake
З урахуванням цього нового дослідження зі Швейцарії було запропоновано переробку методології за допомогою підходів до виявлення deepfake, навчаючи системи виявлення вивчати характеристики контенту deepfake, коли він представлений у свідомо погіршених контекстах.
У новій роботі дослідники стверджують, що передові пакети виявлення deepfake спираються на нереалістичні умовні метрики для контексту метрик, які вони застосовують, і що “погіршений” вихід deepfake може впасти нижче мінімального порогу якості для виявлення, хоча їх реалістично “брудний” контент, ймовірно, обмане глядачів через правильну увагу до контексту.
Корисна плутанина
Попередні спроби включення погіршеного виходу у підходи до виявлення deepfake включають Mixup нейронну мережу, пропозицію 2018 року від MIT і FAIR, і AugMix, співпрацю 2020 року між DeepMind і Google, обидва методи даних, які намагаються “замути” навчальний матеріал таким чином, щоб допомогти узагальненню.
Тестування та результати
При тестуванні даних дослідники прийняли три метрики: Точність (ACC); Площа під кривою прийняття-відхилення (AUC); і F1-оцінка.
Дослідники протестували стандартно треновані версії двох детекторів deepfake проти фальшивих даних і виявили їх недостатніми:
‘Загалом, більшість реалістичних спотворень і обробки надзвичайно шкідливі для звичайно тренованих детекторів deepfake, заснованих на навчанні. Наприклад, метод Capsule-Forensics показує дуже високі оцінки AUC на непресованих тестових наборах FFpp і Celeb-DFv2 після тренування на відповідних наборах даних, але потім страждає від різкого спаду продуктивності на змінених даних з нашої оціночної структури. Аналогічні тенденції спостерігаються у детекторі XceptionNet.’
Натомість, продуктивність двох детекторів була помітно покращена завдяки тренуванню на трансформованих даних, причому кожен детектор тепер більш здатний виявляти невидимі обманливі засоби масової інформації.
‘Схема збільшення даних суттєво покращує стійкість двох детекторів, і при цьому вони зберігають високу продуктивність на оригінальних незмінених даних.’
* Збіг зерна у згенерованому обличчі є функцією переносу стилю під час процесу перетворення.
Перша публікація 29 березня 2022 року. Оновлено 8:33 вечора за східним часом, щоб уточнити використання зерна у Ffmpeg.












