Погляд Anderson
Виявлення глибоких підробок: латентні дифузійні моделі та GAN

Опінія
Останнім часом, спільнота дослідників, яка займається виявленням глибоких підробок, яка з кінця 2017 року була зайнята майже виключно аутоенкодерною основою, яка дебютувала в той час з великим успіхом (і дезапою), почала проявляти інтерес до менш застійних архітектур, включаючи латентні дифузійні моделі такі як DALL-E 2 і Stable Diffusion, а також вихідні дані Генеративних суперницьких мереж (GAN). Наприклад, у червні, Університет Каліфорнії в Берклі опублікував результати свого дослідження щодо розробки детектора для вихідних даних DALL-E 2.
Що здається причиною цього зростаючого інтересу, це раптовий еволюційний стрибок у можливостях і доступності латентних дифузійних моделей у 2022 році, з закритим і обмеженим випуском DALL-E 2 навесні, а потім у кінці літа – сенсаційним відкриттям Stable Diffusion компанією stability.ai.
GAN також були довго вивчені в цьому контексті, хоча і менш інтенсивно, оскільки дуже важко використовувати їх для переконливих і складних відео-реконструкцій людей; принаймні, порівняно з пакетами аутоенкодерів, такими як FaceSwap і DeepFaceLab та його живий стрімінг-кузен, DeepFaceLive.
Рухомі зображення
У будь-якому випадку, галванізуючий фактор здається перспективою наступного етапу розвитку відео-синтезу. Початок жовтня – і великий конференційний сезон 2022 року – був характеризований раптовим і несподіваним рішенням кількох давніх проблем відео-синтезу: як тільки Facebook опублікував зразки своєї платформи текст-відео, Google Research швидко затопив цю первинну славу, оголосивши про свою нову архітектуру Imagen-to-Video T2V, здатну виводити високороздільне відео (хоча тільки через 7-шарову мережу апскейлерів).
Блейд Раннер
Останні дві статті, які розглядають, відповідно, латентні дифузійні моделі та GAN-детектори глибоких підробок, це DE-FAKE: Виявлення і атрибуція підроблених зображень, згенерованих текст-ізображенням дифузійними моделями, спільна робота між CISPA Helmholtz Центром інформаційної безпеки та Salesforce; та BLADERUNNER: Швидкий контрзахід для синтетичних (AI-генерованих) StyleGAN-лиць, від Адама Доріана Вонга з лабораторії Лінкольна Массачусетського технологічного інституту.
DE-FAKE
Архітектура DE-FAKE спрямована не тільки на досягнення “універсального виявлення” зображень, згенерованих текст-ізображенням дифузійними моделями, але також на розробку методу визначення якої латентної дифузійної моделі було згенеровано зображення.
Перша публікація 14 жовтня 2022 року.












