Взгляд Anderson

Обнаружители глубоких фейков преследуют новые горизонты: латентные диффузионные модели и GAN

mm
Добавьте Unite.AI в избранные источники в Google

Мнение  

В последнее время, сообщество исследователей, занимающихся обнаружением глубоких фейков, которое с конца 2017 года было занято几乎 исключительно автоэнкодерной основой, представленной в то время и вызвавшей широкий общественный интерес (и недоумение), начало проявлять судебный интерес к менее застойным архитектурам, включая латентные диффузионные модели, такие как DALL-E 2 и Stable Diffusion, а также выходные данные Генеративных Противостоящих сетей (GAN). Например, в июне Университет Калифорнии в Беркли опубликовал результаты своего исследования по разработке детектора для выходных данных доминирующей на тот момент DALL-E 2.

Что, кажется, вызывает этот растущий интерес, так это внезапный эволюционный скачок в возможностях и доступности латентных диффузионных моделей в 2022 году, с закрытой и ограниченной публикацией DALL-E 2 весной, за которой последовала в конце лета сенсационная открытая публикация Stable Diffusion компанией stability.ai.

GAN также были долго изучены в этом контексте, хотя и менее интенсивно, поскольку очень сложно использовать их для убедительных и сложных видео-реконструкций людей; по крайней мере, по сравнению с уже устоявшимися пакетами автоэнкодеров, такими как FaceSwap и DeepFaceLab – и последний из них имеет живой потоковый аналог, DeepFaceLive….

Изображения в движении

В любом случае, galvanizing фактором, кажется, является перспектива последующего спринта разработки видео синтеза. Начало октября – и основной конференционный сезон 2022 года – было характеризовано внезапным и неожиданным решением различных давних проблем видео синтеза: едва Facebook опубликовал образцы своей платформы текст-в-видео, Google Research быстро затмил эту первоначальную известность, объявив о своей новой архитектуре Imagen-to-Video T2V, способной выдавать высококачественные видео (хотя и только через 7-слойную сеть апскейлеров)….

Бегущий по лезвию

Последние две статьи, посвященные, соответственно, латентным диффузионным и GAN-основанным методам обнаружения глубоких фейков, это DE-FAKE: Обнаружение и атрибуция фейковых изображений, сгенерированных текст-изображение диффузионными моделями, совместная работа между CISPA Helmholtz Center for Information Security и Salesforce; и BLADERUNNER: Быстрый контрмер для синтетических (AI-генерированных) лиц StyleGAN, от Адама Дориана Вонга из лаборатории Линкольна Массачусетского технологического института….

DE-FAKE

Архитектура DE-FAKE направлена не только на достижение “универсального обнаружения” для изображений, сгенерированных текст-изображение диффузионными моделями, но и на предоставление метода для определения какой латентной диффузионной (LD) модели было сгенерировано изображение….

Учитывая сенсационные события последних трех месяцев, любая корпоративная спячка со стороны OpenAI и других конкурирующих игроков в области синтеза изображений, скорее всего, была ликвидирована, что означает, что мы можем ожидать аналогичный быстрый темп прогресса и в закрытом пространстве синтеза изображений. Первая публикация 14 октября 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai