Погляд Anderson

Розрізнення – це наступна революція Deepfake

mm
Додайте Unite.AI до бажаних джерел у Google

CGI-дані збільшення використовуються в новому проекті для отримання більшої контролю над зображеннями Deepfake. Хоча ви все ще не можете ефективно використовувати CGI-голови для заповнення відсутніх пробілів у наборах даних Deepfake-лиць, нова хвиля досліджень щодо розрізнення ідентичності від контексту означає, що скоро вам може не доведеться.

Створити деякі з найбільш успішних вірусних відео Deepfake за останні кілька років обирають джерельні відео дуже обережно, уникając тривалих профільних знімків (тобто таких, що популярні в поліцейських процедурах арешту), гострих кутів і незвичайних або перебільшених виразів. Все частіше демонстраційні відео, створені вірусними Deepfake, є відредагованими компіляціями, які обирають “найлегші” кути і вирази для Deepfake.

Насправді, найбільш підходящим цільовим відео для вставки Deepfake-знаменитості є те, де оригінальна особа (її ідентичність буде видалена Deepfake) дивиться прямо в камеру, з мінімальним діапазоном виразів.

Більшість популярних Deepfake за останні роки показували суб'єктів, що дивляться прямо в камеру, і або мали тільки популярні вирази (наприклад, посмішку), які можна легко витягнути з виходів папараці на червоній доріжці, або (як у випадку з фейковим Сільвестром Сталлоне у ролі Термінатора 2019 року, зображеного зліва), ідеально без виразу зовсім, оскільки нейтральні вирази дуже поширені, що робить їх легкими для включення до моделей Deepfake.

Більшість популярних Deepfake за останні роки показували суб’єктів, що дивляться прямо в камеру, і або мали тільки популярні вирази (наприклад, посмішку), які можна легко витягнути з виходів папараці на червоній доріжці, або (як у випадку з фейковим Сільвестром Сталлоне у ролі Термінатора 2019 року, зображеного зліва), ідеально без виразу зовсім, оскільки нейтральні вирази дуже поширені, що робить їх легкими для включення до моделей Deepfake.

Через те, що технології Deepfake, такі як DeepFaceLab і FaceSwap, виконують ці прості заміни дуже добре, ми достатньо осліплені тим, що вони досягають, щоб не помітити, чого вони не можуть зробити, і – часто – навіть не намагаються:

Знімки з відомого відео Deepfake, де Арнольд Шварценеггер перетворюється на Сільвестра Сталлоне - якщо кути не надто складні. Профільні знімки залишаються тривалим проблемом у поточних підходах Deepfake, частково через те, що відкритий软件, використовуваний для визначення поз обличчя в рамках Deepfake, не оптимізований для бічних видів, але головним чином через нестачу відповідного джерельного матеріалу в одному або обох необхідних наборах даних. Джерело: https://www.youtube.com/watch?v=AQvCmQFScMA

Знімки з відомого відео Deepfake, де Арнольд Шварценеггер перетворюється на Сільвестра Сталлоне – якщо кути не надто складні. Профільні знімки залишаються тривалим проблемом у поточних підходах Deepfake, частково через те, що відкритий软件, використовуваний для визначення поз обличчя в рамках Deepfake, не оптимізований для бічних видів, але головним чином через нестачу відповідного джерельного матеріалу в одному або обох необхідних наборах даних. Джерело: https://www.youtube.com/watch?v=AQvCmQFScMA

Нові дослідження з Ізраїлю пропонують новий метод використання синтетичних даних, таких як CGI-голови, для приведення Deepfake в 2020-ті роки, фактично розрізняючи особистість (тобто основні характеристики обличчя “Тома Круза” з усіх сторін) від контексту (тобто дивитися вгору, дивитися вбік, хмуритися, хмуритися в темряві, зморщувати брови, закрити очі, тощо).

Нова система дискретно розрізняє позу і контекст (тобто мигання ока) від кодування ідентичності особи, використовуючи несуміжні синтетичні дані обличчя (зображено зліва). У верхньому ряду ми бачимо

Нова система дискретно розрізняє позу і контекст (тобто мигання ока) від кодування ідентичності особи, використовуючи несуміжні синтетичні дані обличчя (зображено зліва). У верхньому ряду ми бачимо “мігання” перенесене на ідентичність Барака Обами, спровоковане вивченим нелінійним шляхом латентного простору ГАН, представленого CGI-образом зліва. У ряду нижче ми бачимо перенесену куточку рота на обличчя колишнього президента. Праворуч внизу ми бачимо обидві характеристики, застосованої одночасно. Джерело: https://arxiv.org/pdf/2111.08419.pdf

Це не просто Deepfake-головне ляльководство, техніка, більш підходящая для аватарів і часткового синхронного руху губ, і яка має обмежений потенціал для повноцінних трансформацій відео Deepfake.

Натомість це представляє шлях вперед для фундаментального розрізнення інструментальності (наприклад, ‘змінити кут голови’, ‘створити хмурість’) від ідентичності, пропонуючи шлях до високорівневої, а не “похідної” синтезу зображень на основі Deepfake.

Нова робота називається Delta-GAN-Encoder: Кодування семантичних змін для явної редакції зображень, використовуючи кілька синтетичних зразків, і походить від дослідників з Technion – Ізраїльського технологічного інституту.

Що стримує сучасну технологію Deepfake?

Deepfake зараз створюються шляхом навчання моделі машинного навчання типу кодувач/декодувач на двох папках зображень обличчя – особи, яку ви хочете “помалювати” (у попередньому прикладі, це Арні), і особи, яку ви хочете накласти на відео (Слай).

Приклади різноманітних поз і освітлення в двох різних наборах обличчя. Відзначте характерний вираз наприкінці третього ряду в колонці А, який малоймовірно матиме близький аналог в іншому наборі даних.

Приклади різноманітних поз і освітлення в двох різних наборах обличчя. Відзначте характерний вираз наприкінці третього ряду в колонці А, який малоймовірно матиме близький аналог в іншому наборі даних.

Система кодувач/декодувач потім порівнює кожне окреме зображення в кожній папці з іншими, підтримуючи, покращуючи і повторюючи цю операцію протягом сотень тисяч ітерацій (часто протягом тижня), поки не зрозуміє основні характеристики обох ідентичностей досить добре, щоб поміняти їх на свій розсуд.

Для кожної з двох осіб, які беруть участь у процесі заміни, те, що дізнається про ідентичність архітектура Deepfake, запутане з контекстом. Вона не може вивчити і застосовувати принципи щодо загальної пози “раз і назавжди”, а повинна мати багато прикладів у навчальному наборі даних для кожної ідентичності, яка буде залучена до заміни обличчя.

Отже, якщо ви хочете поміняти дві ідентичності, які роблять щось більш незвичайне, ніж просто посміхаються або дивляться прямо в камеру, вам потрібно буде мати багато екземплярів цієї конкретної пози/ідентичності в обох наборах даних:

Через те, що характеристики обличчя і пози зараз запутані, потрібна широка парність виразів, поз обличчя і (в меншій мірі) освітлення в двох наборах даних обличчя для навчання ефективної моделі Deepfake на системах типу DeepFaceLab. Чим менше певна конфігурація (наприклад,

Через те, що характеристики обличчя і пози зараз запутані, потрібна широка парність виразів, поз обличчя і (в меншій мірі) освітлення в двох наборах даних обличчя для навчання ефективної моделі Deepfake на системах типу DeepFaceLab. Чим менше певна конфігурація (наприклад, “бічний вигляд/посмішка/сонячне освітлення”) представлена в обох наборах даних, тим менше точно вона буде відтворена в відео Deepfake, якщо потрібно.

Якщо набір А містить незвичайну позу, але набір Б її не містить, ви майже без шансів; незалежно від того, як довго ви тренуєте модель, вона ніколи не навчиться добре відтворювати цю позу між ідентичностями, оскільки вона мала тільки половину необхідної інформації під час навчання.

Чому дані рідкі?

Якщо ви не часто арештовуєтеся, у вас, ймовірно, немає багатьох профільних знімків себе. Будь-які, які з’явилися, ви, ймовірно, викинули. Поскольку агентства з фотографій також роблять так само, профільні знімки обличчя рідкісні.

Deepfakers часто включають кілька копій обмежених профільних даних, які вони мають для ідентичності в наборі даних, просто щоб ця поза отримала хоч якусь увагу і час під час навчання, а не була відкинута як відхилення.

Але існує багато більше можливих типів профільних знімків обличчя, ніж можуть бути доступні для включення до набору даних – посмішка, хмурість, крик, плакання, темне освітлення, презирство, нудьга, радість, флеш-освітлення, дивитися вгору, дивитися вниз, відкриті очі, закриті очі… і так далі. Будь-яка з цих поз, у різних комбінаціях, може бути потрібна у цільовому відео Deepfake.

Синтетична заміна

З початку Deepfake deepfakers експериментували з використанням CGI-образів, голів, створених у 3D-додатках, таких як Cinema4D і Maya, для отримання цих “відсутніх” поз.

Ніяких AI-не потрібно; актриса відтворена в традиційній CGI-програмі Cinema 4D, використовуючи сітки і текстури - технологія, яка сягає 1960-х років, хоча й набула широкого використання лише з 1990-х років. Теоретично, ця модель обличчя могла б бути використана для генерації джерельних даних Deepfake для незвичайних поз, стилів освітлення і виразів обличчя. На практиці це було мало або зовсім не корисно для Deepfake, оскільки

Ніяких AI-не потрібно; актриса відтворена в традиційній CGI-програмі Cinema 4D, використовуючи сітки і текстури – технологія, яка сягає 1960-х років, хоча й набула широкого використання лише з 1990-х років. Теоретично, ця модель обличчя могла б бути використана для генерації джерельних даних Deepfake для незвичайних поз, стилів освітлення і виразів обличчя. На практиці це було мало або зовсім не корисно для Deepfake, оскільки “фальшивість” рендерингу тенденцію до просочування в заміняє відео. Джерело: зображення автора статті на https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Цей метод зазвичай відкидається новими практиками Deepfake, оскільки хоча він може надати пози і вирази, які інакше недоступні, синтетичний вигляд CGI-обличь通常 просочується до заміни через запутання ідентичності і контекстної/семантичної інформації.

Це може привести до раптового спалаху “долини незручності” облич у відео Deepfake, оскільки алгоритм починає використовувати єдині дані, які у нього є для незвичайної пози або виразу – явно фальшиві обличчя.

CGI-обличчя як відокремлені концептуальні орієнтири

Натомість новий метод Delta-GAN Encoder (DGE) від ізраїльських дослідників більш ефективний, оскільки інформація про позу і контекст з CGI-образів повністю відокремлена від інформації про “ідентичність” цілі.

Ми можемо побачити цей принцип у дії на зображенні нижче, де різні орієнтації голови були отримані за допомогою CGI-образів як орієнтирів. Поскольку характеристики ідентичності не пов’язані з контекстними характеристиками, немає жодного просочування ні фальшивого вигляду синтетичних CGI-обличь, ні ідентичності, зображеної на них:

З новим методом вам не потрібно шукати три окремі джерельні зображення для виконання Deepfake з різних кутів - ви можете просто повернути CGI-голову, чий високорівневий абстрактний вигляд накладається на ідентичність без витоку жодної інформації про ідентичність.

З новим методом вам не потрібно шукати три окремі джерельні зображення для виконання Deepfake з різних кутів – ви можете просто повернути CGI-голову, чий високорівневий абстрактний вигляд накладається на ідентичність без витоку жодної інформації про ідентичність.

Delta-GAN-Encoder. Верхня ліва група: кут джерельного зображення можна змінити за секунду для отримання нового джерельного зображення, яке відображається у виводі; верхня права група: освітлення також відокремлено від ідентичності, що дозволяє накладення стилів освітлення; нижня ліва група: змінено кілька деталей обличчя для створення

Delta-GAN-Encoder. Верхня ліва група: кут джерельного зображення можна змінити за секунду для отримання нового джерельного зображення, яке відображається у виводі; верхня права група: освітлення також відокремлено від ідентичності, що дозволяє накладення стилів освітлення; нижня ліва група: змінено кілька деталей обличчя для створення “сумного” виразу; нижня права група: змінено одну окрему деталь виразу обличчя, так що очі щуряться.

Це розрізнення ідентичності і контексту досягається на етапі навчання. Поток нових архітектур Deepfake шукає латентний вектор у попередньо навченій генеративній суперницькій мережі (GAN), який відповідає зображенню, яке потрібно перетворити – методологія Sim2Real, що будується на проєкті 2018 року від дослідницької секції IBM.

Дослідники відзначають:

‘З кількома зразками, які відрізняються певною ознакою, можна вивчити роз’єднану поведінку попередньо запутаної генеративної моделі. Не потрібно точних реальних зразків для досягнення цієї мети, що не завжди можливо.

‘Використовуючи нереалістичні дані зразків, можна досягти тієї ж мети завдяки використанню семантики закодованих латентних векторів. Зміна існуючих даних зразків можна виконати без явного дослідження поведінки латентного простору.’

Дослідники припускають, що основні принципи роз’єднання, досліджені в цьому проєкті, можуть бути перенесені до інших областей, таких як симуляції внутрішньої архітектури, і що метод Sim2Real, прийнятий для Delta-GAN-Encoder, може в кінцевому підсумі дозволити інструментальність Deepfake на основі простих нарисів, а не CGI-вхідних даних.

Можна сказати, що ступінь, у якій нова ізраїльська система може або не може синтезувати відео Deepfake, значно менший, ніж прогрес, досягнутий у роз’єднанні контексту від ідентичності, і отримання більшої контролю над латентним простором GAN.

Роз’єднання – це активна область дослідження у синтезі зображень; у січні 2021 року дослідження, очолюване Amazon, демонструвало подібний контроль пози і роз’єднання, а у 2018 році робота від Інститутів передових технологій Шеньчженя при Китайській академії наук зробила прогрес у генерації довільних точок зору в GAN.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai