Погляд Anderson

Переструктуризація обличь у відео за допомогою машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідницьке співробітництво між Китаєм і Великою Британією розробило новий метод для зміни форми обличчя у відео. Цей метод дозволяє переконливо змінювати ширину і висоту обличчя, зберігаючи високу консистентність і відсутність артефактів.

З відео з YouTube, використаного як джерело матеріалу дослідниками, актриса Дженніфер Лоуренс виглядає як більш худа особистість (праворуч). Дивіться супровідне відео, вкладене в нижній частині статті, для багатьох інших прикладів у вищій роздільності. Джерело: https://www.youtube.com/watch?v=tA2BxvrKvjE

З відео з YouTube, використаного як джерело матеріалу дослідниками, актриса Дженніфер Лоуренс виглядає як більш худа особистість (праворуч). Дивіться супровідне відео, вкладене в нижній частині статті, для багатьох інших прикладів у вищій роздільності. Джерело: https://www.youtube.com/watch?v=tA2BxvrKvjE

Такий тип трансформації зазвичай можливий лише за допомогою традиційних методів CGI, які потребують повної реконструкції обличчя за допомогою детальних і дорогих процедур руху, ригінгу та текстурювання.

Натомість, використовувана в цьому методі CGI інтегрована в нейронну трубопровід як параметрична 3D інформація про обличчя, яка потім використовується як основа для робочого процесу машинного навчання.

Традиційні параметричні обличчя все частіше використовуються як керівництва для трансформаційних процесів, які використовують штучний інтелект замість CGI. Джерело: https://arxiv.org/pdf/2205.02538.pdf

Традиційні параметричні обличчя все частіше використовуються як керівництва для трансформаційних процесів, які використовують штучний інтелект замість CGI. Джерело: https://arxiv.org/pdf/2205.02538.pdf

Автори заявляють:

‘Наша мета – генерувати високоякісні відео з зміненим обличчям шляхом редагування загальної форми обличчя згідно з природними деформаціями обличчя в реальному світі. Це можна використовувати для застосунків, таких як генерація обличчя для краси, і перебільшення обличчя для візуальних ефектів.’

Хоча 2D-деформація і викривлення обличчя були доступні споживачам з моменту появи Photoshop (і призвели до появи дивних і часто неприйнятних субкультур навколо деформації обличчя і дисморфії тіла), це складно зробити у відео без використання CGI.

Розміри Марка Цукерберга розширені і звужені китайсько-британським методом.

Розміри Марка Цукерберга розширені і звужені новим китайсько-британським методом.

Зміна тіла зараз є сферою інтенсивного інтересу в секторі комп’ютерного бачення, головним чином через її потенціал у сфері моди електронної комерції, хоча зробити людину вищою або скелетно різноманітною зараз є помітним викликом.

Аналогічно, зміна форми голови у відеозаписі в послідовному і переконливому порядку була предметом попередньої роботи дослідників, хоча ця реалізація мала артефакти і інші обмеження. Нова пропозиція розширює можливості цієї попередньої роботи з статичних до відеових виходів.

Нова система була навчена на настільному комп’ютері з процесором AMD Ryzen 9 3950X і 32 ГБ оперативної пам’яті, і використовує алгоритм оптичного потоку з OpenCV для карт руху, згладжених за допомогою StructureFlow.framework; мережу визначення орієнтації обличчя (FAN) компонент для оцінки орієнтації, який також використовується в популярних пакетах deepfakes; і Ceres Solver для вирішення завдань оптимізації.

Крайній приклад зміни форми обличчя за допомогою нової системи.

Крайній приклад зміни форми обличчя за допомогою нової системи.

Стаття називається Параметрична зміна обличчя у відео, і походить від трьох дослідників університету Чжецзян і одного дослідника університету Бата.

Про обличчя

Під новою системою відео витягується в послідовність зображень, і спочатку оцінюється жорстка поза для кожного обличчя. Потім спільно оцінюється певна кількість наступних кадрів для побудови послідовних параметрів ідентичності протягом усієї послідовності зображень (тобто кадрів відео).

Архітектурний потік системи зміни обличчя.

Архітектурний потік системи зміни обличчя.

Після цього оцінюється вираз обличчя, що дає параметр зміни, який реалізується за допомогою лінійної регресії. Далі новий підписаний функції відстані (SDF) підхід побудови густої 2D карти ліній обличчя до і після зміни.

Нарешті, проводиться оптимізація зміни вмісту у вихідному відео.

Параметричні обличчя

Процес використовує 3D-модель змінного обличчя (3DMM), все частіше використовувану як допоміжний інструмент до нейронних і GAN-основаних систем синтезу обличчя, а також застосовувану для виявлення deepfakes.

Не з цієї статті, але приклад 3D-моделі змінного обличчя (3DMM) – параметричної прототипної моделі обличчя, використовуваної в новому проекті. Верхній лівий, застосування орієнтації на 3D-моделі обличчя. Верхній правий, 3D-модель вершин ізомапи. Нижній лівий показує застосування орієнтації; нижній середній, ізомапу витягнутого текстуру обличчя; і нижній правий, результат застосування і форми. Джерело: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Не з нової статті, але приклад 3D-моделі змінного обличчя (3DMM) – параметричної прототипної моделі обличчя, використовуваної в новому проекті. Верхній лівий, застосування орієнтації на 3D-моделі обличчя. Верхній правий, 3D-модель вершин ізомапи. Нижній лівий показує застосування орієнтації; нижній середній, ізомапу витягутого текстуру обличчя; і нижній правий, результат застосування і форми. Джерело: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Потік роботи нової системи повинен враховувати випадки окулювання, наприклад, коли суб’єкт відводить погляд. Це одна з найбільших проблем у програмному забезпеченні deepfakes, оскільки орієнтаційні точки FAN мають мало можливостей для урахування цих випадків і схильні до погіршення якості при відведенні обличчя або його окулюванні.

Нова система здатна уникнути цієї пастки, визначаючи контурну енергію, яка здатна відповідати межі між 3D-моделлю обличчя (3DMM) і 2D-моделлю обличчя (визначеною орієнтаційними точками FAN).

Оптимізація

Корисним застосуванням такої системи було б реалізація деформації в реальному часі, наприклад, у фільтрах відеочату. Поточна структура не дозволяє цього, а обчислювальні ресурси, необхідні для цього, зробили б “на живо” деформацію помітним викликом.

За даними статті, і припускаючи цільовий відеопотік з частотою 24 кадри в секунду, операції з кадрів у трубопроводі представляють затримку 16,344 секунди для кожної секунди відео, з додатковими одноразовими ударами для оцінки ідентичності і деформації 3D-моделі обличчя (321 мс і 160 мс, відповідно).

Отже, оптимізація є ключем до прогресу у зниженні затримки. Оскільки спільна оптимізація по всіх кадрах додала б серйозне навантаження на процес, а оптимізація типу init (припускаючи послідовну ідентичність мовця з першого кадру) могла б привести до аномалій, автори прийняли розріджену схему для розрахунку коефіцієнтів кадрів, вибраних на практичних інтервалах.

Спільна оптимізація потім проводиться на цьому підмножині кадрів, що призводить до більш лаконічного процесу реконструкції.

Зміна обличчя

Техніка зміни, використовувана в цьому проекті, є адаптацією роботи авторів 2020 року Глибокі обличчя (DSP).

Глибокі обличчя, подання 2020 року на ACM Multimedia. Стаття очолюється дослідниками з ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Джерело: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Глибокі обличчя, подання 2020 року на ACM Multimedia. Стаття очолюється дослідниками з ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Джерело: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Автори зазначають ‘Ми розширюємо цей метод з зміни однієї моноокулярної зображення до зміни всієї послідовності зображень.’

Тести

У статті зазначається, що не було порівнянного попереднього матеріалу для оцінки нового методу. Тому автори порівняли кадри зміненого відеовиходу з статичним виходом DSP.

Тестування нової системи проти статичних зображень з Глибоких обличь.

Тестування нової системи проти статичних зображень з Глибоких обличь.

Автори зазначають, що артефакти виникають з методу DSP, через його використання розрідженої карти – проблему, яку нова структура вирішує за допомогою густої карти. Крім того, відео, вироблене DSP, у статті стверджується, демонструє відсутність гладкості і візуальної узгодженості.

Автори заявляють:

‘Результати показують, що наш підхід може надійно виробляти узгоджене змінене відео з обличчями, тоді як метод, заснований на зображенні, легко може привести до помітних артефактів мерцання.’

Перегляньте супровідне відео нижче для більшої кількості прикладів:

 

Опубліковано вперше 9 травня 2022 року. Виправлено о 18:00 за київським часом, замінив слово “поле” на “функцію” для SDF.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai