Погляд Anderson
Google’s LipSync3D пропонує покращену синхронізацію руху губ “Deepfaked”

Співпраця між дослідниками Google AI та Індійським технологічним інститутом Кхарагпура пропонує нову основу для синтезу рухомих голів з аудіоконтенту. Проект спрямований на створення оптимальних і розумно ресурсних способів створення контенту відео з аудіо, для синхронізації руху губ з дубльованим або машинним перекладом аудіо, а також для використання в аватарах, інтерактивних додатках та інших реальних середовищах.

Джерело: https://www.youtube.com/watch?v=L1StbX9OznY
Моделі машинного навчання, які були навчені в процесі – звані LipSync3D – потребують лише однієї відео з цільової ідентичності обличчя як вхідних даних. Пipeline підготовки даних розділяє витягування геометрії обличчя від оцінки освітлення та інших аспектів вхідного відео, що дозволяє більш економічно та зосереджено навчати.

Двостадійний робочий процес LipSync3D. Вище, генерація динамічно текстурированого 3D-обличчя з ‘цільового’ аудіо; нижче, вставка згенерованої сітки в цільове відео.
Фактично, найпомітнішим внеском LipSync3D у сфері досліджень цієї області може бути його алгоритм нормалізації освітлення, який від’єднує навчання та висновок освітлення.

Від’єднання даних освітлення від загальної геометрії допомагає LipSync3D генерувати більш реалістичний рух губ під складними умовами. Інші підходи останніх років обмежувалися ‘фіксованими’ умовами освітлення, які не демонструють їх обмежену здатність в цьому відношенні.
Під час попередньої обробки вхідних даних кадрів система повинна ідентифікувати та видалити спекулярні точки, оскільки вони є специфічними для умов освітлення, під яких було знято відео, та інакше будуть заважати процесу перезапису освітлення.

LipSync3D, як його назва говорить, не здійснює простий аналіз пікселів на обличчях, які він оцінює, а активно використовує ідентифіковані орієнтаційні точки обличчя для генерації рухливих CGI-ситок, разом з ‘розгорнутими’ текстурами, які обгортаються навколо них у традиційному CGI-пipeline.

Нормалізація положення в LipSync3D. Зліва – вхідні кадри та виявлені особливості; посередині – нормалізовані вершини згенерованої сітки; справа – відповідна текстурна атлас, яка забезпечує основу для прогнозування текстури. Джерело: https://arxiv.org/pdf/2106.04185.pdf
Окрім нового методу перезапису освітлення, дослідники стверджують, що LipSync3D пропонує три основні інновації порівняно з попередньою роботою: розділення геометрії, освітлення, положення та текстури на окремі потоки даних у нормалізованому просторі; легко треновану автoregresивну модель прогнозування текстури, яка генерує тимчасово узгоджену відеосинтез; та підвищену реалістичність, як оцінено за допомогою оцінок людини та об’єктивних метрик.

Розділення різних аспектів відеообличчя дозволяє більший контроль у відеосинтезі.
LipSync3D може отримувати відповідну геометрію руху губ безпосередньо з аудіо шляхом аналізу фонем та інших аспектів мови, та перекладання їх у відомі відповідні м’язові пози навколо рота.

Цей процес використовує спільну прогнозувальну pipeline, де витягнута геометрія та текстура мають окремі кодувальники у складі автокодувальника, але спільно використовують аудіокодувальник із мовою, яка має бути накладена на модель:
Синтез руху губ LipSync3D також призначений для генерації стилізованих CGI-аватарів, які фактично складаються з тих самих сіток та текстурної інформації, як і реальні відео:

Стилізований 3D-аватар має рух губ, керований в реальному часі джерельним відео. У такому сценарії найкращі результати будуть досягнуті шляхом персоналізованого попереднього тренування.
Дослідники також передбачають використання аватарів з稍 більш реалістичним відчуттям:
![]()
Зразкові часи навчання для відео становлять від 3 до 5 годин для відео тривалістю 2-5 хвилин, у pipeline, який використовує TensorFlow, Python та C++ на GeForce GTX 1080. Сесії навчання використовували розмір пакету 128 кадрів за 500-1000 епох, де кожна епоха представляє повну оцінку відео.
До динамічної синхронізації руху губ
Область синхронізації руху губ для адаптації до нового аудіотреку отримала значну увагу в дослідженнях комп’ютерного зору за останні кілька років (див. нижче), не в останню чергу через те, що це побічний продукт суперечливої технології deepfake.
У 2017 році Університет Вашингтону представив дослідження, здатне вивчити синхронізацію губ з аудіо, використовуючи його для зміни руху губ колишнього президента Обами. У 2018 році Інститут інформатики імені Макса Планка очолив інше дослідницьке підприємство для забезпечення передачі ідентичності>ідентичності відео, з синхронізацією губ як побічним продуктом процесу; а в травні 2021 року стартап FlawlessAI представив свою пропрієтарну технологію синхронізації губ TrueSync, широко сприйняту пресою як засіб поліпшення технологій дублювання для великих кінорелізів мовами.
І, звичайно, триває розвиток відкритих джерел deepfake, який забезпечує ще одну гілку активних досліджень у сфері синтезу образів обличчя.











