Моделі та платформи ШІ
AniPortrait: Аудіо-керована синтеза фотореалістичної портретної анімації
За останні роки створення реалістичних та виразних портретних анімацій з статичних зображень та аудіо знайшло широке застосування, включаючи ігри, цифрові медіа, віртуальну реальність та багато іншого. Незважаючи на потенційне застосування, розробникам все ще складно створити.frameworkи, які можуть генерувати високоякісні анімації, що зберігають тимчасову послідовність та візуально привабливі. Основною причиною цієї складності є необхідність складної координації рухів губ, положення голови та виразів обличчя для створення візуально привабливого ефекту.
У цій статті ми будемо говорити про AniPortrait, новий.framework, розроблений для генерації високоякісних анімацій, керованих посиланням на портретне зображення та аудіо-зразок. Робота.frameworkу AniPortrait розділена на два етапи. Спочатку.framework AniPortrait витягує проміжні 3D-представлення з аудіо-зразків та проєктує їх у послідовність 2D-орієнтаційних ознак обличчя. Після цього.framework використовує потужну дифузійну модель, поєднану з модулем руху, для перетворення послідовності ознак обличчя у тимчасово послідовні та фотореалістичні анімації. Експериментальні результати демонструють перевагу та здатність.frameworkу AniPortrait генерувати високоякісні анімації з винятковою візуальною якістю, різноманітністю поз та природністю обличчя, забезпечуючи таким чином підвищений та збагачений перцептивний досвід. Крім того,.framework AniPortrait володіє помітним потенціалом щодо керованості та гнучкості та може бути застосований ефективно в галузях, включаючи відновлення обличчя, редагування руху обличчя та багато іншого. Ця стаття має на меті висвітлити.framework AniPortrait у глибині, та ми досліджуємо механізм, методологію, архітектуру.frameworkу разом з його порівнянням з найкращими.frameworkами.
AniPortrait: Фотореалістична портретна анімація
Створення реалістичних та виразних портретних анімацій було предметом уваги дослідників протягом тривалого часу через їхній неймовірний потенціал та застосування, що охоплюють цифрові медіа, віртуальну реальність, ігри та багато іншого. Незважаючи на роки досліджень та розробок, генерація високоякісних анімацій, що зберігають тимчасову послідовність та візуально привабливі, все ще становить суттєву складність. Основною перешкодою для розробників є необхідність складної координації між положенням голови, візуальними виразами та рухами губ для створення візуально привабливого ефекту. Існуючі методи не змогли подолати ці складності, головним чином тому, що більшість з них покладаються на обмежені можливості генераторів, такі як NeRF, декодери руху та GAN для створення візуального контенту. Ці мережі демонструють обмежені можливості узагальнення та є нестабільними при генерації високоякісного контенту. Однак недавнє виникнення дифузійних моделей полегшило генерацію високоякісних зображень, а деякі.frameworkи, побудовані на основі дифузійних моделей разом з тимчасовими модулями, полегшили створення привабливих відео, дозволяючи дифузійним моделям виділитися.
Відштовхуючись від досягнень дифузійних моделей,.framework AniPortrait має на меті генерувати високоякісні анімовані портрети, використовуючи посиланням на зображення та аудіо-зразок. Робота.frameworkу AniPortrait розділена на два етапи. На першому етапі.framework використовує моделі, засновані на трансформерах, для витягування послідовності 3D-орієнтаційної сітки обличчя та положення голови з аудіо-входу, та проєктує ці елементи у послідовність 2D-орієнтаційних ознак обличчя. Перший етап дозволяє.frameworkу AniPortrait захопити рух губ та тонкі вирази з аудіо, а також рух голови, синхронізований з ритмом аудіо-зразка. На другому етапі.framework використовує потужну дифузійну модель, поєднану з модулем руху, для перетворення послідовності ознак обличчя у тимчасово послідовні та фотореалістичні анімації. Для цього.framework використовує мережеву архітектуру від існуючої моделі AnimateAnyone, яка використовує Stable Diffusion 1.5, потужну дифузійну модель для генерації життєвих та рідинних анімацій на основі посилання на зображення та послідовності руху тіла. Що варто відзначити, так це те, що.framework AniPortrait не використовує модуль керування позою у цій мережі, а переробляє його, що дозволяє.frameworkу не тільки зберегти легку конструкцію, але й демонструє підвищену точність при генерації руху губ.
Експериментальні результати демонструють перевагу.frameworkу AniPortrait у створенні анімацій з вражаючою природністю обличчя, винятковою візуальною якістю та різноманітністю поз. Використовуючи 3D-представлення обличчя як проміжні ознаки,.framework AniPortrait здобуває гнучкість для зміни цих представлень за потребами. Ця гнучкість суттєво підвищує застосовність.frameworkу AniPortrait у різних галузях, включаючи відновлення обличчя та редагування руху обличчя.
AniPortrait: Робота та методологія
Предложений.framework AniPortrait складається з двох модулів, а саме Lmk2Video та Audio2Lmk. Модуль Audio2Lmk намагається витягувати послідовність ознак, які захоплюють тонкі рухи губ та вирази обличчя з аудіо-входу, тоді як модуль Lmk2Video використовує цю послідовність ознак для генерації високоякісних портретних відео з тимчасовою стабільністю. Наступна схема представляє огляд роботи.frameworkу AniPortrait. Як можна побачити,.framework спочатку витягує 3D-орієнтаційну сітку обличчя та положення голови з аудіо, та проєктує ці елементи у 2D-орієнтаційні ознаки. На другому етапі.framework використовує дифузійну модель для перетворення 2D-орієнтаційних ознак у портретне відео з двома етапами, які тренуються одночасно у мережі.

Audio2Lmk
Для заданої послідовності фрагментів мови, основною метою.frameworkу AniPortrait є передбачення відповідної послідовності 3D-орієнтаційної сітки обличчя з векторними представленнями трансляції та обертання..framework використовує попередньо тренований метод wav2vec для витягування аудіо-ознак, та модель демонструє високу ступінь узагальнення,能够 визначати інтонацію та вимову з аудіо точно, що грає важливу роль у генерації реалістичних анімацій обличчя. Використовуючи отримані надійні аудіо-ознаки,.framework може ефективно використовувати просту архітектуру, що складається з двох повністю зв’язаних шарів, для перетворення цих ознак у 3D-орієнтаційну сітку обличчя..framework спостерігає, що цей простий дизайн, реалізований моделлю, не тільки підвищує ефективність процесу висновку, але й забезпечує точність. Коли аудіо перетворюється у позу,.framework використовує ту ж саму мережу wav2vec як основу, хоча модель не розділяє ваги з модулем аудіо-у-сітку. Це відбувається через те, що поза пов’язана більше з тоном та ритмом, присутніми в аудіо, які мають інший акцент у порівнянні з завданням аудіо-у-сітку. Для врахування впливу попередніх станів.framework використовує декодер трансформера для декодування послідовності поз. Під час цього процесу.framework інтегрує аудіо-ознаки у декодер за допомогою механізмів взаємної уваги, та для обох модулів.framework тренує їх за допомогою втрат L1. Як тільки модель одержує позу та сітку,.framework використовує перспективну проєкцію для перетворення цих послідовностей у 2D-послідовність ознак обличчя, які потім використовуються як вхідні сигнали для наступного етапу.
Lmk2Video
Для заданого посилання на портретне зображення та послідовності ознак обличчя, пропонований модуль Lmk2Video створює тимчасово послідовну портретну анімацію, яка узгоджується з рухом ознак та зберігає вигляд, що узгоджується з посиланням на зображення, та, нарешті,.framework представляє портретну анімацію як послідовність портретних кадрів. Дизайн мережевої структури модуля Lmk2Video шукає натхнення у вже існуючому.frameworkу AnimateAnyone.framework використовує модель Stable Diffusion 1.5, надзвичайно потужну дифузійну модель, як основу, та інтегрує тимчасовий модуль руху, який ефективно перетворює багатокадрові шумові входи у послідовність відеокадрів. Одночасно компонент мережі ReferencenNet дублює структуру моделі Stable Diffusion 1.5 та використовує її для витягування інформації про вигляд з посилання на зображення, та інтегрує її у основу. Стратегічний дизайн забезпечує, що ідентифікатор обличчя залишається постійним протягом всього вихідного відео. На відміну від.frameworkу AnimateAnyone,.framework AniPortrait підвищує складність дизайну модуля PoseGuider.framework виявляє, що оригінальний дизайн.frameworkу AnimateAnyone складається лише з декількох свортових шарів після чого ознаки обличчя зливаються з латентними на входному шарі основи..framework AniPortrait виявляє, що цей дизайн не достатньо ефективний для захоплення тонких рухів губ, та для вирішення цієї проблеми.framework приймає багатомасштабну стратегію архітектури ConvNet та інтегрує ознаки обличчя відповідних масштабів у різні блоки основи. Крім того,.framework вводить додаткове покращення, включно з ознаками посилання на зображення як додатковим входом. Модуль взаємної уваги компонента PoseGuider забезпечує взаємодію між цільовими ознаками кожного кадру та ознаками посилання. Цей процес надає мережі додаткові підказки для розуміння кореляції між виглядом та ознаками обличчя, тим самим допомагаючи у генерації портретних анімацій з більш точним рухом.
AniPortrait: Реалізація та результат
Для етапу Audio2Lmk.framework AniPortrait приймає компонент wav2vec2.0 як основу та використовує архітектуру MediaPipe для витягування 3D-сіток та 6D-поз для анотацій. Модель джерел даних для компонента Audio2Mesh джерелується з внутрішньої бази даних, яка складається з майже 60 хвилин високоякісних аудіо-даних, джерелених від одного мовця. Для забезпечення стабільності 3D-сітки, витягнутої компонентом MediaPipe, акторові наказано дивитися у камеру та зберігати стабільне положення голови протягом всього процесу запису. Для модуля Lmk2Video.framework AniPortrait реалізує двоступеневий підхід тренування. На першому етапі.framework фокусується на тренуванні компонентів ReferenceNet та PoseGuider, 2D-компонента основи, та залишає модуль руху. На другому етапі.framework заморожує всі інші компоненти та зосереджується на тренуванні модуля руху. Для цього етапу.framework використовує дві великі високоякісні бази даних відео обличчя для тренування моделі, та обробляє всі дані за допомогою компонента MediaPipe для витягування 2D-орієнтаційних ознак обличчя. Крім того, для підвищення чутливості мережі до руху губ.framework AniPortrait відрізняє верхню та нижню губи різними кольорами під час рендерингу зображення пози з 2D-орієнтаційних ознак.
Як демонструється на наступному зображенні,.framework AniPortrait генерує серію анімацій, які демонструють вищу якість та реалізм.

Потім.framework використовує проміжне 3D-представлення, яке можна редагувати для маніпулювання виходом за потребами. Наприклад, користувачі можуть витягувати ознаки з певного джерела та змінювати ідентифікатор, тим самим дозволяючи.frameworkу AniPortrait створювати ефект відновлення обличчя.
Фінальні думки
У цій статті ми говорили про.framework AniPortrait, новий.framework, розроблений для генерації високоякісних анімацій, керованих посиланням на портретне зображення та аудіо-зразком. Введенням посилання на зображення та аудіо-кліп.framework AniPortrait здатний генерувати портретне відео, яке демонструє природний рух голови та гладкий рух губ. Використовуючи потужні можливості узагальнення дифузійної моделі,.framework AniPortrait генерує анімації, які демонструють вражаючу реалістичну якість зображення та життєві рухи. Робота.frameworkу AniPortrait розділена на два етапи. Спочатку.framework витягує проміжні 3D-представлення з аудіо-зразків та проєктує їх у послідовність 2D-орієнтаційних ознак обличчя. Після цього.framework використовує потужну дифузійну модель, поєднану з модулем руху, для перетворення послідовності ознак обличчя у тимчасово послідовні та фотореалістичні анімації. Експериментальні результати демонструють перевагу та здатність.frameworkу AniPortrait генерувати високоякісні анімації з винятковою візуальною якістю, різноманітністю поз та природністю обличчя, забезпечуючи таким чином підвищений та збагачений перцептивний досвід. Крім того,.framework AniPortrait володіє помітним потенціалом щодо керованості та гнучкості та може бути застосований ефективно в галузях, включаючи відновлення обличчя, редагування руху обличчя та багато іншого.












