Моделі та платформи ШІ
DIRFA перетворює аудіокліпи на реалістичні цифрові обличчя
У видатному стрибку вперед для штучного інтелекту та багатомедійного спілкування команда дослідників з Наньянського технологічного університету (NTU Singapore) представила інноваційну комп’ютерну програму під назвою DIRFA (різноманітні, але реалістичні анімації обличчя).
Ця технологія, заснована на штучному інтелекті, демонструє вражаючу здатність: перетворення простого аудіокліпу та статичної фотографії обличчя у реалістичні 3D-анімовані відео. Відео демонструють не тільки точну синхронізацію губ з аудіо, але також багату палітру виразів обличчя та природних рухів голови, розширюючи межі створення цифрових медіа.
Розробка DIRFA
Основна функціональність DIRFA полягає в її передовому алгоритмі, який безшовно поєднує аудіовхід з фотографічними зображеннями для генерації тривимірних відео. Аналізуючи мовлені закономірності та тони в аудіо, DIRFA інтелектуально передбачає та реплікує відповідні вирази обличчя та рухи голови. Це означає, що отримане відео зображує мовця з високим рівнем реалізму, його рухи обличчя ідеально синхронізовані з нюансами його виступів.
Розробка DIRFA позначає суттєве покращення над попередніми технологіями в цій сфері, які часто боролися з складностями різноманітних поз і виразів обличчя.
Традиційні методи зазвичай мали труднощі з точним відтворенням нюансів людських емоцій або були обмежені в своїй здатності обробляти різні орієнтації голови. DIRFA, однак, excels у захопленні широкого діапазону емоційних нюансів і може адаптуватися до різних орієнтацій голови, пропонуючи значно більш гнучкий і реалістичний результат.
Цей прорив не тільки крок вперед у технології штучного інтелекту, але також відкриває нові горизонти у тому, як ми можемо взаємодіяти з цифровими медіа, пропонуючи погляд на майбутнє, де цифрове спілкування набуває більш особистого та виразного характеру.
Тренування та технологія за DIRFA
Спроможність DIRFA реплікувати людські вирази обличчя та рухи голови з такою точністю є результатом тривалого процесу тренування. Команда з NTU Singapore тренувала програму на величезній базі даних – понад один мільйон аудіовізуальних кліпів з VoxCeleb2 Dataset.
Ця база даних охоплює різноманітний діапазон виразів обличчя, рухів голови та мовлених закономірностей від понад 6 000 осіб. Надавши DIRFA доступ до такої величезної та різноманітної колекції аудіовізуальних даних, програма навчилися розпізнавати та реплікувати тонкі нюанси, які характеризують людські вирази та мовлення.
Асоційований професор Лу Шіджан, відповідальний автор дослідження, та доктор Ву Ронлянь, перший автор, поділилися цінними ідеями щодо значення своєї роботи.
“Вплив нашого дослідження може бути глибоким і далекосяжним, оскільки він революціонізує сферу багатомедійного спілкування, дозволяючи створювати надзвичайно реалістичні відео людей, які говорять, поєднуючи техніки штучного інтелекту та машинного навчання”, – сказав проф. Лу. “Наша програма також будується на попередніх дослідженнях і представляє собою розвиток технології, оскільки відео, створені за допомогою нашої програми, повні точних рухів губ, яскравих виразів обличчя та природних рухів голови, використовуючи лише їх аудіозаписи та статичні зображення”.
Доктор Ву Ронлянь додав: “Мовлення демонструє безліч варіацій. Люди вимовляють одні й ті ж слова по-різному в різних контекстах, охоплюючи варіації тривалості, амплітуди, тону та багато іншого. Крім того, окрім лінгвістичного змісту, мовлення передає багату інформацію про емоційний стан та ідентифікаційні чинники мовця, такі як стать, вік, етнічна приналежність та навіть особистісні риси. Наш підхід представляє собою піонерську спробу покращення результатів з точки зору аудіо-репрезентаційного навчання штучного інтелекту та машинного навчання”.

Порівняння DIRFA з іншими підходами генерації аудіо-анімованих облич. (NTU Singapore)
Потенційні застосування
Одним з найбільш перспективних застосувань DIRFA є сфера охорони здоров’я, особливо у розробці складних віртуальних помічників та чат-ботів. З її можливістю створювати реалістичні та реактивні анімації обличчя, DIRFA може суттєво покращити досвід користувача на цифрових платформах охорони здоров’я, роблячи взаємодію більш особистою та привабливою. Ця технологія може бути вирішальною у наданні емоційного комфорту та персоналізованої допомоги через віртуальні засоби, важливий аспект, який часто відсутній у поточних цифрових рішеннях охорони здоров’я.
DIRFA також має великий потенціал у допомозі людям з порушеннями мови або виразів обличчя. Для тих, хто стикається з труднощами у вербальному спілкуванні або виразах обличчя, DIRFA може слугувати потужним інструментом, дозволяючи їм висловлювати свої думки та емоції через виразні аватари чи цифрові представлення. Це може покращити їхню здатність спілкуватися ефективно, звужуючи розрив між їхніми намірами та виразами. Надавши цифровий засіб вираження, DIRFA може відіграти важливу роль у розширенні можливостей цих осіб, пропонуючи їм новий шлях для взаємодії та вираження себе у цифровому світі.
Виклики та майбутні напрямки
Створення реалістичних виразів обличчя лише з аудіовхідних даних представляє складний виклик у сфері штучного інтелекту та багатомедійного спілкування. Поточний успіх DIRFA в цій сфері є суттєвим, проте складності людських виразів означають, що завжди є місце для вдосконалення. Кожна особа має унікальний мовний шаблон, і їх вирази обличчя можуть різко змінюватися навіть з одними й тими ж аудіовхідними даними. Захоплення цього різноманіття та тонкості залишається ключовим викликом для команди DIRFA.
Доктор Ву визнає певні обмеження в поточній ітерації DIRFA. Зокрема, інтерфейс програми та ступінь контролю, який вона пропонує над результатом виразів, потребують покращення. Наприклад, відсутність можливості регулювати конкретні вирази, такі як зміна похмурого обличчя на посмішку, є обмеженням, яке вони планують подолати. Подолання цих обмежень є важливим для розширення застосуваності DIRFA та забезпечення доступності для користувачів.
Оглядаючи майбутнє, команда NTU планує покращити DIRFA за допомогою більш різноманітної бази даних, включаючи ширший діапазон виразів обличчя та аудіокліпів. Це розширення очікується进一步 вдосконалити точність та реалізм анімацій обличчя, генерованих DIRFA, роблячи їх більш універсальними та адаптованими до різних контекстів та застосувань.
Вплив та потенціал DIRFA
DIRFA, з її інноваційним підходом до синтезу реалістичних анімацій обличчя з аудіо, готова революціонізувати сферу багатомедійного спілкування. Ця технологія розширює межі цифрової взаємодії, стираючи межу між цифровим та фізичним світами. Надавши можливість створювати точні, реалістичні цифрові представлення, DIRFA підвищує якість та автентичність цифрового спілкування.
Майбутнє технологій, таких як DIRFA, у покращенні цифрового спілкування та представлення є величезним і цікавим. По мірі того, як ці технології продовжують розвиватися, вони обіцяють пропонувати більш іммерсивні, персоналізовані та виразні способи взаємодії у цифровому просторі.
Ви можете знайти опубліковане дослідження тут.












