Моделі та платформи ШІ

OmniHuman-1: AI від ByteDance, яка перетворює одне фото у рухому, розмовлячу людину

mm
Додайте Unite.AI до бажаних джерел у Google

П уявіть, що ви берете одне фото людини і вже через кілька секунд бачите, як вона говорить, жестикулює і навіть виконує дії, не записуючи жодного відео. Це саме те, що може зробити OmniHuman-1 від ByteDance. Ця недавно популярна модель штучного інтелекту наділяє нерухомі зображення життям, генеруючи дуже реалістичні відео, повні синхронізованих рухів губ, жестів всього тіла та виразних рухів обличчя, усі керуються аудіокліпом.

На відміну від традиційних технологій deepfake, які в основному фокусуються на заміні облич у відео, OmniHuman-1 анімує всю людську фігуру, від голови до ніг. Чи то політик, який виголошує промову, чи історична постать, оживлена, чи штучно створений аватар, який виконує пісню, ця модель змушує нас глибоко подумати про створення відео. І разом з цією інновацією виникає ряд наслідків – як цікавих, так і турботних.

Що робить OmniHuman-1 видатним?

OmniHuman-1 дійсно є гігантським кроком вперед у реалізмі та функціональності, саме тому він став вірусним.

Ось лише кілька причин:

  • Більше, ніж просто розмовлячі голови: Більшість технологій deepfake та штучно створених відео були обмежені анімацією обличчя, часто створюючи негнучкі або нереальні рухи. OmniHuman-1 анімує все тіло, захоплюючи природні жести, пози та навіть взаємодію з об’єктами.
  • Неймовірна синхронізація губ та нюансів емоцій: Він не просто робить рот, який рухається випадково; штучний інтелект забезпечує, щоб рухи губ, вирази обличчя та мову тіла відповідали входному аудіо, роблячи результат надзвичайно реалістичним.
  • Адаптується до різних стилів зображень: Чи то високоякісний портрет, чи низькоякісне знімок, чи навіть стилізована ілюстрація, OmniHuman-1 інтелектуально адаптується, створюючи гладкий, переконливий рух незалежно від якості входу.

Такий рівень точності можливий завдяки масивній базі даних людських відеозаписів від ByteDance, яка нараховує 18 700 годин, а також завдяки її передовому дифузійному трансформеру, який вивчає складні рухи людини. Результатом є штучно створені відео, які майже не відрізняються від справжніх кадрів. Це найкраще, що я бачив досі.

Технологія за цим (у простих словах)

Подивившись на офіційну статтю, OmniHuman-1 є дифузійним трансформером, передовою штучною моделлю, яка генерує рух, передбачаючи та уточнюючи рухові моделі кадр за кадром. Цей підхід забезпечує гладкі переходи та реалістичну динаміку тіла, що є великим кроком вперед порівняно з традиційними моделями deepfake.

ByteDance навчила OmniHuman-1 на обширній базі даних людських відеозаписів, яка нараховує 18 700 годин, дозволяючи моделі зрозуміти величезну кількість рухів, виразів обличчя та жестів. Надавши штучному інтелекту можливість побачити величезну кількість реальних рухів, вона підвищує природність створеного контенту.

Ключова інновація полягає в її стратегії навчання “омні-умовах”, коли під час навчання одночасно використовуються кілька входних сигналів, таких як аудіокліпи, текстові підказки та посилання на позу. Цей метод допомагає штучному інтелекту передбачати рух більш точно, навіть у складних сценаріях, які включають жести рук, вирази емоцій та різні кути камери.

Функція Перевага OmniHuman-1
Генерація руху Використовує дифузійний трансформер для безшовного, реалістичного руху
Тренувальна база даних 18 700 годин відео, що забезпечує високу точність
Багаторівневе навчання Інтегрує аудіо, текст та посилання на позу для точної синхронізації
Анімація всього тіла Захоплює жести, позу тіла та вирази обличчя
Адаптивність Працює з різними стилями зображень та кутами

Етичні та практичні проблеми

OmniHuman-1 встановлює новий стандарт у штучно створених відео, але також піднімає значні етичні та безпекові проблеми:

  • Ризики deepfake: Спроможність створювати дуже реалістичні відео з одного зображення відкриває двері для дезінформації, крадіжки особистості та цифрової імперсонації. Це може вплинути на журналістику, політику та довіру до ЗМІ.
  • Потенційне неправильне використання: Штучно створена оманна діяльність може бути використана у зловісних цілях, включаючи політичні deepfake, фінансові шахрайства та штучно створений контент без згоди. Це робить регулювання та водяні знаки критичними проблемами.
  • Відповідальність ByteDance: Наразі OmniHuman-1 не доступний для публічного використання, ймовірно, через ці етичні проблеми. Якщо він буде випущений, ByteDance повинна реалізувати сильні заходи безпеки, такі як цифрові водяні знаки, відстежування автентичності контенту та, можливо, обмеження на використання, щоб запобігти зловживанням.
  • Регуляторні проблеми: Уряди та технологічні організації борються з тим, як регулювати штучно створені ЗМІ. Зусилля, такі як AI Act в ЄС та пропозиції США щодо законодавства про deepfake, підкреслюють термінову необхідність нагляду.
  • Перегони між виявленням та генерацією: Коли штучні моделі, такі як OmniHuman-1, покращуються, так само повинні покращуватися системи виявлення. Компанії, такі як Google (GOOGL ) та OpenAI, розробляють інструменти виявлення штучного інтелекту, але підтримання темпу з цими штучними можливостями, які рухаються неймовірно швидко, залишається проблемою.

Що далі для майбутнього штучно створених людей?

Створення штучно створених людей буде розвиватися дуже швидко тепер, з OmniHuman-1, який прокладає шлях. Одним з найближчих застосувань цієї моделі може бути її інтеграція до платформ, таких як TikTok та CapCut, оскільки ByteDance володіє цими платформами. Це потенційно дозволить користувачам створювати гіперреалістичні аватари, які можуть говорити, співати чи виконувати дії з мінімальним входом. Якщо це буде реалізовано, це може переозначити користувальницький контент, дозволяючи інфлюенсерам, бізнесу та звичайним користувачам створювати привабливі відео, керовані штучним інтелектом, без зусиль.

Поза соціальними медіа OmniHuman-1 має значні наслідки для Голлівуду та кіно, ігор та віртуальних інфлюенсерів. Індустрія розваг вже досліджує штучно створених персонажів, а здатність OmniHuman-1 надавати реалістичні виступи може суттєво просунути це вперед.

З геополітичної точки зору, досягнення ByteDance знову піднімає питання про зростаючу конкуренцію штучного інтелекту між Китаєм та американськими технологічними гігантами, такими як OpenAI та Google. З великими інвестиціями Китаю в дослідження штучного інтелекту, OmniHuman-1 є серйозним викликом у сфері генеративних медіа-технологій. Коли ByteDance продовжує вдосконалювати цю модель, це може створити сцену для ширшої конкуренції за лідерство у сфері штучного інтелекту, впливаючи на те, як інструменти відео штучного інтелекту розробляються, регулюються та приймаються у світі.

Часто задавані питання (FAQ)

1. Що таке OmniHuman-1?

OmniHuman-1 – це модель штучного інтелекту, розроблена ByteDance, яка може генерувати реалістичні відео з одного зображення та аудіокліпу, створюючи реалістичні анімації людей.

2. Як OmniHuman-1 відрізняється від традиційних технологій deepfake?

На відміну від традиційних deepfake, які в основному заміняють обличчя, OmniHuman-1 анімує всю людину, включаючи рухи всього тіла, синхронізовані рухи губ та вирази обличчя.

3. Чи доступний OmniHuman-1 для публічного використання?

Наразі ByteDance не випустила OmniHuman-1 для публічного використання.

4. Які етичні ризики пов’язані з OmniHuman-1?

Модель може бути використана для дезінформації, шахрайства deepfake та штучно створеного контенту без згоди, що робить цифрову безпеку ключовою проблемою.

5. Як можна виявити штучно створені відео?

Технологічні компанії та дослідники розробляють інструменти водяних знаків та методи форензичної аналітики, щоб допомогти відрізнити штучно створені відео від справжніх кадрів.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.