Modele i platformy AI

OmniHuman-1: AI ByteDance, która zamienia jedno zdjęcie w poruszającego się i mówiącego człowieka

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wyobraź sobie, że robisz zdjęcie człowieka i w ciągu kilku sekund widzisz, jak mówi, gestykuluje i nawet wykonuje różne czynności – wszystko to bez nagrywania prawdziwego filmu. To jest możliwe dzięki OmniHuman-1, AI opracowanej przez ByteDance. Niedawno OmniHuman-1 stała się viralem, ponieważ potrafi ożywić statyczne obrazy, generując bardzo realistyczne filmy, w tym ruchy ust, pełne gesty i wyrażenia twarzy, wszystko to sterowane przez dźwięk.

W przeciwieństwie do tradycyjnej technologii deepfake, która głównie koncentruje się na zamianie twarzy w filmach, OmniHuman-1 ożywia całą postać ludzką, od głowy do stóp. Niezależnie od tego, czy jest to polityk wygłaszający przemówienie, postać historyczna ożywiona, czy awatar generowany przez AI wykonujący piosenkę, ten model powoduje, że wszyscy głęboko zastanawiamy się nad tworzeniem filmów. I wraz z tą innowacją pojawia się wiele implikacji – zarówno ekscytujących, jak i niepokojących.

Co wyróżnia OmniHuman-1?

OmniHuman-1 to naprawdę ogromny krok naprzód w realizmie i funkcjonalności, co jest dokładnie powodem, dla którego stała się viralem.

Oto tylko kilka powodów, dlaczego:

  • Więcej niż tylko mówiące głowy: Większość deepfake i filmów generowanych przez AI była ograniczona do animacji twarzy, często wytwarzając sztywne lub nienaturalne ruchy. OmniHuman-1 ożywia całe ciało, ujmując naturalne gesty, postawy i nawet interakcje z obiektami.
  • Niesamowita synchronizacja ust i nuansowane emocje: Nie tylko sprawia, że usta poruszają się losowo; AI zapewnia, że ruchy ust, wyrażenia twarzy i język ciała odpowiadają dźwiękowi wejściowemu, sprawiając, że efekt jest niesamowicie realistyczny.
  • Dostosowanie do różnych stylów obrazu: Niezależnie od tego, czy jest to wysokiej jakości portret, niższej jakości zdjęcie, czy nawet stylizowana ilustracja, OmniHuman-1 inteligentnie dostosowuje się, tworząc gładkie, wiarygodne ruchy niezależnie od jakości wejściowej.

Ten poziom precyzji jest możliwy dzięki ogromnemu zbiorowi danych ByteDance, liczącemu 18 700 godzin filmów z ludźmi, a także zaawansowanemu modelowi transformatora dyfuzyjnego, który uczy się skomplikowanych ruchów ludzkich. Efektem są filmy generowane przez AI, które są prawie nie do odróżnienia od prawdziwych.

Technologia za OmniHuman-1 (w prostych słowach)

OmniHuman-1 to model transformatora dyfuzyjnego, zaawansowany framework AI, który generuje ruch, przewidując i udoskonalając wzorce ruchu klatka po klatce. Podejście to zapewnia gładkie przejścia i realistyczne dynamikę ciała, co jest znacznym krokiem naprzód w porównaniu z tradycyjnymi modelami deepfake.

ByteDance opracował OmniHuman-1 na ogromnym zbiorze danych, liczącym 18 700 godzin filmów z ludźmi, co pozwoliło modelowi nauczyć się ogromnej ilości ruchów, wyrażeń twarzy i gestów. Dzięki narażeniu AI na niezwykle różnorodne ruchy w prawdziwym życiu, zwiększa to naturalny charakter generowanego treści.

Kluczowa innowacja to tak zwana strategia treningu „omni-warunków”, w której podczas treningu używa się jednocześnie wielu sygnałów wejściowych, takich jak klipy audio, tekstowe wskazówki i odniesienia do pozycji. Metoda ta pomaga AI przewidywać ruchy z większą dokładnością, nawet w skomplikowanych sytuacjach, w tym gestach rąk, wyrażeniach emocjonalnych i różnych kątach kamery.

Funkcja Przewaga OmniHuman-1
Generowanie ruchu Używa modelu transformatora dyfuzyjnego do gładkiego, realistycznego ruchu
Dane treningowe 18 700 godzin filmów, co zapewnia wysoką wierność
Uczenie się w wielu warunkach Integruje dane audio, tekst i pozycję wejściową do precyzyjnej synchronizacji
Animacja całego ciała Ujmuje gesty, postawę ciała i wyrażenia twarzy
Dostosowanie Działa z różnymi stylami obrazu i kątami

Etyczne i praktyczne problemy

OmniHuman-1 stawia nowy standard w filmach generowanych przez AI, ale podnosi również znaczące problemy etyczne i bezpieczeństwa:

  • Ryzyko deepfake: Możliwość tworzenia bardzo realistycznych filmów z jednego zdjęcia otwiera drzwi do dezinformacji, kradzieży tożsamości i cyfrowej impersonacji. To może wpłynąć na dziennikarstwo, politykę i zaufanie publiczne do mediów.
  • Potencjalne nadużycie: Deceptywna AI może być używana w sposób szkodliwy, w tym deepfakes polityczne, oszustwa finansowe i treści generowane przez AI bez zgody. To sprawia, że regulacja i znakowanie wodne są kluczowymi problemami.
  • Odpowiedzialność ByteDance: Obecnie OmniHuman-1 nie jest dostępny publicznie, prawdopodobnie ze względu na te problemy etyczne. Jeśli zostanie wydany, ByteDance będzie musiał wdrożyć silne zabezpieczenia, takie jak znakowanie cyfrowe, śledzenie autentyczności treści i możliwe ograniczenia użycia, aby zapobiec nadużyciom.
  • Wyzwania regulacyjne: Rządy i organizacje technologiczne walczą z tym, jak regulować media generowane przez AI. Wysiłki takie jak Akt AI w UE i propozycje legislacji deepfake w Stanach Zjednoczonych podkreślają pilną potrzebę nadzoru.
  • Wyścig zbrojeń między wykrywaniem a generowaniem: Im lepsze są modele AI, takie jak OmniHuman-1, tym bardziej muszą się poprawiać systemy wykrywania. Firmy takie jak Google (GOOGL ) i OpenAI rozwijają narzędzia do wykrywania AI, ale utrzymanie tempa tych możliwości AI, które rozwijają się niezwykle szybko, jest wyzwaniem.

Co dalej dla przyszłości ludzi generowanych przez AI?

Tworzenie ludzi generowanych przez AI będzie postępować bardzo szybko, a OmniHuman-1 jest pierwszym krokiem. Jednym z najbliższych zastosowań tego modelu może być jego integracja z platformami takimi jak TikTok i CapCut, ponieważ ByteDance jest właścicielem tych platform. To pozwoliłoby użytkownikom tworzyć hiperrealistyczne awatary, które mogą mówić, śpiewać lub wykonywać czynności z minimalnym wkładem. Jeśli zostanie wdrożone, to może zmienić treści generowane przez użytkowników, umożliwiając influencerom, firmom i zwykłym użytkownikom tworzenie atrakcyjnych filmów napędzanych przez AI bez wysiłku.

Poza mediami społecznościowymi OmniHuman-1 ma znaczące implikacje dla przemysłu filmowego i rozrywkowego, gier i wirtualnych influencerów. Przemysł rozrywkowy już teraz bada postacie generowane przez AI, a zdolność OmniHuman-1 do dostarczania realistycznych występów może naprawdę pomóc w tym.

Z punktu widzenia geopolitycznego postępy ByteDance ponownie podnoszą rosnącą rywalizację AI między Chinami a amerykańskimi gigantami technologicznymi, takimi jak OpenAI i Google. Z Chinami, które inwestują ogromne środki w badania AI, OmniHuman-1 stanowi poważne wyzwanie w technologii mediów generowanych. Im więcej ByteDance udoskonala ten model, tym bardziej może on ustalić scenę dla szerszej rywalizacji o przywództwo w AI, wpływając na to, jak narzędzia wideo AI są rozwijane, regulowane i przyjmowane na całym świecie.

Często zadawane pytania (FAQ)

1. Co to jest OmniHuman-1?

OmniHuman-1 to model AI opracowany przez ByteDance, który może generować realistyczne filmy z jednego zdjęcia i klipu audio, tworząc realistyczne animacje ludzi.

2. Jak OmniHuman-1 różni się od tradycyjnej technologii deepfake?

W przeciwieństwie do tradycyjnych deepfake, które głównie koncentrują się na zamianie twarzy, OmniHuman-1 ożywia całą postać ludzką, w tym pełne gesty, zsynchronizowane ruchy ust i wyrażenia twarzy.

3. Czy OmniHuman-1 jest dostępny publicznie?

Obecnie ByteDance nie wydał OmniHuman-1 do użytku publicznego.

4. Jakie są ryzyka etyczne związane z OmniHuman-1?

Model ten może być użyty do dezinformacji, oszustw deepfake i treści generowanych przez AI bez zgody, co sprawia, że bezpieczeństwo cyfrowe jest kluczowym problemem.

5. Jak można wykryć filmy generowane przez AI?

Firmy technologiczne i badacze rozwijają narzędzia do znakowania wodnego i analityki sądowej, aby pomóc odróżnić filmy generowane przez AI od prawdziwych.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.