AI-modeller og platforme

OmniHuman-1: ByteDances AI, der kan omdanne et enkelt billede til en talende, bevægelig person

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forestil dig, at du tager et enkelt billede af en person og ser det bevæge sig, tale og endda optræde – uden nogensinde at have optaget et rigtigt video. Det er kraften i ByteDances OmniHuman-1. Den nyligt virale AI-model giver liv til stille billeder ved at generere meget realistiske videoer, komplet med synkroniserede lipbevægelser, fuldkropsbevægelser og udtryksfulde ansigtsanimationer, alt drevet af en lydklip.

I modsætning til traditionel deepfake-teknologi, der primært fokuserer på at bytte ansigter i videoer, animerer OmniHuman-1 en hel menneskefigur, fra hoved til tå. Uanset om det er en politiker, der holder en tale, en historisk figur, der bringes til live, eller en AI-genereret avatar, der optræder med en sang, får denne model os alle til at tænke dybt over videooprettelse. Og med denne innovation følger en række implikationer – både spændende og bekymrende.

Hvad gør OmniHuman-1 særligt?

OmniHuman-1 er virkelig et kæmpe skridt fremad i realisme og funktionalitet, og det er netop derfor, det gik viralt.

Her er blot et par grunde til, hvorfor:

  • Mere end bare talehoveder: De fleste deepfake- og AI-genererede videoer har været begrænset til ansigtsanimation, ofte resulterende i stive eller unaturlige bevægelser. OmniHuman-1 animerer hele kroppen, fanger naturlige gestus, kropsholdninger og endda interaktioner med objekter.
  • Utrolig lip-sync og nuancerede følelser: Den gør ikke bare, at munden bevæger sig tilfældigt; AI’en sikrer, at lipbevægelser, ansigtsudtryk og kropssprog matcher input-lyden, hvilket gør resultatet utrolig levende.
  • Tilpasning til forskellige billedstiler: Uanset om det er et højopløst portræt, et lavkvalitetsnapshot eller endda en stiliseret illustration, tilpasser OmniHuman-1 sig intelligently, skabende glatte, troværdige bevægelser uanset inputkvaliteten.

Dette niveau af præcision er muligt takket være ByteDances massive 18.700-timers dataset af menneskeligt videooptag, samt dets avancerede diffusion-transformer-model, der lærer intrikate menneskelige bevægelser. Resultatet er AI-genererede videoer, der føles næsten umulig at skelne fra rigtige optag. Det er langt det bedste, jeg har set hidtil.

Teknologien bag det (på godt dansk)

Ved at kaste et blik på den officielle artikel, er OmniHuman-1 en diffusion-transformer-model, en avanceret AI-ramme, der genererer bevægelse ved at forudsige og forfine bevægelsesmønstre frame for frame. Denne tilgang sikrer glatte overgange og realistiske kropsdynamik, et stort skridt beyond traditionelle deepfake-modeller.

ByteDance har trænet OmniHuman-1 på et omfattende 18.700-timers dataset af menneskeligt videooptag, hvilket giver modellen mulighed for at forstå en bred vifte af bevægelser, ansigtsudtryk og gestus. Ved at udsætte AI’en for en ubeskrivelig mængde af rigtige bevægelser, forbedres den naturlige følelse af den genererede indhold.

En nøgleinnovation at vide er dens “omni-conditions”-træningsstrategi, hvor multiple input-signaler – såsom lydklip, tekstprompt og posereferencer – bruges samtidig under træning. Denne metode hjælper AI’en med at forudsige bevægelse mere præcist, selv i komplekse scenarier, der involverer håndbevægelser, emotionelle udtryk og forskellige kameravinkler.

Funktion OmniHuman-1-fordele
Bevægelsesgenerering Bruger en diffusion-transformer-model til glatte, realistiske bevægelser
Træningsdata 18.700 timer video, hvilket sikrer høj troværdighed
Multi-conditions-læring Integrerer lyd-, tekst- og pose-input for præcis synkronisering
Fuldkropsanimation Fanger gestus, kropsholdninger og ansigtsudtryk
Tilpasning Fungerer med forskellige billedstiler og vinkler

Etniske og praktiske bekymringer

Da OmniHuman-1 sætter en ny standard for AI-genererede videoer, rejser det også betydelige etiske og sikkerhedsbekymringer:

  • Deepfake-risici: Evnen til at skabe meget realistiske videoer fra et enkelt billede åbner døren for misinformation, identitetstyveri og digital impersonation. Dette kan påvirke journalistik, politik og offentlig tillid til medier.
  • Mulig misbrug: AI-drevet bedrag kan bruges på skadelig vis, herunder politiske deepfakes, finansielle svindel og ikke-frivillig AI-genereret indhold. Dette gør regulering og vandmærkning kritiske bekymringer.
  • ByteDances ansvar: For nuværende er OmniHuman-1 ikke offentligt tilgængelig, sandsynligvis på grund af disse etiske bekymringer. Hvis den frigøres, skal ByteDance implementere stærke sikkerhedsforanstaltninger, såsom digital vandmærkning, indholdets ægthedssporing og muligvis begrænsninger på brugen for at forhindre misbrug.
  • Reguleringsudfordringer: Regeringer og teknologivirksomheder kæmper med, hvordan de skal regulere AI-genererede medier. Bemühninger som AI-loven i EU og amerikanske forslag til deepfake-lovgivning understreger det presserende behov for tilsyn.
  • Detektion vs. genererings kapløb: Da AI-modeller som OmniHuman-1 forbedres, skal detektionssystemer også forbedres. Virksomheder som Google (GOOGL ) og OpenAI udvikler AI-detektionsværktøjer, men at holde trit med disse AI-kapaciteter, der bevæger sig utrolig hurtigt, er en udfordring.

Hvad er næste skridt for fremtiden for AI-genererede mennesker?

Skabelsen af AI-genererede mennesker vil gå rigtig hurtigt nu, med OmniHuman-1 som banepioner. En af de mest umiddelbare anvendelser af denne model kunne være dens integration i platforme som TikTok og CapCut, da ByteDance ejer disse. Dette kunne potentielt give brugerne mulighed for at skabe hyperrealistiske avatars, der kan tale, synge eller udføre handlinger med minimalt input. Hvis det implementeres, kunne det omdefinere bruger-genereret indhold, hvilket giver influencere, virksomheder og almindelige brugere mulighed for at skabe overbevisende AI-drevne videoer uden besvær.

Uden for sociale medier har OmniHuman-1 betydelige implikationer for Hollywood og film, spil og virtuelle influencere. Underholdningsindustrien udforsker allerede AI-genererede karakterer, og OmniHuman-1’s evne til at levere levende præstationer kunne virkelig hjælpe med at fremme dette.

Fra et geopolitisk synspunkt bringer ByteDances fremskridt igen den voksende AI-konkurrence mellem Kina og amerikanske teknologigiganter som OpenAI og Google. Med Kina investerer tungt i AI-forskning, er OmniHuman-1 en alvorlig udfordring i generativ medieteknologi. Da ByteDance fortsætter med at forfine denne model, kan det sætte scenen for en bredere konkurrence om AI-lederskab, hvilket påvirker, hvordan AI-videoværktøjer udvikles, reguleres og adopteres verden over.

Ofte stillede spørgsmål (FAQ)

1. Hvad er OmniHuman-1?

OmniHuman-1 er en AI-model udviklet af ByteDance, der kan generere realistiske videoer fra et enkelt billede og en lydklip, skabende levende animationer af mennesker.

2. Hvordan adskiller OmniHuman-1 sig fra traditionel deepfake-teknologi?

I modsætning til traditionelle deepfakes, der primært bygger ansigter, animerer OmniHuman-1 en hel person, herunder fuldkropsbevægelser, synkroniserede lipbevægelser og emotionelle udtryk.

3. Er OmniHuman-1 offentligt tilgængelig?

For nuværende har ByteDance ikke frigivet OmniHuman-1 til offentlig brug.

4. Hvad er de etiske risici forbundet med OmniHuman-1?

Modellen kan bruges til misinformation, deepfake-svindel og ikke-frivillig AI-genereret indhold, hvilket gør digital sikkerhed til en vigtig bekymring.

5. Hvordan kan AI-genererede videoer detekteres?

Teknologivirksomheder og forskere udvikler vandmærkingsværktøjer og forensiske analysemetoder til at hjælpe med at skelne AI-genererede videoer fra rigtige optag.

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.