Andersons hoek

Een Opmerkelijke Vooruitgang in Mens-gedreven AI-Video

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
Examples from the DreamActor project page.

Opmerking: De projectpagina voor dit werk bevat 33 autoplaying high-res video’s met een totale grootte van half een gigabyte, die mijn systeem op laadtijd destabiliseerden. Om deze reden zal ik er niet rechtstreeks naar linken. Lezers kunnen de URL vinden in de abstract of PDF van het artikel als ze dat willen.

Een van de primaire doelstellingen in het huidige onderzoek naar video-synthese is het genereren van een complete AI-gedreven video-prestatie vanuit één afbeelding. Deze week is er een nieuw artikel van Bytedance Intelligent Creation verschenen, dat mogelijk het meest complete systeem van deze soort tot nu toe is, dat in staat is om full- en semi-body animaties te produceren die expressieve faciale details combineren met nauwkeurige grote bewegingen, en ook een verbeterde identiteitsconsistentie bereikt – een gebied waarin zelfs toonaangevende commerciële systemen vaak tekortschieten.

In het onderstaande voorbeeld zien we een prestatie die wordt aangedreven door een acteur (bovenaan links) en is afgeleid van één afbeelding (bovenaan rechts), die een opmerkelijk flexibele en behendige rendering biedt, zonder de gebruikelijke problemen bij het creëren van grote bewegingen of ‘gokken’ over verborgen gebieden (d.w.z. delen van kleding en faciale hoeken die moeten worden afgeleid of uitgevonden omdat ze niet zichtbaar zijn in de enige bronfoto):

AUDIO CONTENT. Klik om af te spelen. Een prestatie wordt geboren uit twee bronnen, inclusief lip-sync, die normaal gesproken het domein is van toegewijde secundaire systemen. Dit is een gereduceerde versie van de bronwebsite (zie opmerking aan het begin van het artikel – van toepassing op alle andere ingesloten video’s hier).

Hoewel we enkele resterende uitdagingen kunnen zien met betrekking tot de persistentie van identiteit bij elke clip, is dit het eerste systeem dat ik heb gezien dat over het algemeen (hoewel niet altijd) identiteit behoudt gedurende een langere periode zonder het gebruik van LoRAs:

AUDIO CONTENT. Klik om af te spelen. Verdere voorbeelden van het DreamActor-project.

Het nieuwe systeem, getiteld DreamActor, gebruikt een driedelige hybride besturingssysteem dat speciale aandacht besteedt aan faciale expressie, hoofdrotatie en core skeletontwerp, waardoor AI-gedreven prestaties mogelijk zijn waarbij noch het faciale noch het lichaamsaspect lijden onder het andere – een zeldzame, mogelijk onbekende mogelijkheid onder soortgelijke systemen.

Onderaan zien we een van deze facetten, hoofdrotatie, in actie. De gekleurde bal in de hoek van elke miniatuur naar rechts geeft een soort virtuele gimbal aan die hoofdoriëntatie onafhankelijk van faciale beweging en expressie definieert, die hier wordt aangedreven door een acteur (onderaan links).

Klik om af te spelen. De multicolore bal die hier wordt gevisualiseerd, vertegenwoordigt de as van rotatie van het hoofd van de avatar, terwijl de expressie wordt aangedreven door een aparte module en wordt geïnformeerd door een acteursprestatie (hieronder links te zien).

Een van de meest interessante functionaliteiten van het project, die niet eens goed wordt opgenomen in de tests van het artikel, is de mogelijkheid om lip-sync-beweging rechtstreeks uit audio af te leiden – een functionaliteit die ongewoon goed werkt, zelfs zonder een aandrijvende acteur-video.

De onderzoekers hebben de beste bestaande systemen in dit onderzoek aangepakt, waaronder de veelgeprezen Runway Act-One en LivePortrait, en melden dat DreamActor betere kwantitatieve resultaten behaalde.

Aangezien onderzoekers hun eigen criteria kunnen kiezen, zijn kwantitatieve resultaten niet noodzakelijkerwijs een empirische standaard; maar de bijbehorende kwalitatieve tests lijken de conclusies van de auteurs te ondersteunen.

Helaas is dit systeem niet bedoeld voor openbare release, en de enige waarde die de gemeenschap mogelijk uit dit werk kan halen, is het potentieel om de methodologieën die in het artikel worden beschreven te reproduceren (zoals eerder werd gedaan met het eveneens gesloten Google Dreambooth in 2022 ).

Het artikel vermeldt*:

‘Human image animatie heeft mogelijke sociale risico’s, zoals het misbruiken om nepvideo’s te maken. De voorgestelde technologie kan worden gebruikt om nepvideo’s van mensen te maken, maar bestaande detectiehulpmiddelen [Demamba, Dormant] kunnen deze nepvideo’s opsporen.

‘Om deze risico’s te verminderen, zijn duidelijke ethische regels en verantwoorde gebruiksrichtlijnen noodzakelijk. We zullen toegang tot onze core-modellen en -codes strikt beperken om misbruik te voorkomen.’

Van nature zijn ethische overwegingen van deze soort handig vanuit een commercieel oogpunt, aangezien ze een rechtvaardiging bieden voor API-only toegang tot het model, dat vervolgens kan worden gemonetariseerd. ByteDance heeft dit al eerder gedaan in 2025, door de zeer geprezen OmniHuman beschikbaar te stellen voor betaalde credits op de Dreamina-website. Daarom lijkt het, gezien DreamActor mogelijk een nog sterkere product is, dat dit het waarschijnlijke resultaat is. Wat nog moet worden gezien, is de mate waarin de principes, voor zover ze in het artikel worden uitgelegd, de open source-gemeenschap kunnen helpen.

Het nieuwe artikel is getiteld DreamActor-M1: Holistische, Expressieve en Robuuste Human Image Animatie met Hybride Begeleiding, en komt van zes Bytedance-onderzoekers.

Methode

Het DreamActor-systeem dat in het artikel wordt voorgesteld, heeft als doel om menselijke animatie te genereren vanuit een referentie-afbeelding en een aandrijvende video, met behulp van een Diffusion Transformer (DiT) framework aangepast voor latent ruimte (blijkbaar een soort Stable Diffusion, hoewel het artikel alleen de 2022 landmark release publicatie citeert).

In plaats van te vertrouwen op externe modules voor referentieconditie, combineren de auteurs verschijning en bewegingsfuncties rechtstreeks binnen de DiT-backbone, waardoor interactie mogelijk is over ruimte en tijd via aandacht:

Schema voor het nieuwe systeem: DreamActor codeert pose, faciale beweging en verschijning in afzonderlijke latente variabelen, combineert deze met geluidige video-latente variabelen die worden gegenereerd door een 3D VAE. Deze signalen worden gefuseerd binnen een Diffusion Transformer met behulp van self- en cross-aandacht, met gedeelde gewichten over takken. Het model wordt gesuperviseerd door gedenoiseerde uitvoer te vergelijken met schone video-latente variabelen. Bron: https://arxiv.org/pdf/2504.01724

Schema voor het nieuwe systeem: DreamActor codeert pose, faciale beweging en verschijning in afzonderlijke latente variabelen, combineert deze met geluidige video-latente variabelen die worden gegenereerd door een 3D VAE. Deze signalen worden gefuseerd binnen een Diffusion Transformer met behulp van self- en cross-aandacht, met gedeelde gewichten over takken. Het model wordt gesuperviseerd door gedenoiseerde uitvoer te vergelijken met schone video-latente variabelen. Bron: https://arxiv.org/pdf/2504.01724

Om dit te doen, gebruikt het model een vooraf getrainde 3D variational autoencoder om zowel de invoer-video als de referentie-afbeelding te coderen. Deze latente variabelen worden patchified, samengevoegd en ingevoerd in de DiT, die ze gezamenlijk verwerkt.

Deze architectuur wijkt af van de gebruikelijke praktijk van het koppelen van een secundair netwerk voor referentie-injectie, wat de aanpak was voor de invloedrijke Animate Anyone en Animate Anyone 2 projecten.

In plaats daarvan bouwt DreamActor de fusie in het hoofdmodel zelf, waardoor het ontwerp wordt vereenvoudigd en de stroom van informatie tussen verschijning en bewegingsaanwijzingen wordt verbeterd. Het model wordt vervolgens getraind met behulp van flow matching in plaats van het standaard diffusie-objectief (Flow matching traint diffusiemodellen door directe voorspelling van snelheidsvelden tussen gegevens en ruis, waarbij score-schatting wordt overgeslagen).

Hybride Bewegingsbegeleiding

De Hybride Bewegingsbegeleidingsmethode die de neurale renderingen informeert, combineert pose-tokens die zijn afgeleid van 3D lichaamsskeletten en hoofdsferen; impliciete faciale representaties die zijn geëxtraheerd door een vooraf getrainde faciale encoder; en referentie-verschijnings-tokens die zijn bemonsterd uit de bronafbeelding.

Deze elementen worden geïntegreerd binnen de Diffusion Transformer met behulp van verschillende aandachtmecanismen, waardoor het systeem globale beweging, faciale expressie en visuele identiteit kan coördineren tijdens het generatieproces.

Voor het eerst, in plaats van te vertrouwen op faciale landmarks, gebruikt DreamActor impliciete faciale representaties om expressiegeneratie te begeleiden, wat blijkbaar een fijnere controle over faciale dynamica mogelijk maakt en identiteit en hoofdpose van expressie ontkoppelt.

Om deze representaties te creëren, detecteert de pipeline eerst het gezichtsgebied in elke frame van de aandrijvende video, verkleint het tot 224×224 en verwerkt de gewonnen gezichten met een faciale bewegingsencoder die is voorgetraind op de PD-FGC dataset, die vervolgens wordt geconditioneerd door een MLP laag.

PD-FGC, gebruikt in DreamActor, genereert een pratend hoofd vanuit een referentie-afbeelding met ontkoppelde controle over lip-sync (van audio), hoofdpose, oogbeweging en expressie (van afzonderlijke video's), waardoor een precieze, onafhankelijke manipulatie van elk mogelijk is. Bron: https://arxiv.org/pdf/2211.14506

PD-FGC, gebruikt in DreamActor, genereert een pratend hoofd vanuit een referentie-afbeelding met ontkoppelde controle over lip-sync (van audio), hoofdpose, oogbeweging en expressie (van afzonderlijke video’s), waardoor een precieze, onafhankelijke manipulatie van elk mogelijk is. Bron: https://arxiv.org/pdf/2211.14506

Het resultaat is een reeks faciale bewegingstokens, die worden geïnjecteerd in de Diffusion Transformer via een cross-aandacht laag.

Hetzelfde kader ondersteunt ook een audio-gedreven variant, waarin een afzonderlijke encoder wordt getraind die spraakinput rechtstreeks in faciale bewegingstokens kaart. Dit maakt het mogelijk om gesynchroniseerde faciale animatie te genereren – inclusief lipbewegingen – zonder een aandrijvende video.

AUDIO CONTENT. Klik om af te spelen. Lip-sync die rechtstreeks uit audio wordt afgeleid, zonder een aandrijvende acteur-verwijzing. De enige karakterinput is de statische foto die bovenaan rechts wordt getoond.

Ten tweede, om hoofdpose onafhankelijk van faciale expressie te controleren, introduceert het systeem een 3D hoofdsfeerrepresentatie (zie video die eerder in dit artikel is ingesloten), die faciale dynamica van globale hoofdbeweging ontkoppelt, waardoor de precisie en flexibiliteit tijdens animatie worden verbeterd.

Hoofdsferen worden gegenereerd door 3D faciale parameters – zoals rotatie en camerapositie – uit de aandrijvende video te extraheren met behulp van de FaceVerse tracking-methode.

Schema voor het FaceVerse-project. Bron: https://www.liuyebin.com/faceverse/faceverse.html

Schema voor het FaceVerse-project. Bron: https://www.liuyebin.com/faceverse/faceverse.html

Deze parameters worden gebruikt om een gekleurde sfeer te renderen die wordt geprojecteerd op het 2D-beeldvlak, ruimtelijk uitgelijnd met de aandrijvende hoofd. De grootte van de sfeer komt overeen met de referentiehoofd, en de kleur weerspiegelt de oriëntatie van het hoofd. Deze abstractie vermindert de complexiteit van het leren van 3D hoofdbeweging, waardoor gestileerde of geëxaggererde hoofdvormen in getekende personages kunnen worden behouden.

Visualisatie van de controle-sfeer die de hoofdoriëntatie beïnvloedt.

Visualisatie van de controle-sfeer die de hoofdoriëntatie beïnvloedt.

Ten slotte, om volledige lichaamsbeweging te begeleiden, gebruikt het systeem 3D lichaamsskeletten met adaptieve botlengtenormalisatie. Lichaams- en handparameters worden geschat met behulp van 4DHumans en de handgerichte HaMeR, die beide werken op het SMPL-X lichaamsmodel.

SMPL-X past een parameterisch net over het volledige menselijk lichaam in een afbeelding, uitgelijnd met de geschatte pose en expressie om pose-gevoelige manipulatie mogelijk te maken met behulp van het net als een volumetrische gids. Bron: https://arxiv.org/pdf/1904.05866

SMPL-X past een parameterisch net over het volledige menselijk lichaam in een afbeelding, uitgelijnd met de geschatte pose en expressie om pose-gevoelige manipulatie mogelijk te maken met behulp van het net als een volumetrische gids. Bron: https://arxiv.org/pdf/1904.05866

Vanuit deze uitvoer worden sleutelgewrichten geselecteerd, geprojecteerd in 2D en verbonden in lijn-gebaseerde skeletkaarten. In tegenstelling tot methoden zoals Champ, die volledige lichaamsmeshes renderen, vermijdt deze aanpak het opleggen van vooraf gedefinieerde vormprioriteiten, en door uitsluitend te vertrouwen op skeletstructuur, wordt het model aangemoedigd om lichaamsvorm en verschijning rechtstreeks uit de referentie-afbeeldingen af te leiden, waardoor de voorkeur voor vaste lichaamstypen wordt verminderd en de generalisatie over een breed scala aan poses en lichaamsvormen wordt verbeterd.

Tijdens de training worden de 3D lichaamsskeletten samengevoegd met hoofdsferen en doorgegeven aan een pose-encoder, die functies uitvoert die vervolgens worden gecombineerd met geluidige video-latente variabelen om de ruis-tokens te produceren die door de Diffusion Transformer worden gebruikt.

Tijdens de inferentie houdt het systeem rekening met skeletverschillen tussen onderwerpen door botlengten te normaliseren. De SeedEdit voorgetrainde beeldbewerkingsmodel transformeert zowel referentie- als aandrijvende afbeeldingen in een standaard canonische configuratie. RTMPose wordt vervolgens gebruikt om skeletproporties te extraheren, die worden gebruikt om het aandrijvende skelet aan te passen aan de anatomie van het referentie-onderwerp.

Overzicht van de inferentie-pipeline. Pseudo-referenties kunnen worden gegenereerd om verschijningsaanwijzingen te verrijken, terwijl hybride controle-seinen - impliciete faciale beweging en expliciete pose van hoofdsferen en lichaamsskeletten - worden geëxtraheerd uit de aandrijvende video. Deze worden vervolgens ingevoerd in een DiT-model om geanimeerde uitvoer te produceren, met faciale beweging ontkoppeld van lichaamspositie, waardoor het gebruik van audio als bestuurder mogelijk wordt.

Overzicht van de inferentie-pipeline. Pseudo-referenties kunnen worden gegenereerd om verschijningsaanwijzingen te verrijken, terwijl hybride controle-seinen – impliciete faciale beweging en expliciete pose van hoofdsferen en lichaamsskeletten – worden geëxtraheerd uit de aandrijvende video. Deze worden vervolgens ingevoerd in een DiT-model om geanimeerde uitvoer te produceren, met faciale beweging ontkoppeld van lichaamspositie, waardoor het gebruik van audio als bestuurder mogelijk wordt.

Verschijningsbegeleiding

Om de verschijningstrouw te verbeteren, met name in verborgen of zelden zichtbare gebieden, vult het systeem de primaire referentie-afbeelding aan met pseudo-referenties die zijn bemonsterd uit de invoer-video.

Klik om af te spelen. Het systeem voorziet in de behoefte om verborgen gebieden nauwkeurig en consistent te renderen. Dit is zo dichtbij als ik heb gezien, in een project van deze soort, bij een CGI-achtige bitmap-tekstuurbenadering.

Deze extra frames worden geselecteerd op pose-diversiteit met behulp van RTMPose en gefilterd met behulp van CLIP-gebaseerde overeenkomst om ervoor te zorgen dat ze consistent blijven met de identiteit van het onderwerp.

Alle referentieframes (primaire en pseudo) worden gecodeerd door dezelfde visuele encoder en gefuseerd via een self-aandachtmecanisme, waardoor het model toegang heeft tot aanvullende verschijningsaanwijzingen. Deze opstelling verbetert de dekking van details zoals profielfoto’s of ledemaat-teksturen. Pseudo-referenties worden altijd gebruikt tijdens de training en optioneel tijdens de inferentie.

Training

DreamActor werd getraind in drie fasen om geleidelijk complexiteit toe te voegen en stabiliteit te verbeteren.

In de eerste fase werden alleen 3D lichaamsskeletten en 3D hoofdsferen gebruikt als controle-seinen, waarbij faciale representaties werden uitgesloten. Dit stelde het basisvideo-generatiemodel, geïnitialiseerd vanuit MMDiT, in staat om zich aan te passen aan menselijke animatie zonder te worden overweldigd door fijne controle.

In de tweede fase werden impliciete faciale representaties toegevoegd, maar alle andere parameters bevroren. Alleen de faciale bewegingsencoder en faciale aandachtlagen werden getraind op dit punt, waardoor het model in staat was om expressieve details te leren in isolatie.

In de laatste fase werden alle parameters ontdooid voor gezamenlijke optimalisatie over verschijning, pose en faciale dynamica.

Gegevens en Tests

Voor de testfase wordt het model geïnitialiseerd vanuit een voorgetraind image-to-video DiT-checkpoint en getraind in drie fasen: 20.000 stappen voor elk van de eerste twee fasen en 30.000 stappen voor de derde.

Om generalisatie over verschillende duur en resolutie te verbeteren, werden video-clips willekeurig bemonsterd met lengtes tussen 25 en 121 frames. Deze werden vervolgens omgezet naar 960x640px, waarbij het aspectratio werd behouden.

De training werd uitgevoerd op acht (China-georiënteerde) NVIDIA H20 GPU’s, elk met 96GB VRAM, met behulp van de AdamW optimizer met een (tolerabel hoge) leer tempo van 5e−6.

Tijdens de inferentie bevatte elk video-segment 73 frames. Om consistentie over segmenten te behouden, werd de laatste latente variabele van een segment opnieuw gebruikt als de initiële latente variabele voor het volgende, waardoor de taak als sequentiële image-to-video-generatie wordt gecontextualiseerd.

Classifier-free guidance werd toegepast met een gewicht van 2,5 voor zowel referentie-afbeeldingen als bewegingscontrole-seinen.

De auteurs construeerden een trainingsdataset (geen bronnen worden vermeld in het artikel) bestaande uit 500 uur video uit diverse domeinen, met voorbeelden van (onder andere) dans, sport, film en openbare spreken. De dataset was ontworpen om een breed spectrum van menselijke beweging en expressie te vangen, met een gelijke verdeling tussen full-body en half-body shots.

Om de kwaliteit van de faciale synthese te verbeteren, werd Nersemble opgenomen in het datapreparatieproces.

Voorbeelden uit de Nersemble-dataset, die worden gebruikt om de gegevens voor DreamActor te verrijken. Bron: https://www.youtube.com/watch?v=a-OAWqBzldU

Voorbeelden uit de Nersemble-dataset, die worden gebruikt om de gegevens voor DreamActor te verrijken. Bron: https://www.youtube.com/watch?v=a-OAWqBzldU

Voor de evaluatie gebruikten de onderzoekers hun dataset ook als een benchmark om generalisatie over verschillende scenario’s te beoordelen.

Het prestatieniveau van het model werd gemeten met behulp van standaardmetrieken uit eerder onderzoek: Fréchet Inception Distance (FID); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); en Peak Signal-to-Noise Ratio (PSNR) voor frame-niveau kwaliteit. Fréchet Video Distance (FVD) werd gebruikt voor het beoordelen van temporele coherentie en algemene video-gelijkenis.

De auteurs voerden experimenten uit op zowel lichaamsanimatie- als portretanimatie-taken, allemaal met behulp van één (doel) referentie-afbeelding.

Voor lichaamsanimatie werd DreamActor-M1 vergeleken met Animate Anyone; Champ; MimicMotion, en DisPose.

Kwantitatieve vergelijkingen met rivaliserende kaders.

Kwantitatieve vergelijkingen met rivaliserende kaders.

Hoewel de PDF een statische afbeelding als visuele vergelijking biedt, kan een van de video’s op de projectsite de verschillen mogelijk duidelijker laten zien:

AUDIO CONTENT. Klik om af te spelen. Een visuele vergelijking over de concurrerende kaders. De aandrijvende video is linksboven te zien, en de conclusie van de auteurs dat DreamActor de beste resultaten produceert, lijkt redelijk.

Voor portretanimatie-tests werd het model geëvalueerd tegen LivePortrait; X-Portrait; SkyReels-A1; en Act-One.

Kwantitatieve vergelijkingen voor portretanimatie.

Kwantitatieve vergelijkingen voor portretanimatie.

De auteurs merken op dat hun methode de kwantitatieve tests wint en beweren ook dat het kwalitatief superieur is.

AUDIO CONTENT. Klik om af te spelen. Voorbeelden van portretanimatie-vergelijkingen.

Betwistbaar is de derde en laatste van de clips die in de bovenstaande video worden getoond, een minder overtuigende lip-sync, vergeleken met enkele van de concurrerende kaders, hoewel de algemene kwaliteit opmerkelijk hoog is.

Conclusie

Door de noodzaak voor texturen die worden geïmpliceerd maar niet daadwerkelijk aanwezig zijn in de enkele doelafbeelding die deze reproducties aandrijft, heeft ByteDance een van de grootste uitdagingen aangepakt die de diffusie-gebaseerde video-generatie tegenkomt – consistente, persistente texturen. De volgende logische stap na het perfectioneren van een dergelijke aanpak zou zijn om op de een of andere manier een referentie-atlas te creëren vanuit de eerste gegenereerde clip die kan worden toegepast op latere, verschillende generaties, om verschijning te behouden zonder LoRAs.

Hoewel een dergelijke aanpak in feite nog steeds een externe referentie zou zijn, is dit niet anders dan texture-mapping in traditionele CGI-technieken, en de kwaliteit van realisme en geloofwaardigheid is veel hoger dan die van die oude methoden.

De meest indrukwekkende aspect van DreamActor is het gecombineerde driedelige begeleidingssysteem, dat de traditionele kloof tussen faciale en lichaamsgerichte menselijke synthese op een ingenieuze manier overbrugt.

Het blijft nu te zien of enkele van deze kernprincipes kunnen worden benut in meer toegankelijke aanbiedingen; zoals het er nu uitziet, lijkt DreamActor gedoemd om nog een andere synthese-as-a-service-aanbieding te worden, ernstig beperkt door gebruiksbeperkingen en door de onpraktische mogelijkheid om uitgebreid te experimenteren met een commerciële architectuur.

 

* Mijn vervanging van hyperlinks voor de auteurs; inline citaten

Zoals eerder vermeld, is het niet duidelijk welke smaak van Stable Diffusion in dit project is gebruikt.

Eerst gepubliceerd op vrijdag 4 april 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]