Andersonin kulma
Uusi järjestelmä aikajatkuvuuden säilyttäville Stable Diffusion -videohahmoille

Alibaban uusi aloite tarjoaa yhden parhaimmista menetelmistä, joita olen nähnyt, täysikokoisten ihmishahmojen luomiseen Stable Diffusion -perusmallin pohjalta.
Tämä järjestelmä, joka on nimeltään MIMO (MIMikointi Objektien kanssa), käyttää useita suosittuja teknologioita ja moduuleja, kuten CGI-pohjaisia ihmismalleja ja AnimateDiff:iä, mahdollistaakseen aikajatkuvuuden säilyttämisen hahmojen korvaamisessa videoissa tai ohjaamalla hahmoa käyttäjän määrittelemällä luurangoposeella.
Tässä näemme hahmot, jotka on interpoloitu yhdestä kuvasta, ja ohjataan ennalta määrätyn liikkeen mukaan:
[Klikkaa videota alla nähdäksesi sen]
Yhdestä kuvasta luodut kolme monipuolista hahmoa ohjataan 3D-posekuvaussarjalla (kaukaisin vasen) MIMO-järjestelmällä. Katso projekti-sivu ja liittyvä YouTube-video (joka on upotettu artikkelin loppuun) lisätietoja ja parempaa resoluutiota varten. Lähde: https://menyifang.github.io/projects/MIMO/index.html
Luodut hahmot, jotka voidaan myös ladata videoiden kehyksistä ja monin muin tavoin, voidaan yhdistää todellisen maailman kuvamateriaaliin.
MIMO tarjoaa uuden järjestelmän, joka luo kolme erillistä koodausta, yhden hahmolle, toisen kohtaukselle ja kolmannen peittämiselle (ts. maskaukselle, kun joku esine tai henkilö kulkee hahmon edessä, jota kuvaillaan). Nämä koodaukset yhdistetään johtopäätöksessä.
[Klikkaa videota alla nähdäksesi sen]
MIMO voi korvata alkuperäiset hahmot fotorealistisilla tai tyylitetyillä hahmoilla, jotka seuraavat liikettä kohdevideosta. Katso projekti-sivu ja liittyvä YouTube-video (joka on upotettu artikkelin loppuun) lisätietoja ja parempaa resoluutiota varten.
Järjestelmä on koulutettu Stable Diffusion V1.5 -mallin ylle, käyttäen tutkijoiden kokoamaa mukautettua tietojoukkoa, joka koostuu yhtä paljon todellista maailman videoita ja simuloituja videoita.
Diffuusiopohjaisen videon suuri ongelma on aikajatkuvuus, jossa videon sisältö joko vilkkuu tai “kehittyy” ei-toivottavilla tavoilla, jotka eivät ole toivottavia hahmojen jatkuvuuden kannalta.
MIMO käyttää kuitenkin tehokkaasti yhtä kuvaa karttana jatkuvuuden ohjaamiseksi, jota voidaan orkesteroida ja rajoittaa väli- SMPL -CGI-mallin avulla.
Koska viite on jatkuvaa, ja perusmalli, jolle järjestelmä on koulutettu, on täydennetty riittävillä edustavilla liikkeen esimerkeillä, järjestelmän kyky aikajatkuvuuden tuottamiseen on yleisen standardin yläpuolella diffuusiopohjaisille hahmoille.
[Klikkaa videota alla nähdäksesi sen]
Lisää esimerkkejä pose-ohjatuista MIMO-hahmoista. Katso projekti-sivu ja liittyvä YouTube-video (joka on upotettu artikkelin loppuun) lisätietoja ja parempaa resoluutiota varten.
On tullut yleisemmäksi, että yksittäisiä kuvia käytetään tehokkaiden neurorajatusten luomiseen, joko itsenään tai multimodaalisesti yhdistettynä tekstiprompteihin. Esimerkiksi suosittu LivePortrait -kasvojen siirtämisen järjestelmä voi myös luoda erittäin uskottavia deepfaked-kasvoja yksittäisistä kasvokuvista.
Tutkijat uskovat, että MIMO-järjestelmässä käytetyt periaatteet voidaan laajentaa muihin ja uusiin generatiivisiin järjestelmiin ja kehyksiin.
Uusi artikkeli on nimeltään MIMO: Kontrolloida hahmojen videon synteesi avaruudellisesti hajotettujen mallien avulla, ja se on neljän tutkijan työ Alibaban Älykkään laskennan instituutista. Työllä on videoita täynnä oleva projektisivu ja liittyvä YouTube-video, joka on myös upotettu artikkelin loppuun.
Menetelmä
MIMO saavuttaa automaattisen ja valvomattoman erottamisen edellä mainituista kolmesta avaruudellisesta komponentista, päättäväisessä arkkitehtuurissa (ts. kaikki alaprosessit ovat integroituja järjestelmään, ja käyttäjän tarvitsee vain antaa syötemateriaali).

MIMO:n käsitteellinen schema. Lähde: https://arxiv.org/pdf/2409.16160
Kohdevideojen objektit käännetään 2D:stä 3D:hen aluksi käyttäen Depth Anything -syvyyden arviointia. Ihmiskomponentti jokaisessa kehyksessä eristetään menetelmillä, joka on sovellettu Tune-A-Video -projektista.
Nämä ominaisuudet käännetään sitten videoon perustuviksi tilavuusominaisuuksiksi Facebookin Segment Anything 2 -arkkitehtuurin avulla.
Kohtauskerros itsessään saadaan poistamalla objektit, jotka on havaittu kahdessa muussa kerroksessa, ja tarjoamalla samalla rotoskooppityylisen maskin automaattisesti.
Liikkeen osalta joukko eristettyjä latenttikoodauksia ihmiskomponentille kiinnitetään oletusarvoisesti SMPL-malliin, jonka liikkeet tarjoavat kontekstin renderöidylle ihmiselle.
2D- ominaisuuskartta ihmiskomponentille saadaan erottuvalla rasteroijalla, joka on johdettu 2020-luvun aloitteesta Nvidialta. Yhdistämällä saadun 3D-tiedon SMPL:stä ja 2D-tiedon, joka saadaan Nvidian menetelmällä, latenttikoodaukset, jotka edustavat “neuraalista henkilöä”, ovat vahvasti yhteydessä lopulliseen kontekstiinsa.
Tässä vaiheessa on tarpeen määritellä viite, jota usein tarvitaan SMPL-käyttävissä arkkitehtuureissa – kanoninen pose. Tämä on laajasti samankaltainen kuin Da Vincin ‘Vitruvian ihminen’, koska se edustaa nollapose-mallia, joka voi hyväksyä sisällön ja sitten muuttaa sitä mukanaan “teksturoitu” sisältö.
Nämä muutokset tai “poikkeamat normaalista”, edustavat ihmisen liikettä, kun taas SMPL-malli säilyttää latenttikoodaukset, jotka muodostavat ihmisen identiteetin, joka on eristetty, ja edustaa tuloksena olevaa hahmoa oikein sekä poseen että tekstuuriin nähden.

Esimerkki kanonisesta posesta SMPL-hahmossa. Lähde: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
Koskien säikeistyksen ongelmaa (siihen asti, kuinka koulutettu data voi osoittautua joustamattomaksi, kun sitä venytetään sen koulutusrajojen ja yhteyksien ulkopuolelle), kirjoittajat toteavat*:
‘Täydellisen erottamisen saavuttamiseksi ulkonäön ja poseeratun videon kehyksistä, ihannetapaus on oppia dynaaminen ihmisen edustus monokulaarisen videon kautta ja muuttaa sitä pose-avaruudesta kanoniseen avaruuteen.
‘Tehokkuuden vuoksi käytämme yksinkertaista menetelmää, joka muuttaa suoraan poseeratun ihmiskuvan kanoniseen tulokseen standardi-A-poseessa käyttäen esikoulutettua ihmisen uudelleenposeerausmallia. Syntetisoitu kanoninen ulkonäkökuva syötetään ID-koodaajiin saadakseen identiteetin [koodin].
‘Tämä yksinkertainen suunnittelu mahdollistaa täydellisen erottamisen identiteetin ja liikkeen ominaisuuksien välillä. Seuraamalla Animate Anyone:ia, ID-koodaajat sisältävät CLIP -kuvauskoodaajan ja referenssi-verkkorakenteen upottamiseen globaalille ja paikalliselle ominaisuudelle [vastavuoroisesti].’
Kohtaus- ja peittämisosuuksien osalta jaettu ja kiinteä variational autoencoder (VAE – tässä tapauksessa johdettu 2013 julkaisusta) käytetään upottamiseen kohtaus- ja peittämisominaisuuksia latenttiavaruuteen. Epäjohdonmukaisuudet käsitellään täyttämismenetelmällä 2023 ProPainter -projektista.
Kun nämä osat on kootu ja korjattu, sekä tausta että peittävät objektit videossa tarjoavat maskin liikkuvalle ihmishahmolle.
Nämä hajotetut ominaisuudet syötetään sitten U-Net -rungoon, joka perustuu Stable Diffusion V1.5 -arkkitehtuuriin. Täydellinen kohtauskoodi on yhdistetty isäntäjärjestelmän latenttiin meluun. Ihmiskomponentti integroidaan itsehuomion ja ristihuomion kerrosten kautta.
Sitten puhdistettu tulos syötetään VAE-dekooderin kautta.
Data ja testit
Koulutuksessa tutkijat loivat ihmisten videoiden tietojoukon, joka käsitti 5 000 todellista hahmoa ja 2 000 synthetistä animaatiota, jotka luotiin En3D -järjestelmällä. Todelliset videot eivät vaatineet annotaatioita MIMO:n arkkitehtuurin ei-semanttisen hahmojen erottamismenetelmän vuoksi. Synthetinen data oli täysin annotoitu.
Malli koulutettiin kahdeksalla Nvidian A100 -näytönohjaimella (vaikka artikkeli ei mainitse, olivatko nämä 40GB- tai 80GB-malleja), 50 iteraatiolla, käyttäen 24 videokehystä ja eränkokoa neljä, kunnes konvergenssi saavutettiin.
Liikkeen moduuli koulutettiin AnimateDiff:n painoarvoilla. Koulutusprosessin aikana VAE-encoderin/decoderin ja CLIP-kuvauskoodaajan painot jäädytettiin (toisin kuin täysi hienosäätö, jolla on laajempi vaikutus perusmalliin).
Vaikka MIMO:a ei testattu vertailujärjestelmiä vastaan, tutkijat testasivat sen haastavilla ulkopuolisilla liikkeen sarjoilla, jotka perustuivat AMASS:iin ja Mixamo:on. Nämä liikkeet sisälsivät kiipeämistä, leikkiä ja tanssimista.
He testasivat myös järjestelmää villinä ihmisten videoissa. Molemmissa tapauksissa artikkeli raportoi “korkean robustisuuden” näille näkemättömillä 3D-liikkeillä eri näkökulmista.
Vaikka artikkeli tarjoaa useita staattisia kuvatuloksia, jotka osoittavat järjestelmän tehokkuuden, MIMO:n todellinen suorituskyky on parhaiten arvioitavissa laajojen videotuloksien kautta, jotka on esitetty projekti-sivulla ja YouTube-videossa, joka on upotettu artikkelin loppuun (josta videot artikkelin alussa on johdettu).
Kirjoittajat toteavat:
‘Kokeelliset tulokset [osoittavat], että menetelmämme mahdollistaa sekä joustavan hahmo-, liikke- ja kohtausohjauksen, että edistyneen skaalautuvuuden mihin tahansa hahmoihin, yleisyyden uusiin 3D-liikkeisiin ja soveltamiskyvyn interaktiivisiin kohtauksiin.
‘Uskomme myös, että ratkaisumme, joka ottaa huomioon sisäänrakennetun 3D-luonteen ja koodaa automaattisesti 2D-videon hierarkkisiin avaruudellisiin komponentteihin, voi inspiroida tulevia tutkimuksia 3D-tietoisten videoiden synteesiin.
‘Lisäksi, kehys on sovellettavissa ei vain hahmojen videoiden luomiseen, vaan myös muihin ohjattaviin videon synteesitehtäviin.’
Johtopäätös
On virkistävää nähdä Stable Diffusion -pohjainen hahmojärjestelmä, joka näyttää pystyvän sellaiseen aikajatkuvuuteen – ei vähiten, koska Gaussian Avatars näyttävät saavan ylätasoisuuden tässä tutkimusalueessa.
Tyylitellyt hahmot, jotka esitetään tuloksissa, ovat tehokkaita, ja vaikka fotorealistisuuden taso, jonka MIMO voi tuottaa, ei ole vielä samaa tasoa kuin mitä Gaussian Splatting pystyy, moninaiset edut aikajatkuvien ihmisten luomisesta semanttisesti perustuvassa Latent Diffusion Network (LDM) -järjestelmässä ovat merkittäviä.
* Minun muunnos kirjoittajien sisäisistä viittauksista hyperlinkkeihin, ja tarvittaessa, ulkoisiin selittäviin hyperlinkkeihin.
Julkaistu ensimmäisen kerran keskiviikkona, 25. syyskuuta 2024












