AI-mallit ja alustat
AniPortrait: Ääniohjattu synteesi fotorealistisista muotokuvanimaatioista
Vuosien varrella fotorealististen ja ilmaisuvoimaisien muotokuvanimaatioiden luominen staattisista kuvista ja äänestä on löytänyt sovelluksia mm. pelaamisessa, digitaalisessa mediassa, virtuaalitodellisuudessa ja paljon muussa. Huolimatta sen mahdollisista sovelluksista, on edelleen haasteellista kehittäjille luoda kehyksiä, jotka pystyvät tuottamaan laadukkaita animaatioita, jotka säilyttävät aikajatkuvuuden ja ovat visuaalisesti viehättäviä. Yksi merkittävä syy tämän monimutkaisuuden takana on tarve yksityiskohtaiselle koordinaatiolle huulien liikkeiden, pään asentojen ja kasvojen ilmeiden välillä luodakseen visuaalisesti viehättävän vaikutuksen.
Tässä artikkelissa puhumme AniPortraitista, uudesta kehyksestä, joka on suunniteltu luomaan laadukkaita animaatioita viittaamalla muotokuvakuvaan ja ääninäytteeseen. AniPortrait-kehyksen toiminta on jaettu kahteen vaiheeseen. Ensimmäisessä vaiheessa AniPortrait-kehyksen avulla voidaan poistaa välitöntä 3D-edustusta ääninäytteistä ja heijastaa ne järjestykseen 2D-kasvojen maamerkkejä. Tämän jälkeen kehyksessä käytetään vankkaa diffuusiomallia yhdessä liikemoduulin kanssa muuttaakseen maamerkkijärjestyksen ajallisesti yhdenmukaisiksi ja fotorealistisiksi animaatioiksi. Kokeelliset tulokset osoittavat AniPortrait-kehyksen ylivoimaisuuden ja kyvyn luoda laadukkaita animaatioita poikkeuksellisen visuaalisen laadun, asentojen monimuotoisuuden ja kasvojen luonnollisuuden kanssa, tarjoten siten parannetun ja rikastetun havaintokokemuksen. Lisäksi AniPortrait-kehyksellä on merkittävä potentiaali hallittavuuden ja joustavuuden suhteen, ja sitä voidaan soveltaa tehokkaasti alueilla, kuten kasvojen uudelleenjärjestelyssä, kasvojen liikkeen editoinnissa ja muissa. Tämä artikkeli pyrkii kattamaan AniPortrait-kehyksen syvällisemmin ja tutkimaan sen mekanismia, metodologiaa, arkkitehtuuri ja vertailua valmiiden kehysten kanssa. Aloita siis.
AniPortrait: Fotorealistinen muotokuvanimaatio
Fotorealististen ja ilmaisuvoimaisien muotokuvanimaatioiden luominen on ollut tutkijoiden fokuksessa jonkin aikaa johtuen sen uskomattomasta potentiaalista ja sovelluksista, jotka ulottuvat digitaalisesta mediasta ja virtuaalitodellisuudesta pelaamiseen ja muihin. Huolimatta vuosien tutkimuksesta ja kehityksestä, korkealaatuisten animaatioiden tuottaminen, jotka säilyttävät aikajatkuvuuden ja ovat visuaalisesti viehättäviä, edelleen esittää merkittävän haasteen. Yksi suuri este kehittäjille on tarve yksityiskohtaiselle koordinaatiolle pään asentojen, visuaalisten ilmeiden ja huulien liikkeiden välillä luodakseen visuaalisesti viehättävän vaikutuksen. Olemassa olevat menetelmät eivät ole onnistuneet haasteiden ratkaisemisessa, lähinnä koska useimmat niistä perustuvat rajoitettujen kapasiteettien generoijiin, kuten NeRF, liikkeen perustuviin dekoodereihin ja GAN:een visuaalisen sisällön luomiseksi. Nämä verkot osoittavat rajoitetut yleistymiskyvyt ja ovat epävakaita korkealaatuisten sisältöjen tuottamisessa. Viimeaikaisen diffuusiomallien kehittymisen ansiosta on kuitenkin mahdollistunut korkealaatuisten kuvien generointi, ja jotkin kehykset, jotka perustuvat diffuusiomalleihin ja ajallisiiin moduuleihin, ovat mahdollistaneet viehättävien videoiden luomisen, mikä mahdollistaa diffuusiomallien menestyksen.
Diffuusiomallien edistymisen pohjalta AniPortrait-kehyksen tavoitteena on luoda korkealaatuinen animoitu muotokuva viittaamalla kuvaan ja ääninäytteeseen. AniPortrait-kehyksen toiminta on jaettu kahteen vaiheeseen. Ensimmäisessä vaiheessa AniPortrait-kehyksen avulla voidaan poistaa välitöntä 3D-kasvomallia äänestä ja heijastaa se järjestykseen 2D-kasvojen maamerkkejä. Tämä vaihe mahdollistaa AniPortrait-kehykselle huulien liikkeiden ja hienojen ilmeiden tallentamisen äänestä sekä pään liikkeiden tallentamisen, jotka synchronoivat ääninäytteen rytmiin. Toisessa vaiheessa AniPortrait-kehyksen avulla voidaan käyttää vankkaa diffuusiomallia ja liikemoduulia muuttaakseen maamerkkijärjestyksen ajallisesti yhdenmukaisiksi ja fotorealistisiksi animaatioiksi. Tarkemmin sanottuna AniPortrait-kehyksen verkkorakenne perustuu olemassa olevaan AnimateAnyone-malliin, joka käyttää Stable Diffusion 1.5:ää, voimakasta diffuusiomallia, luomaan elävän ja fluidin animaation viittaamalla kuvaan ja kehon liikkeen järjestykseen. On huomionarvoista, että AniPortrait-kehyksessä ei käytetä pose-ohjausmoduulia, kuten AnimateAnyone-kehyksessä, vaan suunnittelee sen uudelleen, mikä mahdollistaa AniPortrait-kehykselle sekä kevyen suunnittelun että parannetun tarkin huulien liikkeiden generoinnin.
Kokeelliset tulokset osoittavat AniPortrait-kehyksen ylivoimaisuuden animaatioiden luomisessa, joissa on vaikuttava kasvojen luonnollisuus, erinomainen visuaalinen laatu ja monimuotoinen asento. Käyttämällä 3D-kasvomallia välittömänä piirteenä AniPortrait-kehyksellä on joustavuutta muokata näitä malleja tarpeiden mukaan. Tämä joustavuus parantaa AniPortrait-kehyksen soveltamista eri alueilla, kuten kasvojen uudelleenjärjestelyssä ja kasvojen liikkeen editoinnissa.
AniPortrait: Toiminta ja Metodologia
Ehdotettu AniPortrait-kehyksessä on kaksi moduulia, Audio2Lmk ja Lmk2Video. Audio2Lmk-moduuli pyrkii poistamaan maamerkkijärjestyksen, joka tallentaa hienot huulien liikkeet ja kasvojen ilmeet äänestä, kun taas Lmk2Video-moduuli käyttää tätä maamerkkijärjestykseen luomaan korkealaatuista muotokuvavideota ajallisella stabiilisuudella. Seuraava kuva esittää yleiskatsauksen AniPortrait-kehyksen toiminnasta. Kuten voidaan havaita, AniPortrait-kehyksessä poistetaan ensin 3D-kasvomalli ja pään asento äänestä ja heijastetaan ne järjestykseen 2D-avainpisteisiin. Toisessa vaiheessa kehyksessä käytetään diffuusiomallia muuttaakseen 2D-avainpisteet muotokuvavideoksi, ja kaksi vaihetta koulutetaan rinnakkain verkossa.

Audio2Lmk
Jokaiselle puheenäytteelle AniPortrait-kehyksen ensisijainen tavoite on ennustaa vastaava 3D-kasvomallijärjestys vektorimuodossa käännöksellä ja kiertoalueella. AniPortrait-kehyksessä käytetään esikoulutettua wav2vec-menetelmää äänipiirteiden poistamiseen, ja malli osoittaa korkean yleistymiskyvyn ja pystyy tunnistamaan intonaation ja ääntämisen äänestä tarkasti, mikä on ratkaisevan tärkeää realistisen kasvojen animaation luomisessa. Hyödyntämällä hankittuja vankkoja äänipiirteitä AniPortrait-kehyksessä voidaan käyttää yksinkertaista arkkitehtuuria, joka koostuu kahdesta fc-kerroksesta, muuttaakseen nämä piirteet 3D-kasvomalleiksi. AniPortrait-kehyksessä huomataan, että tämä suoraviivainen suunnittelu, jota malli toteuttaa, parantaa sekä Inferenssiprojektin tehokkuutta että tarkin luotettavuutta. Kun ääntä muunnetaan asentoon, AniPortrait-kehyksessä käytetään samaa wav2vec-verkkoa runkona, vaikka malli ei jaa painoja ääni-malli-moduulin kanssa. Tämä johtuu siitä, että asento liittyy enemmän äänen sävyyn ja rytmiin, jolla on erilainen painopiste verrattuna ääni-malli-tehtäviin. Ottaakseen huomioon edellisten tilojen vaikutuksen, AniPortrait-kehyksessä käytetään transformer-dekooderia asentojärjestyksen dekoodaamiseen. Tämän prosessin aikana kehyksessä integroidaan äänipiirteet dekooderiin cross-attention-mekanismeja käyttäen, ja molemmat moduulit koulutetaan L1-hävikillä. Kun malli saa asennon ja mallijärjestyksen, se käyttää perspektiiviprojektia muuttaakseen nämä järjestykset 2D-maamerkkijärjestykseksi, jota käytetään syötteinä seuraavassa vaiheessa.
Lmk2Video
Jokaiselle viittaamiskuvalle ja maamerkkijärjestykselle ehdotetun Lmk2Video-moduulin tavoitteena on luoda ajallisesti yhdenmukainen muotokuvanimaatio, joka on linjassa maamerkkijärjestyksen kanssa, ja jolla on ulkonäkö, joka on yhdenmukainen viittaamiskuvan kanssa, ja lopulta kehyksessä edustetaan muotokuvanimaatiota muotokuvakehysjärjestyksenä. Lmk2Video-verkkorakenteen suunnittelu perustuu olemassa olevaan AnimateAnyone-kehykseen. AniPortrait-kehyksessä käytetään Stable Diffusion 1.5:ää, erittäin voimakasta diffuusiomallia, runkona, ja sisällytetään ajallinen liikemoduuli, joka muuttaa monikehyksisen melun syötteen videokehyksjärjestykseksi. Samanaikaisesti ReferencenNet-verkkokomponentti heijastaa Stable Diffusion 1.5:n rakennetta ja käyttää sitä viittaamiskuvasta ulkonäön tiedon poistamiseen ja integroi sen runkoon. Strateginen suunnittelu varmistaa, että kasvojen ID säilyy koko tulostusvideossa. Eroon AnimateAnyone-kehyksestä AniPortrait-kehyksessä parannetaan PoseGuiderin suunnittelun monimutkaisuutta. Alkuperäinen AnimateAnyone-kehyksen versio koostuu vain muutamasta konvoluutiokehystä, jonka jälkeen maamerkkipiirteet yhdistyvät latenteihin rungon syötekerroksessa. AniPortrait-kehyksessä havaitaan, että tämä suunnittelu ei riitä hienojen huulien liikkeiden tallentamiseen, ja ratkaisemaan tämän ongelman kehyksessä otetaan käyttöön ConvNet-arkkitehtuurin moniskaalainen strategia, ja maamerkkipiirteitä vastaavista skaalaa sisällytetään eri lohkoihin rungossa. Lisäksi AniPortrait-kehyksessä esitetään lisäparannus, jossa viittaamiskuvan maamerkit sisällytetään lisäsyötteinä. PoseGuider-komponentin cross-attention-moduuli mahdollistaa vuorovaikutuksen kunkin kehyksen kohde- ja viittaamismaamerkkien välillä. Tämä prosessi antaa verkolle lisäviitteitä ymmärtääkseen ulkonäön ja kasvojen maamerkkien välisen suhteen, mikä auttaa muotokuvanimaatioiden luomisessa tarkemmalla liikkeellä.
AniPortrait: Toteutus ja Tulos
Audio2Lmk-vaiheessa AniPortrait-kehyksessä käytetään wav2vec2.0-komponenttia runkona ja hyödynnetään MediaPipe-arkkitehtuuri 3D-mallien ja 6D-asentojen poistamiseen merkinnöistä. Malli hankkii koulutusdatan Audio2Mesh-komponentille sisäisestä tietokannasta, joka sisältää noin 60 minuutin korkealaatuista puhetta yhden puhujan äänellä. Varmistamaan, että MediaPipe-komponentti poistaa 3D-mallin, ääninäyttelijä ohjeistetaan katsomaan kameraa ja pitämään päänsä vakaana koko äänitysprosessin ajan. Lmk2Video-moduulissa AniPortrait-kehyksessä toteutetaan kaksivaiheinen koulutuslähestymistapa. Ensimmäisessä vaiheessa kehyksessä koulutetaan ReferenceNet ja PoseGuider, rungon 2D-komponentti, ja jätetään liikemoduuli pois. Toisessa vaiheessa AniPortrait-kehyksessä jäädytetään kaikki muut komponentit ja koulutetaan liikemoduulia. Tässä vaiheessa kehyksessä käytetään kahta suurta laadukasta kasvovideotietokantaa mallin kouluttamiseen, ja kaikki data prosessoidaan MediaPipe-komponentilla 2D-kasvojen maamerkkien poistamiseksi. Lisäksi kehyksessä erottellaan ylä- ja alahuulet eri väreillä renderoidessa posekuva 2D-maamerkeistä, jotta verkko olisi herkempi huulien liikkeille.
Kuten seuraavasta kuvasta voidaan nähdä, AniPortrait-kehyksessä generoidaan sarja animaatioita, jotka osoittavat korkean laadun ja realismin.

Kehyksessä sitten hyödynnetään välitöntä 3D-edustusta, jota voidaan muokata tuloksen mukaan. Esimerkiksi käyttäjät voivat poistaa maamerkit tietystä lähteestä ja muuttaa niiden ID:tä, mikä mahdollistaa AniPortrait-kehykselle kasvojen uudelleenjärjestelyvaikutuksen luomisen.
Lopputulet
Tässä artikkelissa olemme puhuneet AniPortraitista, uudesta kehyksestä, joka on suunniteltu luomaan korkealaatuista animaatioita viittaamalla muotokuvakuvaan ja ääninäytteeseen. Vain viittaamalla kuvaan ja ääniklippiin AniPortrait-kehyksessä voidaan generoida muotokuvavideo, jossa on luonnollinen pään liike ja sileä huulien liike. Hyödyntämällä diffuusiomallin vankkoja yleistymiskykyjä AniPortrait-kehyksessä generoidaan animaatioita, jotka osoittavat uskomattoman realistisen kuvanlaadun ja elävän liikkeen. AniPortrait-kehyksen toiminta on jaettu kahteen vaiheeseen. Ensimmäisessä vaiheessa AniPortrait-kehyksessä poistetaan välitöntä 3D-edustusta ääninäytteistä ja heijastetaan se järjestykseen 2D-kasvojen maamerkkejä. Tämän jälkeen kehyksessä käytetään vankkaa diffuusiomallia yhdessä liikemoduulin kanssa muuttaakseen maamerkkijärjestyksen ajallisesti yhdenmukaisiksi ja fotorealistisiksi animaatioiksi. Kokeelliset tulokset osoittavat AniPortrait-kehyksen ylivoimaisuuden ja kyvyn luoda korkealaatuista animaatioita poikkeuksellisen visuaalisen laadun, asentojen monimuotoisuuden ja kasvojen luonnollisuuden kanssa, tarjoten siten parannetun ja rikastetun havaintokokemuksen. Lisäksi AniPortrait-kehyksellä on merkittävä potentiaali hallittavuuden ja joustavuuden suhteen, ja sitä voidaan soveltaa tehokkaasti alueilla, kuten kasvojen uudelleenjärjestelyssä, kasvojen liikkeen editoinnissa ja muissa.












