Andersonin kulma

Hunyuan-videoiden synty

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

Jonkin verran tässä käsiteltävän aineiston luonteen vuoksi tämä artikkeli sisältää vähemmän viitteellisiä linkkejä ja kuvia kuin yleensä.

Jotain merkittävää tapahtuu parhaillaan tekoälysynthesoidun videoyhteisössä, vaikka sen merkitys saattaa kestää jonkin aikaa selvitä. Harrastajat kouluttavat generatiivisia tekoälyvideo-malleja jäljittelemään ihmisten kaltaisia, käyttäen video-pohjaisia LoRAs Tencentin äskettäin julkaisemalla avoimella Hunyuan Video -kehyksellä.*

Paina toistaa. Monipuoliset tulokset Hunyuan-pohjaisista LoRA-mukautuksista ovat vapaasti saatavilla Civit-yhteisössä. Kouluttamalla matalan tasoisia sopeutumismalleja (LoRAs), aiheuttavat ongelmia aikaskaalan vakaudessa, jotka ovat vaivanneet tekoälyvideoiden synteesiä kaksi vuotta, ovat merkittävästi vähentyneet. Lähteet: civit.ai

Yllä olevassa videossa, Natalie Portmanin, Christina Hendricksin ja Scarlett Johanssonin näyttelijöiden sekä teknologiajohtaja Elon Muskin kaltaiset henkilöhahmot on koulutettu suhteellisen pieniin lisätiedostoihin Hunyuan-generatiiviselle videosysteemille, joka voidaan asentaa sisällön suodattimien (kuten NSFW-suodattimien) ulkopuolelle käyttäjän tietokoneelle.

Christina Hendricksin LoRA:n luoja kertoo, että vain 16 kuvaa Mad Men -televisiosarjasta oli tarpeen mallin kehittämiseen (joka on vain 307 Mt lataus); useat viestit Stable Diffusion -yhteisössä Redditissä ja Discordissa vahvistavat, että tällaiset LoRAs eivät vaadi suuria määriä koulutusdataa tai pitkiä koulutusajoja useimmissa tapauksissa.

Paina toistaa. Arnold Schwarzenegger herätetään henkiin Hunyuan-videossa LoRA:lla, jota voi ladata Civitistä. Katso https://www.youtube.com/watch?v=1D7B9g9rY68 tarkemmat Arnie-esimerkit, tekoälyharrastaja Bob Doylelta.

Hunyuan LoRAs voidaan kouluttaa joko staattisilla kuvilla tai videoilla, vaikka videoiden kouluttaminen vaatii enemmän laitteistorajoituksia ja pidentää koulutusaikaa.

Hunyuan Video -malli sisältää 13 miljardia parametriä, joka ylittää Soran 12 miljardin parametrin, ja ylittää merkittävästi vähemmän kykenevän Hunyuan-DiT -mallin, joka julkaistiin avoimena lähdekoodina kesällä 2024, ja jolla on vain 1,5 miljardia parametriä.

Kuten tapahtui kaksi ja puoli vuotta sitten Stable Diffusionin ja LoRA:n (katso esimerkkejä Stable Diffusion 1.5:n “alkuperäisistä” julkkiksista täällä) kanssa, perusmalli on paljon rajallisempi ymmärtäessään julkkisten persoonallisuutta verrattuna siihen, mitä voidaan saavuttaa “ID-injektoitujen” LoRA-toteutusten kautta.

Todellisuudessa kustomoitu, persoonallisuuteen keskittyvä LoRA saa “ilmaisen liftin” perus-Hunyuan-mallin merkittävistä synteesikyvyistä, tarjoten huomattavasti tehokkaamman ihmisen synteesin kuin mitä voidaan saavuttaa joko 2017-vuoden autoencoder-deepfake:lla tai yrittämällä lisätä liikettä staattisiin kuviin järjestelmien kautta, kuten LivePortrait.

Kaikki tässä esitetyt LoRAs voidaan ladata ilmaiseksi Civit-yhteisöstä, kun taas suurempi määrä vanhoja, kustomoituja “staattisia kuva” -LoRAs voidaan myös potentiaalisesti luoda “siemen”-kuviksi videon luomisprosessiin (ts. kuva-videolle, odottaa Hunyuan-videon julkaisua, vaikka työskentelyratkaisuja on mahdollista).

Paina toistaa. Yllä, näytteitä “staattisesta” Flux LoRA:sta; alla, esimerkkejä Hunyuan-videosta LoRA:sta, jossa on muusikko Taylor Swift. Nämä LoRAs ovat vapaasti saatavilla Civit-yhteisössä.

Kun kirjoitan, Civit-sivusto tarjoaa 128 hakutulosta “Hunyuan” * -hakusanalle. Lähes kaikki näistä ovat jollain tavoin NSFW-malleja; 22 kuvaavat julkkisia; 18 on suunniteltu helpottamaan kovaa pornografiaa; ja vain seitsemän kuvaavat miehiä naisia vastaan.

Mikä on uutta?

Joidenkin käsiteltävän aineiston luonteen vuoksi tämä artikkeli sisältää vähemmän viitteellisiä linkkejä ja kuvia kuin yleensä. Tekoälysynthesoidun videoyhteisössä tapahtuu parhaillaan jotain merkittävää, vaikka sen merkitys saattaa kestää jonkin aikaa selvitä. Harrastajat kouluttavat generatiivisia tekoälyvideo-malleja jäljittelemään ihmisten kaltaisia, käyttäen video-pohjaisia LoRAs Tencentin äskettäin julkaisemalla avoimella Hunyuan Video -kehyksellä.*

Tässä on joitain avaineroja eroja Hunyuan LoRA:n ja aiempien lähestymistapojen välillä.

1: Rajaton paikallinen asennus

Hunyuan Videon tärkein asia on se, että se voidaan ladata paikallisesti, ja se antaa hyvin voimakkaan ja sensorittoman tekoälyvideoiden synteesijärjestelmän sekä harrastelijoille että VFX-yhteisölle (sillä laajuudella, kuin luvat sallivat alueellisesti).

Viimeksi tämä tapahtui, kun Stable Diffusion julkaistiin avoimena lähdekoodina kesällä 2022. Tuolloin OpenAI:n DALL-E2 oli kaapannut julkisen mielikuvituksen, vaikka DALLE-2 oli maksullinen palvelu, jolla oli merkittäviä rajoituksia (joita ajan myötä laajennettiin).

Kun Stable Diffusion tuli saataville, ja Low-Rank Adaptation mahdollisti kuvien synteesin minkä tahansa henkilön identiteetistä (julkkis tai ei), suuri kehittäjien ja kuluttajien kiinnostus auttoi Stable Diffusionia pimentämään DALLE-2:n suosiota; vaikka jälkimmäinen oli kyvykkäämpi järjestelmä valmiina, sen sensuurirutiinit nähtiin raskaina monille käyttäjille, ja mukauttaminen ei ollut mahdollista.

Väittäen, että sama skenaario koskee nyt Sora ja Hunyuan – tai tarkemmin, Sora-luokan omistajan generatiivisia videosysteemejä ja avoimia kilpailijoita, joista Hunyuan on ensimmäinen – mutta luultavasti ei viimeinen (tässä kannattaa huomioida, että Flux saavutti lopulta merkittävän edun Stable Diffusionista).

Käyttäjät, jotka haluavat luoda Hunyuan LoRA -tulostetta, mutta joilla ei ole tehokkaita laitteita, voivat aina siirtää GPU-osan koulutuksesta online-laskentapalveluihin kuten RunPod. Tämä ei ole sama kuin luominen AI-videota alustoilla, kuten Kaiber tai Kling, koska siinä ei ole semanttista tai kuvapohjaista suodatusta (sensuuria).

2: Ei tarvitse “isäntä”-videoita ja suurta ponnistelua

Kun deepfakes ilmestyivät loppuvuonna 2017, anonyymisti julkaistu koodi kehittyi mainstream-forkkeihin DeepFaceLab ja FaceSwap (sekä DeepFaceLive -järjestelmään, joka tekee deepfakes-tuotannon mahdolliseksi reaaliajassa).

Tämä menetelmä vaati tarkkaa kuraattorin toimintaa tuhansien kasvojen kuvien kokoamiseksi kullekin identiteetille, jota vaihdetaan; mitä vähemmän vaivaa tässä vaiheessa, sitä vähemmän tehokas malli olisi. Lisäksi koulutusajat vaihtelivat 2-14 päivän välillä, riippuen saatavilla olevasta laitteistosta, joka rasitti jopa kyvykkäitä järjestelmiä pitkällä aikavälillä.

Viimeaikaisemmin ROOP, LivePortrait ja useat muut samankaltaiset kehykset ovat tarjonneet saman toiminnallisuuden paljon vähemmällä vaivalla ja usein paremmilla tuloksilla – mutta ilman kykyä luoda tarkkoja täysin kehon deepfake:ja – tai mitään muuta kuin kasvoja.

Esimerkkejä ROOP Unleashed ja LivePortrait (sisennetty alhaalla vasemmalla), Bob Doylelta YouTubesta. Lähteet: https://www.youtube.com/watch?v=i39xeYPBAAM ja https://www.youtube.com/watch?v=QGatEItg2Ns

Esimerkkejä ROOP Unleashed ja LivePortrait (sisennetty alhaalla vasemmalla), Bob Doylelta YouTubesta. Lähteet: https://www.youtube.com/watch?v=i39xeYPBAAM ja https://www.youtube.com/watch?v=QGatEItg2Ns

Hunyuan LoRAs (ja samankaltaiset järjestelmät, jotka varmasti seuraavat) mahdollistavat vapaan luomisen koko maailmoista, mukaan lukien täysin kehon simulaatio käyttäjän koulutetusta LoRA-identiteetistä.

3: Massiivisesti parannettu aikaskaalan vakaus

Aikaskaalan vakaus on ollut pyhä graali diffuusiiviselle videolle jo useita vuosia. LoRA:n käyttö yhdessä sopivien ohjelmistojen kanssa antaa Hunyuan-videon synteesille jatkuvan identiteetin, johon sen on mahdollista pitäytyä. Teoriassa (nämä ovat varhaisia päiviä), voisi kouluttaa useita LoRAs erityisestä identiteetistä, kullekin eri vaatteita.

Näin ollen vaatteet ovat vähemmän todennäköisiä “mutatoitumaan” videon aikana (koska generatiivinen järjestelmä perustuu edellisten kehyksien rajoittuneeseen ikkunaan).

(Vaihtoehtoisesti, kuten kuvapohjaisissa LoRA-järjestelmissä, voidaan soveltaa useita LoRAs, kuten identiteetti + puvun LoRAs, yhteen videon synteesiin)

4: Pääsy “Ihmiskokeeseen”

Kuten olen aiemmin huomauttanut, omistajan generatiivisen tekoälysektorin näyttää olevan niin varovainen mahdollisista kritiikeistä, jotka liittyvät heidän projektien tekoälyvideoihin, että todellisia ihmisiä harvoin nähdään projektisivuilla suurten julkistusten ja julkaisujen yhteydessä. Sen sijaan liittyvät julkaisukirjallisuudet näyttävät yhä enemmän “söpöjä” ja “uhkaamattomia” aiheita syntetisoiduissa tuloksissa.

Hunyuan LoRA:n myötä yhteisöllä on nyt mahdollisuus tutkia LDM-pohjaisen ihmisen videosynteesin rajoja erittäin kyvykkäässä (ei marginaalisessa) järjestelmässä ja täysin tutkia sitä aihealuetta, joka kiinnostaa meistä useimpia – ihmisiä.

Seuraukset

Koska Civit-yhteisössä “Hunyuan” -hakusana palauttaa pääasiassa julkkisten LoRAs ja “kovia” LoRAs, Hunyuan LoRA:n keskeinen seuraus on, että niitä käytetään luomaan tekoälypornografisia (tai muuten halventavia) videoita todellisista ihmisistä – sekä julkkisista että tuntemattomista.

Tämän vuoksi harrastajat, jotka luovat Hunyuan LoRAs ja kokeilevat niitä eri Discord-palvelimilla, ovat varovaisia estämään todellisten henkilöiden esimerkkien julkaisemisen. Todellisuudessa kuva-pohjaiset deepfakes ovat jo vakavasti aseistettu; ja mahdollisuus lisätä todella realistisia videoita sekaan saattaa lopulta oikeuttaa korostetut pelot, jotka ovat olleet julkisuudessa viimeisen seitsemän vuoden ajan, ja jotka ovat johtaneet uusiin sääntöihin.

Ajavana voimana

Kuten aina, pornografia jää teknologian ajavana voimana. Mikä tahansa mielipide tällaisesta käytöstä, tämä jatkuva voimanlähde ajaa eteenpäin valtion kehitystä, joka lopulta voi hyödyttää laajempaa käyttöä.

Tässä tapauksessa hinta saattaa olla suurempi kuin yleensä, koska hyperrealistisen videon luomisen avoimet lähdekoodit ovat merkittäviä seurauksia rikollisesta, poliittisesta ja eettisestä väärinkäytöstä.

Yksi Reddit-ryhmä (jota en mainitse tässä), joka on omistettu tekoälyvideo NSFW -sisällön luomiselle, on liittynyt avoimeen Discord-palvelimeen, jossa käyttäjät kehittävät ComfyUI -työkaluja Hunyuan-pohjaisen videopornografian luomiseksi. Päivittäin käyttäjät julkaisevat esimerkkejä NSFW -klippejä – joista monet voidaan luonnehtia “ääriliikkeiksi” tai vähintään rajoittaviksi foorumin sääntöjä.

Tämä yhteisö ylläpitää myös merkittävää ja kehittynyttä GitHub-arkistoa, joka sisältää työkaluja, joilla voidaan ladata ja prosessoida pornovideoita, jotta voidaan tarjota koulutusdataa uusille malleille.

Koska paras LoRA-kouluttaja, Kohya-ss, tukee nyt Hunyuan LoRA -koulutusta, esteet vapaan generatiivisen videon koulutukselle madaltuvat päivittäin, samoin kuin Hunyuanin koulutus- ja videotuotannon laitteistovaatimukset.

Avainasiana omistajan tekoälypornografian koulutusohjelmissa (ei identiteettiin perustuvissa malleissa, kuten julkkiksissa) on, että perusmalli, kuten Hunyuan, ei ole erityisesti koulutettu NSFW-tuloksiin, ja saattaa joko suorittaa huonosti, kun pyydetään luomaan NSFW-sisältöä, tai epäonnistua erottamaan oppimansa käsitteet ja assosiaatiot suorituskykyisellä tai vakuuttavalla tavalla.

Kehittämällä hienosäädettyjä NSFW-perusmalleja ja LoRAs, on mahdollista projisoida koulutettuja identiteettejä omistajan “pornovideo”-alueelle; kaiken kaikkiaan tämä on vain videoversio siitä, mitä on jo tapahtunut kuvissa viimeisten kahden ja puolen vuoden aikana.

VFX

Hunyuan Video LoRA:n tarjoama suuri parannus aikaskaalan vakaudessa on ilmeinen etu tekoälyvisuaaliefektien teollisuudelle, joka nojautuu voimakkaasti avoimien lähdekoodien sopeuttamiseen.

Vaikka Hunyuan Video LoRA -lähestymistapa luo koko kehyksen ja ympäristön, visuaaliefektiyhtiöt ovat todennäköisesti jo alkaneet kokeilla eristämistä aikaskaalan mukaisia ihmisten kasvoja, joita voidaan saada tällä menetelmällä, jotta ne voidaan yhdistää tai integroida todellisiin lähdekehyksiin.

Kuten harrastelijayhteisö, visuaaliefektiyhtiöt on odottava Hunyuan-videon kuvasta-videolle ja videosta-videolle -toiminnallisuutta, joka on potentiaalisesti hyödyllisin silta LoRA-ohjatuissa, ID-pohjaisissa “deepfake” -sisällöissä; tai keksivät ja käyttävät väliaikaisratkaisuja ja tutkivat järjestelmän ulkopuolisia kykyjä ja mahdollisia omistajan sisäisiä forkkeja Hunyuan Videosta.

Lisenssiehdot Hunyuan Videolle kieltävät sen käytön EU:ssa, Yhdistyneessä kuningaskunnassa ja Etelä-Koreassa. “Las Vegasin periaatteella” tämä ei välttämättä tarkoita, että Hunyuan Videota ei käytetä näissä alueissa; kuitenkin ulkoisten tietojen tarkastusten mahdollisuus, joilla valvotaan kasvavaa sääntelyä tekoälystä, saattaa tehdä laitonta käyttöä riskialttiiksi.

Toinen potentiaalisesti epäselvä alue lisenssiehdoissa on:

‘Jos Tencent Hunyuan -version julkaisupäivänä kaikkien tuotteiden tai palvelujen kuukausittaiset aktiiviset käyttäjät, jotka on julkaistu tai tehty lisenssinhaltijalle, ovat yli 100 miljoonaa kuukausittaista aktiivista käyttäjää edellisen kalenterikuukauden aikana, sinun on pyydettävä lisenssiä Tencentilta, jonka Tencent voi myöntää sinulle omalla harkintansa mukaan, ja sinä et ole valtuutettu harjoittamaan mitään oikeuksia tämän sopimuksen mukaisesti, ellei Tencent muuta tavoin nimenomaisesti myönnä sinulle näitä oikeuksia.’

Tämä pykälä on selvästi suunnattu monille yrityksille, jotka todennäköisesti “välikäden” Hunyuan Videota suhteellisen teknologisesti heikolle käyttäjäkunnalle, ja jotka vaaditaan jakamaan Tencentin toiminnan tietyn käyttäjäkynnyksen yläpuolella.

On epäselvää, voitaisiinko laajan sanamuodon myös tulkita “epäsuoraksi” käytöksi (ts. Hunyuan-käyttöä visuaalisten efektiiden kautta suositussa elokuvassa ja TV-sarjassa); tämä saattaa vaatia selvennystä.

Johtopäätös

Koska deepfake-videot ovat olleet olemassa jo kauan, on helppo aliarvioida Hunyuan Video LoRA:n merkitystä lähestymistapana identiteetin synteesiin ja deepfakingiin; ja olettaa, että nykyiset ponnistelut, jotka ilmenevät Civit-yhteisössä, liittyvät Discordeihin ja alaryhmiin, edustavat vain pientä askelta kohti täysin hallittavissa olevaa ihmisen videosynteesiä.

Todennäköisemmin nykyiset ponnistelut edustavat vain osaa Hunyuan-videon potentiaalista luoda täysin vakuuttavia täysin kehon ja täysin ympäristön deepfakeja; kun kuvasta-videolle -komponentti julkaistaan (jota huhutaan tapahtuvan tässä kuussa), paljon tarkempi generatiivinen voima tulee saataville sekä harrastelijoille että ammattilaisille.

Kun Stability.ai julkaisi Stable Diffusionin vuonna 2022, monet tarkkailijat eivät voineet määritellä, miksi yhtiö antaisi niin arvokkaan ja voimakkaan generatiivisen järjestelmän. Hunyuan-videon kohdalla voittonaikaiset motiivit on sisäänrakennettu lisenssiin – vaikka se saattaa osoittautua vaikeaksi Tencentille määritellä, kun yritys laukaisee voittorajan.

Joka tapauksessa lopputulos on sama kuin vuonna 2022: omistajan kehitysyhteisöt ovat muodostuneet välittömästi ja voimakkaasti julkaisun ympärille. Jotkut tiet, joille nämä ponnistelut johtavat, ovat varmasti aiheuttavat uusia otsikoita seuraavien 12 kuukauden aikana.

 

* Jopa 136 julkaisuhetkeen mennessä.

Alun perin julkaistu tiistaina, 7. tammikuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai