Andersonin kulma

AI-videot tekee kissan itsestÃĪÃĪn tÃĪydelliseksi

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa
A still from a demo video for the paper 'Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models', depicting a POV of a 'cat selfie', while a dog skateboards in the background. Source: https://vita-epfl.github.io/FVG/

AI-videogeneraattorit antavat usein tuloksia, jotka ovat lÃĪhellÃĪ, mutta eivÃĪt aivan oikein, kun on kyse siitÃĪ, mitÃĪ tekstiprompt haluaa. Mutta uusi korkean tason korjaus tekee kaiken eron.

 

Generatiiviset videosysteemit usein kÃĪrsivÃĪt siitÃĪ, ettÃĪ ne eivÃĪt pysty luomaan todella luovia tai villiÃĪ videoita, ja usein epÃĪonnistuvat tÃĪyttÃĪmÃĪÃĪn kÃĪyttÃĪjien tekstipromptien odotuksia.

Osasyy tÃĪhÃĪn on entanglement – se, ettÃĪ visio/kielimallit joutuvat tinkimÃĪÃĪn siitÃĪ, kuinka kauan ne koulutetaan lÃĪhdemateriaalilla. Liian vÃĪhÃĪn koulutusta, ja kÃĪsitteet ovat joustavia, mutta eivÃĪt tÃĪysin muodostuneita – liian paljon, ja kÃĪsitteet ovat tarkkoja, mutta eivÃĪt enÃĪÃĪ joustavia tarpeeksi uusien yhdistelmien luomiseen.

Voit saada idean videosta, joka on upotettu alla. Vasemmalla on tyyppi kompromissi, jota monet AI-jÃĪrjestelmÃĪt toimittavat vaativan promptin (prompt on videon ylÃĪreunassa kaikissa neljÃĪssÃĪ esimerkissÃĪ) vastauksena, joka pyytÃĪÃĪ jotain elementtien yhdistÃĪmistÃĪ, joka on liian fantastinen ollakseen ollut todellinen koulutusesimerkki. Oikealla on AI-tulos, joka noudattaa promptia paljon paremmin:

Klikkaa toistaa (ei ÃĪÃĪntÃĪ). Oikealla nÃĪemme ‘factorized’ WAN 2.2:n toimivan promptien mukaan, verrattuna ‘vanillan’ Wan 2.2:een vasemmalla. Viittaa alkuperÃĪisiin videoihin paremman resoluution ja enemmÃĪn esimerkkejÃĪ, vaikka kuratoidut versiot, jotka nÃĪkyvÃĪt tÃĪÃĪllÃĪ, eivÃĪt ole olemassa projekti-sivustolla, ja ne on koottu tÃĪtÃĪ artikkelia varten. LÃĪhde

Hyvin, vaikka meidÃĪn on annettava anteeksi taputtava ankan ihmiskÃĪdet (!), on selvÃĪÃĪ, ettÃĪ oikeanpuoleiset esimerkit noudattavat alkuperÃĪistÃĪ tekstipromptia paljon paremmin kuin vasemmanpuoleiset.

Mielenkiintoista on, ettÃĪ molemmat arkkitehtuurit ovat kÃĪytÃĪnnÃķssÃĪ samat – suosittu ja erittÃĪin kykyinen Wan 2.2, kiinalainen julkaisu, joka on saavuttanut merkittÃĪvÃĪÃĪ menestystÃĪ avoimen lÃĪhdekoodin ja harrastajayhteisÃķissÃĪ tÃĪnÃĪ vuonna.

ErillisyyttÃĪ on se, ettÃĪ toinen generatiivinen putki on factorized, mikÃĪ tarkoittaa, ettÃĪ suuri kielen malli (LLM) on kÃĪytetty uudelleen tulkkaamaan ensimmÃĪistÃĪ (siemen) kehykstÃĪ videosta, jotta se olisi paljon helpompi jÃĪrjestelmÃĪlle toimittaa, mitÃĪ kÃĪyttÃĪjÃĪ pyytÃĪÃĪ.

TÃĪmÃĪ â€˜visuaalinen ankkurointi’ sisÃĪltÃĪÃĪ kuvan, joka on tehty tÃĪstÃĪ LLM-parannetusta promptista, generatiiviseen putkeen ‘alkukehys’ -muodossa, ja kÃĪyttÃĪÃĪ LoRA -tulkkausmallia auttamaan ‘intrusiivisen’ kehyksen integroimisessa video-luomisprosessiin.

Tulokset ovat melko merkittÃĪviÃĪ prompt-uskollisuuden suhteen, erityisesti ratkaisu, joka nÃĪyttÃĪÃĪ melko elegantilta:

Klikkaa toistaa (ei ÃĪÃĪntÃĪ). LisÃĪÃĪ esimerkkejÃĪ â€˜factorized’ videoista, jotka todella noudattavat kÃĪsikirjoitusta. Viittaa alkuperÃĪisiin videoihin paremman resoluution ja enemmÃĪn esimerkkejÃĪ, vaikka kuratoidut versiot, jotka nÃĪkyvÃĪt tÃĪÃĪllÃĪ, eivÃĪt ole olemassa projekti-sivustolla, ja ne on koottu tÃĪtÃĪ artikkelia varten.

TÃĪmÃĪ ratkaisu tulee uuden tutkimuksen muodossa Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, ja sen videoilla tÃĪydentÃĪvÃĪn projektisivuston.

Vaikka useat nykyiset jÃĪrjestelmÃĪt yrittÃĪvÃĪt parantaa prompt-tarkkuutta kÃĪyttÃĪmÃĪllÃĪ kielen malleja uudelleenkirjoittamaan epÃĪmÃĪÃĪrÃĪisiÃĪ tai alimÃĪÃĪrÃĪisiÃĪ tekstipromptteja, uusi tutkimus vÃĪittÃĪÃĪ, ettÃĪ tÃĪmÃĪ strategia johtaa edelleen epÃĪonnistumiseen, kun mallin s sisÃĪinen kohteen esitys on viallinen.

Even with a detailed rewritten prompt, text-to-video-mallit usein miscompose avain elementtejÃĪ tai generoivat epÃĪyhteensopivia alkutiloja, jotka rikkovat animaation logiikkaa. Kunnes ensimmÃĪinen kehys ei heijasta, mitÃĪ prompt kuvailee, tuloksena oleva video ei voi palautua, riippumatta siitÃĪ, kuinka hyvÃĪ liikemalli on.

Tutkimus toteaa*:

‘[Text-to-video] -mallit tuottavat usein jakautuneita kehyksiÃĪ, mutta saavuttavat silti [arviointipisteet] verrattavissa I2V-malleihin, osoittaen, ettÃĪ heidÃĪn liikemallinsa on edelleen kohtuullisen luonnollinen, vaikka kohteen uskollisuus on suhteellisen huono.

‘[Image-to-Video] -mallit osoittavat vastakkaisen kÃĪyttÃĪytymisen, vahvat [arviointipisteet] tarkoista alkukohtauksista ja heikompi aikasuhteellinen yhdenmukaisuus, kun taas I2V + teksti tasapainottaa molempia nÃĪkÃķkohtia.

‘TÃĪmÃĪ kontrasti viittaa struktuuriseen epÃĪilyyn nykyisissÃĪ T2V-malleissa: kohteen kiinnittÃĪminen ja aikasuhteellinen synteesi hyÃķtyvÃĪt erillisistÃĪ induktiivisista vinoumista, mutta olemassa olevat arkkitehtuurit yrittÃĪvÃĪt oppia molemmat samanaikaisesti yhden mallin sisÃĪllÃĪ.’

Diagnostinen vertailu generoimistiloja osoitti, ettÃĪ mallit ilman eksplisiittistÃĪ kohteen kiinnittÃĪmistÃĪ saavuttivat hyvÃĪt tulokset liikkeessÃĪ, mutta usein tinkivÃĪt kohteen asettelussa, kun taas kuva-ehtoiset lÃĪhestymistavat osoittivat vastakkaisen mallin:

Vertailu video-generoimistiloja kahdessa tietokannassa, osoittaen, ettÃĪ I2V + teksti saavuttaa parhaan kehyslaadun (FID) ja aikasuhteellisen yhdenmukaisuuden (FVD), korostaen erottelun hyÃķtyÃĪ kohteen rakentamisesta ja liikkeen synteesistÃĪ.

Vertailu video-generoimistiloja kahdessa tietokannassa, osoittaen, ettÃĪ I2V + teksti saavuttaa parhaan kehyslaadun (FID) ja aikasuhteellisen yhdenmukaisuuden (FVD), korostaen erottelun hyÃķtyÃĪ kohteen rakentamisesta ja liikkeen synteesistÃĪ. LÃĪhde

NÃĪmÃĪ tulokset osoittavat, ettÃĪ nykyiset mallit yrittÃĪvÃĪt oppia sekÃĪ kohteen asettelun ettÃĪ animaation samanaikaisesti, vaikka nÃĪmÃĪ tehtÃĪvÃĪt vaativat erilaisia induktiivisia vinoumia ja ovat paremmin hoidettavissa erikseen.

On mielenkiintoista, ettÃĪ tÃĪmÃĪ â€˜temppu’ voidaan soveltaa paikallisiin asennuksiin malleja, kuten Wan 2.1 ja 2.2, ja samankaltaisiin video-diffuusiomalleihin, kuten Hunyuan Video. Anekdoottisesti, vertaamalla harrastajien tuotosten laatua kaupallisiin generatiivisiin portaalien, kuten Klingin ja Runwayn, useimmat suuret API-toimittajat parantavat avoimen lÃĪhdekoodin tarjoajia, kuten WAN:ia, LoRA:illa, ja – nÃĪyttÃĪÃĪ siltÃĪ â€“ temppujen avulla, joita nÃĪhdÃĪÃĪn uudessa tutkimuksessa. TÃĪmÃĪ lÃĪhestymistapa voi edustaa tasapainoa vapaan ja avoimen lÃĪhdekoodin osapuolelle.

Kokeet, jotka tehtiin menetelmÃĪllÃĪ, osoittivat, ettÃĪ tÃĪmÃĪ yksinkertainen ja modulaarinen lÃĪhestymistapa tarjoaa uuden tilanhuipun T2V-CompBench -mittauksessa, parantaen kaikkia testattuja malleja merkittÃĪvÃĪsti. Tutkijat toteavat johtopÃĪÃĪtÃķksessÃĪÃĪn, ettÃĪ vaikka heidÃĪn jÃĪrjestelmÃĪnsÃĪ radikaalisti parantaa uskollisuutta, se ei koske (eikÃĪ ole tarkoitettu koskemaan) identiteetin siirtymistÃĪ, joka on tÃĪllÃĪ hetkellÃĪ generatiivisen AI-tutkimuksen ongelmia.

Uusi tutkimus tulee neljÃĪltÃĪ tutkijalta Ecole Polytechnique FÃĐdÃĐrale de Lausannessa (EPFL) SveitsissÃĪ.

MenetelmÃĪ ja data

Uuden tekniikan keskeinen vÃĪite on, ettÃĪ teksti-videodiffuusiomalleja on “ankkuroida” aloituskohdaksi, joka vastaa todella tekstipromptia.

Jotta malli kunnioittaa aloituskohdaksi, uusi menetelmÃĪ keskeyttÃĪÃĪ standardin diffuusioprosessin injektoimalla puhdas latentin ankkurikuvasta aikavÃĪlillÃĪ nolla, korvaamalla yhden tavallisen meluisan syÃķtteen. TÃĪmÃĪ outo syÃķte hÃĪmmÃĪstyttÃĪÃĪ mallia aluksi, mutta vÃĪhÃĪisellÃĪ LoRA hienosÃĪÃĪtÃķllÃĪ se oppii kohdellemaan injektoidun kehyksen kiinteÃĪnÃĪ visuaalisena ankkurina eikÃĪ osana meluisaa polkua:

Kaksivaiheinen menetelmÃĪ teksti-videon generoimiseen visuaalisella ankkurilla: Vasemmalla malli on hienosÃĪÃĪtelty kevyellÃĪ LoRA:lla, jotta se kohdeltaisi injektoidun puhdaslatentin kiinteÃĪnÃĪ kohteen rajoituksena. Oikealla prompt on jaettu ensimmÃĪisen kehyksen kuvaukseksi, jota kÃĪytetÃĪÃĪn ankkurikuvan luomiseen, joka ohjaa videota.

Kaksivaiheinen menetelmÃĪ teksti-videon generoimiseen visuaalisella ankkurilla: Vasemmalla malli on hienosÃĪÃĪtelty kevyellÃĪ LoRA:lla, jotta se kohdeltaisi injektoidun puhdaslatentin kiinteÃĪnÃĪ kohteen rajoituksena. Oikealla prompt on jaettu ensimmÃĪisen kehyksen kuvaukseksi, jota kÃĪytetÃĪÃĪn ankkurikuvan luomiseen, joka ohjaa videota.

JohtopÃĪÃĪtÃķksessÃĪ menetelmÃĪ kirjoittaa promptin uudelleen kuvaamaan vain ensimmÃĪistÃĪ kehystÃĪ, kÃĪyttÃĪen LLM:ÃĪÃĪ, jotta se poistaa uskottavan alkutilan, joka keskittyy asettelun ja ulkonÃĪÃķn.

TÃĪmÃĪ uudelleenkirjoitettu prompt on vÃĪlitetty kuvaluojalle, jotta se voi tuottaa ehdokasankkurikehyksen (jota voidaan valinnaisesti parantaa kÃĪyttÃĪjÃĪn toimesta). Valittu kehys on koodattu latenteiksi ja injektoida diffuusioprosessiin korvaamalla ensimmÃĪisen aikavÃĪlin, jolloin malli voi generoida loput videosta pysyen ankkurissa alkutilassa – prosessi, joka toimii ilman, ettÃĪ perusrakennetta on muutettu.

Prosessi testattiin luomalla LoRA:ja Wan2.2-14B:lle, Wan2.1-1B:lle ja CogVideo1.5-5B:lle. LoRA-koulutus suoritettiin sijalla 256, 5000:lle satunnaisesti nÃĪytteille otetulle klipille UltraVideo -kokoelmasta.

Koulutus kesti 6000 askelta, ja vaati 48 GPU-tuntia† Wan-1B:lle ja CogVideo-5B:lle, ja 96 GPU-tuntia Wan-14B:lle. Tutkijat toteavat, ettÃĪ Wan-5B tukee luonnostaan teksti-vain ja teksti-kuva -ehtoja (joita tÃĪssÃĪ tapauksessa pakotetaan vanhempiin kehyksiin), ja siksi ei vaadi mitÃĪÃĪn hienosÃĪÃĪtÃķÃĪ.

Kokeet

Kokeissa, jotka suoritettiin prosessille, jokainen tekstiprompt on aluksi parannettu Qwen2.5-7B-Instruct:lla, joka kÃĪytti tulosta luomaan yksityiskohtaisen ‘siemenkuva’ -kuvauksen, joka sisÃĪlsi koko kohteen kuvauksen. TÃĪmÃĪ kuvauksen osa vÃĪlitettiin QwenImage:lle, joka sai tehtÃĪvÃĪkseen generoida ‘taikakehyksen’, joka sitten interposoidaan diffuusioprosessiin.

Vertailumittareina, joilla arvioitiin jÃĪrjestelmÃĪÃĪ, olivat mainittu T2V-CompBench, joka testasi kohteen ymmÃĪrtÃĪmistÃĪ pisteyttÃĪmÃĪllÃĪ, kuinka hyvin mallit sÃĪilyttivÃĪt objekteja, attribuutteja ja toimintoja yhdenmukaisessa kohtauksessa; ja VBench 2.0, joka arvioi laajempaa pÃĪÃĪttelyÃĪ ja johdonmukaisuutta 18 mittarilla, jotka on ryhmitelty luovuuden, yhteisenÃĪ pÃĪÃĪttely, ohjattavuuden, ihmisen uskollisuuden ja fysiikan osalta:

Kaikissa seitsemÃĪssÃĪ T2V-CompBenchin arviointiluokassa factorisoitu T2V-menetelmÃĪ ylitti sekÃĪ standardin ettÃĪ ylÃķsotetun T2V-vertailuversion kaikissa testatuissa malleissa, saavuttaen jopa 53,25 prosentin parannuksen. Korkeimmin pisteytetyt variantit usein vastasivat tai ylittivÃĪt PixVerse-V3-benchmarkin.

Kaikissa seitsemÃĪssÃĪ T2V-CompBenchin arviointiluokassa factorisoitu T2V-menetelmÃĪ ylitti sekÃĪ standardin ettÃĪ ylÃķsotetun T2V-vertailuversion kaikissa testatuissa malleissa, saavuttaen jopa 53,25 prosentin parannuksen. Korkeimmin pisteytetyt variantit usein vastasivat tai ylittivÃĪt PixVerse-V3-benchmarkin.

Tutkijat toteavat tÃĪstÃĪ alkuvaiheesta*:

‘Kaikissa malleissa ankkurikuvan lisÃĪÃĪminen parantaa johdonmukaisuutta. Kaikki pienemmÃĪt factorisoidut mallit (CogVideo 5B, Wan 5B ja Wan 1B) ylittÃĪvÃĪt suuremman Wan 14B T2V-mallin.

‘MeidÃĪn factorisoitu Wan 5B ylittÃĪÃĪ myÃķs kaupallisen PixVerse-V3-vertailuversion, joka on paras ilmoitettu malli benchmarkissa. TÃĪmÃĪ osoittaa, ettÃĪ visuaalinen ankkurointi parantaa merkittÃĪvÃĪsti kohteen ja toiminnan ymmÃĪrtÃĪmistÃĪ, jopa pienempiÃĪ kapasiteettia olevissa malleissa.

‘Jokaisen malliperheen sisÃĪllÃĪ factorisoitu versio ylittÃĪÃĪ alkuperÃĪisen mallin. Huomattavaa on, ettÃĪ meidÃĪn kevyt ankkuriohjattu LoRA WAN 14B:llÃĪ saavuttaa suorituskyvyn, joka on verrattavissa sen esikoulutetun I2V 14B -variantin kanssa (0,661 vs. 0,666), vaikka se ei vaadi tÃĪydellistÃĪ uudelleenkoulutusta.’

Seuraava oli VBench2.0-kierros:

Factorisoitu T2V-lÃĪhestymistapa parantaa johdonmukaisesti VBench 2.0 -suorituskykyÃĪ koostumuksen, yleisen pÃĪÃĪttelyn, ohjattavuuden ja fysiikan osalta, joidenkin parannusten ylittÃĪessÃĪ 60 prosenttia - vaikka ihmisen uskollisuus sÃĪilyi alempana kuin Veo 3 -vertailuversiossa.

Factorisoitu T2V-lÃĪhestymistapa parantaa johdonmukaisesti VBench 2.0 -suorituskykyÃĪ koostumuksen, yleisen pÃĪÃĪttelyn, ohjattavuuden ja fysiikan osalta, joidenkin parannusten ylittÃĪessÃĪ 60 prosenttia – vaikka ihmisen uskollisuus sÃĪilyi alempana kuin Veo 3 -vertailuversiossa.

Kaikissa arkkitehtuureissa factorisoitu lÃĪhestymistapa paransi pisteitÃĪ jokaisessa VBench-luokassa paitsi ihmisen uskollisuudessa, joka laski hieman, vaikka promptia ylÃķsotettiin. WAN 5B ylitti suuremman WAN 14B:n, vahvistaen aiempia T2V-CompBench-tuloksia, jotka osoittivat, ettÃĪ visuaalinen ankkurointi vaikuttaa enemmÃĪn kuin skaala.

Vaikka VBench-parannukset olivat johdonmukaisia, ne olivat pienempiÃĪ kuin ne, jotka havaittiin T2V-CompBenchissa, ja tutkijat pitÃĪvÃĪt tÃĪtÃĪ johtuvan VBenchin tiukemmasta binÃĪÃĪrisestÃĪ pisteytysjÃĪrjestelmÃĪstÃĪ.

Laadullisissa kokeissa tutkimus tarjoaa statisia kuvia, mutta viittaa lukijaa tarkastelemaan tÃĪmÃĪn artikkelin upotettuja videoita, joista saa selkeÃĪmmÃĪn kÃĪsityksen, varoitellen, ettÃĪ alkuperÃĪiset videot ovat monipuolisempia ja tarkempia. LÃķydÃĪt ne tÃĪÃĪltÃĪ. Laadullisten tuloksien osalta tutkimus toteaa:

‘Ankkuroidut videot osoittavat johdonmukaisesti tarkemman kohteen asettelun, vahvemman objektin-attribuutin sitoutumisen ja selkeÃĪmmÃĪn aikasuhteellisen etenemisen.’

Factorisoitu menetelmÃĪ sÃĪilyi vakaana, vaikka diffuusioprosessin askelten mÃĪÃĪrÃĪÃĪ laskettiin 50:stÃĪ 15:een, osoittaen lÃĪhes olemattoman suorituskyvyn menetyksen T2V-CompBenchissa. Toisaalta sekÃĪ teksti-vain ettÃĪ ylÃķsotetut vertailuversiot heikkenivÃĪt terÃĪvÃĪsti samojen olosuhteiden vallitessa.

Vaikka askelten vÃĪhentÃĪminen voi teoriassa kolminkertaistaa nopeuden, tÃĪysi generoimisprosessi muuttui vain 2,1-kertaiseksi kÃĪytÃĪnnÃķssÃĪ, johtuen kiinteistÃĪ kustannuksista ankkurikuvan generoimisesta. Kuitenkin tulokset osoittivat, ettÃĪ ankkurointi ei ainoastaan parantanut nÃĪytenlaatuja vaan myÃķs auttoi stabiloimaan diffuusioprosessin, tukeakseen nopeampaa ja tehokkaampaa generointia ilman tarkkuuden menetystÃĪ.

Projektisivusto tarjoaa esimerkkejÃĪ ylÃķsotetusta ja uuden menetelmÃĪn generoimisista, joista tarjoamme muutamia (alempaa resoluutiota) editoituja esimerkkejÃĪ:

Klikkaa toistaa (ei ÃĪÃĪntÃĪ). YlÃķsotetut alkulÃĪhteet vs. tekijÃķiden factorisoitu lÃĪhestymistapa.

Tutkijat johtavat:

‘Tulokset osoittavat, ettÃĪ parannettu ankkurointi, eikÃĪ ainoastaan kapasiteetin lisÃĪÃĪminen, voi olla yhtÃĪ tÃĪrkeÃĪÃĪ. Viimeaikaiset edistysaskelet T2V-diffuusioprosessissa ovat riippuvaisia suuresti mallin kokoon ja koulutusaineiston mÃĪÃĪrÃĪstÃĪ, mutta jopa suuret mallit usein kÃĪrsivÃĪt siitÃĪ, ettÃĪ ne eivÃĪt pysty johtamaan ymmÃĪrrettÃĪvÃĪÃĪ alkutilaa tekstistÃĪ yksin.

‘TÃĪmÃĪ on vastakohtainen kuva kuvalle, jossa skaalautuminen on suhteellisen suoraviivaista; videomalleissa jokainen arkkitehtoninen parannus on toimittava yhden lisÃĪaikadimension ylitse, mikÃĪ tekee skaalautumisesta huomattavasti resursseja vaativampaa.

‘Tutkimuksemme osoittaa, ettÃĪ parannettu ankkurointi voi tÃĪydentÃĪÃĪ skaalautumista osoittamalla toisen pullonkaulan: kohteen oikean asettelun perustamisen ennen liikkeen synteesin aloittamista.

‘Videogeneroinnin factorisointi kohteen rakentamiseen ja aikasuhteelliseen mallintamiseen lievittÃĪÃĪ useita yleisiÃĪ epÃĪonnistumisen muotoja ilman, ettÃĪ olisi tarvetta merkittÃĪvÃĪsti suuremmille malleille. Me nÃĪemme tÃĪmÃĪn komplementaarisen suunnitteluperiaatteen, joka voi ohjata tulevia arkkitehtuureja kohti luotettavampaa ja rakenteellisempaa videosynteesiÃĪ.’

JohtopÃĪÃĪtÃķs

Vaikka sekaannuksen ongelmat ovat hyvin todellisia ja saattavat vaatia omia ratkaisuja (kuten parannettua kuraattorin arviointia ja jakelua ennen koulutusta), on ollut silmÃĪnavaus katsella, kuinka factorisointi ‘irrottaa’ useita sitkeitÃĪ ja ‘jumissa olevia’ konseptiprompt-asetteluja paljon tarkemmin – vain kohtuullisella LoRA-konditionoinnilla ja huomattavasti parannetun aloitus/alkuvalokuvan avustuksella.

Resurssien kuilu paikallisten harrastajien inference- ja kaupallisten ratkaisujen vÃĪlillÃĪ ei vÃĪlttÃĪmÃĪttÃĪ ole yhtÃĪ valtava kuin oletetaan, koska lÃĪhes kaikki tarjoajat pyrkivÃĪt jÃĪrkeistÃĪmÃĪÃĪn merkittÃĪvÃĪt GPU-resurssinsa kuluttajille.

Anekdoottisesti, suuri osa nykyisistÃĪ generatiivisista video-palveluntarjoajista nÃĪyttÃĪÃĪ kÃĪyttÃĪvÃĪn brÃĪndÃĪttyjÃĪ ja yleensÃĪ â€˜parannettuja’ versioita kiinalaisista avoimen lÃĪhdekoodin malleista. PÃĪÃĪasiallinen ‘linnoitus’, jonka nÃĪmÃĪ â€˜vÃĪlittÃĪjÃĪjÃĪrjestelmÃĪt’ nÃĪyttÃĪvÃĪt omistavan, on se, ettÃĪ he ovat vaivautuneet kouluttamaan LoRA:ja tai – suuremmalla kustannuksella ja hieman suuremmalla hyÃķdylÃĪ â€“ suorittamaan tÃĪydellisen mallipainojen hienosÃĪÃĪtÃķÃΆ†.

NÃĪistÃĪ oivalluksista voisi olla apua sulkemassa tÃĪtÃĪ kuilua edelleen, kontekstissa, jossa kiinalaiset nÃĪyttÃĪvÃĪt olevan mÃĪÃĪrÃĪtietoisia demokratisoimaan gen. AI:ta, kun taas lÃĪnsimaiset liiketoimintaintresseet saattavat mieluummin haluta, ettÃĪ kasvava mallikoko ja sÃĪÃĪntely lopulta eristÃĪvÃĪt hyvÃĪt mallit API:iden ja useiden sisÃĪllÃķn suodattimien taakse.

 

* Tutkijoiden korostukset, eivÃĪt minun.

† Tutkimus ei mainitse, mikÃĪ GPU valittiin tai kuinka monta kÃĪytettiin.

†† Vaikka LoRA-reitti on todennÃĪkÃķisempi, sekÃĪ taloudellisen helppokÃĪyttÃķisyyden vuoksi, ettÃĪ siksi, ettÃĪ tÃĪydelliset painot, eivÃĪt aina ole saatavilla, eivÃĪt kvantitoidut painot.

Julkaistu ensimmÃĪisen kerran perjantaina, 19. joulukuuta 2025

Kirjailija tekoÃĪlystÃĪ, alan erikoisosaaja ihmisen kuvansynteesissÃĪ. Entinen tutkimussisÃĪllÃķn johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttÃĪ: [email protected]