AI-modeller och plattformar
Vidu släpper Q4 Preview av nästa generations flaggskepps‑AI‑videomodell

ShengShu Technology lanserade Vidu Q4 Preview den 7 oktober 2026, den första offentliga förhandsvisningen av dess nästa generations flaggskeppsmodell för uttrycksfullt ljud och video. Lanseringspriset börjar på $0.014 per sekund, och förhandsvisningen är tillgänglig via Vidu:s webbprodukt och API‑plattform.
Modellen stöder upp till 15 bildreferenser och upp till tre ljudreferenser, med utdata i 2K‑ eller 4K‑upplösning och 10‑bit färgdjup. Företaget sade att förhandsvisningen riktar sig till oberoende skapare, små studior och produktionsteam som arbetar med både berättande och kommersiellt arbete.
Karaktärsprestation, Kamerarbete och Visuella Effekter
ShengShu Technology sade att Q4 Preview är konstruerad för att bättre samordna ansiktsuttryck, känslor, kroppsrörelser och röst, vilket ger subtilare uttryck, tydligare emotionella avläsningar och mer naturlig rörelse. Upp till tre referensljudklipp kan hjälpa till att hålla en karaktärs röst konsekvent och leveransen emotionellt i linje, medan upp till 15 referensbilder kan fastställa karaktärer, kläder, rekvisita, produkter och miljöer inom en enda kreativ uppsättning. Företaget förklarade att dessa kontroller är avsedda att hålla visuella och vokala val sammansatta genom en scen och att ge narrativa projekt mer medveten kontroll över scenografi och prestation.
Meddelandet beskriver en tajtare samordning mellan kamerarörelser, klipp och handling på skärmen: i snabbrörliga sekvenser såsom slagsmål och jakter är kameran utformad för att följa handlingen mer sammanhängande, och effekter som explosioner, fyrverkerier och partiklar smälter in mer naturligt i omgivningen. 2K‑ och 4K‑lägena lanseras tillsammans med förbättrad belysning och övergripande estetik, där det bredare upplösningsspannet tjänar både tidiga kreativa tester och slutgiltig högupplöst leverans.
“Avancerade videomodeller bör bevisa sig själva bortom noggrant utvalda demoexempel. Varje förbättring i effektivitet bör i slutändan ge skapare friheten att prova ett extra tag eller göra en extra version,” sade Yihang Luo, medgrundare och VD för ShengShu Technology, i lanseringsmeddelande.
Prissättning och avsedd användning
Utdataalternativen sträcker sig över 540p, 720p, 1080p, 2K och 4K. ShengShu Technology sade att när utdata‑specifikationer och faktureringsvillkor är jämförbara levererar Q4 Preview upp till fem gånger så mycket utdata för samma budget. Företaget knöt prissättningen till iterationens verklighet: att få ett produktionsklart klipp kräver vanligtvis mer än ett försök, oavsett om det innebär att justera en karaktärs uttryck, utvärdera alternativa kameravinklar eller experimentera med olika öppningar. Som exempel på avsedd användning pekade de på reklambyråer som väger kreativa koncept och öppningssekvenser, e‑handelsgrupper som skapar variationer för olika produkter och målgrupper, samt filmskapare som testar prestationer, storyboard och tempo innan de går vidare med produktionen.
Meddelandet noterar att slutgiltig prissättning, stödda upplösningar, funktionsutbud och användarvillkor kan variera beroende på plan och region, med fullständiga prisuppgifter och kampanjvillkor publicerade på Vidu:s webbplats.
Produktlägen och API‑specifikationer
Vidu:s officiella produktsidan listar Image-to-Video‑ och Reference-to-Video‑lägen för Q4: Image-to-Video animerar en enskild uppladdad bild från en textprompt, medan Reference-to-Video kombinerar en till 15 bildreferenser med noll till tre ljudreferenser för att hålla ämnen och röster konsekventa. På produktsidan anges Reference-to-Video med varaktigheter på 1 till 16 sekunder och Image-to-Video med 3 till 16 sekunder, och sidans höjdpunkter inkluderar en maximal upplösning på 4K samt en maximal videolängd på 16 sekunder. Utdata bevarar det ursprungliga bildförhållandet för uppladdat material, och sidan nämner AI‑serier, reklam, socialt innehåll och filmisk produktion som de scenarier modellen är avsedd för.
För utvecklare listar image-to-video-dokumentation modellen under namnet viduq4-preview på POST https://api.vidu.com/ent/v2/img2video. Slutpunkten tar emot en enda start‑frame‑bild i png, jpeg, jpg eller webp‑format upp till 50 MB, en prompt på upp till 20 000 tecken, varaktigheter på 3 till 16 sekunder med standardvärde 5, samt upplösningar från 540p upp till 4K med standardvärde 720p. En ljudparameter har standardvärdet true, vilket producerar video med ljud som kan inkludera dialog och ljudeffekter, och dokumentationen anger att modellen stödjer ljud‑video‑synkronisering och automatisk kameraväxling.
Den reference-to-video-dokumentation listar POST https://api.vidu.com/ent/v2/reference2video, som accepterar en till 15 bilder och noll till tre mp3‑ljudreferenser på 3 till 12 sekunder vardera, med bildförhållandealternativ på 1:1, 9:16, 16:9, 3:4 och 4:3 samt standardvärde 16:9. Promptar kan bädda in taggar för referensämnen, och dokumentationen anger att modellen stödjer generering av video med referensljud, intelligent kameraväxling, konsistens över flera kamerapositioner samt simultan ljud‑ och video‑utmatning. Returnerade skapelse‑URL:er förblir giltiga i 24 timmar.
Vidu släpper Q4 Preview i förväg för den fullständiga Q4‑modellen så att skapare kan använda den i verkliga projekt, och ShengShu Technology sade att återkoppling om prestanda, kreativ kontroll och dagliga produktionsbehov kommer att forma den slutgiltiga lanseringen.












