Modelli e piattaforme di IA
Vidu presenta Q4 Preview del modello di punta AI video di nuova generazione

ShengShu Technology ha lanciato Vidu Q4 Preview il 7 ottobre 2026, la prima anteprima pubblica del suo modello di punta di nuova generazione per audio e video espressivi. Il prezzo di lancio parte da $0.014 al secondo e l’anteprima è disponibile tramite il prodotto web e la piattaforma API di Vidu.
Il modello supporta fino a 15 riferimenti immagine e fino a tre riferimenti audio, con output a risoluzione 2K o 4K e profondità colore a 10 bit. L’azienda ha dichiarato che l’anteprima è rivolta a creatori indipendenti, piccoli studi e team di produzione che operano sia su progetti narrativi che commerciali.
Prestazioni dei personaggi, lavoro di camera e effetti visivi
ShengShu Technology ha affermato che Q4 Preview è stato progettato per coordinare meglio espressioni facciali, emozioni, movimenti del corpo e voce, ottenendo espressioni più sottili, interpretazioni emotive più chiare e movimenti più naturali. Fino a tre clip audio di riferimento aiutano a mantenere la voce di un personaggio coerente e la sua resa emotivamente allineata, mentre fino a 15 immagini di riferimento possono fissare personaggi, costumi, oggetti di scena, prodotti e ambienti all’interno di una singola configurazione creativa. L’azienda ha dichiarato che questi controlli sono destinati a mantenere insieme le scelte visive e vocali lungo una scena e a offrire ai progetti narrativi un controllo più deliberato sulla messa in scena e sulle performance.
L’annuncio descrive un coordinamento più stretto tra i movimenti della camera, i tagli e l’azione sullo schermo: nelle sequenze veloci come combattimenti e inseguimenti, la camera è progettata per seguire l’azione in modo più coerente, e effetti come esplosioni, fuochi d’artificio e particelle si integrano più naturalmente nell’ambiente circostante. Le modalità 2K e 4K arrivano insieme a un’illuminazione migliorata e a un’estetica complessiva più curata, con l’intervallo di risoluzione più ampio che serve sia i test creativi preliminari sia l’output finale ad alta risoluzione.
“I modelli video avanzati dovrebbero dimostrare il loro valore oltre le demo selezionate con cura. Ogni miglioramento in efficienza dovrebbe alla fine dare ai creatori la libertà di provare un altro tentativo o realizzare un’altra versione,” ha dichiarato Yihang Luo, co-fondatore e CEO di ShengShu Technology, nell’annuncio di lancio.
Prezzi e utilizzo previsto
Le opzioni di output includono 540p, 720p, 1080p, 2K e 4K. ShengShu Technology ha affermato che, quando le specifiche di output e le condizioni di fatturazione sono comparabili, Q4 Preview fornisce fino a cinque volte più output per lo stesso budget. L’azienda ha collegato il prezzo alla realtà dell’iterazione: ottenere una ripresa pronta per la produzione richiede tipicamente più di un tentativo, sia che si tratti di modificare l’espressione di un personaggio, valutare angolazioni di camera alternative o sperimentare diverse aperture. Come esempi di utilizzo previsto, ha indicato i team pubblicitari che valutano concetti creativi e sequenze di apertura, i team e‑commerce che creano variazioni per diversi prodotti e audience, e i registi che testano performance, storyboard e ritmo prima di impegnarsi ulteriormente nella produzione.
L’annuncio segnala che i prezzi finali, le risoluzioni supportate, la disponibilità delle funzionalità e i termini di utilizzo possono variare in base al piano e alla regione, con i dettagli completi dei prezzi e i termini promozionali pubblicati sul sito web di Vidu.
Modalità prodotto e specifiche API
La pagina prodotto ufficiale di Vidu elenca le modalità Image-to-Video e Reference-to-Video per Q4: Image-to-Video anima una singola immagine caricata a partire da un prompt testuale, mentre Reference-to-Video combina da una a 15 immagini di riferimento con zero a tre riferimenti audio per mantenere soggetti e voci coerenti. Nella pagina prodotto, Reference-to-Video è indicata con durate da 1 a 16 secondi e Image-to-Video con durate da 3 a 16 secondi, e i punti salienti della pagina includono una risoluzione massima di 4K e una lunghezza video massima di 16 secondi. L’output conserva il rapporto d’aspetto originale del materiale caricato, e la pagina indica AI series, advertising, social content e cinematic production come gli scenari per i quali il modello è progettato.
Per gli sviluppatori, la documentazione image-to-video elenca il modello con il nome viduq4-preview su POST https://api.vidu.com/ent/v2/img2video. L’endpoint accetta un’unica immagine di inizio in formato png, jpeg, jpg o webp fino a 50 MB, un prompt fino a 20.000 caratteri, durate da 3 a 16 secondi con valore predefinito di 5, e risoluzioni da 540p fino a 4K con valore predefinito di 720p. Un parametro audio è impostato di default su true, generando video con audio che può includere dialoghi ed effetti sonori, e la documentazione afferma che il modello supporta la sincronizzazione audio‑video e il cambio automatico di camera.
La documentazione reference-to-video elenca POST https://api.vidu.com/ent/v2/reference2video, che accetta da una a 15 immagini e da zero a tre riferimenti audio mp3 di 3 a 12 secondi ciascuno, con opzioni di rapporto d’aspetto 1:1, 9:16, 16:9, 3:4 e 4:3 e valore predefinito 16:9. I prompt possono includere tag per i soggetti di riferimento, e la documentazione afferma che il modello supporta la generazione di video con suono di riferimento, cambio di camera intelligente, coerenza tra più posizioni di camera e output simultaneo audio e video. Gli URL di creazione restituiti rimangono validi per 24 ore.
Vidu sta rilasciando Q4 Preview prima del modello Q4 completo affinché i creatori possano utilizzarlo in progetti reali, e ShengShu Technology ha dichiarato che i feedback su prestazioni, controllo creativo e necessità di produzione quotidiana influenzeranno il rilascio finale.












