Model dan platform AI
Vidu Merilis Pratinjau Q4 Model Video AI Andalan Generasi Berikutnya

ShengShu Technology meluncurkan Vidu Q4 Preview pada 7 Oktober 2026, pratinjau publik pertama dari model andalan generasi berikutnya untuk audio dan video yang ekspresif. Harga peluncuran dimulai dari $0.014 per detik, dan pratinjau ini tersedia melalui produk web Vidu dan platform API.
Model ini mendukung hingga 15 referensi gambar dan hingga tiga referensi audio, dengan output pada resolusi 2K atau 4K dan kedalaman warna 10-bit. Perusahaan menyatakan bahwa pratinjau ini ditujukan untuk kreator independen, studio kecil, dan tim produksi yang mencakup pekerjaan naratif maupun komersial.
Performa Karakter, Pengambilan Kamera, dan Efek Visual
ShengShu Technology mengatakan Q4 Preview dibangun untuk mengoordinasikan ekspresi wajah, emosi, gerakan tubuh, dan suara dengan lebih baik, menghasilkan ekspresi yang lebih halus, pembacaan emosional yang lebih jelas, dan gerakan yang lebih alami. Hingga tiga klip audio referensi dapat membantu menjaga konsistensi suara karakter dan penyampaiannya selaras secara emosional, sementara hingga 15 gambar referensi dapat menancapkan karakter, pakaian, properti, produk, dan lingkungan dalam satu pengaturan kreatif. Perusahaan menyatakan bahwa kontrol ini dimaksudkan untuk menyatukan pilihan visual dan vokal di seluruh adegan serta memberikan proyek naratif kontrol yang lebih sengaja atas tata panggung dan performa.
Pengumuman tersebut menggambarkan koordinasi yang lebih ketat antara gerakan kamera, pemotongan, dan aksi di layar: dalam urutan cepat seperti pertarungan dan kejar-kejaran, kamera dirancang untuk mengikuti aksi secara lebih koheren, dan efek seperti ledakan, kembang api, serta partikel menyatu secara lebih alami dengan lingkungan sekitarnya. Mode 2K dan 4K hadir bersamaan dengan pencahayaan yang lebih baik dan estetika keseluruhan yang ditingkatkan, dengan rentang resolusi yang lebih luas melayani baik pengujian kreatif tahap awal maupun output resolusi tinggi akhir.
“Model video canggih harus membuktikan diri mereka di luar demo yang dipilih dengan cermat. Setiap peningkatan efisiensi pada akhirnya harus memberi kreator kebebasan untuk mencoba satu shot lagi atau membuat satu versi lagi,” kata Yihang Luo, co‑founder dan CEO ShengShu Technology, dalam pengumuman peluncuran.
Harga dan Penggunaan yang Dituju
Pilihan output mencakup 540p, 720p, 1080p, 2K, dan 4K. ShengShu Technology mengatakan bahwa ketika spesifikasi output dan kondisi penagihan sebanding, Q4 Preview menghasilkan hingga lima kali lipat output dengan anggaran yang sama. Perusahaan mengaitkan harga dengan realitas iterasi: menghasilkan shot yang siap produksi biasanya memerlukan lebih dari satu percobaan, baik itu menyesuaikan ekspresi karakter, mengevaluasi sudut kamera alternatif, atau bereksperimen dengan pembukaan yang berbeda. Sebagai contoh penggunaan yang dituju, mereka menyebut tim iklan yang menimbang konsep kreatif dan urutan pembuka, tim e‑commerce yang membuat variasi untuk produk dan audiens yang berbeda, serta pembuat film yang menguji performa, storyboard, dan kecepatan alur sebelum melanjutkan produksi lebih jauh.
Pengumuman mencatat bahwa harga akhir, resolusi yang didukung, ketersediaan fitur, dan ketentuan penggunaan dapat bervariasi menurut paket dan wilayah, dengan detail harga lengkap serta syarat promosi dipublikasikan di situs web Vidu.
Mode Produk dan Spesifikasi API
Halaman halaman produk resmi Vidu mencantumkan mode Image-to-Video dan Reference-to-Video untuk Q4: Image-to-Video menggerakkan satu gambar yang diunggah berdasarkan prompt teks, sementara Reference-to-Video menggabungkan satu hingga 15 referensi gambar dengan nol hingga tiga referensi audio untuk menjaga konsistensi subjek dan suara. Di halaman produk, Reference-to-Video tercantum dengan durasi 1 hingga 16 detik dan Image-to-Video dengan 3 hingga 16 detik, serta sorotan halaman mencakup resolusi maksimum 4K dan panjang video maksimum 16 detik. Output mempertahankan rasio aspek asli materi yang diunggah, dan halaman tersebut menyebut seri AI, iklan, konten sosial, serta produksi sinematik sebagai skenario yang ditujukan untuk model ini.
Untuk pengembang, dokumentasi image-to-video mencantumkan model dengan nama viduq4-preview di POST https://api.vidu.com/ent/v2/img2video. Endpoint menerima satu gambar frame awal dalam format png, jpeg, jpg, atau webp hingga 50 MB, prompt hingga 20.000 karakter, durasi 3 hingga 16 detik dengan default 5, dan resolusi dari 540p hingga 4K dengan default 720p. Parameter audio defaultnya true, menghasilkan video dengan suara yang dapat mencakup dialog dan efek suara, dan dokumentasi menyatakan bahwa model mendukung sinkronisasi audio‑video serta perpindahan kamera otomatis.
The dokumentasi reference-to-video lists POST https://api.vidu.com/ent/v2/reference2video, yang menerima satu hingga 15 gambar dan nol hingga tiga referensi audio mp3 masing‑masing berdurasi 3 hingga 12 detik, dengan opsi rasio aspek 1:1, 9:16, 16:9, 3:4, dan 4:3 serta default 16:9. Prompt dapat menyematkan tag untuk subjek referensi, dan dokumentasi menyatakan bahwa model mendukung pembuatan video dengan suara referensi, perpindahan kamera cerdas, konsistensi di berbagai posisi kamera, serta output audio dan video simultan. URL kreasi yang dikembalikan tetap berlaku selama 24 jam.
Vidu merilis Pratinjau Q4 sebelum model Q4 penuh agar kreator dapat menggunakannya dalam proyek nyata, dan ShengShu Technology mengatakan masukan mengenai performa, kontrol kreatif, dan kebutuhan produksi sehari‑hari akan membentuk rilis akhir.












