AI 模型与平台
Vidu 发布下一代旗舰 AI 视频模型的 Q4 预览

盛书科技于 2026 年 10 月 7 日推出了 Vidu Q4 预览,这是其下一代旗舰模型在富有表现力的音频和视频方面的首次公开预览。启动定价为每秒 0.014 美元,预览可通过 Vidu 的网页产品和 API 平台使用。
该模型支持最多 15 张图像参考和最多 3 条音频参考,输出分辨率为 2K 或 4K,色深为 10 位。公司表示,此预览面向独立创作者、小型工作室以及涉及叙事和商业作品的制作团队。
角色表现、摄像与视觉特效
盛书科技表示,Q4 预览旨在更好地协调面部表情、情感、身体动作和声音,从而实现更细腻的表情、更清晰的情感读取以及更自然的动作。多达三段参考音频可帮助保持角色声音的一致性并使其情感表达保持一致,而最多 15 张参考图像则可在单一创意设置中确定角色、服装、道具、产品和环境。公司称,这些控制旨在跨场景保持视觉与声音选择的一致,并为叙事项目在布景和表演上提供更有意图的控制。
公告描述了摄像机运动、剪辑和屏幕动作之间更紧密的协同:在战斗、追逐等快速序列中,摄像机设计为更连贯地跟随动作,爆炸、烟火和粒子等特效也能更自然地融入环境。2K 与 4K 模式伴随更佳的光照和整体美感推出,更宽的分辨率范围既适用于早期创意测试,也适用于最终的高分辨率输出。
“先进的视频模型应当在精心挑选的演示之外证明自身价值。每一次效率提升最终都应让创作者拥有再尝试一次或再制作一个版本的自由,” 盛书科技联合创始人兼 CEO 罗一航 在 发布公告 中表示。
定价与预期用途
输出选项包括 540p、720p、1080p、2K 和 4K。盛书科技表示,在输出规格和计费条件相当的情况下,Q4 预览可在相同预算下实现最高五倍的产出。公司将定价与迭代的实际情况挂钩:获得可用于生产的镜头通常需要多次尝试,无论是调整角色表情、评估不同摄像角度,还是尝试不同的开场。作为预期用途的示例,文中提到广告团队在权衡创意概念和开场序列时、电子商务团队为不同产品和受众构建变体时,以及电影制作者在进一步投入制作前测试表演、分镜和节奏时的使用场景。
公告指出,最终定价、支持的分辨率、功能可用性以及使用条款可能因套餐和地区而异,完整的定价细节和促销条款已在 Vidu 官方网站上公布。
产品模式与 API 规范
Vidu 的 官方产品页面 列出了 Q4 的 Image-to-Video(图像转视频)和 Reference-to-Video(参考转视频)模式:Image-to-Video 根据文本提示为单张上传的图像生成动画,而 Reference-to-Video 将 1 到 15 张图像参考与 0 到 3 段音频参考相结合,以保持主体和声音的一致性。产品页面上,Reference-to-Video 的时长列为 1 至 16 秒,Image-to-Video 为 3 至 16 秒,页面亮点包括最高 4K 分辨率和最长 16 秒的视频时长。输出保持上传素材的原始宽高比,页面将 AI 系列、广告、社交内容和电影制作列为模型设计的使用场景。
对于开发者,image-to-video 文档 将该模型列为名为 viduq4-preview 的条目,位于 POST https://api.vidu.com/ent/v2/img2video. 该端点接受单张起始帧图像,支持 png、jpeg、jpg 或 webp 格式,大小最高 50MB;提示文本最长可达 20,000 个字符;时长为 3 至 16 秒,默认 5 秒;分辨率范围为 540p 至 4K,默认 720p。音频参数默认 true,生成带声音的视频,可包含对白和音效,文档说明该模型支持音视频同步和自动摄像机切换。
reference-to-video 文档 列出了 POST https://api.vidu.com/ent/v2/reference2video, 接受 1 到 15 张图像以及 0 到 3 段每段 3 到 12 秒的 mp3 音频参考,支持 1:1、9:16、16:9、3:4 和 4:3 等宽高比选项,默认 16:9。提示词可嵌入参考主体的标签,文档说明该模型支持生成带参考音频的视频、智能摄像机切换、多摄像机位置的一致性以及音视频同步输出。返回的创作 URL 在 24 小时内保持有效。
Vidu 提前于完整的 Q4 模型发布 Q4 预览,以便创作者在实际项目中使用,盛书科技表示,对性能、创意控制和日常制作需求的反馈将影响最终版本的发布。












