AI 模型与平台

好莱坞对Veo 3的到来投以侧目

mm
将 Unite.AI 添加到您在 Google 上的首选来源

谷歌最新推出的Veo 3模型正在重新定义人工智能生成视频的可能性。该模型在谷歌I/O 2025上宣布,能够生成的视频片段如此逼真,以至于大多数观众难以将其与真人拍摄的画面区分开来。

Veo 3引入了诸如本地音频生成和电影级视觉保真度等功能,这些功能大大降低了专业级视频制作的门槛。

打破“无声时代”以集成音频

首次,人工智能视频生成器拥有自己的声音。 Veo 3 生成音效、环境噪音,甚至人物对话来伴随每个场景,所有这些都与动作同步。谷歌DeepMind的CEO德米斯·哈萨比斯将其描述为“从视频生成的无声时代中走出来”,创作者可以用场景描述和声音来提示Veo 3。

在内部,模型分析其自身生成的帧,并自动同步合适的音频,因此脚步声、门声或人物说话的声音都恰好在正确的时刻出现。这种内置的音频功能是一个游戏规则的改变者——以前的生成模型产生的画面是静默的,需要用户手动添加声音。相比之下,Veo 3可以生成一个带有丰富音频的完整视频片段,有效地处理了摄像师和音频设计师的角色。

音频的加入大大提高了沉浸感和创作者的实用性。对话生成尤其令人惊讶——给Veo 3一个脚本或让它发明人物对话,它将生成与视觉相匹配的语音,嘴唇的运动与声音完美同步。背景噪音和音乐也会出现,无论是公园场景中的鸟鸣还是戏剧性的管弦乐配乐在高潮时响起。

谷歌表示,Veo 3经过训练,可以无缝地融合这些元素,借鉴DeepMind对视频到音频建模的研究。从实际角度来看,一个独自的创作者现在可以输入“海上风暴,水手发出命令”,然后得到一个带有海浪、风和水手声音的短片——所有这些都在一次生成中完成。这种端到端的音频-视觉生成去掉了专业视频制作所需的又一层专业知识,使高质量的结果对没有声音编辑技能的人来说是可及的。

电影级质量和难以置信的逼真度

Veo 3将其画面质量提升到了以前所未有的水平。该模型输出更清晰、更详细的视频(最高可达4K分辨率),并展示了对现实世界物理和照明的强大理解。早期示例令观众惊叹于其逼真的外观——由Veo 3生成的场景通常没有明显的合成迹象。运动在帧之间是平滑和连贯的——人工智能很少会打破连续性,这意味着您不会看到颤抖的伪影或角色在一瞬间内不可预测地变化。

如果一辆车在拐角处疾驰,尘埃和阴影会自然地表现;如果一个人奔跑,动作会尊重物理定律,如动量和重力。这种对现实的遵循甚至延伸到人类的手和语言。Veo 3中的人物具有自然的比例(是的,每只手有五个手指),面部动作与音频同步——这使得屏幕上的对话更加令人信服。

所有这些改进都是由于更大的训练语料库和模型优化所致,允许Veo 3将复杂、详细的提示转化为精致、逼真的视频。

重要的是,该模型对电影输出的关注使其能够达到以前无法在没有工作室的情况下达到的艺术质量。谷歌宣称Veo 3具有“更高的真实性和保真度,包括4K输出”,事实上,其示例片段的质地、照明和相机深度都具有专业电影的外观。

PJ Ace/X

精确提示和创造性控制变得容易

Veo 3的一个突出优势是它如何忠实地遵循在提示中描述的导演的构想。该模型在解释复杂、多行提示方面表现出色——甚至可以将短篇故事或分镜头脚本转化为连贯的视频。谷歌报告了提示遵循性的显著改进:Veo 3可以跟踪在文本中指定的动作序列或多个场景变化,并以正确的时机和细节渲染它们。

对于创作者来说,这意味着您可以一次性概述整个概念(“场景1:英雄进入一个黑暗的房间……场景2:突然的爆炸引起混乱……”),Veo 3将生成一个符合这些节奏的片段。这种理解程度解锁了通过文本实现更复杂的讲故事能力,远远超过了早期生成模型的能力,这些模型经常难以维持连贯性,甚至在几秒钟的视频中也是如此。Veo 3有效地扮演着摄像师、布景设计师和编辑的角色——它理解您的脚本,并按照舞台指示跟踪人物和摄像角度,具有前所未有的准确性。

谷歌通过用户友好的工具增强了这种提示驱动的力量,赋予创作者在不需要编辑专业知识的情况下对结果进行细粒度控制的能力。除了Veo 3,公司还推出了Flow,这是一款专门为利用该模型的功能而打造的人工智能电影制作应用程序。

Flow提供了一套功能,从虚拟的“摄像头控制”(用于设置具有特定角度或平滑平移的镜头)到“场景构建器”,它允许您使用连续运动和一致的角色来扩展或调整生成的场景。例如,您可以要求Veo生成一个户外市场场景,然后使用场景构建器来扩展该片段,展示更多环境或无缝地过渡到下一个场景。Flow甚至允许对象级别的编辑:创作者可以在片段中添加或删除元素,或更改宽高比(例如,将纵向视频转换为横向宽屏),并且模型将填充新的背景,如有需要。所有这些都可以通过简单的提示或UI滑块来实现,而不是手动动画。

结果是一个迭代的、几乎毫不费力的创作过程——您用文字草拟一个想法,得到一个视频,然后通过指示人工智能调整“摄像头”或“重选”道具来完善它。这种紧密的人机协作意味着,即使是新手也可以实现通常需要高级技能或团队的复杂镜头和编辑。

使专业视频制作民主化

Veo 3的推出标志着一个新时代的开始,在这个时代,好莱坞级别的制作价值对于更广泛的创作者和企业来说是触手可及的。通过自动化大量的繁重工作——摄影、特效,甚至音效设计——Veo 3大大降低了制作精致视频所需的资源。

一个单独的YouTuber或一个小型初创企业现在可以创建看起来和听起来像由完整的工作室团队制作的视频。这大大降低了制作商业广告、预告片或其他宣传媒体的入门成本。事实上,行业分析师指出,像Veo 3这样的工具可能对商业营销和媒体工作很有用,能够快速制作广告和内容,而无需大型团队或预算。需要为活动制作最后一刻的视频广告吗?与其雇佣演员和租用设备,营销团队可以从提示中生成一个逼真的30秒视频,并在当天就能完成。

值得注意的是,Veo 3的最先进功能(如音频生成)最初仅通过谷歌的249美元/月AI超级订阅和企业云服务提供。虽然这种高级访问可能会限制爱好者的使用,但很明显——这些功能将变得更加普及和负担得起。即使现在,这种订阅成本也只是专业视频拍摄或后期制作工作的一小部分。在更大的格局中,Veo 3是人工智能驱动内容创作管道的预览,这种管道可以在最小的开支下扩大质量。

新的创意边疆——和新的责任

Veo 3的到来无疑是创造力和效率的福音,但它也迫使创意产业面对重要的影响。另一方面,真实和合成内容之间的界限正在变得模糊:互联网上已经充斥着Veo生成的片段,这些片段以其逼真度令观众惊叹——同时也让他们感到不安,因为现实和人工智能之间的界限变得模糊不清。

电影制片人和视频专业人士面临着人工智能可以按需生成令人信服的画面的未来。这引发了人们对原创性、真实性和人类工艺作用的质疑。一些艺术家和纯粹主义者是可以理解的。批评者无论多么令人印象深刻的技术,都将人工智能视频斥为没有灵魂的垃圾,担心会出现低质量内容的泛滥或工作岗位流失。这些担忧与摄影和设计领域中人工智能的兴起相似:当创作被民主化时,它会挑战现有的所有权和劳动规范。

另一方面,支持者认为像Veo 3这样的AI只是创意技术的下一个演进——不是人类创造力的替代品,而是一种强大的新工具。谷歌在Veo 3中内置了防护措施,以应对一些陷阱,包括对每个AI生成帧进行不可见的水印(通过DeepMind的SynthID),以帮助检测和标记AI生成的视频。该模型还具有内容防护措施:测试人员发现它拒绝生成类似深度伪造的政治虚假信息或有害场景的提示。这些负责任的AI措施将在超现实的AI视频变得更容易制作时至关重要。

与此同时,许多前瞻性创作者正在拥抱这一工具,专注于它如何增强他们的想象力,而不是取代它。通过在开发过程中与电影制片人合作,谷歌旨在确保Veo 3支持创作工作流程,而不是破坏它们。结果理想情况下是人工智能承担了枯燥的制作后勤工作,从而让人类创作者专注于讲故事、风格和想法。

从内容工作室到广告代理公司,信息是人工智能视频生成已经到来——并且它变得越来越强大。Veo 3体现了这种趋势的最高质量。它降低了门槛和成本,但也挑战创作者在任何人都可以制作令人惊叹的视觉效果的世界中区分他们的工作。

当我们站在这个新的边疆时,很明显像Veo 3这样的工具将在电影和媒体的未来中发挥重要作用。整个创意产业需要适应,建立新的AI辅助内容规范。在谷歌看来,这项技术是“使新一波电影制片人更容易讲述他们的故事的工具”,最终解锁了可能以前无法呈现在银幕上的新声音和想法。未来几年,成功的讲故事者可能是那些学会将像Veo 3这样的AI模型作为他们的艺术工具包的一部分的人——利用生成视频的效率和规模,同时用独特的人类创造力和视野来引导它。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。