AI 模型与平台
AI 研究人员设计程序以生成电影和其他媒体的音效
德克萨斯大学圣安东尼奥分校的研究人员创建了一个基于 AI 的应用程序,能够观察视频中的动作并生成与这些动作相匹配的音效。该程序生成的音效据报道非常逼真,当人类观察者被询问时,他们通常认为这些音效是合法的。
负责生成音效的程序 AudioFoley 在最近发表在 IEEE 多媒体事务上的研究中进行了详细介绍。根据 IEEE Spectrum 的报道,AI 程序由 Jeff Provost 教授和博士生 Sanchita Ghose 开发。研究人员使用多个机器学习模型共同创建了该程序。
生成适合屏幕上动作的音效的第一步是识别这些动作并将它们映射到音效上。为了完成这一步,研究人员设计了两个不同的机器学习模型并测试了不同的方法。第一个模型通过从视频中提取帧并分析这些帧中的相关特征(如运动和颜色)来运作。之后,使用第二个模型来分析物体在帧中的位置变化,以提取时间信息。这种时间信息用于预测视频中的下一个可能动作。两个模型都使用视频中的信息来猜测哪种声音最适合伴随它。
下一步是合成声音,这是通过匹配活动/预测动作与可能的音效样本来完成的。根据 Ghose 和 Prevost 的说法,AutoFoley 被用于生成 1000 个短片的音效,包括火、奔跑的马、滴答的钟表和雨滴落在植物上的声音。虽然 AutoFoley 在创建不需要动作和声音之间完美匹配的片段的音效方面最为成功,但它在匹配动作发生变化的片段方面遇到了困难,然而该程序仍然能够欺骗许多人类观察者,使他们选择其生成的音效而不是原始音效。
Prevost 和 Ghose 招募了 57 名大学生,让他们观看不同的片段。一些片段包含原始音频,而其他片段包含由 AutoFoley 生成的音频。当测试第一个模型时,约 73% 的学生选择了合成音频作为原始音频,忽略了伴随片段的真正声音。另一个模型的表现略差,仅有 66% 的参与者选择了生成的音频而不是原始音频。
Prevost 解释说,AutoFoley 可能被用于加速电影、电视和其他媒体的制作过程。Prevost 指出,一个真实的 Foley 音轨对于使媒体引人入胜和可信至关重要,但 Foley 过程通常需要大量时间来完成。拥有一个自动系统来处理基本 Foley 元素的创建可以使媒体的制作更加廉价和快速。
目前,AutoFoley 有一些显著的局限性。首先,虽然该模型似乎在观察具有稳定、可预测的动作的事件时表现良好,但它在尝试为时间上变化的事件(如雷暴)生成音频时会遇到困难。此外,它还要求分类主题在整个剪辑中存在,并且不会离开帧。研究团队旨在解决这些问题,并在应用程序的未来版本中进行改进。












