Anderson 视角
AI 研究预见对话、音乐和音效的单独音量控制

由三菱电机领导的新研究合作探讨了从原始音频源提取三个独立音轨的可能性,将音频轨道分解为语音、音乐和音效(即环境噪音)。
由于这是一个事后处理框架,因此它为后代的多媒体播放平台(包括消费设备)提供了潜在的可能性,以提供三点音量控制,允许用户提高对话音量或降低音轨音量。
在下面的短片中,我们看到音轨的不同方面被强调,因为用户在三角形上拖动控制条,每个音频组件在一个角落:
研究论文的配套视频片段(见文章末尾的完整视频)。当用户将光标拖向三角形 UI(右侧)中的三个提取的音频组件之一时,音频会强调音轨的这一部分。虽然更长的视频引用了 YouTube 上的其他示例,但这些示例目前似乎不可用。 来源:https://vimeo.com/634073402
该论文名为 鸡尾酒叉问题:真实世界音轨的三音分离,由马萨诸塞州剑桥的三菱电机研究实验室(MERL)和伊利诺伊州印第安纳大学智能系统工程系的研究人员撰写。
分离音轨的方面
研究人员将这一挑战命名为“鸡尾酒派对问题”,因为它涉及隔离严重交织的音轨元素,这创建了一个类似叉子的路线图(见下图)。在实践中,多通道(即立体声和更高)音轨可能具有不同类型的内容,例如对话、音乐和环境声,特别是因为对话往往 占据中心通道 在杜比 5.1 混音中。目前,音频分离的活跃研究领域正在从单个、混合的音轨中捕获这些线索,就像当前的研究一样。

鸡尾酒叉 – 从合并的单个音轨中提取三个不同的音轨。 来源:https://arxiv.org/pdf/2110.09958.pdf
最近的研究重点是从各种环境中提取语音,通常是为了去噪语音音频,以便后续与自然语言处理(NLP)系统进行交互,还有 隔离 存档中的歌唱声音,既可以创建真实(甚至已经去世的)歌手的合成版本,也可以促进 卡拉 OK 风格的音乐隔离。
每个方面的数据集
到目前为止,很少有人考虑使用这种人工智能技术来为用户提供对音轨混合的更多控制。因此,研究人员正式定义了这个问题,并生成了一个新的数据集,以帮助继续研究多类型音轨分离,并将其用于测试各种现有的音频分离框架。
研究人员开发的新数据集称为 Divide and Remaster(DnR),它源自之前的数据集 LibriSpeech、Free Music Archive 和 Freesound Dataset 50k(FSD50K)。对于那些希望从头开始使用 DnR 的人,必须从三个来源重建数据集;否则,它将在 Zenodo 上提供,作者声称。但是,写作时提供的 GitHub 链接 用于源提取实用程序目前不可用,因此感兴趣的人可能需要等待一段时间。
研究人员发现,索尼在五月提出的 CrossNet 解混 (XUMX) 架构在 DnR 中效果特别好。

索尼的 CrossNet 架构。
作者声称,他们的机器学习提取模型在 YouTube 的音轨上效果很好,尽管论文中提出的评估是基于合成数据的,而提供的主要支持视频(见下面的嵌入)目前似乎是唯一可用的视频。
使用的三个数据集每个都包含需要从音轨中分离出来的输出类型的集合:FSD50K 包含 50,000 个 44.1 kHz 的单声道音频片段,带有 200 个来自 Google 的 AudioSet 本体的类别标签;Free Music Archive 包含 100,000 个立体声歌曲,涵盖 161 个音乐流派,作者使用了一个包含 25,000 首歌曲的子集,以与 FSD50K 保持一致;LibriSpeech 为 DnR 提供了 100 小时的有声读物样本,作为 44.1kHz 的 mp3 音频文件。
未来工作
作者预计将在数据集和为进一步研究语音识别和声音分类框架而开发的单独模型上进行更多工作,包括自动为语音和非语音声音生成字幕。他们还计划评估可以减少感知伪影的混音方法的可能性,这仍然是将合并的音频音轨分解为其组成部分时的核心问题。
这种分离在未来可能作为智能电视的消费品提供,智能电视中集成了高度优化的推理网络,尽管早期实现可能需要一些预处理时间和存储空间。三星已经 使用 本地神经网络进行升级,而索尼的 Cognitive Processor XR,用于公司的 Bravia 系列,实时分析和 重新解释 音轨,通过轻量级集成的 AI。
对音轨混合控制的呼声 周期性地出现,并且大多数解决方案都必须应对音轨已经按照当前标准(以及对观众期望的假设)在电影和电视行业中降混的事实。
一位观众对电影音轨中不同元素之间的音量水平差异感到沮丧,于是 开发 了一个基于硬件的自动音量调节器,能够 均衡音量 以用于电影和电视。
尽管智能电视提供了 多种方法 来尝试提高对话音量,以对抗音乐的宏伟音量水平,但它们都在与混音时做出的决定以及内容制作者希望观众按照他们设置的方式体验他们的音轨的愿景作斗争。
内容制作者可能会对这一潜在的“混音文化”补充感到不满,因为一些行业知名人士已经对诸如 运动平滑 之类的默认后处理电视算法表示不满。
https://vimeo.com/634073402












