AI 模型与平台

文本到音乐生成AI:稳定音频、谷歌的MusicLM及更多

mm
将 Unite.AI 添加到您在 Google 上的首选来源

音乐,一种与人类灵魂产生共鸣的艺术形式,始终伴随着我们。使用人工智能创建音乐的尝试始于几十年前。最初,尝试是简单和直观的,基本算法创建单调的旋律。然而,随着技术的进步,AI音乐生成器的复杂性和能力也随之提高,铺平了深度学习和自然语言处理(NLP)在这一技术中发挥关键作用的道路。

今天,像Spotify这样的平台正在利用AI来细化用户的听歌体验。这些深度学习算法根据各种音乐元素(如节奏和情绪)分析个性化的歌曲推荐。它们甚至分析更广泛的听歌模式,并在互联网上搜索与歌曲相关的讨论,以建立详细的歌曲简介。

AI在音乐中的起源:从算法组成到生成建模的旅程

在AI与音乐世界初次接触的早期阶段(从1950年代到1970年代),重点主要放在算法组成上。这是一种使用一套定义好的规则让计算机创造音乐的方法。在此期间,首个值得注意的创作是1957年的《Illiac组曲》(Illiac Suite for String Quartet)。它使用了蒙特卡罗算法,这是一个涉及随机数来决定音调和节奏(在传统音乐理论和统计概率的范围内)的过程。

使用Midjourney生成的图像

使用Midjourney生成的图像

在此期间,另一位先驱者Iannis Xenakis,利用随机过程(涉及随机概率分布的概念)来创作音乐。他使用计算机和FORTRAN语言来连接多个概率函数,创建一个模式,其中不同的图形表示对应于不同的音域。

将文本转换为音乐的复杂性

音乐以一种丰富的多维数据格式存储,涵盖了旋律、和声、节奏和节拍等元素,使得将文本转换为音乐的任务变得非常复杂。一个标准的歌曲在计算机中几乎由一百万个数字表示,这个数字远远高于其他数据格式,如图像、文本等。

音频生成领域正在见证创新方法来克服创建真实声音的挑战。其中一种方法涉及生成一个频谱图,然后将其转换回音频。

另一种策略利用音乐的符号表示,如乐谱,可以被音乐家解读和演奏。这种方法已经被成功数字化,像Magenta的室内乐生成器可以创建MIDI格式的音乐,这是一种允许计算机和乐器之间进行通信的协议。

虽然这些方法已经推进了这一领域,但它们也带来了自己的局限性,凸显了音频生成的复杂性。

Transformer基于的自回归模型和U-Net基于的扩散模型,是当前技术的前沿,能够在生成音频、文本、音乐等方面产生最先进的结果。OpenAI的GPT系列和几乎所有其他LLM目前都由Transformer驱动,使用了编码器、解码器或两者的架构。在艺术/图像方面,MidJourney、Stability AI和DALL-E 2都使用了扩散框架。这些两项核心技术在音频领域也取得了最先进的结果。在本文中,我们将深入探讨谷歌的MusicLM和稳定音频,这些技术展示了这些技术的卓越能力。

谷歌的MusicLM

谷歌的MusicLM于今年五月发布。MusicLM可以生成高保真度的音乐片段,这些片段与文本中描述的情绪完美契合。使用分层序列到序列建模,MusicLM能够将文本描述转换为在24 kHz下长时间保持一致的音乐。

该模型在多个维度上运行,不仅仅遵循文本输入,还能够根据旋律进行条件控制。这意味着它可以接受一个哼唱或吹口哨的旋律,并根据文本字幕中描述的风格进行转换。

技术洞察

MusicLM利用了AudioLM的原理,AudioLM是一种2022年推出的音频生成框架。AudioLM将音频合成视为离散表示空间中的语言建模任务,使用从粗到细的音频离散单位(也称为令牌)的层次结构。这种方法确保了在长时间内保持高保真度和长期的一致性。

为了促进生成过程,MusicLM扩展了AudioLM的能力,以纳入文本条件,这是一种将生成的音频与输入文本的细微差别对齐的技术。这种方法是通过使用一个共同的嵌入空间来实现的,该空间使用一个联合音乐文本模型(MuLan)训练,该模型将音乐和其对应的文本描述投影到嵌入空间中靠近。这一策略有效地消除了在训练期间需要字幕的必要,使得模型可以在仅包含音频的巨大语料库上进行训练。

MusicLM模型还使用SoundStream作为其音频标记器,SoundStream可以以6 kbps的速度重建24 kHz的音乐,并具有令人印象深刻的保真度,利用残差向量量化(RVQ)进行高效和高质量的音频压缩。

MusicLM的独立预训练过程图解

MusicLM的预训练过程图解,来源:这里

此外,MusicLM通过允许旋律条件来扩展其能力。这一方法确保即使是一个简单的哼唱旋律也可以为一个经过精心调整以符合文本风格描述的壮丽音频体验奠定基础。

MusicLM的开发者还开源了MusicCaps,这是一个包含5.5k音乐文本对的数据集,每个对都有由人类专家精心编写的丰富文本描述。你可以在这里查看:MusicCaps在Hugging Face

准备好使用谷歌的MusicLM创建AI音轨了吗?以下是开始的步骤:

  1. 访问MusicLM的官方网站并点击“开始”。
  2. 通过选择“注册你的兴趣”加入等待名单。
  3. 使用你的谷歌账户登录。
  4. 一旦获得访问权限,点击“尝试”开始使用。

以下是我尝试的一些示例提示:

“冥想歌曲,平静且舒缓,伴有长笛和吉他。音乐缓慢,专注于创造一种宁静和平和的感觉。”

“爵士乐,萨克斯风”

与之前的最先进模型(如Riffusion和Mubert)进行定性评估时,MusicLM在10秒音频片段的文本字幕兼容性方面更受欢迎,参与者对其进行了积极的评分。

MusicLM性能比较

MusicLM性能比较,来源:这里

稳定音频

稳定AI最近推出了“稳定音频”,这是一种基于文本元数据、音频文件时长和开始时间的潜在扩散模型架构。这种方法与谷歌的MusicLM类似,允许对生成音频的内容和长度进行控制,从而可以创建具有指定长度的音频片段,长度可达训练窗口大小。

技术洞察

稳定音频包括多个组件,包括变分自编码器(VAE)和基于U-Net的条件扩散模型,后者与文本编码器协同工作。

变分自编码器(VAE)、文本编码器和基于U-Net的条件扩散模型集成的图解

稳定音频架构,来源:这里

VAE通过将立体声音频压缩为数据压缩、抗噪和可逆的损失压缩潜在编码来实现更快的生成和训练,绕过了处理原始音频样本的需要。

文本编码器源自CLAP模型,在理解词语和声音之间的复杂关系方面发挥着至关重要的作用,提供了输入文本的信息丰富的表示。这种表示是通过利用CLAP文本编码器的倒数第二层的文本特征来实现的,这些特征然后通过交叉注意力层集成到扩散U-Net中。

一个重要方面是时间嵌入的纳入,这些嵌入是基于两个属性计算的:音频块的开始秒和原始音频文件的总时长。这些值被转换为每秒的离散学习嵌入,然后与提示令牌一起输入到U-Net的交叉注意力层中,使用户能够控制输出音频的总长度。

稳定音频模型使用超过80万个音频文件的庞大数据集进行训练,通过与音频sparx的合作实现。

稳定音频广告

稳定音频广告

稳定音频提供了一个免费版本,允许每月生成20个最长20秒的音轨,以及一个每月12美元的专业计划,允许生成最长90秒的音轨,数量可达500个。

以下是我使用稳定音频创建的音频片段。

使用Midjourney生成的图像

使用Midjourney生成的图像

“电影,原声带,温柔的雨,氛围,舒缓,远处的狗叫声,平静的树叶沙沙声,微妙的风,40 BPM”

此类精心制作的音频片段的应用是无穷无尽的。电影制片人可以利用这项技术来创造丰富的沉浸式音景。在商业领域,广告商可以利用这些定制的音频轨道。此外,这项工具为个人创作者和艺术家打开了实验和创新的大门,提供了一个无限的画布来创作能够讲述故事、唤起情感并以以前难以实现的深度创造氛围的音频片段。

提示技巧

使用文本提示来创造完美的音频。以下是一个快速入门指南:

  1. 详细说明:指定流派、情绪和乐器。例如:电影,狂野西部,打击乐,紧张,氛围
  2. 情绪设定:将音乐和情感术语结合起来,以传达所需的情绪。
  3. 乐器选择:使用形容词来增强乐器名称,如“回声吉他”或“强大的合唱团”。
  4. BPM:将节奏与流派保持一致,以获得和谐的输出,例如“170 BPM”用于鼓和贝斯曲目。

结论

使用Midjourney生成的图像

使用Midjourney生成的图像

在本文中,我们深入探讨了AI生成音乐/音频的世界,从算法组成到今天的复杂生成AI框架,如谷歌的MusicLM和稳定音频。这些技术,利用深度学习和最先进的压缩模型,不仅提高了音乐生成能力,还优化了听众的体验。

然而,这是一个不断演变的领域,长期保持一致性和AI创作音乐的真实性等挑战仍然存在。就在一周前,人们对一首模仿德雷克和威肯风格的AI创作歌曲的讨论引起了轰动,但它最终被从格莱美奖提名名单中删除,凸显了围绕AI生成音乐在音乐行业中的合法性的持续辩论。随着AI继续弥合音乐和听众之间的差距,它无疑正在推动一个技术与艺术共存的生态系统,促进创新同时尊重传统。

我已经沉浸在了令人着迷的机器学习和深度学习世界中五年了。我的热情和专业知识让我为超过50个不同的软件工程项目做出了贡献,特别关注AI/ML。我的持续的好奇心也让我对自然语言处理产生了兴趣,这是一个我渴望进一步探索的领域。