نماذج ومنصات الذكاء الاصطناعي

AudioSep: افصل أي شيء تصفه

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

LASS أو Language-queried Audio Source Separation هو نمط جديد للـ CASA أو Computational Auditory Scene Analysis يهدف إلى فصل صوت هدف من مزيج صوتي معين باستخدام استعلام لغة طبيعية يوفر واجهة قابلة للتطوير للtasks و تطبيقات الصوت الرقمي. على الرغم من أن إطارات LASS قد تقدمت بشكل كبير في السنوات القليلة الماضية فيما يتعلق بالحصول على الأداء المطلوب على مصادر صوتية محددة مثل الآلات الموسيقية، إلا أنها غير قادرة على فصل الصوت الصوتي المستهدف في المجال المفتوح.

AudioSep هو نموذج أساسي يهدف إلى حل القيود الحالية لإطارات LASS من خلال تمكين فصل الصوت المستهدف باستخدام استعلامات لغة طبيعية. قام مطورو إطار AudioSep بتدريب النموذج بشكل مكثف على مجموعة واسعة من مجموعات بيانات متعددة الوسائط على نطاق كبير، وقيموا أداء الإطار على مجموعة واسعة من مهام الصوت بما في ذلك فصل الآلات الموسيقية و فصل الأحداث الصوتية و تحسين الكلام من بين العديد من المهام الأخرى. الأداء الأولي لـ AudioSep يلبي المعايير كما أنه يظهر قدرات تعلم رائعة و يعطي أداء فصل صوتي قوي.

في هذه المقالة، سنقوم بالغوص بشكل أعمق في كيفية عمل إطار AudioSep حيث سنقوم بتقييم هيكل النموذج و مجموعات البيانات المستخدمة للتدريب و التقييم و المفاهيم الأساسية المشاركة في عمل نموذج AudioSep. لذا دعونا نبدأ بمقدمة أساسية إلى إطار CASA.

إطارات CASA و USS و QSS و LASS: الأساس لـ AudioSep

إطار CASA أو Computational Auditory Scene Analysis هو إطار يستخدمه المطورون لتصميم أنظمة الاستماع الآلية التي لها القدرة على تصور بيئات صوتية معقدة بطريقة مشابهة لطريقة تصور البشر للصوت باستخدام أنظمة السمع. فصل الصوت، مع التركيز على فصل الصوت المستهدف، هو مجال بحث أساسي داخل إطار CASA، ويهدف إلى حل “مشكلة الحفلة” أو فصل تسجيلات صوتية حقيقية من تسجيلات مصدر صوتي فردي أو ملفات. يمكن أن يُعزى أهمية فصل الصوت بشكل رئيسي إلى تطبيقاته الواسعة النطاق بما في ذلك فصل مصدر الموسيقى و فصل مصدر الصوت و تحسين الكلام و تحديد الصوت المستهدف و الكثير غير ذلك.

معظم الأعمال التي تم إجراؤها على فصل الصوت في الماضي تركز بشكل رئيسي على فصل مصدر صوتي واحد أو أكثر مثل فصل الموسيقى أو فصل الكلام. نموذج جديد يسمى USS أو Universal Sound Separation يهدف إلى فصل أصوات عشوائية في تسجيلات صوتية حقيقية. ومع ذلك، فإن فصل كل مصدر صوتي من مزيج صوتي هو مهمة صعبة و مقيدة بشكل رئيسي بسبب وجود مجموعة واسعة من مصادر الصوت المختلفة في العالم، وهو السبب الرئيسي لعدم جدوى طريقة USS للتطبيقات الحقيقية التي تعمل في الوقت الفعلي.

بديل قابل للتنفيذ لطريقة USS هو طريقة QSS أو Query-based Sound Separation التي تهدف إلى فصل مصدر صوتي فردي أو مستهدف من مزيج الصوت بناءً على مجموعة معينة من الاستعلامات. بفضل ذلك، يسمح إطار QSS للمطورين و المستخدمين باستخراج مصادر الصوت المطلوبة من المزيج بناءً على متطلباتهم مما يجعل طريقة QSS حلاً أكثر واقعية للتطبيقات الرقمية الحقيقية مثل تحرير المحتوى المتعددة أو تحرير الصوت.

علاوة على ذلك، اقترح المطورون مؤخرًا تمديدًا لإطار QSS، وهو إطار LASS أو Language-queried Audio Source Separation الذي يهدف إلى فصل مصادر صوتية عشوائية من مزيج صوتي باستخدام وصفات لغة طبيعية للمصدر الصوتي المستهدف. نظرًا لأن إطار LASS يسمح للمستخدمين باستخراج مصادر الصوت المستهدفة باستخدام مجموعة من تعليمات اللغة الطبيعية، فقد يصبح أداة قوية ذات تطبيقات واسعة النطاق في تطبيقات الصوت الرقمي.

في الأصل، يعتمد إطار LASS على التعلم الإشرافي الذي يتم فيه تدريب النموذج على مجموعة من بيانات الصوت-النص المزدوجة المسمى. ومع ذلك، المشكلة الرئيسية في هذا النهج هي محدودية توافر بيانات الصوت-النص المسمى. من أجل تقليل اعتماد إطار LASS على بيانات الصوت-النص المسمى، يتم تدريب النماذج باستخدام نهج التعلم الإشرافي المتعدد الوسائط. الهدف الرئيسي من استخدام نهج التعلم الإشرافي المتعدد الوسائط هو استخدام نماذج التعلم الإشرافي المتعددة الوسائط مثل نموذج CLIP أو Contrastive Language Image Pre Training ككود الاستعلام لإطار LASS.

为了解决当前 LASS 框架的局限性,开发人员引入了 AudioSep,一种基础模型,旨在使用自然语言描述从音频混合中分离声音。AudioSep 的当前重点是开发一个预训练的音频分离模型,利用现有的大规模多模态数据集,以实现 LASS 模型在开放域应用中的泛化。总之,AudioSep 模型是“一种使用自然语言查询或描述的开放域通用音频分离基础模型,训练于大规模音频和多模态数据集”。

AudioSep:关键组件和架构

AudioSep 框架的架构由两个关键组件组成:文本编码器和分离模型。

文本编码器

AudioSep 框架使用 CLIP 或 Contrastive Language Image Pre Training 模型的文本编码器或 CLAP 或 Contrastive Language Audio Pre Training 模型的文本编码器来提取自然语言查询中的文本嵌入。输入文本查询由“N”个标记序列组成,然后由文本编码器处理以提取给定输入语言查询的文本嵌入。文本编码器使用一堆变换器块来编码输入文本标记,并且输出表示是通过变换器层聚合的,结果是具有固定长度的 D 维向量表示,其中 D 对应于 CLAP 或 CLIP 模型的维度,而文本编码器在训练期间是冻结的。

CLIP 模型是在大规模图像-文本对数据集上使用对比学习预训练的,这也是其文本编码器学习将文本描述映射到语义空间的原因,该空间也由视觉表示共享。AudioSep 通过使用 CLIP 的文本编码器获得的优势是,它现在可以使用视觉嵌入作为替代品来扩大或训练 LASS 模型,从而使其能够在无需注释音频-文本数据的情况下训练 LASS 模型。

CLAP 模型的工作方式与 CLIP 模型类似,使用对比学习目标,并使用文本和音频编码器来连接音频和语言,从而将文本和音频描述映射到音频-文本潜在空间中。

分离模型

AudioSep 框架使用频率域 ResUNet 模型作为分离骨干,该模型输入音频片段的混合。该框架通过对波形信号应用短时傅里叶变换(STFT)来提取复杂谱图、幅度谱图和相位。然后,模型遵循相同的设置,并构建编码器-解码器网络来处理幅度谱图。

ResUNet 编码器-解码器网络由 6 个残差块、6 个解码器块和 4 个瓶颈块组成。在每个编码器块中,谱图使用 4 个残差卷积块对其进行下采样到瓶颈特征,而解码器块使用 4 个残差反卷积块通过上采样特征来获得分离组件。然后,在每个编码器块和其对应的解码器块之间建立跳过连接,操作在相同的上采样或下采样率下进行。框架中的残差块由 2 个泄漏 ReLU 激活层、2 个批量归一化层和 2 个卷积层组成。此外,框架还引入了一个额外的残差快捷方式,连接每个残差块的输入和输出。ResUNet 模型以复杂谱图 X 为输入,并生成幅度掩码 M 为输出,相位残差由文本嵌入条件化,控制谱图的幅度缩放和旋转。然后,可以通过将预测的幅度掩码和相位残差乘以混合的 STFT(短时傅里叶变换)来提取分离的复杂谱图。

在其框架中,AudioSep 使用 FiLm 或特征线性调制层来连接分离模型和文本编码器,在 ResUNet 中部署卷积块之后。

训练和损失

在 AudioSep 模型的训练过程中,开发人员使用响亮度增强方法,并通过使用预测波形和真实波形之间的 L1 损失函数来训练 AudioSep 框架端到端。

数据集和基准

如前所述,AudioSep 是一个基础模型,旨在解决 LASS 模型对注释音频-文本对数据集的当前依赖。AudioSep 模型在多个数据集上进行训练,以使其具有多模态学习能力,以下是开发人员用于训练 AudioSep 框架的数据集和基准的详细描述。

AudioSet

AudioSet 是一个大规模的弱标注音频数据集,包含超过 200 万个 10 秒的音频片段,直接从 YouTube 中提取。AudioSet 数据集中的每个音频片段根据声音类别的存在或不存在进行分类,没有声音事件的具体时间细节。AudioSet 数据集有超过 500 个不同的音频类别,包括自然声音、人类声音、车辆声音等。

VGGSound

VGGSound 数据集是一个大规模的视觉-音频数据集,与 AudioSet 类似,也是从 YouTube 中提取的,包含超过 20 万个视频片段,每个片段的长度为 10 秒。VGGSound 数据集根据声音类别进行分类,包括人类声音、自然声音、鸟类声音等。使用 VGGSound 数据集可以确保产生目标声音的对象也可以在对应的视觉片段中描述。

AudioCaps

AudioCaps 是目前最大的公开音频字幕数据集,包含超过 5 万个 10 秒的音频片段,从 AudioSet 数据集中提取。AudioCaps 数据集分为三个类别:训练数据、测试数据和验证数据,音频片段使用 Amazon (AMZN ) Mechanical Turk 平台进行人工注释,使用自然语言描述。值得注意的是,训练数据集中的每个音频片段只有一个字幕,而测试和验证数据集中的每个音频片段都有 5 个真实字幕。

ClothoV2

ClothoV2 是一个音频字幕数据集,包含从 FreeSound 平台中提取的音频片段,与 AudioCaps 类似,每个音频片段使用 Amazon Mechanical Turk 平台进行人工注释,使用自然语言描述。

WavCaps

WavCaps 是一个大规模的弱标注音频数据集,包含超过 40 万个音频片段,带有字幕,总运行时间约为 7568 小时的训练数据。WavCaps 数据集中的音频片段来自多个音频源,包括 BBC Sound Effects、AudioSet、FreeSound、SoundBible 等。

训练细节

在训练阶段,AudioSep 模型从训练数据集中随机采样两个不同音频片段,然后将它们混合在一起,创建一个训练混合音, 每个音频片段的长度约为 5 秒。然后,模型使用 Hann 窗口大小为 1024、跳跃大小为 320 的 STFT 从波形信号中提取复杂谱图。

然后,模型使用 CLIP/CLAP 模型的文本编码器来提取文本嵌入,文本监督是 AudioSep 的默认配置。对于分离模型,AudioSep 框架使用一个具有 30 层、6 个编码器块和 6 个解码器块的 ResUNet 层,类似于通用音频分离框架的架构。此外,每个编码器块有两个卷积层,卷积核大小为 3×3,编码器块的输出特征映射数量分别为 32、64、128、256、512 和 1024。解码器块与编码器块对称,开发人员应用 Adam 优化器来训练 AudioSep 模型,批量大小为 96。

评估结果

在已见数据集上

以下图表比较了 AudioSep 框架在训练阶段的已见数据集上的性能,包括训练数据集。下图表示 AudioSep 框架与基准系统(包括语音增强模型、LASS 和 CLIP)相比的基准评估结果。使用 CLIP 文本编码器的 AudioSep 模型表示为 AudioSep-CLIP,而使用 CLAP 文本编码器的 AudioSep 模型表示为 AudioSep-CLAP。

如图所示,AudioSep 框架在使用音频字幕或文本标签作为输入查询时表现良好,结果表明 AudioSep 框架在与以前的基准 LASS 和音频查询音频分离模型相比时具有更好的性能。

在未见数据集上

为了评估 AudioSep 在零样本学习设置中的性能,开发人员继续评估其在未见数据集上的性能,AudioSep 框架在零样本学习设置中实现了令人印象深刻的分离性能,结果如以下图所示。

此外,下图显示了评估 AudioSep 模型与 Voicebank-Demand 语音增强的结果。

AudioSep 框架的评估结果表明其在未见数据集上的零样本学习设置中具有强大且理想的性能,因此为在新数据分布上执行音频操作任务铺平了道路。

分离结果的可视化

以下图表显示了当开发人员使用 AudioSep-CLAP 框架对不同音频或声音的文本查询进行分离的光谱图的可视化结果。结果使开发人员能够观察到分离源的光谱图模式接近真实源,这进一步支持了在实验中获得的目标结果。

文本查询的比较

开发人员评估了 AudioSep-CLAP 和 AudioSep-CLIP 在 AudioCaps Mini 上的性能,并使用 AudioSet 事件标签、AudioCaps 标题和重新注释的自然语言描述来检查不同的查询的影响。以下图表显示了 AudioCaps Mini 的一个示例。

结论

AudioSep 是一个基础模型,旨在成为开放域通用音频分离框架,使用自然语言描述进行音频分离。如评估中所观察到的,AudioSep 框架能够使用音频字幕或文本标签作为查询进行零样本学习和无监督学习。AudioSep 的结果和评估性能表明其具有强大的性能,超越了当前的音频分离框架,如 LASS,并可能能够解决流行的音频分离框架的当前限制。

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.