Modèles et plateformes d’IA
AudioSep : Séparez Tout Ce Que Vous Décrivez

LASS ou Séparation de Sources Audio Linguistiques est le nouveau paradigme pour CASA ou Analyse de Scène Auditive Computationnelle qui vise à séparer un son cible d’un mélange audio donné en utilisant une requête en langage naturel qui fournit une interface naturelle et évolutives pour les tâches et applications audio numériques. Bien que les cadres LASS aient considérablement progressé ces dernières années en termes de performances souhaitées sur des sources audio spécifiques comme les instruments de musique, ils sont incapables de séparer le son cible dans le domaine ouvert.
AudioSep, est un modèle fondamental qui vise à résoudre les limitations actuelles des cadres LASS en permettant la séparation du son cible en utilisant des requêtes en langage naturel. Les développeurs du cadre AudioSep ont formé le modèle de manière intensive sur une large variété de jeux de données multimodaux à grande échelle, et ont évalué les performances du cadre sur une large gamme de tâches audio, y compris la séparation d’instruments de musique, la séparation d’événements audio et l’amélioration de la parole parmi beaucoup d’autres. Les performances initiales d’AudioSep satisfont aux références, car il démontre des capacités d’apprentissage zéro-shot impressionnantes et offre de fortes performances de séparation audio.
Dans cet article, nous allons plonger plus profondément dans le fonctionnement du cadre AudioSep, en évaluant l’architecture du modèle, les jeux de données utilisés pour la formation et l’évaluation, et les concepts essentiels impliqués dans le fonctionnement du modèle AudioSep. Alors commençons par une introduction de base au cadre CASA.
CASA, USS, QSS, LASS Frameworks : La Fondation pour AudioSep
Le cadre CASA ou l’Analyse de Scène Auditive Computationnelle est un cadre utilisé par les développeurs pour concevoir des systèmes d’écoute de machine qui ont la capacité de percevoir des environnements sonores complexes d’une manière similaire à celle dont les humains perçoivent le son en utilisant leurs systèmes auditifs. La séparation du son, avec un accent particulier sur la séparation du son cible, est un domaine de recherche fondamental au sein du cadre CASA, et il vise à résoudre le problème du « cocktail party » ou la séparation d’enregistrements audio réels à partir d’enregistrements audio sources individuels ou de fichiers. L’importance de la séparation du son peut être attribuée principalement à ses applications répandues, y compris la séparation de sources musicales, la séparation de sources audio, l’amélioration de la parole, l’identification du son cible et bien plus encore.
La plupart des travaux sur la séparation du son effectués dans le passé tournent principalement autour de la séparation d’une ou plusieurs sources audio, comme la séparation musicale ou la séparation de la parole. Un nouveau modèle appelé USS ou Séparation Universelle du Son vise à séparer des sons arbitraires dans des enregistrements audio réels. Cependant, il s’agit d’une tâche difficile et restrictive pour séparer chaque source de son d’un mélange audio, principalement en raison de la grande variété de sources de son existant dans le monde, ce qui est la principale raison pour laquelle la méthode USS n’est pas réalisable pour les applications réelles fonctionnant en temps réel.
Une alternative réalisable à la méthode USS est la méthode QSS ou la Séparation de Son basée sur des Requêtes qui vise à séparer une source de son individuelle ou cible d’un mélange audio en fonction d’un ensemble de requêtes spécifiques. Grâce à cela, le cadre QSS permet aux développeurs et aux utilisateurs d’extraire les sources de son désirées du mélange en fonction de leurs besoins, ce qui rend la méthode QSS une solution plus pratique pour les applications numériques réelles, telles que l’édition de contenu multimédia ou l’édition audio.
De plus, les développeurs ont récemment proposé une extension du cadre QSS, le cadre LASS ou la Séparation de Sources Audio Linguistiques qui vise à séparer des sources de son arbitraires d’un mélange audio en utilisant des descriptions linguistiques naturelles de la source de son cible. Comme le cadre LASS permet aux utilisateurs d’extraire les sources de son cible en utilisant un ensemble de descriptions linguistiques naturelles, il peut devenir un outil puissant avec des applications répandues dans les applications audio numériques. Lorsqu’il est comparé aux méthodes traditionnelles de requêtes audio ou de requêtes visuelles, l’utilisation de descriptions linguistiques naturelles pour la séparation du son offre un degré d’avantage plus élevé, car elle ajoute de la flexibilité et rend l’acquisition d’informations de requête plus facile et plus pratique. De plus, lorsqu’il est comparé aux cadres de séparation de son basés sur des requêtes étiquetées qui utilisent un ensemble prédéfini de requêtes ou d’instructions, le cadre LASS n’a pas de limite sur le nombre de requêtes d’entrée et a la flexibilité d’être généralisé au domaine ouvert de manière transparente.
À l’origine, le cadre LASS repose sur l’apprentissage supervisé, dans lequel le modèle est formé sur un ensemble de données audio-texte appariées étiquetées. Cependant, le principal problème de cette approche est la disponibilité limitée de données audio-texte étiquetées et annotées. Pour réduire la dépendance du cadre LASS à l’égard des données audio-texte étiquetées et annotées, les modèles sont formés en utilisant l’approche d’apprentissage de supervision multimodale. L’objectif principal derrière l’utilisation d’une approche de supervision multimodale est d’utiliser des modèles de pré-formation de contraste multimodaux tels que le modèle CLIP ou le modèle de pré-formation de langage et d’image contrastive comme encodeur de requête pour le cadre. Puisque le modèle CLIP a la capacité d’aligner les embeddings textuels avec d’autres modalités telles que l’audio ou la vision, il permet aux développeurs de former les modèles LASS en utilisant des modalités riches en données et permet l’interférence avec les données textuelles dans un paramètre zéro-shot. Les cadres LASS actuels utilisent cependant des jeux de données à petite échelle pour la formation, et les applications du cadre LASS à travers des centaines de domaines potentiels sont encore à explorer.
Pour résoudre les limitations actuelles auxquelles sont confrontés les cadres LASS, les développeurs ont introduit AudioSep, un modèle fondamental qui vise à séparer le son d’un mélange audio en utilisant des descriptions linguistiques naturelles. L’objectif actuel pour AudioSep est de développer un modèle de séparation de son pré-formé qui utilise les jeux de données multimodaux à grande échelle existants pour permettre la généralisation des modèles LASS dans les applications de domaine ouvert. Pour résumer, le modèle AudioSep est : « Un modèle fondamental pour la séparation universelle du son dans le domaine ouvert en utilisant des requêtes ou des descriptions linguistiques naturelles formées sur des jeux de données audio et multimodaux à grande échelle ».
AudioSep : Composants Clés et Architecture
L’architecture du cadre AudioSep comprend deux composants clés : un encodeur de texte et un modèle de séparation.
L’Encodeur de Texte
Le cadre AudioSep utilise un encodeur de texte du modèle CLIP ou du modèle de pré-formation de langage et d’image contrastive ou du modèle CLAP ou du modèle de pré-formation de langage et d’audio contrastive pour extraire les embeddings de texte dans une requête en langage naturel. La requête de texte d’entrée consiste en une séquence de « N » jetons qui est ensuite traitée par l’encodeur de texte pour extraire les embeddings de texte pour la requête de langage d’entrée. L’encodeur de texte utilise une pile de blocs de transformation pour encoder les jetons de texte d’entrée, et les représentations de sortie sont agrégées après avoir été passées à travers les couches de transformation qui aboutissent au développement d’une représentation vectorielle à dimension fixe où D correspond aux dimensions du modèle CLAP ou CLIP, tandis que l’encodeur de texte est gelé pendant la période de formation.
Le modèle CLIP est pré-formé sur un jeu de données à grande échelle d’appariement de données d’image et de texte en utilisant l’apprentissage contrastif, ce qui est la principale raison pour laquelle son encodeur de texte apprend à mapper les descriptions textuelles sur l’espace sémantique partagé par les représentations visuelles. L’avantage qu’AudioSep tire de l’utilisation de l’encodeur de texte du CLIP est qu’il peut désormais mettre à l’échelle ou former le modèle LASS à partir de données audio-visuelles non étiquetées en utilisant les embeddings visuels comme alternative, permettant ainsi la formation de modèles LASS sans l’exigence de données audio-texte étiquetées et annotées.
Le modèle CLAP fonctionne de manière similaire au modèle CLIP et utilise un objectif d’apprentissage contrastif en utilisant un encodeur de texte et un encodeur audio pour relier l’audio et le langage, ce qui permet de mettre les descriptions textuelles et audio sur un espace latent audio-texte commun.
Modèle de Séparation
Le cadre AudioSep utilise un modèle ResUNet en domaine fréquentiel qui est alimenté par un mélange de clips audio comme colonne vertébrale de séparation pour le cadre. Le cadre fonctionne en appliquant d’abord une transformée de Fourier à court terme ou STFT sur le signal de forme d’onde pour extraire un spectrogramme complexe, le spectrogramme de magnitude et la phase de X. Le modèle suit ensuite la même configuration et construit un réseau encodeur-décodeur pour traiter le spectrogramme de magnitude.
Le réseau encodeur-décodeur ResUNet se compose de 6 blocs résiduels, 6 blocs de décodeur et 4 blocs de goulot d’étranglement. Le spectrogramme de chaque bloc d’encodeur utilise 4 blocs convolutionnels résiduels pour échantillonner en descendant dans un ensemble de caractéristiques de goulot d’étranglement, tandis que les blocs de décodeur utilisent 4 blocs de déconvolution résiduels pour obtenir les composants de séparation en mettant à l’échelle les caractéristiques. Ensuite, chaque bloc d’encodeur et son bloc de décodeur correspondant établissent une connexion de saut qui fonctionne à la même vitesse de mise à l’échelle ou de décodage. Le bloc résiduel du cadre se compose de 2 couches d’activation Leaky-ReLU, 2 couches de normalisation de lot et 2 couches de convolution, et de plus, le cadre introduit un raccourci résiduel supplémentaire qui relie l’entrée et la sortie de chaque bloc résiduel individuel. Le modèle ResUNet prend le spectrogramme complexe X comme entrée et produit le masque de magnitude M comme sortie avec le résidu de phase conditionné par les embeddings de texte qui contrôle l’amplitude de mise à l’échelle et la rotation de l’angle du spectrogramme. Le spectrogramme complexe séparé peut ensuite être extrait en multipliant le masque de magnitude prédit et le résidu de phase avec la transformée de Fourier à court terme ou STFT du mélange.

Dans son cadre, AudioSep utilise une couche FiLm ou une couche modulée linéairement par fonction pour relier le modèle de séparation et l’encodeur de texte après le déploiement des blocs de convolution dans le ResUNet.
Formation et Perte
Pendant la formation du modèle AudioSep, les développeurs utilisent la méthode d’augmentation de sonie et forment le cadre AudioSep de bout en bout en utilisant une fonction de perte L1 entre les formes d’onde réelles et prédites.
Jeux de Données et Références
Comme mentionné dans les sections précédentes, AudioSep est un modèle fondamental qui vise à résoudre la dépendance actuelle des modèles LASS à l’égard des jeux de données audio-texte appariés étiquetés. Le modèle AudioSep est formé sur une large gamme de jeux de données pour lui conférer des capacités d’apprentissage multimodales, et voici une description détaillée des jeux de données et des références utilisés par les développeurs pour former le cadre AudioSep.
AudioSet
AudioSet est un jeu de données audio faiblement étiqueté à grande échelle composé de plus de 2 millions de fragments audio de 10 secondes extraits directement de YouTube. Chaque fragment audio dans le jeu de données AudioSet est catégorisé par l’absence ou la présence de classes de sons sans détails de synchronisation spécifiques des événements sonores. Le jeu de données AudioSet comprend plus de 500 classes de sons distinctes, y compris des sons naturels, des sons humains, des sons de véhicules et bien plus encore.
VGGSound
Le jeu de données VGGSound est un jeu de données visuel-audio à grande échelle qui, comme AudioSet, a été extrait directement de YouTube et contient plus de 200 000 clips vidéo, chacun d’une durée de 10 secondes. Le jeu de données VGGSound est catégorisé en plus de 300 classes de sons, y compris des sons humains, des sons naturels, des sons d’oiseaux et bien plus encore. L’utilisation du jeu de données VGGSound garantit que l’objet responsable de la production du son cible est également décrivable dans la clip visuelle correspondante.
AudioCaps
AudioCaps est le plus grand jeu de données de sous-titres audio disponible publiquement et se compose de plus de 50 000 fragments audio de 10 secondes extraits du jeu de données AudioSet. Les données dans AudioCaps sont divisées en trois catégories : données de formation, données de test et données de validation, et les fragments audio sont annotés par des humains avec des descriptions linguistiques naturelles en utilisant la plate-forme Amazon (AMZN ) Mechanical Turk. Il convient de noter que chaque fragment audio dans le jeu de données de formation a une légende unique, tandis que les données de test et de validation ont chacune 5 légendes réelles.
ClothoV2
ClothoV2 est un jeu de données de sous-titres audio qui se compose de clips extraits de la plate-forme FreeSound, et comme AudioCaps, chaque fragment audio est annoté par des humains avec des descriptions linguistiques naturelles en utilisant la plate-forme Amazon Mechanical Turk.
WavCaps
Comme AudioSet, WavCaps est un jeu de données audio faiblement étiqueté à grande échelle composé de plus de 400 000 fragments audio avec des légendes, et un temps de lecture total d’environ 7568 heures de données de formation. Les fragments audio dans le jeu de données WavCaps sont extraits d’une large gamme de sources audio, y compris BBC Sound Effects, AudioSet, FreeSound, SoundBible et bien plus encore.

Détails de Formation
Pendant la phase de formation, le modèle AudioSep échantillonne aléatoirement deux segments audio provenant de deux fragments audio différents du jeu de données de formation, puis les mélange ensemble pour créer un mélange de formation où la longueur de chaque segment audio est d’environ 5 secondes. Le modèle extrait ensuite le spectrogramme complexe du signal de forme d’onde en utilisant une fenêtre de Hann de taille 1024 avec une taille de saut de 320.
Le modèle utilise ensuite l’encodeur de texte du modèle CLIP/CLAP pour extraire les embeddings de texte avec une supervision de texte par défaut pour AudioSep. Pour le modèle de séparation, le cadre AudioSep utilise un modèle ResUNet composé de 30 couches, 6 blocs d’encodeur et 6 blocs de décodeur ressemblant à l’architecture suivie dans le cadre de séparation universelle du son. De plus, chaque bloc d’encodeur comporte deux couches de convolution avec une taille de noyau 3×3, et le nombre de cartes de caractéristiques de sortie des blocs d’encodeur est respectivement de 32, 64, 128, 256, 512 et 1024. Les blocs de décodeur partagent la symétrie avec les blocs d’encodeur, et les développeurs appliquent l’optimiseur Adam pour former le modèle AudioSep avec une taille de lot de 96.
Résultats d’Évaluation
Sur les Jeux de Données Vus
La figure suivante compare les performances du cadre AudioSep sur les jeux de données vus pendant la phase de formation, y compris les jeux de données de formation. La figure ci-dessous représente les résultats d’évaluation des références du cadre AudioSep lorsqu’il est comparé aux systèmes de référence, y compris les modèles d’amélioration de la parole, LASS et CLIP. Le modèle AudioSep avec l’encodeur de texte CLIP est représenté comme AudioSep-CLIP, tandis que le modèle AudioSep avec l’encodeur de texte CLAP est représenté comme AudioSep-CLAP.

Comme on peut le voir dans la figure, le cadre AudioSep fonctionne bien lorsqu’il utilise des légendes audio ou des étiquettes de texte comme requêtes d’entrée, et les résultats indiquent les performances supérieures du cadre AudioSep lorsqu’il est comparé aux modèles de séparation de son et de requêtes audio traditionnels.
Sur les Jeux de Données Non Vus
Pour évaluer les performances d’AudioSep dans un paramètre zéro-shot, les développeurs ont continué à évaluer les performances sur les jeux de données non vus, et le cadre AudioSep offre des performances de séparation impressionnantes dans un paramètre zéro-shot, et les résultats sont affichés dans la figure ci-dessous.

De plus, l’image ci-dessous montre les résultats de l’évaluation du modèle AudioSep contre l’amélioration de la parole Voicebank-Demand.

L’évaluation du cadre AudioSep indique des performances fortes et souhaitées sur les jeux de données non vus dans un paramètre zéro-shot, et ainsi ouvre la voie à l’exécution de tâches de traitement du son sur de nouvelles distributions de données.
Visualisation des Résultats de Séparation
La figure ci-dessous montre les résultats obtenus lorsque les développeurs ont utilisé le cadre AudioSep-CLAP pour effectuer des visualisations de spectrogrammes pour les sources de son cible réelles, les mélanges audio et les sources de son séparées en utilisant des requêtes de texte pour des sons divers. Les résultats ont permis aux développeurs d’observer que le modèle de spectrogramme de la source séparée est proche de la source de la vérité, ce qui soutient davantage les résultats objectifs obtenus lors des expériences.

Comparaison des Requêtes de Texte
Les développeurs évaluent les performances d’AudioSep-CLAP et d’AudioSep-CLIP sur AudioCaps Mini, et les développeurs utilisent les étiquettes d’événement AudioSet, les légendes AudioCaps et les descriptions linguistiques naturelles ré-annotées pour examiner les effets de différentes requêtes, et la figure ci-dessous montre un exemple d’AudioCaps Mini en action.

Conclusion
AudioSep est un modèle fondamental qui est développé dans le but d’être un cadre de séparation universelle du son à domaine ouvert qui utilise des descriptions linguistiques naturelles pour la séparation du son. Comme observé lors de l’évaluation, le cadre AudioSep est capable de réaliser un apprentissage zéro-shot et non supervisé de manière transparente en utilisant des légendes audio ou des étiquettes de texte comme requêtes. Les résultats et les performances d’évaluation d’AudioSep indiquent des performances fortes qui surpassent les cadres de séparation du son actuels comme LASS, et il peut être suffisamment capable pour résoudre les limitations actuelles des cadres de séparation du son populaires.












