Modèles et plateformes d’IA
Générateur de musique texte-à-musique IA : Stability Audio, Google’s MusicLM et plus
La musique, une forme d’art qui résonne avec l’âme humaine, a toujours été un compagnon constant de notre vie. La création de musique à l’aide de l’intelligence artificielle a commencé il y a plusieurs décennies. Au début, les tentatives étaient simples et intuitives, avec des algorithmes de base créant des mélodies monotones. Cependant, à mesure que la technologie a évolué, la complexité et les capacités des générateurs de musique IA ont également augmenté, ouvrant la voie à l’apprentissage profond et au traitement automatique du langage naturel (NLP) pour jouer des rôles clés dans cette technologie.
Aujourd’hui, des plateformes comme Spotify utilisent l’IA pour affiner l’expérience d’écoute de leurs utilisateurs. Ces algorithmes d’apprentissage profond analysent les préférences individuelles en fonction de divers éléments musicaux tels que le tempo et l’humeur pour créer des suggestions de chansons personnalisées. Ils analysent également les modèles d’écoute plus larges et fouillent Internet à la recherche de discussions sur les chansons pour créer des profils de chansons détaillés.
L’origine de l’IA dans la musique : un voyage de la composition algorithmique à la modélisation générative
Dans les premières étapes de l’IA dans le monde de la musique, allant des années 1950 aux années 1970, l’accent était mis principalement sur la composition algorithmique. Il s’agissait d’une méthode dans laquelle les ordinateurs utilisaient un ensemble de règles définies pour créer de la musique. La première création notable pendant cette période était la Illiac Suite pour quatuor à cordes en 1957. Elle utilisait l’algorithme de Monte Carlo, un processus impliquant des nombres aléatoires pour dicter la hauteur et le rythme dans les limites de la théorie musicale traditionnelle et des probabilités statistiques.
Pendant cette période, un autre pionnier, Iannis Xenakis, a utilisé des processus stochastiques, un concept impliquant des distributions de probabilité aléatoire, pour créer de la musique. Il a utilisé des ordinateurs et le langage FORTRAN pour relier plusieurs fonctions de probabilité, créant un modèle dans lequel différentes représentations graphiques correspondaient à des espaces sonores divers.
La complexité de la traduction de texte en musique
La musique est stockée dans un format de données riche et multi-dimensionnel qui englobe des éléments tels que la mélodie, l’harmonie, le rythme et le tempo, ce qui rend la tâche de traduire le texte en musique extrêmement complexe. Une chanson standard est représentée par près d’un million de nombres dans un ordinateur, un chiffre nettement supérieur à d’autres formats de données comme les images, le texte, etc.
Le domaine de la génération audio est témoin d’approches innovantes pour surmonter les défis de la création de sons réalistes. Une méthode consiste à générer un spectrogramme, puis à le convertir en audio.
Une autre stratégie utilise la représentation symbolique de la musique, comme les partitions, qui peuvent être interprétées et jouées par des musiciens. Cette méthode a été numérisée avec succès, avec des outils comme le Chamber Ensemble Generator de Magenta, créant de la musique au format MIDI, un protocole qui facilite la communication entre les ordinateurs et les instruments de musique.
Alors que ces approches ont avancé le domaine, elles comportent leurs propres limites, soulignant la nature complexe de la génération audio.
Transformer-based autoregressive models et U-Net-based diffusion models, sont à la pointe de la technologie, produisant des résultats de pointe dans la génération d’audio, de texte, de musique et bien plus encore. La série GPT d’OpenAI et presque tous les autres LLMs sont actuellement alimentés par des transformateurs utilisant soit l’encodeur, le décodeur, soit les deux architectures. Du côté de l’art/image, MidJourney, Stability AI et DALL-E 2 utilisent tous des cadres de diffusion. Ces deux technologies clés ont été essentielles pour atteindre des résultats de pointe dans le secteur audio. Dans cet article, nous allons nous plonger dans Google’s MusicLM et Stable Audio, qui témoignent des capacités remarquables de ces technologies.
Google’s MusicLM
Google’s MusicLM a été publié en mai de cette année. MusicLM peut générer des pièces de musique de haute fidélité qui correspondent exactement au sentiment décrit dans le texte. En utilisant la modélisation séquentielle hiérarchique, MusicLM a la capacité de transformer les descriptions de texte en musique qui résonne à 24 kHz sur des durées étendues.
Le modèle opère à plusieurs niveaux, ne s’attachant pas seulement aux entrées textuelles mais également démontrant la capacité d’être conditionné sur les mélodies. Cela signifie qu’il peut prendre une mélodie fredonnée ou sifflée et la transformer selon le style décrit dans une légende de texte.
Insights techniques
MusicLM s’appuie sur les principes de AudioLM, un cadre introduit en 2022 pour la génération audio. AudioLM synthétise l’audio comme une tâche de modélisation de langage dans un espace de représentation discret, en utilisant une hiérarchie d’unités audio discrètes grossières à fines, également appelées jetons. Cette approche garantit une haute fidélité et une cohérence à long terme sur des durées substantielles.
Pour faciliter le processus de génération, MusicLM étend les capacités d’AudioLM pour incorporer le conditionnement de texte, une technique qui aligne l’audio généré avec les nuances du texte d’entrée. Cela est réalisé grâce à un espace d’intégration partagé créé à l’aide de MuLan, un modèle de musique-texte conjoint formé pour projeter la musique et ses descriptions de texte correspondantes près les unes des autres dans un espace d’intégration. Cette stratégie élimine efficacement le besoin de légendes pendant la formation, permettant au modèle d’être formé sur des corpus audio uniquement massifs.
Le modèle MusicLM utilise également SoundStream comme son tokeniseur audio, qui peut reconstruire de la musique à 24 kHz à 6 kbps avec une fidélité impressionnante, en utilisant la quantification vectorielle résiduelle (RVQ) pour une compression audio efficace et de haute qualité.

Une illustration du processus de préformation de MusicLM : SoundStream, w2v-BERT et MuLan | Source d’image : ici
De plus, MusicLM étend ses capacités en permettant le conditionnement de mélodie. Cette approche garantit que même une simple mélodie fredonnée peut poser les fondements d’une expérience auditive magnifique, fine-tunée aux descriptions de style textuelles exactes.
Les développeurs de MusicLM ont également open-sourced MusicCaps, un jeu de données présentant 5,5 k de paires musique-texte, chacune accompagnée de descriptions de texte riches créées par des experts humains. Vous pouvez le consulter ici : MusicCaps sur Hugging Face.
Prêt à créer des bandes sonores IA avec Google’s MusicLM ? Voici comment commencer :
- Visitez le site officiel de MusicLM et cliquez sur “Commencer”.
- Inscrivez-vous sur la liste d’attente en sélectionnant “S’inscrire à l’intérêt”.
- Connectez-vous à l’aide de votre compte Google.
- Une fois l’accès accordé, cliquez sur “Essayer maintenant” pour commencer.
Voici quelques exemples de invites que j’ai expérimentés :
“Chanson méditative, calme et apaisante, avec des flûtes et des guitares. La musique est lente, avec un focus sur la création d’un sentiment de paix et de tranquillité.”
“jazz avec saxophone”
Lorsqu’il est comparé à des modèles SOTA précédents tels que Riffusion et Mubert dans une évaluation qualitative, MusicLM a été préféré plus que les autres, avec des participants évaluant favorablement la compatibilité des légendes de texte avec des extraits audio de 10 secondes.

Comparaison de performance de MusicLM, Image source : ici
Stability Audio
Stability AI a introduit récemment “Stable Audio“, une architecture de modèle de diffusion latent conditionnée sur les métadonnées de texte ainsi que sur la durée et le moment de début du fichier audio. Cette approche, similaire à celle de Google’s MusicLM, permet un contrôle sur le contenu et la longueur de l’audio généré, permettant la création d’extraits audio avec des longueurs spécifiées jusqu’à la taille de la fenêtre d’entraînement.
Insights techniques
Stable Audio se compose de plusieurs composants, notamment un Variational Autoencoder (VAE) et un modèle de diffusion conditionné basé sur U-Net, travaillant ensemble avec un encodeur de texte.

Architecture de Stable Audio, Image source : ici
Le VAE facilite la génération plus rapide et l’entraînement en compressant l’audio stéréo dans un codage latent compressé, résistant au bruit et inversible, en contournant le besoin de travailler avec des échantillons audio bruts.
L’encodeur de texte, dérivé d’un modèle CLAP, joue un rôle crucial dans la compréhension des relations complexes entre les mots et les sons, offrant une représentation informative du texte d’entrée tokenisé. Cela est réalisé en utilisant les fonctionnalités de texte de la couche pénultième de l’encodeur de texte CLAP, qui sont ensuite intégrées dans le U-Net de diffusion à travers des couches d’attention croisée.
Un aspect important est l’incorporation d’incrustations de temporisation, qui sont calculées en fonction de deux propriétés : la seconde de début de la partie audio et la durée totale du fichier audio d’origine. Ces valeurs, traduites en incrustations discrètes apprises par seconde, sont combinées avec les jetons de invite et alimentent les couches d’attention croisée du U-Net, permettant aux utilisateurs de dicter la longueur globale de l’audio de sortie.
Le modèle Stable Audio a été formé en utilisant un vaste ensemble de données de plus de 800 000 fichiers audio, en collaboration avec le fournisseur de musique de stock AudioSparx.
Stable Audio offre une version gratuite, permettant 20 générations de pistes de jusqu’à 20 secondes par mois, et un plan Pro à 12 $/mois, permettant 500 générations de pistes de jusqu’à 90 secondes.
Voici un extrait audio que j’ai créé en utilisant Stable Audio.
“Cinématique, bande originale pluie douce, ambiance, apaisante, chiens lointains aboyant, bruissement de feuilles calme, vent subtil, 40 BPM”
Les applications de ces pièces audio finement conçues sont infinies. Les cinéastes peuvent utiliser cette technologie pour créer des paysages sonores riches et immersifs. Dans le secteur commercial, les annonceurs peuvent utiliser ces pistes audio personnalisées. De plus, cet outil ouvre des voies pour les créateurs individuels et les artistes pour expérimenter et innover, offrant un canevas de potentiel illimité pour créer des pièces sonores qui racontent des histoires, évoquent des émotions et créent des atmosphères avec une profondeur qui était précédemment difficile à atteindre sans un budget important ou une expertise technique.
Conseils de formulation
Créez l’audio parfait en utilisant des invites de texte. Voici un guide rapide pour vous lancer :
- Soyez détaillé : Spécifiez les genres, les humeurs et les instruments. Par exemple : Cinématique, Western sauvage, Percussion, Tense, Atmosphérique
- Paramétrage de l’humeur : Combinez les termes musicaux et émotionnels pour transmettre l’humeur souhaitée.
- Choix d’instrument : Améliorez les noms d’instruments avec des adjectifs, comme “Guitare réverbérée” ou “Chœur puissant”.
- BPM : Alignez le tempo avec le genre pour une sortie harmonieuse, comme “170 BPM” pour une piste de Drum and Bass.
Notes de clôture
Dans cet article, nous avons plongé dans la musique générée par IA, des compositions algorithmiques aux cadres de modélisation générative sophistiqués d’aujourd’hui comme Google’s MusicLM et Stability Audio. Ces technologies, qui utilisent l’apprentissage profond et les modèles de compression de pointe, améliorent non seulement la génération de musique mais également l’expérience des auditeurs.
Cependant, c’est un domaine en constante évolution, avec des défis tels que le maintien de la cohérence à long terme et le débat en cours sur l’authenticité de la musique créée par IA, qui défient les pionniers dans ce domaine. Il y a juste une semaine, le buzz était autour d’une chanson créée par IA qui canalisait les styles de Drake et The Weeknd, qui avait initialement pris feu en ligne plus tôt cette année. Cependant, elle a été supprimée de la liste des nominations aux Grammy, montrant le débat en cours sur la légitimité de la musique générée par IA dans l’industrie (source). Alors que l’IA continue de combler les lacunes entre la musique et les auditeurs, elle promeut certainement un écosystème où la technologie coexiste avec l’art, favorisant l’innovation tout en respectant la tradition.

















