Modèles et plateformes d’IA

OpenAI Crée Un Nouveau Programme IA Pour Créer De La Musique En Fonction De Genres

mm
Ajouter Unite.AI à vos sources préférées sur Google

L’organisation de recherche indépendante OpenAI a récemment publié une nouvelle forme d’IA générative appelée Jukebox, ainsi nommée en raison de sa capacité à générer de la musique. L’IA Jukebox est capable de générer des sons en fonction d’attributs tels que l’instrumentation et même les paroles, et l’équipe de recherche d’OpenAI a créé l’IA en la formant sur des extraits audio compressés et divers extraits de paroles.

Comme l’a rapporté TechCrunch , les chercheurs d’OpenAI ont formé le modèle en utilisant des extraits audio bruts, donnant ainsi au modèle la capacité de produire de l’audio. Cela contraste avec les approches utilisées pour créer d’autres applications de génération de musique, qui s’appuient souvent sur la « musique symbolique » (comme la musique MIDI) qui est des informations sur les notes et les hauteurs, mais pas de véritable audio. L’équipe de chercheurs a utilisé des réseaux de neurones convolutionnels pour former le modèle, en compressant l’audio et en le codant dans un format que le réseau de neurones pouvait interpréter. Par la suite, un transformateur a été utilisé pour générer de l’audio compressé, qui a été échantillonné pour convertir les données en format audio.

Lors de la création de Jukebox, OpenAI a dû créer une méthode pour traiter la nature complexe et dense de l’audio. Les chercheurs ont traité la nature continue de l’audio en le divisant en sections plus discrètes et plus faciles à digérer, en divisant les chansons en morceaux d’une durée de 1/128e de seconde. L’objectif était de créer un modèle IA capable de diviser les chansons en morceaux suffisamment grands pour que le problème ne devienne pas inextricable, mais suffisamment petits et précis pour que les modèles puissent apprendre le motif d’une chanson et le reconstruire.

La technique utilisée par OpenAI partage certaines similitudes avec un ancien IA de génération de musique que la société a produit, appelé MuseNet. MuseNet a été formé sur des fichiers MIDI et était capable de générer de la musique dans une variété de styles, bien qu’il se soit concentré sur la mélodie générale d’une chanson et n’ait pas pu produire de paroles. En revanche, Jukebox est capable d’écrire ses propres paroles pour accompagner la musique. Les paroles sont « co-écrites » par les chercheurs d’OpenAI, en guidant le modèle pour créer des paroles dans certains styles. Le système Jukebox a été formé sur des paroles extraites de LyricWiki, avec des données de formation consistant en texte et métadonnées sur 1,2 million de chansons.

Lorsqu’il s’agit des paroles du modèle, les chercheurs ont d’abord essayé d’utiliser une simple heuristique qui étirait les paroles à la durée approximative d’une chanson, en analysant le texte qui correspondait à un morceau/segment particulier de la chanson. Cette approche simple a fonctionné bien en général, bien que les chercheurs aient constaté que lorsque les paroles étaient particulièrement rapides, cela se décomposait. Pour résoudre ce problème, les vocaux ont été extraits de la chanson et alignés avec le texte des paroles pour obtenir des alignements de paroles au niveau du mot. Par la suite, une couche de codage a été utilisée pour les paroles ainsi qu’une couche d’attention qui a cartographié les sections de la musique aux paroles en utilisant des paires clé-valeur. Le résultat a été que les paroles et les vocaux avaient une correspondance assez précise.

Les auteurs de l’article notent également qu’il existe plusieurs limites que Jukebox possède, et que les travaux futurs viseront à améliorer la capacité de l’IA. Comme les auteurs l’écrivent dans un billet de blog :

« Alors que Jukebox représente un pas en avant en termes de qualité musicale, de cohérence, de longueur d’échantillon audio et de capacité à conditionner l’artiste, le genre et les paroles, il existe un écart important entre ces générations et la musique créée par l’homme. Par exemple, bien que les chansons générées montrent une cohérence musicale locale, suivent des modèles d’accords traditionnels et peuvent même présenter des solos impressionnants, nous n’entendons pas de structures musicales plus larges familières telles que des refrains qui se répètent. »

Actuellement, le modèle est capable de produire une chanson qui est reconnaissable dans le style d’un genre ou même d’un artiste spécifique. Par exemple, il peut produire des chansons dans le style d’Elvis Presley, Katy Perry ou Rage Against the Machine. Bien que les chansons soient reconnaissables dans un genre ou sur le thème d’un style de chanteur, elles sont également assez grossières, ressemblant souvent à une parodie ou à une mauvaise version d’une chanson. Néanmoins, la réalisation technique est impressionnante. Les chercheurs responsables de la création du système de génération d’IA ont choisi de travailler sur un programme capable de générer de la musique spécifiquement parce que la tâche était difficile, et les chercheurs prévoient de continuer à affiner leurs techniques. Vous pouvez écouter certaines des chansons ici.

Blogueur et programmeur avec des spécialités en Machine Learning et Deep Learning sujets. Daniel espère aider les autres à utiliser le pouvoir de l'IA pour le bien social.