Modèles et plateformes d’IA

Google présente un modèle de musique IA qui crée plus vite que la lecture

mm
Ajouter Unite.AI à vos sources préférées sur Google

Imaginez cela : un musicien assis à son ordinateur, non pas en composant note par note, mais en dirigeant un collaborateur IA à travers une performance en direct – en changeant de genre, en mélangeant des instruments et en explorant des territoires sonores qui existent entre les styles musicaux établis. C’est ce qui se passe maintenant avec Magenta RealTime (RT) de Google (GOOGL ), un modèle open-source qui apporte une interactivité en temps réel à la génération de musique IA.

Tout récemment publié, Magenta RT nous oblige à changer notre façon de penser la musique générée par IA. Contrairement aux modèles précédents qui exigeaient des utilisateurs d’attendre que les pistes soient entièrement rendues, Magenta RT génère de la musique plus vite qu’elle ne la lit, permettant une véritable interaction en temps réel. Pour l’industrie musicale – déjà aux prises avec l’influence perturbatrice de l’IA – cette technologie ouvre des portes à de nouvelles formes d’expression créative tout en soulevant des questions profondes sur l’auteur, la performance et l’avenir de la musique humaine.

Comprendre Magenta RealTime

À son cœur, Magenta RT est un modèle de transformateur autoregressif de 800 millions de paramètres, mais ce qui le distingue est son approche du défi de la génération en temps réel. Le modèle génère des flux de musique continus de 2 secondes, chacun conditionné par les 10 dernières secondes de sortie audio et un style d’intégration dynamiquement ajustable. Cette architecture permet aux musiciens de manipuler l’intégration de style en temps réel, en dirigeant efficacement la sortie musicale à mesure qu’elle se déroule.

Le réalisation technique ici ne peut pas être surestimée. Sur un Google Colab TPU de niveau gratuit, Magenta RT génère 2 secondes d’audio en seulement 1,25 seconde – un facteur temps réel de 1,6. Cette vitesse est rendue possible grâce à plusieurs innovations :

  • Autoregression de bloc : Plutôt que de générer des pistes entières à la fois, le modèle travaille en petits morceaux gérables qui peuvent être traités rapidement
  • SpectroStream Codec : Un successeur de SoundStream qui permet un audio stéréo 48kHz de haute fidélité
  • MusicCoCa Embeddings : Un nouveau modèle d’intégration de musique et de texte qui permet un contrôle sémantique sur le processus de génération

Ce qui rend cela particulièrement impressionnant est que, contrairement aux solutions basées sur des API ou aux modèles de génération orientés vers les lots, Magenta RT prend en charge la synthèse de streaming avec un facteur de temps réel supérieur à 1. Cela signifie que le modèle peut réellement devancer la lecture, créant un tampon qui assure un flux musical fluide et ininterrompu.

De la génération passive à la performance active

Les implications de la génération de musique IA en temps réel s’étendent loin au-delà des spécifications techniques. Comme le note l’équipe Magenta, “L’interaction en direct exige plus du joueur mais peut offrir plus en retour. La boucle continue de perception-action entre l’humain et le modèle offre un accès à un état de flux créatif, en mettant l’accent sur le plaisir du processus plutôt que sur le produit final.”

Ce passage de l’engagement passif à l’engagement actif répond à l’une des principales critiques du contenu généré par IA : son potentiel à inonder le marché avec de la musique sans âme, produite en masse. Les modèles en temps réel “évite naturellement de créer un déluge de contenu passif, car ils équilibrent intrinsèquement l’écoute et la génération dans un rapport de 1:1”. Chaque moment de musique créée nécessite un moment d’attention et de prise de décision humaine.

Considérez les possibilités que cela ouvre :

  • Performance en direct : Les DJs et les musiciens électroniques peuvent incorporer l’IA comme un instrument réactif dans leurs sets, ajoutant à l’ensemble croissant d’outils IA pour les musiciens qui améliorent plutôt que de remplacer la créativité humaine
  • Installations interactives : Les artistes peuvent créer des environnements où la musique répond au mouvement du public ou à des facteurs environnementaux
  • Outils éducatifs : Les étudiants peuvent explorer des concepts musicaux à travers des rétroactions immédiates et tangibles
  • Bandes sonores de jeux : Des scores dynamiques qui s’adaptent aux actions du joueur en temps réel

Perturbation et opportunité

L’industrie musicale se trouve à la croisée des chemins. Le chiffre d’affaires de l’industrie musicale devrait augmenter de 17,2%, en partie grâce à la musique générée par IA, avec le marché mondial de la musique IA évalué à 2,9 milliards de dollars en 2024. Cependant, cette croissance est accompagnée de préoccupations importantes de la part des artistes et des professionnels de l’industrie.

Les recherches de Goldmedia prédisent que, sans systèmes de compensation appropriés, les musiciens pourraient perdre jusqu’à 27% de leurs revenus d’ici 2028 à mesure que le contenu généré par IA augmente. La peur est palpable – l’IA remplacera-t-elle les musiciens humains ? La valeur de la créativité humaine sera-t-elle diminuée dans un monde où n’importe qui peut générer de la musique professionnelle ?

Magenta RT offre une réponse nuancée à ces préoccupations. En se positionnant comme un outil open-source qui améliore plutôt que remplace la créativité humaine, il fournit un modèle pour la façon dont l’IA et les musiciens pourraient coexister. L’exigence d’une entrée humaine en temps réel garantit que la technologie amplifie la créativité humaine plutôt que de fonctionner de manière autonome.

Démocratisation par rapport à la dévaluation

L’un des impacts les plus significatifs de Magenta RT est son potentiel à démocratiser la création musicale. Le modèle est conçu pour fonctionner éventuellement sur du matériel grand public et est déjà fonctionnel sur des TPU Colab de niveau gratuit. Cette accessibilité signifie que les musiciens aspirants sans équipement coûteux ou formation formelle peuvent expérimenter des idées musicales complexes, rejoignant l’écosystème croissant de générateurs de musique IA qui transforment les flux de travail créatifs.

Cependant, cette démocratisation comporte des risques. Comme le compositeur Mark Henry Phillips le note dans ses expériences avec la génération de musique IA, il suspecte qu’il “ne pourra bientôt plus gagner sa vie en tant que musicien, car les entreprises commenceront à utiliser directement la technologie elles-mêmes”. La facilité avec laquelle l’IA peut générer de la musique de qualité commerciale menace les flux de revenus traditionnels pour les musiciens professionnels.

Cependant, il y a une autre perspective à considérer. Tout comme la photographie numérique n’a pas éliminé les photographes professionnels mais a changé la nature de leur travail, la génération de musique IA peut remodeler plutôt que remplacer les carrières musicales. La clé réside dans la façon dont les musiciens s’adaptent et intègrent ces outils dans leur processus créatif.

La montée en puissance de la génération de musique IA en temps réel soulève également des questions éthiques urgentes. Les droits d’auteur, la propriété et la compensation équitable restent des questions litigieuses. 90% des musiciens estiment que les entreprises d’IA devraient demander la permission avant d’utiliser de la musique protégée par des droits d’auteur pour la formation, mettant en évidence la tension entre l’innovation technologique et les droits artistiques.

L’approche open-source de Magenta RT offre un chemin possible vers l’avant. En rendant la technologie librement disponible et en la formant sur environ 190 000 heures de musique instrumentale de stock de plusieurs sources, Google a tenté de contourner certaines préoccupations en matière de droits d’auteur tout en produisant un modèle capable.

Les limites du modèle reflètent également des considérations éthiques. Bien qu’il soit capable de générer des vocalisations non lexicales et des bourdonnements, Magenta RT n’est pas conditionné sur les paroles et est peu susceptible de générer des mots réels. Ce choix de conception aide à éviter les problèmes potentiels liés à la génération de contenu lyrique inapproprié tout en se concentrant sur la composition instrumentale.

Le futur de la collaboration musicale humaine-IA

Alors que nous nous tenons au seuil de cette nouvelle ère de création musicale, plusieurs tendances émergent :

  1. Modèles de création hybrides : Plutôt que de remplacer les musiciens, des outils comme Magenta RT deviennent des collaborateurs. Les développements récents dans les systèmes de suivi de rythme avec une latence nulle et une contrôlabilité améliorée montrent comment l’IA peut se synchroniser avec les artistes humains en temps réel.
  2. Nouveaux paradigmes de performance : Le concept de “performance” avec l’IA ouvre entièrement de nouvelles possibilités artistiques. Les musiciens apprennent à “jouer” ces systèmes comme des instruments, en développant des techniques pour obtenir des sons spécifiques et naviguer dans des espaces musicaux latents.
  3. Révolution éducative : La technologie de génération de musique IA a révolutionné l’éducation musicale, avec des plateformes qui offrent des expériences interactives qui écoutent les performances des utilisateurs et offrent des commentaires immédiats.Convergence technique : Avec les innovations dans les codecs audio neuronaux et les architectures optimisées, des outils comme MusicFX DJ peuvent maintenant diffuser de l’audio stéréo 48kHz de production de qualité en temps réel, amenant la musique générée par IA aux normes de qualité professionnelles.

Embrasser l’avenir collaboratif

Magenta RealTime offre un aperçu d’un avenir où les frontières entre la créativité humaine et la créativité de la machine deviennent de plus en plus fluides. En exigeant une entrée humaine en temps réel et en se concentrant sur le processus plutôt que sur la sortie, il offre un modèle pour l’IA qui améliore plutôt que remplace la créativité humaine.

La nature open-source de la technologie et son accessibilité sur du matériel grand public démocratisent la création musicale tout en garantissant que l’agentivité humaine reste centrale dans le processus créatif. Comme le souligne l’équipe Magenta, améliorer la créativité humaine – et non la remplacer – a toujours été au cœur de leur mission.

Pour les musiciens, les producteurs et les amateurs de musique, le message est clair : l’avenir de la musique réside non pas dans le choix entre la création humaine ou l’IA, mais dans l’exploration des vastes possibilités créatives qui émergent lorsque les deux travaillent ensemble en temps réel. Magenta RT est une invitation à réimaginer ce que peut être la création musicale à l’ère de l’IA.

Alors que nous avançons, l’industrie musicale doit faire face à des questions importantes sur la compensation équitable, les droits d’auteur et la valeur de la créativité humaine. Mais si des outils comme Magenta RT sont un indicateur, l’avenir de la musique sera celui de la collaboration, de l’expérimentation et de nouvelles formes d’expression que nous commençons à peine à imaginer.

Alex McFarland est un journaliste et écrivain en intelligence artificielle qui explore les derniers développements en intelligence artificielle. Il a collaboré avec de nombreuses startups et publications en intelligence artificielle dans le monde entier.