Modèles et plateformes d’IA

Google introduit la génération musicale Lyria 3.5 dans l’application Gemini et l’API

mm
Ajouter Unite.AI à vos sources préférées sur Google

Google, le 4 septembre 2026, a rendu Lyria 3.5, son modèle de génération musicale, disponible dans l’application Gemini et l’API Gemini, étendant le modèle au-delà de l’outil Google Flow Music où il a fait ses débuts plus tôt cette année. Le modèle est accessible à tous les utilisateurs de Gemini dans le monde, sur le web et dans l’application mobile, a déclaré l’entreprise dans son annonce sur The Keyword.

Google décrit Lyria 3.5 comme son modèle de génération musicale au meilleur rendu sonore et indique qu’il offre des voix plus expressives et des arrangements musicaux plus riches que les versions précédentes, produisant des morceaux d’une fidélité supérieure. Le modèle a été lancé pour la première fois dans Google Flow Music le 29 juillet 2026, lorsque Google a déclaré qu’il apportait des améliorations en matière de musicalité, de paroles et de qualité vocale.

Nouveaux contrôles de création dans l’application Gemini

La version de Lyria 3.5 dans l’application Gemini ajoute un ensemble de fonctionnalités de création guidée. Les utilisateurs peuvent sélectionner ou décrire un genre et choisir entre des styles vocaux ou instrumentaux. De nouveaux modèles sont conçus pour lancer des projets allant de la musique d’ambiance aux morceaux d’anniversaire personnalisés, et les utilisateurs peuvent désormais choisir entre des pistes courtes ou plus longues.

Google a indiqué que la fonctionnalité vise des cas d’utilisation tels que des pistes d’accompagnement personnalisées pour la vidéo, des jingles de marque et des sonneries personnalisées. En dehors de l’application, Lyria 3.5 est disponible pour les artistes et les créateurs d’IA dans Google Flow Music, ainsi que pour les développeurs et les techniciens via Google AI Studio et Google Vids.

La page du modèle pour la famille Lyria de Google DeepMind décrit le modèle comme prenant en charge des durées de chanson variables allant jusqu’à trois minutes, avec la capacité de générer des pistes cohérentes correspondant à la durée demandée, d’un clip de 60 secondes à une chanson complète de trois minutes. La page indique que les utilisateurs peuvent écrire leurs propres paroles ou les générer autour de sujets ou de thèmes spécifiques, et peuvent définir les styles vocaux et les préférences acoustiques. Elle décrit également la composition à partir d’images : les utilisateurs peuvent télécharger une image et laisser le modèle la transformer en piste.

Accès développeur via l’API Gemini

Selon la documentation développeur pour la génération musicale de Google, mise à jour le 4 septembre 2026, Lyria 3.5 génère de l’audio stéréo à 44,1 kHz à partir d’instructions textuelles ou d’images, avec une cohérence structurelle incluant des voix, des paroles synchronisées et des arrangements instrumentaux complets. La documentation répertorie deux modèles : Lyria 3 Clip, identifié par l’ID de modèle lyria-3-clip-preview, qui produit toujours des clips de 30 secondes pour les boucles et les aperçus, et Lyria 3.5, identifié par l’ID de modèle lyria-3.5, qui génère des chansons de longueur complète avec couplets, refrains et ponts durant quelques minutes.

Les deux modèles sont accessibles via l’API Interactions de Google et produisent par défaut de l’audio MP3, avec une sortie WAV disponible pour Lyria 3.5. La documentation indique que les développeurs peuvent fournir jusqu’à 10 images en plus d’une instruction textuelle, et que le modèle composera de la musique inspirée du contenu visuel. Ils peuvent également fournir des paroles personnalisées en utilisant des balises de section telles que Verse, Chorus et Bridge, et utiliser des horodatages pour préciser ce qui se passe à des moments précis d’une chanson, par exemple l’entrée des instruments. Délivrer une instruction dans une langue donnée génère des paroles dans cette langue, précise la documentation, le modèle adaptant le style vocal et la prononciation en conséquence. Avant la génération audio, le modèle raisonne sur la structure musicale à partir de l’instruction.

Limitations déclarées et filigrane

La documentation développeur énumère plusieurs limitations. Toutes les instructions passent par des filtres de sécurité, et les demandes de voix d’artistes spécifiques ou la génération de paroles protégées par le droit d’auteur sont bloquées. La génération musicale est un processus à un seul tour, de sorte que l’édition itérative d’un clip généré à travers plusieurs instructions n’est pas prise en charge dans la version actuelle. Les résultats peuvent varier d’un appel à l’autre même avec la même instruction.

Tout audio généré porte un filigrane SynthID à des fins d’identification, que Google décrit comme imperceptible à l’oreille humaine. La page du modèle de DeepMind indique que toutes les pistes sont subtilement filigranées avec SynthID afin que les auditeurs et les plateformes puissent détecter si la musique a été créée ou modifiée à l’aide de l’IA, et que Google utilise un filtrage étendu et un étiquetage des données pour réduire le contenu nuisible dans les ensembles de données d’entraînement ainsi que la probabilité de paroles offensantes. La page ajoute que Google travaille encore à améliorer les capacités clés et conseille aux utilisateurs de vérifier que les pistes générées correspondent à leur vision.

La page de DeepMind indique également que la gamme Lyria a été développée avec la contribution de producteurs et de musiciens, et elle répertorie les expériences antérieures d’artistes avec les outils musicaux de Google, notamment le travail du producteur Wyclef Jean avec Music AI Sandbox et l’utilisation de Lyria par Yung Spielburg pour la bande‑son originale du court métrage d’animation Dear Upstairs Neighbors. Lyria 3.5 est disponible via l’application Gemini, Google Flow Music, Google AI Studio et Google Vids à compter du 4 septembre 2026.

Luca Ren est un analyste généré par IA chez Unite.AI, spécialisé dans l’intelligence artificielle appliquée au divertissement, aux médias et à la narration numérique. Son travail explore la façon dont les systèmes d’IA sélectionnent le contenu, influencent la production de films, de séries télévisées, de musique et de jeux vidéo, et personnalisent les expériences médiatiques pour des publics mondiaux.

Avec une perspective créative et sensible aux tendances, Luca examine comment les moteurs de recommandation, les outils génératifs et l’analyse d’audience transforment les flux de travail créatifs et les modèles de distribution. Il s’intéresse tout particulièrement à la manière dont l’IA affecte la structure narrative, l’autonomie des créateurs et l’équilibre entre l’optimisation basée sur les données et l’expression artistique dans les écosystèmes médiatiques modernes.

Les articles rédigés par Luca Ren sont générés par IA et revus par l’équipe éditoriale de Unite.AI afin d’assurer leur exactitude, leur contexte culturel et une couverture responsable du rôle évolutif de l’IA dans le divertissement et les médias.