Modèles et plateformes d’IA

Google lance les modèles de parole Gemini 3.8 dans l’API et AI Studio

mm
Ajouter Unite.AI à vos sources préférées sur Google

Google, le 23 septembre 2026, a présenté Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale qu’il a décrits comme ses modèles de génération audio les plus expressifs à ce jour. Les deux modèles ont commencé à être déployés le même jour dans l’API Gemini et Google AI Studio.

L’annonce, rédigée par le Group Product Manager Leland Rechis et le Director of Research Science Alan Cowen au nom de l’équipe Gemini Audio, positionne Gemini 3.8 Flash TTS pour une direction créative approfondie et la conception de personnages dans les jeux vidéo, les livres audio immersifs, les podcasts et les médias interactifs. Gemini 3.8 Flash‑Lite TTS est conçu pour un usage à haut volume et rentable, optimisé pour le doublage, la création de contenus audio et les agents vocaux avec un contrôle granulaire du ton, du rythme et des nuances expressives. L’annonce présente le duo comme la suite des précédentes versions Gemini Audio : 3.5 Live Translate, 3.5 Transcribe et les modèles Gemini 3.8 Live et 3.8 Live Extended Thinking. Selon la fiche technique de Gemini 3.8 Audio, les modèles sont basés sur Gemini 3 Pro, et les variantes TTS acceptent des entrées texte jusqu’à 8 K jetons et renvoient une sortie audio jusqu’à 64 K jetons.

Conception et réplication de voix

Google affirme que Gemini 3.8 Flash TTS peut créer des voix sur mesure à partir de zéro grâce à des invites en langage naturel, en personnalisant le rôle, l’accent et les caractéristiques vocales dans plus de 100 langues et dialectes. L’entreprise indique que cette version étend son ensemble initial de 30 voix à une bibliothèque de plus de 2 000 voix prêtes pour la production, avec une couverture linguistique étendue, incluant des variantes régionales telles que l’espagnol mexicain, le français québécois et l’anglais écossais. Les utilisateurs peuvent enregistrer et gérer leurs voix personnalisées afin de garantir une performance constante sur les projets en cours, et une fonction de remixage vocal qui ajuste le timbre, la hauteur, le rythme et l’accent des voix de la bibliothèque est annoncée comme prochaine.

La réplication de voix recrée un profil vocal cohérent à partir d’un échantillon audio de 30 secondes de la propre voix de l’utilisateur ou d’une voix dont l’utilisateur détient les droits d’utilisation. Google indique que cette fonctionnalité est livrée avec une vérification de consentement intégrée, un filigrane SynthID et des identifiants C2PA.

Direction de la performance et repères rapportés

Les deux modèles permettent une direction ligne par ligne de chaque performance : les utilisateurs peuvent écrire leurs propres indications scéniques ou laisser Gemini guider la livraison à partir d’indices naturels du script. Google indique que la génération de contenu long maintient la qualité vocale, le rythme et le timbre du personnage constants pendant des heures d’audio continu avec une dérive de locuteur minimale, ciblant les podcasts et les livres audio. Le découpage natif de scènes à deux locuteurs orchestre des conversations à multiples tours à partir d’un seul script tout en gardant les deux voix séparées grâce à une prise de parole naturelle. Les explosions vocales scénarisées et le backchanneling ajoutent des repères non verbaux tels que <laughs>, <sigh> et <gasp>, ainsi que des interjections comme « mhm » et « yeah ».

Lors des évaluations, Google a indiqué que Gemini 3.8 Flash TTS a obtenu la première place globale au Voice Design Benchmark de Hume AI avec un score de 71,4 et a également mené le classement de modélisation des accents avec 60,8. Il a précisé que Flash TTS et Flash‑Lite TTS occupent respectivement les première et deuxième positions dans l’Overall Quality Index de Hume AI, et que les nouveaux modèles montrent des améliorations majeures par rapport à Gemini 3.1 Flash TTS dans des cas d’usage tels que le contenu long et le contrôle de scénario à deux locuteurs. Dans des évaluations aveugles de préférence humaine sur Voice Arena, Google a déclaré que les deux modèles ont pris les meilleures places parmi les concurrents dans des langues dont le japonais, le portugais brésilien, le vietnamien, l’arabe standard moderne, l’espagnol mexicain et l’hindi.

Sécurité, limites et disponibilité

Dans le cadre du système de vérification du consentement, l’utilisateur doit fournir un enregistrement verbal de consentement du propriétaire de la voix correspondant à l’orateur de référence avant de pouvoir créer une voix répliquée. Chaque extrait audio généré par les modèles Gemini Audio comporte un filigrane SynthID, que Google décrit comme imperceptible et intégré directement dans la sortie audio afin que la parole générée par l’IA reste détectable.

La fiche technique répertorie les limites connues, notamment les hallucinations et des lenteurs ou des problèmes de dépassement de délai occasionnels, et indique une date de coupure des connaissances de janvier 2025. En matière de sécurité de pointe, Google DeepMind a déclaré que ses évaluations n’ont détecté aucune nouvelle capacité significative ni aucune amélioration matérielle des performances des modèles Gemini 3.8 Audio par rapport à Gemini 3.7 Flash, dont les évaluations ont montré qu’ils n’atteignaient aucun niveau de capacité suivi ou critique selon le Frontier Safety Framework. Sur cette base, il a affirmé que les modèles Gemini 3.8 Audio ne sont probablement pas susceptibles d’atteindre ces niveaux.

Gemini 3.8 Flash TTS est également disponible dans Gemini Notebook et Flash‑Lite TTS dans Google Vids, l’accès entreprise via l’API dans Gemini Enterprise étant annoncé prochainement. Google AI Studio ajoute un terrain de jeu audio conçu comme un espace de travail de conception vocale, où les développeurs peuvent créer de nouvelles identités vocales à partir de zéro ou répliquer une voix, puis diriger la livraison ligne par ligne dans un éditeur de scénario à deux locuteurs. Une note de bas de page dans l’annonce indique que la réplication de voix via AI Studio n’est pas disponible dans l’Illinois, le Texas, l’Espace économique européen, le Royaume‑Uni, la Suisse et l’Inde. Les plateformes de développeurs Agora, LiveKit, Pipecat et Vercel prennent en charge les modèles via l’API Gemini, et Google a désigné Figma, HeyGen, Linguana, Wondercraft, 99.co et Ollang comme partenaires intégrant les nouveaux modèles TTS pour le doublage mondial, la localisation de médias et les agents vocaux conversationnels.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.