Modèles et plateformes d’IA

Google lance les modèles vocaux Gemini 3.8 Live et Extended Thinking

mm
Ajouter Unite.AI à vos sources préférées sur Google

Google a annoncé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking le 15 septembre 2026, une paire de modèles de dialogue en direct déployés via l’API Gemini, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live et Google Workspace.

Les modèles ont été présentés par Tom Ouyang, ingénieur principal, et Malini Jaganathan, membre du personnel technique, écrivant au nom de l’équipe Gemini Audio. Google décrit le duo comme ses modèles de dialogue en direct les plus avancés à ce jour, conçus pour la conversation naturelle, et indique que les gains en intelligence et en raisonnement parallèle les rendent plus intuitifs pour collaborer sur des tâches complexes exécutées par la voix. L’entreprise positionne Gemini 3.8 Live pour l’évolutivité et l’efficacité des coûts, combinant intelligence conversationnelle, dialogue fluide et ancrage visuel, tandis que Gemini 3.8 Live Extended Thinking est conçu pour des tâches à haute complexité nécessitant une intelligence accrue et un raisonnement à plusieurs étapes. Selon Google, les modèles offrent aux développeurs et aux entreprises les blocs de construction nécessaires à des agents vocaux fiables et prêts pour la production, tout en rendant les conversations avec Gemini via l’application Gemini, Workspace et Search plus fluides.

Résultats des benchmarks publiés

Google rapporte que Gemini 3.8 Live Extended Thinking a obtenu la première position globale sur le Speech to Speech Quality Index d’Artificial Analysis avec un score de 82,6, et qu’il domine l’achèvement des tâches agentiques avec 68,6 % sur τ-Voice et 35,1 % sur le benchmark τ-Voice-banking de Sierra. L’entreprise indique également un score de 97,7 % sur Big Bench Audio et affirme que Extended Thinking maintient un prix très compétitif par rapport aux autres modèles de pointe. Google indique que Gemini 3.8 Live s’est classé deuxième dans le Speech Agent Arena d’Artificial Analysis, soulignant une forte préférence des utilisateurs, et le décrit comme très rentable et conçu pour l’évolutivité. Sur l’EVA-Bench de ServiceNow, un benchmark d’évaluation des agents vocaux, Google affirme que ses modèles repoussent la frontière de Pareto pour les flux de travail complexes en équilibrant avec succès précision et qualité conversationnelle ; le post précise que cette évaluation a été réalisée sur l’API Live sur la plateforme d’agents Gemini Enterprise.

Capacités de conversation en temps réel

Selon Google, Gemini 3.8 Live traite les entrées visuelles en quasi temps réel, ajoutant un contexte que l’entreprise affirme produire des réponses plus utiles. Le modèle détecte automatiquement et passe entre 97 langues prises en charge en cours de conversation, et il exécute des outils et des appels d’API en arrière-plan pendant que la conversation se poursuit, reconnaissant les demandes et maintenant le dialogue pendant que les tâches se terminent. Pour les tâches nécessitant un raisonnement plus approfondi, Google indique que Extended Thinking raisonne et parle simultanément, utilisant des indices verbaux précoces pour reconnaître naturellement les invites et une narration de progression en direct pour guider les utilisateurs à travers des tâches d’arrière-plan à plusieurs étapes à mesure qu’elles avancent, sans interrompre le flux conversationnel.

Les vidéos de démonstration publiées avec l’annonce montrent Gemini 3.8 Live guidant une session d’intégration d’employés en temps réel en utilisant le contexte visuel pour répondre aux questions en direct, jouant aux échecs en quasi temps réel, créant des plans d’affaires complets et des kits marketing personnalisés grâce à la parole naturelle, et alimentant une assistance de dépannage étape par étape dans Search Live. Les démonstrations d’Extended Thinking montrent le modèle transformant des croquis bruts et des retours vocaux en quasi temps réel en composants React fonctionnels, coordonnant des réservations de restaurant à plusieurs étapes via des appels de fonctions asynchrones sans interrompre la conversation, et fonctionnant dans Docs Live, Gmail Live et Keep Live dans Google Workspace.

API Live et écosystème développeur

Google cite Agora, Fishjam, LiveKit, Pipecat, Vercel et Vision Agents comme plateformes développeurs qui utilisent le Gemini Live API pour permettre aux développeurs de créer et déployer des interfaces vocales tandis que les plateformes gèrent l’infrastructure sous-jacente de diffusion multimédia en temps réel. L’entreprise indique également qu’elle s’associe à Salesforce, Genspark et Lumeris sur les nouveaux modèles, soulignant leur intérêt pour la latence, la fluidité et les capacités d’appel d’outils des modèles.

La documentation officielle de l’API Live décrit l’interface comme permettant des interactions vocales et visuelles en temps réel à faible latence avec Gemini, traitant des flux continus d’audio, d’images et de texte pour fournir des réponses orales immédiates via une connexion WebSocket étatful. Les entrées documentées sont de l’audio PCM brut 16 bits à 16 kHz, des images JPEG à raison d’une image par seconde maximum, et du texte, avec une sortie audio PCM brute 16 bits à 24 kHz. Les développeurs peuvent choisir une implémentation serveur‑à‑serveur, où un backend transmet les données de flux du client à l’API Live, ou une implémentation client‑à‑serveur, où le code frontal se connecte directement via WebSockets. La documentation répertorie des cas d’utilisation allant des assistants d’achat en détail et agents de support, aux personnages de jeux interactifs, aux expériences vocales et vidéo dans la robotique, les lunettes intelligentes et les véhicules, aux compagnons de santé, aux outils de conseil financier, aux mentors éducatifs, à la traduction en temps réel, ainsi qu’à la transcription et au sous‑titrage en direct.

Google indique que tout audio généré par ses produits d’IA est marqué d’un filigrane SynthID, un filigrane imperceptible intégré directement dans la sortie audio afin que le contenu généré par l’IA reste détectable pour aider à prévenir la désinformation. L’article renvoie les lecteurs à la fiche modèle pour plus de détails sur l’approche de sécurité et de responsabilité de l’entreprise.

Disponibilité et déploiement

Les deux modèles ont commencé à être déployés le 15 septembre. Pour les développeurs, ils sont disponibles dans l’API Gemini et Google AI Studio, et pour les entreprises ils sont en prévisualisation privée dans Gemini Enterprise. Gemini 3.8 Live est accessible à tous dans Search Live, tandis que Extended Thinking est disponible dans Gemini Live, dans Docs pour les abonnés Google AI Pro et Ultra via Workspace, ainsi que dans Gmail et Keep pour tous les abonnés Google AI. Google indique que Gemini Enterprise pour le support de l’expérience client des deux modèles arrive bientôt, et que Extended Thinking sera bientôt proposé aux clients professionnels de Google Workspace.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.