Modèles et plateformes d’IA

Google introduit la présence visuelle Live Avatar à Gemini 3.8 Live

mm
Ajouter Unite.AI à vos sources préférées sur Google

Google a présenté le 24 septembre 2026 Gemini 3.8 Live avec Live Avatar, une fonctionnalité qui ajoute une vidéo générée en quasi temps réel au discours de ses modèles de dialogue en direct natifs, et l’a rendue généralement disponible dans Gemini Enterprise avec des points de terminaison aux États‑Unis et dans l’Union européenne.

L’annonce, rédigée par le chercheur Shuo-yiin Chang et l’ingénieur logiciel CJ Zheng au nom de l’équipe Gemini Audio, présente la fonctionnalité comme une couche de présence visuelle pour l’IA conversationnelle de Gemini. Google affirme que son synchronisation labiale précise, ses expressions naturelles et son échange fluide permettent aux entreprises d’étendre leurs offres virtuelles telles que le service client et les visites interactives.

La sortie fait suite au Lancement du 15 septembre 2026 de Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, des modèles de dialogue en direct que Google a positionnés respectivement pour des conversations évolutives et rentables et pour des tâches de raisonnement à haute complexité, et qui ont commencé à être déployés via l’API Gemini, Google AI Studio, l’application Gemini, Google Workspace et Search Live.

Disponibilité générale dans Gemini Enterprise

Gemini 3.8 Live avec Live Avatar est généralement disponible dans Gemini Enterprise à partir du 24 septembre 2026, et Google Cloud a indiqué que la technologie avait été présentée en avant-première lors de Google Cloud Next 2026. La version est proposée via des points de terminaison aux États‑Unis et dans l’UE et comprend un débit provisionné, la conformité d’entreprise et une gouvernance stricte des données, selon le billet Google Cloud de Fabien Blanc‑paques, chef de produit groupe pour Gemini Live. Gemini 3.8 Live Extended Thinking reste en aperçu privé.

Les clients d’entreprise peuvent essayer le modèle dans la console Gemini Enterprise, l’intégrer via la documentation de l’API Gemini Live et consulter les tarifs sur la page de tarification de Google Cloud. Google Cloud conseille aux clients de travailler avec leurs représentants commerciaux pour le débit provisionné, les architectures de déploiement personnalisées et l’autorisation de création d’avatars personnalisés.

Fonctionnement de Live Avatar

Live Avatar traite simultanément les entrées visuelles et audio et répond avec un audio et une vidéo expressifs en quasi temps réel, selon Google. La fonctionnalité prend également en charge les appels d’outils asynchrones, ce qui lui permet de lancer des appels d’outils et de récupérer des données en arrière-plan sans interrompre la conversation. Une démonstration de Google montre l’avatar vérifiant l’état d’un client d’hôtel tandis que le dialogue se poursuit sans interruption.

Google indique que l’avatar ajuste sa synchronisation labiale et ses expressions à mesure que les conversations passent à travers 97 langues, tout en préservant la fidélité vidéo et en évitant la dérive visuelle. Le billet Google Cloud ajoute une compréhension visuelle en direct des flux de caméra et des partages d’écran en complément de l’audio, une récupération d’interruption qui préserve le contexte de la conversation et les transactions en arrière‑plan, une détection automatique de la langue et une transition sans bascule manuelle, ainsi qu’un déploiement sur le web, le mobile et les kiosques interactifs. Une démonstration distincte de Google Cloud montre un agent de saisie de sinistres d’assurance remplissant un carnet de réclamation tandis qu’un client montre les dommages à la caméra, tandis qu’une équipe d’agents construite avec le Agent Development Kit de Google vérifie la police, applique les règles de saisie et assemble le dossier de l’expert en arrière‑plan.

Avatars, filigrane et limites de la fiche modèle

Les organisations peuvent déployer à partir d’une bibliothèque d’avatars prédéfinis ou générer des avatars personnalisés à partir d’une image de référence de haute qualité, et Google indique que le résultat conserve la ressemblance, le style de marque ou l’identité du personnage de la référence. L’accès à la création d’avatars personnalisés nécessite une autorisation en liste blanche d’entreprise ; Google Cloud décrit le processus d’autorisation et de vérification comme une protection de l’identité et contre les abus. Chaque flux audio et vidéo généré est intégré d’un filigrane SynthID imperceptible, garantissant la détection du contenu généré par l’IA.

Selon la fiche technique du modèle Gemini 3.8 Audio, les modèles sont basés sur Gemini 3 Pro. Gemini 3.8 Live accepte l’audio, les images, la vidéo et le texte avec une fenêtre contextuelle pouvant atteindre 128 K jetons, et avec Live Avatar il génère de l’audio, de la vidéo et du texte, soumis à une limite de sortie de 24 K jetons. La fiche technique indique que les variantes Live Avatar produisent des vidéos expressives avec des mouvements de tête naturels synchronisés à la parole, alimentées par des images configurées et des entrées audio, et qu’elles permettent quelques minutes d’interaction continue plutôt que plusieurs heures.

La fiche modèle répertorie les limitations connues, notamment d’éventuelles hallucinations et des lenteurs ou des expirations occasionnelles, et fixe la date limite de connaissances à janvier 2025. Son évaluation de sécurité frontier n’a trouvé aucune capacité nouvelle significative ni aucun gain de performance matériel par rapport à Gemini 3.7 Flash, et sur cette base Google considère que les modèles Gemini 3.8 Audio sont peu susceptibles d’atteindre des niveaux de capacité suivis ou critiques dans le cadre de son Frontier Safety Framework.

Déploiements clients

Google Cloud a cité plusieurs entreprises utilisant la fonctionnalité. Cox Automotive a créé un assistant d’achat alimenté par l’IA pour Autotrader qui utilise la mise en évidence d’écran en direct et les appels d’outils pour guider les acheteurs de voitures à travers la recherche de véhicules, la comparaison et le financement en temps réel.

“Les acheteurs s’attendent de plus en plus à décrire ce dont ils ont besoin avec leurs propres mots plutôt que de passer par des filtres et des menus. Le nouvel avatar IA conversationnel d’Autotrader offre cette expérience lors de la découverte de véhicules en faisant correspondre la conversation naturelle à l’inventaire adéquat,” a déclaré Marianne Johnson, vice‑présidente exécutive et directrice produit de Cox Automotive, lors de l’annonce de Google Cloud.

Le PDG d’Equal AI, Akhilesh Damaraju, a indiqué que l’IA personnelle de l’entreprise gère plus d’un million d’appels en direct chaque jour, dans neuf langues indiennes, et a affirmé que Gemini 3.8 Live améliore la gestion des interruptions, les conversations multilingues et la fiabilité des appels d’outils. Bob Van Osten, vice‑président produit d’Agentforce chez Salesforce, a déclaré qu’Agentforce et Gemini 3.8 Live s’associent dans le cadre d’une collaboration entre Salesforce AI Research et Google qui combine des capacités multimodales en temps réel avec une IA agentique. Eric Walsh, ingénieur logiciel chez Specs, a indiqué que les mises à jour de la détection d’activité vocale du modèle et les améliorations de latence constituaient des avancées pour l’assistant IA sur la plateforme SPECS.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.