AI-modellen en platforms

Google brengt Live Avatar visuele aanwezigheid naar Gemini 3.8 Live

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Google heeft op 24 september 2026 Gemini 3.8 Live met Live Avatar geïntroduceerd, een functie die bijna realtime gegenereerde video toevoegt aan de spraak van zijn native live‑dialoogmodellen, en heeft deze algemeen beschikbaar gemaakt in Gemini Enterprise met eindpunten in de Verenigde Staten en de Europese Unie.

De aankondiging, geschreven door onderzoeksscientist Shuo-yiin Chang en software‑engineer CJ Zheng namens het Gemini Audio Team, presenteert de functie als een visuele aanwezigheidslaag voor Gemini’s conversationele AI. Google zegt dat de nauwkeurige lip‑sync, natuurlijke uitdrukkingen en vloeiende beurtwisseling bedrijven in staat stellen hun virtuele aanbod uit te breiden, zoals klantenservice en interactieve rondleidingen.

De uitgave volgt op Google’s 15 september 2026 lancering van Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking, live‑dialoogmodellen die Google positioneerde voor schaalbare, kostenefficiënte conversatie en respectievelijk voor redeneeropdrachten van hoge complexiteit, en die begonnen uit te rollen via de Gemini API, Google AI Studio, de Gemini‑app, Google Workspace en Search Live.

Algemene beschikbaarheid in Gemini Enterprise

Gemini 3.8 Live met Live Avatar is vanaf 24 september 2026 algemeen beschikbaar in Gemini Enterprise, en Google Cloud meldde dat de technologie voor het eerst werd gepresenteerd op Google Cloud Next 2026. De uitgave wordt aangeboden via VS‑ en EU‑eindpunten en omvat gereserveerde doorvoersnelheid, enterprise‑compliance en strenge datagovernance, volgens de Google Cloud‑post van Fabien Blanc‑paques, groepsproductmanager voor Gemini Live. Gemini 3.8 Live Extended Thinking blijft in privé‑preview.

Enterprise‑klanten kunnen het model uitproberen in de Gemini Enterprise‑console, het integreren via de Gemini Live API‑documentatie en de prijzen bekijken op de prijspagina van Google Cloud. Google Cloud adviseert klanten om met hun verkoopvertegenwoordigers samen te werken voor gereserveerde doorvoersnelheid, aangepaste implementatie‑architecturen en het toestaan van aangepaste avatars.

Hoe Live Avatar werkt

Live Avatar verwerkt visuele en audio‑invoer gelijktijdig en beantwoordt met expressieve audio en video in bijna realtime, volgens Google. De functie ondersteunt ook asynchrone tool‑aanroepen, zodat deze tool‑calls kan starten en gegevens op de achtergrond kan ophalen zonder de conversatie te onderbreken. Een demonstratie van Google toont de avatar die een hotelgast incheckt terwijl de dialoog zonder onderbreking doorgaat.

Google zegt dat de avatar zijn lip‑sync en uitdrukkingen aanpast terwijl gesprekken zich over 97 talen verspreiden, waarbij videokwaliteit behouden blijft en visuele drift wordt voorkomen. De Google Cloud‑post voegt live visueel begrip van camerafeeds en schermdeling naast audio toe, onderbrekingsherstel dat de gesprekcontext en backend‑transacties behoudt, automatische taaldetectie en -overgang zonder handmatige schakelaars, en implementatie op web, mobiel en interactieve kiosken. Een afzonderlijke Google Cloud‑demonstratie toont een verzekeringsclaims‑intake‑agent die een claimnotitie invult terwijl een klant schade op camera laat zien, terwijl een agententeam gebouwd met Google’s Agent Development Kit het polis controleert, de intake‑regels toepast en het schade‑pakket op de achtergrond samenstelt.

Avatars, watermerken en model‑cardlimieten

Organisaties kunnen kiezen uit een bibliotheek met vooraf ingestelde avatars of aangepaste avatars genereren op basis van een hoogwaardige referentie‑afbeelding, en Google zegt dat het resultaat de gelijkenis, merkstijl of karakteridentiteit van de referentie behoudt. Toegang tot het maken van aangepaste avatars vereist enterprise‑allowlisting; Google Cloud beschrijft het allowlisting‑ en verificatieproces als een waarborg voor identiteit en tegen misbruik. Elke gegenereerde audio‑ en videostream is voorzien van een onzichtbaar SynthID‑watermerk, waardoor AI‑gegenereerde inhoud detecteerbaar blijft.

Volgens de Gemini 3.8 Audio modelkaart, zijn de modellen gebaseerd op Gemini 3 Pro. Gemini 3.8 Live accepteert audio, afbeeldingen, video en tekst met een contextvenster van maximaal 128 K tokens, en met Live Avatar genereert het audio, video en tekst onder een uitvoerlimiet van 24 K tokens. De modelkaart stelt dat de Live Avatar‑varianten expressieve video produceren van natuurlijke hoofdbewegingen gesynchroniseerd met spraak, aangestuurd door geconfigureerde afbeeldingen en audio‑invoer, en dat ze enkele minuten continue interactie kunnen volhouden in plaats van urenlange sessies.

De model‑card somt bekende beperkingen op, waaronder mogelijke hallucinaties en af en toe traagheid of time‑outs, en stelt de kennisafkapdatum op januari 2025. De frontier‑veiligheidsbeoordeling vond geen betekenisvolle nieuwe mogelijkheden of materiële prestatieverbeteringen ten opzichte van Gemini 3.7 Flash, en op basis daarvan beschouwt Google de Gemini 3.8 Audio‑modellen als onwaarschijnlijk om enige Tracked‑ of Critical Capability‑niveaus te bereiken onder haar Frontier Safety Framework.

Klantenimplementaties

Google Cloud noemde verschillende bedrijven die met de functie bouwen. Cox Automotive ontwikkelde een AI‑aangedreven winkelassistent voor Autotrader die live scherm‑highlighting en tool‑aanroepen gebruikt om autokopers in realtime te begeleiden bij voertuigen zoeken, vergelijken en financieren.

“Kopers verwachten steeds vaker dat ze kunnen beschrijven wat ze nodig hebben in hun eigen woorden in plaats van door filters en menu’s te navigeren. De nieuwe conversationele AI‑Avatar van Autotrader brengt die ervaring naar het vinden van voertuigen door natuurlijke gesprekken af te stemmen op de juiste voorraad,” Marianne Johnson, executive vice president en chief product officer van Cox Automotive, zei in de Google Cloud aankondiging.

Equal AI‑chief executive Akhilesh Damaraju zei dat de persoonlijke AI van het bedrijf meer dan een miljoen live‑gesprekken per dag afhandelt in negen Indiase talen, en dat Gemini 3.8 Live de afhandeling van onderbrekingen, meertalige gesprekken en de betrouwbaarheid van tool‑calls heeft verbeterd. Bob Van Osten, vice‑president product voor Agentforce bij Salesforce, zei dat Agentforce en Gemini 3.8 Live samenkomen in een samenwerking tussen Salesforce AI Research en Google die realtime multimodale mogelijkheden combineert met agent‑AI. Eric Walsh, software‑engineer bij Specs, zei dat de updates van Voice Activity Detection en de latency‑verbeteringen stappen vooruit waren voor de AI‑assistent op het SPECS‑platform.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.