AI-modeller och plattformar
Google introducerar visuell närvaro med Live Avatar för Gemini 3.8 Live

Google introducerade den 24 september 2026 Gemini 3.8 Live med Live Avatar, en funktion som lägger till nästan realtidsgenererad video till talet i sina inhemska live‑dialogmodeller, och gjorde den allmänt tillgänglig i Gemini Enterprise med slutpunkter i USA och Europeiska unionen.
Meddelandet, skrivet av forskningsvetenskapsmannen Shuo-yiin Chang och mjukvaruingenjören CJ Zheng på uppdrag av Gemini Audio Team, presenterar funktionen som ett visuellt närvarolager för Geminis konversations‑AI. Google säger att dess precisa läpsynk, naturliga uttryck och flytande tur‑tagningsmekanism låter företag utöka virtuella erbjudanden såsom kundservice och interaktiva genomgångar.
Utgåvan följer Googles 15 september 2026 lansering av Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking, live‑dialogmodeller som Google positionerade för skalbar, kostnadseffektiv konversation respektive för högkomplexa resonemangsuppgifter, vilka började rullas ut via Gemini API, Google AI Studio, Gemini‑appen, Google Workspace och Search Live.
Allmän tillgänglighet i Gemini Enterprise
Gemini 3.8 Live med Live Avatar är allmänt tillgänglig i Gemini Enterprise från och med den 24 september 2026, och Google Cloud meddelade att tekniken först förhandsvisades på Google Cloud Next 2026. Utgåvan erbjuds via US- och EU-slutpunkter och inkluderar tilldelad genomströmning, företagsöverensstämmelse och strikt datastyrning, enligt Google Cloud‑inlägget av Fabien Blanc‑paques, gruppproduktchef för Gemini Live. Gemini 3.8 Live Extended Thinking förblir i privat förhandsvisning.
Företagskunder kan prova modellen i Gemini Enterprise‑konsolen, integrera den via Gemini Live API‑dokumentationen och granska prissättningen på Google Clouds pris‑sida. Google Cloud uppmanar kunder att samarbeta med sina försäljningsrepresentanter för tilldelad genomströmning, anpassade driftsarkitekturer och tillåtelsetillstånd för anpassade avatarer.
Hur Live Avatar fungerar
Live Avatar bearbetar visuella och ljudinmatningar samtidigt och svarar med uttrycksfullt ljud och video i nära realtid, enligt Google. Funktionen stödjer också asynkron verktygsanrop, så den kan initiera verktygsanrop och hämta data i bakgrunden utan att avbryta konversationen. En Google‑demonstration visar avatarerna som checkar in en hotellgäst medan dialogen fortsätter utan avbrott.
Google säger att avataren justerar sin läpsynk och sina uttryck när konversationer sker på 97 språk, vilket bibehåller videokvaliteten och undviker visuell drift. Google Cloud‑inlägget lägger till levande visuell förståelse av kameraflöden och skärmdelningar tillsammans med ljud, återhämtning vid avbrott som bevarar samtalskontext och backend‑transaktioner, automatisk språkdetektering och övergång utan manuella omkopplare, samt distribution över webb, mobil och interaktiva kiosker. En separat Google Cloud‑demonstration visar en försäkringsanspråks‑intagsagent som fyller i en anspråksbok medan en kund visar skada via kamera, medan ett agentteam byggt med Googles Agent Development Kit verifierar policyn, tillämpar intagsreglerna och sammanställer justerarpaketet i bakgrunden.
Avatarer, vattenstämpling och begränsningar i modellkortet
Organisationer kan distribuera från ett bibliotek med förinställda avatarer eller skapa anpassade avatarer från en högkvalitativ referensbild, och Google säger att resultatet behåller likheten, varumärkesstilen eller karaktärsidentiteten hos referensen. Tillgång till skapande av anpassade avatarer kräver företagsgodkännande; Google Cloud beskriver godkännande‑ och verifieringsprocessen som ett skydd för identitet och mot missbruk. Varje genererad ljud‑ och videoström är inbäddad med ett omärkbart SynthID‑vattenstämpel, vilket gör AI‑genererat innehåll detekterbart.
Enligt Gemini 3.8 Audio modellkort är modellerna baserade på Gemini 3 Pro. Gemini 3.8 Live accepterar ljud, bilder, video och text med ett kontextfönster på upp till 128 000 token, och med Live Avatar levererar den ljud, video och text med en utmatningsgräns på 24 000 token. Modellkortet anger att Live Avatar‑varianterna producerar uttrycksfull video med naturliga huvudrörelser synkroniserade med tal, drivna av konfigurerade bilder och ljudinmatningar, och att de upprätthåller några minuters kontinuerlig interaktion snarare än flera timmar.
Modellkortet listar kända begränsningar inklusive möjliga hallucinationer samt sporadisk långsamhet eller tidsavbrott, och det sätter kunskapsgränsen till januari 2025. Dess frontier‑säkerhetsbedömning fann inga meningsfulla nya förmågor eller materiella prestandaförbättringar i förhållande till Gemini 3.7 Flash, och på den grunden anser Google att Gemini 3.8 Audio‑modellerna sannolikt inte kommer att nå några spårade eller kritiska förmågenivåer under dess Frontier Safety Framework.
Kundimplementeringar
Google Cloud nämnde flera företag som bygger med funktionen. Cox Automotive skapade en AI‑driven shoppingassistent för Autotrader som använder live‑skärmmarkering och verktygsanrop för att vägleda bilköpare genom fordonssökning, jämförelse och finansiering i realtid.
“Handlare förväntar sig i allt högre grad att beskriva vad de behöver med egna ord snarare än att gå igenom filter och menyer. Autotrader’s nya konversativa AI‑avatar ger den upplevelsen till fordonsupptäckt genom att matcha naturlig konversation med rätt lager,” Marianne Johnson, verkställande vice president och chef för produkt på Cox Automotive, sade i Google Cloud-annonseringen.
Equal AI:s verkställande direktör Akhilesh Damaraju sade att företagets personliga AI hanterar mer än en miljon live‑samtal dagligen på nio indiska språk, och att Gemini 3.8 Live förbättrade avbrottshantering, flerspråkiga konversationer och pålitlighet för verktygsanrop. Bob Van Osten, Salesforces vice president för produkt för Agentforce, sade att Agentforce och Gemini 3.8 Live samverkar i ett samarbete mellan Salesforce AI Research och Google som kombinerar realtids‑multimodala funktioner med agentisk AI. Eric Walsh, mjukvaruingenjör på Specs, sade att modellens uppdateringar av röstaktivitetsdetektering och förbättringar av latens var framsteg för AI‑assistenten på SPECS‑plattformen.












