AI-modeller og platforme

Google introducerer Live Avatar‑visuel tilstedeværelse i Gemini 3.8 Live

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google introducerede den 24. september 2026 Gemini 3.8 Live med Live Avatar, en funktion der tilføjer næsten realtidsgenereret video til talen i sine oprindelige live‑dialogmodeller, og gjorde den generelt tilgængelig i Gemini Enterprise med slutpunkter i USA og EU.

Meddelelsen, skrevet af forskningsforsker Shuo-yiin Chang og softwareingeniør CJ Zheng på vegne af Gemini Audio Team, præsenterer funktionen som et visuelt tilstedeværelseslag for Geminis konverserende AI. Google siger, at dens præcise læbesynkronisering, naturlige udtryk og flydende tur‑afgivelse gør det muligt for virksomheder at udvide virtuelle tilbud såsom kundeservice og interaktive gennemgange.

Udgivelsen følger Googles 15. september 2026 lancering af Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, live‑dialogmodeller som Google positionerede til skalerbar, omkostningseffektiv samtale og til høj‑kompleksitet resonneringsopgaver henholdsvis, som begyndte at blive rullet ud via Gemini API, Google AI Studio, Gemini‑appen, Google Workspace og Search Live.

Generel tilgængelighed i Gemini Enterprise

Gemini 3.8 Live med Live Avatar er generelt tilgængelig i Gemini Enterprise pr. 24. september 2026, og Google Cloud oplyste, at teknologien først blev vist på Google Cloud Next 2026. Udgivelsen tilbydes gennem US‑ og EU‑slutpunkter og omfatter tildelt gennemløb, virksomheds‑overholdelse og streng datastyring, ifølge Google Cloud‑indlægget af Fabien Blanc‑paques, gruppeproduktchef for Gemini Live. Gemini 3.8 Live Extended Thinking forbliver i privat forhåndsvisning.

Enterprise‑kunder kan afprøve modellen i Gemini Enterprise‑konsollen, integrere den via Gemini Live API‑dokumentationen og gennemgå priser på Google Clouds prisoversigt. Google Cloud opfordrer kunderne til at samarbejde med sine salgsrepræsentanter om tildelt gennemløb, tilpassede deployments‑arkitekturer og tilladelsesliste for brugerdefinerede avatarer.

Hvordan Live Avatar fungerer

Live Avatar behandler visuelle og lydinput samtidigt og svarer med udtryksfuld lyd og video i næsten realtid, ifølge Google. Funktionen understøtter også asynkron værktøjskald, så den kan starte værktøjskald og hente data i baggrunden uden at afbryde samtalen. En Google‑demonstration viser avatar‑en, der tjekker ind på en hotelgæst, mens dialogen fortsætter uden afbrydelse.

Google siger, at avatar‑en justerer sin læbesynkronisering og sine udtryk, når samtaler foregår på 97 sprog, og bevarer videokvaliteten uden visuel drift. Google Cloud‑indlægget tilføjer live‑visuel forståelse af kamera‑feeds og skærmdeling sammen med lyd, genoprettelse efter afbrydelse som bevarer samtalekontekst og backend‑transaktioner, automatisk sproggenkendelse og -overgang uden manuelle skift, samt implementering på web, mobil og interaktive kiosker. En separat Google Cloud‑demonstration viser en forsikringskrav‑indtagelsesagent, der udfylder en krav‑notesbog, mens en kunde viser skader på kameraet, mens et agentteam bygget med Googles Agent Development Kit bekræfter policen, anvender indtagelsesreglerne og samler justeringspakken i baggrunden.

Avatarer, vandmærkning og begrænsninger i modelkort

Organisationer kan implementere fra et bibliotek af forudindstillede avatarer eller generere brugerdefinerede avatarer ud fra et højkvalitets referencebillede, og Google siger, at resultatet bevarer ligheden, brand‑stylingen eller karakteridentiteten fra referencen. Adgang til oprettelse af brugerdefinerede avatarer kræver en virksomheds‑tilladelsesliste; Google Cloud beskriver tilladelses‑ og verifikationsprocessen som en sikkerhedsforanstaltning for identitet og mod misbrug. Hver genereret lyd‑ og videostrøm er indlejret med et umærkbart SynthID‑vandmærke, så AI‑genereret indhold kan opdages.

Ifølge Gemini 3.8 Audio modelkort er modellerne baseret på Gemini 3 Pro. Gemini 3.8 Live accepterer lyd, billeder, video og tekst med et kontekstvindue på op til 128 000 tokens, og med Live Avatar udgiver den lyd, video og tekst med en udgangsgrænse på 24 000 tokens. Modelkortet angiver, at Live Avatar‑varianterne producerer udtryksfuld video med naturlige hovedbevægelser synkroniseret til tale, drevet af konfigurerede billeder og lydinput, og at de kan opretholde nogle minutters kontinuerlig interaktion i stedet for flere timer.

Modelkortet opremser kendte begrænsninger, herunder mulige hallucinationer og lejlighedsvis langsomhed eller tidsudløb, og fastsætter vidensgrænsen til januar 2025. Dets frontier‑sikkerhedsvurdering fandt ingen væsentlige nye funktioner eller betydelige præstationsforbedringer i forhold til Gemini 3.7 Flash, og på dette grundlag anser Google Gemini 3.8 Audio‑modellerne for usandsynlige at nå nogen Spor‑ eller Kritisk‑kapacitetsniveauer under dets Frontier Safety Framework.

Kundeimplementeringer

Google Cloud nævnte flere virksomheder, der bygger med funktionen. Cox Automotive udviklede en AI‑drevet shoppingassistent til Autotrader, som bruger live skærmmarkering og værktøjskald til at guide bilkøbere gennem køretøjsøgning, sammenligning og finansiering i realtid.

“Købere forventer i stigende grad, at de kan beskrive, hvad de har brug for, med deres egne ord i stedet for at arbejde gennem filtre og menuer. Autotraders nye konverserende AI‑Avatar bringer den oplevelse til bilopdagelse ved at matche naturlig samtale med det rette lager,” Marianne Johnson, executive vice president og chief product officer hos Cox Automotive, sagde i Google Cloud-meddelelse.

Equal AI’s administrerende direktør Akhilesh Damaraju sagde, at virksomhedens personlige AI håndterer mere end en million live‑opkald dagligt på tværs af ni indiske sprog, og at Gemini 3.8 Live har forbedret håndtering af afbrydelser, flersprogede samtaler og pålidelighed ved værktøjs‑kald. Bob Van Osten, Salesforces vice president for produkt for Agentforce, sagde, at Agentforce og Gemini 3.8 Live kommer sammen i et samarbejde mellem Salesforce AI Research og Google, som kombinerer real‑time multimodale funktioner med agentisk AI. Eric Walsh, softwareingeniør hos Specs, sagde, at modellens opdateringer af Voice Activity Detection og forbedringer af latenstid var skridt fremad for AI‑assistenten på SPECS‑platformen.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.