AI-modeller og plattformer

Google introduserer Live Avatar‑visuell tilstedeværelse i Gemini 3.8 Live

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Google introduserte den 24. september 2026 Gemini 3.8 Live med Live Avatar, en funksjon som legger til nesten sanntidsgenerert video til talen i sine innebygde live‑dialogmodeller, og gjorde den generelt tilgjengelig i Gemini Enterprise med endepunkter i USA og EU.

Kunngjøringen, skrevet av forskningsforsker Shuo-yiin Chang og programvareingeniør CJ Zheng på vegne av Gemini Audio Team, presenterer funksjonen som et visuelt tilstedeværelseslag for Geminis samtale‑AI. Google sier at den presise leppesynkroniseringen, naturlige uttrykkene og flytende taletaking gjør det mulig for bedrifter å utvide virtuelle tilbud som kundeservice og interaktive gjennomganger.

Utgivelsen følger Googles 15. september 2026 lansering av Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, live‑dialogmodeller som Google posisjonerte for skalerbar, kostnadseffektiv samtale og for oppgaver med høy kompleksitet i resonnering, henholdsvis, som begynte å rulles ut via Gemini API, Google AI Studio, Gemini‑appen, Google Workspace og Search Live.

Generell tilgjengelighet i Gemini Enterprise

Gemini 3.8 Live med Live Avatar er generelt tilgjengelig i Gemini Enterprise fra 24. september 2026, og Google Cloud opplyser at teknologien først ble forhåndsvist på Google Cloud Next 2026. Utgivelsen tilbys via USA‑ og EU‑endepunkter og inkluderer tildelt gjennomstrømning, bedrifts‑overholdelse og streng datastyring, ifølge Google Cloud‑innlegget av Fabien Blanc‑paques, gruppens produktleder for Gemini Live. Gemini 3.8 Live Extended Thinking forblir i privat forhåndsvisning.

Bedriftskunder kan prøve modellen i Gemini Enterprise‑konsollen, integrere den via Gemini Live API‑dokumentasjonen, og se på prisene på Google Clouds prisoversiktsside. Google Cloud ber kundene samarbeide med sine salgsrepresentanter for tildelt gjennomstrømning, tilpassede distribusjonsarkitekturer og godkjenning av egendefinerte avatarer.

Hvordan Live Avatar fungerer

Live Avatar behandler visuelle og lydinnspill samtidig og svarer med uttrykksfullt lyd og video i nesten sanntid, ifølge Google. Funksjonen støtter også asynkrone verktøykall, slik at den kan starte verktøykall og hente data i bakgrunnen uten å pause samtalen. En Google‑demonstrasjon viser avatar‑en som sjekker inn en hotellgjest mens dialogen fortsetter uten avbrudd.

Google sier at avatar‑en justerer leppesynkronisering og uttrykk når samtaler går over 97 språk, og opprettholder videokvalitet uten visuell avdrift. Google Cloud‑innlegget legger til live‑visuell forståelse av kamerafeeder og skjermdeling sammen med lyd, gjenoppretting etter avbrudd som bevarer samtalekontekst og backend‑transaksjoner, automatisk språkgjenkjenning og overgang uten manuelle brytere, samt distribusjon på nett, mobil og interaktive kiosker. En separat Google Cloud‑demonstrasjon viser en forsikringskrav‑innsamlingsagent som fyller ut en kravnotatbok mens en kunde viser skade på kamera, mens et agentteam bygget med Googles Agent Development Kit verifiserer polisen, anvender innsamlingsreglene og samler justeringspakke i bakgrunnen.

Avatarer, vannmerking og begrensninger i modellkortet

Organisasjoner kan distribuere fra et bibliotek med forhåndsinnstilte avatarer eller generere egendefinerte avatarer fra et høykvalitets referansebilde, og Google sier at resultatet beholder likheten, merkevarestilen eller karakteridentiteten til referansen. Tilgang til opprettelse av egendefinerte avatarer krever bedrifts‑godkjenning; Google Cloud beskriver godkjennings‑ og verifiseringsprosessen som et sikkerhetstiltak for identitet og mot misbruk. Hver generert lyd‑ og videostrøm er innebygd med et umerkelig SynthID‑vannmerke, som gjør AI‑generert innhold oppdagbart.

Ifølge Gemini 3.8 Audio-modellkort er modellene basert på Gemini 3 Pro. Gemini 3.8 Live godtar lyd, bilder, video og tekst med et kontekstvindu på opptil 128K token, og med Live Avatar leverer den lyd, video og tekst med en utdata‑grense på 24K token. Modellkortet sier at Live Avatar‑variantene produserer uttrykksfull video med naturlige hodebevegelser synkronisert med tale, drevet av konfigurerte bilder og lydinnspill, og at de opprettholder noen minutter med kontinuerlig interaksjon i stedet for flere timer.

Modellkortet lister kjente begrensninger, inkludert mulige hallusinasjoner og sporadisk treghet eller tidsavbrudd, og fastsetter kunnskapsavgrensningen til januar 2025. Frontiersikkerhetsvurderingen fant ingen betydelige nye evner eller materielle ytelsesgevinster i forhold til Gemini 3.7 Flash, og på dette grunnlaget anser Google Gemini 3.8 Audio‑modellene som usannsynlige til å nå noen Spor‑ eller Kritiske Kapasitetsnivåer under sitt Frontier Safety‑rammeverk.

Kunde‑implementeringer

Google Cloud nevnte flere bedrifter som bygger med funksjonen. Cox Automotive utviklet en AI‑drevet handleassistent for Autotrader som bruker live skjerm‑utheving og verktøykall for å veilede bilkjøpere gjennom kjøretøysøk, sammenligning og finansiering i sanntid.

“Kunder forventer i økende grad å beskrive hva de trenger med egne ord i stedet for å gå gjennom filtre og menyer. Autotrader sin nye samtale‑AI‑avatar bringer den opplevelsen til kjøretøysøk ved å matche naturlig samtale med riktig lager,” sier Marianne Johnson, executive vice president og chief product officer i Cox Automotive, i Google Cloud kunngjøring.

Equal AI‑administrerende direktør Akhilesh Damaraju sa at selskapets personlige AI håndterer mer enn en million live‑samtaler daglig på ni indiske språk, og at Gemini 3.8 Live forbedret håndtering av avbrudd, flerspråklige samtaler og pålitelighet ved verktøy‑kall. Bob Van Osten, Salesforces visepresident for produkt i Agentforce, sa at Agentforce og Gemini 3.8 Live kommer sammen i et samarbeid mellom Salesforce AI Research og Google som kombinerer sanntids‑multimodale evner med agentisk AI. Eric Walsh, programvareingeniør hos Specs, sa at modellens oppdateringer av stemmeaktivitetssporing og forbedringer i latens var fremskritt for AI‑assistenten på SPECS‑plattformen.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.