Modely a platformy AI
Google přináší vizuální přítomnost Live Avatar do Gemini 3.8 Live

Google 24. září 2026 představil Gemini 3.8 Live s Live Avatar, funkci, která přidává téměř v reálném čase generované video k řeči svých nativních modelů živého dialogu, a zpřístupnil ji obecně v Gemini Enterprise s koncovými body ve Spojených státech a Evropské unii.
Oznámení, napsané výzkumným vědcem Shuo-yiin Changem a softwarovým inženýrem CJ Zhengem jménem týmu Gemini Audio, představuje funkci jako vrstvu vizuální přítomnosti pro konverzační AI Gemini. Google uvádí, že její přesné synchronizování rtů, přirozené výrazy a plynulé střídání řeči umožňují podnikům rozšířit virtuální nabídky, například zákaznický servis a interaktivní prohlídky.
Vydání navazuje na 15. září 2026 spuštění Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking, modely živého dialogu, které Google umístil pro škálovatelnou, nákladově efektivní konverzaci a pro úlohy vyžadující vysokou složitost úvah, a které se začaly rozšiřovat prostřednictvím Gemini API, Google AI Studio, aplikace Gemini, Google Workspace a Search Live.
Obecná dostupnost v Gemini Enterprise
Gemini 3.8 Live s Live Avatar je obecně dostupné v Gemini Enterprise od 24. září 2026 a Google Cloud uvedl, že technologie byla poprvé představena na Google Cloud Next 2026. Vydání je nabízeno prostřednictvím koncových bodů v USA a EU a zahrnuje přidělenou propustnost, podnikové soulady a přísnou správu dat, podle příspěvku Google Cloud od Fabiena Blanc-paques, skupinového produktového manažera pro Gemini Live. Gemini 3.8 Live Extended Thinking zůstává v soukromém náhledu.
Podnikatelé mohou model vyzkoušet v konzoli Gemini Enterprise, integrovat jej prostřednictvím dokumentace Gemini Live API a prohlédnout si ceny na stránce s cenami Google Cloud. Google Cloud radí zákazníkům spolupracovat s jejich obchodními zástupci na přidělené propustnosti, přizpůsobených architekturách nasazení a povolení vlastních avatarů.
Jak Live Avatar funguje
Live Avatar zpracovává vizuální a zvukové vstupy současně a odpovídá expresivním zvukem a videem téměř v reálném čase, podle Googlu. Funkce také podporuje asynchronní volání nástrojů, takže může spouštět volání nástrojů a načítat data na pozadí bez pozastavení konverzace. Jedna demonstrace od Googlu ukazuje, jak avatar kontroluje hotelového hosta, zatímco dialog pokračuje bez přerušení.
Google uvádí, že avatar upravuje synchronizaci rtů a výrazy, jak se konverzace přesouvají mezi 97 jazyky, a zachovává kvalitu videa a vyhýbá se vizuálnímu posunu. Příspěvek Google Cloud doplňuje živé vizuální porozumění kamerovým tokům a sdíleným obrazovkám vedle zvuku, obnovu po přerušení, která zachovává kontext konverzace a transakce na pozadí, automatické rozpoznání jazyka a přechod bez ručních přepínačů a nasazení na web, mobil a interaktivní kiosky. Samostatná demonstrace Google Cloud ukazuje agenta pro zpracování pojistných událostí, který vyplňuje poznámkový blok nároku, zatímco zákazník ukazuje poškození kamerou, a tým agentů postavený pomocí Agent Development Kit od Googlu ověřuje pojistku, aplikuje pravidla příjmu a sestavuje balíček pojistného likvidátora na pozadí.
Avataři, vodoznakování a omezení modelové karty
Organizace mohou nasadit z knihovny přednastavených avatarů nebo vytvořit vlastní avatary z vysoce kvalitního referenčního obrázku a Google uvádí, že výsledek zachovává podobu, styl značky nebo identitu postavy reference. Přístup k tvorbě vlastních avatarů vyžaduje podnikové povolení; Google Cloud popisuje proces povolení a ověření jako ochranu identity a před zneužitím. Každý generovaný audio a video stream je vložen s nepostřehnutelným vodoznakem SynthID, který umožňuje detekci obsahu vytvořeného AI.
Podle Gemini 3.8 Audio karta modelu jsou modely založeny na Gemini 3 Pro. Gemini 3.8 Live přijímá audio, obrázky, video a text s kontextovým oknem až 128K tokenů a s Live Avatarem výstupuje audio, video a text s omezením výstupu na 24K-token. Modelová karta uvádí, že varianty Live Avatar produkují expresivní video s přirozenými pohyby hlavy synchronizovanými s řečí, řízené konfigurovanými obrázky a audio vstupy, a že umožňují několik minut nepřetržité interakce spíše než hodiny.
Modelová karta uvádí známá omezení, včetně možných halucinací a občasné pomalosti nebo časových limitů, a stanovuje hranici znalostí na leden 2025. Její hodnocení bezpečnosti na hranici nezjistilo žádné významné nové schopnosti ani podstatné zlepšení výkonu ve srovnání s Gemini 3.7 Flash, a na této bázi Google považuje modely Gemini 3.8 Audio za nepravděpodobné, že dosáhnou jakýchkoli sledovaných nebo kritických úrovní schopností v rámci svého Frontier Safety Framework.
Nasazení u zákazníků
Google Cloud uvedl několik podniků, které s touto funkcí pracují. Cox Automotive vytvořil AI-poháněného nákupního asistenta pro Autotrader, který používá živé zvýrazňování obrazovky a volání nástrojů k vedení zákazníků automobilů při vyhledávání vozidel, porovnávání a financování v reálném čase.
“Zákazníci stále častěji očekávají, že budou moci popsat, co potřebují, vlastními slovy, místo aby procházeli filtry a nabídky. Nový konverzační AI Avatar společnosti Autotrader přináší tento zážitek do vyhledávání vozidel tím, že přirozenou konverzaci přiřadí k správnému inventáři,” Marianne Johnson, výkonná viceprezidentka a hlavní produktová ředitelka společnosti Cox Automotive, řekla v oznámení Google Cloud
Výkonný ředitel společnosti Equal AI Akhilesh Damaraju uvedl, že osobní AI společnosti zpracovává více než milion živých hovorů denně v devíti indických jazycích, a řekl, že Gemini 3.8 Live zlepšil zvládání přerušení, vícejazyčné konverzace a spolehlivost volání nástrojů. Bob Van Osten, viceprezident produktů společnosti Salesforce pro Agentforce, uvedl, že Agentforce a Gemini 3.8 Live se spojují v rámci spolupráce mezi Salesforce AI Research a Google, která kombinuje multimodální schopnosti v reálném čase s agentní AI. Eric Walsh, softwarový inženýr ve společnosti Specs, řekl, že aktualizace detekce hlasové aktivity modelu a zlepšení latence představují krok vpřed pro AI asistenta na platformě SPECS.












