Modele i platformy AI

Google wprowadza wizualną obecność Live Avatar w Gemini 3.8 Live

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Google 24 września 2026 r. wprowadziło Gemini 3.8 Live with Live Avatar, funkcję, która dodaje generowane w prawie rzeczywistym czasie wideo do mowy swoich natywnych modeli dialogu na żywo, i udostępniło ją ogólnie w Gemini Enterprise z punktami końcowymi w Stanach Zjednoczonych i Unii Europejskiej.

Ogłoszenie, napisane przez naukowca badawczego Shuo-yiin Chang i inżyniera oprogramowania CJ Zheng w imieniu zespołu Gemini Audio, przedstawia tę funkcję jako warstwę wizualnej obecności dla konwersacyjnej sztucznej inteligencji Gemini. Google twierdzi, że jej precyzyjne synchronizowanie ust, naturalne wyrazy twarzy i płynne przechodzenie między wypowiedziami pozwalają przedsiębiorstwom rozszerzyć wirtualne usługi, takie jak obsługa klienta i interaktywne prezentacje.

Wydanie następuje po premierze Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking z 15 września 2026 r. firmy Google, modelach dialogu na żywo, które Google przeznaczyło odpowiednio do skalowalnych, kosztowo efektywnych konwersacji oraz zadań wymagających wysokiej złożoności rozumowania, a które zaczęto udostępniać poprzez Gemini API, Google AI Studio, aplikację Gemini, Google Workspace i Search Live.

Ogólna dostępność w Gemini Enterprise

Gemini 3.8 Live with Live Avatar jest ogólnie dostępne w Gemini Enterprise od 24 września 2026 r., a Google Cloud poinformowało, że technologia została po raz pierwszy zaprezentowana na Google Cloud Next 2026. Wydanie jest oferowane przez punkty końcowe w USA i UE i obejmuje przydzieloną przepustowość, zgodność przedsiębiorstwa oraz rygorystyczne zarządzanie danymi, według posta Google Cloud autorstwa Fabiena Blanc‑paques, grupowego menedżera produktu dla Gemini Live. Gemini 3.8 Live Extended Thinking pozostaje w prywatnym podglądzie.

Klienci korporacyjni mogą wypróbować model w konsoli Gemini Enterprise, zintegrować go za pomocą dokumentacji Gemini Live API oraz zapoznać się z cennikiem na stronie cenowej Google Cloud. Google Cloud zaleca klientom współpracę z przedstawicielami handlowymi w celu uzyskania przydzielonej przepustowości, dostosowanych architektur wdrożeniowych oraz listy dopuszczonych niestandardowych avatarów.

Jak działa Live Avatar

Live Avatar przetwarza jednocześnie dane wizualne i dźwiękowe oraz odpowiada ekspresyjnym dźwiękiem i wideo w prawie rzeczywistym czasie, według Google. Funkcja obsługuje także asynchroniczne wywoływanie narzędzi, dzięki czemu może rozpoczynać wywołania narzędzi i pobierać dane w tle bez przerywania rozmowy. Jedna demonstracja Google pokazuje, jak avatar sprawdza gościa hotelowego, podczas gdy dialog trwa bez przerwy.

Google twierdzi, że avatar dostosowuje synchronizację ust i wyrazy twarzy w miarę, jak rozmowy przechodzą przez 97 języków, zachowując jakość wideo i unikając dryfu wizualnego. Post na Google Cloud dodaje możliwość bieżącego rozumienia obrazu z kamer i udostępniania ekranu wraz z dźwiękiem, odzyskiwania po przerwie, które zachowuje kontekst rozmowy i transakcje w tle, automatycznego wykrywania języka i przełączania bez ręcznych przełączników oraz wdrożenia na platformach internetowych, mobilnych i interaktywnych kioskach. Oddzielna demonstracja Google Cloud pokazuje agenta przyjmującego roszczenia ubezpieczeniowe, który wypełnia notatnik roszczenia, gdy klient pokazuje uszkodzenie przed kamerą, podczas gdy zespół agentów zbudowany przy użyciu Agent Development Kit firmy Google weryfikuje polisę, stosuje zasady przyjmowania i przygotowuje pakiet likwidatora w tle.

Avatary, znakowanie wodne i ograniczenia karty modelu

Organizacje mogą wdrażać avatarów z biblioteki gotowych avatarów lub generować niestandardowe avatary na podstawie wysokiej jakości obrazu referencyjnego, a Google twierdzi, że rezultat zachowuje podobieństwo, styl marki lub tożsamość postaci referencji. Dostęp do tworzenia niestandardowych avatarów wymaga listy dopuszczonych przedsiębiorstw; Google Cloud opisuje proces listowania i weryfikacji jako zabezpieczenie tożsamości i ochronę przed nadużyciami. Każdy wygenerowany strumień audio i wideo jest osadzony z niewyczuwalnym znakiem wodnym SynthID, co umożliwia wykrycie treści generowanej przez AI.

Zgodnie z kartą modelu Gemini 3.8 Audio, modele opierają się na Gemini 3 Pro. Gemini 3.8 Live przyjmuje dźwięk, obrazy, wideo i tekst w oknie kontekstowym do 128K tokenów, a przy użyciu Live Avatar generuje dźwięk, wideo i tekst, podlegające limitowi wyjścia 24K-token. Karta modelu stwierdza, że warianty Live Avatar tworzą ekspresyjne wideo z naturalnymi ruchami głowy zsynchronizowanymi z mową, sterowane skonfigurowanymi obrazami i dźwiękiem, oraz że utrzymują kilka minut ciągłej interakcji, a nie godziny.

Karta modelu wymienia znane ograniczenia, w tym możliwe halucynacje oraz sporadyczne spowolnienia lub przekroczenia limitu czasu, i ustala granicę wiedzy na styczeń 2025 roku. Ocena bezpieczeństwa na granicy nie wykazała istotnych nowych możliwości ani znaczących przyrostów wydajności w porównaniu do Gemini 3.7 Flash, i na tej podstawie Google uważa, że modele Gemini 3.8 Audio prawdopodobnie nie osiągną żadnych poziomów Śledzonych lub Krytycznych Zdolności w ramach jego Ram Bezpieczeństwa Frontier.

Wdrożenia u klientów

Google Cloud wymieniło kilka przedsiębiorstw korzystających z tej funkcji. Cox Automotive stworzyło asystenta zakupowego napędzanego AI dla Autotrader, który wykorzystuje podświetlanie ekranu w czasie rzeczywistym i wywoływanie narzędzi, aby prowadzić kupujących samochody przez wyszukiwanie pojazdów, porównania i finansowanie w czasie rzeczywistym.

“„Klienci coraz częściej oczekują, że będą mogli opisywać, czego potrzebują własnymi słowami, zamiast przeszukiwać filtry i menu. Nowy konwersacyjny awatar AI Autotrader wprowadza to doświadczenie do odkrywania pojazdów, dopasowując naturalną rozmowę do odpowiedniego asortymentu,” powiedziała Marianne Johnson, wiceprezes wykonawcza i dyrektor produktu w Cox Automotive, w ogłoszeniu Google Cloud.”

“Dyrektor generalny Equal AI, Akhilesh Damaraju, powiedział, że osobista sztuczna inteligencja firmy obsługuje ponad milion połączeń na żywo dziennie w dziewięciu językach indyjskich, oraz dodał, że Gemini 3.8 Live poprawił obsługę przerw, wielojęzyczne rozmowy i niezawodność wywołań narzędzi. Bob Van Osten, wiceprezes ds. produktu w Salesforce odpowiedzialny za Agentforce, stwierdził, że Agentforce i Gemini 3.8 Live łączą się w ramach współpracy między Salesforce AI Research a Google, łącząc możliwości multimodalne w czasie rzeczywistym z AI o charakterze agentowym. Eric Walsh, inżynier oprogramowania w Specs, zauważył, że aktualizacje wykrywania aktywności głosowej (Voice Activity Detection) oraz usprawnienia opóźnień modelu stanowią krok naprzód dla asystenta AI na platformie SPECS.”

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.