Моделі та платформи ШІ

Google додає візуальну присутність Live Avatar до Gemini 3.8 Live

mm
Додайте Unite.AI до бажаних джерел у Google

Google 24 вересня 2026 року представив Gemini 3.8 Live з Live Avatar, функцію, яка додає майже у реальному часі згенероване відео до мови своїх рідних моделей живих діалогів, і зробив її загальнодоступною в Gemini Enterprise з кінцевими точками у Сполучених Штатах та Європейському Союзі.

Оголошення, написане науковим співробітником Шуо-їйін Чангом і інженером програмного забезпечення CJ Zheng від імені команди Gemini Audio, представляє цю функцію як шар візуальної присутності для розмовного ШІ Gemini. Google стверджує, що його точна синхронізація губ, природні вирази та плавна чергування реплік дозволяють підприємствам розширювати віртуальні пропозиції, такі як обслуговування клієнтів та інтерактивні екскурсії.

Випуск слідує запуску 15 вересня 2026 року Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking, моделей живих діалогів, які Google позиціонує відповідно для масштабованих, економічних розмов та для завдань високої складності, що почали розгортатися через Gemini API, Google AI Studio, додаток Gemini, Google Workspace та Search Live.

Загальна доступність у Gemini Enterprise

Gemini 3.8 Live з Live Avatar загально доступний у Gemini Enterprise станом на 24 вересня 2026 року, і Google Cloud повідомив, що технологія вперше була продемонстрована на Google Cloud Next 2026. Випуск пропонується через кінцеві точки США та ЄС і включає забезпечену пропускну здатність, корпоративну відповідність та суворий контроль даних, згідно з дописом Google Cloud від Фабієн Блан-Пак, керівника групи продукту Gemini Live. Gemini 3.8 Live Extended Thinking залишається у приватному попередньому перегляді.

Клієнти‑підприємства можуть спробувати модель у консолі Gemini Enterprise, інтегрувати її через документацію Gemini Live API та переглянути ціни на сторінці цін Google Cloud. Google Cloud радить клієнтам співпрацювати зі своїми представниками з продажу щодо забезпеченої пропускної здатності, налаштованих архітектур розгортання та дозволу на створення кастомних аватарів.

Як працює Live Avatar

Live Avatar обробляє візуальні та аудіо вхідні дані одночасно і відповідає виразним аудіо та відео майже в реальному часі, згідно з Google. Функція також підтримує асинхронний виклик інструментів, тому вона може запускати виклики інструментів і отримувати дані у фоновому режимі без паузи в розмові. Одна демонстрація Google показує, як аватар перевіряє гостя готелю, поки діалог продовжується без переривань.

Google стверджує, що аватар коригує синхронізацію губ та вирази під час розмов, що переходять між 97 мовами, зберігаючи якість відео та уникаючи візуального зсуву. У дописі Google Cloud зазначено, що система забезпечує живе візуальне розуміння потоків з камер та спільного екрану разом з аудіо, відновлення після переривань, що зберігає контекст розмови та бекенд‑транзакції, автоматичне визначення мови та перехід без ручних перемикачів, а також розгортання на веб‑платформах, мобільних пристроях та інтерактивних кіосках. Окрема демонстрація Google Cloud показує агента з прийому страхових претензій, який заповнює нотатник претензії, коли клієнт демонструє пошкодження через камеру, тоді як команда агентів, створена за допомогою Agent Development Kit від Google, перевіряє поліс, застосовує правила прийому та збирає пакет оцінювача у фоні.

Аватари, водяні знаки та обмеження модельної карти

Організації можуть розгортати аватари з бібліотеки готових аватарів або створювати кастомні аватари з високоякісного референсного зображення, і Google стверджує, що результат зберігає схожість, бренд‑стиль або ідентичність персонажа референсу. Доступ до створення кастомних аватарів вимагає включення в список дозволених підприємств; Google Cloud описує процес включення в список та верифікації як захист ідентичності та запобігання зловживанням. Кожен згенерований аудіо‑ та відео‑потік вбудований з непомітним водяним знаком SynthID, що дозволяє виявляти контент, створений ШІ.

Згідно з Gemini 3.8 Audio модельна карта, моделі базуються на Gemini 3 Pro. Gemini 3.8 Live приймає аудіо, зображення, відео та текст з контекстним вікном до 128 Ти токенів, а з Live Avatar виводить аудіо, відео та текст з обмеженням у 24 Ти токенів. У модельній карті зазначено, що варіанти Live Avatar створюють виразне відео з природними рухами голови, синхронізованими з мовленням, керовані налаштованими зображеннями та аудіо‑вхідними даними, і що вони підтримують кілька хвилин безперервної взаємодії, а не години.

У модельній карті перераховано відомі обмеження, включаючи можливі галюцинації та випадкову повільність або тайм‑ауты, і встановлено межу знань у січень 2025 року. Оцінка безпеки на межі не виявила значних нових можливостей чи суттєвих підвищень продуктивності порівняно з Gemini 3.7 Flash, і на цій основі Google вважає, що моделі Gemini 3.8 Audio навряд чи досягнуть будь‑яких рівнів Tracked або Critical Capability у межах його Frontier Safety Framework.

Впровадження у клієнтів

Google Cloud назвав кілька підприємств, що впроваджують цю функцію. Cox Automotive створив AI‑підтримуваного помічника покупок для Autotrader, який використовує живе підсвічування екрану та виклик інструментів, щоб у реальному часі вести покупців автомобілів через пошук, порівняння та фінансування транспортних засобів.

«Покупці все частіше очікують, що зможуть описати свої потреби власними словами, а не проходити через фільтри та меню. Новий розмовний AI‑аватар Autotrader забезпечує такий досвід під час пошуку автомобілів, підбираючи правильний інвентар у відповідності до природної розмови», — сказала Маріанна Джонсон, виконавчий віце‑президент і головний продуктовий директор Cox Automotive, у оголошенні Google Cloud.

Генеральний директор Equal AI Ахілеш Дамараджу заявив, що персональний AI компанії обробляє понад мільйон живих дзвінків щодня дев’ятьма індійськими мовами, і зазначив, що Gemini 3.8 Live покращив обробку переривань, багатомовні розмови та надійність викликів інструментів. Боб Ван Остен, віце‑президент з продукту у Salesforce для Agentforce, сказав, що Agentforce і Gemini 3.8 Live об’єднуються в рамках співпраці між Salesforce AI Research і Google, яка поєднує можливості реального часу мультимодального та агентного ШІ. Ерік Уолш, інженер‑програміст у Specs, зазначив, що оновлення розпізнавання голосової активності та покращення затримки моделі є кроком уперед для AI‑асистента на платформі SPECS.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.