Модели и платформы ИИ
Google добавляет визуальное присутствие Live Avatar в Gemini 3.8 Live

Google 24 сентября 2026 года представил Gemini 3.8 Live с Live Avatar, функцию, которая добавляет почти в реальном времени генерируемое видео к речи его собственных моделей живого диалога, и сделал её общедоступной в Gemini Enterprise с конечными точками в United States и European Union.
Объявление, написанное научным сотрудником Шуо-ийин Чанг и инженером‑программистом CJ Zheng от имени Gemini Audio Team, представляет функцию как слой визуального присутствия для разговорного ИИ Gemini. Google заявляет, что её точная синхронизация губ, естественные выражения и плавный порядок реплик позволяют предприятиям расширять виртуальные предложения, такие как обслуживание клиентов и интерактивные экскурсии.
Выпуск следует за 15 сентября 2026 запуск Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, моделями живого диалога, которые Google позиционировал соответственно для масштабируемого, экономичного общения и для задач высоко‑сложного рассуждения, и которые начали распространяться через Gemini API, Google AI Studio, приложение Gemini, Google Workspace и Search Live.
Общая доступность в Gemini Enterprise
Gemini 3.8 Live с Live Avatar общедоступен в Gemini Enterprise с 24 сентября 2026 года, и Google Cloud сообщил, что технология впервые была продемонстрирована на Google Cloud Next 2026. Выпуск предлагается через конечные точки US и EU и включает выделенную пропускную способность, корпоративное соответствие и строгий контроль данных, согласно посту Google Cloud от Fabien Blanc‑paques, руководителя группы продукта Gemini Live. Gemini 3.8 Live Extended Thinking остаётся в закрытом предварительном просмотре.
Корпоративные клиенты могут опробовать модель в консоли Gemini Enterprise, интегрировать её через документацию Gemini Live API и ознакомиться с ценами на странице ценообразования Google Cloud. Google Cloud советует клиентам работать с их представителями по продажам для получения выделенной пропускной способности, индивидуальных архитектур развертывания и включения в список разрешённых пользовательских аватаров.
Как работает Live Avatar
Live Avatar обрабатывает визуальные и аудио входы одновременно и отвечает выразительным аудио и видео почти в реальном времени, согласно Google. Функция также поддерживает асинхронный вызов инструментов, позволяя запускать вызовы инструментов и получать данные в фоновом режиме без приостановки диалога. Одна демонстрация Google показывает, как аватар проверяет состояние гостя отеля, пока диалог продолжается без прерываний.
Google утверждает, что аватар регулирует синхронизацию губ и выражения по мере переключения разговоров между 97 языками, сохраняя качество видео и избегая визуального дрейфа. В посте Google Cloud отмечается живое визуальное понимание видеопотоков с камеры и совместного использования экрана вместе с аудио, восстановление после прерываний, сохраняющее контекст диалога и бек‑энд транзакции, автоматическое определение языка и переход без ручных переключений, а также развертывание на вебе, мобильных устройствах и интерактивных киосках. Отдельная демонстрация Google Cloud показывает агента по приёму страховых претензий, заполняющего журнал претензий, пока клиент демонстрирует повреждения через камеру, а команда агентов, построенная с помощью Agent Development Kit от Google, проверяет полис, применяет правила приёма и собирает пакет эксперта по урегулированию в фоновом режиме.
Аватары, водяные знаки и ограничения модель‑карты
Организации могут развернуть аватары из библиотеки предустановленных вариантов или создать пользовательские аватары из высококачественного референсного изображения, и Google заявляет, что результат сохраняет сходство, фирменный стиль или характерную идентичность референса. Доступ к созданию пользовательских аватаров требует включения в список разрешённых предприятий; Google Cloud описывает процесс включения в список и верификации как защиту идентичности и против злоупотреблений. Каждый сгенерированный аудио‑ и видеопоток содержит незаметный водяной знак SynthID, позволяющий обнаружить контент, созданный ИИ.
Согласно Gemini 3.8 Audio карта модели, модели основаны на Gemini 3 Pro. Gemini 3.8 Live принимает аудио, изображения, видео и текст с контекстным окном до 128 K токенов, а при использовании Live Avatar выводит аудио, видео и текст с ограничением вывода в 24 K токенов. В карте модели указано, что варианты Live Avatar создают выразительное видео с естественными движениями головы, синхронными с речью, управляемое настроенными изображениями и аудиовходами, и что они поддерживают несколько минут непрерывного взаимодействия, а не часы.
В модель‑карте перечислены известные ограничения, включая возможные галлюцинации и редкую медлительность или тайм‑ауты, а также установлен предел знаний — январь 2025. Оценка передовой безопасности не выявила значимых новых возможностей или существенного повышения производительности по сравнению с Gemini 3.7 Flash, и на этой основе Google считает, что модели Gemini 3.8 Audio вряд ли достигнут каких‑либо уровней Tracked или Critical Capability в рамках её Frontier Safety Framework.
Развертывание клиентами
Google Cloud назвал несколько предприятий, использующих эту функцию. Cox Automotive создала AI‑управляемого помощника для покупок в Autotrader, который использует живое выделение экрана и вызов инструментов, чтобы в реальном времени проводить покупателей автомобилей через поиск, сравнение и финансирование транспортных средств.
“Покупатели всё чаще ожидают описывать свои потребности собственными словами, а не просматривать фильтры и меню. Новый разговорный AI‑аватар Autotrader предоставляет такой опыт при поиске автомобилей, сопоставляя естественный диалог с подходящим инвентарём,” — сказала Марианн Джонсон, исполнительный вице‑президент и главный продуктовый директор Cox Automotive, в объявлении Google Cloud.
Генеральный директор Equal AI Ахилеш Дамараджу сообщил, что персональный ИИ компании обрабатывает более миллиона живых звонков ежедневно на девяти индийских языках, и отметил, что Gemini 3.8 Live улучшил обработку прерываний, многоязычные беседы и надёжность вызовов инструментов. Боб Ван Остен, вице‑президент по продукту Agentforce в Salesforce, сказал, что Agentforce и Gemini 3.8 Live объединяются в рамках сотрудничества между Salesforce AI Research и Google, сочетая возможности реального времени мультимодального взаимодействия с агентным ИИ. Эрик Уолш, инженер‑программист в Specs, отметил, что обновления детекции голосовой активности и улучшения задержки модели являются шагом вперёд для AI‑ассистента на платформе SPECS.












