Модели и платформы ИИ

Google добавляет визуальное присутствие Live Avatar в Gemini 3.8 Live

mm
Добавьте Unite.AI в избранные источники в Google

Google 24 сентября 2026 года представил Gemini 3.8 Live с Live Avatar, функцию, которая добавляет почти в реальном времени генерируемое видео к речи его собственных моделей живого диалога, и сделал её общедоступной в Gemini Enterprise с конечными точками в United States и European Union.

Объявление, написанное научным сотрудником Шуо-ийин Чанг и инженером‑программистом CJ Zheng от имени Gemini Audio Team, представляет функцию как слой визуального присутствия для разговорного ИИ Gemini. Google заявляет, что её точная синхронизация губ, естественные выражения и плавный порядок реплик позволяют предприятиям расширять виртуальные предложения, такие как обслуживание клиентов и интерактивные экскурсии.

Выпуск следует за 15 сентября 2026 запуск Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, моделями живого диалога, которые Google позиционировал соответственно для масштабируемого, экономичного общения и для задач высоко‑сложного рассуждения, и которые начали распространяться через Gemini API, Google AI Studio, приложение Gemini, Google Workspace и Search Live.

Общая доступность в Gemini Enterprise

Gemini 3.8 Live с Live Avatar общедоступен в Gemini Enterprise с 24 сентября 2026 года, и Google Cloud сообщил, что технология впервые была продемонстрирована на Google Cloud Next 2026. Выпуск предлагается через конечные точки US и EU и включает выделенную пропускную способность, корпоративное соответствие и строгий контроль данных, согласно посту Google Cloud от Fabien Blanc‑paques, руководителя группы продукта Gemini Live. Gemini 3.8 Live Extended Thinking остаётся в закрытом предварительном просмотре.

Корпоративные клиенты могут опробовать модель в консоли Gemini Enterprise, интегрировать её через документацию Gemini Live API и ознакомиться с ценами на странице ценообразования Google Cloud. Google Cloud советует клиентам работать с их представителями по продажам для получения выделенной пропускной способности, индивидуальных архитектур развертывания и включения в список разрешённых пользовательских аватаров.

Как работает Live Avatar

Live Avatar обрабатывает визуальные и аудио входы одновременно и отвечает выразительным аудио и видео почти в реальном времени, согласно Google. Функция также поддерживает асинхронный вызов инструментов, позволяя запускать вызовы инструментов и получать данные в фоновом режиме без приостановки диалога. Одна демонстрация Google показывает, как аватар проверяет состояние гостя отеля, пока диалог продолжается без прерываний.

Google утверждает, что аватар регулирует синхронизацию губ и выражения по мере переключения разговоров между 97 языками, сохраняя качество видео и избегая визуального дрейфа. В посте Google Cloud отмечается живое визуальное понимание видеопотоков с камеры и совместного использования экрана вместе с аудио, восстановление после прерываний, сохраняющее контекст диалога и бек‑энд транзакции, автоматическое определение языка и переход без ручных переключений, а также развертывание на вебе, мобильных устройствах и интерактивных киосках. Отдельная демонстрация Google Cloud показывает агента по приёму страховых претензий, заполняющего журнал претензий, пока клиент демонстрирует повреждения через камеру, а команда агентов, построенная с помощью Agent Development Kit от Google, проверяет полис, применяет правила приёма и собирает пакет эксперта по урегулированию в фоновом режиме.

Аватары, водяные знаки и ограничения модель‑карты

Организации могут развернуть аватары из библиотеки предустановленных вариантов или создать пользовательские аватары из высококачественного референсного изображения, и Google заявляет, что результат сохраняет сходство, фирменный стиль или характерную идентичность референса. Доступ к созданию пользовательских аватаров требует включения в список разрешённых предприятий; Google Cloud описывает процесс включения в список и верификации как защиту идентичности и против злоупотреблений. Каждый сгенерированный аудио‑ и видеопоток содержит незаметный водяной знак SynthID, позволяющий обнаружить контент, созданный ИИ.

Согласно Gemini 3.8 Audio карта модели, модели основаны на Gemini 3 Pro. Gemini 3.8 Live принимает аудио, изображения, видео и текст с контекстным окном до 128 K токенов, а при использовании Live Avatar выводит аудио, видео и текст с ограничением вывода в 24 K токенов. В карте модели указано, что варианты Live Avatar создают выразительное видео с естественными движениями головы, синхронными с речью, управляемое настроенными изображениями и аудиовходами, и что они поддерживают несколько минут непрерывного взаимодействия, а не часы.

В модель‑карте перечислены известные ограничения, включая возможные галлюцинации и редкую медлительность или тайм‑ауты, а также установлен предел знаний — январь 2025. Оценка передовой безопасности не выявила значимых новых возможностей или существенного повышения производительности по сравнению с Gemini 3.7 Flash, и на этой основе Google считает, что модели Gemini 3.8 Audio вряд ли достигнут каких‑либо уровней Tracked или Critical Capability в рамках её Frontier Safety Framework.

Развертывание клиентами

Google Cloud назвал несколько предприятий, использующих эту функцию. Cox Automotive создала AI‑управляемого помощника для покупок в Autotrader, который использует живое выделение экрана и вызов инструментов, чтобы в реальном времени проводить покупателей автомобилей через поиск, сравнение и финансирование транспортных средств.

“Покупатели всё чаще ожидают описывать свои потребности собственными словами, а не просматривать фильтры и меню. Новый разговорный AI‑аватар Autotrader предоставляет такой опыт при поиске автомобилей, сопоставляя естественный диалог с подходящим инвентарём,” — сказала Марианн Джонсон, исполнительный вице‑президент и главный продуктовый директор Cox Automotive, в объявлении Google Cloud.

Генеральный директор Equal AI Ахилеш Дамараджу сообщил, что персональный ИИ компании обрабатывает более миллиона живых звонков ежедневно на девяти индийских языках, и отметил, что Gemini 3.8 Live улучшил обработку прерываний, многоязычные беседы и надёжность вызовов инструментов. Боб Ван Остен, вице‑президент по продукту Agentforce в Salesforce, сказал, что Agentforce и Gemini 3.8 Live объединяются в рамках сотрудничества между Salesforce AI Research и Google, сочетая возможности реального времени мультимодального взаимодействия с агентным ИИ. Эрик Уолш, инженер‑программист в Specs, отметил, что обновления детекции голосовой активности и улучшения задержки модели являются шагом вперёд для AI‑ассистента на платформе SPECS.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.