Модели и платформы ИИ

Google запускает голосовые модели Gemini 3.8 Live и Extended Thinking

mm
Добавьте Unite.AI в избранные источники в Google

Google объявила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking 15 сентября 2026 года, пару моделей живого диалога, распространяемых через Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live и Google Workspace.

Модели представили Том Оуянг, главный инженер, и Малини Джаганатан, сотрудник технического отдела, от имени команды Gemini Audio. Google описывает эту пару как самые продвинутые модели живого диалога, созданные для естественного общения, и отмечает, что рост интеллекта и параллельного рассуждения делает их более интуитивными для совместной работы над сложными задачами, выполняемыми голосом. Компания позиционирует Gemini 3.8 Live как решение для масштабируемости и экономической эффективности, сочетая разговорный интеллект с плавным диалогом и визуальной привязкой, тогда как Gemini 3.8 Live Extended Thinking предназначена для задач высокой сложности, требующих повышенного интеллекта и многошагового рассуждения. По словам Google, модели предоставляют разработчикам и предприятиям базовые элементы для надёжных, готовых к производству голосовых агентов, делая разговоры с Gemini в приложении Gemini, Workspace и Search более плавными.

Сообщённые результаты бенчмарков

Google сообщает, что Gemini 3.8 Live Extended Thinking заняла первое место в общем рейтинге Speech to Speech Quality Index от Artificial Analysis со скором 82,6, а также лидирует в выполнении агентных задач: 68,6 % на τ-Voice и 35,1 % в бенчмарке τ-Voice-banking от Sierra. Компания также сообщает о результате 97,7 % в Big Bench Audio и заявляет, что Extended Thinking сохраняет очень конкурентоспособную цену по сравнению с другими передовыми моделями. Google сообщает, что Gemini 3.8 Live заняла второе место в Speech Agent Arena от Artificial Analysis, указывая на высокий уровень предпочтения среди пользователей, и описывает её как чрезвычайно экономичную и предназначенную для масштабирования. В EVA-Bench от ServiceNow, бенчмарке для оценки голосовых агентов, Google заявляет, что её модели продвигают границу Парето для сложных рабочих процессов, успешно балансируя точность и качество диалога; в посте отмечается, что эта оценка была проведена на Live API на Gemini Enterprise Agent Platform.

Возможности общения в реальном времени

По словам Google, Gemini 3.8 Live обрабатывает визуальные вводы почти в реальном времени, добавляя контекст, который, по утверждению компании, делает ответы более полезными. Модель автоматически обнаруживает и переключается между 97 поддерживаемыми языками в ходе разговора, а также выполняет инструменты и вызовы API в фоновом режиме, пока диалог продолжается, подтверждая запросы и поддерживая разговор, пока задачи завершаются. Для задач, требующих более глубоких рассуждений, Google сообщает, что Extended Thinking рассуждает и говорит одновременно, используя ранние вербальные сигналы для естественного подтверждения запросов и живое повествование прогресса, чтобы проводить пользователей через многошаговые фоновые задачи по мере их выполнения, не прерывая поток разговора.

Видео‑демонстрации, опубликованные вместе с объявлением, показывают, как Gemini 3.8 Live в реальном времени проводит сессию адаптации сотрудников, используя визуальный контекст для ответов на живые вопросы, играет в шахматы почти в реальном времени, создает полные бизнес‑планы и индивидуальные маркетинговые наборы инструментов с помощью естественной речи, а также обеспечивает пошаговую помощь в устранении неполадок внутри Search Live. Демонстрации Extended Thinking показывают, как модель превращает наброски и почти мгновенную голосовую обратную связь в функциональные компоненты React, координирует многошаговое бронирование ресторанов через асинхронные вызовы функций без прерывания разговора и работает в Docs Live, Gmail Live и Keep Live в Google Workspace.

Live API и экосистема разработчиков

Google перечисляет Agora, Fishjam, LiveKit, Pipecat, Vercel и Vision Agents как платформы для разработчиков, которые используют Gemini Live API, позволяя создавать и развёртывать голосовые интерфейсы, в то время как платформы управляют базовой инфраструктурой потоковой передачи медиа в реальном времени. Компания также сообщает о партнёрстве с Salesforce, Genspark и Lumeris в рамках новых моделей, подчёркивая их интерес к задержкам, плавности и возможностям вызова инструментов.

Официальная документация Live API описывает интерфейс как обеспечивающий низкую задержку и взаимодействие в реальном времени голоса и зрения с Gemini, обрабатывая непрерывные потоки аудио, изображений и текста для предоставления мгновенных голосовых ответов через устойчивое соединение WebSocket. В документации указаны входные данные: необработанный 16‑битный PCM‑аудио с частотой 16 кГц, JPEG‑изображения до одного кадра в секунду и текст, а аудиовыход — необработанный 16‑битный PCM с частотой 24 кГц. Разработчики могут выбрать реализацию server‑to‑server, при которой бэкенд пересылает потоковые данные клиента в Live API, или реализацию client‑to‑server, когда фронтенд‑код подключается напрямую через WebSocket. В документации перечислены сценарии применения, охватывающие помощников по розничным покупкам и службы поддержки, интерактивных игровых персонажей, голосовые и видеовозможности в робототехнике, умных очках и транспортных средствах, медицинских компаньонов, финансовые консультативные инструменты, образовательных наставников, перевод в реальном времени, а также живую транскрипцию и субтитры.

Google заявляет, что весь аудио‑контент, генерируемый её AI‑продуктами, снабжён водяным знаком SynthID — незаметным водяным знаком, встроенным непосредственно в аудиовыход, чтобы сгенерированный ИИ контент оставался обнаруживаемым и помогал предотвращать дезинформацию. В посте читателям предлагается ознакомиться с карточкой модели для получения подробностей о подходе компании к безопасности и ответственности.

Доступность и развертывание

Обе модели начали распространяться 15 сентября. Для разработчиков они доступны в Gemini API и Google AI Studio, а для предприятий находятся в закрытом предварительном доступе в Gemini Enterprise. Gemini 3.8 Live доступна всем в Search Live, в то время как Extended Thinking доступна в Gemini Live, в Docs для подписчиков Google AI Pro и Ultra через Workspace, а также в Gmail и Keep для всех подписчиков Google AI. Google сообщает, что Gemini Enterprise для поддержки клиентского опыта обеих моделей скоро будет доступен, и что Extended Thinking скоро появится у бизнес‑клиентов Google Workspace.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.