Моделі та платформи ШІ

Google запускає голосові моделі Gemini 3.8 Live та Extended Thinking

mm
Додайте Unite.AI до бажаних джерел у Google

Google оголосила Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking 15 вересня 2026 року, пару моделей живого діалогу, які розгортаються в Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live та Google Workspace.

Моделі представили Том Оуянг, головний інженер, та Маліні Джаганатан, член технічного персоналу, від імені команди Gemini Audio. Google описує цю пару як найпросунутіші моделі живого діалогу, створені для природної розмови, і зазначає, що підвищення інтелекту та паралельного мислення робить їх інтуїтивнішими для співпраці у складних завданнях, виконуваних голосом. Компанія позиціонує Gemini 3.8 Live для масштабованості та економічної ефективності, поєднуючи розмовний інтелект з плавним діалогом та візуальним орієнтуванням, тоді як Gemini 3.8 Live Extended Thinking створена для завдань високої складності, які вимагають підвищеного інтелекту та багатокрокового мислення. За словами Google, моделі надають розробникам і підприємствам будівельні блоки для надійних, готових до виробництва голосових агентів, роблячи розмови з Gemini у додатку Gemini, Workspace та Search більш плавними.

Звітні результати тестування

Google повідомляє, що Gemini 3.8 Live Extended Thinking зайняла перше загальне місце в індексі якості Speech to Speech від Artificial Analysis зі значенням 82,6, а також лідирує у виконанні агентських завдань з 68,6 % у τ-Voice та 35,1 % у τ-Voice-banking benchmark від Sierra. Компанія також повідомляє про оцінку 97,7 % у Big Bench Audio і зазначає, що Extended Thinking зберігає дуже конкурентоспроможну ціну порівняно з іншими передовими моделями. Google стверджує, що Gemini 3.8 Live зайняла друге місце в Speech Agent Arena від Artificial Analysis, підкреслюючи високу перевагу серед користувачів, і описує її як надзвичайно економічно ефективну та призначену для масштабування. У EVA-Bench від ServiceNow, бенчмарку для оцінки голосових агентів, Google заявляє, що його моделі просувають межу Парето для складних робочих процесів, успішно поєднуючи точність із якістю розмови; у дописі зазначено, що ця оцінка була проведена на Live API у платформі агентів Gemini Enterprise.

Можливості розмов у реальному часі

За словами Google, Gemini 3.8 Live обробляє візуальні входи майже в реальному часі, додаючи контекст, який, за словами компанії, забезпечує більш корисні відповіді. Модель автоматично виявляє та переходить між 97 підтримуваними мовами під час розмови, і виконує інструменти та виклики API у фоновому режимі, доки розмова триває, підтверджуючи запити та підтримуючи діалог, доки завдання завершуються. Для завдань, що вимагають глибшого мислення, Google стверджує, що Extended Thinking міркує та говорить одночасно, використовуючи ранні вербальні сигнали для природного підтвердження підказок і живе прогресивне озвучування, щоб проводити користувачів через багатокрокові фонова завдання у процесі їх виконання, не порушуючи розмовний потік.

Відео‑демонстрації, опубліковані разом з оголошенням, показують, як Gemini 3.8 Live проводить сесію адаптації співробітників у реальному часі, використовуючи візуальний контекст для відповіді на живі запитання, грає у шахи майже в реальному часі, створює повні бізнес‑плани та індивідуальні маркетингові набори інструментів за допомогою природної мови, а також забезпечує покрокову допомогу у вирішенні проблем у Search Live. Демонстрації Extended Thinking показують, як модель перетворює ескізи та майже реальний голосовий зворотний зв’язок у функціональні компоненти React, координує багатокрокові бронювання ресторанів через асинхронні виклики функцій без переривання розмови та працює у Docs Live, Gmail Live та Keep Live у Google Workspace.

Live API та екосистема розробників

Google називає Agora, Fishjam, LiveKit, Pipecat, Vercel та Vision Agents платформами для розробників, які використовують Gemini Live API, щоб дозволити розробникам створювати та розгортати голосові інтерфейси, тоді як платформи керують підлеглою інфраструктурою потокової передачі медіа в реальному часі. Компанія також повідомляє про партнерство з Salesforce, Genspark та Lumeris щодо нових моделей, вказуючи на їхню зацікавленість у затримці, плавності та можливостях виклику інструментів моделей.

Офіційна документація Live API описує інтерфейс як такий, що забезпечує низьколатентні, реального часу голосові та візуальні взаємодії з Gemini, обробляючи безперервні потоки аудіо, зображень та тексту для надання негайних усних відповідей через станний WebSocket-з’єднання. Зафіксовані вхідні дані — це необроблене 16‑бітове PCM‑аудіо з частотою 16 кГц, JPEG‑зображення до одного кадра в секунду та текст, а вихідний аудіо‑потік — необроблене 16‑бітове PCM з частотою 24 кГц. Розробники можуть обрати реалізацію server‑to‑server, коли бекенд пересилає дані потоку клієнта до Live API, або реалізацію client‑to‑server, коли фронтенд‑код підключається безпосередньо через WebSocket. Документація перераховує сценарії використання, включаючи роздрібних помічників при покупках та агентів підтримки, інтерактивних персонажів у іграх, голосові та відео‑додатки в робототехніці, смарт‑окулярах та транспортних засобах, помічників у сфері охорони здоров’я, фінансових консультаційних інструментів, освітніх наставників, переклад у реальному часі, а також живу транскрипцію та субтитрування.

Google заявляє, що весь аудіо‑контент, створений його AI‑продуктами, має водяний знак SynthID, непомітний водяний знак, вплетений безпосередньо в аудіо‑вихід, щоб AI‑згенерований контент залишався виявленим і допомагав запобігти дезінформації. У дописі читачі перенаправляються до картки моделі для отримання деталей щодо підходу компанії до безпеки та відповідальності.

Доступність та впровадження

Обидві моделі почали впроваджуватись 15 вересня. Для розробників вони доступні в Gemini API та Google AI Studio, а для підприємств — у приватному попередньому перегляді в Gemini Enterprise. Gemini 3.8 Live доступна всім у Search Live, тоді як Extended Thinking доступна в Gemini Live, у Docs для підписників Google AI Pro та Ultra через Workspace, а також у Gmail та Keep для всіх підписників Google AI. Google каже, що Gemini Enterprise for Customer Experience support для обох моделей незабаром з’явиться, і що Extended Thinking незабаром буде доступна клієнтам‑бізнесу Google Workspace.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.