Modele i platformy AI

Google wprowadza modele głosowe Gemini 3.8 Live i Extended Thinking

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Google ogłosił Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking 15 września 2026 r., parę modeli dialogowych na żywo, które są wprowadzane w Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live i Google Workspace.

Modele zostały przedstawione przez Toma Ouyanga, głównego inżyniera, oraz Malini Jaganathan, członka zespołu technicznego, w imieniu zespołu Gemini Audio. Google opisuje tę parę jako najnowocześniejsze modele dialogowe na żywo, przeznaczone do naturalnej rozmowy, i podkreśla, że postępy w inteligencji i równoległym rozumowaniu czynią je bardziej intuicyjnymi w współpracy przy złożonych zadaniach realizowanych głosem. Firma pozycjonuje Gemini 3.8 Live pod kątem skalowalności i efektywności kosztowej, łącząc inteligencję konwersacyjną z płynnym dialogiem i wizualnym osadzeniem, podczas gdy Gemini 3.8 Live Extended Thinking jest przeznaczony do zadań o wysokiej złożoności, wymagających zwiększonej inteligencji i wieloetapowego rozumowania. Według Google modele dostarczają deweloperom i przedsiębiorstwom elementy budulcowe niezbędne do niezawodnych, gotowych do produkcji agentów głosowych, jednocześnie sprawiając, że rozmowy z Gemini w aplikacji Gemini, Workspace i Search są bardziej płynne.

Zgłoszone wyniki benchmarków

Google informuje, że Gemini 3.8 Live Extended Thinking zajął pierwsze miejsce w ogólnym rankingu w Speech to Speech Quality Index firmy Artificial Analysis, uzyskując wynik 82,6, oraz że przoduje w realizacji zadań agentowych z wynikiem 68,6 % w benchmarku τ-Voice i 35,1 % w benchmarku τ-Voice-banking firmy Sierra. Firma podaje także wynik 97,7 % w Big Bench Audio i twierdzi, że Extended Thinking utrzymuje bardzo konkurencyjną cenę w porównaniu z innymi modelami na czołowej pozycji. Google podaje, że Gemini 3.8 Live zajął drugie miejsce w Speech Agent Arena firmy Artificial Analysis, wskazując na wysoką preferencję wśród użytkowników, i opisuje go jako bardzo opłacalny kosztowo i zaprojektowany pod kątem skalowalności. W benchmarku EVA-Bench firmy ServiceNow, służącym do oceny agentów głosowych, Google twierdzi, że jego modele przesuwają granicę Pareto Frontier dla złożonych przepływów pracy, skutecznie równoważąc dokładność z jakością konwersacji; w poście zaznaczono, że ocena została przeprowadzona na Live API na platformie Gemini Enterprise Agent Platform.

Możliwości rozmów w czasie rzeczywistym

Według Google, Gemini 3.8 Live przetwarza dane wizualne w prawie czasie rzeczywistym, dodając kontekst, który – jak podkreśla firma – prowadzi do bardziej pomocnych odpowiedzi. Model automatycznie wykrywa i przełącza się pomiędzy 97 obsługiwanymi językami w trakcie rozmowy oraz wykonuje narzędzia i wywołania API w tle, jednocześnie kontynuując konwersację, potwierdzając żądania i utrzymując dialog, aż zadania zostaną zakończone. W przypadku zadań wymagających głębszego rozumowania Google twierdzi, że Extended Thinking rozumuje i mówi jednocześnie, wykorzystując wczesne sygnały werbalne do naturalnego potwierdzania zapytań oraz narrację postępu na żywo, aby prowadzić użytkowników przez wieloetapowe zadania w tle, nie przerywając płynności konwersacji.

Filmy demonstracyjne opublikowane wraz z ogłoszeniem pokazują, jak Gemini 3.8 Live prowadzi sesję wprowadzania pracownika w czasie rzeczywistym, wykorzystując kontekst wizualny do udzielania bieżących odpowiedzi, gra w szachy w prawie czasie rzeczywistym, tworzy pełne plany biznesowe i spersonalizowane zestawy marketingowe przy użyciu naturalnej mowy oraz zapewnia pomoc krok po kroku w rozwiązywaniu problemów w Search Live. Demonstracje Extended Thinking ukazują, jak model przekształca surowe szkice i prawie natychmiastową informację zwrotną głosową w funkcjonalne komponenty React, koordynuje wieloetapowe rezerwacje restauracji poprzez asynchroniczne wywołania funkcji bez przerywania rozmowy oraz działa w Docs Live, Gmail Live i Keep Live w Google Workspace.

Live API i ekosystem deweloperów

Google wymienia Agora, Fishjam, LiveKit, Pipecat, Vercel i Vision Agents jako platformy deweloperskie, które korzystają z Gemini Live API, umożliwiając programistom budowanie i wdrażanie interfejsów sterowanych głosem, podczas gdy platformy zarządzają podstawową infrastrukturą strumieniowania mediów w czasie rzeczywistym. Firma informuje, że współpracuje również z Salesforce, Genspark i Lumeris przy nowych modelach, podkreślając ich zainteresowanie opóźnieniami, płynnością i możliwościami wywoływania narzędzi.

Oficjalna dokumentacja Live API opisuje interfejs jako umożliwiający niskolatencyjne, rzeczywiste interakcje głosowe i wizualne z Gemini, przetwarzając ciągłe strumienie audio, obrazów i tekstu, aby dostarczyć natychmiastowe odpowiedzi głosowe przez trwałe połączenie WebSocket. Dokumentowane wejścia to surowe 16‑bitowe audio PCM o częstotliwości 16 kHz, obrazy JPEG z maksymalnie jedną klatką na sekundę oraz tekst, a wyjście audio to surowe 16‑bitowe PCM przy 24 kHz. Deweloperzy mogą wybrać implementację serwer‑do‑serwera, w której backend przekazuje dane strumienia klienta do Live API, lub implementację klient‑do‑serwera, w której kod front‑endu łączy się bezpośrednio przez WebSockety. Dokumentacja wymienia scenariusze użycia obejmujące asystentów zakupowych w handlu detalicznym i agentów wsparcia, interaktywne postacie w grach, doświadczenia z obsługą głosu i wideo w robotyce, inteligentnych okularach i pojazdach, towarzyszy zdrowotnych, narzędzia doradztwa finansowego, mentorów edukacyjnych, tłumaczenia w czasie rzeczywistym oraz transkrypcję i napisy na żywo.

Google podkreśla, że wszystkie dźwięki generowane przez jego produkty AI są znakowane wodnym znakiem SynthID, niewidocznym znakem wprowadzonym bezpośrednio do wyjścia audio, aby treści generowane przez AI były wykrywalne i pomagały zapobiegać dezinformacji. W poście czytelnicy zostają skierowani do karty modelu, gdzie znajdują się szczegóły dotyczące podejścia firmy do bezpieczeństwa i odpowiedzialności.

Dostępność i wdrożenie

Oba modele rozpoczęły wdrażanie 15 września. Dla programistów są dostępne w Gemini API i Google AI Studio, a dla przedsiębiorstw znajdują się w prywatnym podglądzie w Gemini Enterprise. Gemini 3.8 Live jest dostępny dla wszystkich w Search Live, natomiast Extended Thinking jest dostępny w Gemini Live, w Docs dla subskrybentów Google AI Pro i Ultra poprzez Workspace oraz w Gmail i Keep dla wszystkich subskrybentów Google AI. Google informuje, że Gemini Enterprise z obsługą Customer Experience dla obu modeli pojawi się wkrótce oraz że Extended Thinking wkrótce będzie dostępny dla klientów biznesowych Google Workspace.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.