Modely a platformy AI

Google uvádí hlasové modely Gemini 3.8 Live a Extended Thinking

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Google oznámila Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking dne 15. září 2026, dvojice modelů pro živý dialog, které jsou nasazovány napříč Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live a Google Workspace.

Modely představili Tom Ouyang, hlavní inženýr, a Malini Jaganathan, člen technického týmu, jménem týmu Gemini Audio. Google popisuje tuto dvojici jako své dosud nejpokročilejší modely pro živý dialog, vytvořené pro přirozenou konverzaci, a uvádí, že zisky v inteligenci a paralelním uvažování je činí intuitivnějšími pro spolupráci na složitých úlohách prováděných hlasem. Společnost umisťuje Gemini 3.8 Live jako řešení pro škálovatelnost a nákladovou efektivitu, kombinující konverzační inteligenci s plynulým dialogem a vizuálním zakotvením, zatímco Gemini 3.8 Live Extended Thinking je navržen pro vysoce komplexní úlohy vyžadující zvýšenou inteligenci a vícekrokové uvažování. Podle Googlu modely poskytují vývojářům a podnikům stavební bloky pro spolehlivé, produkčně připravené hlasové agenty a zároveň činí konverzace s Gemini v aplikaci Gemini, Workspace a Search plynulejšími.

Zpráva o výsledcích benchmarků

Google uvádí, že Gemini 3.8 Live Extended Thinking získal první celkové místo v indexu kvality řeč‑na‑řeč společnosti Artificial Analysis s výsledkem 82,6 a vede v dokončování úkolů agentury s 68,6 % na τ‑Voice a 35,1 % na benchmarku τ‑Voice‑banking společnosti Sierra. Společnost také uvádí výsledek 97,7 % v Big Bench Audio a tvrdí, že Extended Thinking si udržuje vysoce konkurenceschopnou cenovou úroveň ve srovnání s ostatními špičkovými modely. Google uvádí, že Gemini 3.8 Live obsadil druhé místo v Speech Agent Arena od Artificial Analysis, s odkazem na vysokou oblíbenost mezi uživateli, a popisuje jej jako vysoce nákladově efektivní a určený pro škálování. V benchmarku EVA‑Bench od ServiceNow, který hodnotí hlasové agenty, Google uvádí, že jeho modely posouvají Pareto frontu pro složité pracovní postupy tím, že úspěšně vyvažují přesnost s konverzační kvalitou; příspěvek poznamenává, že toto hodnocení bylo provedeno na Live API na platformě Gemini Enterprise Agent Platform.

Schopnosti konverzace v reálném čase

Podle Googlu Gemini 3.8 Live zpracovává vizuální vstupy téměř v reálném čase a přidává kontext, o kterém společnost tvrdí, že vede k užitečnějším odpovědím. Model automaticky detekuje a přepíná mezi 97 podporovanými jazyky během konverzace a v pozadí provádí nástroje a volání API, zatímco konverzace pokračuje, uznává požadavky a udržuje dialog, dokud úkoly nedokončí. U úkolů vyžadujících hlubší uvažování Google uvádí, že Extended Thinking uvažuje a mluví současně, používá rané verbální signály k přirozenému uznání výzev a živý komentář postupu, který uživatele provádí vícekrokovými úkoly na pozadí, aniž by narušil tok konverzace.

Ukázkové video zveřejněné spolu s oznámením ukazují, jak Gemini 3.8 Live v reálném čase vede školení nových zaměstnanců pomocí vizuálního kontextu k odpovědím na živé otázky, hraje šachy téměř v reálném čase, vytváří kompletní obchodní plány a vlastní marketingové sady pomocí přirozené řeči a poskytuje krok‑za‑krokem pomoc při odstraňování problémů v rámci Search Live. Demonstrace Extended Thinking ukazují, jak model převádí surové skici a téměř okamžitou hlasovou zpětnou vazbu na funkční komponenty React, koordinuje vícekrokové rezervace v restauracích prostřednictvím asynchronních volání funkcí bez přerušení konverzace a pracuje napříč Docs Live, Gmail Live a Keep Live v Google Workspace.

Live API a vývojářský ekosystém

Google uvádí Agora, Fishjam, LiveKit, Pipecat, Vercel a Vision Agents jako vývojářské platformy, které používají Gemini Live API k umožnění vývojářům vytvářet a nasazovat hlasové rozhraní, zatímco platformy spravují podkladovou infrastrukturu pro streamování médií v reálném čase. Společnost také uvádí, že spolupracuje s Salesforce, Genspark a Lumeris na nových modelech a poukazuje na jejich zájem o nízkou latenci, plynulost a schopnosti volání nástrojů.

Oficiální dokumentace Live API popisuje rozhraní jako umožňující nízkou latenci a interakce v reálném čase mezi hlasem a vizí s Gemini, zpracovávající kontinuální proudy audia, obrázků a textu a poskytující okamžité mluvené odpovědi přes stavové připojení WebSocket. Dokumentované vstupy jsou surový 16‑bitový PCM audio při 16 kHz, JPEG obrázky až po jeden snímek za sekundu a text, přičemž výstupní audio je surový 16‑bitový PCM při 24 kHz. Vývojáři si mohou vybrat implementaci server‑to‑server, kde backend přeposílá data klientského proudu do Live API, nebo implementaci client‑to‑server, kde frontendový kód se připojuje přímo přes WebSockety. Dokumentace uvádí příklady použití od asistentů pro nákup v maloobchodě a podpora agentů, interaktivních herních postav, hlasových a video‑poháněných zážitků v robotice, chytrých brýlích a vozidlech, zdravotních společníků, finančních poradenských nástrojů, vzdělávacích mentorů, překladu v reálném čase až po živé přepisování a titulkování.

Google uvádí, že veškerý audio výstup generovaný jeho AI produkty je opatřen vodoznakem SynthID, nepostřehnutelným vodoznakem vloženým přímo do audio výstupu, aby byl obsah generovaný AI detekovatelný a pomáhal předcházet dezinformacím. Příspěvek odkazuje čtenáře na modelovou kartu s podrobnostmi o přístupu společnosti k bezpečnosti a odpovědnosti.

Dostupnost a rozšíření

Oba modely byly zahájeny 15. září. Pro vývojáře jsou k dispozici v Gemini API a Google AI Studio, a pro podniky jsou v soukromém náhledu v Gemini Enterprise. Gemini 3.8 Live je dostupné všem v Search Live, zatímco Extended Thinking je k dispozici v Gemini Live, v Docs pro předplatitele Google AI Pro a Ultra prostřednictvím Workspace a v Gmailu a Keep pro všechny předplatitele Google AI. Google uvádí, že Gemini Enterprise pro podporu zákaznické zkušenosti pro oba modely bude brzy k dispozici, a že Extended Thinking bude brzy k dispozici pro firemní zákazníky Google Workspace.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.