Modele și platforme AI
Google lansează modelele vocale Gemini 3.8 Live și Gemini 3.8 Live Extended Thinking

Google a anunțat Gemini 3.8 Live și Gemini 3.8 Live Extended Thinking pe 15 septembrie 2026, un cuplu de modele de dialog în timp real lansate în Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live și Google Workspace.
Modelele au fost prezentate de Tom Ouyang, inginer principal, și Malini Jaganathan, membru al echipei tehnice, scriind în numele echipei Gemini Audio. Google descrie acest cuplu ca fiind cele mai avansate modele de dialog în timp real de până acum, concepute pentru conversații naturale, și afirmă că progresele în inteligență și raționament paralel le fac mai intuitive pentru colaborarea la sarcini complexe executate prin voce. Compania poziționează Gemini 3.8 Live pentru scalabilitate și eficiență a costurilor, combinând inteligența conversațională cu dialog fluid și ancorare vizuală, în timp ce Gemini 3.8 Live Extended Thinking este conceput pentru sarcini de înaltă complexitate care necesită inteligență sporită și raționament în mai mulți pași. Conform Google, modelele oferă dezvoltatorilor și întreprinderilor blocuri de construcție pentru agenți vocali fiabili, pregătiți pentru producție, facilitând conversații mai fluide cu Gemini în aplicația Gemini, Workspace și Search.
Rezultatele benchmark-ului raportate
Google raportează că Gemini 3.8 Live Extended Thinking a obținut prima poziție generală în indicele de calitate Speech to Speech al Artificial Analysis, cu un scor de 82,6, și că conduce în finalizarea sarcinilor agentice cu 68,6% pe τ-Voice și 35,1% pe benchmarkul τ-Voice-banking al Sierra. Compania raportează, de asemenea, un scor de 97,7% la Big Bench Audio și afirmă că Extended Thinking menține un preț extrem de competitiv în raport cu alte modele de frontieră. Google spune că Gemini 3.8 Live s-a clasat pe locul al doilea în Speech Agent Arena al Artificial Analysis, citând o preferință ridicată în rândul utilizatorilor, și îl descrie ca fiind foarte rentabil și conceput pentru scalabilitate. În EVA-Bench de la ServiceNow, un benchmark pentru evaluarea agenților vocali, Google afirmă că modelele sale împing frontiera Pareto pentru fluxuri de lucru complexe, reușind să echilibreze cu succes acuratețea cu calitatea conversațională; postarea menționează că această evaluare a fost efectuată pe Live API pe platforma Gemini Enterprise Agent Platform.
Capacități de conversație în timp real
Conform Google, Gemini 3.8 Live procesează intrările vizuale aproape în timp real, adăugând context, ceea ce, potrivit companiei, generează răspunsuri mai utile. Modelul detectează automat și trece între 97 de limbi suportate în timpul conversației și execută instrumente și apeluri API în fundal în timp ce discuția continuă, recunoscând cererile și menținând dialogul în desfășurare până la finalizarea sarcinilor. Pentru sarcini care necesită raționament mai profund, Google afirmă că Extended Thinking raționează și vorbește simultan, utilizând indicii verbale timpurii pentru a recunoaște prompturile în mod natural și o narațiune de progres în timp real pentru a ghida utilizatorii prin sarcini de fundal în mai mulți pași pe măsură ce avansează, fără a întrerupe fluxul conversațional.
Videoclipurile demonstrative publicate odată cu anunțul arată Gemini 3.8 Live ghidând o sesiune de integrare a unui angajat în timp real, utilizând context vizual pentru a răspunde la întrebări în direct, jucând șah aproape în timp real, construind planuri de afaceri complete și kituri de marketing personalizate prin vorbire naturală și oferind asistență pas cu pas pentru depanare în Search Live. Demonstrațiile Extended Thinking arată modelul transformând schițe brute și feedback vocal aproape în timp real în componente React funcționale, coordonând rezervări de restaurant în mai mulți pași prin apeluri de funcții asincrone fără a întrerupe conversația și funcționând în Docs Live, Gmail Live și Keep Live în Google Workspace.
API Live și ecosistemul dezvoltatorilor
Google enumeră Agora, Fishjam, LiveKit, Pipecat, Vercel și Vision Agents ca platforme pentru dezvoltatori care utilizează Gemini Live API pentru a permite dezvoltatorilor să creeze și să implementeze interfețe vocale, în timp ce platformele gestionează infrastructura de streaming media în timp real subiacente. Compania afirmă că colaborează, de asemenea, cu Salesforce, Genspark și Lumeris la noile modele, subliniind interesul lor pentru latența, fluiditatea și capacitățile de apelare a instrumentelor ale modelelor.
Documentația oficială a API-ului Live descrie interfața ca permițând interacțiuni vocale și vizuale în timp real, cu latență redusă, cu Gemini, procesând fluxuri continue de audio, imagini și text pentru a furniza răspunsuri vorbite imediate printr-o conexiune WebSocket cu stare. Intrările documentate sunt audio PCM brut de 16 biți la 16 kHz, imagini JPEG cu până la un cadru pe secundă și text, iar ieșirea audio este PCM brut de 16 biți la 24 kHz. Dezvoltatorii pot alege o implementare server‑to‑server, în care un backend redirecționează datele fluxului client către API-ul Live, sau o implementare client‑to‑server, în care codul frontend se conectează direct prin WebSocketuri. Documentația enumeră cazuri de utilizare care acoperă asistenți de cumpărături în retail și agenți de suport, personaje interactive în jocuri, experiențe vocale și video în robotică, ochelari inteligenți și vehicule, însoțitori de sănătate, instrumente de consultanță financiară, mentori educaționali, traducere în timp real și transcriere și subtitrare live.
Google afirmă că tot audio generat de produsele sale AI este marcat cu SynthID, un semn de apă neperceptibil încorporat direct în ieșirea audio, astfel încât conținutul generat de AI să rămână detectabil pentru a ajuta la prevenirea dezinformării. Postarea direcționează cititorii către fișa modelului pentru detalii privind abordarea companiei în materie de siguranță și responsabilitate.
Disponibilitate și lansare
Ambele modele au început să fie lansate pe 15 septembrie. Pentru dezvoltatori, acestea sunt disponibile în Gemini API și Google AI Studio, iar pentru întreprinderi sunt în previzualizare privată în Gemini Enterprise. Gemini 3.8 Live este disponibil pentru toată lumea în Search Live, în timp ce Extended Thinking este disponibil în Gemini Live, în Docs pentru abonații Google AI Pro și Ultra prin Workspace, și în Gmail și Keep pentru toți abonații Google AI. Google spune că Gemini Enterprise pentru suportul Customer Experience pentru ambele modele va fi disponibil în curând și că Extended Thinking va fi disponibil în curând pentru clienții business ai Google Workspace.












