Modele și platforme AI

Google aduce prezență vizuală Live Avatar la Gemini 3.8 Live

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Google a introdus pe 24 septembrie 2026 Gemini 3.8 Live with Live Avatar, o caracteristică care adaugă video generat aproape în timp real la vorbirea modelelor sale native de dialog live și a făcut-o disponibilă în mod general în Gemini Enterprise cu puncte finale în Statele Unite și Uniunea Europeană.

Anunțul, redactat de cercetătorul Shuo-yiin Chang și inginerul software CJ Zheng în numele echipei Gemini Audio, prezintă caracteristica ca un strat de prezență vizuală pentru AI‑ul conversațional al Gemini. Google afirmă că sincronizarea precisă a buzelor, expresiile naturale și alternarea fluidă a vorbirii permit întreprinderilor să extindă ofertele virtuale, cum ar fi serviciul clienți și prezentările interactive.

Lansarea urmează 15 septembrie 2026 lansarea Gemini 3.8 Live și Gemini 3.8 Live Extended Thinking, modele de dialog live pe care Google le-a poziționat pentru conversații scalabile și rentabile, respectiv pentru sarcini de raționament de înaltă complexitate, care au început să fie distribuite prin Gemini API, Google AI Studio, aplicația Gemini, Google Workspace și Search Live.

Disponibilitate generală în Gemini Enterprise

Gemini 3.8 Live with Live Avatar este disponibil în mod general în Gemini Enterprise începând cu 24 septembrie 2026, iar Google Cloud a declarat că tehnologia a fost prezentată pentru prima dată la Google Cloud Next 2026. Lansarea este oferită prin puncte finale în Statele Unite și UE și include lățime de bandă provisionată, conformitate enterprise și guvernanță strictă a datelor, conform postării Google Cloud de către Fabien Blanc‑paques, manager de produs de grup pentru Gemini Live. Gemini 3.8 Live Extended Thinking rămâne în previzualizare privată.

Clienții enterprise pot testa modelul în consola Gemini Enterprise, îl pot integra prin documentația API Gemini Live și pot revizui prețurile pe pagina de prețuri a Google Cloud. Google Cloud recomandă clienților să colaboreze cu reprezentanții săi de vânzări pentru lățime de bandă provisionată, arhitecturi de implementare personalizate și includerea în lista de permisiuni pentru avataruri personalizate.

Cum funcționează Live Avatar

Live Avatar procesează simultan intrări vizuale și audio și răspunde cu audio și video expresiv în aproape timp real, potrivit Google. Funcționalitatea suportă, de asemenea, apeluri asincrone de instrumente, astfel încât poate iniția apeluri de instrumente și poate recupera date în fundal fără a întrerupe conversația. O demonstrație Google arată avatarul verificând un oaspete de hotel în timp ce dialogul continuă fără întrerupere.

Google afirmă că avatarul își ajustează sincronizarea buzelor și expresiile pe măsură ce conversațiile trec prin 97 de limbi, menținând fidelitatea video și evitând derapajul vizual. Postarea Google Cloud adaugă înțelegere vizuală în timp real a fluxurilor de cameră și a partajărilor de ecran alături de audio, recuperarea de întreruperi care păstrează contextul conversației și tranzacțiile de backend, detectarea automată a limbii și tranziția fără comutări manuale, și implementarea pe web, mobil și chioșcuri interactive. O demonstrație separată a Google Cloud arată un agent de preluare a cererilor de despăgubire completând un caiet de cerere în timp ce un client arată daunele pe cameră, în timp ce o echipă de agenți construită cu Agent Development Kit de la Google verifică polița, aplică regulile de preluare și asamblează pachetul de ajustor în fundal.

Avatare, marcaj de apă și limitări ale fișei de model

Organizațiile pot implementa dintr-o bibliotecă de avatare presetate sau pot genera avatare personalizate dintr-o imagine de referință de înaltă calitate, iar Google afirmă că rezultatul păstrează asemănarea, stilul de marcă sau identitatea personajului din referință. Accesul la crearea de avatare personalizate necesită includere în lista de permisiuni enterprise; Google Cloud descrie procesul de includere și verificare ca o măsură de protecție a identității și împotriva utilizării abuzive. Fiecare flux audio și video generat este încorporat cu un marcaj de apă SynthID imperceptibil, menținând detectabilitatea conținutului generat de IA.

Potrivit Gemini 3.8 Cartă de model audio, modelele se bazează pe Gemini 3 Pro. Gemini 3.8 Live acceptă audio, imagini, video și text cu o fereastră de context de până la 128K token, și cu Live Avatar produce audio, video și text sub o limită de 24K-token de ieșire. Cardul de model afirmă că variantele Live Avatar produc video expresiv de mișcări naturale ale capului sincronizate cu vorbirea, controlat de imagini și intrări audio configurate, și că acestea susțin câteva minute de interacțiune continuă în loc de ore extinse.

Fișa de model enumeră limitările cunoscute, inclusiv posibile halucinații și încetiniri sau timeout‑uri ocazionale, și stabilește data limită a cunoștințelor la ianuarie 2025. Evaluarea de siguranță frontieră nu a identificat capabilități noi semnificative sau îmbunătățiri materiale de performanță în raport cu Gemini 3.7 Flash, iar pe baza acestui fapt Google consideră că modelele Gemini 3.8 Audio sunt puțin probabil să atingă niveluri de Capacitate urmărite sau critice în cadrul Cadrelor sale de Siguranță Frontieră.

Implementări ale clienților

Google Cloud a enumerat mai multe întreprinderi care construiesc cu această funcționalitate. Cox Automotive a dezvoltat un asistent de cumpărături alimentat de IA pentru Autotrader, care folosește evidențiere în timp real a ecranului și apeluri de instrumente pentru a ghida cumpărătorii de mașini prin căutarea vehiculului, comparare și finanțare în timp real.

„Cumpărătorii așteaptă din ce în ce mai mult să descrie ce au nevoie în propriile cuvinte, în loc să navigheze prin filtre și meniuri. Avatarul AI conversațional nou al Autotrader aduce această experiență în descoperirea vehiculelor prin potrivirea conversației naturale cu inventarul potrivit,” a declarat Marianne Johnson, vicepreședinte executiv și director de produs la Cox Automotive, în anunțul Google Cloud.

Directorul executiv al Equal AI, Akhilesh Damaraju, a declarat că AI-ul personal al companiei gestionează peste un milion de apeluri în direct zilnic în nouă limbi indiene și a spus că Gemini 3.8 Live a îmbunătățit gestionarea întreruperilor, conversațiile multilingve și fiabilitatea apelurilor de instrument. Bob Van Osten, vicepreședinte de produs pentru Agentforce la Salesforce, a afirmat că Agentforce și Gemini 3.8 Live se reunesc într-o colaborare între Salesforce AI Research și Google, care combină capabilități multimodale în timp real cu AI agentic. Eric Walsh, inginer software la Specs, a declarat că actualizările de Detectare a Activității Vocale și îmbunătățirile de latență ale modelului reprezintă pași înainte pentru asistentul AI pe platforma SPECS.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.