Modele și platforme AI

Google lansează modelele de vorbire Gemini 3.8 în API și AI Studio

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Google, pe 23 septembrie 2026, a introdus Gemini 3.8 Flash TTS și Gemini 3.8 Flash-Lite TTS, două modele de text‑to‑speech pe care le-a descris ca fiind cele mai expresive modele de generare audio de până acum. Ambele modele au început să fie lansate în aceeași zi în Gemini API și Google AI Studio.

Anunțul, redactat de Manager de produs de grup Leland Rechis și Director de cercetare științifică Alan Cowen în numele echipei Gemini Audio, poziționează Gemini 3.8 Flash TTS pentru direcție creativă profundă și design de personaje în jocuri, audiobooks imersive, podcasturi și media interactivă. Gemini 3.8 Flash-Lite TTS este conceput pentru utilizare de volum mare, eficientă din punct de vedere al costurilor, optimizat pentru dublaj, creare de conținut audio și agenți vocali cu control detaliat asupra tonului, ritmului și nuanțelor expresive. Anunțul prezintă perechea ca succesor al lansărilor anterioare Gemini Audio: 3.5 Live Translate, 3.5 Transcribe și modelele Gemini 3.8 Live și 3.8 Live Extended Thinking. Conform fișei de model Gemini 3.8 Audio, modelele se bazează pe Gemini 3 Pro, iar variantele TTS acceptă intrări text de până la 8K de tokeni și returnează ieșiri audio de până la 64K de tokeni.

Proiectare vocală și replicare

Google a declarat că Gemini 3.8 Flash TTS poate crea voci personalizate de la zero prin solicitări în limbaj natural, personalizând rolul, accentul și caracteristicile vocale în peste 100 de limbi și dialecte. Compania a afirmat că lansarea extinde setul inițial de 30 de voci la o bibliotecă de peste 2.000 de voci pregătite pentru producție, cu o acoperire lingvistică largă, inclusiv variante regionale precum spaniola mexicană, franceza din Quebec și engleza scoțiană. Utilizatorii pot salva și gestiona vocile personalizate pentru a menține performanța constantă pe parcursul proiectelor în desfășurare, iar o funcție de remixare vocală care ajustează timbrul, înălțimea, ritmul și accentul pe vocile din bibliotecă este listată ca urmează să fie lansată.

Replicarea vocală recreează un profil vocal consistent dintr-un eșantion audio de 30 de secunde al vocii utilizatorului sau al unei voci pentru care utilizatorul deține drepturi de utilizare. Google a declarat că funcționalitatea este livrată cu verificare încorporată a consimțământului, marcaj de apă SynthID și acreditări C2PA.

Direcționarea performanței și benchmark-urile raportate

Ambele modele permit direcționarea linie cu linie a fiecărei interpretări: utilizatorii pot scrie propriile indicații scenice sau pot lăsa Gemini să ghideze livrarea din indicii naturale ale scenariului. Google a declarat că generarea pe termen lung menține calitatea vocii, ritmul și timbrul personajului constante pe parcursul orelor de audio continuu, cu o deriva minimă a vorbitorului, vizând podcasturi și audiobooks. Scenarea nativă cu două voci direcționează conversații multi-tur dintr-un singur scenariu, menținând cele două voci separate prin luarea naturală a cuvintelor. Explozii vocale scriptate și backchanneling adaugă indicii non-verbale precum <râsete>, <suspine> și <sufluri>, plus interjecții ca „mhm” și „yeah”.

În evaluări, Google a raportat că Gemini 3.8 Flash TTS a ocupat prima poziție generală în Voice Design Benchmark de la Hume AI, cu un scor de 71,4, și a condus și la modelarea accentului cu 60,8. A declarat că Flash TTS și Flash-Lite TTS dețin prima și a doua poziție în Overall Quality Index de la Hume AI, și că noile modele prezintă îmbunătățiri majore față de Gemini 3.1 Flash TTS în cazuri de utilizare, inclusiv conținut pe termen lung și control de scenariu cu dublu vorbitor. În evaluări blind de preferință umană pe Voice Arena, Google a spus că cele două modele au ocupat poziții de top printre concurenți în limbi precum japoneză, portugheză braziliană, vietnameză, arabă standard modernă, spaniola mexicană și hindi.

Siguranță, limitări și disponibilitate

În cadrul sistemului de verificare a consimțământului, utilizatorul trebuie să furnizeze o înregistrare verbală de consimțământ de la proprietarul vocii care să corespundă vorbitorului de referință înainte ca o voce replicată să poată fi creată. Fiecare fragment audio generat de modelele Gemini Audio conține un marcaj de apă SynthID, pe care Google îl descrie ca fiind imperceptibil și încorporat direct în ieșirea audio, astfel încât vorbirea generată de AI să rămână detectabilă.

Fișa de model enumeră limitările cunoscute, inclusiv halucinații și ocazionale încetiniri sau probleme de timeout, și oferă un prag de cunoaștere până în ianuarie 2025. Pentru siguranța frontieră, Google DeepMind a declarat că evaluările sale nu au identificat noi capacități semnificative sau creșteri materiale ale performanței în modelele Gemini 3.8 Audio comparativ cu Gemini 3.7 Flash, ale căror evaluări nu au atins niciun Nivel de Capacitate urmărit sau critic în cadrul Frontier Safety Framework. Pe baza acestor constatări, a afirmat că modelele Gemini 3.8 Audio nu sunt susceptibile să atingă acele niveluri.

Gemini 3.8 Flash TTS este disponibil și în Gemini Notebook, iar Flash-Lite TTS în Google Vids, cu acces enterprise prin API în Gemini Enterprise listat ca urmare. Google AI Studio adaugă un spațiu de joacă audio construit ca un spațiu de lucru pentru design vocal, unde dezvoltatorii pot solicita noi identități vocale de la zero sau pot replica o voce și apoi pot direcționa livrarea linie cu linie într-un editor de scenariu cu dublu vorbitor. O notă de subsol în anunț precizează că replicarea vocală prin AI Studio nu este disponibilă în Illinois, Texas, Spațiul Economic European, Regatul Unit, Elveția și India. Platformele pentru dezvoltatori Agora, LiveKit, Pipecat și Vercel susțin modelele prin Gemini API, iar Google a numit Figma, HeyGen, Linguana, Wondercraft, 99.co și Ollang ca parteneri care integrează noile modele TTS pentru dublaj global, localizare media și agenți vocali conversaționali.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.