Modele i platformy AI

Google wprowadza modele mowy Gemini 3.8 w API i AI Studio

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Google 23 września 2026 roku wprowadziło Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS, dwa modele zamiany tekstu na mowę, które określiło jako najwyrażniejsze dotychczasowe modele generowania dźwięku. Oba modele zaczęły być udostępniane tego samego dnia w Gemini API i Google AI Studio.

Ogłoszenie, napisane przez Kierownika Produktu Grupowego Leland Rechis i Dyrektora Badań Naukowych Alana Cowena w imieniu zespołu Gemini Audio, pozycjonuje Gemini 3.8 Flash TTS do głębokiego kierowania kreatywnością i projektowania postaci w grach, immersyjnych audiobookach, podcastach i mediach interaktywnych. Gemini 3.8 Flash-Lite TTS jest przeznaczony do zastosowań o dużej objętości i wysokiej efektywności kosztowej, zoptymalizowany pod dubbing, tworzenie treści audio oraz agenty głosowe z precyzyjną kontrolą tonu, tempa i wyrafinowanej niuansu. Ogłoszenie przedstawia parę jako następcę wcześniejszych wydań Gemini Audio: 3.5 Live Translate, 3.5 Transcribe oraz modele Gemini 3.8 Live i 3.8 Live Extended Thinking. Według karty modelu Gemini 3.8 Audio, modele opierają się na Gemini 3 Pro, a warianty TTS przyjmują wejściowy tekst do 8 KB tokenów i zwracają wyjście audio do 64 KB tokenów.

Projektowanie i replikacja głosu

Google twierdzi, że Gemini 3.8 Flash TTS może tworzyć unikalne głosy od podstaw przy użyciu poleceń w języku naturalnym, dostosowując rolę, akcent i cechy głosu w ponad 100 językach i dialektach. Firma podkreśla, że wydanie rozszerza pierwotny zestaw 30 głosów do biblioteki ponad 2 000 gotowych do produkcji głosów o szerokim pokryciu językowym, w tym regionalnych odmian, takich jak hiszpański meksykański, francuski z Quebecu i szkocki angielski. Użytkownicy mogą zapisywać i zarządzać własnymi głosami, aby utrzymać spójność wydajności w trwających projektach, a funkcja przetwarzania głosu, która dostosowuje barwę, wysokość, tempo i akcent w głosach bibliotecznych, jest wymieniona jako wkrótce dostępna.

Replikacja głosu odtwarza spójny profil wokalny na podstawie 30‑sekundowego próbki audio własnego głosu użytkownika lub głosu, do którego użytkownik posiada prawa. Google informuje, że funkcja jest dostarczana z wbudowaną weryfikacją zgody, znakowaniem wodnym SynthID oraz poświadczeniami C2PA.

Kierowanie wykonaniem i zgłoszone benchmarki

Oba modele umożliwiają kierowanie każdą częścią wykonania linia po linii: użytkownicy mogą pisać własne wskazówki sceniczne lub pozwolić Gemini sterować dostawą na podstawie naturalnych wskazówek w scenariuszu. Google twierdzi, że generowanie długich form utrzymuje jakość głosu, tempo i barwę postaci stabilnie przez godziny ciągłego audio przy minimalnym dryfowaniu mówcy, co jest przeznaczone dla podcastów i audiobooków. Natychmiastowe scenariusze z dwoma mówcami kierują wielokrotne wymiany w rozmowie z jednego scenariusza, zachowując oddzielenie dwóch głosów przy naturalnym przejmowaniu kolejki. Zaplanowane wybuchy wokalne i backchanneling dodają niewerbalne sygnały, takie jak <laughs>, <sigh>, i <gasp>, oraz wtrącenia typu „mhm” i „yeah”.

W oceniach Google poinformował, że Gemini 3.8 Flash TTS zajął pierwsze miejsce w ogólnym rankingu Benchmarku Projektowania Głosu Hume AI z wynikiem 71,4 oraz przewodził w modelowaniu akcentów z wynikiem 60,8. Stwierdzono, że Flash TTS i Flash-Lite TTS zajmują pierwsze i drugie miejsce w Indeksie Jakości Ogólnej Hume AI, a nowe modele wykazują znaczące ulepszenia w stosunku do Gemini 3.1 Flash TTS w przypadkach użycia, w tym treści długich form i kontroli scenariusza z dwoma mówcami. W ślepych ocenach preferencji ludzkich na Voice Arena Google podał, że oba modele zajęły czołowe pozycje wśród konkurentów w językach, takich jak japoński, portugalski brazylijski, wietnamski, nowoczesny język arabski, hiszpański meksykański i hindi.

Bezpieczeństwo, ograniczenia i dostępność

W ramach systemu weryfikacji zgody użytkownik musi dostarczyć nagranie werbalnej zgody od właściciela głosu, które odpowiada referencyjnemu mówcy, zanim będzie można stworzyć zreplikowany głos. Każdy klip audio generowany przez modele Gemini Audio zawiera znak wodny SynthID, który Google opisuje jako niewyczuwalny i wbudowany bezpośrednio w wyjściowy dźwięk, aby generowana przez SI mowa pozostawała wykrywalna.

Karta modelu wymienia znane ograniczenia, w tym halucynacje oraz sporadyczne spowolnienia lub problemy z przekroczeniem limitu czasu, a także podaje granicę wiedzy na styczeń 2025. W zakresie bezpieczeństwa granicznego Google DeepMind stwierdził, że jego oceny nie wykazały istotnych nowych możliwości ani materialnych zwiększeń wydajności w modelach Gemini 3.8 Audio w porównaniu z Gemini 3.7 Flash, które w jego ocenach nie osiągnęły żadnych Tracked lub Critical Capability Levels w ramach Frontier Safety Framework. Na tej podstawie stwierdzono, że modele Gemini 3.8 Audio raczej nie osiągną tych poziomów.

Gemini 3.8 Flash TTS jest również dostępny w Gemini Notebook, a Flash-Lite TTS w Google Vids, przy dostępie korporacyjnym przez API w Gemini Enterprise, które jest oznaczone jako wkrótce dostępne. Google AI Studio dodaje plac zabaw audio zbudowany jak przestrzeń projektowania głosu, gdzie programiści mogą od podstaw tworzyć nowe tożsamości wokalne lub replikować głos, a następnie kierować dostawą linia po linii w edytorze scenariusza z dwoma mówcami. Przypis w ogłoszeniu wskazuje, że replikacja głosu przez AI Studio nie jest dostępna w Illinois, Teksasie, Europejskim Obszarze Gospodarczym, Zjednoczonym Królestwie, Szwajcarii i Indiach. Platformy deweloperskie Agora, LiveKit, Pipecat i Vercel wspierają modele poprzez Gemini API, a Google wymienił Figma, HeyGen, Linguana, Wondercraft, 99.co i Ollang jako partnerów integrujących nowe modele TTS do globalnego dubbingu, lokalizacji mediów i konwersacyjnych agentów głosowych.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.