AI-mallit ja alustat
Google julkaisee Gemini 3.8 -puhemallit API:ssa ja AI Studiossa

Google esitteli 23. syyskuuta 2026 Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, kaksi tekstistä puheeksi -mallia, joita se kuvailee tähän mennessä ilmaisemmaisina äänenluontimalleina. Molemmat mallit alkoivat levitä samana päivänä Gemini API:ssa ja Google AI Studiossa.
Ilmoituksen, jonka on kirjoittanut ryhmän tuotejohtaja Leland Rechis ja tutkimustieteen johtaja Alan Cowen Gemini Audio -tiimin puolesta, asettaa Gemini 3.8 Flash TTS:n syvälliseen luovaan ohjaukseen ja hahmosuunnitteluun pelien, immersiivisten äänikirjojen, podcastien ja interaktiivisen median parissa. Gemini 3.8 Flash-Lite TTS on rakennettu suurta volyymia ja kustannustehokkuutta varten, optimoitu dubbaukseen, ääni sisällön luomiseen ja ääniavustajiin, joissa on hienojakoinen hallinta sävyyn, tempoon ja ilmaisulliseen vivahteeseen. Ilmoitus esittelee parin jatkavana aiempien Gemini Audio -julkaisujen: 3.5 Live Translate, 3.5 Transcribe ja Gemini 3.8 Live and 3.8 Live Extended Thinking mallien jälkeen. Gemini 3.8 Audio mallikortti mukaan mallit perustuvat Gemini 3 Pro:hon, ja TTS-versiot hyväksyvät tekstisyötteen enintään 8 000 tokenia ja palauttavat ääniulostulon enintään 64 000 tokenia.
Äänisuunnittelu ja replikaatio
Google kertoi, että Gemini 3.8 Flash TTS pystyy luomaan räätälöityjä ääniä alusta alkaen luonnollisen kielen kehotteiden avulla, mukauttaen roolia, aksenttia ja äänen ominaisuuksia yli 100 kielellä ja murteella. Yritys ilmoitti, että julkaisu laajentaa alkuperäisen 30 äänen sarjan yli 2 000 tuotantovalmiiseen ääneen kattavalla kielivalikoimalla, mukaan lukien alueelliset variantit, kuten meksikolainen espanja, Quebecin ranska ja skottilainen englanti. Käyttäjät voivat tallentaa ja hallita omia räätälöityjä ääniään pitääksensä suorituskyvyn johdonmukaisena käynnissä olevissa projekteissa, ja äänen remixausominaisuus, joka säätää kirjaston äänien värisävettä, sävelkorkeutta, tempoa ja aksenttia, on listattu tulossa pian.
Äänireplikaatio luo johdonmukaisen ääniprofiilin 30 sekunnin ääninäytteestä käyttäjän omasta äänestä tai äänestä, jonka käyttöön käyttäjällä on oikeudet. Google kertoi, että ominaisuus toimitetaan sisäänrakennetulla suostumuksen vahvistuksella, SynthID-vesileimalla ja C2PA-sertifikaateilla.
Suorituksen ohjaus ja raportoituja mittausarvoja
Molemmat mallit mahdollistavat jokaisen suorituksen linja‑kohtaisen ohjauksen: käyttäjät voivat kirjoittaa omat näyttöohjeensa tai antaa Geminin ohjata esitystä luonnollisten käsikirjoituksen vihjeiden perusteella. Google kertoi, että pitkämuotoinen generointi säilyttää äänen laadun, tempon ja hahmon värisävyn tasaisena useiden tuntien jatkuvan äänen aikana minimaalisella puhujan poikkeamalla, ja se on suunnattu podcasteihin ja äänikirjoihin. Alkuperäinen kaksipuheinen kohtausasetelma ohjaa monivaiheisia keskusteluja yhdestä käsikirjoituksesta pitäen kaksi ääntä erillään luonnollisella vuorovaikutuksella. Käsikirjoitetut äänipurskeet ja takakanavat lisäävät ei‑verbaalisia vihjeitä, kuten <laughs>, <sigh> ja <gasp>, sekä interjektioita kuten “mhm” ja “yeah”.
Arvioinneissa Google raportoi, että Gemini 3.8 Flash TTS saavutti ensimmäisen sijan Hume AI:n Voice Design -vertailussa 71,4 pisteellä ja johti myös aksenttimallinnuksessa 60,8 pisteellä. Se kertoi, että Flash TTS ja Flash-Lite TTS pitävät ensimmäistä ja toista sijaa Hume AI:n Kokonaistason laatuindeksissä, ja että uudet mallit osoittavat merkittäviä parannuksia Gemini 3.1 Flash TTS:ään verrattuna eri käyttötapauksissa, mukaan lukien pitkämuotoinen sisältö ja kaksipuheinen käsikirjoituksen ohjaus. Sokeissa ihmisten mieltymysarvioinneissa Voice Arenalla Google sanoi, että molemmat mallit saavuttivat ylimmän sijan kilpailijoiden joukossa kielissä, kuten japani, brasilian portugali, vietnam, nykystandardiarabia, meksikolainen espanja ja hindi.
Turvallisuus, rajoitukset ja saatavuus
Suostumuksen vahvistusjärjestelmän alla käyttäjän on annettava äänen omistajan suullinen suostumusäänite, joka vastaa viittauspuhujaa, ennen kuin replikoitu ääni voidaan luoda. Jokainen äänileike, jonka Gemini Audio -mallit tuottavat, sisältää SynthID-vesileiman, jonka Google kuvaa havaitsemattomaksi ja suoraan ääniulostukseen upotetuksi, jotta AI:n tuottama puhe pysyy tunnistettavana.
Mallikortti luettelee tunnetut rajoitukset, kuten harhakuvitelmat ja satunnaiset hidastumiset tai aikakatkaisuongelmat, ja se antaa tiedon leikkauspisteen tammikuussa 2025. Frontier‑turvallisuuden osalta Google DeepMind kertoi, että sen arvioinnit eivät löytäneet merkittäviä uusia kykyjä tai merkittäviä suorituskyvyn parannuksia Gemini 3.8 Audio -malleissa verrattuna Gemini 3.7 Flashiin, jonka arvioinnit osoittivat etteivät ne saavuttaneet mitään seurattuja tai kriittisiä kyvykkyystasoja Frontier‑turvallisuuskehyksessä. Tämän perusteella se totesi, että Gemini 3.8 Audio -mallit eivät todennäköisesti saavuta näitä tasoja.
Gemini 3.8 Flash TTS on myös saatavilla Gemini Notebookissa ja Flash-Lite TTS Google Vidsissä, ja yritystason pääsy API:n kautta Gemini Enterprise on listattu tulossa pian. Google AI Studio lisää ääni‑leikkikentän, joka on rakennettu kuin äänisuunnittelun työtila, jossa kehittäjät voivat kehottaa uusia äänihahmoja alusta alkaen tai replikoida äänen ja sitten ohjata linja‑kohtaisesti toimitusta kaksipuheisessa käsikirjoitusmuokkaimessa. Ilmoituksen alaviitteessä todetaan, että äänireplikaatio AI Studion kautta ei ole saatavilla Illinoisissa, Texasissa, Euroopan talousalueella, Yhdistyneessä kuningaskunnassa, Sveitsissä ja Intiassa. Kehittäjäalustat Agora, LiveKit, Pipecat ja Vercel tukevat malleja Gemini API:n kautta, ja Google mainitsi Figma, HeyGen, Linguana, Wondercraft, 99.co ja Ollang kumppaneina, jotka integroitavat uudet TTS-mallit globaaliin dubbaukseen, median lokalisointiin ja keskusteluun perustuvien ääniavustajien osalta.












