Model dan platform AI
Google Luncurkan Model Suara Gemini 3.8 di API dan AI Studio

Google pada 23 September 2026 memperkenalkan Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS, dua model teks-ke-suara yang digambarkan sebagai model generasi audio paling ekspresif hingga saat ini. Kedua model mulai diluncurkan pada hari yang sama di Gemini API dan Google AI Studio.
Pengumuman, yang ditulis oleh Group Product Manager Leland Rechis dan Director of Research Science Alan Cowen atas nama Tim Audio Gemini, menempatkan Gemini 3.8 Flash TTS untuk pengarahan kreatif mendalam dan desain karakter di seluruh game, buku audio imersif, podcast, dan media interaktif. Gemini 3.8 Flash-Lite TTS dibangun untuk penggunaan volume tinggi yang hemat biaya, dioptimalkan untuk dubbing, pembuatan konten audio, dan agen suara dengan kontrol halus atas nada, kecepatan, dan nuansa ekspresif. Pengumuman tersebut memperkenalkan pasangan ini sebagai kelanjutan dari rilis Audio Gemini sebelumnya: 3.5 Live Translate, 3.5 Transcribe, dan model Gemini 3.8 Live dan 3.8 Live Extended Thinking. Menurut kartu model Gemini 3.8 Audio, model-model tersebut didasarkan pada Gemini 3 Pro, dan varian TTS menerima input teks hingga 8K token serta menghasilkan output audio hingga 64K token.
Desain Suara dan Replikasi
Google menyatakan bahwa Gemini 3.8 Flash TTS dapat membuat suara khusus dari nol melalui prompt bahasa alami, menyesuaikan peran, aksen, dan karakteristik suara di lebih dari 100 bahasa dan dialek. Perusahaan mengatakan bahwa rilis ini memperluas kumpulan awal 30 suara menjadi perpustakaan lebih dari 2.000 suara siap produksi dengan cakupan bahasa yang luas, termasuk variasi regional seperti Spanyol Meksiko, Prancis Quebec, dan Inggris Skotlandia. Pengguna dapat menyimpan dan mengelola suara khusus mereka untuk menjaga konsistensi kinerja di seluruh proyek yang sedang berjalan, dan fitur pencampuran suara yang menyesuaikan timbre, nada, kecepatan, dan aksen pada suara perpustakaan tercantum akan segera hadir.
Replikasi suara menciptakan profil vokal yang konsisten dari sampel audio 30 detik suara pengguna sendiri atau suara yang memiliki hak penggunaan. Google menyatakan bahwa kemampuan ini dilengkapi dengan verifikasi persetujuan bawaan, watermark SynthID, dan kredensial C2PA.
Arahan Performa dan Benchmark yang Dilaporkan
Kedua model memungkinkan arahan baris demi baris untuk setiap penampilan: pengguna dapat menulis arahan panggung mereka sendiri atau membiarkan Gemini mengarahkan penyampaian berdasarkan isyarat skrip alami. Google mengatakan bahwa generasi bentuk panjang mempertahankan kualitas suara, kecepatan, dan timbre karakter secara stabil selama jam-jam audio berkelanjutan dengan drift pembicara yang minimal, ditujukan untuk podcast dan buku audio. Penataan adegan dua pembicara bawaan mengarahkan percakapan berbalik ganda dari satu skrip sambil menjaga kedua suara terpisah dengan pergantian giliran yang alami. Ledakan vokal yang ter-skrip dan backchannel menambahkan isyarat non-verbal seperti <laughs>, <sigh>, dan <gasp>, serta interjeksi seperti “mhm” dan “yeah”.
Dalam evaluasi, Google melaporkan bahwa Gemini 3.8 Flash TTS meraih posisi teratas secara keseluruhan pada Voice Design Benchmark milik Hume AI dengan skor 71.4 dan juga memimpin pemodelan aksen dengan skor 60.8. Google menyatakan bahwa Flash TTS dan Flash‑Lite TTS menempati posisi pertama dan kedua pada Overall Quality Index milik Hume AI, serta model baru tersebut menunjukkan perbaikan signifikan dibandingkan Gemini 3.1 Flash TTS dalam berbagai kasus penggunaan termasuk konten bentuk panjang dan kontrol skenario dua pembicara. Dalam evaluasi preferensi manusia buta di Voice Arena, Google mengatakan kedua model tersebut menempati posisi teratas di antara pesaing dalam bahasa termasuk Jepang, Portugis Brasil, Vietnam, Arab Standar Modern, Spanyol Meksiko, dan Hindi.
Keamanan, Batasan, dan Ketersediaan
Di bawah sistem verifikasi persetujuan, pengguna harus menyediakan rekaman persetujuan verbal dari pemilik suara yang cocok dengan pembicara referensi sebelum suara yang direplikasi dapat dibuat. Setiap klip audio yang dihasilkan oleh model Audio Gemini menyertakan watermark SynthID, yang digambarkan oleh Google sebagai tidak terdeteksi dan tertanam langsung dalam output audio sehingga ucapan yang dihasilkan AI tetap dapat dideteksi.
Kartu model mencantumkan batasan yang diketahui termasuk halusinasi serta kelambatan atau masalah timeout sesekali, dan memberikan batas pengetahuan hingga Januari 2025. Untuk keamanan frontier, Google DeepMind menyatakan bahwa penilaiannya tidak menemukan kemampuan baru yang berarti atau peningkatan kinerja material pada model Audio Gemini 3.8 dibandingkan Gemini 3.7 Flash, yang dalam evaluasinya tidak mencapai Tingkat Kapabilitas Terlacak atau Kritikal menurut Kerangka Keamanan Frontier. Berdasarkan hal tersebut, mereka menyatakan bahwa model Audio Gemini 3.8 tidak kemungkinan akan mencapai tingkat tersebut.
Gemini 3.8 Flash TTS juga tersedia di Gemini Notebook dan Flash‑Lite TTS di Google Vids, dengan akses perusahaan melalui API di Gemini Enterprise yang tercantum akan segera hadir. Google AI Studio menambahkan ruang bermain audio yang dibangun seperti ruang kerja desain suara, di mana pengembang dapat membuat identitas vokal baru dari nol atau mereplikasi suara lalu mengarahkan penyampaian baris demi baris dalam editor skenario dua pembicara. Catatan kaki dalam pengumuman menyebutkan bahwa replikasi suara melalui AI Studio tidak tersedia di Illinois, Texas, Wilayah Ekonomi Eropa, Britania Raya, Swiss, dan India. Platform pengembang Agora, LiveKit, Pipecat, dan Vercel mendukung model-model tersebut melalui Gemini API, dan Google menyebutkan Figma, HeyGen, Linguana, Wondercraft, 99.co, dan Ollang sebagai mitra yang mengintegrasikan model TTS baru untuk dubbing global, lokalisasi media, dan agen suara percakapan.












