Yapay zeka modelleri ve platformları

Google, Gemini 3.8 Konuşma Modellerini API ve AI Studio’da Yayına Aldı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Google, 23 Eylül 2026’da Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS‘i tanıttı, henüz en etkileyici ses üretim modelleri olarak tanımladığı iki metin‑konuşma modeli. Her iki model de aynı gün Gemini API ve Google AI Studio’da kullanıma sunuldu.

Gemini Audio Ekibi adına Grup Ürün Müdürü Leland Rechis ve Araştırma Bilimi Direktörü Alan Cowen tarafından yazılan duyuru, Gemini 3.8 Flash TTS’yi oyun, sürükleyici sesli kitaplar, podcast’ler ve etkileşimli medya boyunca derin yaratıcı yönlendirme ve karakter tasarımı için konumlandırıyor. Gemini 3.8 Flash-Lite TTS, yüksek hacimli, maliyet‑verimli kullanım için inşa edilmiş; dublaj, ses içeriği oluşturma ve ton, tempo ve ifadeli nüanslar üzerinde ayrıntılı kontrol sağlayan ses ajanları için optimize edilmiştir. Duyuru, çifti önceki Gemini Audio sürümleri: 3.5 Live Translate, 3.5 Transcribe ve Gemini 3.8 Live ve 3.8 Live Extended Thinking modelleri olarak sunuyor. Gemini 3.8 Audio model kartına göre, modeller Gemini 3 Pro üzerine inşa edilmiş ve TTS varyantları 8K tokena kadar metin girişi kabul edip 64K tokena kadar ses çıktısı üretir.

Ses Tasarımı ve Çoğaltma

Google, Gemini 3.8 Flash TTS’nin doğal dil istemiyle sıfırdan özel sesler oluşturabildiğini, rol, aksan ve ses özelliklerini 100’den fazla dil ve lehçe arasında özelleştirebildiğini belirtti. Şirket, bu sürümün orijinal 30 seslik setini 2.000’den fazla üretime hazır ses içeren geniş bir kütüphaneye ölçeklediğini, Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi gibi bölgesel çeşitlilikleri kapsadığını söyledi. Kullanıcılar, özel seslerini kaydedip yöneterek devam eden projelerde performansın tutarlı kalmasını sağlayabilir ve kütüphane seslerinde tını, perde, tempo ve aksanı ayarlayan bir ses‑karıştırma özelliğinin yakında geleceği belirtilmiştir.

Ses çoğaltma, kullanıcının kendi sesinden veya kullanma hakkına sahip olduğu bir ses örneğinden 30 saniyelik bir ses örneğiyle tutarlı bir vokal profilini yeniden oluşturur. Google, bu özelliğin yerleşik onay doğrulaması, SynthID filigranı ve C2PA kimlik bilgileriyle birlikte sunulduğunu belirtti.

Performans Yönlendirme ve Bildirilen Kıyaslamalar

Her iki model de performansın satır satır yönlendirilmesine izin verir: kullanıcılar kendi sahne talimatlarını yazabilir veya Gemini’nin doğal senaryo ipuçlarından yönlendirmesini sağlayabilir. Google, uzun biçimli üretimin ses kalitesini, temposunu ve karakter tınısını saatlerce kesintisiz ses boyunca minimal konuşmacı kaymasıyla sabit tuttuğunu, podcast ve sesli kitaplar için hedeflendiğini belirtti. Yerel iki‑konuşmacı sahne düzenlemesi, tek bir senaryodan çoklu dönüşlü konuşmaları yönlendirirken iki sesi doğal dönüşlerle ayrılmış tutar. Senaryolu vokal patlamaları ve geri kanal eklemeleri, <gülüşmeler>, <iç çekiş> ve <nefes alıp verme> gibi sözsüz ipuçları ile “mhm” ve “yeah” gibi ara sözler ekler.

Değerlendirmelerde, Google, Gemini 3.8 Flash TTS’nin Hume AI’nın Ses Tasarımı Kıyaslamasında 71,4 puanla genel birincilik elde ettiğini ve aksan modellemesinde de 60,8 puanla lider olduğunu bildirdi. Flash TTS ve Flash‑Lite TTS’nin Hume AI’nın Genel Kalite Endeksi’nde birinci ve ikinci sırayı aldığını ve yeni modellerin Gemini 3.1 Flash TTS’ye kıyasla uzun biçimli içerik ve çift‑konuşmacı senaryo kontrolü gibi kullanım senaryolarında büyük iyileşmeler gösterdiğini söyledi. Voice Arena’da kör insan tercih değerlendirmelerinde, Google, iki modelin Japonca, Brezilya Portekizcesi, Vietnamca, Modern Standart Arapça, Meksika İspanyolcası ve Hintçe dahil olmak üzere birçok dilde rakipler arasında birinci konumları aldığını belirtti.

Güvenlik, Sınırlamalar ve Kullanılabilirlik

Onay doğrulama sistemi kapsamında, bir kullanıcının çoğaltılmış bir ses oluşturulmadan önce referans konuşmacıyla eşleşen ses sahibinden sözlü onay kaydı sağlaması gerekir. Gemini Audio modellerinin ürettiği her ses klibi, Google’ın algılanamaz ve ses çıktısına doğrudan gömülü olarak AI‑tarafından üretilen konuşmanın tespit edilebilir kalmasını sağlayan bir SynthID filigranı taşıdığını açıklıyor.

Model kartı, halüsinasyonlar ve zaman zaman yavaşlama veya zaman aşımı sorunları gibi bilinen sınırlamaları listeler ve Ocak 2025 tarihli bir bilgi kesim noktası verir. Sınır güvenliği için Google DeepMind, değerlendirmelerinin Gemini 3.8 Audio modellerinde Gemini 3.7 Flash’a kıyasla anlamlı yeni yetenekler veya maddi performans artışı bulmadığını, bu modellerin Sınır Güvenlik Çerçevesi altında Takip Edilen veya Kritik Yetenek Seviyelerine ulaşmadığını belirtti. Bu temelde, Gemini 3.8 Audio modellerinin bu seviyelere ulaşma olasılığının düşük olduğunu söyledi.

Gemini 3.8 Flash TTS, Gemini Notebook’ta ve Google Vids’te Flash‑Lite TTS olarak da mevcuttur; API üzerinden kurumsal erişim Gemini Enterprise içinde yakında geliyor olarak listelenmiştir. Google AI Studio, ses tasarımı çalışma alanı gibi inşa edilmiş bir ses oyun alanı ekleyerek geliştiricilerin sıfırdan yeni vokal kimlikler oluşturmasını veya bir sesi çoğaltmasını ve ardından çift‑konuşmacı senaryo editöründe satır satır yönlendirmesini sağlar. Duyurudaki bir dipnot, AI Studio üzerinden ses çoğaltmanın Illinois, Texas, Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan’da mevcut olmadığını belirtir. Geliştirici platformları Agora, LiveKit, Pipecat ve Vercel, modelleri Gemini API üzerinden destekler ve Google, yeni TTS modellerini küresel dublaj, medya yerelleştirme ve konuşma ses ajanları için entegre eden ortaklar olarak Figma, HeyGen, Linguana, Wondercraft, 99.co ve Ollang’ı adlandırdı.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.