Yapay zeka modelleri ve platformları
Google, Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking Ses Modellerini Başlattı

Google duyurdu Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking 15 Eylül 2026’da, Gemini API, Google AI Studio, Gemini Enterprise, Search Live, Gemini Live ve Google Workspace üzerinde yayımlanan iki canlı diyalog modeli.
Modeller, Tom Ouyang (baş mühendis) ve Malini Jaganathan (teknik personel üyesi) tarafından Gemini Audio Team adına tanıtıldı. Google, bu ikiliyi şu ana kadarki en gelişmiş canlı diyalog modelleri olarak tanımlıyor, doğal konuşma için tasarlandığını ve zekâ ve paralel akıl yürütmedeki kazanımların sesle yürütülen karmaşık görevlerde daha sezgisel iş birliği sağladığını belirtiyor. Şirket, Gemini 3.8 Live’ı ölçek ve maliyet verimliliği için konumlandırıyor; konuşma zekâsını akıcı diyalog ve görsel yerleştirme ile birleştirirken, Gemini 3.8 Live Extended Thinking yüksek karmaşıklıkta, artan zekâ ve çok adımlı akıl yürütme gerektiren görevler için inşa edildi. Google’a göre, modeller geliştiricilere ve işletmelere güvenilir, üretime hazır ses ajanları oluşturmak için temel blokları sağlarken, Gemini uygulaması, Workspace ve Search içinde Gemini ile yapılan sohbetleri daha akıcı hâle getiriyor.
Raporlanan Kıyaslama Sonuçları
Google, Gemini 3.8 Live Extended Thinking’in Artificial Analysis’ın Speech to Speech Quality Index’inde 82.6 puanla genel olarak birincilik konumunu yakaladığını ve τ-Voice üzerindeki %68.6 ve Sierra’nın τ-Voice-banking benchmark’inde %35.1 ile ajan görev tamamlama konusunda lider olduğunu rapor ediyor. Şirket ayrıca Big Bench Audio’da %97.7 puan aldığını ve Extended Thinking’in diğer öncü modellerle karşılaştırıldığında son derece rekabetçi bir fiyat noktasını koruduğunu belirtiyor. Google, Gemini 3.8 Live’ın Artificial Analysis’ın Speech Agent Arena’sında ikinci sırada yer aldığını, kullanıcılar arasında yüksek tercih edildiğini ve onu çok maliyet‑etkin ve ölçek için tasarlanmış olarak tanımlıyor. ServiceNow’nun ses ajanlarını değerlendiren EVA-Bench benchmark’ında, Google modellerinin karmaşık iş akışları için doğruluk ile konuşma kalitesini başarılı bir şekilde dengeleyerek Pareto Frontier’ı iterek ilerlediğini söylüyor; gönderi, bu değerlendirmenin Live API üzerinden Gemini Enterprise Agent Platformu’nda yürütüldüğünü belirtiyor.
Gerçek Zamanlı Konuşma Yetileri
Google’a göre, Gemini 3.8 Live görsel girdileri neredeyse gerçek zamanlı olarak işleyerek, şirketin daha faydalı yanıtlar ürettiğini belirttiği bağlamı ekliyor. Model, konuşma sırasında otomatik olarak 97 desteklenen dil arasında algılayıp geçiş yapıyor ve konuşma devam ederken arka planda araçları ve API çağrılarını yürütüyor; istekleri onaylıyor ve görevler tamamlanırken diyaloğu sürdürüyor. Daha derin akıl yürütme gerektiren görevler için Google, Extended Thinking’in aynı anda akıl yürütüp konuştuğunu, erken sözlü ipuçlarıyla istemleri doğal olarak onayladığını ve canlı ilerleme anlatımıyla kullanıcıları çok adımlı arka plan görevleri boyunca yönlendirdiğini, konuşma akışını bozmadan belirtiyor.
İlanla birlikte yayınlanan gösterim videoları, Gemini 3.8 Live’ın görsel bağlamı kullanarak gerçek zamanlı olarak çalışan bir çalışan oryantasyon oturumunu yönlendirdiğini, neredeyse gerçek zamanlı satranç oynadığını, doğal konuşma ile eksiksiz iş planları ve özelleştirilmiş pazarlama araç setleri oluşturduğunu ve Search Live içinde adım adım sorun giderme desteği sağladığını gösteriyor. Extended Thinking gösterimleri, modelin ham taslakları ve neredeyse gerçek zamanlı ses geri bildirimlerini işlevsel React bileşenlerine dönüştürdüğünü, asenkron fonksiyon çağrılarıyla çok adımlı restoran rezervasyonlarını konuşmayı kesmeden koordine ettiğini ve Google Workspace içinde Docs Live, Gmail Live ve Keep Live’da çalıştığını gösteriyor.
Live API ve Geliştirici Ekosistemi
Google, geliştiricilerin ses odaklı arayüzler oluşturup dağıtmalarını sağlayan ve platformların temel gerçek zamanlı medya akışı altyapısını yönettiği Gemini Live API‘yi kullanan geliştirici platformları olarak Agora, Fishjam, LiveKit, Pipecat, Vercel ve Vision Agents’ı listeliyor. Şirket ayrıca yeni modeller üzerinde Salesforce, Genspark ve Lumeris ile ortaklık kurduğunu, modellerin gecikme süresi, akıcılık ve araç çağırma yeteneklerine olan ilgilerine işaret ettiğini belirtiyor.
Resmi Live API belgeleri, arayüzün Gemini ile düşük gecikmeli, gerçek zamanlı ses ve görsel etkileşimleri mümkün kıldığını, ses, görüntü ve metin akışlarını sürekli işleyerek durumlu bir WebSocket bağlantısı üzerinden anlık konuşma yanıtları sağladığını açıklıyor. Belgelenen girişler, 16 kHz’de 16‑bit PCM ham ses, saniyede bir kareye kadar JPEG görüntüler ve metin; ses çıkışı ise 24 kHz’de 16‑bit PCM ham ses olarak tanımlanıyor. Geliştiriciler, istemci akış verilerini Live API’ye yönlendiren bir arka uç sunucu‑sunucu uygulamasını ya da ön uç kodun doğrudan WebSocket üzerinden bağlandığı istemci‑sunucu uygulamasını seçebilir. Belgeler, perakende alışveriş asistanları ve destek ajanları, etkileşimli oyun karakterleri, robotikte ses ve video destekli deneyimler, akıllı gözlükler ve araçlar, sağlık asistanları, finansal danışmanlık araçları, eğitim mentorları, gerçek zamanlı çeviri ve canlı transkripsiyon ve altyazı gibi kullanım senaryolarını listeliyor.
Google, AI ürünleri tarafından üretilen tüm sesin SynthID adlı, ses çıktısına doğrudan işlenen ve algılanamayan bir filigranla işaretlendiğini, böylece AI tarafından oluşturulan içeriğin tespit edilebilir kalmasını ve yanlış bilginin önlenmesine yardımcı olunduğunu belirtiyor. Gönderi, okuyucuları şirketin güvenlik ve sorumluluk yaklaşımına ilişkin ayrıntılar için model kartına yönlendiriyor.
Kullanılabilirlik ve Yayılım
Her iki model de 15 Eylül’de dağıtıma başladı. Geliştiriciler için Gemini API ve Google AI Studio’da, işletmeler için ise Gemini Enterprise’te özel önizlemede mevcuttur. Gemini 3.8 Live, Search Live’da herkesin kullanımına açıktır, Extended Thinking ise Gemini Live’da, Workspace üzerinden Google AI Pro ve Ultra aboneleri için Docs’ta ve tüm Google AI aboneleri için Gmail ve Keep’te kullanılabilir. Google, her iki model için Müşteri Deneyimi desteği sağlayan Gemini Enterprise’ın yakında geleceğini ve Extended Thinking’in Google Workspace iş müşterilerine yakında sunulacağını belirtiyor.












