Yapay zeka modelleri ve platformları
Google, Live Avatar Görsel Varlığını Gemini 3.8 Live’a Getiriyor

Google, 24 Eylül 2026 tarihinde Gemini 3.8 Live with Live Avatar özelliğini tanıttı; bu özellik, yerel canlı diyalog modellerinin konuşmasına neredeyse gerçek zamanlı oluşturulan video ekliyor ve Amerika Birleşik Devletleri ile Avrupa Birliği’ndeki uç noktalarla Gemini Enterprise’te genel olarak kullanılabilir hâle getirdi.
Gemini Audio Ekibi adına araştırma bilim insanı Shuo-yiin Chang ve yazılım mühendisi CJ Zheng tarafından hazırlanan duyuru, bu özelliği Gemini’nin sohbet yapay zekası için bir görsel varlık katmanı olarak sunuyor. Google, kesin dudak senkronizasyonu, doğal ifadeler ve akıcı konuşma sırası sayesinde işletmelerin müşteri hizmetleri ve etkileşimli tanıtımlar gibi sanal hizmetlerini genişletebileceğini belirtiyor.
Bu sürüm, Google’ın Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking’in 15 Eylül 2026 lansmanının ardından geliyor; bu canlı diyalog modelleri, sırasıyla ölçeklenebilir, maliyet-etkin sohbet ve yüksek karmaşıklıkta akıl yürütme görevleri için konumlandırıldı ve Gemini API, Google AI Studio, Gemini uygulaması, Google Workspace ve Search Live üzerinden dağıtılmaya başlandı.
Gemini Enterprise’te Genel Kullanıma Açık
Gemini 3.8 Live with Live Avatar, 24 Eylül 2026 itibarıyla Gemini Enterprise’te genel olarak kullanılabilir durumda ve Google Cloud, teknolojinin ilk kez Google Cloud Next 2026’da ön izleme edildiğini belirtti. Yayın, ABD ve AB uç noktaları üzerinden sunuluyor ve tahsis edilmiş aktarım hızı, kurumsal uyumluluk ve sıkı veri yönetişimi içeriyor, bu da Google Cloud’ta Gemini Live için grup ürün yöneticisi Fabien Blanc-paques’in gönderisine göre. Gemini 3.8 Live Extended Thinking hâlâ özel ön izleme aşamasında.
Kurumsal müşteriler modeli Gemini Enterprise konsolunda deneyebilir, Gemini Live API belgeleri aracılığıyla entegre edebilir ve Google Cloud’un fiyatlandırma sayfasında fiyatlandırmayı inceleyebilir. Google Cloud, müşterilerine tahsis edilmiş aktarım hızı, özelleştirilmiş dağıtım mimarileri ve özel avatar izin listesi için satış temsilcileriyle çalışmalarını öneriyor.
Live Avatar Nasıl Çalışır
Google’a göre Live Avatar, görsel ve ses girdilerini aynı anda işleyerek neredeyse gerçek zamanlı olarak ifadeli ses ve video ile yanıt veriyor. Özellik ayrıca eşzamanlı olmayan araç çağrılarını destekliyor; böylece araç çağrılarını başlatıp verileri arka planda alabiliyor ve konuşmayı durdurmuyor. Bir Google gösteriminde avatar, diyalog kesintisiz devam ederken bir otel konukunu kontrol ediyor.
Google, avatarın konuşmalar 97 dil arasında geçiş yaptıkça dudak senkronizasyonunu ve ifadelerini ayarladığını, video kalitesini koruduğunu ve görsel kaymayı önlediğini belirtiyor. Google Cloud gönderisi, sesin yanı sıra kamera akışları ve ekran paylaşımları için canlı görsel anlayış, konuşma bağlamını ve arka uç işlemlerini koruyan kesinti kurtarma, manuel geçişler olmadan otomatik dil algılama ve geçiş, ve web, mobil ve etkileşimli kiosklar üzerinden dağıtım ekliyor. Ayrı bir Google Cloud gösteriminde, bir sigorta talep alma ajanı, müşteri kamerada hasarı gösterirken bir talep defterini dolduruyor; aynı anda Google’ın Agent Development Kit’iyle oluşturulmuş bir ajan ekibi poliçeyi doğruluyor, talep kurallarını uyguluyor ve ayarlayıcı paketini arka planda derliyor.
Avatarlar, Su İşareti ve Model Kartı Sınırlamaları
Kuruluşlar, önceden ayarlanmış avatarların bulunduğu bir kütüphaneden dağıtım yapabilir veya yüksek kaliteli bir referans görselinden özel avatarlar oluşturabilir; Google, sonucun referansın benzerliğini, marka stilini veya karakter kimliğini koruduğunu belirtiyor. Özel avatar oluşturma erişimi, kurumsal izin listesi gerektirir; Google Cloud, kimlik koruması ve kötüye kullanım önlemi olarak izin listesi ve doğrulama sürecini tanımlıyor. Oluşturulan her ses ve video akışı, algılanamayan bir SynthID su işaretiyle gömülür, böylece yapay zekâ tarafından üretilen içerik tespit edilebilir.
Gemini 3.8 Audio model kartı‘na göre, modeller Gemini 3 Pro üzerine inşa edilmiştir. Gemini 3.8 Live, ses, görseller, video ve metni, 128K token’a kadar çıkabilen bir bağlam penceresiyle kabul eder ve Live Avatar ile ses, video ve metni, 24K tokenlık çıktı sınırına tabi olarak üretir. Model kartı, Live Avatar varyantlarının konuşmayla senkronize edilen doğal baş hareketleriyle ifadeli video ürettiğini, yapılandırılmış görseller ve ses girdileriyle yönlendirildiğini ve uzun saatler yerine birkaç dakikalık kesintisiz etkileşimi sürdürebildiğini belirtmektedir.
Model kartı, olası halüsinasyonlar ve zaman zaman yavaşlamalar ya da zaman aşımı gibi bilinen sınırlamaları listeler ve bilgi kesme noktasını Ocak 2025 olarak belirler. Sınır güvenlik değerlendirmesi, Gemini 3.7 Flash ile karşılaştırıldığında anlamlı yeni yetenekler veya maddi performans artışı bulamadığını ortaya koymuş ve bu temelde Google, Gemini 3.8 Audio modellerinin Sınır Güvenlik Çerçevesi altında herhangi bir İzlenen veya Kritik Yetenek Seviyesine ulaşma olasılığının düşük olduğunu değerlendiriyor.
Müşteri Dağıtımları
Google Cloud, bu özellik ile inşa eden birkaç işletmeyi adlandırdı. Cox Automotive, Autotrader için gerçek zamanlı ekran vurgulama ve araç çağrısı kullanan, otomobil alıcılarını araç arama, karşılaştırma ve finansman süreçlerinde yönlendiren yapay zekâ destekli bir alışveriş asistanı geliştirdi.
\”Alışveriş yapanlar giderek daha fazla, filtreler ve menüler aracılığıyla gezinmek yerine ihtiyaçlarını kendi kelimeleriyle tanımlamayı bekliyor. Autotrader’ın yeni konuşma tabanlı AI Avatar’ı, doğal sohbeti doğru envantere eşleştirerek bu deneyimi araç keşfine getiriyor,\” Cox Automotive’in yürütme başkan yardımcısı ve baş ürün sorumlusu Marianne Johnson, Google Cloud duyurusu‘nda söyledi.
Equal AI CEO’su Akhilesh Damaraju, şirketin kişisel AI’sının dokuz Hint dilinde günlük bir milyondan fazla canlı aramayı yönettiğini ve Gemini 3.8 Live’ın kesinti yönetimini, çok dilli sohbetleri ve araç çağrısı güvenilirliğini geliştirdiğini söyledi. Salesforce’un Agentforce ürün başkan yardımcısı Bob Van Osten, Agentforce ve Gemini 3.8 Live’ın Salesforce AI Research ve Google arasındaki bir iş birliğinde bir araya geldiğini, gerçek zamanlı çok modlu yetenekleri ajan AI ile birleştirdiğini belirtti. Specs’te bir yazılım mühendisi olan Eric Walsh, modelin Ses Aktivitesi Algılama güncellemeleri ve gecikme iyileştirmelerinin SPECS platformundaki AI asistanı için ilerleme olduğunu söyledi.












