Yapay zeka modelleri ve platformları
OpenAI’nin GPT-Live-1 API’de Dakikada $0.05 Ücretle Kullanıma Sunuluyor

OpenAI GPT-Live-1’i API’de başlattı 10 Eylül 2026’da, tam çift yönlü ses modelini geliştiriciler için ön uç ses katmanı başına dakikada $0.05 ücretle sunuyor. Bu sürüm, ChatGPT Voice’un arkasındaki konuşma sistemini üçüncü taraf uygulamalara ve iş akışlarına genişletiyor.
GPT-Live-1 aynı anda dinleyip konuşabilir ve OpenAI, bunun daha derin akıl yürütme ve eylemleri, Codex ve ChatGPT Work ile gösterildiği gibi eşleştirildiği model ve araçlara devrettiğini belirtti. API sürümü için şirket, geliştiricilerin kullanıcıları, iş akışları ve hedefleri etrafında ses deneyimlerini yönlendirmelerine ve özelleştirmelerine olanak tanıyan yeteneklere odaklandığını söyledi.
Dinleme ve Konuşma İçin Tek Bir Model
Geleneksel ses ajanları, konuşmadan metne, bir akıl yürütme modeline ve metinden sese dönüşümü zincirleme olarak bağlar ve her aktarım gecikme ekler, zamanlamayı, bağlamı veya bir konuşmanın doğal ritmini kaybetme olasılığını artırır. GPT-Live-1, dinleme ve konuşmayı tek bir modelde ele alır; gelen ve giden sesleri birlikte akıl yürütür, kesintilere ve onaylara anında yanıt verirken daha derin akıl yürütmeyi arka uçta devreder, böylece arka planda işler yürürken konuşma devam edebilir.
Geliştiriciler, konuşmanın arkasındaki model, araç ve ajan çerçevesini seçer. OpenAI, GPT-Live-1’i yüksek hacimli görevler için Luna gibi bir modelle (örneğin planlama veya sipariş güncellemeleri) ve akıl yürütme gerektiren karmaşık müşteri sorunları için Astra gibi bir modelle eşleştirmenin örneğini veriyor; arka uç ayrıca üçüncü taraf bir model de olabilir. Geliştiriciler, sistem istemi aracılığıyla bir ajanın tonunu, temposunu ve konuşma stilini şekillendirebilir.
OpenAI, API sürümü için ek güçlü yönleri şu şekilde listeliyor: her adımı yüksek sesle anlatmadan sessiz bağlam yönetimi ve arka plan gürültüsü işleme, uzun oturumlar boyunca bağlam koruma ve restoran rezervasyonlarından müşteri desteğine kadar aramalarda tam çift yönlü telefon ajanları için telefon desteği. GPT-Live-1 yerel olarak ASR transkriptleri ve yanıt metni sağlar, anahtar kelime önyargısını ve alfanümerik anlayışı destekler ve dönüş‑tabanlı bir model olmamasına rağmen, yerel olarak dönüş algılamayı destekler; böylece geliştiriciler açık dönüş sınırları etrafında geliştirmeye devam edebilir. Duyuruyla birlikte yayınlanan bir kod örneği, bir uygulamanın konuşma bağlamını Codex’e gönderip Codex’in yanıtını bir oturum sırasında GPT-Live-1’e döndürdüğünü gösteriyor.
Raporlanan Değerlendirme Sonuçları
OpenAI, GPT-Live-1’in Full Duplex Bench performansını GPT-Realtime-2.1’e göre 30 yüzde puan artırdığını, dönüş latensiyesinde ve etkileşimli davranışta büyük kazançlar sağladığını ve orta seviyede akıl yürütme çabasıyla GPT-6 Astra ile eşleştirildiğinde uç‑uç görevlerde ses‑ajanı zekasını ölçen bir ölçüt olan Tau3’te birinci sırada yer aldığını rapor ediyor.
Tau3 (Ses) Zekâsı’nda, havayolu, perakende ve telekom alanlarındaki konuşmalı müşteri hizmeti görevlerini değerlendiren bu ölçekte, OpenAI’nin rapor ettiği Pass@1 görev‑başarı puanları GPT-Live-1 için %86.2, GPT-Realtime-2.1 için %45.7 ve GPT-Realtime-2 için %42.4’tür. Tau Banking (Ses) Bilgisi’nde, 97 banka‑bilgisi görevinin başarıyla tamamlanma oranı olarak ölçülen değerler sırasıyla %32.0, %12.4 ve %10.3’tür.
Şirket ayrıca, duraklama yönetimi, konuşma dönüşleri, kesintiler ve geri kanalların değerlendirildiği bir testte GPT-Live-1 için %97.3, GPT-Realtime-2.1 için %95.7 ve GPT-Realtime-2 için %95.3 ortalama Artificial Analysis Conversational Dynamics puanı rapor etti. Full Duplex Bench v1.5 Interactivity testinde, arka plan konuşmasına, başka bir kişiye konuşmaya, dinleyici geri kanallarına ve kesintilere verilen tepkiler ölçülür; rapor edilen puanlar %80.10, %45.4 ve %47.8’dir. Full Duplex Bench v1’de dönüş‑alım gecikmesi, kullanıcının bir dönüşü bitirdikten sonra ajanın yanıtına ne kadar hızlı başladığını ölçer; bu değer sırasıyla 0.798 saniye, 1.41 saniye ve 1.63 saniyedir. Full Duplex Bench v3’te, düşük akıl yürütme çabasıyla Terra arka ucu kullanılarak, OpenAI araç‑çağrısı Pass@1 için %87.0, %60.0 ve %58.0 ve yanıt kalitesi için %90.0, %88.0 ve %81.0 rapor etti.
ChatGPT Voice’dan API’ye
OpenAI GPT-Live’ı tanıttı 8 Temmuz 2026’da, ChatGPT Voice’ı güçlendiren yeni nesil tam çift yönlü ses modelleri olarak, o gün GPT-Live-1 ve GPT-Live-1 mini’yi dünya çapında ChatGPT kullanıcılarına sundu ve modelleri API’ye getirmeyi planladığını belirtti. OpenAI, GPT-Live-1’in Go, Plus ve Pro kullanıcıları için ChatGPT Voice’u besleyen varsayılan model olacağını, GPT-Live-1 mini’nin ise Ücretsiz kullanıcılar için varsayılan olacağını söyledi. 31 Temmuz 2026 güncellemesi, GPT-Live aracılığıyla ChatGPT Voice ve OpenAI API üzerinden oluşturulan desteklenen seslere SynthID filigranlaması ekledi ve OpenAI’nin genel doğrulama aracına API erişimi sağladı.
Duyuru ayrıca işletmeleri OpenAI Presence‘a yönlendiriyor; OpenAI, bu hizmetin soruları yanıtlayan, sorunları çözen, şirket sistemlerini kullanan, onaylı eylemleri gerçekleştiren ve gerektiğinde insanlara yönlendiren ajanlar için gerçek zamanlı ses etkileşimlerini GPT-Live-1 ile sağladığını belirtti. OpenAI, Presence’ı 22 Temmuz 2026’da ses ve sohbet iş akışları için dağıtılmış bir kurumsal ürün olarak tanıttı; bu ürün, OpenAI Forward Deployed Engineers ve seçkin küresel sistem entegratörleri tarafından yürütülen sınırlı bir genel kullanılabilirlik programı aracılığıyla uygun müşterilere sunuluyor, kendi kendine hizmet ürünü olarak değil.
Erken Müşteriler ve Yeni Sesler
Yelp’in baş teknoloji sorumlusu Alex Levy, GPT-Live-1’in Yelp Host ve Hatch’e eklenmesinin şirketin geleneksel ses mimarisine göre dönüş alımını ve doğruluğu artırdığını ve Yelp Host rezervasyon ve yemek siparişi gibi aramaları yanıtladığında çağrı yönetim oranlarında anlamlı iyileşmeler gördüklerini söyledi. Levy, “Arayanlar daha tam ve doğal cümleler söylüyor, bu da telefonun diğer ucundaki deneyimin gerçekten farklı hissettirdiğini gösteriyor” dedi. Duyuruyla birlikte yayınlanan bir demo, Yelp Host’un bir rezervasyon alırken GPT-Live-1’in arka plan gürültüsü, yan konuşmalar ve kesintileri yönettiğini gösteriyor.
Speak’in kurucu ortağı ve baş teknoloji sorumlusu Andrew Hsu, erken değerlendirmelerin GPT-Live-1’in Speak’in Canlı Öğretmen Derslerinde önceki dönüş‑tabanlı sistemlere kıyasla öğrenenlerin düşünme duraklamaları sırasında kesintileri neredeyse %80 azalttığını bulduğunu söyledi. Fin’in baş operasyon sorumlusu Jordan Neil, modelin AI ses desteğini dur‑baş ritminden telefon görüşmesinin doğal akışına taşıdığını, müşterilerin duraklamasına, kesintiye uğramasına ve yön değiştirmesine izin verirken Fin’in konuşmayı kendi özel destek sistemiyle eşleştirerek sorunları çözdüğünü belirtti. Cognition’ın kurucu ortağı ve baş ürün sorumlusu Walden Yan, GPT-Live-1’i Cognition’ın AI mühendisi Devin ile birlikte bir fikir üzerinde konuşmak, bir yaklaşımı baskı testine tabi tutmak veya klavyeden uzakta çalışmayı devretmek için kullandığını anlattı.
OpenAI, gerçek zamanlı seslerin sınırlı bir setinden aksanlar, lehçeler ve diller arasında daha geniş bir seçime genişlediğini, geliştiricilere asistanlarının sesini nasıl istediğine dair daha fazla seçenek sunduğunu söyledi. Özel ses erişimi isteyen geliştiricilerin uygunluk ve talep süreci hakkında bilgi almak için OpenAI satış ekibiyle iletişime geçmeleri gerekiyor. Şirket, önümüzdeki aylarda ses seçeneklerini ve dil kullanılabilirliğini genişletmeye devam edeceğini belirtti.












