Yapay zeka modelleri ve platformları
Decagon, Chord Konuşma Modeliyle Voice 3 Ajanını Tanıttı

Decagon, müşteri aramaları için sesli AI ajanı Voice 3’ü ve Decagon Labs’tan ilk konuşma modeli olan Chord’u, şirketin 1 Ekim 2026 tarihli Decagon Dialogues 2026 etkinliğinde tanıttı ve ajanın 70’ten fazla dili desteklediğini ve yeni bir çift yönlü mimaride çalıştığını belirtti.
Voice 3 duyurusu‘nda, Ürün Yöneticisi Quique Lores ve Kıdemli Ürün Pazarlama Yöneticisi Ariana Xiang tarafından hazırlanmış, Decagon, Voice 3’ü şimdiye kadar geliştirdiği en ileri ses AI ajanı olarak tanımladı. Ajan, Chord aracılığıyla konuşur ve Decagon Dialogues 2026’da üç başka ürünle birlikte piyasaya sürüldü.
In the Decagon Dialogues 2026 gönderisi, kurucu ortaklar Jesse Zhang, Decagon’un baş yöneticisi ve Ashwin Sreenivas, şirketin başkanı, diğer üç sürümü adlandırdı: Personal Agent Gateway, müşterilerin kişisel AI ajanlarını tanımlayan ve onlara bir işletmeyle etkileşime girmek için özel bir kanal sağlayan; Agent Modules, bir ajanın destek dışındaki yolculuklarda genişlemesini sağlayan; ve Duet Apprentice, şirketin Duet sisteminin iç kaynaklardan ve yükseltilmiş müşteri konuşmalarından bir işletmeyi öğrenmesini sağlayan.
Kurucu ortakların yazdığına göre, işletmeler ilk olarak Decagon ajanlarını destek taleplerini çözmek için kullandılar ve bu ajanlar artık potansiyel müşterileri nitelendiriyor, müşterileri sisteme alıyor, ödemeleri topluyor ve ilişkileri geliştiriyor. Dört sürüm, müşterilerin Decagon’un AI konsiyerj olarak adlandırdığı hizmete ve onun onlara neler yapabileceğine ulaşma şeklini genişletiyor.
Voice 3 ve Chord Konuşma Modeli
Chord, Decagon Labs tarafından eğitilen ilk ses modelidir ve şirket, modelin geniş bir kullanım yelpazesi (sesli kitap anlatımından video oyunu seslendirmelerine kadar) yerine gerçek dünya müşteri deneyimi konuşmalarına dayanarak sonradan eğitildiğini belirtiyor. Decagon, modelin konuşmayı cümle cümle şekillendirdiğini, onay kodu ya da telefon numarası için yavaşlayıp ardından tekrar konuşma hızına döndüğünü, tek bir genel hız ayarına dayanmadığını söylüyor. Mevcut ses özelleştirme kontrolleri de devam ediyor: ses seçimi, iş‑özel terimlerin telaffuzu ve işletmeye göre ayarlanmış teslimat.
Voice 3, duyuruda belirtildiği gibi, ekiplerin her dil için ayrı bir ajan oluşturmasına gerek kalmadan 70’ten fazla dili destekliyor. Arayanın dilini algılar ve otomatik olarak geçiş yapar, hatta arayan cümle ortasında dil değiştirse bile, ve Decagon, yerel seslerin her pazarda insanların nasıl konuştuğunu yansıttığını ve gönderilmeden önce yerel konuşmacılar tarafından doğrulandığını belirtiyor.
Decagon, Chord’un lisanslı veri ve onaylı ses yetenekleriyle eğitildiğini, asla müşteri sahipliğindeki verilerle eğitilmediğini belirtiyor. Deutsche Telekom’da Dijital Servis İletişimi Lideri Christian Niedworok, duyuruda, yılların IVR sistemlerinin müşterileri sadece bir insanla konuşmak için kısa parçalar halinde konuşmaya eğittiğini ve Decagon’un sesinin gerçekten dinliyormuş gibi ses çıktığını, çalışırken sessiz kalmak yerine konuşmayı sürdürdüğünü söyledi. Chime Operasyon Direktörü Janelle Sallenave, Decagon Voice’un Chime’in yüksek performans ve sorunsuz marka özelleştirmesini kanal‑ötesi hafıza ile birleştirmesine olanak tanıdığını, her etkileşimin bağlı kalmasını ve üye‑öncelikli değerlerine sadık kalmasını sağladığını belirtti.
Eğitim Boru Hattı ve Temel Model
Samuel Zhang tarafından, Decagon’un ajan orkestrasyonuna odaklanan teknik ekibin bir üyesi olarak hazırlanan bir yardımcı gönderi, Chord’un nasıl oluşturulduğunu açıklıyor. Eğitim boru hattı, gerçek konuşmanın dokusunu korumak üzere tasarlanmıştır; hız değişimleri, doğal vurgu, duraklamalar ve dolgu kelimeleri gibi unsurları korur, kayıtları temiz, tekdüze bir okuma haline getirerek seslerin sentetik çıkmasına neden olan işlemlerden kaçınır. Bu yaklaşımı destekleyen iki yöntem vardır: hızı, vurguyu ve akıcılık hatalarını koruyan kelimesi kelimesine bir transkripsiyon süreci ve bir senaryonun içeriğini serbest akışlı konuşmanın doğallığıyla birleştiren bir kayıt yöntemi, seslendirme sanatçılarının performans okuması yerine.
Temel model için, Decagon bir token‑sız difüzyon modeli üzerine sonradan eğitim yaptı. Gönderi, sesin tokenlara ayrılmasının her tokenizasyon adımında bilgiyi kaybettiğini, token‑sız bir temsilin kayıpsıza yakın kaldığını ve sadece anlaşılabilir bir sesi, var gibi gelen bir sesden ayıran ince detayı koruduğunu savunuyor. Ayrıca modelin çok daha yönlendirilebilir olduğunu, Decagon’un duyguyu, hızı ve vurguyu hassas bir şekilde şekillendmesine olanak tanıdığını belirtiyor. Üretimde, Chord Modal üzerinde sunulmaktadır.
Çift Yönlü Mimari
Decagon, çoğu sesli ajanın, konuşmayı metne çeviren bir konuşmacıyı, yanıtı belirleyen büyük bir dil modelini ve yanıtı seslendiren metni sese çeviren bir aşamayı içeren kademeli bir boru hattı çalıştırdığını ve her aşamanın gecikme eklediğini, aşamalar arasındaki koordinasyonun doğal dönüşümlü konuşmayı zorlaştırdığını belirtiyor. Voice 3, bu düzeni iki katmanı paralel çalışan bir çift yönlü mimariyle değiştiriyor: düşük gecikmeli bir konuşma modeli dinleme ve konuşmayı, yanıtları ve ilerleme güncellemelerini yönetirken, daha güçlü bir model mantık yürütmeyi, araç çağrısını ve konuşmanın arkasındaki güvenlik önlemlerini yönetiyor.
Şirkete göre, ajan konuşurken bile gelen sesi işler, bu yüzden bir arayan “mhm” dediğinde bile konuşmaya devam eder ancak gerçek bir kesinti olduğunda geri çekilir. Uzun sorgulamalar sırasında ilerlemesini anlatır, bir görev hâlâ çalışırken takip sorularını yanıtlar ve aralarındaki daha küçük isteklerde yardımcı olur; arayanı sessiz bırakmak ya da bekletmek yerine.
Şirket Tarafından Bildirilen Değerlendirme Sonuçları
Zhang’ın gönderisi, telekom, finansal hizmetler ve seyahat ve konaklama sektörlerindeki müşterilerin, hazır bir ses yerine Chord üzerindeki bir sese geçtiklerini ve yalnızca ses değiştirildiği koşulda aynı programları öncesi ve sonrası karşılaştırdıklarını rapor ediyor. Decagon, çözüm oranının her durumda arttığını bildiriyor: telekom müşterisi için 6,1 puan, finansal hizmet sağlayıcısı için 7,1 puan ve seyahat markası için 2,6 puan artış. Decagon’un tanımladığı “barge oranları”, arayanın tek amacının bir insanla konuşmak olduğu çağrıların payı olarak, üç müşteri arasında sırasıyla 14,5, 6,1 ve 5,3 puan azaldı.
Üç ses üzerinde yapılan kör bir dinleme testinde, dinleyiciler aynı ses örneklerini bir kez Chord ve bir kez model alındığı insan ses yeteneğiyle duydu ve hangisinin yapay zeka olduğunu seçmeleri istendi. Decagon, dinleyicilerin %45,7’sinin gerçek insan sesinin yapay zeka olduğunu düşündüğünü rapor ediyor; şirket bu sonucu, iki sesin etkili bir şekilde ayırt edilemez olduğu, %50-%50 bir para atışı kadar yakın olarak tanımlıyor. Voice 3 duyurusu, sonucun yaklaşık %90’lık bir kullanıcı kitlesinin ayırt edemediği şeklinde özetleniyor.
Decagon ayrıca, Chord’u önde gelen üç başka konuşma modeliyle yan yana koyduğu bir tercih testinden bahsediyor; her model aynı kelimeleri seslendiriyor ve dinleyiciler, sorun yaşayan bir müşteri olarak en çok konuşmak isteyecekleri sesi seçmeleri isteniyor. 185 dinleyici arasında, şirket Chord’un genel olarak %36,2 ile birinci sırada yer aldığını ve bireysel turlarda %48,4’e kadar yükseldiğini belirtiyor.
Geleceğe bakarken, Decagon daha zor ve daha değerli sorunun gerçek bir konuşma içinde sesin nasıl davrandığı olduğunu, beş dakika içinde güven kazanıp kazanmadığını ve bir çağrı karıştığında dayanıp kalabildiğini belirtiyor. Şirket, Chord’u Decagon Labs’taki temel iddianın en yeni ifadesi olarak tanımlıyor: müşteri etkileşimlerinde, belirli bir görev için ince ayar yapılmış bir modelin, her şey için inşa edilmiş genel amaçlı bir sınır modelinden daha iyi performans gösterdiği.












