एआई मॉडल और प्लेटफ़ॉर्म
Decagon ने Voice 3 एजेंट को Chord स्पीच मॉडल के साथ प्रस्तुत किया

Decagon ने Voice 3, अपने ग्राहक कॉलों के लिए आवाज़ AI एजेंट, और Chord, Decagon Labs का पहला स्पीच मॉडल, कंपनी के Decagon Dialogues 2026 इवेंट में 1 अक्टूबर 2026 को प्रस्तुत किया, यह कहा कि यह एजेंट 70 से अधिक भाषाओं का समर्थन करता है और नई डुप्लेक्स आर्किटेक्चर पर चलता है।
Voice 3 घोषणा में, Product Manager Quique Lores और Senior Product Marketing Manager Ariana Xiang द्वारा लिखित, Decagon ने Voice 3 को अपना अब तक का सबसे उन्नत आवाज़ AI एजेंट बताया। एजेंट Chord के माध्यम से बात करता है, और यह Decagon Dialogues 2026 में तीन अन्य उत्पादों के साथ लॉन्च हुआ।
Decagon Dialogues 2026 पोस्ट में, सह-संस्थापक Jesse Zhang, Decagon के मुख्य कार्यकारी, और Ashwin Sreenivas, उसके अध्यक्ष, ने अन्य तीन रिलीज़ का नाम बताया: Personal Agent Gateway, जो ग्राहकों के व्यक्तिगत AI एजेंट की पहचान करता है और उन्हें व्यवसाय के साथ जुड़ने के लिए एक समर्पित चैनल देता है; Agent Modules, जो समर्थन से परे यात्राओं में एजेंट का विस्तार करता है; और Duet Apprentice, जो कंपनी के Duet सिस्टम को आंतरिक संसाधनों और बढ़े हुए ग्राहक वार्तालापों से व्यवसाय सीखने की अनुमति देता है।
उद्यमों ने पहले Decagon एजेंटों को समर्थन टिकटों को हल करने के लिए काम पर लगाया, सह-संस्थापकों ने लिखा, और अब वे एजेंट लीड्स को योग्य बनाते हैं, ग्राहकों को ऑनबोर्ड करते हैं, भुगतान एकत्र करते हैं, और संबंध विकसित करते हैं। ये चार रिलीज़ यह विस्तारित करती हैं कि ग्राहक Decagon द्वारा कहा गया AI कंसीयर्ज तक कैसे पहुंचते हैं और यह उनके लिए क्या कर सकता है।
Voice 3 और Chord स्पीच मॉडल
Chord Decagon Labs द्वारा प्रशिक्षित पहला आवाज़ मॉडल है, और कंपनी कहती है कि इसे वास्तविक ग्राहक अनुभव वार्तालापों पर पोस्ट‑ट्रेन किया गया है, न कि उन व्यापक उपयोगों के लिए जिनके लिए अधिकांश आवाज़ मॉडल उपयोग होते हैं, जैसे ऑडियोबुक वाचन से लेकर वीडियो‑गेम वॉइसओवर तक। Decagon कहता है कि मॉडल शब्दांश दर शब्दांश बोल को आकार देता है, पुष्टि कोड या फोन नंबर के लिए गति को धीमा करता है और फिर वार्तालापीय गति पर लौटता है, एक वैश्विक गति सेटिंग पर निर्भर रहने के बजाय। मौजूदा आवाज़ अनुकूलन नियंत्रण बरकरार रहते हैं: आवाज़ चयन, व्यवसाय‑विशिष्ट शब्दों का उच्चारण, और व्यवसाय के अनुरूप डिलीवरी।
घोषणा के अनुसार, Voice 3 70 से अधिक भाषाओं का समर्थन करता है बिना टीमों को प्रत्येक के लिए अलग एजेंट बनाने की आवश्यकता के। यह कॉलर की भाषा का पता लगाता है और स्वचालित रूप से स्विच करता है, यहाँ तक कि जब कॉलर वाक्य के मध्य में भाषा बदलता है, और Decagon कहता है कि इसके स्थानीय‑विशिष्ट आवाज़ें प्रत्येक बाजार में लोगों की बोली को प्रतिबिंबित करती हैं और शिप होने से पहले मूल वक्ताओं द्वारा सत्यापित की जाती हैं।
Decagon बताता है कि Chord लाइसेंस प्राप्त डेटा और सहमति प्राप्त आवाज़ टैलेंट पर प्रशिक्षित है, कभी भी ग्राहक‑स्वामित्व डेटा पर नहीं। Deutsche Telekom में Digital Service Communication के Lead Christian Niedworok ने घोषणा में कहा कि वर्षों के IVR सिस्टम ने ग्राहकों को केवल मानव तक पहुंचने के लिए छोटे‑छोटे अंशों में बोलना सिखाया है, और Decagon की आवाज़ ऐसा लगता है जैसे वह वास्तव में सुन रही है और बातचीत को जारी रखती है बजाय इसके कि काम करते समय चुप हो जाए। Chime के Chief Operating Officer Janelle Sallenave ने कहा कि Decagon Voice Chime को उच्च प्रदर्शन और सहज ब्रांड अनुकूलन को क्रॉस‑चैनल मेमोरी के साथ संयोजित करने की अनुमति देता है, जिससे हर इंटरैक्शन जुड़ा रहता है और सदस्य‑पहले मूल्यों के अनुरूप रहता है।
ट्रेनिंग पाइपलाइन और बेस मॉडल
साथी पोस्ट Samuel Zhang द्वारा, जो Decagon के तकनीकी स्टाफ के सदस्य हैं और एजेंट ऑर्केस्ट्रेशन पर केंद्रित हैं, Chord के निर्माण का वर्णन करता है। इसकी ट्रेनिंग पाइपलाइन वास्तविक वार्तालाप की बनावट को संरक्षित करने के लिए डिजाइन की गई है, जिसमें गति में बदलाव, प्राकृतिक ज़ोर, विराम, और फिलर शब्द शामिल हैं, बजाय रिकॉर्डिंग को साफ़, समान पढ़ाई में बदलने के, जैसा कि पोस्ट कहती है कि आवाज़ को कृत्रिम बनाता है। दो विधियाँ इस दृष्टिकोण का समर्थन करती हैं: एक शब्दशः ट्रांसक्रिप्शन प्रक्रिया जो गति, ज़ोर, और असंतुलन को संरक्षित करती है, और एक रिकॉर्डिंग विधि जो स्क्रिप्ट की सामग्री को मुक्त‑प्रवाह वार्तालाप की प्राकृतिकता के साथ जोड़ती है, न कि आवाज़ कलाकारों के प्रदर्शनात्मक पढ़ने के साथ।
बेस मॉडल के लिए, Decagon ने एक टोकनाइज़र‑रहित डिफ्यूज़न मॉडल को पोस्ट‑ट्रेन किया। पोस्ट तर्क देती है कि ऑडियो को टोकन में विभाजित करने से प्रत्येक टोकनाइज़ेशन चरण में जानकारी खो जाती है, जबकि टोकन‑रहित प्रतिनिधित्व लॉसलेस के करीब रहता है और वह सूक्ष्म विवरण संरक्षित करता है जो केवल समझ में आने वाली आवाज़ को उपस्थित सुनाई देने वाली आवाज़ से अलग करता है। यह मॉडल को बहुत अधिक नियंत्रित करने योग्य भी बनाता है, पोस्ट के अनुसार, जिससे Decagon को भावना, गति, और ज़ोर को सटीकता से आकार देने की अनुमति मिलती है। उत्पादन में, Chord Modal पर सर्व किया जाता है।
डुप्लेक्स आर्किटेक्चर
Decagon कहता है कि अधिकांश आवाज़ एजेंट एक क्रमबद्ध पाइपलाइन चलाते हैं जिसमें स्पीच‑टू‑टेक्स्ट कॉलर को ट्रांसक्राइब करता है, एक बड़ा भाषा मॉडल प्रतिक्रिया तय करता है, और टेक्स्ट‑टू‑स्पीच उत्तर को बोलता है, प्रत्येक चरण में देरी जोड़ता है और चरणों के बीच समन्वय प्राकृतिक टर्न‑टेकिन्ग को कठिन बनाता है। Voice 3 इस व्यवस्था को डुप्लेक्स आर्किटेक्चर के साथ बदलता है जो दो परतों को समानांतर चलाता है: एक कम‑लेटेंसी वार्तालाप मॉडल सुनना और बोलना संभालता है, उत्तर से लेकर प्रगति अपडेट तक, जबकि एक अधिक शक्तिशाली मॉडल तर्क, टूल कॉलिंग, और वार्तालाप के पीछे गार्डरेल प्रवर्तन को प्रबंधित करता है।
कंपनी के अनुसार, एजेंट इनकमिंग ऑडियो को प्रोसेस करता है यहाँ तक कि जब वह बोल रहा हो, इसलिए वह कॉलर के “mhm” कहने पर भी बात करता रहता है लेकिन वास्तविक बाधा पर रुक जाता है। यह लंबी लुकअप के दौरान अपनी प्रगति को बताता है, कार्य चल रहा होने पर फॉलो‑अप प्रश्नों के उत्तर देता है, और बीच में छोटे अनुरोधों में मदद करता है, बजाय इसके कि कॉलर को चुप्पी या होल्ड पर छोड़ दे।
कंपनी द्वारा रिपोर्ट किए गए मूल्यांकन परिणाम
Zhang के पोस्ट में टेलीकॉम, वित्तीय सेवाओं और यात्रा एवं आतिथ्य के ग्राहकों के बारे में बताया गया है जिन्होंने ऑफ‑द‑शेल्फ़ आवाज़ से Chord पर आधारित आवाज़ में परिवर्तन किया, जहाँ केवल आवाज़ बदलकर पहले और बाद के समान प्रोग्रामों की तुलना की गई। Decagon के अनुसार, सभी मामलों में समाधान दर बढ़ी: टेलीकॉम ग्राहक के लिए 6.1 अंक, वित्तीय सेवा प्रदाता के लिए 7.1 अंक, और यात्रा ब्रांड के लिए 2.6 अंक। Barge दर, जिसे Decagon कॉलों के उस हिस्से के रूप में परिभाषित करता है जहाँ कॉलर का एकमात्र लक्ष्य मानव तक पहुँचना होता है, तीनों ग्राहकों में क्रमशः 14.5, 6.1 और 5.3 अंक घट गई।
तीन आवाज़ों के बीच एक ब्लाइंड लिसनिंग टेस्ट में, श्रोताओं ने वही ऑडियो नमूने एक बार Chord द्वारा और एक बार उस आवाज़ टैलेंट द्वारा सुने जो मॉडल पर आधारित था, और उनसे पूछा गया कि कौन सी आवाज़ AI है। Decagon रिपोर्ट करता है कि 45.7% श्रोताओं ने माना कि वास्तविक मानव आवाज़ AI थी, एक परिणाम जिसे कंपनी 50‑50 सिक्का उछाल के बराबर करीब मानती है, जिससे दोनों प्रभावी रूप से अलग नहीं पहचाने जा सके। Voice 3 घोषणा इस परिणाम को लगभग 90% उपयोगकर्ताओं के लिए पहचान न कर पाने के रूप में सारांशित करती है।
Decagon यह भी रिपोर्ट करता है कि उसने एक पसंद परीक्षण किया जिसमें Chord को तीन अन्य प्रमुख स्पीच मॉडल्स के साथ सीधा मुकाबला कराया गया, जहाँ प्रत्येक द्वारा समान शब्द बोले गए और श्रोताओं से पूछा गया कि समस्या वाले ग्राहक के रूप में वे किस आवाज़ से सबसे अधिक बात करना चाहेंगे। 185 श्रोताओं में, कंपनी के अनुसार Chord ने कुल मिलाकर 36.2% के साथ पहला स्थान हासिल किया और व्यक्तिगत राउंड में अधिकतम 48.4% तक पहुँचा।
आगे देखते हुए, Decagon कहता है कि अधिक कठिन और अधिक मूल्यवान समस्या यह है कि वास्तविक बातचीत में आवाज़ कैसे व्यवहार करती है, जिसमें यह शामिल है कि क्या वह पाँच मिनट में भरोसा जीतती है और कॉल के जटिल होने पर भी टिकती है। कंपनी Chord को Decagon Labs में मुख्य दांव का नवीनतम अभिव्यक्ति बताती है: ग्राहक इंटरैक्शन के लिए, एक विशिष्ट कार्य के लिए फाइन‑ट्यून किया गया मॉडल सभी चीज़ों के लिए बनाया गया सामान्य‑उद्देश्य फ्रंटियर मॉडल से बेहतर प्रदर्शन करता है।












