نماذج ومنصات الذكاء الاصطناعي
ديكاجون تُقدم وكيل Voice 3 مع نموذج الكلام Chord

أعلنت ديكاجون عن Voice 3، وكيل الذكاء الاصطناعي الصوتي للمكالمات مع العملاء، وChord، أول نموذج كلام من Decagon Labs، خلال فعالية Decagon Dialogues 2026 التي أقامتها الشركة في 1 أكتوبر 2026، قائلة إن الوكيل يدعم أكثر من 70 لغة ويعمل على بنية مزدوجة جديدة.
في إعلان Voice 3، كتبها مدير المنتج Quique Lores ومديرة التسويق المنتج الأول Ariana Xiang، وصفت ديكاجون Voice 3 بأنه أكثر وكيل ذكاء اصطناعي صوتي تقدماً لديها حتى الآن. يتحدث الوكيل عبر Chord، وتم إصداره إلى جانب ثلاثة منتجات أخرى في Decagon Dialogues 2026.
في مشاركة Decagon Dialogues 2026، أسس المؤسسان Jesse Zhang، الرئيس التنفيذي لDecagon، وAshwin Sreenivas، رئيسها، أسماء الإصدارات الثلاثة الأخرى: Personal Agent Gateway، الذي يحدد وكلاء الذكاء الاصطناعي الشخصية للعملاء ويمنحهم قناة مخصصة للتفاعل مع الأعمال؛ Agent Modules، التي توسّع الوكيل عبر الرحلات خارج الدعم؛ وDuet Apprentice، التي تسمح لنظام Duet الخاص بالشركة بتعلم الأعمال من الموارد الداخلية والمحادثات المتصاعدة مع العملاء.
كتبت المؤسسان أن الشركات بدأت أولاً باستخدام وكلاء Decagon لحل تذاكر الدعم، وأن هؤلاء الوكلاء الآن يؤهلون العملاء المحتملين، ويسجلون العملاء الجدد، ويجمعون المدفوعات، ويقوّون العلاقات. توّسع الإصدارات الأربعة طريقة وصول العملاء إلى ما تسميه ديكاجون بـ “الكونسيرج الذكي” وما يمكنه تقديمه لهم.
Voice 3 ونموذج الكلام Chord
Chord هو أول نموذج صوت تم تدريبه بواسطة Decagon Labs، وتقول الشركة إنه تم تدريبه لاحقًا على محادثات تجربة العملاء الواقعية بدلاً من النطاق الواسع من الاستخدامات التي تخدمها معظم نماذج الصوت، من رواية الكتب الصوتية إلى التعليق الصوتي لألعاب الفيديو. تقول ديكاجون إن النموذج يشكّل الكلام جملةً بجملة، يبطئ عند رمز التأكيد أو رقم الهاتف ثم يعود إلى إيقاع محادثة، بدلاً من الاعتماد على إعداد سرعة عالمي واحد. تنتقل ضوابط تخصيص الصوت الحالية: اختيار الصوت، نطق المصطلحات الخاصة بالأعمال، وتوصيل مُضبط لاحتياجات العمل.
يدعم Voice 3 أكثر من 70 لغة دون الحاجة إلى أن تبني الفرق وكيلًا منفصلاً لكل لغة، وفقًا للإعلان. يكتشف لغة المتصل ويبدّل تلقائيًا، حتى عندما ينتقل المتصل بين اللغات داخل الجملة، وتقول ديكاجون إن الأصوات المخصصة لكل locale تعكس طريقة تحدث الناس في كل سوق وتم التحقق منها من قبل المتحدثين الأصليين قبل إطلاقها.
تصرّح ديكاجون أن Chord تم تدريبه على بيانات مرخصة ومواهب صوتية موافقة، ولا يُستخدم أبداً بيانات مملوكة للعملاء. قال Christian Niedworok، قائد التواصل الرقمي للخدمات في Deutsche Telekom، في الإعلان إن سنوات أنظمة IVR قد دربت العملاء على التحدث بجمل قصيرة فقط للوصول إلى إنسان، وإن صوت ديكاجون يبدو كأنه يستمع فعلاً ويحافظ على تدفق المحادثة بدلاً من الصمت أثناء عمله. وقالت Janelle Sallenave، الرئيسة التنفيذية للعمليات في Chime، إن Decagon Voice يتيح لشركة Chime دمج الأداء العالي وتخصيص العلامة التجارية بسلاسة مع ذاكرة متعددة القنوات، مما يبقي كل تفاعل متصلاً ومتماشياً مع قيمها التي تضع الأعضاء أولاً.
خط أنابيب التدريب والنموذج الأساسي
في المشاركة المصاحبة من قبل Samuel Zhang، عضو في فريق التقنية في Decagon يركز على تنسيق الوكلاء، تصف كيف تم بناء Chord. تم تصميم خط أنابيب التدريب للحفاظ على نسيج المحادثة الحقيقية، بما في ذلك تغير الإيقاع، التأكيد الطبيعي، الوقفات، والكلمات المملوءة، بدلاً من تنقية التسجيلات إلى قراءة نظيفة ومتساوية كما تقول المشاركة التي تجعل الأصوات تبدو صناعية. تدعم هذه المقاربة طريقتان: عملية نسخ حرفية تحافظ على الإيقاع، التأكيد، وعدم الطلاقة، وطريقة تسجيل تجمع محتوى النص مع طبيعية المحادثة المتدفقة بدلاً من قراءة تمثيلية من ممثلي الصوت.
بالنسبة للنموذج الأساسي، قامت Decagon بتدريب نموذج انتشار خالٍ من المُجزئات بعد النشر. تجادل المشاركة أن تجزئة الصوت إلى مُجزئات تُفقد المعلومات في كل خطوة تجزئة، بينما تمثيل خالٍ من المُجزئات يبقى قريبًا من فقدان البيانات القليل ويحافظ على التفاصيل الدقيقة التي تفرق بين صوت مفهوم فقط وصوت يبدو حاضراً. كما يجعل النموذج أكثر قابلية للتوجيه، وفقًا للمشاركة، مما يسمح لDecagon بتشكيل العاطفة، الإيقاع، والتأكيد بدقة. في الإنتاج، يُقدم Chord على منصة Modal.
البنية المزدوجة
تقول Decagon إن معظم وكلاء الصوت يعملون بنظام أنابيب متسلسلة حيث يحول تحويل الكلام إلى نص المتصل، ثم يقرر نموذج اللغة الضخم كيفية الرد، ثم يحول النص إلى كلام لتوليد الرد، مع إضافة تأخير في كل مرحلة وجعل التنسيق بين المراحل صعبًا لتحقيق تبادل أدوار طبيعي. يستبدل Voice 3 هذا الترتيب ببنية مزدوجة تشغل طبقتين بالتوازي: نموذج محادثة منخفض الكمون يتعامل مع الاستماع والتحدث، من الإجابات إلى تحديثات التقدم، بينما يدير نموذج أقوى التفكير، استدعاء الأدوات، وتطبيق الحواجز خلف المحادثة.
وفقًا للشركة، يعالج الوكيل الصوت الوارد حتى أثناء حديثه، لذا يتحدث عندما يقول المتصل “mhm” لكنه يتوقف عند مقاطعة حقيقية. يروي تقدمه خلال عمليات البحث الطويلة، يجيب على الأسئلة المتابعة بينما لا يزال المهمة قيد التنفيذ، ويساعد في الطلبات الصغيرة بين ذلك، بدلاً من ترك المتصل في صمت أو على الانتظار.
نتائج التقييم التي أبلغت عنها الشركة
تقرير زانغ يوضح أن العملاء في قطاع الاتصالات والخدمات المالية والسفر والضيافة الذين انتقلوا من صوت جاهز إلى صوت على Chord، قارنوا البرامج نفسها قبل وبعد التغيير مع تغيير الصوت فقط. ارتفعت نسبة حل المشكلات في كل حالة، وفقًا لتقارير Decagon: بزيادة 6.1 نقطة لعميل الاتصالات، 7.1 نقطة لمزود الخدمات المالية، و2.6 نقطة للعلامة التجارية في قطاع السفر. أما معدلات البارج، التي تعرفها Decagon بأنها حصة المكالمات التي يكون هدف المتصل الوحيد فيها الوصول إلى إنسان، فقد انخفضت بمقدار 14.5 و6.1 و5.3 نقطة عبر العملاء الثلاثة.
في اختبار استماع أعمى شمل ثلاثة أصوات، سمع المستمعون عينات صوتية متطابقة نُطقت مرة بواسطة Chord ومرة أخرى بواسطة موهبة الصوت التي تم بناء النموذج عليها، وطُلب منهم تحديد أيهما الذكاء الاصطناعي. تشير تقارير Decagon إلى أن 45.7٪ من المستمعين اعتقدوا أن الصوت البشري الحقيقي هو الذكاء الاصطناعي، وهو نتيجة تصفها الشركة بأنها قريبة بما يكفي من نتيجة عملة معدنية 50-50 بحيث لا يمكن تمييزهما فعليًا. يلخص إعلان Voice 3 النتيجة بأنها تقريبًا 90٪ من المستخدمين غير قادرين على التمييز.
كما تقرّب Decagon اختبار تفضيل وضع Chord مواجهةً لثلاث نماذج كلامية أخرى تصفها بأنها رائدة، حيث نُطقت نفس الكلمات بواسطة كل نموذج وطُلب من المستمعين اختيار الصوت الذي يرغبون في التحدث إليه أكثر كعميل يواجه مشكلة. عبر 185 مستمعًا، تقول الشركة إن Chord احتل المركز الأول إجمالًا بنسبة 36.2٪ ووصل إلى أعلى نسبة بلغت 48.4٪ في جولات فردية.
نظرةً إلى المستقبل، تقول Decagon إن المشكلة الأصعب والأكثر قيمة هي كيفية تصرف الصوت داخل محادثة حقيقية، بما في ذلك ما إذا كان يكتسب الثقة خلال خمس دقائق ويستمر في الأداء عندما تصبح المكالمة فوضوية. تصف الشركة Chord بأنه أحدث تجسيد للرهان الأساسي في Decagon Labs: أن نموذجًا مُصممًا بدقة لمهمة محددة يتفوق على نموذج عام متعدد الاستخدامات يُبنى لتغطية جميع المجالات في تفاعلات العملاء.












