โมเดลและแพลตฟอร์ม AI
Decagon เปิดตัว Voice 3 Agent พร้อมโมเดลการพูด Chord

Decagon แนะนำ Voice 3 ซึ่งเป็นเอเย่นต์ AI ด้านเสียงสำหรับการโทรของลูกค้า, และ Chord ซึ่งเป็นโมเดลการพูดแรกจาก Decagon Labs, ที่งาน Decagon Dialogues 2026 ของบริษัทเมื่อวันที่ 1 ตุลาคม 2026, โดยระบุว่าเอเย่นต์นี้รองรับภาษามากกว่า 70 ภาษาและทำงานบนสถาปัตยกรรม duplex ใหม่.
ใน ประกาศ Voice 3 ซึ่งเขียนโดยผู้จัดการผลิตภัณฑ์ Quique Lores และผู้จัดการการตลาดผลิตภัณฑ์อาวุโส Ariana Xiang, Decagon อธิบายว่า Voice 3 เป็นเอเย่นต์ AI ด้านเสียงที่ก้าวหน้าที่สุดของบริษัทจนถึงตอนนี้. เอเย่นต์นี้พูดผ่าน Chord และเปิดตัวพร้อมกับผลิตภัณฑ์อื่นอีกสามรายการที่ Decagon Dialogues 2026.
ใน โพสต์ Decagon Dialogues 2026, ผู้ก่อตั้งร่วม Jesse Zhang, ซีอีโอของ Decagon, และ Ashwin Sreenivas, ประธานของบริษัท, ได้ตั้งชื่อการเปิดตัวอีกสามรายการ: Personal Agent Gateway ซึ่งระบุตัวเอเย่นต์ AI ส่วนบุคคลของลูกค้าและมอบช่องทางเฉพาะให้พวกเขาติดต่อกับธุรกิจ; Agent Modules ซึ่งขยายขอบเขตของเอเย่นต์ผ่านการเดินทางต่าง ๆ นอกเหนือจากการสนับสนุน; และ Duet Apprentice ซึ่งทำให้ระบบ Duet ของบริษัทเรียนรู้ธุรกิจจากแหล่งข้อมูลภายในและการสนทนาลูกค้าที่ถูกส่งต่อ.
บริษัทต่าง ๆ เริ่มใช้เอเย่นต์ Decagon เพื่อแก้ไขตั๋วสนับสนุน, ตามที่ผู้ก่อตั้งร่วมเขียน, และเอเย่นต์เหล่านั้นตอนนี้สามารถคัดกรองโอกาส, นำลูกค้าเข้าสู่ระบบ, เก็บเงิน, และพัฒนาความสัมพันธ์ได้. การเปิดตัวสี่รายการนี้ขยายวิธีที่ลูกค้าสามารถเข้าถึงสิ่งที่ Decagon เรียกว่า AI concierge และสิ่งที่มันสามารถทำให้กับพวกเขา.
Voice 3 และโมเดลการพูด Chord
Chord เป็นโมเดลเสียงแรกที่ได้รับการฝึกโดย Decagon Labs, และบริษัทระบุว่าโมเดลนี้ได้รับการฝึกต่อบนการสนทนาประสบการณ์ลูกค้าในโลกจริง แทนที่จะออกแบบเพื่อการใช้งานที่หลากหลายเช่นที่โมเดลเสียงส่วนใหญ่ทำ, ตั้งแต่การบรรยายหนังสือเสียงจนถึงการพากย์เสียงเกมวิดีโอ. Decagon กล่าวว่าโมเดลนี้ปรับรูปแบบการพูดตามวลี, ชะลอความเร็วสำหรับรหัสยืนยันหรือหมายเลขโทรศัพท์แล้วกลับสู่จังหวะการสนทนาปกติ, แทนการพึ่งพาการตั้งค่าความเร็วทั่วโลกหนึ่งค่า. การควบคุมการปรับแต่งเสียงที่มีอยู่เดิมยังคงใช้ได้: การเลือกเสียง, การออกเสียงคำเฉพาะของธุรกิจ, และการส่งเสียงที่ปรับให้เข้ากับธุรกิจ.
ตามประกาศ, Voice 3 รองรับภาษามากกว่า 70 ภาษาโดยไม่ต้องให้ทีมสร้างเอเย่นต์แยกสำหรับแต่ละภาษา. มันตรวจจับภาษาของผู้โทรและสลับโดยอัตโนมัติ, แม้ผู้โทรจะเปลี่ยนภาษากลางประโยค, และ Decagon ระบุว่าเสียงที่ปรับตามท้องถิ่นสะท้อนการพูดของผู้คนในแต่ละตลาดและได้รับการตรวจสอบจากเจ้าของภาษาก่อนการปล่อย.
Decagon ระบุว่า Chord ได้รับการฝึกด้วยข้อมูลที่ได้รับใบอนุญาตและเสียงที่ได้รับความยินยอม, ไม่เคยใช้ข้อมูลที่เป็นของลูกค้า. Christian Niedworok, หัวหน้าการสื่อสารบริการดิจิทัลที่ Deutsche Telekom, กล่าวในประกาศว่าปีหลายของระบบ IVR ได้ฝึกให้ลูกค้าพูดเป็นส่วนสั้น ๆ เพียงเพื่อให้ได้พูดกับมนุษย์, และว่าเสียงของ Decagon ฟังดูเหมือนกำลังฟังจริง ๆ และทำให้การสนทนาเดินต่อโดยไม่เงียบขณะทำงาน. Janelle Sallenave, COO ของ Chime, กล่าวว่า Decagon Voice ทำให้ Chime สามารถผสานประสิทธิภาพสูงและการปรับแต่งแบรนด์อย่างไร้รอยต่อกับความจำข้ามช่องทาง, ทำให้ทุกการโต้ตอบเชื่อมต่อและสอดคล้องกับค่านิยมที่ให้สมาชิกเป็นศูนย์กลางของบริษัท.
กระบวนการฝึกและโมเดลฐาน
ใน โพสต์คู่ โดย Samuel Zhang, สมาชิกทีมเทคนิคของ Decagon ที่มุ่งเน้นการประสานงานเอเย่นต์, อธิบายวิธีการสร้าง Chord. กระบวนการฝึกของมันออกแบบให้คงลักษณะของการสนทนาจริง, รวมถึงการเปลี่ยนจังหวะ, การเน้นธรรมชาติ, การหยุดพัก, และคำเติม, แทนการทำความสะอาดการบันทึกให้เป็นเสียงที่อ่านอย่างเรียบเนียนซึ่งทำให้เสียงฟังดูเทียมตามที่โพสต์ระบุ. มีสองวิธีสนับสนุนแนวทางนี้: กระบวนการถอดความแบบถ้อยคำที่คงจังหวะ, การเน้น, และความไม่ต่อเนื่อง, และวิธีการบันทึกที่ผสานเนื้อหาของสคริปต์กับความเป็นธรรมชาติของการสนทนาที่ไหลอย่างอิสระแทนการอ่านแบบแสดงจากนักพากย์เสียง.
สำหรับโมเดลฐาน, Decagon ได้ฝึกต่อโมเดล diffusion ที่ไม่มีตัวแยกโทเคน. โพสต์อธิบายว่าการแยกเสียงเป็นโทเคนทำให้สูญเสียข้อมูลในทุกขั้นตอนของการแยกโทเคน, ในขณะที่การแสดงผลแบบไม่มีโทเคนคงความใกล้เคียงกับการสูญเสียศูนย์และคงรายละเอียดละเอียดที่แยกเสียงที่เข้าใจได้จากเสียงที่ฟังดูเป็นธรรมชาติ. มันยังทำให้โมเดลสามารถควบคุมได้มากขึ้นตามที่โพสต์ระบุ, ทำให้ Decagon สามารถปรับอารมณ์, ความเร็ว, และการเน้นได้อย่างแม่นยำ. ในการผลิต, Chord ให้บริการบน Modal.
สถาปัตยกรรม Duplex
Decagon ระบุว่าเอเย่นต์เสียงส่วนใหญ่ทำงานด้วยกระบวนการต่อเนื่องที่ speech-to-text ถอดความผู้โทร, โมเดลภาษาใหญ่ตัดสินใจว่าจะตอบอย่างไร, และ text-to-speech พูดคำตอบ, โดยแต่ละขั้นตอนเพิ่มความล่าช้าและการประสานระหว่างขั้นตอนทำให้การสลับบทสนทนาธรรมชาติเป็นเรื่องยาก. Voice 3 แทนที่การจัดเรียงนั้นด้วยสถาปัตยกรรม duplex ที่ทำงานสองชั้นพร้อมกัน: โมเดลสนทนาที่มีความหน่วงต่ำจัดการการฟังและการพูด, ตั้งแต่คำตอบจนถึงการอัปเดตความคืบหน้า, ในขณะที่โมเดลที่ทรงพลังกว่าจัดการการให้เหตุผล, การเรียกเครื่องมือ, และการบังคับใช้กฎระเบียบเบื้องหลังการสนทนา.
ตามที่บริษัทกล่าว, เอเย่นต์จะประมวลผลเสียงเข้ามาแม้ในขณะที่กำลังพูด, ดังนั้นมันสามารถพูดต่อเมื่อผู้โทรพูด “mhm” แต่จะหยุดเมื่อมีการขัดจังหวะจริง. มันบรรยายความคืบหน้าระหว่างการค้นหาที่ยาว, ตอบคำถามต่อเนื่องขณะงานยังดำเนินอยู่, และช่วยตอบคำขอเล็ก ๆ ระหว่างนั้น, แทนที่จะทำให้ผู้โทรเงียบหรือรอคอย.
ผลการประเมินที่รายงานโดยบริษัท
โพสต์ของ Zhang รายงานเกี่ยวกับลูกค้าในอุตสาหกรรมโทรคมนาคม, บริการทางการเงิน, และการท่องเที่ยวและการบริการที่เปลี่ยนจากเสียงสำเร็จรูปเป็นเสียงบน Chord โดยเปรียบเทียบโปรแกรมเดียวกันก่อนและหลังโดยเปลี่ยนเฉพาะเสียงเท่านั้น อัตราการแก้ปัญหาเพิ่มขึ้นในทุกกรณี ตามรายงานของ Decagon: เพิ่มขึ้น 6.1 จุดสำหรับลูกค้าโทรคมนาคม, 7.1 จุดสำหรับผู้ให้บริการทางการเงิน, และ 2.6 จุดสำหรับแบรนด์การท่องเที่ยว อัตรา Barge ซึ่ง Decagon นิยามว่าเป็นส่วนแบ่งของการโทรที่เป้าหมายเดียวของผู้โทรคือการติดต่อกับมนุษย์ ลดลงโดย 14.5, 6.1, และ 5.3 จุดในสามลูกค้า
ในการทดสอบการฟังแบบลำบากตาโดยใช้เสียงสามแบบ ผู้ฟังได้ยินตัวอย่างเสียงเดียวกันที่พูดโดย Chord หนึ่งครั้งและโดยนักพากย์ที่เป็นต้นแบบของมันอีกครั้งหนึ่ง และถูกถามให้เลือกว่าเสียงใดเป็น AI Decagon รายงานว่า 45.7% ของผู้ฟังเชื่อว่าเสียงมนุษย์จริงเป็น AI ผลลัพธ์นี้บริษัทอธิบายว่าใกล้เคียงกับการโยนเหรียญ 50-50 จนสองเสียงไม่สามารถแยกแยะได้อย่างมีนัยสำคัญ การประกาศ Voice 3 สรุปผลว่าโดยประมาณ 90% ของผู้ใช้ไม่สามารถบอกได้
Decagon ยังรายงานการทดสอบความชอบที่เปรียบเทียบ Chord กับโมเดลการพูดอื่น ๆ สามแบบที่บริษัทอธิบายว่าเป็นผู้นำ โดยใช้คำเดียวกันที่พูดโดยแต่ละโมเดลและให้ผู้ฟังเลือกเสียงที่พวกเขาต้องการคุยด้วยมากที่สุดในฐานะลูกค้าที่มีปัญหา จากผู้ฟังจำนวน 185 คน บริษัทระบุว่า Chord ได้อันดับแรกโดยรวมที่ 36.2% และสูงสุดถึง 48.4% ในรอบแต่ละรอบ
มองไปข้างหน้า Decagon กล่าวว่า ปัญหาที่ยากและมีคุณค่ามากขึ้นคือวิธีที่เสียงทำงานภายในการสนทนาจริง รวมถึงว่ามันสามารถสร้างความเชื่อมั่นได้ภายในห้านาทีและยังคงทำงานได้เมื่อการโทรเกิดความยุ่งยาก บริษัทอธิบายว่า Chord เป็นการแสดงออกล่าสุดของการเดิมพันหลักที่ Decagon Labs คือ สำหรับการโต้ตอบกับลูกค้า โมเดลที่ปรับแต่งเฉพาะงานจะเหนือกว่าโมเดลทั่วไประดับแนวหน้า ที่สร้างขึ้นเพื่อทำทุกอย่าง












