AI 模型与平台
Decagon 推出搭载 Chord 语音模型的 Voice 3 代理

Decagon 在公司于 2026 年 10 月 1 日举办的 Decagon Dialogues 2026 活动上,推出了用于客户通话的语音 AI 代理 Voice 3,以及 Decagon Labs 的首个语音模型 Chord,并表示该代理支持超过 70 种语言,运行在全新的双工架构上。
在 Voice 3 公告 中,由产品经理 Quique Lores 和高级产品营销经理 Ariana Xiang 撰写,Decagon 将 Voice 3 描述为迄今为止最先进的语音 AI 代理。该代理通过 Chord 发声,并与另外三款产品一同在 Decagon Dialogues 2026 上发布。
在 Decagon Dialogues 2026 帖子 中,联合创始人兼首席执行官 Jesse Zhang 与总裁 Ashwin Sreenivas 介绍了另外三项发布:Personal Agent Gateway(个人代理网关),用于识别客户的个人 AI 代理并为其提供专属渠道与企业互动;Agent Modules(代理模块),将代理的功能延伸至支持之外的整个旅程;以及 Duet Apprentice(Duet 学徒),让公司的 Duet 系统能够从内部资源和升级的客户对话中学习业务。
联合创始人写道,企业最初使用 Decagon 代理来处理支持工单,而这些代理如今已经能够对潜在客户进行资格审查、为客户进行入职、收取付款并发展关系。这四项发布扩展了客户接触 Decagon 所称的 AI 礼宾服务以及其能为客户提供的功能。
Voice 3 与 Chord 语音模型
Chord 是 Decagon Labs 训练的首个语音模型,公司表示该模型在真实的客户体验对话上进行后训练,而非针对大多数语音模型所覆盖的广泛用途,如有声书朗读或电子游戏配音。Decagon 称该模型能够逐句塑造语音,在读取确认码或电话号码时放慢速度,然后恢复对话节奏,而不是依赖统一的全局语速设置。现有的语音定制控制仍然适用:语音选择、业务专有词汇的发音,以及针对业务调校的语调。
根据公告,Voice 3 支持超过 70 种语言,无需团队为每种语言单独构建代理。它能够检测来电者的语言并自动切换,即使来电者在句子中途切换语言也能应对。Decagon 表示,其针对不同地区的语音反映了各市场的语言习惯,并在发布前由母语者进行验证。
Decagon 表示,Chord 基于已获授权的数据和经同意的配音人才进行训练,绝不使用客户拥有的数据。德国电信的数字服务通信负责人 Christian Niedworok 在公告中指出,多年的 IVR 系统让客户习惯于用简短片段来尝试接通人工,而 Decagon 的语音听起来仿佛真的在倾听,并在工作时保持对话的流畅,而不是在处理时沉默。Chime 首席运营官 Janelle Sallenave 表示,Decagon Voice 让 Chime 能够将高性能与无缝品牌定制相结合,并具备跨渠道记忆,确保每次互动都保持连贯,忠实于其以会员为先的价值观。
训练流水线与基础模型
Samuel Zhang(Decagon 技术团队专注于代理编排的成员)撰写的 配套文章 介绍了 Chord 的构建方式。其训练流水线旨在保留真实对话的质感,包括节奏变化、自然重音、停顿以及填充词,而不是将录音清理成均匀的朗读——该帖子称这种做法会使声音听起来合成。两种方法支持这一思路:一种是逐字转录流程,保留节奏、重音和不流畅之处;另一种是录音方法,将脚本内容与自由对话的自然性相结合,而非声优的表演式朗读。
对于基础模型,Decagon 对一个无分词器的扩散模型进行了后训练。该帖子认为,将音频离散为令牌会在每一步令牌化过程中丢失信息,而无令牌的表示方式接近无损,保留了细微的细节,使得声音从仅可理解提升为具有现场感。帖子还指出,这使得模型的可控性大幅提升,Decagon 能够精准地塑造情感、节奏和重音。在生产环境中,Chord 通过 Modal 提供服务。
双工架构
Decagon 表示,大多数语音代理采用级联流水线:语音转文本转录来电者的内容,大型语言模型决定回复内容,文本转语音输出回复,每个阶段都会增加延迟,且各阶段的协同使得自然的轮流对话变得困难。Voice 3 用双工架构取代了这种安排,两个层级并行运行:低延迟的对话模型负责聆听和发声,从答案到进度更新;而更强大的模型在对话背后处理推理、工具调用以及安全防护。
公司称,该代理在发声的同时仍能处理来音,因此当来电者说 \”mhm\” 时仍可继续对话,但在真正的打断出现时会让出。它在长时间查询期间会叙述进度,在任务仍在运行时回答后续问题,并在两者之间处理较小的请求,而不是让来电者陷入沉默或等待状态。
公司报告的评估结果
Zhang 的帖子报告了电信、金融服务以及旅游和酒店行业的客户,这些客户将现成语音切换为 Chord 上的语音,比较了仅更换语音前后的相同程序。Decagon 报告称,所有案例的解决率均有所提升:电信客户提升了 6.1 点,金融服务提供商提升了 7.1 点,旅游品牌提升了 2.6 点。Decagon 将 Barge 率定义为来电者唯一目标是接通人工的通话比例,该比例在三个客户中分别下降了 14.5、6.1 和 5.3 点。
在针对三种声音的盲听测试中,听众听到了同一音频样本,分别由 Chord 和其模型所基于的真人配音各朗读一次,并被要求判断哪一个是 AI。Decagon 报告称,45.7% 的听众认为真实的人声是 AI,公司将这一结果形容为接近 50‑50 的硬币抉择,双方几乎无法区分。Voice 3 的公告将该结果概括为约 90% 的用户无法辨别。
Decagon 还报告了一项偏好测试,将 Chord 与其称为领先的另外三种语音模型进行正面对决,使用相同的文字由各模型朗读,听众被要求选择在遇到问题时最想与之交谈的声音。在 185 名听众中,公司称 Chord 总体排名第一,获得 36.2% 的选择率,单轮最高可达 48.4%。
展望未来,Decagon 表示更困难且更有价值的问题在于语音在真实对话中的表现,包括它是否能在五分钟内赢得信任,以及在通话出现混乱时是否仍能保持稳定。公司将 Chord 描述为 Decagon Labs 核心赌注的最新体现:在客户互动中,针对特定任务微调的模型优于为所有任务构建的通用前沿模型。












