Mô hình và nền tảng AI
Decagon giới thiệu Agent Voice 3 với Mô hình Giọng nói Chord

Decagon đã giới thiệu Voice 3, agent AI giọng nói dành cho các cuộc gọi khách hàng, và Chord, mô hình giọng nói đầu tiên của Decagon Labs, tại sự kiện Decagon Dialogues 2026 của công ty vào ngày 1 tháng 10 năm 2026, cho biết agent này hỗ trợ hơn 70 ngôn ngữ và chạy trên kiến trúc duplex mới.
Trong Thông báo Voice 3, do Quản lý Sản phẩm Quique Lores và Quản lý Tiếp thị Sản phẩm Cấp cao Ariana Xiang viết, Decagon mô tả Voice 3 là agent AI giọng nói tiên tiến nhất của mình cho đến nay. Agent này nói qua Chord, và được ra mắt cùng ba sản phẩm khác tại Decagon Dialogues 2026.
Trong Decagon Dialogues 2026 bài đăng, các đồng sáng lập Jesse Zhang, giám đốc điều hành của Decagon, và Ashwin Sreenivas, chủ tịch của công ty, đã nêu tên ba bản phát hành khác: Personal Agent Gateway, công cụ xác định các agent AI cá nhân của khách hàng và cung cấp cho họ kênh riêng để tương tác với doanh nghiệp; Agent Modules, mở rộng một agent qua các hành trình ngoài hỗ trợ; và Duet Apprentice, cho phép hệ thống Duet của công ty học một doanh nghiệp từ các nguồn nội bộ và các cuộc trò chuyện khách hàng được nâng cấp.
Các doanh nghiệp lần đầu tiên triển khai các agent Decagon để giải quyết các phiếu hỗ trợ, các đồng sáng lập viết, và những agent này hiện nay có thể xác định khách hàng tiềm năng, đưa khách hàng mới vào hệ thống, thu tiền và phát triển mối quan hệ. Bốn bản phát hành này mở rộng cách khách hàng tiếp cận những gì Decagon gọi là trợ lý AI và những gì nó có thể làm cho họ.
Voice 3 và Mô hình Giọng nói Chord
Chord là mô hình giọng nói đầu tiên được đào tạo bởi Decagon Labs, và công ty cho biết nó đã được đào tạo thêm dựa trên các cuộc trò chuyện thực tế của khách hàng, thay vì cho phạm vi sử dụng rộng rãi mà hầu hết các mô hình giọng nói phục vụ, từ lời đọc sách âm thanh đến lồng tiếng trò chơi video. Decagon cho biết mô hình này tạo hình giọng nói từng cụm từ, chậm lại khi phát mã xác nhận hoặc số điện thoại và sau đó trở lại tốc độ hội thoại, thay vì dựa vào một cài đặt tốc độ toàn cục. Các công cụ tùy chỉnh giọng nói hiện có vẫn được giữ lại: lựa chọn giọng, cách phát âm các thuật ngữ riêng của doanh nghiệp, và cách truyền tải được điều chỉnh phù hợp với doanh nghiệp.
Theo thông báo, Voice 3 hỗ trợ hơn 70 ngôn ngữ mà không yêu cầu các đội ngũ phải xây dựng một agent riêng cho mỗi ngôn ngữ. Nó phát hiện ngôn ngữ của người gọi và tự động chuyển đổi, ngay cả khi người gọi chuyển đổi ngôn ngữ giữa chừng câu, và Decagon cho biết các giọng nói đặc thù theo vùng địa phương phản ánh cách mọi người nói trong mỗi thị trường và đã được người bản ngữ xác nhận trước khi ra mắt.
Decagon cho biết Chord được đào tạo trên dữ liệu có giấy phép và giọng nói đã được đồng ý, không bao giờ sử dụng dữ liệu sở hữu của khách hàng. Christian Niedworok, Trưởng bộ phận Truyền thông Dịch vụ Kỹ thuật số tại Deutsche Telekom, nói trong thông báo rằng nhiều năm các hệ thống IVR đã đào tạo khách hàng nói thành các đoạn ngắn chỉ để tiếp cận nhân viên, và giọng nói của Decagon nghe như thể đang thực sự lắng nghe và duy trì cuộc trò chuyện thay vì im lặng khi đang xử lý. Giám đốc Vận hành của Chime, Janelle Sallenave, cho biết Decagon Voice cho phép Chime kết hợp hiệu suất cao và tùy chỉnh thương hiệu liền mạch với bộ nhớ đa kênh, giữ cho mọi tương tác luôn kết nối và phù hợp với giá trị đặt thành viên lên hàng đầu.
Quy trình Đào tạo và Mô hình Cơ sở
Một bài viết đi kèm của Samuel Zhang, thành viên trong đội kỹ thuật của Decagon chuyên về điều phối agent, mô tả cách Chord được xây dựng. Quy trình đào tạo của nó được thiết kế để bảo tồn kết cấu của cuộc trò chuyện thực tế, bao gồm việc thay đổi tốc độ, nhấn mạnh tự nhiên, các khoảng dừng và từ ngữ đệm, thay vì làm sạch các bản ghi thành dạng đọc đồng đều mà bài viết cho rằng làm cho giọng nói trở nên nhân tạo. Hai phương pháp hỗ trợ cách tiếp cận này: một quy trình sao chép nguyên văn giữ lại tốc độ, nhấn mạnh và các lỗi ngôn ngữ, và một phương pháp ghi âm kết hợp nội dung của kịch bản với tính tự nhiên của cuộc trò chuyện tự do thay vì đọc biểu diễn từ các diễn viên lồng tiếng.
Đối với mô hình cơ sở, Decagon đã đào tạo lại một mô hình khuếch tán không dùng tokenizer. Bài viết lập luận rằng việc phân đoạn âm thanh thành các token sẽ mất thông tin ở mỗi bước token hoá, trong khi biểu diễn không token giữ gần với độ mất mát không và bảo tồn chi tiết tinh tế phân biệt giữa một giọng chỉ nghe được và một giọng nghe như hiện hữu. Nó cũng làm cho mô hình dễ điều chỉnh hơn rất nhiều, theo bài viết, cho phép Decagon định hình cảm xúc, tốc độ và nhấn mạnh một cách chính xác. Trong môi trường sản xuất, Chord được cung cấp trên Modal.
Kiến trúc Duplex
Decagon cho biết hầu hết các agent giọng nói chạy một quy trình chuỗi gồm chuyển giọng nói thành văn bản để ghi lại lời gọi, một mô hình ngôn ngữ lớn quyết định cách phản hồi, và chuyển văn bản thành giọng nói để nói đáp, mỗi giai đoạn đều gây độ trễ và sự phối hợp giữa các giai đoạn làm cho việc luân phiên tự nhiên trở nên khó khăn. Voice 3 thay thế cấu trúc đó bằng một kiến trúc duplex chạy hai lớp song song: một mô hình hội thoại độ trễ thấp xử lý việc lắng nghe và nói, từ trả lời đến cập nhật tiến độ, trong khi một mô hình mạnh hơn quản lý suy luận, gọi công cụ và thực thi các rào cản bảo vệ phía sau cuộc trò chuyện.
Theo công ty, agent xử lý âm thanh đầu vào ngay cả khi đang nói, vì vậy nó có thể nói qua người gọi khi họ nói “mhm” nhưng sẽ nhường chỗ khi có sự ngắt lời thực sự. Nó mô tả tiến trình của mình trong các truy vấn dài, trả lời các câu hỏi tiếp theo trong khi một tác vụ vẫn đang chạy, và hỗ trợ các yêu cầu nhỏ hơn ở giữa, thay vì để người gọi im lặng hoặc chờ đợi.
Kết quả Đánh giá Báo cáo bởi Công ty
Bài đăng của Zhang báo cáo về các khách hàng trong lĩnh vực viễn thông, dịch vụ tài chính và du lịch – khách sạn đã chuyển từ giọng nói có sẵn sang giọng nói trên Chord, so sánh các chương trình giống nhau trước và sau khi chỉ thay đổi giọng nói. Tỷ lệ giải quyết tăng trong mọi trường hợp, Decagon cho biết: tăng 6,1 điểm cho khách hàng viễn thông, 7,1 điểm cho nhà cung cấp dịch vụ tài chính, và 2,6 điểm cho thương hiệu du lịch. Tỷ lệ “barge”, mà Decagon định nghĩa là tỷ lệ cuộc gọi mà mục tiêu duy nhất của người gọi là tiếp cận con người, đã giảm lần lượt 14,5, 6,1 và 5,3 điểm ở ba khách hàng.
Trong một bài kiểm tra nghe mù với ba giọng nói, người nghe nghe cùng một mẫu âm thanh được phát một lần bởi Chord và một lần bởi giọng nói mẫu mà nó được mô phỏng, sau đó được yêu cầu chọn giọng nào là AI. Decagon báo cáo rằng 45,7% người nghe tin rằng giọng người thật là AI, một kết quả mà công ty mô tả là đủ gần với xác suất 50-50 để hai giọng thực sự không thể phân biệt được. Thông báo về Voice 3 tóm tắt kết quả là khoảng 90% người dùng không thể nhận ra.
Decagon cũng báo cáo một bài kiểm tra sở thích trong đó Chord được so sánh trực tiếp với ba mô hình giọng nói khác mà công ty mô tả là hàng đầu, với cùng một đoạn văn được phát bởi mỗi mô hình và người nghe được yêu cầu chọn giọng mà họ muốn nói chuyện nhất khi là khách hàng gặp vấn đề. Trong số 185 người nghe, công ty cho biết Chord đạt vị trí thứ nhất tổng thể với 36,2% và lên tới 48,4% trong các vòng riêng lẻ.
Nhìn về phía trước, Decagon cho rằng vấn đề khó hơn và có giá trị hơn là cách một giọng nói hoạt động trong một cuộc trò chuyện thực tế, bao gồm việc nó có xây dựng được lòng tin trong vòng năm phút và duy trì hiệu suất khi cuộc gọi trở nên hỗn loạn hay không. Công ty mô tả Chord là biểu hiện mới nhất của quan điểm cốt lõi tại Decagon Labs: rằng trong các tương tác với khách hàng, một mô hình được tinh chỉnh cho một nhiệm vụ cụ thể sẽ vượt trội hơn so với mô hình đa năng tiên tiến được xây dựng cho mọi mục đích.












