AI 모델 및 플랫폼
Decagon, Chord 음성 모델을 탑재한 Voice 3 에이전트 출시

Decagon은 2026년 10월 1일에 개최된 Decagon Dialogues 2026 행사에서 고객 통화를 위한 음성 AI 에이전트인 Voice 3와 Decagon Labs의 첫 번째 음성 모델인 Chord를 소개하며, 이 에이전트가 70개 이상의 언어를 지원하고 새로운 듀플렉스 아키텍처에서 실행된다고 발표했습니다.
Voice 3 발표에서 제품 관리자 Quique Lores와 수석 제품 마케팅 관리자 Ariana Xiang이 작성한 내용에 따르면, Decagon은 Voice 3을 현재까지 가장 진보된 음성 AI 에이전트라고 설명했습니다. 이 에이전트는 Chord를 통해 음성을 전달하며, Decagon Dialogues 2026 행사에서 다른 세 제품과 함께 출시되었습니다.
In the Decagon Dialogues 2026 포스트에서 공동 설립자이자 Decagon 최고경영자인 Jesse Zhang과 사장인 Ashwin Sreenivas는 다른 세 가지 출시 제품을 다음과 같이 소개했습니다: Personal Agent Gateway는 고객의 개인 AI 에이전트를 식별하고 비즈니스와 소통할 전용 채널을 제공합니다; Agent Modules는 지원을 넘어선 여정 전반에 걸쳐 에이전트를 확장합니다; 그리고 Duet Apprentice는 회사의 Duet 시스템이 내부 자원 및 확대된 고객 대화를 통해 비즈니스를 학습하도록 합니다.
기업들은 처음에 Decagon 에이전트를 활용해 지원 티켓을 해결했으며, 공동 설립자들은 이 에이전트가 이제는 잠재 고객을 선별하고, 고객을 온보딩하며, 결제를 수집하고, 관계를 성장시킨다고 적었습니다. 네 가지 출시 제품은 고객이 Decagon이 AI 컨시어지라고 부르는 서비스에 접근하고 그것이 제공할 수 있는 기능을 확대합니다.
Voice 3와 Chord 음성 모델
Chord는 Decagon Labs에서 훈련한 최초의 음성 모델이며, Decagon은 이 모델이 오디오북 내레이션이나 비디오 게임 보이스오버와 같은 대부분의 음성 모델이 지원하는 광범위한 용도 대신 실제 고객 경험 대화를 기반으로 추가 학습(post‑training)되었다고 밝혔습니다. Decagon에 따르면 모델은 구문별로 음성을 형성하여 확인 코드나 전화번호와 같은 경우에는 속도를 늦추고 이후 대화식 속도로 돌아가며, 하나의 전역 속도 설정에 의존하지 않습니다. 기존의 음성 맞춤 설정 기능도 그대로 유지됩니다: 음성 선택, 비즈니스 고유 용어 발음, 그리고 비즈니스에 맞춘 전달 방식.
Voice 3는 발표에 따르면 팀이 각각의 언어마다 별도의 에이전트를 구축할 필요 없이 70개 이상의 언어를 지원합니다. 발신자의 언어를 감지하고 자동으로 전환하며, 발신자가 문장 중간에 언어를 바꾸는 경우에도 대응합니다. Decagon은 각 지역별 음성이 해당 시장의 말투를 반영하고 출시 전에 원어민에 의해 검증된다고 말합니다.
Decagon은 Chord가 라이선스된 데이터와 동의받은 음성 인재를 기반으로 훈련되었으며, 고객이 소유한 데이터는 절대 사용되지 않았다고 밝힙니다. Deutsche Telekom의 디지털 서비스 커뮤니케이션 책임자 Christian Niedworok는 발표에서 수년간의 IVR 시스템이 고객을 짧은 조각으로 말하게 만들어 인간 상담원에 연결하려는 행동을 길러왔으며, Decagon의 음성은 실제로 듣고 있는 듯한 느낌을 주어 대화를 지속시키고 작업 중에 조용해지지 않는다고 말했습니다. Chime의 최고운영책임자 Janelle Sallenave는 Decagon Voice 덕분에 Chime이 높은 성능과 원활한 브랜드 맞춤화를 크로스채널 메모리와 결합하여 모든 상호작용을 연결하고 회원 우선 가치를 충실히 반영할 수 있게 되었다고 밝혔습니다.
학습 파이프라인 및 기본 모델
Samuel Zhang가 작성한 동반 포스트에서는 Decagon의 기술 직원으로 에이전트 오케스트레이션을 담당하는 그가 Chord가 어떻게 구축되었는지 설명합니다. 이 학습 파이프라인은 실제 대화의 질감—속도 변화, 자연스러운 강조, 멈춤, 그리고 채우기 말 등—을 보존하도록 설계되었으며, 녹음을 깨끗하고 균일하게 정제하여 음성을 인공적으로 만드는 방식을 피합니다. 두 가지 방법이 이 접근을 지원합니다: 속도와 강조, 그리고 비유창성을 보존하는 문자 그대로의 전사 과정, 그리고 스크립트 내용과 자유로운 대화의 자연스러움을 결합하는 녹음 방식으로, 성우의 연기식 읽기 대신에 구현됩니다.
기본 모델의 경우, Decagon은 토크나이저 없이 확산 모델을 사후 훈련했습니다. 해당 포스트에서는 오디오를 토큰으로 이산화하면 토큰화 단계마다 정보가 손실된다고 주장하며, 토큰이 없는 표현은 무손실에 가깝게 유지되어 단순히 이해 가능한 음성과 실제감 있는 음성을 구분하는 섬세한 디테일을 보존한다고 설명합니다. 또한 이 방식은 모델을 훨씬 더 제어하기 쉽게 만들어 Decagon이 감정, 속도, 강조를 정밀하게 조정할 수 있게 한다고 포스트는 말합니다. 실제 서비스에서는 Chord가 Modal에서 제공됩니다.
듀플렉스 아키텍처
Decagon에 따르면 대부분의 음성 에이전트는 발신자를 음성‑텍스트 변환으로 전사하고, 대형 언어 모델이 응답을 결정한 뒤, 텍스트‑음성 변환으로 답변을 말하는 연속 파이프라인을 사용합니다. 각 단계마다 지연이 발생하고 단계 간 조정으로 자연스러운 턴테이킹이 어려워집니다. Voice 3는 이러한 구조를 두 개의 레이어를 병렬로 실행하는 듀플렉스 아키텍처로 대체합니다: 저지연 대화 모델이 청취와 발화를 담당하여 답변 및 진행 상황 업데이트를 처리하고, 보다 강력한 모델은 대화 뒤에서 추론, 도구 호출 및 가드레일 적용을 관리합니다.
회사에 따르면 이 에이전트는 말하고 있는 중에도 들어오는 오디오를 처리하여, 발신자가 “음”이라고 말할 때는 계속 대화하지만 실제 중단이 발생하면 양보합니다. 긴 조회 과정에서 진행 상황을 설명하고, 작업이 진행 중일 때도 후속 질문에 답변하며, 그 사이에 작은 요청을 처리하여 발신자를 침묵이나 대기 상태에 두지 않습니다.
기업이 보고한 평가 결과
Zhang의 게시물은 통신, 금융 서비스, 여행 및 환대 분야 고객들이 기성 음성에서 Chord 기반 음성으로 전환했으며, 음성만 교체한 상태에서 동일한 프로그램을 전후 비교한 내용을 보고합니다. Decagon에 따르면 해결률이 모든 경우에서 증가했으며, 통신 고객은 6.1포인트, 금융 서비스 제공자는 7.1포인트, 여행 브랜드는 2.6포인트 상승했습니다. Decagon이 정의한 바와 같이 발신자가 인간과 연결되는 것만을 목표로 하는 통화 비율인 Barge 비율은 세 고객 모두에서 각각 14.5, 6.1, 5.3포인트 감소했습니다.
세 가지 음성에 대한 블라인드 청취 테스트에서 청취자들은 동일한 오디오 샘플을 Chord가 한 번, 그리고 이를 모델링한 인간 음성 재능이 한 번씩 들었으며, 어느 것이 AI인지 선택하도록 요청받았습니다. Decagon에 따르면 청취자 중 45.7%가 실제 인간 음성이 AI라고 판단했으며, 이는 회사가 50대 50 동전 던지기와 거의 차이가 없을 정도로 두 음성을 구별할 수 없다고 설명한 결과입니다. Voice 3 발표에서는 이 결과를 약 90%의 사용자가 구별하지 못했다고 요약했습니다.
Decagon은 또한 Chord를 선도적인 것으로 설명하는 다른 세 가지 음성 모델과 정면 대결시키는 선호도 테스트를 보고했으며, 각 모델이 동일한 문장을 말하고 청취자에게 문제를 가진 고객으로서 가장 대화하고 싶은 음성을 선택하도록 요청했습니다. 185명의 청취자를 대상으로 한 결과, Chord는 전체에서 36.2%로 1위를 차지했으며 개별 라운드에서는 최대 48.4%에 도달했다고 회사는 밝혔습니다.
앞으로를 내다보며 Decagon은 실제 대화 속에서 음성이 어떻게 행동하는지가 더 어렵고 가치 있는 문제이며, 5분 동안 신뢰를 얻는지와 통화가 복잡해질 때 버틸 수 있는지를 포함한다고 말합니다. 회사는 Chord를 Decagon Labs의 핵심 베팅을 가장 최근에 구현한 것으로 설명합니다. 즉, 고객 상호작용에서는 특정 작업에 맞게 미세 조정된 모델이 모든 용도를 위해 구축된 일반 목적의 최첨단 모델보다 뛰어나다는 것입니다.












