AIモデルとプラットフォーム
Decagon、Chord音声モデル搭載のVoice 3エージェントを発表

Decagonは、顧客通話向けの音声AIエージェントであるVoice 3と、Decagon Labs初の音声モデルであるChordを、2026年10月1日に開催された同社のDecagon Dialogues 2026イベントで発表し、エージェントは70以上の言語をサポートし、新しいデュプレックスアーキテクチャ上で動作すると述べました。
Product Manager Quique Lores と Senior Product Marketing Manager Ariana Xiang が執筆した Voice 3 発表において、Decagon は Voice 3 を同社史上最も高度な音声 AI エージェントと説明しました。このエージェントは Chord を通じて音声を出し、Decagon Dialogues 2026 で他の 3 つの製品と同時に発売されました。
「Decagon Dialogues 2026の記事では、共同創業者でCEOのJesse Zhang氏と社長のAshwin Sreenivas氏が、他の3つのリリースを紹介した。Personal Agent Gatewayは顧客のパーソナルAIエージェントを特定し、ビジネスとやり取りする専用チャネルを提供する。Agent Modulesはサポートを超えるジャーニー全体にエージェントを拡張する。Duet Apprenticeは、同社のDuetシステムが社内リソースやエスカレーションされた顧客会話からビジネスを学習できるようにする。」
「共同創業者らは、企業が最初にDecagonエージェントをサポートチケットの解決に活用したと記し、現在ではそれらのエージェントがリードの選別、顧客のオンボーディング、支払いの回収、関係構築を行っているという。これら4つのリリースにより、顧客がDecagonが呼ぶAIコンシェルジュにアクセスし、同コンシェルジュが提供できる機能が拡大する。」
Voice 3とChord音声モデル
ChordはDecagon Labsが訓練した初の音声モデルで、同社はこれが広範な用途(オーディオブックの朗読やビデオゲームの音声など)向けではなく、実際の顧客体験会話に基づいてポストトレーニングされたと述べています。Decagonは、モデルがフレーズごとに音声を形作り、確認コードや電話番号の際には速度を落とし、会話的なペースに戻すと説明しています。従来の音声カスタマイズ機能は引き継がれ、音声の選択、ビジネス固有用語の発音、ビジネスに合わせた配信が可能です。
Voice 3は、チームが言語ごとに別々のエージェントを構築する必要なく、70以上の言語をサポートすると発表しました。発信者の言語を検出し、自動的に切り替えることができ、発信者が文の途中で言語を切り替えても対応します。また、Decagonは、ロケール別の音声が各市場での話し方を反映し、出荷前にネイティブスピーカーによって検証されていると述べています。
Decagonは、Chordがライセンスされたデータと同意を得た音声タレントで訓練されており、顧客所有のデータは使用していないと述べています。Deutsche Telekomのデジタルサービスコミュニケーション部門リーダーであるChristian Niedworokは、発表で、長年のIVRシステムが顧客に短い断片で話すよう訓練し、人間に繋がるだけの目的で話すようになっていると指摘し、Decagonの音声は実際に聞いているかのように感じられ、会話を止めずに進行させると述べました。Chimeの最高執行責任者であるJanelle Sallenaveは、Decagon VoiceによりChimeが高性能とシームレスなブランドカスタマイズをクロスチャネルメモリと組み合わせ、すべてのインタラクションをつなげ、メンバー第一の価値観に忠実に保てると語りました。
トレーニングパイプラインとベースモデル
「Samuel Zhang氏(Decagonのエージェントオーケストレーションを担当する技術スタッフ)が執筆した関連記事では、Chordがどのように構築されたかが説明されている。そのトレーニングパイプラインは、会話の実際の質感—ペースの変化、自然な強調、間、フィラー語—を保持するよう設計されており、録音をきれいに均一に整えることで声が合成的になるという投稿の指摘とは対照的である。このアプローチを支える2つの手法がある。1つはペーシング、強調、ディスフルエンシーを保持する逐語的文字起こしプロセス、もう1つはスクリプトの内容と自由な会話の自然さを組み合わせる録音手法で、声優による演技的な読み上げではない。」
ベースモデルについては、Decagonはトークナイザーフリーの拡散モデルをポストトレーニングしました。投稿では、音声をトークンに離散化すると各トークン化ステップで情報が失われるのに対し、トークンフリーの表現はロスレスに近く、音声が単に聞き取り可能であることと、臨場感のある音声を分ける微細なディテールを保持すると主張しています。また、モデルのステアラビリティが大幅に向上し、感情、ペース、強調を精密に形作ることが可能になると述べています。実運用では、ChordはModal上で提供されています。
デュプレックスアーキテクチャ
Decagonによれば、ほとんどの音声エージェントは、音声認識が発信者を文字起こしし、大規模言語モデルが応答を決定し、テキスト音声合成が返信を発声するというカスケード型パイプラインで動作し、各段階が遅延を生み、段階間の調整が自然なターンテイキングを困難にしています。Voice 3はこの構成を置き換え、2層を並列に動作させるデュプレックスアーキテクチャを採用しています。低遅延の会話モデルがリスニングとスピーキング(回答から進捗報告まで)を処理し、より強力なモデルが推論、ツール呼び出し、ガードレールの適用を会話の背後で管理します。
同社によれば、エージェントは発話中でも入力音声を処理できるため、発信者が「うん」と言っている間に話し続けつつ、実際の割り込みがあれば即座に譲ります。長時間の検索中は進捗をナレーションし、タスクが実行中でもフォローアップ質問に答え、間の小さなリクエストにも対応し、発信者を無音や保留状態に置かないようにします。
企業が報告した評価結果
Zhangの投稿は、通信、金融サービス、旅行・ホスピタリティの顧客が、既製の音声からChord上の音声へ切り替え、音声以外は同じプログラムで比較した結果を報告しています。Decagonによると、解決率はすべてのケースで上昇し、通信顧客で6.1ポイント、金融サービス提供者で7.1ポイント、旅行ブランドで2.6ポイント上がりました。Decagonが「Barge率」と定義する、発信者の唯一の目的が人間に接続することである通話の割合は、3つの顧客でそれぞれ14.5、6.1、5.3ポイント減少しました。
3つの音声を対象としたブラインドリスニングテストで、リスナーは同じ音声サンプルをChordが一度、そしてそれがモデル化された音声タレントが一度ずつ話すのを聞き、どちらがAIかを選ぶよう求められました。Decagonによると、リスナーの45.7%が実際の人間の声をAIだと判断し、同社はこの結果を50対50のコイン投げに近いほどで、実質的に区別できないと説明しています。Voice 3の発表では、約90%のユーザーが判別できなかったと要約されています。
Decagonは、Chordを他の3つの主要な音声モデルと正面対決させる好みテストも報告しています。各モデルが同じ語句を話し、リスナーは問題を抱える顧客として最も話したい声を選びました。185人のリスナーのうち、Chordは全体で36.2%の支持率で首位に立ち、個別ラウンドでは最大48.4%に達したと同社は述べています。
今後を見据えると、Decagonは、実際の会話の中で音声がどのように振る舞うか、例えば5分間で信頼を獲得できるか、通話が混乱した際に耐えられるかといった、より難しく価値のある課題が残っていると述べています。同社はChordをDecagon Labsの核心的な賭けの最新の具現化と位置付けており、顧客対応においては、特定のタスク向けにファインチューニングされたモデルが、あらゆる用途向けに構築された汎用的な最先端モデルよりも優れると説明しています。












