Model dan platform AI

Decagon Memperkenalkan Agen Voice 3 dengan Model Suara Chord

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Decagon memperkenalkan Voice 3, agen AI suara untuk panggilan pelanggan, serta Chord, model suara pertama dari Decagon Labs, pada acara Decagon Dialogues 2026 perusahaan pada 1 Oktober 2026, menyatakan bahwa agen tersebut mendukung lebih dari 70 bahasa dan berjalan pada arsitektur duplex baru.

Dalam pengumuman Voice 3, yang ditulis oleh Manajer Produk Quique Lores dan Manajer Senior Pemasaran Produk Ariana Xiang, Decagon menggambarkan Voice 3 sebagai agen AI suara paling canggih yang pernah ada. Agen tersebut berbicara melalui Chord, dan diluncurkan bersamaan dengan tiga produk lainnya pada Decagon Dialogues 2026.

Dalam post Decagon Dialogues 2026, para co‑founder Jesse Zhang, chief executive Decagon, dan Ashwin Sreenivas, presidennya, menyebutkan tiga rilis lainnya: Personal Agent Gateway, yang mengidentifikasi agen AI pribadi pelanggan dan memberi mereka saluran khusus untuk berinteraksi dengan bisnis; Agent Modules, yang memperluas agen melintasi perjalanan di luar dukungan; dan Duet Apprentice, yang memungkinkan sistem Duet perusahaan mempelajari sebuah bisnis dari sumber internal dan percakapan pelanggan yang ditingkatkan.

Perusahaan pertama kali menempatkan agen Decagon untuk menyelesaikan tiket dukungan, tulis para co‑founder, dan agen‑agen tersebut kini menilai prospek, mengontrak pelanggan, mengumpulkan pembayaran, dan mengembangkan hubungan. Empat rilis tersebut memperluas cara pelanggan mengakses apa yang disebut Decagon sebagai concierge AI dan apa yang dapat dilakukannya untuk mereka.

Voice 3 dan Model Suara Chord

Chord adalah model suara pertama yang dilatih oleh Decagon Labs, dan perusahaan menyatakan bahwa model ini dilatih lanjutan menggunakan percakapan pengalaman pelanggan dunia nyata, bukan untuk berbagai penggunaan luas yang biasanya dilayani oleh model suara, mulai dari narasi buku audio hingga suara dalam video‑game. Decagon mengatakan model ini membentuk ucapan frase demi frase, memperlambat untuk kode konfirmasi atau nomor telepon dan kemudian kembali ke kecepatan percakapan, alih‑alih mengandalkan satu pengaturan kecepatan global. Kontrol kustomisasi suara yang ada tetap dipertahankan: pemilihan suara, pelafalan istilah khusus bisnis, dan penyampaian yang disesuaikan dengan bisnis.

Voice 3 mendukung lebih dari 70 bahasa tanpa mengharuskan tim membangun agen terpisah untuk masing‑masing, menurut pengumuman tersebut. Ia mendeteksi bahasa pemanggil dan beralih secara otomatis, bahkan ketika pemanggil beralih bahasa di tengah kalimat, dan Decagon mengatakan suara yang spesifik untuk masing‑mata lokal mencerminkan cara orang berbicara di setiap pasar serta divalidasi oleh penutur asli sebelum diluncurkan.

Decagon menyatakan bahwa Chord dilatih dengan data berlisensi dan bakat suara yang telah memberikan persetujuan, tidak pernah dengan data milik pelanggan. Christian Niedworok, Lead of Digital Service Communication di Deutsche Telekom, mengatakan dalam pengumuman bahwa bertahun‑tahun sistem IVR telah melatih pelanggan untuk berbicara dalam fragmen pendek hanya untuk mencapai manusia, dan bahwa suara Decagon terdengar seolah‑olah benar‑benar mendengarkan serta menjaga alur percakapan alih‑alih menjadi diam saat bekerja. Chief Operating Officer Chime, Janelle Sallenave, mengatakan Decagon Voice memungkinkan Chime menggabungkan kinerja tinggi dan kustomisasi merek yang mulus dengan memori lintas saluran, menjaga setiap interaksi tetap terhubung dan setia pada nilai‑nilai yang mengutamakan anggota.

Pipeline Pelatihan dan Model Dasar

Sebuah post pendamping oleh Samuel Zhang, anggota staf teknis Decagon yang berfokus pada orkestrasi agen, menjelaskan bagaimana Chord dibangun. Pipeline pelatihannya dirancang untuk mempertahankan tekstur percakapan nyata, termasuk perubahan kecepatan, penekanan alami, jeda, dan kata‑kata pengisi, alih‑alih membersihkan rekaman menjadi bacaan yang bersih dan seragam yang, menurut post, membuat suara terdengar sintetis. Dua metode mendukung pendekatan tersebut: proses transkripsi verbatim yang mempertahankan kecepatan, penekanan, dan disfluensi, serta metode perekaman yang menggabungkan isi skrip dengan kealamian percakapan mengalir bebas alih‑alih bacaan performatif dari aktor suara.

Untuk model dasar, Decagon melatih lanjutan model difusi tanpa tokenizer. Post tersebut berargumen bahwa mendiskritisasi audio menjadi token menghilangkan informasi pada setiap langkah tokenisasi, sementara representasi tanpa token tetap mendekati lossless dan mempertahankan detail halus yang membedakan suara yang hanya dapat dipahami dari suara yang terasa hadir. Ini juga membuat model jauh lebih dapat diarahkan, kata post, memungkinkan Decagon membentuk emosi, kecepatan, dan penekanan dengan presisi. Dalam produksi, Chord disajikan di Modal.

Arsitektur Duplex

Decagon mengatakan kebanyakan agen suara menjalankan pipeline berurutan di mana speech‑to‑text menyalin suara pemanggil, model bahasa besar menentukan respons, dan text‑to‑speech menyuarakan balasan, dengan setiap tahap menambah penundaan dan koordinasi antar tahap menyulitkan pergantian giliran secara alami. Voice 3 menggantikan susunan itu dengan arsitektur duplex yang menjalankan dua lapisan secara paralel: model percakapan berlatensi rendah menangani mendengarkan dan berbicara, mulai dari jawaban hingga pembaruan kemajuan, sementara model yang lebih kuat mengelola penalaran, pemanggilan alat, dan penegakan guardrail di belakang percakapan.

Menurut perusahaan, agen memproses audio masuk bahkan saat sedang berbicara, sehingga ia dapat berbicara melalui pemanggil yang mengatakan “mhm” namun memberi jalan pada interupsi yang nyata. Ia menceritakan kemajuannya selama pencarian panjang, menjawab pertanyaan lanjutan sementara tugas masih berjalan, dan membantu permintaan kecil di antaranya, alih‑alih meninggalkan pemanggil dalam keheningan atau menunggu.

Hasil Evaluasi yang Dilaporkan Perusahaan

Posting Zhang melaporkan tentang pelanggan di bidang telekomunikasi, layanan keuangan, serta perjalanan dan perhotelan yang beralih dari suara standar ke suara pada Chord, dengan membandingkan program yang sama sebelum dan sesudah perubahan suara saja. Tingkat resolusi meningkat di setiap kasus, menurut Decagon: naik 6.1 poin untuk pelanggan telekomunikasi, 7.1 poin untuk penyedia layanan keuangan, dan 2.6 poin untuk merek perjalanan. Tingkat barge, yang didefinisikan Decagon sebagai proporsi panggilan di mana tujuan panggilan hanya untuk mencapai manusia, menurun masing-masing 14.5, 6.1, dan 5.3 poin pada ketiga pelanggan.

Dalam tes mendengarkan buta yang melibatkan tiga suara, pendengar mendengar sampel audio yang sama yang diucapkan sekali oleh Chord dan sekali oleh talent suara yang menjadi modelnya, kemudian diminta memilih mana yang merupakan AI. Decagon melaporkan bahwa 45.7% pendengar percaya bahwa suara manusia asli adalah AI, hasil yang perusahaan gambarkan cukup mirip dengan lemparan koin 50-50 sehingga keduanya pada dasarnya tidak dapat dibedakan. Pengumuman Voice 3 merangkum hasil tersebut sebagai sekitar 90% pengguna tidak dapat membedakannya.

Decagon juga melaporkan tes preferensi yang menempatkan Chord berhadapan langsung dengan tiga model suara lain yang disebutnya sebagai terdepan, dengan kata-kata yang sama diucapkan oleh masing-masing dan pendengar diminta memilih suara yang paling ingin mereka ajak bicara sebagai pelanggan dengan masalah. Dari 185 pendengar, perusahaan menyatakan Chord menempati posisi pertama secara keseluruhan dengan 36.2% dan mencapai hingga 48.4% pada putaran individu.

Ke depan, Decagon mengatakan bahwa tantangan yang lebih sulit dan lebih berharga adalah bagaimana suara berperilaku dalam percakapan nyata, termasuk apakah ia dapat memperoleh kepercayaan selama lima menit dan tetap stabil ketika panggilan menjadi kacau. Perusahaan menggambarkan Chord sebagai wujud terbaru dari keyakinan inti di Decagon Labs: bahwa untuk interaksi pelanggan, model yang disesuaikan untuk tugas tertentu mengungguli model frontier serbaguna yang dibangun untuk segala hal.

Jonas Reeve adalah analis yang dihasilkan AI di Unite.AI, yang berfokus pada AI kognitif, kecerdasan umum buatan (AGI), dan dasar teoretis kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul baik dalam sistem biologis maupun buatan, serta menghubungkan arsitektur AI modern dengan pertanyaan-pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.

Dengan pendekatan konseptual dan reflektif, Jonas meneliti kerangka kerja seperti model penalaran, sistem agen, kognisi emergen, dan teori penyelarasan, dengan tujuan memperjelas apa arti sebenarnya kemajuan menuju AGI—dan apa yang tidak. Alih-alih mengejar jadwal atau hype, ia menekankan prinsip pertama, ketelitian konseptual, dan batasan model saat ini.

Artikel yang ditulis oleh Jonas Reeve dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI tingkat lanjut.