Pemimpin pemikiran
Agen Berbasis Suara yang Ditenagai AI untuk Perusahaan: Dua Tantangan Utama

Sekarang, lebih dari sebelumnya, adalah waktu yang tepat untuk sistem berbasis suara yang ditenagai AI. Bayangkan sebuah panggilan ke layanan pelanggan. Sebagai gantinya, semua kekakuan dan infleksibilitas akan hilang – suara robot yang kaku, menu yang terbatas seperti “tekan satu untuk penjualan”, pengalaman yang menjengkelkan yang membuat kita semua frustrasi dan berharap bisa berbicara dengan seorang agen manusia. (Atau, mengingat waktu tunggu yang lama yang diperlukan untuk dipindahkan ke agen manusia, membuat kita putus asa dengan panggilan tersebut.)
Tidak lagi. Kemajuan tidak hanya dalam model bahasa besar berbasis transformer (LLM) tetapi juga dalam pengenalan suara otomatis (ASR) dan sistem teks-ke-suara (TTS) berarti bahwa “agensi berbasis suara generasi berikutnya” sudah ada – jika Anda tahu bagaimana membangunnya.
Hari ini kita melihat tantangan yang dihadapi oleh siapa saja yang berharap membangun agen conversasi berbasis suara yang canggih.
Mengapa Suara?
Sebelum melompat, mari kita lihat daya tarik umum dan relevansi agen berbasis suara (dibandingkan dengan interaksi berbasis teks). Ada banyak alasan mengapa interaksi suara mungkin lebih sesuai daripada interaksi berbasis teks – ini dapat mencakup, dalam urutan yang meningkat:
-
Preferensi atau kebiasaan – berbicara mendahului perkembangan menulis secara historis
-
Input teks yang lambat – banyak orang dapat berbicara lebih cepat daripada mengetik
-
Situasi tanpa tangan – seperti mengemudi, berolahraga, atau mencuci piring
-
Buta huruf – setidaknya dalam bahasa yang dimengerti agen
-
Disabilitas – seperti kebutaan atau kekurangan kontrol motor non-vokal
Dalam era yang tampaknya didominasi oleh transaksi yang dimediasi oleh situs web, suara tetap menjadi saluran yang kuat untuk perdagangan. Misalnya, sebuah studi terbaru oleh JD Power tentang kepuasan pelanggan di industri hotel menemukan bahwa tamu yang memesan kamar mereka melalui telepon lebih puas dengan menginap mereka daripada mereka yang memesan melalui agen perjalanan online (OTA) atau langsung melalui situs web hotel.
Tapi respon suara interaktif, atau IVR untuk singkatnya, tidak cukup. Sebuah studi 2023 oleh Zippia menemukan bahwa 88% pelanggan lebih memilih panggilan suara dengan agen langsung daripada menavigasi menu telepon otomatis. Studi tersebut juga menemukan bahwa hal-hal yang paling menjengkelkan orang tentang menu telepon termasuk mendengarkan opsi yang tidak relevan (69%), ketidakmampuan untuk sepenuhnya menjelaskan masalah (67%), layanan yang tidak efisien (33%), dan opsi yang membingungkan (15%).
Dan ada keterbukaan untuk menggunakan asisten suara. Menurut sebuah studi oleh Accenture, sekitar 47% konsumen sudah nyaman menggunakan asisten suara untuk berinteraksi dengan bisnis dan sekitar 31% konsumen telah menggunakan asisten suara untuk berinteraksi dengan bisnis.
Apa pun alasan, bagi banyak orang, ada preferensi dan permintaan untuk interaksi lisan – selama itu alami dan nyaman.
Apa yang Membuat Agen Berbasis Suara yang Baik?
Secara kasar, agen berbasis suara yang baik harus merespons pengguna dengan cara yang:
-
Relevan: Berdasarkan pemahaman yang benar tentang apa yang dikatakan pengguna/maksud. Perhatikan bahwa dalam beberapa kasus, respon agen tidak hanya berupa jawaban lisan, tetapi juga tindakan melalui integrasi dengan backend (misalnya, benar-benar memesan kamar hotel ketika pengguna mengatakan “Lanjutkan dan pesan”).
-
Akurat: Berdasarkan fakta (misalnya, hanya mengatakan bahwa ada kamar tersedia di hotel pada tanggal 19 Januari jika memang ada)
-
Jelas: Respon harus dapat dipahami
-
Tepat waktu: Dengan latensi yang seperti yang diharapkan dari manusia
-
Aman: Tidak ada bahasa yang ofensif atau tidak pantas, pengungkapan informasi yang dilindungi, dll.
Masalahnya
Sistem otomatis berbasis suara saat ini mencoba memenuhi kriteria di atas dengan mengorbankan a) sangat terbatas dan b) sangat menjengkelkan untuk digunakan. Bagian dari ini adalah hasil dari harapan yang tinggi yang ditetapkan oleh konteks percakapan suara, dengan harapan tersebut hanya meningkat semakin tinggi kualitas suara dalam sistem TTS menjadi tidak dapat dibedakan dari suara manusia. Tapi harapan tersebut hancur dalam sistem yang saat ini diterapkan. Mengapa?
Dalam satu kata – infleksibilitas:
-
Bicara yang terbatas – pengguna biasanya dipaksa untuk mengatakan hal-hal secara tidak alami: dalam frasa pendek, dalam urutan tertentu, tanpa informasi yang tidak perlu, dll. Ini menawarkan sedikit atau tidak ada kemajuan dari sistem menu berbasis nomor lama
-
Konsep “bicara yang diterima” yang sempit dan tidak inklusif – toleransi rendah untuk bahasa gaul, uhms dan ahs, dll.
-
Tidak ada kemunduran: Jika sesuatu salah, mungkin ada sedikit kesempatan untuk “memperbaiki” atau memperbaiki potongan informasi yang bermasalah, tetapi harus memulai dari awal, atau menunggu transfer ke agen manusia.
-
Pergantian giliran yang ketat – tidak ada kemampuan untuk memotong atau berbicara dengan agen
Tidak perlu dikatakan bahwa orang-orang menemukan batasan ini menjengkelkan atau frustrasi.
Solusinya:
Kabar baiknya adalah bahwa sistem AI modern cukup kuat dan cepat untuk secara signifikan memperbaiki pengalaman di atas, alih-alih mendekati (atau melebihi!) standar layanan pelanggan berbasis manusia. Ini disebabkan oleh beberapa faktor:
-
Perangkat keras yang lebih cepat dan lebih kuat
-
Peningkatan dalam ASR (akurasi yang lebih tinggi, mengatasi kebisingan, aksen, dll.)
-
Peningkatan dalam TTS (suara yang terdengar alami atau bahkan dikloning)
-
Kedatangan LLM generatif (percakapan yang terdengar alami)
Poin terakhir itu adalah perubahan permainan. Wawasan kunci adalah bahwa model prediktif yang baik dapat berfungsi sebagai model generatif yang baik. Sebuah agen buatan dapat mendekati kinerja percakapan manusia jika mengatakan apa yang diprediksi oleh LLM yang cukup baik sebagai hal yang paling mungkin dikatakan oleh agen layanan pelanggan manusia yang baik dalam konteks percakapan yang diberikan.
Tanda kedatangan puluhan startup AI yang berharap memecahkan masalah agen conversasi berbasis suara hanya dengan memilih dan menghubungkan modul ASR dan TTS yang siap pakai ke inti LLM. Dalam pandangan ini, solusinya hanya masalah memilih kombinasi yang meminimalkan latensi dan biaya. Dan tentu saja, itu penting. Tapi apakah itu cukup?
Tidak Terlalu Cepat
Ada beberapa alasan spesifik mengapa pendekatan sederhana itu tidak akan berhasil, tetapi mereka berasal dari dua poin umum:
-
LLM sebenarnya tidak dapat, dengan sendirinya, menyediakan percakapan teks berbasis fakta yang baik seperti yang diperlukan untuk aplikasi perusahaan seperti layanan pelanggan. Jadi mereka tidak dapat, dengan sendirinya, melakukannya untuk percakapan berbasis suara.
-
Bahwa bahkan jika Anda melengkapi LLM dengan apa yang diperlukan untuk membuat agen conversasi teks yang baik, mengubahnya menjadi agen conversasi berbasis suara yang baik memerlukan lebih dari sekadar menghubungkannya ke modul ASR dan TTS terbaik yang dapat Anda beli.
Mari kita lihat contoh spesifik dari setiap tantangan ini.
Tantangan 1: Menjaga Kesadaran
Seperti yang sekarang banyak diketahui, LLM terkadang menghasilkan informasi yang tidak akurat atau ‘halusinasi’. Ini adalah bencana dalam konteks banyak aplikasi komersial, bahkan jika mungkin membuat aplikasi hiburan yang baik di mana akurasi mungkin tidak menjadi titik utama.
Bahwa LLM terkadang mengalami halusinasi hanya dapat dipahami, dengan refleksi. Ini adalah konsekuensi langsung dari menggunakan model yang dilatih pada data dari setahun (atau lebih) yang lalu untuk menghasilkan jawaban untuk pertanyaan tentang fakta yang tidak termasuk dalam data set (bagaimanapun besarnya) yang mungkin sudah usang setahun atau lebih. Ketika pengguna bertanya “Apa nomor keanggotaan saya?”, LLM yang sudah dilatih sebelumnya hanya dapat menghasilkan jawaban yang terdengar masuk akal, bukan jawaban yang akurat.
Cara paling umum untuk menangani masalah ini adalah:
-
Penghalusan: Latih LLM yang sudah dilatih lebih lanjut, kali ini pada semua data spesifik domain yang Anda inginkan untuk dapat dijawab dengan benar.
-
Teknik prompt: Tambahkan data/instruksi tambahan sebagai input ke LLM, selain riwayat percakapan
-
Generasi yang Diperkuat Pencarian (RAG): Seperti teknik prompt, kecuali data yang ditambahkan ke prompt ditentukan secara dinamis dengan mencocokkan konteks percakapan saat ini (misalnya, pelanggan telah bertanya “Apakah hotel Anda memiliki kolam renang?”) ke indeks yang dienkripsi yang mengkodekan data spesifik domain (yang termasuk, misalnya, file yang mengatakan: “Fasilitas yang tersedia di hotel: kolam renang, sauna, stasiun pengisian EV.”)
-
Kontrol berbasis aturan: Seperti RAG, tetapi apa yang ditambahkan ke (atau dikurangi dari) prompt tidak ditentukan oleh memori neural tetapi ditentukan oleh aturan yang dikodekan secara keras (dan ditulis tangan).
Perlu diingat bahwa satu ukuran tidak cocok untuk semua. Metode mana yang akan sesuai akan tergantung, misalnya, pada data spesifik domain yang memberikan informasi jawaban agen. Secara khusus, akan tergantung pada apakah data tersebut berubah sering (panggilan ke panggilan, misalnya – misalnya, nama pelanggan) atau hampir tidak pernah (misalnya, salam awal: “Halo, terima kasih telah menelepon Hotel Budapest. Bagaimana saya dapat membantu Anda hari ini?”). Penghalusan tidak akan sesuai untuk yang pertama, dan RAG akan menjadi solusi yang kikuk untuk yang terakhir. Jadi, setiap sistem yang berfungsi harus menggunakan berbagai metode ini.
Apa yang lebih, mengintegrasikan metode-metode ini dengan LLM dan satu sama lain dengan cara yang meminimalkan latensi dan biaya memerlukan rekayasa yang hati-hati. Misalnya, kinerja RAG model Anda mungkin ditingkatkan jika Anda menghaluskan untuk memfasilitasi metode tersebut.
Mungkin tidak mengejutkan bahwa masing-masing metode ini pada gilirannya memperkenalkan tantangan mereka sendiri. Misalnya, ambil penghalusan. Menghaluskan LLM yang sudah dilatih pada data spesifik domain Anda akan meningkatkan kinerjanya pada data tersebut, ya. Tapi penghalusan memodifikasi parameter (berat) yang merupakan dasar kinerja umum model yang sudah dilatih (yang mungkin cukup baik). Modifikasi ini menyebabkan penghapusan (atau “penghapusan bencana”) beberapa pengetahuan sebelumnya model. Ini dapat menyebabkan model memberikan respon yang tidak akurat atau tidak pantas (bahkan tidak aman). Jika Anda ingin agen Anda terus merespons dengan akurat dan aman, Anda memerlukan metode penghalusan yang memitigasi penghapusan bencana.
Tantangan 2: Endpointing
Menentukan kapan pelanggan selesai berbicara sangat penting untuk aliran percakapan yang alami. Demikian pula, sistem harus menangani interupsi dengan anggun, memastikan percakapan tetap kohesif dan responsif terhadap kebutuhan pelanggan. Mencapai ini hingga standar yang setara dengan interaksi manusia adalah tugas yang kompleks tetapi penting untuk menciptakan pengalaman percakapan yang alami dan menyenangkan.
Solusi yang efektif memerlukan perancang untuk mempertimbangkan pertanyaan-pertanyaan seperti:
-
Berapa lama setelah pelanggan berhenti berbicara sebelum agen memutuskan bahwa pelanggan telah selesai berbicara?
-
Apakah di atas tergantung pada apakah pelanggan telah menyelesaikan kalimat penuh?
-
Apa yang harus dilakukan jika pelanggan memotong agen?
-
Khususnya, apakah agen harus menganggap bahwa apa yang sedang dikatakannya tidak terdengar oleh pelanggan?
Masalah-masalah ini, yang sebagian besar terkait dengan waktu, memerlukan rekayasa yang hati-hati di luar yang terkait dengan membuat LLM memberikan respon yang benar.
Kesimpulan
Evolusi sistem berbasis suara yang ditenagai AI menjanjikan perubahan revolusioner dalam dinamika layanan pelanggan, menggantikan sistem telepon kuno dengan LLM, ASR, dan teknologi TTS canggih. Namun, mengatasi tantangan informasi yang halusinasi dan endpointing yang mulus akan menjadi kunci untuk menghadirkan interaksi suara yang alami dan efisien.
Mengotomatisasi layanan pelanggan memiliki kekuatan untuk menjadi perubahan permainan sejati untuk perusahaan, tetapi hanya jika dilakukan dengan benar. Pada tahun 2024, khususnya dengan semua teknologi baru ini, kita akhirnya dapat membangun sistem yang dapat terasa alami dan lancar dan memahami kita dengan baik. Dampak bersih akan mengurangi waktu tunggu dan meningkatkan pengalaman saat ini yang kita miliki dengan bot suara, menandai era transformasional dalam keterlibatan pelanggan dan kualitas layanan.













