Lãnh đạo tư tưởng

Các đại lý giọng nói dựa trên trí tuệ nhân tạo cho doanh nghiệp: Hai thách thức chính

mm mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Giờ đây, hơn bao giờ hết, là thời điểm cho các hệ thống dựa trên giọng nói được hỗ trợ bởi trí tuệ nhân tạo. Hãy xem xét một cuộc gọi đến dịch vụ khách hàng. Sắp hết sự giòn giã và inflexibility – những giọng nói robot cứng nhắc, những menu hạn chế kiểu “nhấn một để bán” – những trải nghiệm khó chịu mà chúng ta đã từng phải trải qua khi cố gắng nói chuyện với một đại lý người thật. (Hoặc, cho dù thời gian chờ đợi để được chuyển đến một đại lý người thật có thể kéo dài – chúng ta đã từ bỏ cuộc gọi hoàn toàn.)

Không còn nữa. Những tiến bộ không chỉ trong các mô hình ngôn ngữ lớn dựa trên transformer (LLM) mà còn trong nhận dạng giọng nói tự động (ASR) và hệ thống văn bản-giọng nói (TTS) có nghĩa là “thế hệ tiếp theo” của các đại lý giọng nói đã có mặt – nếu bạn biết cách xây dựng chúng.

Hôm nay, chúng ta sẽ xem xét những thách thức mà bất kỳ ai hy vọng xây dựng một đại lý giọng nói dựa trên cuộc trò chuyện như vậy phải đối mặt.

Tại sao lại là giọng nói?

Trước khi bắt đầu, hãy xem xét nhanh những lợi ích và sự liên quan của các đại lý giọng nói (so với các tương tác dựa trên văn bản). Có nhiều lý do tại sao một tương tác giọng nói có thể phù hợp hơn một tương tác dựa trên văn bản – những lý do này bao gồm, theo thứ tự tăng dần về mức độ nghiêm trọng:

  • Sự ưa thích hoặc thói quen – nói chuyện xuất hiện trước khi viết về mặt phát triển và lịch sử

  • Nhập văn bản chậm – nhiều người có thể nói nhanh hơn họ có thể nhập văn bản

  • Tình huống không cần tay – như khi lái xe, tập thể dục hoặc làm việc nhà

  • Mất khả năng đọc viết – ít nhất là trong ngôn ngữ mà đại lý hiểu

  • Khuyết tật – như khiếm thị hoặc thiếu kiểm soát vận động không phải bằng giọng nói

Trong một thời đại dường như bị chi phối bởi các giao dịch được trung gian bởi trang web, giọng nói vẫn là một phương tiện mạnh mẽ cho thương mại. Ví dụ, một nghiên cứu gần đây của JD Power về sự hài lòng của khách hàng trong ngành khách sạn cho thấy rằng những khách hàng đã đặt phòng qua điện thoại có mức độ hài lòng cao hơn với chỗ ở của họ so với những người đã đặt qua một cơ quan du lịch trực tuyến (OTA) hoặc trực tiếp qua trang web của khách sạn.

Nhưng các phản hồi tương tác giọng nói, hoặc IVR, không đủ. Một nghiên cứu năm 2023 của Zippia cho thấy rằng 88% khách hàng thích cuộc gọi giọng nói với một đại lý người thật thay vì điều hướng một menu điện thoại tự động. Nghiên cứu cũng cho thấy rằng những điều khiến khách hàng khó chịu nhất về menu điện thoại bao gồm việc nghe các tùy chọn không liên quan (69%), không thể mô tả đầy đủ vấn đề (67%), dịch vụ không hiệu quả (33%) và các tùy chọn khó hiểu (15%).

Và có sự cởi mở để sử dụng các trợ lý giọng nói. Theo một nghiên cứu của Accenture, khoảng 47% người tiêu dùng đã thoải mái khi sử dụng các trợ lý giọng nói để tương tác với doanh nghiệp và khoảng 31% người tiêu dùng đã sử dụng một trợ lý giọng nói để tương tác với một doanh nghiệp.

Dù lý do là gì, đối với nhiều người, có sự ưa thích và nhu cầu về tương tác giọng nói – miễn là nó tự nhiên và thoải mái.

Điều gì tạo nên một đại lý giọng nói tốt?

Nói một cách đơn giản, một đại lý giọng nói tốt nên phản hồi người dùng theo cách:

  • Phù hợp: Dựa trên sự hiểu biết chính xác về những gì người dùng nói/muốn. Lưu ý rằng trong một số trường hợp, phản hồi của đại lý không chỉ là một câu trả lời bằng giọng nói, mà còn là một số hành động thông qua tích hợp với một backend (ví dụ: thực sự đặt một phòng khách sạn khi người gọi nói “Đặt nó”).

  • Chính xác: Dựa trên các sự kiện (ví dụ: chỉ nói rằng có một phòng trống tại khách sạn vào ngày 19 tháng 1 nếu thực sự có)

  • Rõ ràng: Phản hồi nên dễ hiểu

  • Đúng lúc: Với độ trễ mà một người sẽ mong đợi từ một người

  • An toàn: Không có ngôn ngữ xúc phạm hoặc không phù hợp, tiết lộ thông tin được bảo vệ, v.v.

Vấn đề

Các hệ thống tự động hóa giọng nói hiện tại cố gắng đáp ứng các tiêu chí trên với chi phí của a) rất hạn chế và b) rất khó chịu khi sử dụng. Một phần của điều này là kết quả của những kỳ vọng cao mà một ngữ cảnh trò chuyện giọng nói đặt ra, với những kỳ vọng đó chỉ tăng cao hơn khi chất lượng giọng nói trong các hệ thống TTS trở nên không thể phân biệt với giọng nói của con người. Nhưng những kỳ vọng đó bị thất vọng trong các hệ thống được triển khai rộng rãi hiện nay. Tại sao?

Trong một từ – inflexibility:

  • Giọng nói hạn chế – người dùng thường bị buộc phải nói những điều không tự nhiên: trong các cụm từ ngắn, theo một thứ tự nhất định, không có thông tin không cần thiết, v.v. Điều này không mang lại lợi thế nào so với hệ thống menu số cũ.

  • Khái niệm hẹp về “giọng nói chấp nhận được” – dung lượng thấp cho các từ lóng, uhms và ahs, v.v.

  • Không có khả năng quay lại: Nếu có điều gì đó sai, có thể không có nhiều cơ hội để “sửa chữa” hoặc sửa đổi thông tin có vấn đề, mà thay vào đó phải bắt đầu lại hoặc chờ đợi để được chuyển đến một đại lý người thật.

  • Quy tắc luân phiên nghiêm ngặt – không có khả năng ngắt lời hoặc nói với đại lý

Điều đó không cần nói rằng mọi người thấy những hạn chế này khó chịu hoặc khó chịu.

Giải pháp:

Tin tốt là các hệ thống AI hiện đại đủ mạnh và nhanh để cải thiện đáng kể những trải nghiệm trên, thay vì đạt (hoặc vượt!) tiêu chuẩn dịch vụ khách hàng của con người. Điều này là do một loạt các yếu tố:

  • Phần cứng nhanh hơn và mạnh hơn

  • Cải thiện ASR (độ chính xác cao hơn, vượt qua tiếng ồn, giọng nói, v.v.)

  • Cải thiện TTS (giọng nói tự nhiên hoặc thậm chí là giọng nói được nhân bản)

  • Sự xuất hiện của các mô hình ngôn ngữ lớn sinh (các cuộc trò chuyện nghe tự nhiên)

Điểm cuối cùng là một yếu tố thay đổi cuộc chơi. Ý tưởng chính là một mô hình dự đoán tốt có thể phục vụ như một mô hình sinh tốt. Một đại lý nhân tạo có thể đạt được hiệu suất trò chuyện gần như con người nếu nó nói bất cứ điều gì mà một mô hình ngôn ngữ lớn đủ tốt dự đoán là điều mà một đại lý dịch vụ khách hàng người thật tốt sẽ nói trong ngữ cảnh trò chuyện đã cho.

Hãy chào đón sự xuất hiện của hàng chục công ty khởi nghiệp AI hy vọng giải quyết vấn đề đại lý giọng nói dựa trên cuộc trò chuyện chỉ bằng cách chọn và kết nối các mô块 ASR và TTS ngoài hộp với một lõi LLM. Theo quan điểm này, giải pháp chỉ là vấn đề chọn một sự kết hợp tối thiểu hóa độ trễ và chi phí. Và当然, điều đó rất quan trọng. Nhưng liệu đó có đủ không?

Không quá nhanh

Có một số lý do cụ thể tại sao cách tiếp cận đơn giản đó sẽ không hoạt động, nhưng chúng bắt nguồn từ hai điểm chung:

  1. LLM thực sự không thể, bằng chính mình, cung cấp các cuộc trò chuyện văn bản dựa trên sự kiện của loại được yêu cầu cho các ứng dụng doanh nghiệp như dịch vụ khách hàng. Vì vậy, chúng không thể, bằng chính mình, làm điều đó cho các cuộc trò chuyện giọng nói.

  2. Ngay cả khi bạn bổ sung LLM với những gì cần thiết để tạo ra một đại lý trò chuyện văn bản tốt, việc chuyển đổi nó thành một đại lý giọng nói tốt đòi hỏi hơn là chỉ kết nối nó với các mô-đun ASR và TTS tốt nhất mà bạn có thể mua được.

Hãy xem xét một ví dụ cụ thể về mỗi một trong những thách thức này.

Thách thức 1: Giữ cho nó trở nên thật

Như đã được biết rộng rãi, LLM đôi khi tạo ra thông tin không chính xác hoặc “ảo giác”. Điều này là thảm họa trong ngữ cảnh của nhiều ứng dụng thương mại, ngay cả khi nó có thể tạo ra một ứng dụng giải trí tốt nơi độ chính xác có thể không phải là điểm then chốt.

Điều đó LLM đôi khi tạo ra ảo giác là điều có thể dự đoán được, khi phản ánh. Đó là một hậu quả trực tiếp của việc sử dụng các mô hình được đào tạo trên dữ liệu từ một năm (hoặc nhiều hơn) trước để tạo ra câu trả lời cho các câu hỏi về các sự kiện không phải là một phần của (hoặc được suy dẫn bởi) một tập dữ liệu (dù lớn đến đâu) có thể đã một năm hoặc nhiều hơn. Khi người gọi hỏi “Số thành viên của tôi là gì?”, một mô hình LLM đơn giản có thể chỉ tạo ra một câu trả lời nghe có vẻ hợp lý, không phải là câu trả lời chính xác.

Cách phổ biến nhất để giải quyết vấn đề này là:

  • Tinh chỉnh: Đào tạo mô hình LLM đã được đào tạo trước thêm, lần này trên tất cả dữ liệu cụ thể của miền mà bạn muốn nó có thể trả lời chính xác.

  • Kỹ thuật lời nhắc: Thêm dữ liệu / hướng dẫn bổ sung vào mô hình LLM, ngoài lịch sử trò chuyện

  • Sinh tăng cường bằng cách thu thập (RAG): Giống như kỹ thuật lời nhắc, ngoại trừ dữ liệu được thêm vào lời nhắc được xác định trên fly bằng cách phù hợp với ngữ cảnh trò chuyện hiện tại (ví dụ: khách hàng đã hỏi “Khách sạn của bạn có hồ bơi không?”) với một chỉ mục mã hóa được mã hóa của dữ liệu cụ thể của miền (bao gồm, ví dụ: một tệp nói: “Đây là các tiện ích có sẵn tại khách sạn: hồ bơi, phòng xông hơi, trạm sạc xe điện.”).

  • Kiểm soát dựa trên quy tắc: Giống như RAG, nhưng những gì được thêm vào (hoặc trừ đi) lời nhắc không được thu thập bởi một bộ nhớ thần kinh mà được xác định bởi các quy tắc mã hóa cứng (và mã hóa tay).

Lưu ý rằng một kích cỡ không phù hợp với tất cả. Phương pháp nào sẽ phù hợp sẽ phụ thuộc vào, ví dụ, dữ liệu cụ thể của miền đang thông báo cho câu trả lời của đại lý. Cụ thể, nó sẽ phụ thuộc vào việc liệu dữ liệu nói trên có thay đổi thường xuyên (gọi đến gọi – ví dụ: tên khách hàng) hay hầu như không bao giờ (ví dụ: lời chào ban đầu: “Xin chào, cảm ơn bạn đã gọi đến Khách sạn Budapest. Tôi có thể giúp bạn gì hôm nay?”). Tinh chỉnh sẽ không phù hợp cho trường hợp đầu tiên và RAG sẽ là một giải pháp vụng về cho trường hợp thứ hai. Vì vậy, bất kỳ hệ thống nào hoạt động sẽ phải sử dụng nhiều phương pháp này.

Hơn nữa, tích hợp các phương pháp này với LLM và với nhau theo cách tối thiểu hóa độ trễ và chi phí đòi hỏi kỹ thuật cẩn thận. Ví dụ, hiệu suất RAG của mô hình có thể được cải thiện nếu bạn tinh chỉnh nó để tạo điều kiện cho phương pháp đó.

Điều đó có thể không có gì ngạc nhiên khi mỗi phương pháp này lại đưa ra những thách thức của riêng nó. Ví dụ, hãy xem xét việc tinh chỉnh. Việc tinh chỉnh mô hình LLM đã được đào tạo trước của bạn trên dữ liệu cụ thể của miền sẽ cải thiện hiệu suất của nó trên dữ liệu đó, vâng. Nhưng việc tinh chỉnh sửa đổi các tham số (trọng số) mà cơ sở của hiệu suất chung (presumably khá tốt) của mô hình đã được đào tạo trước. Việc sửa đổi này do đó gây ra sự quên lãng (hoặc “quên lãng thảm khốc”) của một số kiến thức trước đó của mô hình. Điều này có thể dẫn đến mô hình đưa ra các phản hồi không chính xác hoặc không phù hợp (thậm chí không an toàn). Nếu bạn muốn đại lý của mình tiếp tục phản hồi chính xác và an toàn, bạn cần một phương pháp tinh chỉnh giảm thiểu sự quên lãng thảm khốc.

Thách thức 2: Endpointing

Xác định khi nào khách hàng đã ngừng nói là điều quan trọng để có dòng chảy trò chuyện tự nhiên. Tương tự, hệ thống phải xử lý các sự gián đoạn một cách nhẹ nhàng, đảm bảo rằng cuộc trò chuyện vẫn nhất quán và đáp ứng nhu cầu của khách hàng. Việc đạt được điều này lên đến tiêu chuẩn tương đương với tương tác của con người là một nhiệm vụ phức tạp nhưng thiết yếu để tạo ra các trải nghiệm trò chuyện tự nhiên và dễ chịu.

Một giải pháp hoạt động đòi hỏi các nhà thiết kế phải xem xét các câu hỏi như:

  • Bao lâu sau khi khách hàng ngừng nói thì đại lý nên chờ trước khi quyết định rằng khách hàng đã ngừng nói?

  • Liệu điều trên có phụ thuộc vào việc khách hàng đã hoàn thành một câu đầy đủ?

  • Nên làm gì nếu khách hàng ngắt lời đại lý?

  • Cụ thể, đại lý có nên giả định rằng những gì nó đang nói không được khách hàng nghe?

Những vấn đề này, phần lớn liên quan đến thời gian, đòi hỏi kỹ thuật cẩn thận hơn những gì liên quan đến việc đưa ra phản hồi chính xác của LLM.

Kết luận

Sự tiến hóa của các hệ thống dựa trên giọng nói được hỗ trợ bởi trí tuệ nhân tạo hứa hẹn một sự thay đổi cách mạng trong động lực học dịch vụ khách hàng, thay thế các hệ thống điện thoại cũ bằng các LLM, ASR và TTS tiên tiến. Tuy nhiên, việc vượt qua các thách thức về thông tin ảo giác và điểm cuối mượt mà sẽ là then chốt để cung cấp các tương tác giọng nói tự nhiên và hiệu quả.

Tự động hóa dịch vụ khách hàng có sức mạnh để trở thành một yếu tố thay đổi cuộc chơi thực sự cho các doanh nghiệp, nhưng chỉ khi nó được thực hiện đúng cách. Năm 2024, đặc biệt là với tất cả những công nghệ mới này, chúng ta cuối cùng có thể xây dựng các hệ thống có thể cảm thấy tự nhiên và trôi chảy và hiểu chúng ta một cách chắc chắn. Hiệu ứng ròng sẽ giảm thời gian chờ đợi và cải thiện trải nghiệm hiện tại mà chúng ta có với các bot giọng nói, đánh dấu một kỷ nguyên chuyển đổi trong sự tham gia của khách hàng và chất lượng dịch vụ.

Dr. Itamar Arel, hiện là CEO tại Tenyx, kết hợp nền tảng học thuật của mình với tư cách là một giáo sư trước đây tại Đại học Tennessee và phòng thí nghiệm AI của Stanford University với thành công trong lĩnh vực doanh nghiệp, đồng sáng lập các công ty tiên phong Binatix, Apprente (được McDonald’s và IBM mua lại) và Tenyx. Itamar gần đây đã giữ vị trí Phó Chủ tịch Công ty và trưởng bộ phận McD Tech Labs tại Tập đoàn McDonald’s và trưởng bộ phận Trí tuệ nhân tạo đối thoại tại IBM Watson Orders.

Dr. Ron Chrisley is currently Chief Scientific Advisor at Tenyx, which he co-founded in 2021. He received a BS in Symbolic Systems from Stanford, holds a doctorate from the University of Oxford, and is Professor of Cognitive Science and Artificial Intelligence at the University of Sussex. From 2019 to 2020, he was Visiting Scholar at Stanford’s Institute for Human-Centered AI.