Lãnh đạo tư tưởng

Điều gì là thực và điều gì là ảo tưởng trong AI giọng nói

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vào năm 2024, nếu bạn gọi đến đường dây hỗ trợ của một công ty và được chuyển tới “đại lý giọng nói”, bạn sẽ nhận ra mình đang nói chuyện với một máy chỉ sau vài giây đầu tiên. Một vài giây im lặng giữa câu hỏi của bạn và câu trả lời của nó đã làm cho phần mềm ở phía bên kia trở nên rõ ràng. Hai năm và hàng tỷ đô la vốn đầu tư sau, những dấu hiệu nhận biết đó đang dần biến mất. Các hệ thống AI giọng nói tốt nhất hiện nay đủ xuất sắc để mọi người không thể nhận ra chúng trong các bài kiểm tra mù mắt không chỉ thỉnh thoảng, mà thường xuyên. Theo hầu hết các định nghĩa hiện hành, chúng ta đang chứng kiến AI giọng nói phá vỡ Kiểm tra Turing trong thực tế.

Tuy nhiên, cột mốc này cần được xem xét kỹ lưỡng vì các tuyên bố tương tự thường thiếu chi tiết. Khi một công nghệ vượt qua một ngưỡng như vậy, các lời quảng cáo thường vượt xa khả năng kỹ thuật, và AI giọng nói cũng không ngoại lệ. Tôi đã dành gần hai năm xây dựng các mô hình chuyển văn bản thành giọng nói và chuyển giọng nói thành giọng nói, gặp gỡ các khách hàng doanh nghiệp đang đánh giá hàng chục nhà cung cấp, với những tuyên bố gần như giống nhau. Một số tuyên bố ấy đứng vững trước sự kiểm chứng, nhưng phần lớn vẫn còn xa thực tế. Trong AI giọng nói, dưới đây là bảy huyền thoại tôi thường gặp nhất khi nói chuyện với khách hàng.

Huyền thoại #1: Mô hình lớn hơn không làm cho AI giọng nói trở nên nhân tính hơn

Giả định mặc định của ngành là quy mô giải quyết mọi vấn đề: đưa một mô hình ngôn ngữ lớn hơn vào vấn đề và đại lý sẽ trở nên nhân tính hơn. Thực tế không phải vậy, vì con người không xử lý cuộc trò chuyện như mô hình xử lý một lời nhắc, chúng ta can thiệp giữa chừng thay vì chờ một câu hoàn chỉnh. Một đại lý giọng nói chờ, xử lý rồi mới trả lời sẽ cảm giác robot dù đầu ra của nó có trôi chảy đến đâu, vì thời gian là yếu tố quyết định, không phải từ vựng. Các mô hình nhỏ, chuyên biệt, xử lý hội thoại thường ngày trong thời gian thực thường nghe tự nhiên hơn, chỉ mở rộng khi cần thiết đồng thời vẫn đủ nhanh để bắt kịp người gọi.

Huyền thoại #2: “Chúng tôi xử lý 90% cuộc gọi” thường có nghĩa là kiềm chế, không phải giải quyết

AI giọng nói vẫn dựa vào các tiêu chuẩn cụ thể để đánh giá hiệu suất và “giữ lại cuộc gọi” có lẽ là chỉ số gây hiểu lầm nhất. Chỉ số này đo phần trăm cuộc gọi được AI giọng nói xử lý mà không cần can thiệp của con người, và nó tồn tại vì hầu như không ai đặt câu hỏi tiếp theo rõ ràng: các cuộc gọi được giữ lại có thực sự được giải quyết không? Một cuộc gọi được giữ lại nếu khách hàng không được chuyển tới người thật; nó chỉ được giải quyết nếu vấn đề được khắc phục. Các nhà cung cấp thường nhấn mạnh chỉ số giữ lại vì con số này lớn hơn, nhưng nó không nói gì về việc triển khai có thực sự hoạt động hay không. Sự chênh lệch này là nguồn gốc của phần lớn thất vọng trong các dự án AI giọng nói doanh nghiệp. Hãy yêu cầu bất kỳ nhà cung cấp nào cung cấp tỷ lệ giải quyết thay vì, và bạn sẽ thấy cuộc trò chuyện thay đổi.

Huyền thoại #3: AI giọng nói giống người nhưng bịa đặt câu trả lời tệ hơn AI robot không trả lời

Có rất nhiều điều đáng yêu về AI nghe giống người, vì nó làm cho tương tác giọng nói trở nên tự nhiên thay vì robot. Nhưng mục tiêu thực sự là kết hợp sự ấm áp của con người với độ chính xác, vì một giọng nói nghe giống người và luôn đúng sẽ luôn thắng một giọng nói chỉ nghe giống người. Các mô hình giọng nói không dựa trên dữ liệu thực tế, chỉ dựa vào bộ nhớ huấn luyện nội bộ, có thể “ảo giác” trong 15 đến 30 phần trăm các cuộc gọi thực tế. Các hệ thống AI giọng nói dựa trên dữ liệu khách hàng và dữ liệu nền tảng thực tế cho mỗi phản hồi, thay vì để mô hình tự phát, sẽ ít có khả năng tự tin cung cấp thông tin sai cho người gọi, gây hiểu lầm. Nếu một nhà cung cấp không thể giải thích cách hệ thống của họ kiểm soát hiện tượng ảo giác, bạn chỉ nhận được một phần của lời hứa.

Huyền thoại #4: Trí tuệ cho giọng nói là về những gì bạn *không* lưu trữ, không phải những gì bạn làm

Sự ra mắt của ChatGPT đã gieo vào ngành công nghệ ý tưởng thống trị rằng nhiều tham số và nhiều dữ liệu huấn luyện sẽ dẫn đến trí tuệ tốt hơn và nhiều hơn. Nhưng con người không hoạt động như vậy và vì thế, mô hình này không phù hợp cho AI giọng nói. Chúng tôi không lưu giữ mọi thông tin từng nghe, mà chỉ giữ lại những gì quan trọng và để lại phần còn lại. Các mô hình ngôn ngữ lớn ngày nay lại làm ngược lại: chúng nén mọi thứ vào bên trong – đây là một trong những lý do nhu cầu trung tâm dữ liệu đang bùng nổ. Tuy nhiên, đối với phần lớn các trường hợp sử dụng giọng nói trong thực tế, như hỗ trợ khách hàng, phiên âm, hội thoại có cấu trúc, v.v., một mô hình nhỏ, tập trung thường thắng một mô hình đa năng hàng nghìn tỷ tham số về chi phí, độ trễ và thường cả độ chính xác.

Huyền thoại #5: Thay thế hoàn toàn nhân viên con người so với việc biết giới hạn của mình

Rõ ràng không ai muốn một giọng AI giả vờ tự tin chỉ để tránh thừa nhận mình không biết gì. Đó là lý do các triển khai thực sự mang lại giá trị mô phỏng cách một nhân viên con người giỏi hoạt động. Họ biết cách xử lý ngay những gì mình biết, và ngay khi gặp lĩnh vực chưa quen hoặc khách hàng khó tính, họ sẽ đưa ra dấu hiệu cảnh báo, đặt khách hàng vào trạng thái chờ ngắn gọn, tự nhiên, và chuyển sang mô hình lớn hơn hoặc nhân viên con người. Mục tiêu không bao giờ nên là tự động hoá 100 phần trăm. Cấu hình lý tưởng là một đại lý nhận ra, trong thời gian thực, giới hạn năng lực của chính mình, vì đó là yếu tố thực sự khiến nó an toàn khi triển khai ở quy mô lớn.

Huyền thoại #6: Giọng nói không tiêu diệt mọi giao diện khác, nó bổ trợ những gì chúng ta đã dùng

Có một giả định chung rằng khi AI giọng nói đủ tốt, việc gõ phím và màn hình sẽ dần biến mất. Tôi không tin chúng ta đang hướng tới việc không gõ phím, và màn hình cũng không biến mất; con người vẫn cần chúng để xem video, quét bảng điều khiển, hoặc xem xét thông tin một cách trực quan. Điều đang thay đổi là ngày càng nhiều tương tác hàng ngày của chúng ta với máy móc sẽ chuyển sang giọng nói, như cách nó đã diễn ra giữa con người, được xếp lớp trên các giao diện vẫn còn hợp lý. Giọng nói sẽ không thay thế mọi thứ; nó sẽ chỉ trở thành lựa chọn mặc định ở nhiều nơi hơn trước.

Huyền thoại #7: Kết nối một LLM với API Text-to-Speech có sẵn được tính là một đại lý giọng nói

Khi AI giọng nói trở thành yếu tố tạo nên sự khác biệt cho các thương hiệu tiêu dùng, nhiều “bọc đại lý giọng nói”, là các dịch vụ được xếp lớp trên hạ tầng hiện có để thương hiệu hoá hoặc thanh toán, có thể gây ấn tượng trong bản demo nhưng hiếm khi chịu được khối lượng thực tế của trung tâm cuộc gọi. Việc nối chuỗi chuyển giọng nói thành văn bản, một mô hình ngôn ngữ và chuyển văn bản thành giọng nói làm tăng độ trễ ở mỗi bước chuyển giao. Điều thực sự giữ cho một hệ thống hoạt động ở quy mô lớn không phải là lớp API, mà là kinh tế đơn vị khi chạy quy trình dưới tải và tối ưu hoá cấp chipset để duy trì tốc độ và chi phí hợp lý. Đó là công việc không hào nhoáng mà hầu hết các lớp bọc bỏ qua, và chính nó sẽ định hình thế hệ tiếp theo của trải nghiệm khách hàng.

Đường ranh giới quan trọng

Mỗi chu kỳ hype cuối cùng đều tạo ra hệ thống riêng để xác định ai là người nghiêm túc và ai chỉ đi theo xu hướng. Khi các giao diện giọng nói ngày càng khó phân biệt với con người ở đầu dây bên kia, sự khác biệt giữa các hệ thống được xây dựng để nghe đáng tin cậy và các hệ thống thực sự đáng tin cậy, sẽ trở nên quan trọng hơn rất nhiều so với hiện tại. Những công ty coi đây là một kỷ luật kỹ thuật ngay bây giờ, thay vì chỉ là một mục kiểm tra marketing, sẽ là những người khách hàng vẫn tin tưởng khi sự mới lạ phai nhạt.

Sudarshan Kamath là đồng sáng lập và Giám đốc điều hành của Smallest AI, mà ông đã thành lập vào năm 2023 để làm cho AI giọng nói nhanh, giá cả phải chăng và có thể tiếp cận ở quy mô lớn. Một cử nhân từ IIT Guwahati, ông đã dành hơn một thập kỷ để xây dựng các sản phẩm AI. Sudarshan dẫn dắt tầm nhìn, hướng đi và chiến lược lâu dài của công ty.