Phỏng vấn

Nikola Mrksic, Đồng sáng lập và CEO của PolyAI – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nikola Mrksic là đồng sáng lập và CEO của PolyAI, một nhà cung cấp hàng đầu về trợ lý giọng nói cho dịch vụ khách hàng tự động.

Điều gì thu hút bạn đến với AI?

Tôi đã yêu thích toán học và khoa học máy tính từ rất sớm. Trong thời gian học tại Cambridge, tôi đã có cơ hội làm việc với một số nhà nghiên cứu hàng đầu về học máy, bao gồm Steve Young và Zoubin Ghahramani. Steve đã thuyết phục tôi tham gia công ty khởi nghiệp của ông, VocalIQ, để làm việc về xây dựng hệ thống đối thoại giọng nói. Sau đó, tôi đã làm luận án tiến sĩ với Steve, tập trung vào xây dựng các mô hình hiểu ngôn ngữ dựa trên dữ liệu hoạt động trên nhiều trường hợp và ngôn ngữ. Trí tuệ đối thoại là một lĩnh vực công việc thực sự khó khăn và phức tạp, với nhiều đột phá khoa học và kỹ thuật vẫn còn phía trước, và nó đã giữ tôi bận rộn từ đó.

Vào năm 2017, bạn đã ra mắt PolyAI, một công ty trí tuệ đối thoại, bạn có thể thảo luận về câu chuyện khởi nguồn đằng sau PolyAI?

Các đồng sáng lập của tôi, Shawn Wen, Eddy Su và tôi đã làm luận án tiến sĩ tại Cambridge cùng thời điểm. Chúng tôi đã làm việc trên các hệ thống đối thoại trong nhiều năm, nhưng chúng tôi sớm nhận ra rằng các hệ thống tinh vi mà chúng tôi đã quen làm việc không có nhiều ứng dụng thương mại. Vì vậy, chúng tôi đã cùng nhau tạo ra một giải pháp trí tuệ đối thoại sẽ có lợi trong thế giới thực. Chúng tôi đã nhìn thấy một cơ hội cho các hệ thống đối thoại thực sự, đa lượt, giao dịch có thể tương tác với con người trong cuộc sống hàng ngày.

Chúng tôi tập trung vào dịch vụ khách hàng vì chúng tôi cảm thấy rằng các khả năng công nghệ và yêu cầu của khách hàng đã được kết hợp tốt.

Bạn có thể thảo luận về một số công nghệ học máy và xử lý ngôn ngữ tự nhiên được sử dụng?

Bí quyết chính của chúng tôi là tập hợp các mô hình mã hóa độc quyền khác nhau. Chúng tôi đã tiền huấn luyện chúng trên hàng tỷ cuộc trò chuyện tự nhiên, vì vậy chúng có thể trích xuất ý định ngay cả khi đầu vào giọng nói sử dụng tiếng lóng hoặc thành ngữ ví dụ. Điều này cực kỳ quan trọng khi giao tiếp qua điện thoại. Khách hàng không nói bằng từ khóa; họ kể câu chuyện, ngắt lời, hỏi câu hỏi và nói chung là muốn kiểm soát cuộc trò chuyện.

Chúng tôi đã công bố mô hình ConVEx của mình, một trình trích xuất thực thể cực kỳ hiệu quả về dữ liệu, cho phép chúng tôi trích xuất giá trị từ các cuộc trò chuyện một cách chính xác.

Quy trình sắp xếp ASR của chúng tôi bao gồm việc sử dụng các nền tảng nhận dạng giọng nói tinh chỉnh để trung hòa tiếng ồn gây ra bởi các giọng nói khác nhau, cũng như tinh chỉnh cho các ngữ cảnh khác nhau.

Chúng tôi cũng đã phát triển một thư viện chính sách đối thoại khá mạnh mẽ với các trường hợp sử dụng được thiết kế sẵn bao gồm tất cả các giao dịch dịch vụ khách hàng phổ biến, vì vậy chúng tôi có thể khởi chạy một trợ lý giọng nói mới cho khách hàng cực kỳ nhanh chóng.

Theo quan điểm của bạn, điều gì phân biệt một sản phẩm trí tuệ đối thoại tốt với một sản phẩm trí tuệ đối thoại kém?

Một sản phẩm tốt sẽ hiểu nhất quán những gì người dùng muốn và sẽ không bao giờ yêu cầu người dùng lặp lại mình. Cuộc gọi thường diễn ra trong môi trường ồn ào, vì vậy sản phẩm cần phải có khả năng chống lại các đầu vào hỗn loạn. Khi các thương hiệu tiếp cận với thị trường lớn, sản phẩm cần phải hiểu nhiều giọng nói và cách diễn đạt ý định khác nhau. Cả hai điều này đều yêu cầu sản phẩm phải đảm bảo khả năng nhận dạng giọng nói mạnh mẽ, phân loại ý định và trích xuất thực thể.

Một sản phẩm tuyệt vời sẽ tham gia tích cực với người dùng. Nó sẽ theo dõi dòng suy nghĩ của người dùng và có thể xử lý các trường hợp phức tạp, hàng ngày, nơi người dùng có thể chia sẻ nhiều ý định và thông tin đồng thời, và họ có thể nhảy giữa các ngữ cảnh khác nhau. Điều đó đòi hỏi phân loại đa nhãn và quản lý ngữ cảnh mạnh mẽ.

Một sản phẩm hấp dẫn sẽ thể hiện các đặc điểm của con người mà không bị giả tạo hoặc quá robot. Điều này có nghĩa là tương tác nhanh chóng, giọng nói chân thực, tín hiệu phản hồi liên tục và một mức độ ngẫu nhiên và không hoàn hảo.

Cuối cùng, một sản phẩm trí tuệ đối thoại tuyệt vời sẽ tương tác với người dùng ở bất cứ nơi nào họ là và cung cấp một trải nghiệm liền mạch, cụ thể cho từng nền tảng, có thể bao gồm giọng nói, SMS, trò chuyện hoặc tin nhắn xã hội. Mô hình tương tác nên chấp nhận sự đặc biệt của từng nền tảng giao tiếp.

Điều gì là lợi thế của các công ty sử dụng trí tuệ đối thoại thay vì cố gắng chuyển hướng các yêu cầu đến rô-bốt trò chuyện?

Trải nghiệm khách hàng là rất quan trọng và đã trở thành một yếu tố quan trọng cho việc giữ chân khách hàng. Ưu tiên hàng đầu nên là làm cho khách hàng dễ dàng thực hiện những gì họ cần làm.

Điện thoại vẫn là kênh liên lạc được khách hàng ưa chuộng nhất. Lên đến 65% tất cả các tương tác của khách hàng vẫn diễn ra qua điện thoại. Trong đại dịch COVID-19, các trung tâm liên lạc đã bị đẩy đến cực hạn với nhiều khách hàng hơn bao giờ hết gọi để được hỗ trợ.

Tất nhiên, một trải nghiệm tuyệt vời cho phép khách hàng giao tiếp theo bất kỳ cách nào họ muốn, vì vậy đối với bất kỳ ai thích giao tiếp không đồng bộ, chúng tôi giúp các thương hiệu cung cấp cùng mức độ trải nghiệm trên các kênh văn bản.

Độ khó của việc phát hiện ý định của khách hàng là gì?

Có một số thách thức khi hiểu khách hàng qua các kênh giọng nói. Hiểu chính xác và nhất quán ý nghĩa của người dùng đòi hỏi nhiều thành phần phải hoạt động tốt cùng nhau.

Trước hết, nhận dạng giọng nói là khó khăn, đặc biệt là khi mọi người gọi từ các môi trường ồn ào như khi họ đang sử dụng loa hoặc khi lái xe qua giao thông hoặc đường hầm. Nhận dạng giọng nói cũng có thể khó khăn ở các khu vực có giọng nói và phương ngữ khác nhau. Chúng tôi đã phát triển một cách hiệu quả để thiên vị các mô hình nhận dạng giọng nói cho ngữ cảnh đã cho để tối ưu hóa nhận dạng giọng nói.

Vì mô hình ConveRT của chúng tôi đã được đào tạo trên một lượng lớn dữ liệu trò chuyện, nó có thể phát hiện ý định trên các tín hiệu yếu, giống như con người chúng ta thường hiểu những gì ai đó nói, ngay cả khi chúng ta bỏ lỡ một hoặc hai từ.

Một yếu tố khác cần xem xét là hiểu khi người dùng muốn thực hiện nhiều hành động cùng một lúc. Ví dụ, ai đó có thể nói, “Tôi đã mất thẻ. Bạn có thể cho tôi biết nếu nó đã được sử dụng và chặn nó không?” Trong trường hợp này, mô hình cần nhận ra hai ý định và thực hiện chúng theo một thứ tự có ý nghĩa.

Mô hình cũng cần có khả năng trích xuất và hiểu các thực thể được khách hàng cung cấp. Ví dụ, “Bạn có một bàn cho bữa trưa thứ Bảy cho tôi, vợ tôi và hai đứa con của chúng tôi không?” Ở mức độ bề mặt, ý định ở đây là kiểm tra khả năng có một bàn, nhưng mô hình cần chọn ngày (thứ Bảy) và số lượng người (4) và bất kỳ thông tin nào khác có thể liên quan (có thể trẻ em chỉ được phép trong khu vực nhà hàng và không thể ngồi ở quầy bar).

Cuối cùng, cuộc trò chuyện không phải lúc nào cũng tuyến tính. Khách hàng có thể ngắt lời với các câu hỏi không liên quan đến lời nhắc của trợ lý giọng nói, vì vậy trợ lý cần phải “nghe” một loại đầu vào, trong khi vẫn mở để các kích hoạt khác nhau như Câu hỏi thường gặp hoặc thay đổi thông tin đã được người dùng cung cấp trước đó.

Quy trình và thời gian cần thiết cho một công ty muốn ra mắt một bot trí tuệ đối thoại với PolyAI là gì?

Chúng tôi ở đây để cung cấp các trợ lý giọng nói có tác động kinh doanh thực sự. Vì vậy, chúng tôi bắt đầu mọi tương tác với một quá trình khám phá, nơi chúng tôi giúp khách hàng xác định và diễn đạt các mục tiêu CX, chỉ số chính và quy trình hỗ trợ. Đây là nơi chúng tôi xác định các hành trình mà trợ lý giọng nói sẽ cần hướng dẫn khách hàng. Điều này, cùng với mô hình ConveRT đã được đào tạo trước của chúng tôi, có nghĩa là chúng tôi không cần một lượng lớn dữ liệu trò chuyện từ khách hàng.

Từ đó, chúng tôi có thể phát triển một trợ lý giọng nói với rất ít đầu vào cần thiết từ khách hàng, vì vậy nó không đòi hỏi nhiều từ các đội IT trong nhà.

Tùy thuộc vào độ phức tạp, chúng tôi có thể tạo ra một bằng chứng về giá trị trong vòng 2 tuần và một triển khai hoàn chỉnh trong 2 tháng.

Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập PolyAI.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.