Phỏng vấn
Sharone Ben-Levi, Phó Chủ tịch Kinh doanh Toàn cầu và Phát triển Kinh doanh, Trung tâm Liên lạc, AudioCodes – Loạt Phỏng vấn

Sharone Ben-Levi, Phó Chủ tịch Kinh doanh Toàn cầu và Phát triển Kinh doanh, Trung tâm Liên lạc, AudioCodes (AUDC ), là một giám đốc điều hành công nghệ truyền thông có kinh nghiệm với hơn 25 năm kinh nghiệm trong lĩnh vực bán hàng, tiếp thị, phát triển kinh doanh và đổi mới trung tâm liên lạc. Trong suốt sự nghiệp của mình, bao gồm hơn hai thập kỷ tại AudioCodes, ông đã nắm giữ một loạt các vị trí lãnh đạo cấp cao tập trung vào việc thúc đẩy tăng trưởng trên các giải pháp truyền thông doanh nghiệp, trải nghiệm khách hàng và công nghệ trung tâm liên lạc được hỗ trợ bởi AI. Trước khi gia nhập AudioCodes, ông đã làm việc tại NICE Systems, nơi ông đã tích lũy được kinh nghiệm quý giá trong việc tương tác với khách hàng và phần mềm doanh nghiệp. Trong suốt sự nghiệp của mình, Ben-Levi đã tập trung vào việc giúp các tổ chức hiện đại hóa các tương tác với khách hàng thông qua truyền thông đám mây, tự động hóa và AI đối thoại, khiến ông trở thành một giọng nói được công nhận trong sự tiến hóa của công nghệ trung tâm liên lạc.
AudioCodes là một công ty công nghệ truyền thông chuyên về giọng nói doanh nghiệp, trung tâm liên lạc và các giải pháp trải nghiệm khách hàng được hỗ trợ bởi AI. Được thành lập vào năm 1993, công ty đã phát triển từ một nhà cung cấp mạng giọng nói và cơ sở hạ tầng VoIP thành một nhà lãnh đạo trong lĩnh vực truyền thông giọng nói thông minh, giúp các tổ chức hiện đại hóa các tương tác của khách hàng và nhân viên trên các môi trường đám mây, hỗn hợp và tại chỗ. Danh mục sản phẩm của công ty bao gồm các nền tảng AI giọng nói, các giải pháp AI đối thoại, bộ điều khiển biên phiên, tích hợp giọng nói Microsoft Teams, các dịch vụ CPaaS và các công cụ hiện đại hóa trung tâm liên lạc. Thông qua các nền tảng như VoiceAI Connect và Live Hub, AudioCodes cho phép các doanh nghiệp triển khai các bot giọng nói, các đại lý AI, khả năng hỗ trợ đại lý, các giải pháp IVR đối thoại và các dịch vụ truyền thông thời gian thực trong khi tích hợp với cơ sở hạ tầng điện thoại và trung tâm liên lạc hiện có. Các công nghệ của công ty được sử dụng bởi các doanh nghiệp và nhà cung cấp dịch vụ trên toàn thế giới để cải thiện trải nghiệm khách hàng, tự động hóa các quy trình và hỗ trợ các sáng kiến chuyển đổi số.
Bạn đã dành hơn hai thập kỷ tại AudioCodes, phát triển từ kỹ sư hệ thống nhúng đến lãnh đạo các ứng dụng năng suất. Làm thế nào mà hành trình đó đã định hình quan điểm của bạn về những gì cần thiết để làm cho AI giọng nói đáng tin cậy trong các môi trường doanh nghiệp?
Tôi đã chứng kiến các giải pháp truyền thông doanh nghiệp từ nhiều góc độ khác nhau, và hành trình đó đã củng cố một bài học cốt lõi: độ tin cậy phải được xây dựng vào mọi lớp của hệ thống từ đầu.
Làm việc trên các hệ thống nhúng đã dạy tôi rằng quỷ nằm trong các chi tiết, các quyết định kỹ thuật nhỏ có tác động lớn trong các môi trường sản xuất. Độ trễ, chất lượng âm thanh, độ chính xác của chuyển đổi giọng nói, chuyển đổi tự nhiên và mọi yếu tố khác phải được thiết kế với độ tin cậy trong tâm trí, vì nếu bất kỳ yếu tố nào trong số đó thất bại, toàn bộ hệ thống sẽ thất bại. Bạn không thể tuyên bố rằng hệ thống AI giọng nói hoạt động nếu nó chỉ hoạt động trong điều kiện lý tưởng.
Chuyển sang lãnh đạo đã làm cho điều đó rõ ràng hơn. Các doanh nghiệp đang hỗ trợ hàng nghìn người dùng trên các cơ sở hạ tầng phức tạp với các yêu cầu thời gian hoạt động nghiêm ngặt. Một hệ thống hoạt động tốt trong một thử nghiệm nhưng suy giảm dưới tải thực không giải quyết được vấn đề.
Đó cuối cùng là điều mà sự nghiệp của tôi đã dạy tôi: tiêu chuẩn cho AI giọng nói trong doanh nghiệp là niềm tin. Và niềm tin chỉ được xây dựng khi các tổ chức có thể dựa vào hệ thống để thực hiện đáng tin cậy đủ để trở thành một phần của các quy trình kinh doanh quan trọng của họ.
Nhiều tổ chức đã thử nghiệm với các rô-bốt trò chuyện, nhưng giọng nói giới thiệu một lớp phức tạp khác. Những thách thức kỹ thuật lớn nhất khi chuyển từ các hệ thống AI dựa trên văn bản sang các hệ thống giọng nói đối thoại hoàn toàn là gì?
Thách thức lớn nhất là sự phức tạp của các môi trường giọng nói doanh nghiệp, thường bị phân mảnh thành các “hòn đảo” riêng biệt đòi hỏi sự trung gian giữa các giao thức điện thoại dựa trên SIP và các API dựa trên HTTP/SSE. Thậm chí còn liên quan đến con người. Rất ít kỹ sư biết cả SIP và HTTP/SSE. Ngoài ra, không giống như các hệ thống dựa trên văn bản, giọng nói đòi hỏi xử lý và dàn xếp thời gian thực, bao gồm cả việc chuyển đổi giữa các giao thức khác nhau để các hệ thống này có thể giao tiếp một cách mượt mà. Sự khẩn cấp và khả năng tương tác này làm cho việc cung cấp một trải nghiệm đối thoại mượt mà trở nên khó khăn hơn nhiều từ góc độ công nghệ. Độ trễ, tiếng ồn nền, giọng và tiếng nói đồng thời bây giờ được đưa vào hỗn hợp. Những biến số này không tồn tại với văn bản chỉ.
AudioCodes tập trung vào việc kết nối các hệ thống điện thoại truyền thống với các nền tảng AI hiện đại. Bạn có thể giải thích làm thế nào các giải pháp như VoiceAI Connect tích hợp cơ sở hạ tầng遗 sản với các mô hình AI tiên tiến không?
VoiceAI Connect là cầu nối liên kết các điểm liên lạc khách hàng truyền thống (số điện thoại, SIP trunk và điện thoại trung tâm liên lạc) trực tiếp với các nền tảng AI đối thoại của bên thứ ba như Google (GOOGL ) CX Agent Studio, Amazon (AMZN ) Lex, Microsoft Copilot và hơn 30 nền tảng khác. Nó xử lý việc dàn xếp giọng nói thời gian thực phức tạp, bao gồm cả chuyển đổi giọng nói sang văn bản và văn bản sang giọng nói cũng như định tuyến khuôn khổ bot, cho phép các doanh nghiệp kết hợp và dễ dàng kích hoạt giọng nói cho các bot AI được chọn của họ mà không cần từ bỏ các thiết lập điện thoại遗 sản của họ. Các nền tảng遗 sản thường thiếu tích hợp API từ máy chủ phương tiện của chúng với các dịch vụ AI giọng nói mới. Chúng tôi vượt qua điều này bằng cách kết nối với chúng thông qua các giao diện điện thoại SIP của chúng và kết nối với các giao diện AI hiện đại.
Các doanh nghiệp thường gặp khó khăn khi chuyển beyond các dự án thử nghiệm. Những rào cản kiến trúc hoặc hoạt động chính nào ngăn cản AI giọng nói mở rộng trên toàn bộ tổ chức?
AI giọng nói vẫn đang phát triển. Bằng thời gian một doanh nghiệp thử nghiệm một công nghệ AI, một công nghệ mới và tốt hơn sẽ xuất hiện. Vì AudioCodes tích hợp liên tục với các giải pháp AI giọng nói mới nhất, điều này cho phép doanh nghiệp kết hợp và tương lai hóa môi trường của mình. Tính dàn xếp của AudioCodes cho phép họ thử các bot khác nhau cho các mục đích khác nhau, xem xét hiệu suất, chi phí, ngôn ngữ và tuân thủ. Điều này làm tăng cơ hội chuyển đổi thành công sang sản xuất.
Các yếu tố dàn xếp sản xuất khác liên quan đến khả năng mở rộng, tính liên tục kinh doanh và kết nối với nhiều môi trường trung tâm liên lạc trên toàn cầu.
Trong các triển khai thực tế, trải nghiệm cuộc gọi được hỗ trợ bởi AI thành công trông như thế nào từ góc độ của người dùng cuối, và chúng ta đang gần đạt được các tương tác giống con người ở quy mô lớn đến mức nào?
Chúng tôi có một số khách hàng rất lớn bắt đầu với chúng tôi vào khoảng năm 2020 và 2021. Họ là bằng chứng rằng các tương tác giống con người ở quy mô lớn đang hoạt động tốt. Các trường hợp sử dụng thực tế bao gồm các nhiệm vụ hướng tới khách hàng như định hướng cuộc gọi, lập lịch hẹn và chuyển tiền, cũng như các công cụ hướng tới đại lý như tóm tắt cuộc gọi AI, hướng dẫn kiến thức thời gian thực và dịch giọng nói trực tiếp.
Đối với người dùng cuối, trải nghiệm cuộc gọi được hỗ trợ bởi AI cảm giác không có trở ngại. Thay vì điều hướng các cây menu cứng nhắc (nhấn 1 cho điều này, nhấn 2 cho điều đó), người gọi có thể nói một cách tự nhiên bằng các hệ thống IVR (Trả lời Tương tác Giọng nói) đối thoại hiểu ý định và phản hồi phù hợp. Điều này tạo ra một tương tác trực quan và hiệu quả hơn từ điểm chạm đầu tiên.
Mặc dù ngành công nghiệp chưa đạt được các tương tác phức tạp giống con người ở quy mô lớn, nhưng những khả năng này đang đưa các doanh nghiệp gần hơn với việc cung cấp các trải nghiệm chính xác và cá nhân hóa hơn.
AI giọng nói phụ thuộc vào nhận dạng giọng nói, hiểu ngôn ngữ tự nhiên và xử lý thời gian thực. Bạn nhìn thấy những nút thắt lớn nhất hiện nay ở đâu, và chúng đang được giải quyết như thế nào?
Một nút thắt lớn trong việc áp dụng AI giọng nói của các doanh nghiệp lớn là tích hợp. Theo một báo cáo gần đây của Opus Research, chỉ 38% doanh nghiệp cho rằng chi phí là một rào cản để áp dụng AI giọng nói. Tuy nhiên, 65% cho rằng tích hợp trong các hệ thống hiện có và 60% cho rằng sự phức tạp của tích hợp là những rào cản chính.
Các nhà cung cấp CCaaS ngày càng tạo ra các rào cản cho mô hình mang bot của riêng bạn bằng cách chặn tích hợp hoặc khiến chúng không khả thi về mặt tài chính. Các hệ thống cũ đơn giản là không có tích hợp API cập nhật. Các giải pháp như Voice AI Connect của AudioCodes kết nối với các môi trường trung tâm liên lạc hiện có qua SIP tiêu chuẩn và có tích hợp API với hơn 30 khuôn khổ bot AI giọng nói và hơn 20 động cơ STT và TTS, loại bỏ nhu cầu viết các API này thủ công.
Báo cáo cùng nhấn mạnh chất lượng hiệu suất tổng thể (chất lượng giọng nói, luồng cuộc trò chuyện, v.v.) là lý do lớn nhất (72%) làm chậm việc áp dụng. Điều mà Voice AI Connect cho phép là kết hợp và kết hợp các khuôn khổ bot, STT và TTS để tối ưu hóa triển khai vì không phải mọi AI phù hợp với mọi trường hợp sử dụng và các biến thể cũng cần thiết cho các thuật ngữ và ngôn ngữ. Hơn nữa, ngành AI đang phát triển nhanh chóng, đòi hỏi khả năng chuyển đổi dễ dàng sang một nhà cung cấp AI mới khi công nghệ được cải tiến.
Tích hợp nên có độ trễ thấp, chi phí hợp lý và dễ triển khai. Nó cũng nên tăng cường bảo mật và gỡ lỗi, đảm bảo tính liên tục kinh doanh và cung cấp tùy chọn tại chỗ.
AudioCodes thúc đẩy một cách tiếp cận linh hoạt kết nối nhiều nhà cung cấp AI và giọng nói. Sự linh hoạt của nhà cung cấp có tầm quan trọng như thế nào khi xây dựng các hệ thống AI giọng nói mạnh mẽ và tương lai?
Sự linh hoạt của nhà cung cấp là rất quan trọng vì các doanh nghiệp hiếm khi hoạt động trong một môi trường nhà cung cấp duy nhất, và có nhiều giải pháp AI, giọng nói, điện thoại và truyền thông khác nhau trên thị trường. Để tạo ra một chiến lược AI giọng nói thống nhất thực sự, các tổ chức cần có thể kết hợp các giải pháp khác nhau này và đảm bảo khả năng tương tác trên tất cả chúng trong khi tối ưu hóa chi phí, độ trễ, hiệu suất trường hợp sử dụng, hỗ trợ ngôn ngữ và thuật ngữ.
Một cách tiếp cận linh hoạt cho phép các doanh nghiệp tích hợp với nhiều nhà cung cấp, chọn công nghệ phù hợp cho các trường hợp sử dụng khác nhau và thích nghi khi thị trường phát triển.
Trong các ngành được quy định như tài chính hoặc chăm sóc sức khỏe, việc thu thập và phân tích dữ liệu tương tác giọng nói khác với các quy trình AI dựa trên đám mây thông thường như thế nào?
Xử lý dữ liệu giọng nói được điều chỉnh bởi các yêu cầu nghiêm ngặt về quyền riêng tư và tuân thủ, hạn chế đáng kể việc sử dụng các công cụ AI dựa trên đám mây. Để quản lý điều này, nhiều tổ chức được quy định áp dụng các triển khai tại chỗ để đảm bảo dữ liệu nhạy cảm vẫn nằm trong các môi trường được kiểm soát và không bao giờ rời khỏi cơ sở hạ tầng của họ.
Các tiêu chuẩn tuân thủ cũng yêu cầu rằng dữ liệu tương tác giọng nói được ghi lại và lưu trữ trong các định dạng cụ thể trong nhiều năm, với các bản ghi chính xác, nguyên văn được cấu trúc cho khả năng kiểm toán. Ví dụ, trong lĩnh vực tài chính, một công ty giao dịch phải lưu trữ mọi cuộc gọi được ghi lại và bản ghi chính xác như được nói cho các cuộc kiểm toán quy định – dữ liệu không thể bị thay đổi hoặc tóm tắt. Trong chăm sóc sức khỏe, một nhà cung cấp xử lý các cuộc gọi của bệnh nhân phải giữ các bản ghi và bản ghi chính xác, an toàn và tuân thủ HIPAA. Trên toàn bộ, dữ liệu thường cần được xử lý tại chỗ để ngăn chặn thông tin được bảo vệ khỏi bị phơi bày với các dịch vụ đám mây bên ngoài.
Khi các doanh nghiệp bắt đầu triển khai các đại lý AI có thể thực hiện hành động thay vì chỉ phản hồi, điều đó thay đổi vai trò của giao diện giọng nói trong dịch vụ khách hàng và hoạt động nội bộ như thế nào?
Các giao diện giọng nói đang phát triển từ các công cụ thụ động thành các hệ thống thông minh, proaktive có thể phân tích và hành động trong thời gian thực. Thay vì chỉ ghi lại hoặc định tuyến các cuộc trò chuyện, các hệ thống AI giọng nói có thể hiểu ý định và thực hiện hành động ngay lập tức, chẳng hạn như giải quyết các vấn đề của khách hàng, kích hoạt các quy trình hậu trường hoặc giúp một nhân viên giải quyết một vấn đề IT. Sự thay đổi này đặc biệt mạnh mẽ vì giọng nói thường là điểm liên lạc đầu tiên và tự nhiên nhất.
Các đại lý AI hiện có thể liên hệ với một giám sát viên con người – ví dụ, để phê duyệt một khoản giảm giá cho khách hàng. Họ cũng có thể thực hiện các hành động trực tiếp, như thêm mục vào giỏ hàng web của khách hàng. Và họ có thể cộng tác với các bot khác có kỹ năng chuyên môn, chẳng hạn như phân tích ảnh được chia sẻ bởi khách hàng để hiểu rõ hơn về ngữ cảnh. Mỗi điều này đại diện cho một mức độ tinh vi mà trước đây không tồn tại.
Nhìn về tương lai, bạn có thấy giọng nói trở thành giao diện chính cho các hệ thống AI doanh nghiệp, hay nó sẽ vẫn là một phần của trải nghiệm đa phương thức rộng lớn hơn?
Để minh họa điểm của tôi, tôi có hai đứa con trai mới lớn. Họ thích không tương tác với một đại diện dịch vụ khách hàng con người nếu có thể. Tuy nhiên, họ sẽ rất thích nói chuyện với một bot hơn là nhắn tin với nó. Giọng nói đã là phương tiện giao tiếp tự nhiên của con người trong hàng triệu năm. Nó được ưa thích hơn bàn phím hoặc chuột, ít nhất cho đến khi đọc suy nghĩ trở thành hiện thực.
Cảm ơn cuộc phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập AudioCodes.












