Phỏng vấn

Dani Cherkassky, CEO và Đồng sáng lập của Kardome – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Dani Cherkassky, CEO và Đồng sáng lập của Kardome, mang hơn hai thập kỷ kinh nghiệm trong lĩnh vực âm thanh, xử lý tín hiệu và phát triển thuật toán đến lĩnh vực đổi mới công nghệ giọng nói. Trước khi thành lập Kardome, ông từng là CTO tại Silentium Ltd., nơi ông dẫn đầu các dự án nghiên cứu và phát triển hợp tác với các công ty Tier 1 và các tổ chức nghiên cứu. Với bằng Tiến sĩ về Xử lý Mảng Micro từ Đại học Bar-Ilan, Cherkassky kết hợp chuyên môn kỹ thuật sâu sắc với một sứ mệnh rõ ràng – loại bỏ sự thất vọng của tương tác giọng nói hiện đại bằng cách tạo ra công nghệ thực sự lắng nghe con người, không phải tiếng ồn xung quanh họ.

Kardome là một công ty tiên phong trong lĩnh vực giải pháp thính giác không gian dựa trên AI, mang lại tương tác giọng nói cá nhân hóa rõ ràng trong bất kỳ môi trường nào – từ xe hơi và phòng họp đến nhà thông minh và không gian công cộng. Công nghệ phân cụm giọng nói độc quyền của họ tách biệt giọng nói dựa trên vị trí, cho phép thiết bị hiểu từng người nói như thể họ là người nói duy nhất. Được thiết kế để hoạt động độc lập với phần cứng và sẵn sàng cho edge, nền tảng của Kardome tăng cường độ chính xác nhận dạng giọng nói, bảo mật và trải nghiệm người dùng, cung cấp thế hệ tiếp theo của giao tiếp giữa con người và máy tính.

Điều gì đã truyền cảm hứng cho bạn và Dr. Alon Slapak thành lập Kardome?

Ý tưởng thành lập Kardome bắt nguồn từ sự kết hợp giữa sự tò mò và thất vọng. Với kinh nghiệm của chúng tôi trong lĩnh vực giọng nói và âm thanh, cả trong học thuật và công nghiệp, chúng tôi rất hào hứng với tiến bộ trong công nghệ nhận dạng giọng nói, đặc biệt khi mạng nơ-ron sâu xuất hiện.

Trong một phòng thí nghiệm yên tĩnh, công nghệ này thật tuyệt vời. Nhưng khi bạn bước vào thế giới thực, sự kỳ diệu đó biến mất. Chúng tôi quan sát thấy rằng trong một chiếc xe hơi ồn ào, một văn phòng bận rộn hoặc một ngôi nhà hỗn loạn, các hệ thống tiên tiến, hiện đại chỉ hơi tốt hơn công nghệ của những năm 1990. Đây là rào cản lớn đối với sự tiến bộ.

Giọng nói là cách tự nhiên nhất để tương tác với thiết bị của chúng tôi, người kế thừa thực sự của màn hình cảm ứng. Nhưng để điều đó xảy ra, công nghệ cần phải vượt qua sự hỗn loạn của cuộc sống thực. Chúng tôi quyết định biến điều đó thành sứ mệnh của mình. Chúng tôi đã dành một năm trong gara, vật lộn với các phương trình truyền sóng âm và thử nghiệm các ý tưởng mới, cho đến khi chúng tôi đạt được một đột phá: bản trình diễn đầu tiên của công nghệ Thính giác Không gian mà bây giờ được gọi là công nghệ của Kardome.

Vào thời điểm đó, chúng tôi biết mình đã có chìa khóa. Chúng tôi thành lập Kardome không chỉ để xây dựng một sản phẩm, mà để bắt đầu một cuộc cách mạng trong cách con người và máy tính giao tiếp.

Nhiều trợ lý giọng nói gặp khó khăn và thường khiến người dùng thất vọng khi giọng nói chồng chéo hoặc tiếng ồn nền chiếm ưu thế. Tại sao các phương pháp thông thường lại hoạt động kém trong những điều kiện thực tế này?

Các giao diện giọng nói thông thường hoạt động kém trong thế giới thực vì phần mềm của chúng dựa trên một phương pháp quá đơn giản để hiểu âm thanh. Hầu hết các hệ thống sử dụng nhiều micro để xác định hướng đến của âm thanh, một phương pháp chỉ tập trung vào góc của âm thanh trong khi bỏ qua các thông tin không gian 3D quan trọng khác. Phương pháp này ngay lập tức thất bại trong bất kỳ môi trường thực tế nào – như một chiếc xe, văn phòng hoặc phòng khách – vì những môi trường này được lấp đầy bởi sự phản xạ âm thanh, nơi các sóng âm thanh bật lại từ mọi bề mặt phản xạ. Đối với một hệ thống chỉ hiểu hướng, mỗi một trong những phản xạ này được nhận thức như một âm thanh mới từ một vị trí khác.

Điều này tạo ra một hiệu ứng gây choáng váng, như thể thiết bị đang ở trong một “phòng gương âm thanh”, nơi một giọng nói duy nhất dường như đến từ hàng trăm hướng đồng thời. Không thể phân biệt các giọng nói riêng biệt của người nói từ cơn bão của các phản xạ, hệ thống không thể giải mã chính xác cảnh âm thanh. Đây chính là hạn chế cơ bản tại sao các công nghệ giọng nói hiện tại lại có nhận thức âm thanh kém trong các tình huống thực tế hỗn loạn và cuối cùng không hoạt động đáng tin cậy.

Công nghệ của Kardome đối xử với từng người như thể họ là người nói duy nhất trong phòng. Đột phá kỹ thuật nào làm cho điều này có thể xảy ra và nó khác với nhận dạng giọng nói thông thường như thế nào?

Đột phá kỹ thuật của chúng tôi là một công nghệ độc quyền gọi là Thính giác Không gian AI, vượt qua các phương pháp thông thường chỉ phát hiện hướng của âm thanh để xác định vị trí chính xác của âm thanh trong không gian 3D. Nó hoạt động bằng cách phân tích toàn bộ mẫu phản xạ mà một giọng nói tạo ra trong một phòng, xử lý cách âm thanh bật lại từ các bề mặt như một “dấu vân âm thanh” duy nhất cho vị trí đó. Trí tuệ nhân tạo của chúng tôi ngay lập tức và thụ động suy luận dấu vân này cho mỗi nguồn âm thanh, hiệu quả trong việc lập bản đồ môi trường. Phương pháp dựa trên vị trí này khác biệt cơ bản so với các hệ thống truyền thống dựa trên hướng, những hệ thống dễ bị混淆 bởi chính những phản xạ mà chúng tôi sử dụng như dữ liệu có giá trị. Trong khi chúng nghe một người nói như một đám đông của các tiếng vang, công nghệ của chúng tôi sử dụng toàn bộ mẫu phản xạ để xác định nguồn thực sự. Kết quả thực tế là một thiết bị được kích hoạt bởi Kardome có thể tập trung vào một người trong một môi trường ồn ào và nghe họ như thể họ đang nói một mình trong một phòng yên tĩnh. Ngoài ra, Trí tuệ Cognition đảm bảo rằng hệ thống không chỉ nghe các từ ngữ mà còn hiểu ai nói và ý nghĩa của chúng trong ngữ cảnh.

Trợ lý giọng nói được cho là đang có “giờ phút iPhone”. Từ quan điểm của bạn, điều đó có nghĩa là gì và chúng ta đang gần với việc áp dụng rộng rãi thực sự đến mức nào?

Đối với tôi, “giờ phút iPhone” có nghĩa là giọng nói cuối cùng đã sẵn sàng để trở thành cách mặc định để chúng ta tương tác với các thiết bị tính toán.

Tôi thấy các nhà sản xuất đang chạy đua để tích hợp công nghệ giọng nói vào toàn bộ dòng sản phẩm của họ. Xe hơi đang trở thành giao diện giọng nói đầu tiên vì lý do an toàn. Nhà thông minh cần giao diện người dùng giọng nói vì không thể đặt màn hình cảm ứng mọi nơi. Thiết bị điện tử truyền thống cũng đang thêm khả năng giọng nói vì thường nhanh hơn so với việc điều hướng menu. Mặc dù nhiều công nghệ đang thúc đẩy việc áp dụng giọng nói, nhưng cuộc cách mạng thực sự sẽ được quyết định bởi robot. Khi robot được tích hợp vào nhà và nơi làm việc của chúng tôi, giọng nói sẽ xuất hiện như giao diện duy nhất thực sự hiệu quả và tự nhiên cho tương tác.

Sự hợp tác này sẽ trở nên liền mạch khi robot hiểu chúng tôi ở mức độ con người. Chúng cần phải hiểu ngữ cảnh và sắc thái của ngôn ngữ tự nhiên, không chỉ từ khóa. Chúng đòi hỏi sự nhận thức không gian chính xác đến mức cảm giác như ma thuật – biết bản năng rằng bạn là người đang nói chuyện với chúng, ngay cả trong một phòng ồn ào. Điều quan trọng là, trí tuệ này phải hoạt động trên edge để có giao tiếp tức thời, riêng tư và đáng tin cậy.

Đây không phải là một cải tiến nhỏ; đây là một sự thay đổi cơ bản trong cách con người và máy tính sẽ giao tiếp. Chúng tôi đang xây dựng công nghệ để dẫn dắt sự định nghĩa lại này. Tôi sẽ nói rằng chúng tôi đang cách điểm chuyển đổi mà giọng nói sẽ trở thành giao diện mong đợi thay vì một tính năng tốt khoảng 24 tháng.

Theo cách thực tế, bạn nhìn thấy thính giác không gian và trí tuệ nhận thức sẽ biến đổi thiết bị hàng ngày – từ xe hơi và nhà thông minh đến thiết bị đeo và không gian công cộng – như thế nào?

Sự biến đổi này là về việc cho phép tương tác tự nhiên ở bất cứ nơi nào bạn đang ở, mà không cần phải thay đổi hành vi của bạn để phù hợp với công nghệ. Trong xe hơi, điều này có nghĩa là kiểm soát hoàn toàn bằng giọng nói mà không cần dùng tay, ngay cả khi bạn đang lái xe trên đường cao tốc với nhạc đang phát và hành khách đang nói chuyện. Nhà thông minh trở nên thực sự thông minh khi chúng có thể hiểu ai đang nói và từ đâu, xử lý các yêu cầu đồng thời mà không bị nhầm lẫn.

Điểm quan trọng là trí tuệ thính giác không gian không chỉ cải thiện nhận dạng giọng nói – nó cho phép các mô hình tương tác hoàn toàn mới. Khi thiết bị có thể hiểu toàn bộ cảnh âm thanh, chúng có thể tham gia vào dòng chảy tự nhiên của giao tiếp con người, thay vì dựa vào các ràng buộc nhân tạo. Thiết bị đeo trở nên hữu ích hơn khi chúng có thể cô lập giọng nói của bạn từ các cuộc trò chuyện xung quanh, và không gian công cộng có thể cung cấp hỗ trợ giọng nói cá nhân hóa nhưng riêng tư. Như đã đề cập đối với robot, điều này tạo thành một sự thay đổi cơ bản trong cách con người và máy tính sẽ giao tiếp với robot trở thành một phần của cuộc sống của chúng tôi.

Quyền riêng tư là một vấn đề ngày càng tăng với các thiết bị luôn lắng nghe. Làm thế nào Kardome cân bằng nhu cầu xử lý trên thiết bị với nhu cầu về hiệu suất và độ chính xác?

Hầu hết các giải pháp Trợ lý giọng nói hiện nay hoạt động trên mô hình kết hợp, bao gồm một thành phần trên thiết bị (edge) và một thành phần dựa trên đám mây. Trong khi xử lý trên thiết bị không gây ra vấn đề về quyền riêng tư vì dữ liệu không bao giờ rời khỏi thiết bị của người dùng, xử lý trên đám mây lại đặt ra một thách thức lớn đối với quyền riêng tư dữ liệu.

Kardome giải quyết thách thức này bằng cách mở rộng đáng kể khả năng của thành phần trên thiết bị. Bằng cách xử lý nhiều dữ liệu cục bộ và giảm sự phụ thuộc vào đám mây, Kardome đảm bảo rằng dữ liệu giọng nói nhạy cảm không bao giờ rời khỏi thiết bị, cung cấp sự bảo vệ quyền riêng tư vượt trội so với các hệ thống khác trên thị trường.

Một mối quan tâm lớn với các thiết bị “luôn lắng nghe” không phải là microphone thu âm, mà là rủi ro âm thanh đó được tải lên đám mây để phân tích. Trong thực tế, chi phí xử lý liên tục trên đám mây là không thể chấp nhận được, điều này có nghĩa là hầu hết các hệ thống thương mại tránh nó, nhưng điều này lại có giá phải trả: chất lượng và phản hồi của Giao diện giọng nói thấp hơn.

Kardome giải quyết sự đánh đổi này bằng cách mang các mô hình ngôn ngữ mạnh mẽ đến thiết bị edge itself. Với công nghệ của chúng tôi, cảnh âm thanh, ngôn ngữ tự nhiên và ngữ cảnh được phân tích trong thời gian thực trực tiếp trên thiết bị. Không có dữ liệu giọng nói nào được tải lên hoặc lưu trữ. Cách tiếp cận đổi mới này cho phép Kardome cung cấp cả quyền riêng tư dữ liệu mạnh mẽ và giao diện giọng nói hiệu quả cao, loại bỏ sự thỏa hiệp mà người dùng hiện phải đối mặt.

Nhìn chung, những rào cản lớn nhất mà trợ lý giọng nói vẫn cần phải vượt qua trước khi trở thành giao diện thống trị trên thiết bị điện tử tiêu dùng là gì?

Rào cản lớn nhất là trợ lý giọng nói vẫn chưa giao tiếp như con người. Cho đến khi trợ lý giọng nói có thể nghe và hiểu như con người, với nhận thức đầy đủ về ngữ cảnh và khả năng hiểu dòng chảy hội thoại, nó sẽ không trở thành giao diện chính mà mọi người muốn nó trở thành. Một chướng ngại kỹ thuật quan trọng tại thời điểm này là hầu hết công nghệ Trợ lý giọng nói dựa trên đám mây. Điều này vốn dĩ ngăn cản việc nghe liên tục và do đó chặn sự hiểu biết về dòng chảy hội thoại.

Đột phá sẽ đến khi hệ thống giọng nói có thể thực sự hiểu ngữ cảnh hội thoại và phản hồi với sự nhận thức trực giác mà con người có. Đó là khi giọng nói sẽ trở thành giao diện thống trị trên tất cả thiết bị điện tử tiêu dùng.

Bạn nghĩ mối quan hệ của người tiêu dùng với trợ lý giọng nói sẽ tiến hóa như thế nào một khi độ chính xác và độ tin cậy trong môi trường ồn ào được giải quyết?

Khi độ tin cậy và hội thoại tự nhiên được giải quyết, trợ lý giọng nói sẽ chuyển từ tính năng mới sang giao diện thiết yếu mà mọi người dựa vào trong suốt cả ngày. Khi mọi người biết trợ lý giọng nói sẽ hiểu họ chính xác lần đầu, ngay cả trong môi trường thách thức, họ sẽ ngừng thích nghi với công nghệ và bắt đầu sử dụng nó một cách trực giác với ngôn ngữ tự nhiên và hội thoại có ngữ cảnh.

Tương lai của tương tác giọng nói sẽ là dự đoán và chủ động. Hãy tưởng tượng thiết bị của bạn hiểu không chỉ từ ngữ mà còn âm điệu, tín hiệu cảm xúc và ngữ cảnh hội thoại. Các hệ thống hiện tại gặp khó khăn với nhịp điệu tự nhiên của hội thoại và không thể xử lý sự gián đoạn, luân phiên và hiểu ngữ cảnh. Con người thích nghi khi bị gián đoạn; trợ lý giọng nói thường bị nhầm lẫn. Đối với OEM, thách thức là tích hợp trợ lý giọng nói có thể cung cấp giao diện tương lai này mà không có sự phức tạp và yêu cầu phần cứng của các giải pháp hiện tại.

Cuối cùng, bạn nhìn thấy Kardome và hệ sinh thái trợ lý giọng nói trong năm năm tới như thế nào, và những cột mốc nào sẽ xác định liệu chúng ta đã thực sự bước vào kỷ nguyên của tính toán dựa trên giọng nói?

Năm năm từ nay, trợ lý giọng nói sẽ phổ biến như màn hình cảm ứng và bàn phím là ngày nay, và nó sẽ được kỳ vọng trong hầu như mọi thiết bị tính toán. Kardome sẽ là hệ thống hoạt động cho phép người dùng vận hành thiết bị của họ bằng giọng nói, cho phép tương tác tự nhiên với bất kỳ thiết bị nào trong bất kỳ môi trường nào, từ robot, kính thông minh, đến xe hơi.

Các cột mốc định nghĩa sẽ là hành vi hơn là công nghệ. Chúng ta sẽ biết chúng ta đã đạt được tính toán dựa trên giọng nói khi mọi người ngừng nghĩ về lệnh giọng nói và bắt đầu có hội thoại tự nhiên với môi trường của họ, khi môi trường nhiều người dùng hoạt động liền mạch, và khi trẻ em lớn lên với kỳ vọng nói chuyện với bất kỳ thiết bị nào một cách tự nhiên. Tiêu chuẩn cuối cùng sẽ không phải là công nghệ của chúng ta trở nên tinh vi như thế nào, mà là con người tương tác với thế giới kỹ thuật số một cách tự nhiên như thế nào.

Cảm ơn vì cuộc phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập Kardome.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.