Phỏng vấn
Dan O’Connell, Chief Strategy Officer tại Dialpad – Interview Series

Dan là Chief Revenue Officer tại Dialpad. Trước đó, anh là CEO của TalkIQ, một công ty khởi nghiệp về nhận dạng giọng nói và xử lý ngôn ngữ tự nhiên theo thời gian thực mà Dialpad đã mua lại vào tháng 5 năm 2018. Trước khi gia nhập TalkIQ, anh đã từng giữ các vị trí lãnh đạo bán hàng tại AdRoll và Google (GOOGL ).
Dialpad là một nền tảng giao tiếp dựa trên đám mây được hỗ trợ bởi trí tuệ nhân tạo, giúp kết nối và cộng tác với đội ngũ của bạn dễ dàng và hiệu quả hơn
Bạn trước đây là CEO của TalkIQ, một công ty khởi nghiệp về nhận dạng giọng nói và xử lý ngôn ngữ tự nhiên theo thời gian thực mà Dialpad đã mua lại vào tháng 5 năm 2018. Bí quyết gì đã giúp công ty này thành công trong công nghệ nhận dạng giọng nói?
Đó là sự kết hợp của nhiều yếu tố: thời điểm, con người và tập trung. Công nghệ nhận dạng giọng nói tự động (ASR) không phải là mới, nó đã tồn tại trong nhiều thập kỷ – lâu hơn nhiều so với những gì mọi người nghĩ. Trong thời gian này (và nhiều hơn trong 5 năm qua), công nghệ ASR đã được hưởng lợi từ sự tăng trưởng của sức mạnh tính toán, đám mây, sự sẵn có của các tập dữ liệu và sự áp dụng rộng rãi của các loa thông minh trên thị trường tiêu dùng. Tất cả những điều này đã dẫn đến sự tăng cao của độ chính xác của việc chuyển đổi giọng nói sang văn bản.
Bên cạnh những xu hướng này, chúng tôi cũng may mắn khi kết hợp được các chuyên gia (như ngôn ngữ học) với các nhà phát triển. Và khi tôi nói về các nhà phát triển, tôi ám chỉ những kỹ sư có thể nhanh chóng đưa sản phẩm ra thị trường – họ thúc đẩy sự đổi mới và giải quyết vấn đề nhanh chóng. Và mặc dù những giải pháp này có thể không luôn luôn là những giải pháp đẹp nhất, nhưng chúng thường là những giải pháp nhanh nhất và cho phép bạn được xem như một nhà đổi mới trên thị trường – điều này trở thành một điều gì đó bạn có thể tận dụng trong tiếp thị và bán hàng. Câu chuyện này chơi tốt khi bạn xây dựng công ty khởi nghiệp và cố gắng huy động vốn.
Vì vậy, chúng tôi có các chuyên gia trong lĩnh vực, xu hướng thị trường, một đại dương xanh khi áp dụng công nghệ trong doanh nghiệp và một đội ngũ có thành tích trong việc đưa công nghệ đổi mới ra thị trường với các động作 có thể lặp lại.
Cuối cùng, chúng tôi đã tiếp cận vấn đề này theo một cách khác. Các công cụ chuyển đổi giọng nói truyền thống hoạt động như các bản ghi âm. Bạn ghi lại một cuộc gọi; bạn lưu tệp âm thanh; bạn đưa nó qua công cụ chuyển đổi giọng nói của bạn; và sau một thời gian, bạn sẽ nhận được bản chuyển đổi giọng nói của mình. Ban đầu, một cuộc gọi 30 phút sẽ mất 30 phút để chuyển đổi, vì vậy bạn đang nói về sự chậm trễ thực sự khi mở rộng quy mô.
Chúng tôi muốn giải quyết vấn đề này và xây dựng một công cụ chuyển đổi giọng nói theo thời gian thực không cần tệp âm thanh. Điều này có thể nghe có vẻ mới mẻ ngày nay, nhưng nhiều năm trước, không có công cụ chuyển đổi giọng nói nào có thể xử lý âm thanh chất lượng thấp (8khz) theo thời gian thực. Chúng tôi không muốn xây dựng một máy ghi âm.
Chúng tôi muốn xây dựng một công cụ chuyển đổi giọng nói theo thời gian thực để hiểu và phân tích các cuộc trò chuyện. Nếu chúng tôi có thể làm điều đó, thì cơ hội sẽ trở nên vô tận vì bạn có thể bắt đầu tự động hóa các quy trình làm việc và thực hiện nhiều điều thú vị mà trước đây chưa từng được thực hiện. Và xin chúc mừng Jim Palmer, Etienne Manderscheid, Kevin James, Noah Gaspar và nhiều người khác vì đã xây dựng công cụ chuyển đổi giọng nói theo thời gian thực đầu tiên.
Bạn có thể thảo luận về giai đoạn chuyển đổi sau khi Dialpad mua lại TalkIQ vào tháng 5 năm 2018?
Quá trình mua lại thực sự rất suôn sẻ. Dialpad là đối tác của TalkIQ và các đội sản phẩm của chúng tôi đã có mặt tại Dialpad hàng tuần. Và tôi đã từng làm việc với các đồng sáng lập Craig Walker và Brian Peterson tại Google và rất hào hứng về việc hợp tác với họ.
Chúng tôi đều nhìn thấy tương lai theo cùng một cách, rằng những công nghệ này (ASR/NLP) được tích hợp vào một nền tảng giao tiếp/cộng tác có thể thay đổi thị trường và mang lại lợi ích lớn cho các doanh nghiệp. Đây là lý do tại sao, gần như ngay lập tức sau khi hoàn thành việc mua lại, chúng tôi đã huy động được 50 triệu đô la trong một vòng tài trợ do ICONIQ dẫn đầu. Các nhà đầu tư nhìn thấy cơ hội trong tương lai của công nghệ và đội ngũ đang làm việc trên những vấn đề này.
Tại TalkIQ, chúng tôi cơ bản là một công ty khởi nghiệp cố gắng trở thành ba công ty khởi nghiệp cùng một lúc: Chúng tôi xây dựng riêng chồng gọi của mình, công cụ chuyển đổi giọng nói và công nghệ NLP nội bộ. Đây là ba vấn đề khó khăn để giải quyết. Dialpad đã thành công trong việc giải quyết vấn đề gọi, vì vậy khi đề nghị mua lại đến, đó là một quyết định dễ dàng. Chúng tôi xem Dialpad là nền tảng giao tiếp doanh nghiệp đổi mới nhất trong lĩnh vực này, và tầm nhìn của chúng tôi về tương lai của giao tiếp doanh nghiệp phù hợp rất tốt.
Có những công nghệ học máy nào được sử dụng tại Dialpad?
Động cơ Voice Intelligence (Vi) của chúng tôi sử dụng trí tuệ nhân tạo và học máy để giúp các tổ chức thúc đẩy bán hàng, thu được thông tin cạnh tranh, nâng cao dịch vụ khách hàng và có các cuộc họp trực tuyến hiệu quả hơn.
Công nghệ ASR và NLP từ TalkIQ được sử dụng để nhập các cuộc trò chuyện từ các cuộc gọi thoại và video theo thời gian thực. Đồng thời, công nghệ độc quyền của chúng tôi cho phép chúng tôi xử lý dữ liệu cuộc trò chuyện đến và chính xác ghi lại và chuyển đổi nó thành một định dạng dễ đọc với độ chính xác hàng đầu trong ngành.
Công nghệ học máy tích hợp giúp Vi cải thiện theo thời gian. Càng sử dụng Vi, nó sẽ học hỏi và trở nên tốt hơn trong việc xử lý các cuộc trò chuyện. Theo thời gian, bản ghi âm cuộc gọi sẽ tăng độ chính xác, và Vi sẽ có thể xử lý các sắc thái tinh vi hơn của các cuộc trò chuyện.
Dialpad gần đây đã đạt được một cột mốc quan trọng về trí tuệ nhân tạo sau khi phân tích hơn một tỷ phút giọng nói, các thử nghiệm benchmark cho thấy mô hình chuyển đổi giọng nói của Dialpad đã vượt qua các đối thủ cạnh tranh chính, bao gồm cả mô hình điện thoại nâng cao của Google. Những thử nghiệm nào đã được thực hiện để lượng hóa những kết quả này?
Chúng tôi có một bộ các thử nghiệm chứa âm thanh và bản ghi âm được coi là sự thật về những gì đã được nói trong âm thanh. Chúng tôi gửi âm thanh đó cho mỗi đối thủ cạnh tranh và nhận lại bản ghi âm, mà chúng tôi sau đó so sánh với sự thật. Chúng tôi tính toán số lượng lỗi để xác định tỷ lệ chính xác. Chúng tôi đã so sánh mình với Google kể từ khi mua lại TalkIQ vào tháng 4 năm 2018 và luôn có độ chính xác thấp hơn cho đến bây giờ.
Có những khác biệt chính nào giữa động cơ Voice Intelligence (Vi) độc quyền của Dialpad và các động cơ cạnh tranh?
Một trong những khác biệt lớn nhất là chúng tôi đã làm điều này lâu hơn so với các đối thủ cạnh tranh, có nghĩa là chúng tôi đã phân tích nhiều dữ liệu hơn để đảm bảo công nghệ của chúng tôi là chính xác nhất. Chúng tôi đã phân tích hơn một tỷ phút giao tiếp giọng nói và tiếp tục xử lý khoảng 90 triệu phút mỗi tháng với động cơ Vi của chúng tôi. Về mặt này, chúng tôi đang dẫn trước các đối thủ cạnh tranh nhiều năm.
Một khác biệt khác là cách tiếp cận tùy chỉnh và có thể mở rộng của chúng tôi đối với các mô hình ngôn ngữ. Đối với mỗi khách hàng, chúng tôi xây dựng một cơ sở dữ liệu từ các từ khóa cụ thể của công ty để thực hiện việc tăng cường từ khóa và nâng cao độ chính xác. Ví dụ, đối với một người dùng có tên là Kathryn và làm việc tại một công ty có tên là Skribbl, hệ thống của chúng tôi sẽ đánh vần chính xác các tên thích hợp, trong khi các mô hình khác có thể đánh vần chúng theo cách chúng nghe.
Bạn có quan điểm gì về tương lai của xử lý ngôn ngữ tự nhiên? Khi nào trí tuệ nhân tạo sẽ đạt được độ chính xác gần 100% hoặc thậm chí 100%?
Độ chính xác hoàn hảo gần như không thể đạt được. Có lẽ một ngày nào đó tôi sẽ bị bất ngờ (Tôi hy vọng như vậy!). Tôi nghĩ chúng ta sẽ đạt được rất, rất gần nhưng không hoàn hảo. Lý do là nhận dạng giọng nói tự động (và sau đó là NLP) có vô số vấn đề để giải quyết: giọng, khoảng cách đến micro, tiếng ồn nền, vấn đề kết nối, loại micro khác nhau, tốc độ nói, phát âm, ngữ cảnh (Sara vs Sarah vs Serra), từ viết tắt, tiếng lóng và như vậy. Mặc dù tôi muốn nói rằng chúng ta sẽ đạt được điều đó, nhưng tôi nghĩ chúng ta có thể đạt được rất gần, nhưng một dặm cuối cùng, hoặc 1-2% về độ chính xác, sẽ là một thách thức.
Đó được nói, tôi nghĩ sẽ có một số phát triển thú vị về khả năng đọc. Ngày nay, khi bạn xem lại bản ghi âm của một cuộc trò chuyện, nó có thể đọc như một dòng suy nghĩ. Chúng ta tự nhiên nói một cách linh hoạt, sử dụng câu dài, lặp lại từ, bắt đầu lại câu – chúng ta làm tất cả những điều mà chúng ta không làm trong một hình thức viết. Có một số cơ hội thú vị khi nói đến việc có một phiên bản đọc dễ dàng hơn của bản ghi âm – một phiên bản loại bỏ sự trùng lặp, dự đoán hoặc cải thiện dấu câu và tinh chỉnh hoặc tối ưu hóa bản ghi âm để dễ đọc hơn.
Trong suy nghĩ của tôi, có hai phiên bản: phiên bản từ nguyên văn bản, gần như 100% của một cuộc trò chuyện (các câu dài và tất cả), và sau đó là phiên bản nâng cao, dễ tiêu hóa hơn nhờ vào dấu câu và tối ưu hóa.
Và điều này sau đó dẫn chúng ta đến con đường có thể tổng hợp một cuộc trò chuyện thành những phần quan trọng nhất? Bạn có cần một bản ghi âm đầy đủ hay bạn cần một bản tóm tắt chính xác được định dạng cho khả năng đọc?
Điều này chắc chắn phụ thuộc vào trường hợp sử dụng của bạn, nhưng đây là điều thú vị và thú vị về không gian này. Chúng ta đang ở có lẽ inning thứ ba của những gì có thể và chúng ta thậm chí chưa bắt đầu vào sự đổi mới của các quy trình làm việc nơi chúng ta sẽ thấy NLP trở nên “nhận thức ngữ cảnh” hơn, như sử dụng các cuộc trò chuyện trước để cải thiện độ chính xác.
Càng có ngữ cảnh cụ thể mà các mô hình có thể học hỏi, càng tốt. Hãy nghĩ về việc chia sẻ cùng một ngữ cảnh trên nhiều cuộc trò chuyện và liên tục thích nghi với ngữ cảnh để ML trở nên thông minh hơn. Công nghệ nhận thức ngữ cảnh cũng quan trọng để cải thiện độ chính xác khi xem xét sự khác biệt lớn trong cách chúng ta giao tiếp. Những gì có vẻ như sự khác biệt ngôn ngữ tinh vi đối với con người là rất khó để đào tạo một mô hình ML để nhân rộng.
Có những dịch vụ nào mà Dialpad hiện đang cung cấp cho khách hàng?
Dialpad là một cách thông minh hơn để làm việc. Chúng tôi đã xây dựng nền tảng cho lực lượng lao động hiện đại, kết hợp – trao quyền cho mọi người và các đội để trở nên hiệu quả, hiệu quả và tham gia hơn từ bất kỳ nơi nào trên thế giới. Chúng tôi cung cấp một trải nghiệm giao tiếp kinh doanh liền mạch – gọi, trò chuyện, hội nghị video và trung tâm cuộc gọi – với chất lượng, bảo mật và độ tin cậy không thể sánh được. Dialpad cung cấp trải nghiệm này như một nền tảng dựa trên đám mây thống nhất, tiết kiệm, dễ triển khai và dễ quản lý.
Có điều gì khác mà bạn muốn chia sẻ về Dialpad?
Năm 2020 là một năm rất quan trọng đối với công ty, điều thực sự tuyệt vời khi nghĩ về những gì thế giới đã trải qua (và vẫn đang tiếp tục). Chúng tôi đã tăng gấp đôi số lượng nhân viên, đảm bảo 100 triệu đô la tài trợ, mua lại một công ty và làm tất cả những điều này khi cơ sở khách hàng của chúng tôi tăng trưởng theo cấp số nhân.
Với việc làm việc từ xa ở đây để ở lại, chúng tôi dự kiến sự tăng trưởng này sẽ tiếp tục, và chúng tôi rất hào hứng về năm tới. Chúng tôi tin rằng phong trào làm việc từ bất kỳ nơi nào sẽ tăng cường nhu cầu về các công nghệ đổi mới giúp nhân viên làm việc thông minh hơn – không khó hơn. Các công ty sẽ chuyển sang trí tuệ nhân tạo để tối ưu hóa hiệu quả, loại bỏ các nhiệm vụ tầm thường và cho phép nhân viên tập trung vào các ưu tiên lớn hơn. Dialpad rất phù hợp để đáp ứng những nhu cầu này.
Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập Dialpad.












