Phỏng vấn
Dylan Fox, CEO & Founder của AssemblyAI – Series Phỏng Vấn

Dylan Fox là CEO & Founder của AssemblyAI, một nền tảng tự động chuyển đổi tệp âm thanh và video cũng như luồng âm thanh trực tiếp thành văn bản bằng cách sử dụng API Speech-to-Text của AssemblyAI.
Điều gì ban đầu thu hút bạn đến với học máy?
Tôi bắt đầu bằng cách học cách lập trình và tham gia các cuộc họp Python tại Washington DC, nơi tôi theo học đại học. Thông qua các khóa học đại học, tôi发现 bản thân thiên về các vấn đề lập trình loại thuật toán, điều này tự nhiên dẫn tôi đến học máy và NLP.
Trước khi thành lập AssemblyAI, bạn là Kỹ sư Phần mềm Senior tại Cisco, bạn đã làm việc trên những gì?
Tại Cisco, tôi là Kỹ sư Phần mềm Senior tập trung vào Học máy cho các sản phẩm hợp tác của họ.
Làm thế nào công việc của bạn tại Cisco và một vấn đề với công nghệ nhận dạng giọng nói đã truyền cảm hứng cho bạn để ra mắt AssemblyAI?
Trong một số công việc trước đây, tôi đã có cơ hội làm việc trên nhiều dự án AI, bao gồm cả các dự án yêu cầu nhận dạng giọng nói. Nhưng tất cả các công ty cung cấp dịch vụ nhận dạng giọng nói đều đã lỗi thời, khó mua và chạy công nghệ AI lỗi thời.
Khi tôi trở nên quan tâm hơn đến nghiên cứu AI, tôi nhận thấy có rất nhiều công việc được thực hiện trong lĩnh vực nhận dạng giọng nói và tốc độ nghiên cứu đang cải thiện nhanh chóng. Vì vậy, đó là sự kết hợp của các yếu tố đã truyền cảm hứng cho tôi nghĩ, “Nếu bạn có thể xây dựng một công ty API kiểu Twilio bằng cách sử dụng nghiên cứu AI mới nhất, điều đó sẽ dễ dàng hơn nhiều cho các nhà phát triển truy cập vào các mô hình AI tiên tiến cho nhận dạng giọng nói, với trải nghiệm nhà phát triển tốt hơn.”
Và từ đó, ý tưởng về AssemblyAI đã phát triển.
Thử thách lớn nhất đằng sau việc xây dựng công nghệ nhận dạng giọng nói chính xác và đáng tin cậy là gì?
Chi phí và tài năng là những thách thức lớn nhất cho bất kỳ công ty nào khi xây dựng công nghệ nhận dạng giọng nói chính xác và đáng tin cậy.
Dữ liệu rất tốn kém để thu thập, và bạn thường cần hàng trăm nghìn giờ để xây dựng một hệ thống nhận dạng giọng nói mạnh mẽ. Không chỉ vậy, yêu cầu tính toán để đào tạo là khổng lồ và việc cung cấp các mô hình này trong sản xuất cũng rất tốn kém, và đòi hỏi tài năng chuyên môn để tối ưu hóa và làm cho nó trở nên kinh tế.
Xây dựng những công nghệ này cũng đòi hỏi một kỹ năng chuyên môn mà rất khó tìm. Đó là một lý do lớn tại sao khách hàng đến với chúng tôi để có được các mô hình AI mạnh mẽ mà chúng tôi nghiên cứu, đào tạo và triển khai nội bộ. Họ có thể truy cập vào nhiều năm nghiên cứu về các mô hình AI tiên tiến cho ASR và NLP, tất cả đều có một API đơn giản.
Ngoài việc chuyển đổi âm thanh và video thuần túy, AssemblyAI cung cấp các mô hình bổ sung, bạn có thể thảo luận về những mô hình này là gì?
Bộ mô hình AI của chúng tôi mở rộng ra ngoài việc chuyển đổi thời gian thực và không đồng bộ. Chúng tôi gọi những mô hình bổ sung này là Mô hình Trí tuệ Âm thanh vì chúng giúp khách hàng phân tích và hiểu tốt hơn dữ liệu âm thanh.
Mô hình Tóm tắt của chúng tôi cung cấp một bản tóm tắt tổng thể, cũng như tóm tắt có mã thời gian tự động phân đoạn và tạo tóm tắt cho mỗi “chương” khi chủ đề trong cuộc trò chuyện thay đổi (tương tự như chương trên YouTube).
Mô hình Phân tích Tâm lý của chúng tôi phát hiện tâm lý của mỗi câu nói trong tệp âm thanh. Mỗi câu trong bản chuyển đổi có thể được đánh dấu là Tích cực, Tiêu cực hoặc Trung lập.
Mô hình Phát hiện Thực thể của chúng tôi xác định một loạt các thực thể được nói trong tệp âm thanh, chẳng hạn như tên người hoặc công ty, địa chỉ email, ngày tháng và vị trí.
Mô hình Phát hiện Chủ đề của chúng tôi gắn nhãn các chủ đề được nói trong tệp âm thanh và video. Các nhãn chủ đề dự đoán tuân theo Taxonomy IAB tiêu chuẩn, điều này làm cho chúng phù hợp cho mục tiêu ngữ cảnh.
Mô hình Kiểm duyệt Nội dung của chúng tôi phát hiện nội dung nhạy cảm trong tệp âm thanh và video — chẳng hạn như ngôn từ căm thù, bạo lực, vấn đề xã hội nhạy cảm, rượu, ma túy và nhiều hơn nữa.
Các trường hợp sử dụng lớn nhất cho các công ty sử dụng AssemblyAI là gì?
Các trường hợp sử dụng lớn nhất mà các công ty có cho AssemblyAI bao gồm bốn loại: điện thoại, video, họp ảo và truyền thông.
CallRail là một ví dụ tuyệt vời về khách hàng trong không gian Điện thoại, những người sử dụng các mô hình AI của AssemblyAI — Chuyển đổi Cơ bản, Tóm tắt Tự động và Xóa Thông tin Cá nhân — để cung cấp một giải pháp Trí tuệ Đối thoại mạnh mẽ cho khách hàng của họ.
Nguyên bản, CallRail có thể tự động hiển thị và định nghĩa nội dung chính trong các cuộc gọi điện thoại của họ cho khách hàng của họ với quy mô lớn — nội dung chính như yêu cầu khách hàng cụ thể, câu hỏi thường được hỏi và từ khóa và cụm từ thường được sử dụng. Mô hình Xóa Thông tin Cá nhân của chúng tôi giúp họ tự động phát hiện và xóa dữ liệu nhạy cảm tìm thấy trong văn bản chuyển đổi (ví dụ: số an sinh xã hội, số thẻ tín dụng, địa chỉ cá nhân, v.v.).
Trường hợp sử dụng Video bao gồm từ các nền tảng phát trực tuyến video đến các trình chỉnh sửa video như Veed, những người sử dụng các mô hình Chuyển đổi Cơ bản của AssemblyAI để đơn giản hóa quá trình chỉnh sửa video cho người dùng. Veed cho phép người dùng của mình chuyển đổi video của họ và chỉnh sửa chúng trực tiếp bằng cách sử dụng phụ đề.
Trong Cuộc họp ảo, các công ty phần mềm chuyển đổi cuộc họp như Fathom đang sử dụng AssemblyAI để xây dựng các tính năng thông minh giúp người dùng của họ chuyển đổi và nhấn mạnh các khoảnh khắc chính từ các cuộc gọi Zoom của họ, thúc đẩy sự tham gia của cuộc họp tốt hơn và loại bỏ các nhiệm vụ nhàm chán trong và sau cuộc họp (ví dụ: ghi chú).
Trong Truyền thông, chúng tôi thấy các nền tảng lưu trữ podcast sử dụng các mô hình Kiểm duyệt Nội dung và Phát hiện Chủ đề của chúng tôi để họ có thể cung cấp các công cụ quảng cáo tốt hơn cho các trường hợp sử dụng an toàn thương hiệu và kiếm tiền từ nội dung do người dùng tạo với quảng cáo động.
AssemblyAI gần đây đã huy động được 30 triệu đô la trong vòng Series B. Điều này sẽ tăng tốc cho sứ mệnh của AssemblyAI như thế nào?
Sự tiến bộ đang được thực hiện trong lĩnh vực AI là vô cùng thú vị. Mục tiêu của chúng tôi là tiếp xúc với sự tiến bộ này cho mọi nhà phát triển và nhóm sản phẩm trên internet — thông qua một tập hợp API đơn giản. Khi chúng tôi tiếp tục nghiên cứu và đào tạo các mô hình AI Tiên tiến cho các nhiệm vụ ASR và NLP (như nhận dạng giọng nói, tóm tắt, xác định ngôn ngữ và nhiều nhiệm vụ khác), chúng tôi sẽ tiếp tục tiếp xúc với các mô hình AI này cho các nhà phát triển và nhóm sản phẩm thông qua các API đơn giản — có sẵn miễn phí.
AssemblyAI là nơi mà cả nhà phát triển và nhóm sản phẩm có thể đến để có quyền truy cập dễ dàng vào các mô hình AI tiên tiến mà họ cần để xây dựng các sản phẩm, dịch vụ và công ty mới thú vị.
Trong 6 tháng qua, chúng tôi đã ra mắt hỗ trợ ASR cho 15 ngôn ngữ mới — bao gồm tiếng Tây Ban Nha, tiếng Đức, tiếng Pháp, tiếng Ý, tiếng Hindi và tiếng Nhật, phát hành các cải tiến lớn cho Mô hình Tóm tắt, Mô hình ASR Thời gian thực, Mô hình Kiểm duyệt Nội dung và nhiều cập nhật sản phẩm khác.
Chúng tôi hầu như không sử dụng quỹ Series A, nhưng nguồn vốn mới này sẽ cho chúng tôi khả năng mở rộng mạnh mẽ nỗ lực của mình — mà không ảnh hưởng đến đường đua của chúng tôi.
Với nguồn vốn mới này, chúng tôi sẽ có thể tăng tốc đường dây sản phẩm của mình, xây dựng cơ sở hạ tầng AI tốt hơn để tăng tốc nghiên cứu và động cơ suy luận AI của chúng tôi, và phát triển nhóm nghiên cứu AI của chúng tôi — bao gồm cả các nhà nghiên cứu từ DeepMind, Google (GOOGL ) Brain, Meta AI, BMW và Cisco.
Có gì khác mà bạn muốn chia sẻ về AssemblyAI?
Sứ mệnh của chúng tôi là làm cho các mô hình AI Tiên tiến có thể truy cập được cho các nhà phát triển và nhóm sản phẩm với quy mô lớn thông qua một API đơn giản.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập AssemblyAI.












