Phỏng vấn
Tyler Weitzman, Đồng sáng lập & Trưởng bộ phận Trí tuệ nhân tạo tại Speechify – Loạt phỏng vấn

Tyler Weitzman là Đồng sáng lập, Trưởng bộ phận Trí tuệ nhân tạo & Tổng thống tại Speechify, ứng dụng văn bản sang giọng nói số 1 trên thế giới, với hơn 100.000 đánh giá 5 sao. Weitzman là sinh viên tốt nghiệp Đại học Stanford, nơi ông nhận bằng Cử nhân toán học và Thạc sĩ Khoa học máy tính theo dõi Trí tuệ nhân tạo. Ông đã được tạp chí Inc. chọn là một trong 50 doanh nhân hàng đầu, và ông đã được giới thiệu trên các tạp chí Business Insider, TechCrunch, LifeHacker, CBS, cùng với các tạp chí khác. Nghiên cứu thạc sĩ của Weitzman tập trung vào trí tuệ nhân tạo và văn bản sang giọng nói, nơi bài báo cuối cùng của ông có tiêu đề: “CloneBot: Dự đoán phản hồi đối thoại được cá nhân hóa.”
Bạn bắt đầu lập trình khi mới 9 tuổi, điều gì ban đầu thu hút bạn đến với khoa học máy tính?
Tôi khá say mê khi còn là một đứa trẻ với Dragon Ball Z, và tôi muốn học cách tự mình tạo ra hoạt hình. Tôi đã học Adobe (ADBE ) Flash và Photoshop và tạo ra các hoạt hình của Goku trên một trang web fan mà tôi đã xây dựng. Không lâu sau đó, tôi bắt đầu tìm hiểu về hệ thống và thuật toán, và khi tôi biết rằng tôi có thể lập trình để kiếm sống, điều đó thật thú vị. Tôi nghĩ đó chỉ là một sở thích như chơi game.
Sau đó, bạn bắt đầu xây dựng ứng dụng iPhone khi mới 12 tuổi, một số ứng dụng đó là gì?
Một ứng dụng được gọi là Black SMS cho phép người dùng gửi tin nhắn văn bản mã hóa cho nhau. Một ứng dụng khác được gọi là Frontback cho phép người dùng chụp ảnh tự sướng và ảnh của những gì đang ở phía trước họ tại cùng một thời điểm.
Bạn có thể thảo luận về nghiên cứu của mình tại Đại học Stanford và cách nó tập trung vào xử lý ngôn ngữ tự nhiên và tổng hợp giọng nói?
Nghiên cứu của tôi bao gồm nhiều ứng dụng của mạng nơ-ron chuyển đổi, bao gồm mô hình ngôn ngữ được tạo ra cho trò chuyện, thẻ phần-từ, dự đoán dấu câu và văn bản sang giọng nói. Tối ưu hóa suy luận mạng nơ-ron cho CPU di động là một焦 điểm chính và điều đó trực tiếp chuyển đổi sang các giọng nói ngoại tuyến có sẵn trên Speechify, hoạt động ngay cả trong chế độ máy bay.
Bạn có thể chia sẻ câu chuyện về sự ra đời của Speechify?
Tôi bị mù một mắt và anh trai tôi, Cliff, bị khó đọc. Chúng tôi đã sử dụng sách nói và công nghệ âm thanh văn bản sang giọng nói từ khi còn nhỏ để hoàn thành việc học và khi còn trẻ để đọc sách như Harry Potter. Khi chúng tôi lớn hơn và bắt đầu sử dụng nhiều sản phẩm công nghệ hơn, chúng tôi bắt đầu nhận ra rằng có cơ hội để xây dựng các ứng dụng văn bản sang giọng nói tốt hơn trên web và di động với các giọng nói tốt hơn nhờ sự tiến bộ của trí tuệ nhân tạo và trải nghiệm người dùng tốt hơn. Vì vậy, chúng tôi quyết định thực hiện nó trong Speechify.
Có những công nghệ học máy nào được sử dụng tại Speechify?
Chúng tôi đã áp dụng các kỹ thuật tiên tiến cho kiến trúc tạo sinh tiên tiến – mạng nơ-ron chuyển đổi, tiền huấn luyện quy mô lớn, huấn luyện phân tán, tích lũy gradient, không gian mã hóa tự động, khuếch tán, mạng đối抗 và mô hình ngôn ngữ. Chúng tôi sử dụng các kỹ thuật hỗ trợ cho xử lý tính năng xung quanh phân tích âm vị, âm cao và cảm xúc, để mô hình hóa giọng nói cụ thể hơn.
Có những thách thức gì khi xây dựng một ứng dụng văn bản sang giọng nói?
Một thách thức quan trọng là xây dựng các giọng nói chất lượng cao nghe giống như con người thực sự chứ không phải robot. Mục tiêu của chúng tôi là người dùng không thể phân biệt được giọng nói của chúng tôi và giọng nói của con người, để người dùng cảm thấy thoải mái khi nghe nội dung trên Speechify trong thời gian dài. Thách thức thứ hai là phân phối mô hình trí tuệ nhân tạo của chúng tôi đến hàng triệu người dùng. Việc xây dựng giọng nói trí tuệ nhân tạo chất lượng cao là một việc, và việc đảm bảo hàng triệu người dùng trên toàn thế giới thực sự tìm hiểu và sử dụng chúng là một việc khác.
Speechify là ứng dụng số 1 trong danh mục của nó trên cửa hàng ứng dụng, bạn thuộc tính thành công này cho yếu tố nào?
Chúng tôi tin rằng chúng tôi đã xây dựng các sản phẩm tốt nhất trên thị trường cho những người muốn nghe nội dung họ cần – dù đó là sinh viên với bài tập về nhà, chuyên gia đang đọc cho công việc, hoặc người đọc giải trí chỉ muốn được giải trí. Chúng tôi có sự lựa chọn giọng nói tốt nhất, bao gồm cả những người nổi tiếng như Snoop Dogg, và giao diện người dùng tốt nhất để người dùng dễ dàng tải lên và truy cập nội dung họ muốn nghe. Và trải nghiệm người dùng của chúng tôi rất mượt mà trên toàn bộ hệ sinh thái Speechify – bạn có thể bắt đầu nghe một bài viết trên máy tính và sau đó dễ dàng chuyển sang tiếp tục nghe trên điện thoại.
Có những trường hợp sử dụng lớn nhất cho ứng dụng này là gì?
Trí tuệ nhân tạo tạo sinh của Speechify giải quyết các vấn đề thực sự cho sinh viên muốn hoàn thành nhiều bài tập về nhà nhanh hơn, những người thực sự bị khó đọc và ADHD có vấn đề khi đọc, người cao tuổi có thị lực thấp, chuyên gia muốn đọc nhiều hơn và tăng năng suất, nhà văn muốn nghe作品 của mình, người học theo thính giác, và nhiều người khác.
Visions của bạn cho tương lai của trí tuệ nhân tạo là gì?
Chúng tôi muốn trí tuệ nhân tạo – và cụ thể là giọng nói văn bản sang giọng nói trí tuệ nhân tạo – loại bỏ các rào cản đối với việc học tập bất kể mức thu nhập, sự khác biệt trong học tập, địa lý hoặc ngôn ngữ. Chúng tôi xem trí tuệ nhân tạo là một công cụ cho lợi ích xã hội để nâng cao chất lượng cuộc sống con người có thể sống thông qua việc cải thiện giáo dục của họ.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập Speechify.












