Phỏng vấn

Matt Hocking, Đồng sáng lập của WellSaid Labs – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Matt Hocking là đồng sáng lập của WellSaid Labs, một công ty hàng đầu về công nghệ AI Voice Generator cấp doanh nghiệp. Anh có hơn 15 năm kinh nghiệm lãnh đạo các đội và cung cấp các giải pháp công nghệ quy mô lớn.

Nền tảng của bạn khá là doanh nhân, làm thế nào bạn lại tham gia vào lĩnh vực AI?

Tôi nghĩ tôi đã luôn coi mình là một người doanh nhân. Tôi bắt đầu công việc kinh doanh đầu tiên của mình sau khi tốt nghiệp đại học và với nền tảng về thiết kế sản phẩm, tôi đã tìm thấy mình bị thu hút đến việc giúp đỡ những người có ý tưởng khởi nghiệp. Trong suốt sự nghiệp của mình, tôi đã may mắn được làm việc với một số công ty khởi nghiệp đã có những thành công đáng kinh ngạc. Trong những trải nghiệm đó, tôi đã có cơ hội được tiếp xúc với nhiều người sáng lập tuyệt vời và điều đó đã truyền cảm hứng cho tôi để theo đuổi ý tưởng của mình như một người sáng lập. AI là một lĩnh vực khá mới với tôi khi tôi tham gia AI2, tuy nhiên, trải nghiệm đó đã cung cấp cho tôi cơ hội để áp dụng lens sản phẩm và khởi nghiệp của mình vào một số nghiên cứu tuyệt vời và tưởng tượng cách những tiến bộ mới này sẽ giúp nhiều người trong những năm tới. Mục tiêu của tôi từ đầu đã là phát triển các doanh nghiệp thực sự cho những người thực sự, và tôi tin rằng AI có tiềm năng tạo ra nhiều cơ hội và hiệu quả thú vị trong tương lai nếu được áp dụng một cách có trách nhiệm.

Có thể chia sẻ câu chuyện về cách ý tưởng cho WellSaid Labs được hình thành khi bạn là một doanh nhân trong cư trú tại The Allen Institute for AI?

Tôi đã tham gia The Allen Institute for Artificial Intelligence (AI2) với vai trò là một doanh nhân trong cư trú vào năm 2018. Đó có thể được coi là một trong những nơi ươm tạo sáng tạo nhất trên thế giới, AI2 tập hợp những tâm hồn sáng tạo nhất trong lĩnh vực AI và áp dụng các giải pháp từ những gì có thể vào các sản phẩm thực tế giải quyết vấn đề trên toàn cầu. Với nền tảng về thiết kế và công nghệ, tôi đã nuôi dưỡng một sự quan tâm lâu dài đến các lĩnh vực sáng tạo, và với sự bùng nổ của AI như chúng ta đang chứng kiến ngày nay, tôi muốn khám phá cách kết nối hai lĩnh vực này. Tôi đã được giới thiệu với Michael Petrochuk (đồng sáng lập và CTO của WellSaid Labs) trong khi phát triển một ứng dụng chăm sóc sức khỏe tương tác hướng dẫn bệnh nhân qua các tình huống nhạy cảm khác nhau. Trong quá trình phát triển nội dung cho trải nghiệm này, đội của tôi đã làm việc với các tài năng giọng nói để thu âm hàng nghìn dòng thoại cho nhân vật. Khi tôi được tiếp xúc với một số đột phá mà Michael đã đạt được trong nghiên cứu của mình, chúng tôi nhanh chóng nhận thấy giá trị của việc đạt được sự tương đương giọng nói của con người (TTS) có thể biến đổi không chỉ sản phẩm tôi đang làm việc trên mà còn tác động đến nhiều ứng dụng và ngành công nghiệp khác. Công nghệ và công cụ đã vật lộn để theo kịp nhu cầu của các nhà sản xuất tạo ra nội dung bằng giọng nói như một phương tiện. Chúng tôi đã nhìn thấy một con đường để đưa công nghệ này vào tay của tất cả các nhà sáng tạo, cho phép giọng nói trở thành một phần không thể thiếu của mọi câu chuyện.

WellSaid Labs là một trong những công ty ít ỏi cung cấp cho các diễn viên lồng tiếng một con đường vào không gian lồng tiếng AI. Tại sao bạn lại tin rằng việc tích hợp giọng nói thực vào sản phẩm là quan trọng?

Câu trả lời của chúng tôi cho vấn đề này là hai mặt: đầu tiên, chúng tôi muốn tạo ra các giải pháp bổ sung cho khả năng của các diễn viên lồng tiếng chuyên nghiệp, mở rộng cơ hội cho giọng nói. Và thứ hai, chúng tôi phấn đấu để có được mức chất lượng cao nhất của con người trong các sản phẩm của mình. Các diễn viên lồng tiếng của chúng tôi là những đối tác hợp tác lâu dài và nhận được bồi thường và chia sẻ doanh thu cho cả dữ liệu giọng nói và nội dung được tạo ra bằng nó. Mỗi diễn viên lồng tiếng chúng tôi thuê để tạo ra một hình đại diện giọng nói AI dựa trên giọng nói của họ được trả tiền dựa trên mức độ sử dụng giọng nói của họ trên nền tảng của chúng tôi. Chúng tôi khuyến khích tài năng tham gia cùng chúng tôi; bồi thường công bằng cho những đóng góp của họ là vô cùng quan trọng với chúng tôi.

Để cung cấp các sản phẩm có chất lượng cao nhất của con người trên thị trường, chúng tôi phải nghiêm ngặt về nơi chúng tôi lấy dữ liệu. Quá trình này mang lại cho chúng tôi nhiều kiểm soát hơn về chất lượng, vì chúng tôi đào tạo các mô hình học sâu của mình để nói cả về sự tương đương của con người và các phong cách liên quan đến ngữ cảnh cụ thể. Chúng tôi không chỉ tạo ra một giọng nói đọc lại đầu vào được cung cấp. Các mô hình của chúng tôi cung cấp nhiều phong cách giọng nói thực hiện những gì được viết trên trang. Cho dù người dùng đang tạo giọng nói bằng cách sử dụng một hình đại diện từ thư viện của chúng tôi hay tạo giọng nói với một giọng nói tùy chỉnh cho thương hiệu của họ, chúng tôi sử dụng dữ liệu giọng nói thực để đảm bảo một quá trình liền mạch và một nền tảng dễ sử dụng. Nếu khách hàng của chúng tôi phải thao tác và chỉnh sửa giọng nói của chúng tôi trong quá trình hậu sản xuất, quá trình để có được đầu ra mong muốn sẽ rất cồng kềnh và dài. Các giọng nói của chúng tôi lấy ngữ cảnh của nội dung viết và cung cấp một cách đọc chính xác về ngữ cảnh. Chúng tôi cung cấp giọng nói cho tất cả các loại trường hợp sử dụng – cho dù đó là đọc tin tức, tạo quảng cáo âm thanh hoặc hỗ trợ trung tâm cuộc gọi tự động – vì vậy việc hợp tác với tài năng giọng nói chuyên nghiệp cho từng trường hợp sử dụng cung cấp cho chúng tôi cả ngữ cảnh và dữ liệu giọng nói chất lượng cao.

Chúng tôi thường xuyên cập nhật và thêm các phong cách và giọng nói mới vào thư viện hình đại diện để đảm bảo rằng chúng tôi đại diện cho giọng nói của khách hàng. Trong Studio của WellSaid Labs, khách hàng và thương hiệu có thể thử giọng các giọng nói khác nhau dựa trên khu vực, phong cách và trường hợp sử dụng, cho phép một quá trình sản xuất âm thanh thống nhất và cá nhân hóa hơn cho nhu cầu của người tạo. Một khi bản ghi âm ban đầu được lấy mẫu, người dùng có thể gợi ý từ cụ thể, cách đánh vần và cách phát âm để đảm bảo AI nhất quán nói cụ thể đến nhu cầu của họ.

WellSaid Labs đang khẳng định vị trí của mình là nền tảng giọng nói AI đạo đức đầu tiên. Tại sao đạo đức AI lại quan trọng với bạn?

Khi việc áp dụng AI tăng lên và trở nên phổ biến hơn, nỗi sợ về các trường hợp sử dụng có hại và các tác nhân xấu đang ở trung tâm của mọi cuộc trò chuyện – và những lo ngại này được xác nhận bởi các sự kiện trong thế giới thực. Giọng nói AI không phải là ngoại lệ; gần như mỗi ngày, một báo cáo mới về việc một người nổi tiếng, nhân vật công chúng hoặc chính trị gia bị làm giả sâu cho quảng cáo hoặc mục đích chính trị trở thành tiêu đề. Mặc dù quy định liên bang chính thức về công nghệ này vẫn đang phát triển, việc phát hiện và chống lại các tác nhân và sử dụng恶意 giọng nói tổng hợp sẽ trở nên ngày càng khó khăn khi công nghệ tiếp tục phát triển.

Đến từ AI2, nơi đạo đức AI là một nguyên tắc cốt lõi, Michael và tôi đã có những cuộc trò chuyện này từ ngày đầu tiên. Việc phát triển công nghệ giọng nói AI đi kèm với trách nhiệm đáng kể về sự đồng ý, quyền riêng tư và an toàn chung. Chúng tôi biết rằng chúng tôi, với tư cách là nhà phát triển, phải xây dựng công nghệ của mình một cách an toàn, giải quyết các vấn đề về đạo đức và tạo nền tảng cho sự phát triển tương lai của giọng nói tổng hợp. Chúng tôi nhận ra tiềm năng của công nghệ giọng nói AI cho việc sử dụng sai và chấp nhận trách nhiệm của mình để giảm thiểu việc sử dụng sai sản phẩm của chúng tôi. Chúng tôi cần phải tạo nền tảng này từ ngày đầu tiên chứ không phải chạy nhanh và mắc sai lầm trên đường đi. Điều đó sẽ không làm đúng với khách hàng doanh nghiệp và diễn viên lồng tiếng của chúng tôi, những người dựa vào chúng tôi để xây dựng một sản phẩm chất lượng cao và đáng tin cậy.

Chúng tôi hoàn toàn ủng hộ việc kêu gọi lập pháp trong lĩnh vực này; tuy nhiên, chúng tôi sẽ không chờ đợi quy định của liên bang được ban hành. Chúng tôi đã và sẽ tiếp tục ưu tiên các thực tiễn hỗ trợ quyền riêng tư, bảo mật, minh bạch và trách nhiệm.

Chúng tôi tuân thủ nghiêm ngặt mã đạo đức của công ty, dựa trên việc xây dựng đổi mới có trách nhiệm trong mọi quyết định chúng tôi đưa ra. Điều này là vì lợi ích tốt nhất của khách hàng toàn cầu của chúng tôi – các thương hiệu doanh nghiệp.

Làm thế nào bạn phát triển một nền tảng giọng nói AI đạo đức?

WellSaid Labs đã cam kết với đổi mới đạo đức từ đầu. Chúng tôi tập trung vào niềm tin và minh bạch thông qua việc sử dụng mô hình dữ liệu nội bộ, yêu cầu đồng ý rõ ràng, chương trình kiểm duyệt nội dung và cam kết bảo vệ thương hiệu. Tại WellSaid, chúng tôi dựa vào các nguyên tắc của Trách nhiệm AI để định hình quyết định và thiết kế của chúng tôi, và những nguyên tắc đó mở rộng đến việc sử dụng giọng nói của chúng tôi. Mã đạo đức của chúng tôi đại diện cho những nguyên tắc này là Trách nhiệm, Minh bạch, Quyền riêng tư và Bảo mật, và Công bằng.

Trách nhiệm: Chúng tôi duy trì các tiêu chuẩn nghiêm ngặt cho nội dung phù hợp, cấm sử dụng giọng nói của chúng tôi cho nội dung có hại, thù hận, gian dối hoặc nhằm kích động bạo lực. Đội An toàn & Tin cậy của chúng tôi duy trì các tiêu chuẩn này với một chương trình kiểm duyệt nội dung nghiêm ngặt, chặn và xóa người dùng cố gắng vi phạm Điều khoản Dịch vụ của chúng tôi.

Minh bạch: Chúng tôi yêu cầu sự đồng ý rõ ràng trước khi xây dựng một giọng nói tổng hợp với dữ liệu giọng nói của ai đó. Người dùng không thể tải lên dữ liệu giọng nói từ các chính trị gia, người nổi tiếng hoặc bất kỳ ai khác để tạo một bản sao của giọng nói của họ trừ khi chúng tôi có sự đồng ý viết rõ ràng của họ.

Quyền riêng tư và Bảo mật: Chúng tôi bảo vệ danh tính của các diễn viên lồng tiếng bằng cách sử dụng hình ảnh chứng khoán và bí danh để đại diện cho giọng nói tổng hợp. Chúng tôi cũng khuyến khích họ thận trọng về cách và với những người họ chia sẻ sự liên kết của mình với WellSaid Labs hoặc các công ty giọng nói tổng hợp khác để giảm cơ hội cho việc lạm dụng giọng nói của họ.

Công bằng: Chúng tôi bồi thường cho tất cả các diễn viên lồng tiếng cung cấp dữ liệu giọng nói cho nền tảng của chúng tôi, và chúng tôi cung cấp cho họ một phần doanh thu liên tục cho việc sử dụng giọng nói tổng hợp được xây dựng với dữ liệu của họ.

Cùng với những nguyên tắc này, chúng tôi cũng tôn trọng nghiêm ngặt quyền sở hữu trí tuệ. Chúng tôi không tuyên bố quyền sở hữu đối với nội dung do người dùng hoặc diễn viên lồng tiếng của chúng tôi cung cấp. Chúng tôi ưu tiên tính toàn vẹn, công bằng và minh bạch trong mọi thứ chúng tôi làm, đảm bảo rằng công nghệ giọng nói tổng hợp của chúng tôi được sử dụng một cách có trách nhiệm và đạo đức. Chúng tôi tích cực tìm kiếm các quan hệ đối tác với giọng nói từ các nền tảng, tổ chức và kinh nghiệm đa dạng để đảm bảo rằng WellSaid Labs cung cấp một giọng nói cho mọi người.

Cam kết của chúng tôi đối với đổi mới có trách nhiệm và phát triển công nghệ giọng nói AI với đạo đức trong tâm trí tạo nên sự khác biệt của chúng tôi so với những người khác trong lĩnh vực này, những người đang tìm cách tận dụng một ngành công nghiệp mới và không được quản lý thông qua bất kỳ phương tiện nào. Đầu tư sớm của chúng tôi vào đạo đức, an toàn và bảo mật tạo ra niềm tin và lòng trung thành trong số các diễn viên lồng tiếng và khách hàng của chúng tôi, những người ngày càng tìm kiếm các sản phẩm và dịch vụ được sản xuất một cách đạo đức từ các công ty tiên phong trong đổi mới.

WellSaid Labs đã tạo ra mô hình AI nội bộ của riêng mình, cho phép giọng nói AI của họ đạt được sự tương đương của con người, và điều này đã được thực hiện bằng cách đưa những khiếm khuyết của con người vào các cuộc trò chuyện. Điều gì về những khiếm khuyết này làm cho AI tốt hơn, và những khiếm khuyết này được thực hiện như thế nào?

WellSaid Labs không chỉ là một máy tạo giọng nói TTS khác. Trong khi công nghệ TTS ban đầu không thể nhận ra các chất lượng giọng nói của con người như âm cao, âm thấp và phương ngữ truyền đạt ngữ cảnh và cảm xúc đằng sau từ ngữ, giọng nói của WellSaid đã đạt được sự tương đương của con người, mang lại những khiếm khuyết độc đáo của con người vào giọng nói AI.

Đo lường chính của chúng tôi về chất lượng giọng nói luôn là sự tự nhiên của con người. Niềm tin chỉ đạo này đã định hình công nghệ của chúng tôi tại mọi giai đoạn, từ thư viện kịch bản chúng tôi đã xây dựng đến các hướng dẫn chúng tôi đưa ra cho tài năng và, gần đây hơn, cách chúng tôi lặp lại các thuật toán TTS cốt lõi của mình.

Chúng tôi đào tạo trên các vocalizations của con người đích thực. Tài năng giọng nói của chúng tôi đọc kịch bản của họ một cách chân thực và hấp dẫn khi họ thu âm cho chúng tôi. Sự hoàn hảo trong giọng nói, mặt khác, là một khái niệm cơ học dẫn đến một đầu ra không tự nhiên và hoàn hảo như robot. Khi các tài năng giọng nói chuyên nghiệp biểu diễn, tốc độ nói của họ thay đổi. Độ lớn của họ di chuyển cùng với nội dung họ đang đọc. Của họ có thể tăng lên trong một đoạn cần một bản đọc hào hứng và giảm xuống trong một dòng nghiêm túc hơn. Những biến động động này tạo nên một buổi biểu diễn giọng nói của con người hấp dẫn.

Bằng cách xây dựng các quy trình AI hoạt động phối hợp với các buổi biểu diễn động của tài năng chuyên nghiệp của chúng tôi, chúng tôi đã xây dựng một nền tảng TTS thực sự tự nhiên. Chúng tôi đã phát triển hệ thống TTS dài đầu tiên với các điều khiển dự đoán trong toàn bộ quá trình sáng tạo. Thư viện ngữ âm của chúng tôi chứa một bộ sưu tập đa dạng các dữ liệu âm thanh, cho phép người dùng kết hợp các gợi ý âm thanh cụ thể, như hướng dẫn phát âm hoặc khả năng kiểm soát, vào mô hình trong giai đoạn sản xuất. Trong một nền tảng, người dùng WellSaid có thể ghi, chỉnh sửa và tạo phong cách cho giọng nói của họ mà không cần nhập dữ liệu bên ngoài.

Có thể thảo luận về một số thách thức đằng sau việc xây dựng một công ty AI giọng nói (TTS)?

Sự phát triển của công nghệ giọng nói AI đã tạo ra một tập hợp hoàn toàn mới các chướng ngại vật cho cả nhà sản xuất và người tiêu dùng. Một trong những thách thức chính là không bị sa vào tiếng ồn và sự cường điệu tràn ngập lĩnh vực AI. Là một công nghệ mới và hot, nhiều tổ chức đang cố gắng tận dụng các phát triển giọng nói AI ngắn hạn. Chúng tôi muốn cung cấp một giọng nói cho mọi người, được hướng dẫn bởi các nguyên tắc đạo đức trung tâm và tính xác thực. Sự tuân thủ tính xác thực này có thể trì hoãn sự phát triển và triển khai công nghệ của chúng tôi nhưng củng cố sự an toàn và bảo mật của giọng nói WellSaid và dữ liệu của chúng.

Một thách thức khác trong việc phát triển nền tảng TTS của chúng tôi là phát triển các hướng dẫn đồng ý cụ thể để đảm bảo rằng các tổ chức hoặc diễn viên riêng lẻ sẽ không lạm dụng công nghệ của chúng tôi. Để chống lại thách thức này, chúng tôi tìm kiếm các quan hệ đối tác hợp tác và lâu dài và hoàn toàn tham gia vào việc phát triển giọng nói để tăng trách nhiệm, minh bạch và bảo mật người dùng. Chúng tôi tích cực tìm kiếm các quan hệ đối tác với tài năng giọng nói từ các nền tảng, tổ chức và kinh nghiệm đa dạng để đảm bảo rằng thư viện giọng nói của WellSaid Labs phản ánh cả người sáng tạo và khán giả của nó. Những quá trình này được thiết kế để có chủ ý và chi tiết để đảm bảo công nghệ của chúng tôi được sử dụng một cách an toàn và đạo đức nhất có thể, điều này có thể làm chậm thời gian phát triển và ra mắt.

Visions của bạn cho tương lai của giọng nói AI tạo sinh là gì?

Trong thời gian dài, công nghệ giọng nói AI không đạt được chất lượng đủ cao để cho phép các công ty tạo ra nội dung có ý nghĩa ở quy mô lớn. Giờ đây, công nghệ âm thanh không còn yêu cầu thiết bị và phần cứng đắt tiền, tất cả nội dung viết có thể được sản xuất và xuất bản ở định dạng âm thanh để tạo ra các trải nghiệm đa phương tiện hấp dẫn và tự nhiên hơn.

Ngày nay, giọng nói AI có thể tạo ra âm thanh giống như con người và nắm bắt được sự tinh tế cần thiết để làm cho câu chuyện kỹ thuật số trở nên dễ tiếp cận và tự nhiên hơn. Tương lai của giọng nói AI tạo sinh sẽ là những trải nghiệm âm thanh bao quát chạm vào mọi khía cạnh của cuộc sống chúng ta. Khi công nghệ tiếp tục phát triển, chúng ta sẽ thấy giọng nói tổng hợp ngày càng tự nhiên và富 biểu cảm mờ ranh giới giữa giọng nói của con người và máy móc – mở ra cánh cửa mới cho kinh doanh, truyền thông, khả năng tiếp cận và cách chúng ta tương tác với thế giới xung quanh.

Các doanh nghiệp sẽ tìm thấy sự cá nhân hóa tăng cường trong các giao diện giọng nói AI và sử dụng chúng để làm cho các tương tác với các trợ lý ảo trở nên hấp dẫn và thân thiện với người dùng hơn. Những cải tiến này đã đang xảy ra, từ các đại lý gọi điện thông minh đến các quầy phục vụ nhanh. Việc tạo nội dung, bao gồm quảng cáo, tiếp thị sản phẩm, tường thuật tin tức, podcast, sách nói và các phương tiện truyền thông đa dạng khác, sẽ thấy sự hiệu quả tăng lên bằng cách sử dụng các công cụ để phát triển nội dung hấp dẫn – cuối cùng tăng doanh thu và doanh thu cho các tổ chức, đặc biệt là khi các mô hình đa ngôn ngữ có thể mở rộng sự hiện diện của một công ty từ một điểm xuất phát duy nhất đến sự hiện diện toàn cầu. Các đội sản xuất sẽ tìm thấy lợi ích lớn trong giọng nói tổng hợp để tạo ra giọng nói được thiết kế riêng cho nhu cầu của thương hiệu hoặc tùy chỉnh cho người nghe.

Trước khi giới thiệu AI, công nghệ TTS thiếu khả năng cảm xúc, ngữ điệu và phát âm của con người cần thiết để kể một câu chuyện đầy đủ ở quy mô và với sự dễ dàng. Giờ đây, TTS được hỗ trợ bởi AI cung cấp các trải nghiệm hấp dẫn và dễ tiếp cận hơn, bao gồm khả năng nói chuyện thời gian thực và các tác nhân đối thoại tương tác.

Đạt được khả năng nói chuyện giống như con người đã là một hành trình, nhưng giờ đây khi điều đó có thể đạt được, chúng ta đang chứng kiến toàn bộ phạm vi của giọng nói AI để tạo ra giá trị kinh doanh thực sự cho các tổ chức.

Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập WellSaid Labs.

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.