Phỏng vấn

Phil Marshall, Người sáng lập và Giám đốc điều hành của Spoken – Loạt phỏng vấn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Phil Marshall, Founder and CEO of Spoken, là một bác sĩ, nhà phát minh, doanh nhân công nghệ và nhà văn khoa học viễn tưởng, người có sự nghiệp trải dài trong lĩnh vực chăm sóc sức khỏe, truyền thông kỹ thuật số, trí tuệ nhân tạo và đổi mới sản phẩm. Trước khi ra mắt Spoken vào năm 2024, Marshall đã đồng sáng lập Conversa Health, một công ty tương tác cá nhân với bệnh nhân và AI hội thoại, được Amwell mua lại vào năm 2021 và trở thành một phần của dịch vụ chăm sóc ảo tự động của họ. Trong giai đoạn đầu sự nghiệp, ông đã làm việc hơn một thập kỷ tại WebMD với vị trí Phó Chủ tịch Chiến lược Sản phẩm, sau đó giữ chức vụ Phó Chủ tịch Cấp cao Quản lý Sản phẩm tại Press Ganey Associates, và sáng lập công ty khởi nghiệp công nghệ video hợp tác JumperCut. Công việc của ông ngày càng tập trung vào giao điểm của AI, kể chuyện, giao diện não-máy và công nghệ tri thức, kết hợp nền tảng công nghệ và doanh nhân của mình với niềm đam mê khoa học viễn tưởng và các hình thức tương tác kỹ thuật số mới nổi.

Spoken là một nền tảng audiobook được hỗ trợ bởi AI, được thiết kế để giúp tác giả, nhà xuất bản và chủ sở hữu quyền chuyển đổi bản thảo thành âm thanh chuyên nghiệp mà không cần dựa vào phòng thu truyền thống. Công nghệ của nó phân tích ngôn ngữ, phong cách, cấu trúc câu chuyện và các nhân vật trong bản thảo, sau đó gán các giọng nói riêng biệt cho phần thuyết minh và đối thoại, hỗ trợ các sản phẩm một người thuyết minh, hai người thuyết minh và đa giọng. Tác giả có thể sử dụng giọng nói được tạo tùy chỉnh, chọn trong hơn 100 diễn viên lồng tiếng chuyên nghiệp trả phí, hoặc sao chép giọng nói của chính mình, đồng thời giữ quyền sở hữu tác phẩm, bản gốc và quyền phân phối. Spoken cũng cung cấp một giao diện lập trình ứng dụng (API) dành cho các nhà xuất bản muốn sản xuất audiobook trên quy mô lớn, đồng thời nhấn mạnh mô hình AI đạo đức, trong đó họ khẳng định các tác phẩm viết không được sử dụng để đào tạo hệ thống và các diễn viên lồng tiếng người tham gia được trả công.

Sự nghiệp của bạn đã đưa bạn từ y học và chiến lược sản phẩm tại WebMD đến việc sáng lập Conversa Health và hiện tại là Spoken. Vấn đề nào trong việc tạo audiobook đã thuyết phục bạn thành lập Spoken, và công việc trước đây của bạn trong AI hội thoại đã ảnh hưởng như thế nào đến nền tảng mà bạn đang xây dựng ngày hôm nay?

Với Conversa, sứ mệnh của chúng tôi là mở rộng giọng nói của đội ngũ chăm sóc bằng cách tự động hoá việc tiếp cận cá nhân, các câu hỏi theo dõi và hướng dẫn mà một phòng khám lâm sàng trong một hệ thống y tế lớn sẽ cung cấp trực tiếp cho bệnh nhân qua điện thoại, nếu họ có thời gian. Ban đầu, chúng tôi đã nhân hoá bot bằng một nhân vật, Cate, người tự gọi mình ở ngôi thứ nhất. Tuy nhiên, cuối cùng tôi nhận ra việc giả vờ là con người là không trung thực. Cate không phải là một người, và tôi không muốn bệnh nhân nghĩ rằng nó là. Vì vậy, chúng tôi đã loại bỏ tên nhân vật và chuyển sang sử dụng đại từ số nhiều “Chúng tôi” để nó được nhìn nhận như một phần mở rộng của đội ngũ chăm sóc, và thực sự là như vậy. Trải nghiệm này dạy tôi rằng các giải pháp tự động vẫn có thể cảm thấy như một phần mở rộng chân thực của sự chăm sóc con người mà không cần giả vờ là con người.

Tiến tới Spoken, nơi chúng tôi tập trung vào biểu đạt chân thực, lấy con người làm trung tâm. Vấn đề chúng tôi giúp giải quyết là rõ ràng – hầu hết các câu chuyện không thể tiếp cận khán giả đang tăng trưởng nhanh nhất (người nghe) với tiềm năng âm thanh đầy đủ do giới hạn về thời gian và chi phí – nhưng triết lý lâu dài của tôi là trở thành một phần mở rộng chân thực của con người đã đóng vai trò quan trọng. Không giống như các podcast AI cố gắng tạo ra những cuộc trò chuyện giả tạo hay các tác nhân mô phỏng sự cảm thông, việc thuyết minh Multi-Cast của Spoken mang lại những lời nói thật của tác giả thành hiện thực. Vì chúng tôi đang kể chuyện, không cố gắng sao chép các tương tác con người, nên không có sự giả vờ rằng AI của chúng tôi là một người. Đây là các nhân vật trong câu chuyện, vì vậy chúng tôi may mắn tránh được bất kỳ sự nhầm lẫn hay xung đột nào.

Với tư cách là một nhà văn khoa học viễn tưởng cứng và một doanh nhân AI, bạn đã từng kỳ vọng trí tuệ nhân tạo sẽ phát triển như thế nào, và thực tế của sự phát triển AI đã khác biệt rõ rệt nhất so với tương lai mà bạn tưởng tượng ở đâu?

Câu hỏi này rất gần gũi với trái tim tôi. Tôi yêu thích sống ở giao điểm của nghệ thuật, khoa học và công nghệ, và việc miêu tả các hệ thống tự động trong tiểu thuyết khoa học viễn tưởng tương lai gần của tôi là một ví dụ tuyệt vời cho điều đó. Thực tế, mọi công ty tương lai mà tôi viết – và có khá nhiều – đều có một tên miền mà tôi đã sở hữu, một sản phẩm mà tôi đã thiết kế, và một khái niệm mà tôi tin rằng một ngày nào đó có thể trở thành công ty thực tế. Ngay cả bức tượng trước nhà tôi cũng được mô phỏng theo hình dạng hiện đại của logo The Kite Factory, một công ty mà tôi tưởng tượng sẽ một ngày tạo ra công nghệ chống trọng lực sẽ biến đổi hành tinh!

Tập trung vào AI, tôi gặp vấn đề khi tiểu thuyết khoa học viễn tưởng tương lai không đề cập đến cách con người thu thập, sử dụng và chia sẻ thông tin. Vào năm 2100, họ có thực sự vẫn dùng điện thoại để gọi người khác trả lời các câu hỏi thực tế không? Triết lý của tôi trong việc viết lách, và trong cuộc sống thực, rất đơn giản: Những gì có thể tự động hoá sẽ được tự động hoá, và chúng ta sẽ luôn xu hướng hướng tới thông tin thời gian thực hơn, hợp tác hơn và tích hợp vật lý hơn. Tuy nhiên, tôi phải nói thêm rằng tôi có một sự phản cảm cá nhân đối với các cấy ghép. Đó là lý do, trong cốt truyện của cuốn sách, khi Elon Musk kết nối các vệ tinh Starlink với cấy ghép Neuralink của mình và bắt đầu truyền tin nhắn trực tiếp vào não người, chúng tôi đã cấm cấy ghép não!

Về câu hỏi khác biệt: vì tôi tin rằng những gì có thể tự động hoá sẽ được tự động hoá, việc tự động hoá các câu hỏi thực tế đang diễn ra như một điều không thể tránh khỏi. Tuy nhiên, khi nói đến các vấn đề của trái tim – nghệ thuật, âm nhạc và câu chuyện – đã có một chút khác biệt. Vì AI được đào tạo trên các mẫu đã tồn tại, theo định nghĩa, nó sẽ không bao giờ có thể tạo ra điều gì thực sự mới. Tuy nhiên, mọi người vẫn đang viết câu chuyện, tạo nghệ thuật và soạn nhạc bằng AI. Điều đó có thể như thế nào? Bởi vì nghệ thuật không nhất thiết phải hoàn toàn mới hay độc đáo. Điều đó, tôi tin, sẽ có nghĩa là trong tương lai, những sáng tạo phá vỡ khuôn mẫu sẽ trở nên quý giá hơn. Tôi hy vọng chúng ta vẫn sẽ nhận ra khi điều đó xảy ra.

Một nghiên cứu gần đây của Edison Research đã so sánh sản xuất multi-cast của Spoken với phiên bản do con người một người thuyết minh chuyên nghiệp sản xuất. Bạn cho rằng lợi thế của Spoken đến từ công nghệ AI nền tảng bao nhiêu, và bao nhiêu đến từ việc cung cấp cho mỗi nhân vật một giọng nói riêng? Kết quả có thể khác nhau như thế nào so với một dàn diễn viên người đầy đủ?

Phân tích câu chuyện và từng nhân vật để tìm ra giọng nói hoàn hảo cho họ thực sự là một phần lớn trong AI của chúng tôi. Chúng tôi thực hiện một quy trình tác nhân chuyên sâu để xác định các lớp nền của câu chuyện, từ những yếu tố cơ bản như thể loại và ngôn ngữ đến nhịp điệu do giọng điệu và phong cách quyết định, cũng như sự gắn kết cảnh của nhiều nhân vật tương tác. Tất cả các lớp do AI này cung cấp thông tin cho việc thuyết minh giọng nói của nhân vật. Đó là những gì chúng tôi gọi là “Chế độ Ma thuật”, và bạn có thể nghĩ nó giống như việc pha màu sơn.

Khi nói đến cách kết quả có thể khác so với một dàn diễn viên người đầy đủ, thực chất là vấn đề chi phí và quy trình làm việc. Một cú nhấp chuột và vài trăm đô la, so với một dàn diễn viên đầy đủ, không thể tiếp cận được với các tác giả độc lập và hầu hết các nhà xuất bản, vì vậy đó không phải là tiêu chí so sánh của chúng tôi. Về chất lượng, tuy nhiên, tôi tin rằng chúng tôi đã đạt gần mức tương đương với dàn diễn viên đầy đủ, nên chất lượng sẽ không thể phân biệt được.

Spoken Multi-Cast nhận được đánh giá cao hơn cho các cảnh dựa trên nhân vật, trong khi thuyết minh của con người lại thể hiện tốt hơn trong phần diễn giải. Điều gì khiến các đoạn không có đối thoại đặc biệt khó khăn cho việc thuyết minh AI, và bạn đang làm gì để thu hẹp khoảng cách đó?

Thực ra, không phải các đoạn không có đối thoại khó khăn cho thuyết minh AI; mà là số lượng động lực mà AI phải làm việc vẫn ít hơn so với một diễn viên lồng tiếng người. Hãy tưởng tượng mọi sắc thái của ngữ điệu và cách truyền đạt mà một người thuyết minh duy nhất có thể mang lại cho một đoạn văn. Tuy nhiên, với multi-cast, số lượng động lực lớn hơn rất nhiều nhờ vào các âm sắc đa dạng, cá nhân hoá của các giọng nói nhân vật và quá trình pha trộn chúng, giống như việc pha màu sơn. Điều đó có nghĩa là các cảnh multi-cast có thể mang lại tính hiện thực của các tương tác giữa nhiều người theo cách mà một người thuyết minh duy nhất khó có thể sánh kịp.

Về việc thu hẹp khoảng cách, số lượng động lực được sử dụng trong thuyết minh AI một người sẽ tiếp tục tăng, và khoảng cách sẽ tiếp tục thu hẹp.

Trước khi nghe các mẫu, chỉ 31% người tham gia bày tỏ quan tâm đến audiobook do AI thuyết minh, nhưng con số này tăng lên 65% sau khi họ trải nghiệm Spoken Multi-Cast. Bạn cho rằng yếu tố nào trong phần trình diễn đã đóng góp lớn nhất vào việc thay đổi nhận thức của họ?

Thực ra, ngược lại, và yếu tố thiết kế của khảo sát này rất quan trọng. 65% cho biết họ sẽ nghe toàn bộ audiobook với cách thuyết minh này sau khi nghe các đoạn trích, trước khi biết đó là AI. Sau đó, chúng tôi hỏi chung hơn, liệu họ có sẵn sàng nghe audiobook được thuyết minh bằng AI không, và chỉ có 31% trả lời có. Tiếp theo, chúng tôi hỏi họ có nghĩ rằng những gì họ nghe là AI không. Chỉ có 39% trong số những người nghe Spoken Multi-Cast nghi ngờ có thể là AI, so với 35% những người nghe phiên bản con người và nghĩ rằng chúng có thể là AI. Điều này khiến câu hỏi tiếp theo của chúng tôi nổi bật: Bây giờ bạn đã biết điều này, bạn có sẵn sàng nghe một audiobook được thuyết minh bằng AI không? Sự sẵn sàng này đã tăng lên 43% sau khi tiếp xúc, và chúng tôi đang tích cực tối ưu để thu hẹp khoảng cách tới mục tiêu 65%.

Bạn có thể hướng dẫn chúng tôi quy trình AI tác nhân chuyển đổi bản thảo đã tải lên thành audiobook đa giọng, bao gồm cách hệ thống xác định người nói, diễn giải nhân vật, gán giọng nói và xác định cảm xúc, thời gian và cách truyền đạt không?

Vì chúng tôi đang có các bằng sáng chế đang chờ xử lý cho quy trình này, tôi sẽ tóm tắt ở mức cao bằng cách nói rằng đây là một quy trình tác nhân mạnh mẽ, cung cấp nhiều lớp. Đây là quy trình chúng tôi đã tinh chỉnh hơn hai năm. Các yếu tố cơ bản của câu chuyện, nhịp điệu của câu chuyện, sự gắn kết cảnh, và cuối cùng là giọng nói chính xác của từng nhân vật, hay như tôi gọi chúng là “lớp sơn”, đều là một phần của quy trình. Việc nắm bắt đường cung cảm xúc và thời gian truyền đạt là yếu tố then chốt, và chúng tôi tập trung vào đó hơn bất kỳ điều gì khác. Thường người ta ngạc nhiên khi biết AI dùng để chuẩn bị cho việc thuyết minh khoảng gấp 5 lần so với AI được dùng trong phần thuyết minh thực tế.

Tác giả giữ được bao nhiêu quyền kiểm soát sáng tạo đối với sản phẩm cuối cùng, và công cụ nào có sẵn khi AI hiểu sai một nhân vật, cách phát âm, nhịp cảm xúc hoặc ý định câu chuyện?

Tác giả có quyền kiểm soát tuyệt đối đối với sản phẩm cuối cùng. Dù là các sắc thái cảm xúc, giọng nói, âm sắc giọng, hay thời gian, họ đều kiểm soát toàn bộ. Mục tiêu của chúng tôi là đưa chúng đến mức tinh tế nhất chỉ với một cú nhấp chuột. Nếu tác giả, nhà xuất bản hoặc nhà sản xuất cần một cách truyền đạt rất cụ thể cho một đoạn, họ có thể sử dụng “Speak It” để nói vào micro và minh họa cách họ muốn truyền đạt, và giọng nhân vật sẽ thực hiện một cách tuyệt vời.

Chúng tôi tin rằng các tác giả nên cảm thấy sở hữu hoàn toàn tác phẩm của mình, ngay cả giọng nói được sử dụng trong phần mở đầu và kết thúc. Ngay cả “Made with Spoken” cũng sẽ sử dụng giọng nói mà họ chọn, bao gồm cả giọng cá nhân của họ nếu họ muốn.

Spoken cho phép các tác giả sử dụng giọng nói được tạo tùy chỉnh cũng như các bản sao giọng đã được phê duyệt từ các diễn viên lồng tiếng chuyên nghiệp, những người được trả công khi giọng của họ được sử dụng. Sự đồng ý, quyền sở hữu, tiền bồi thường, quyền thu hồi và bảo vệ chống sao chép trái phép được xây dựng như thế nào trong mô hình này?

Chúng tôi chỉ hợp tác với các đối tác giọng nói tuân thủ một quy tắc đạo đức nghiêm ngặt, bao gồm việc phát hiện và ngăn chặn việc sử dụng trái phép giọng nói (đặc biệt quan trọng để bảo vệ các giọng nổi tiếng của người nổi tiếng). Ví dụ, chúng tôi có nhiều giọng hàng đầu từ ElevenLabs trong thư viện của mình. Các diễn viên lồng tiếng đó được trả tiền cho mỗi lần sử dụng bởi các tác giả của chúng tôi.

Bạn có thấy việc thuyết minh AI chủ yếu mở rộng thị trường audiobook bằng cách làm cho các tựa sách trước đây không kinh tế trở nên khả thi, hay nó cũng sẽ thay thế một phần của quy trình sản xuất truyền thống? Những vai trò nào sẽ vẫn còn mang tính người rõ ràng khi công nghệ phát triển?

Chúng tôi hình dung một thị trường audiobook mở rộng đáng kể, thu hút độc giả mới, đặc biệt nhờ khả năng multi-cast sống động mới của chúng tôi. Cuối cùng, thị trường mở rộng này sẽ được thúc đẩy bởi sự kết hợp giữa công nghệ và con người. Thời gian sẽ trả lời, nhưng sự chuyển đổi này có thể ít liên quan đến việc liệu đó là tài năng giọng nói con người hay AI, mà nhiều hơn là quy trình làm việc của tác giả/nhà sản xuất và thói quen nghe của khán giả luôn thay đổi.

Spoken kết hợp sản xuất audiobook với xuất bản, khám phá, phát trực tuyến, cộng đồng và kiếm tiền. AI có thể thay đổi cách kể chuyện như thế nào cuối cùng, thay vì chỉ làm cho quy trình sản xuất audiobook hiện tại nhanh hơn và rẻ hơn?

Việc một người đọc hoặc người nghe “đắm chìm trong câu chuyện” có nghĩa là gì? Đó thực sự là mục tiêu của chúng tôi: mang đến cho khán giả trải nghiệm âm thanh nhập vai vào thời điểm nhu cầu về tiểu thuyết dựa trên nhân vật đang tăng và âm thanh trở thành hình thức tiêu thụ câu chuyện chủ đạo. Cuối cùng, dù là truyện ngắn, hồi ký cá nhân, fanfic hay tiểu thuyết giả tưởng hoành tráng, tốc độ và chi phí thấp trong việc tạo ra cách truyền đạt sinh động, tự nhiên sẽ có những tác động sâu rộng trong dài hạn. Thị trường audiobook hiện tại là cơ hội ngắn hạn, nhưng các dạng ngắn, video dọc, series, fanfic và nhiều nhánh phụ khác sẽ phát triển mạnh mẽ nhờ đó. Và khi chúng phát triển, chúng tôi muốn Spoken Multi-CastTM đứng ở trung tâm của chúng.

Cảm ơn bạn đã tham gia phỏng vấn tuyệt vời, độc giả muốn tìm hiểu thêm nên truy cập Spoken

Antoine là một nhà lãnh đạo có tầm nhìn và là đối tác sáng lập của Unite.AI, được thúc đẩy bởi niềm đam mê không ngừng nghỉ để định hình và quảng bá tương lai của AI và robot. Là một doanh nhân hàng loạt, ông tin rằng AI sẽ gây ra sự gián đoạn cho xã hội giống như điện, và thường được bắt gặp khi nói về tiềm năng của các công nghệ phá vỡ và AGI.

Là một nhà tương lai học, ông dành để khám phá cách những đổi mới này sẽ định hình thế giới của chúng ta. Ngoài ra, ông là người sáng lập của Securities.io, một nền tảng tập trung vào đầu tư vào các công nghệ tiên tiến đang định nghĩa lại tương lai và thay đổi toàn bộ lĩnh vực.