访谈

Phil Marshall,Spoken 创始人兼首席执行官 – 访谈系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Phil Marshall,Spoken 的创始人兼首席执行官,是一名医生、发明家、技术企业家和科幻作家,其职业生涯跨足医疗保健、数字媒体、人工智能和产品创新。在 2024 年推出 Spoken 之前,Marshall 共同创立了 Conversa Health,这是一家个性化患者参与和对话式 AI 公司,2021 年被 Amwell 收购并成为其自动化远程护理业务的一部分。早期职业生涯中,他在 WebMD 任职超过十年,担任产品战略副总裁,随后在 Press Ganey Associates 担任高级产品管理副总裁,并创立了协作视频技术初创公司 JumperCut。他的工作日益聚焦于 AI、叙事、脑机接口和知识技术的交叉点,将其技术专家和企业家背景与对科幻及新兴数字交互形式的兴趣相结合。

Spoken 是一个由 AI 驱动的有声书平台,旨在帮助作者、出版商和版权持有者在无需传统录音室的情况下,将手稿转化为专业制作的音频。其技术在分配叙述和对话的独特声音之前,会分析手稿的语言、风格、叙事结构和角色,支持单叙述者、双叙述者和多声部(Multi-Cast)制作。作者可以使用自定义生成的声音,从超过 100 位付费专业配音演员中挑选,或克隆自己的声音,同时保留作品、母带和发行权的所有权。Spoken 还提供面向希望在更大目录上制作有声书的出版商的应用程序接口(API),并强调其伦理 AI 模型,声明书面作品不会用于训练其系统,参与的人声演员也会得到报酬。

你的职业生涯从医学和 WebMD 的产品战略,到创立 Conversa Health,再到如今的 Spoken。是什么有声书创作中的问题促使你创办了 Spoken?你之前在对话式 AI 的工作如何影响了今天构建的平台?

在 Conversa,我们的使命是通过自动化个性化的外联、后续问题和指导,扩展护理团队的声音——这些本来是大型健康系统的临床部门如果有时间会直接通过电话提供给患者的。最初,我们给机器人赋予了人格化的形象,名为 Cate,以第一人称自称。然而,我最终决定伪装成人类是不诚实的。Cate 并不是人,我也不想让患者误以为它是人。因此,我们去掉了人格名称,改用复数的“我们”,让它被视为护理团队的延伸,事实上它确实如此。这段经历让我明白,自动化解决方案仍然可以像真实的人工关怀延伸,而不必假装是人类。

快进到 Spoken,我们专注于真实、以人为本的表达。我们帮助解决的问题显而易见——大多数故事由于时间和成本限制,无法以完整的音频潜力触达增长最快的受众(听众),但我长期坚持的理念是成为人类的真实延伸,这发挥了重要作用。不同于试图制造闲聊的 AI 播客或模拟同情的代理人,Spoken 的 Multi-Cast 叙述让作者的真实文字栩栩如生。因为我们在讲故事,而不是试图复制人类互动,所以我们的 AI 并不假装是人。这些都是故事中的角色,因此我们很幸运能够避免任何混淆和冲突。

作为一名硬科幻作家和 AI 企业家,你曾经如何预期人工智能的发展?而现实中的 AI 发展与您想象的未来最显著的分歧在哪里?

这个问题对我而言非常亲切。我热爱生活在艺术、科学和技术的交叉点上,在我的近未来科幻作品中描绘自动化系统正是一个很好的例子。事实上,我写到的每一家未来公司——而且不止一家——都有我拥有的域名、我设计的产品以及我相信有朝一日能成为真实公司的概念。甚至我家前面的雕塑也是以 The Kite Factory 标志的现代主义形状为模型,我想象这家公司有一天会创造出改变星球的反重力技术!

聚焦于 AI,我发现未来科幻往往没有讨论人们如何获取、使用和共享信息。到 2100 年,他们真的还会用电话打给别人来回答事实性问题吗?我在写作和现实生活中的哲学很简单:能自动化的就会被自动化,我们始终会趋向于更实时、更协作、更与物理融合的信息。我还要补充一点,我个人对植入物有厌恶感。这也是为什么在我的书的背景故事中,当 Elon Musk 将他的 Starlink 卫星连接到 Neuralink 植入体并直接向人脑广播信息时,我们禁止了脑植入!

关于分歧的问题:因为我相信能自动化的就会被自动化,事实性问题的自动化正以一种必然的方式发生。然而,涉及情感——艺术、音乐和故事——时出现了一些分歧。由于 AI 是在已有模式上进行训练的,按定义它永远无法创造出真正全新的东西。然而人们正在使用 AI 写故事、创作艺术、作曲。这怎么可能?因为艺术并不一定要全新或独特。我相信,这意味着未来真正突破常规的创作将更加珍贵。我希望我们仍能在那时辨识出来。

最近的 Edison Research 研究 将 Spoken 的多声部制作与专业制作的单叙述者人声版本进行比较。你将 Spoken 的优势归因于底层 AI 技术的程度有多少?又有多少来自为每个角色赋予独特声音?与完整的人声阵容相比,结果可能有何不同?

分析故事及每个角色以得出其完美声音,实际上是我们 AI 的重要组成部分。我们通过一套密集的代理过程,提取故事的底层层次,从体裁、语言等基础要素,到由口音和风格决定的节奏,以及多个角色互动的场景连贯性。所有这些由 AI 驱动的层次共同决定了实际的角色配音。这就是我们所称的“魔法模式”,可以把它想象成混合油漆颜色。

至于结果与完整人声阵容的差异,关键在于成本和工作流程。单击几秒并花费数百美元,相较于完整阵容,对独立作者和大多数出版商来说并不易得,这也是我们未以此为对比点的原因。不过在质量方面,我相信我们已经接近与完整阵容的平价,质量将难以区分。

Spoken Multi-Cast 在角色驱动的场景中获得更高评分,而人声叙述在叙事说明阶段表现更佳。是什么让非对话段落对 AI 叙述尤其困难?你们如何努力缩小这一差距?

实际上,并不是非对话段落对 AI 叙述困难;而是 AI 可使用的动态因素仍然少于人类配音演员。想象单一叙述者在一段文字中可以加入的每一种语调和表达细微差别。而在多声部情况下,由于角色声音的多样化、个性化音色以及将它们混合的过程(同样类似于混合油漆颜色),动态因素大幅增加。这意味着多声部场景能够更真实地呈现多人物之间的互动,而单一叙述者很难匹配这种效果。

至于缩小差距,单叙述者 AI 叙述所使用的动态因素将继续增加,差距也会随之缩小。

在听取样本之前,只有 31% 的受访者对 AI 配音的有声书感兴趣,但在体验了 Spoken Multi-Cast 后,这一比例上升至 65%。你认为表现的哪些要素最主要地改变了他们的看法?

实际上情况恰恰相反,这一调查设计要素非常关键。65% 的受访者在听到摘录后( 知道是 AI 之前)表示愿意聆听整本采用配音的有声书。随后我们更广泛地询问他们是否愿意听由 AI 配音的有声书,只有 31% 表示愿意。接着我们问他们是否认为所听到的是 AI 配音。听到 Spoken Multi-Cast 的受访者中只有 39% 认为可能是 AI,而听到人声版本的受访者中有 35% 认为可能是 AI。于是我们提出了下一个问题:既然你已经知道了,你是否愿意听由 AI 配音的有声书?这一意愿在曝光后跃升至 43%,我们正积极优化以缩小与 65% 基准的差距。

能否为我们详细说明将上传的手稿转化为多声部有声书的代理式 AI 工作流,包括系统如何识别说话者、解析角色、分配声音以及确定情感、时机和表达方式?

鉴于我们对该流程的专利尚在申请中,我只能从宏观上概述:这是一套高度代理式的多层次流程。我们已经打磨超过两年。故事的基本要素、节奏、场景连贯性以及最终精确的角色声音(我喜欢称之为“油漆层”)都是其中的一部分。获取情感表达的弧线和时机至关重要,我们在这方面投入最多。人们常惊讶于用于准备配音的 AI 量约是实际配音时使用的 AI 的 5 倍。

作者在最终制作中保留了多少创作控制权?当 AI 误解角色、发音、情感节拍或叙事意图时,有哪些工具可供使用?

作者对最终作品拥有绝对的控制权。无论是情感起伏、口音、音色还是时机,全部由他们掌控。我们的目标是让他们只需一次点击即可达到近乎完美的效果。如果作者、出版商或制作者需要对某段文字进行非常具体的呈现,他们可以使用“Speak It”功能,通过麦克风说出期望的表达方式,角色声音将精准地遵循。

我们认为作者应对自己的作品拥有完整所有权,甚至包括开头和结尾字幕中使用的声音。“Made with Spoken”也会使用作者选择的声音,包括他们自行录制的个人声音(如果他们愿意)。

Spoken 允许作者使用自定义生成的声音以及经批准的专业配音演员的声音克隆,这些配音演员在其声音被使用时会获得报酬。该模型如何在同意、所有权、报酬、撤销权以及防止未经授权的克隆方面进行保障?

我们仅与遵守严格伦理准则的配音合作伙伴合作,其中包括检测和禁止未经授权的声音使用(尤其重要以保护名人等显著声音)。例如,我们库中拥有来自 ElevenLabs 的众多顶级配音演员。这些配音演员会因作者的每一次使用而获得报酬。

你认为 AI 配音主要是通过让此前经济上不可行的标题变得可行来扩大有声书市场,还是也会取代传统制作的部分环节?随着技术成熟,哪些角色仍将保持明显的人类属性?

我们设想有声书市场将大幅扩展,吸引新读者,尤其得益于我们全新的、生动的多声部能力。最终,这一扩展的市场将由技术与人类的混合驱动。时间会给出答案,但这场变革可能更多关注作者/制作者的工作流程以及受众不断变化的收听习惯,而不是单纯是人声还是 AI。

Spoken 将有声书制作与出版、发现、流媒体、社区和变现相结合。AI 最终可能如何改变叙事本身,而不仅仅是让现有的有声书制作过程更快、更便宜?

让读者或听众“沉浸于故事”意味着什么?这正是此事的核心所在——在角色驱动的小说需求增长、音频成为消费故事的主流形态的时代,为受众提供沉浸式的音频体验。最终,无论是短篇、个人回忆录、同人小说还是史诗奇幻,快速且低成本地创作生动自然的呈现方式都将产生深远的长期影响。当前的有声书市场是近期的机遇,但短篇、竖屏短视频、连载、同人以及各种衍生形式都将因此蓬勃发展。当它们兴起时,我们希望 Spoken Multi-CastTM 成为其核心。

感谢这次精彩的访谈,想了解更多的读者请访问 Spoken

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。