访谈
Speechify联合创始人兼AI负责人Tyler Weitzman – 采访系列

Tyler Weitzman是Speechify的联合创始人、人工智能负责人和总裁,Speechify是世界上最好的文本转语音应用,拥有超过100,000个五星级评论。Weitzman毕业于斯坦福大学,获得数学学士学位和计算机科学硕士学位,专业方向为人工智能。他被Inc.杂志评为前50名企业家,并被Business Insider、TechCrunch、LifeHacker、CBS等媒体报道。他的硕士论文研究重点是人工智能和文本转语音,论文题目为:“CloneBot:个性化对话响应预测。”
您9岁开始编程,最初是什么吸引您对计算机科学的兴趣?
我小时候非常痴迷于龙珠Z,我想学习如何自己制作动画。我学习了Adobe (ADBE ) Flash和Photoshop,并在一个我自己搭建的粉丝网站上发布了我自己的动画。后来我开始学习系统和算法,当我发现我可以通过编程谋生时,我觉得非常兴奋。我当时以为这只是一个像玩游戏一样的爱好。
您12岁开始构建iPhone应用程序,哪些应用程序是您构建的?
其中一个应用程序叫做Black SMS,允许人们相互发送加密短信。另一个应用程序叫做Frontback,允许用户同时拍摄自拍和前面的照片。
您能否讨论您在斯坦福大学的研究,以及它如何围绕自然语言处理和语音合成展开?
我的研究涵盖了多种使用变换器网络的应用,包括语言生成模型、词性标注、标点符号预测和文本转语音。优化神经网络推理以适应移动CPU是我主要关注的内容,这直接应用于Speechify上的离线语音,这些语音即使在飞行模式下也可以工作。
您能否分享Speechify的创立故事?
我有一只眼是盲的,我的兄弟Cliff是患有阅读障碍。我们从小就使用有声书和文本转语音技术来完成学校作业和阅读书籍,如哈利波特。随着我们长大并开始使用更多技术产品,我们意识到有机会在网页和移动设备上构建更好的文本转语音应用程序,利用人工智能和更好的用户体验。因此,我们决定在Speechify上实现这一目标。
Speechify使用了哪些不同的机器学习技术?
我们采用了最先进的生成式架构技术——变换器/共形器、大规模预训练、分布式训练、梯度累积、自动编码潜在空间、扩散、对抗网络和语言模型。我们还使用了支持技术来处理语音周围的特征,例如音素化、音调和情感,以更好地模拟语音。
构建文本转语音应用程序的挑战是什么?
其中一个关键挑战是构建高质量的语音,使其听起来像真人而不是机器人。我们的目标是让人们无法区分我们的语音和人类语音,这样我们的用户可以舒适地长时间聆听Speechify上的内容。另一个挑战是将我们的AI模型分发给数百万用户。构建高质量的AI语音是一回事,而确保数百万用户在世界各地发现并使用它们是另一回事。
Speechify是其类别中最好的应用程序,您如何看待这一成功?
我们相信我们已经构建了市场上最好的产品,适用于那些需要聆听所需内容的人——无论是需要完成作业的学生、需要阅读工作文档的专业人士,还是仅仅想娱乐的读者。我们拥有最好的语音选择,包括名人如Snoop Dogg,并且拥有最好的用户界面,允许人们轻松上传和访问他们想要聆听的内容。我们的用户体验在整个Speechify生态系统中是无缝的——您可以在计算机上开始聆听一篇文章,然后轻松地在手机上继续聆听。
该应用程序的最大用例是什么?
Speechify的生成式AI解决了真实问题,例如帮助学生更快地完成作业、帮助阅读障碍和多动症患者、帮助视力低下的老年人、帮助专业人士提高生产力、帮助作家聆听他们的作品、帮助听觉学习者,以及许多其他人。
您对AI的未来有什么展望?
我们希望AI——特别是AI文本转语音——能够消除学习的障碍,无论您的收入水平、学习差异、地理位置或语言如何。我们认为AI是一种社会福利工具,可以通过提高教育来提高人类的生活质量。
感谢您接受这次精彩的采访,希望了解更多的读者可以访问Speechify。












