访谈
Jaime Bosch,Voicemod 首席执行官 – 采访系列

Jaime Bosch 是 Voicemod 的首席执行官,Voicemod 是一款免费的语音改变软件,适用于游戏玩家、内容创作者和 VTuber。
您能否分享 Voicemod 的创立故事?
作为 10 个孩子中的第 8 个,我从小就成长在一个能够充分发挥我创业精神的环境中,因为我的兄弟姐妹们都有相同的想法和支持。
因此,我的两个兄弟和我都对技术和音乐有着深厚的兴趣,我们开始尝试创建一个将这些兴趣结合起来的应用程序。因此,在 2009 年,我们创建了一个面向消费者的音乐应用程序作为我们的副业,同时我们也在经营一家录音棚作为我们的主要职业。
由于这是一个副业,我们尝试了很多事情,例如语音调制,这激发了我们创造一些完全新颖和创新的东西的灵感。我们称之为“Voicemod 体验”——一种完全新的方式来体验自己的声音——这成为应用程序演变的驱动力。无论谁尝试我们的软件,我们都遇到了相同的反应:人们听到自己以完全不同的方式说话时的笑声和惊讶。
这使我们重新定义了对产品的愿景,将其转变为能够通过声音媒介演变人类联系的东西。因此,我们将体验从移动设备转移到 PC 上,在那里它被迅速被游戏和流媒体场景所采用——其余的,如人们所说,就是“历史”了。
Voicemod 最初是一个副业——您是什么时候决定全职投入的?
最初,我的兄弟和我一起拥有一个名为 2taptap 的工作室。当我们想出创建 Voicemod 的想法时,它最初只是一个有趣的副业,但随着时间的推移,我们看到人们如何与之交互以及该技术的潜力。直到那时,大多数语音改变技术都是异步的,因此能够在实时环境中体验成为他人的感觉对于很多人来说是新颖的。然而,对我们来说,决定性时刻是意识到人们不仅仅使用我们的技术来娱乐,还使用它来塑造他们在线表达自己的整个方式。这是我们意识到我们正在构建的东西不仅仅是关于娱乐的东西,而可能是社会音频体验的下一步。
您能否讨论一些语音识别技术?
在我们的语音转换器目录中,有一些过程被应用于将普通人声转换成新东西。当然,还有一些方面需要考虑,例如年龄、性别、情感和简单的说话方式变化。
这些变化都会影响声音的变化。我们利用最先进的语音识别技术来实现语音转换和转换,并不断改进这一过程。我们希望给人们机会来塑造他们被他人感知的方式,听起来像他们想要的样子,并为他们的受众提供良好的听觉体验。
为什么帮助人们通过声音表达自己很重要?
从我们出生时的第一声哭泣开始,声音就是我们自然表达自己的方式。随着我们长大,音频交流的重要性继续增长,因为我们学会了将声音塑造成语言,并使用我们的声音为我们所说的文字添加情感和细微差别。通过提高我们的语调,我们可以表达兴奋——或者使用声音效果,如叹息或呻吟,来强调我们想要表达的观点。
对于一些非常有才华的人,声音是一种无限表达的工具——他们可以创造出无数的音效或声音。然而,大多数人并不幸运,实际上会对自己的声音感到不舒服(尤其是听到自己被录音时)。我们的有些用户谈到在陌生人面前说话时感到紧张,并且对无法以他们想要的方式表达自己感到沮丧。
这就是我们看到帮助人们的巨大机会。通过我们的语音身份,用户可以塑造他们的声音,使其成为他们感到舒适的东西——或者为特定情况切换到不同的声音。我们还希望赋予他们使用声音效果、音乐片段或音频表情来创造氛围、传达背景或实现喜剧效果的能力——就像图形表情符号帮助塑造文本通信一样。
您将 Voicemod 描述为通过声音演变人类联系,您能否详细说明这一点?
除了解放说话者和消除某些心理障碍外,我们还致力于使这种联系更加深入。例如,我们的声卡将通信提升到下一个层次——可以将其视为“音频表情符号”。你能想象 35 岁以下的人在不使用表情符号的情况下聊天吗?虽然这种技术已经存在很长时间了,但它只是在大约 2010 年才深入人心。我们看到类似的趋势出现在消息平台上的贴纸、语音消息和语音笔记上,现在也出现了 GIF 和 Giphy 的使用。随着全球音频通信的增长,声音的使用方式变得越来越重要。向朋友的笑话发送音频反应可以比输入一句话更能表达你的真实、诚实的反应。想象一下听到蟋蟀的声音和 ba dum tss! 之间的区别。它们都具有截然不同的含义和情感,你可以只需点击一下就能传达出来。
我们希望让用户能够轻松使用语音、语音效果和音频表情符号,以便与朋友、家人或陌生人进行更吸引人的音频对话。
Voicemod 应用程序背后的机器学习技术是什么,包括允许用户以更好的方式定制声音的技术?
机器学习是 Voicemod 大多数新功能的核心。
关于创造性方面,Voicemod 的 Voicelab 创造了市场上第一个实时语音转换技术,允许用户选择自己的音频身份,创建个人声音。
我们即将发布的新技术将创建以前从未听过的声音,具有独特的特征,这将有助于保护用户的隐私和安全,同时也允许他们通过声音创建理想的个性。
我们还观察到近年来出现了数据驱动的深度学习方法。这些方法使我们能够学习语音信号中与语音感知特征相关的抽象隐藏结构,例如语音学、内容、身份、意图和情绪。利用这些技术,我们可以控制和修改信号的感知方面。这使我们能够设计出能够让用户以以前无法实现的方式控制他们被感知的语音身份的技术。
Voicemod 的一些用例是什么?
Voicemod 的一个很棒的事情是,它的工具满足了广泛的需求和场景。更常见的情况可能是用于内容创作、与朋友游戏、与家人或朋友聊天、创建沉浸式角色扮演环境,甚至用于工作和商业——在这些情况下,用户主要使用我们的噪音消除和音频增强工具。
您能否讨论一下与兄弟姐妹一起创业的挑战和好处?
说实话,我很乐意讨论这个话题,我知道每个人都会面临一些挑战,但我实际上不记得我们遇到了太多挑战。原因是,我们来自一个非常大的家庭。我们一直在一起做事情,从童年项目到演奏音乐和创作。所以,自然而然地,我们最终会一起工作。我的兄弟费尔南多和胡安——正如我提到的,与我一起创立了 Voicemod——已经有了几年的创业经验。2010 年,我加入了他们的公司 2taptap,因此我也对此有所了解。当我们创建 Voicemod 时,我们完全清楚我们想要实现什么,以及如何实现。这使得我们能够将强大的价值观文化带入 Voicemod,这是我们成功的关键因素。
您是否还有其他关于 Voicemod 的信息想要分享?
幕后正在发生很多事情,但与我们希望通过声音演变一切的愿景一致,我们目前正在努力使我们的技术更加……易于访问。我们希望让任何开发人员都能够在他们的产品中使用我们的技术。
我们知道人们大部分时间都在线上,连接着各种平台和应用程序。在在线环境中,你的“头像”就是你的全部自我表现。没有声音,谁是那个自我表现的人呢?
构建实时语音转换技术并开发一个完全可定制的音频表达系统是一项艰巨的任务。我们的团队已经将这一步从等式中去掉,设计了一个可以轻松集成到任何地方的开发工具包。我们非常高兴能够让我们的技术面向全球的开发人员和用户,同时继续构建社会音频体验的未来!
感谢这次精彩的采访,希望了解更多的读者可以访问 Voicemod。












