访谈
Pavel Osokin,AMAI联合创始人兼CEO – 采访系列

Pavel Osokin是AMAI的联合创始人兼CEO,AMAI是一家位于旧金山的初创公司,生产人工智能语音引擎。Pavel领导着AMAI的运营和战略,具有将其语音技术安装到世界每部手机中的职业抱负。在AMAI,他们开发了一个人工智能语音,97%的用户无法将其与真正的人类语音区分开来。
您一生都在创业,13岁就创立了第一家公司,什么是您第一次创业尝试,什么激发了您成为企业家的想法?
我并没有把它称为公司,但我通过转卖东西或在街上用桶洗车赚了我的第一笔钱。我的动力是,我想要一罐可乐或一块斯尼克斯巧克力,但我的父母没有钱。我可以等待钱出现,或者自己赚钱。等待对我没有吸引力。
您能否分享AMAI的创立故事?
我问我的合伙人,“世界各地的公司需要什么?”在那次谈话中,我意识到每家企业都在寻找“销售”。我们开始制作可以通过邮件和信使与客户对话并销售产品的机器人。另一方面,这并不是特别新鲜的东西,因为有很多聊天机器人可用。所以,我们认为如果这些机器人也可以打电话,那将会很酷。由于市场上没有很好的解决方案,我们创建了自己的合成语音的原型,并在第一次销售后放弃了机器人,专注于文本转语音技术。
AMAI具体代表什么?
这代表“我是人工智能”(I’m artificial intelligence)。
您能否讨论一下设计最先进的文本转语音技术的一些挑战?
设计最先进的文本转语音技术提供了几个挑战。第一个挑战是收集数据集。训练神经网络需要不同年龄的男女声音,越多越好。第二个挑战是实现与自然声音非常相似的效果。最好的方法是测试不同的机器学习模型,并不断尝试不同的语音使用情况:特别是,您需要找到最具挑战性的样本并单独处理它。谈到长期挑战,评估语音是否变得更好或更差,并确定它应该在哪个方向上改进可能会很困难。
在人类与AMAI语音人工智能交互时,语音识别的一些挑战是什么?
有数百家公司正在从事语音识别,因为它更容易开发。目前没有解决方案的问题是儿童语音的识别。儿童在年幼时就具有许多语音特征,因此很难考虑到所有这些因素。尽管如此,我们一直在致力于解决这个问题,我们即将宣布结果——因此,很快我们的AI将不仅能与成人交互,还能与儿童交互。
AMAI的一些流行用例是什么?
目前,它主要用于有声书配音和企业呼叫中心。
目前支持哪些语言,哪些语言正在开发中?
我们的多语音系统包括两种语言,俄语和英语。该想法是,一种语言中创建的语音可以在我们的模型中使用所有其他语言。目前,我们正在为40多种语言收集数据,很快我们将支持42种语言。
您对未来人工智能语音助手的展望是什么?
我相信语音助手将进入元宇宙,我们正在研究这些机会。如果您将助手与智能扬声器或网络浏览器集成,更多的人将每天使用语音搜索和与助手交互。您可以与冰箱或电视交谈。
关于AMAI,还有您想分享的内容吗?
AMAI仅使用其自己的专有技术。
感谢这次采访,希望了解更多的读者请访问AMAI。












