访谈
安德烈亚·瓦塔尼,Spiketrap联合创始人兼首席科学家 – 采访系列

安德烈亚·瓦塔尼是Spiketrap的联合创始人兼首席科学家,Spiketrap是一家为创作者、平台和品牌提供受众智能和媒体表现的上下文化公司。他们的专有Clair AI从无结构数据集的噪音中提取信号,提供无与伦比的清晰度和上下文,特别是在高速度的在线环境中。
是什么最初吸引你学习计算机科学和人工智能?
这是多种偶然的因素,我来到罗马大学参加统计专业的入学考试,结果我迟到了!我被建议改为申请计算机科学专业,等一年后再转回统计系。我参加了计算机科学的入学考试(当天就考试!),并通过了考试……从此再也没有转回统计系!我的兴趣在于如何利用计算机自动化事物,而人工智能是最终的自动化工具。另外,自然语言和人们如何使用它一直是我的兴趣:我在高中学习古典研究,研究古希腊语和拉丁语,这可能与机器接收一系列文字的方式类似。
您之前曾在亚马逊Goodreads担任高级软件工程师,您在那里工作过哪些项目?您从这段经历中得到了什么关键的收获?
(AMZN )在Goodreads期间,我参与了多个机器学习项目,包括垃圾邮件检测和图书推荐引擎的扩展。从我的经历中,我得到了一个关键的收获:定义与业务和客户目标相符的机器学习指标的重要性。例如,推荐引擎已经存在很久了。还记得2009年Netflix (NFLX ) 奖项比赛,旨在找出更好的电影推荐算法吗?一些获奖解决方案表明,你是否会观看一部电影并不是由你是否会喜欢它决定的,而是由它是否与你的兴趣相似。这种方法可能适用于电影,因为电影是一种短暂的90分钟的承诺,但对于书籍来说,这种方法并不适用。将正确的目标融入你的指标中是至关重要的。
我在Spiketrap应用的另一个收获是,构建面向交付的AI团队,并将其与产品路线图集成,而不是将其作为一个仅专注于探索和研究的孤立团队。这导致了更好的目标定义、时间表和对投资回报率的理解。它也自然地使团队专注于模型的速度和实用性,而不是纯粹地关注准确性。回想一下Netflix比赛的例子,获奖团队的模型由于不够实用而从未被集成,尽管它们的准确性有所提高。
您的研究已发表在多个期刊上,您认为到目前为止最重要的论文是什么?
在我的博士研究期间,我有幸与来自不同领域的几位研究人员合作,包括机器学习、“大数据”、社会数据分析和博弈论。一个我喜欢的论文是“可扩展的K-Means++”:K-Means++是一种无监督的聚类方法,用于将数据集划分为K个连贯的群体。它通过一次添加一个群体来实现,当你有大量数据和群体时,它变得非常慢。在这篇论文中,我们展示了如何通过并行化该方法来实现相同的甚至更好的准确性。我们的方法非常简单,并已被实施到几个机器学习库中。
您能否分享Spiketrap的创立故事?
在Goodreads工作之后,Spiketrap的联合创始人Kieran、Virgilio和我意识到,行业中存在一个空白,需要访问来自小众社交平台的高级品牌洞察。通过应用人工智能技术,我们可以高效地解决这个问题。
在今天的经济中,公司必须倾听客户和整个行业的声音。然而,客户对品牌的看法往往被忽略。每天,数百万人在Twitter、Reddit、Twitch等平台上公开表达他们的意见。这对任何市场研究人员来说都是一个非常有价值的资源,只要内容可以在规模上被上下文化。问题在于,洞察力行业并没有跟上数字行为和语言的演变。
监听工具仍然依赖于关键词和布尔搜索,错过了许多可以和应该归因于特定品牌的对话。同时,市场研究公司正面临着日益困难的平衡行为,试图从数量和成本有限的方法中获取定性洞察。简而言之,人们缺乏理解受众的工具。销售数字和浏览量只能回答受众行为的“是什么”,而不是“为什么”。没有上下文,弄清楚什么是相关的,什么是因果关系就是一个猜测游戏。认识到这一空白,我们深入研究了上下文理解的解决方案,于是Spiketrap诞生了。
Spiketrap使用了哪些机器学习技术?
我们使用了多种技术,从Scikit-learn到深度学习库,如Pytorch。除了库之外,我们使用的方法、模型和数据集大多是专有的。我们已经学会了,现成的方法和模型只能带你走到一定的距离,要真正解决问题,你需要从目标开始,深入到模型架构和数据集。例如,主题建模是从文本集合中提取主题的任务。我们的“Spiketrap Convos”为客户提供了有关其受众的关键洞察,并使用主题建模作为其中一个信号。你的典型主题建模方法是LDA(Latent Dirichlet Allocation),但不幸的是,它太不一致和不可预测,且不够强大。另一方面,你可以尝试使用像Bert-Topics这样的现代预训练模型,它虽然强大且全面的,但也非常僵化和缓慢。NLP和语言人工智能在过去十年中取得了巨大的进步,但将现有模型转化为产品仍然远非理想且存在风险。
您能否详细说明Spiketrap如何为创作者、平台和品牌提供即时的受众理解?
广告商和代理商使用我们的影响者排行榜和品牌亲和力工具来识别社区安全的创作者,涵盖多个类别,包括有毒、淫秽和性内容的评分,以及整体社区品牌安全性。
创作者可以使用该工具深入个别流媒体并查看哪些对话是最安全或最不安全的,对其赞助商的参与度起到了积极作用,以及他们可以在哪里改进其管理工作。
Spiketrap最近发表了一篇题为“FeelsGoodMan:推断Twitch新词的语义”的论文。您能否简要描述一下这篇论文?
人们在线上进行交流和表达自己的方式变得越来越复杂和难以理解。首先出现了情绪符号:-)。然后出现了表情符号。然后是表情包……现在是“emotes”,一种在Twitch流媒体平台上流行的基于图标的交流形式。与表情符号类似,它们与普通文本混合使用,但与表情包类似,它们是用户生成的,其神秘含义与所显示的图像没有明显的联系。截至目前,已经有超过800万个不同的emotes,每周使用超过40万个。尽管如此,人们仍然可以有效地使用它们来表达任何一种情感,如喜悦、无聊、兴奋或讽刺。我们的最近论文是关于如何推断emotes的语义含义的AI“食谱”。我们的方法不需要维护和更新手动策划的数据集,并且可以自适应地应对新emotes的引入以及流行emotes含义的演变。这在emotes被政治化或种族化时尤为重要,例如“TriHard”、“PogChamp”和“FeelsGoodMan”。语言的动态使用和含义的转变对调节系统或情感分析框架构成了巨大的挑战,我们为能够以正确的方式解决这个问题而感到自豪。
您是否还有其他关于Spiketrap的信息想要分享?
展望新的一年,Spiketrap正在开发和完善一款新工具,旨在为客户提供对品牌情绪的更深入的理解。Spiketrap的新Affinity Tool提供了一种交互式和直观的方式来识别和量化受众在创作者、品牌、游戏等方面的亲和力。对于任何给定的查询,该工具都会生成亲和力指数分数,指示给定实体与另一个实体之间的正相关性。多个上下文信号组成了该分数,包括相关提及的频率和情绪。Spiketrap的技术栈独特地定位了游戏、品牌和创作者之间的亲和力。他们的专有NLP AI Clair每天处理数百万条公开发布的用户生成消息,将其他模糊内容归因于Spiketrap广泛的知识图谱中,识别对话主题,确定情绪,并监测安全性。新Affinity Tool的添加使开发者、创作者、品牌和更多人能够进一步了解其受众和品牌影响。
感谢这次精彩的采访,希望了解更多的读者可以访问Spiketrap。












