访谈
Seek AI创始人兼CEO萨拉·纳吉 – 采访系列

萨拉·纳吉是Seek AI的创始人兼CEO,Seek AI是一款平台,允许业务最终用户在Slack、Teams和电子邮件中直接向Seek提问,而无需“润饰”他们的问题,也无需学习新的平台。
您最初作为一名研究员,使用哈勃太空望远镜的数据。您当时在研究什么?
我当时在加州大学洛杉矶分校和加州理工学院进行研究,研究一些最遥远的星系,这些星系可以用望远镜观察到,我正在分析它们的一些属性,例如它们的质量和大小。这个研究的目的是帮助我们了解遥远星系和靠近我们自己的星系之间的差异,并开发出这些星系随时间形成的模型。
然后,您在各个初创公司担任数据科学家。有些更有趣的项目是什么?
一个让我印象深刻的项目涉及使用自然语言处理(NLP)来分类与零售商品相关的非结构化文本。例如,取原始文本(例如“air jordans green”)并将其标记为预估品牌(“Nike”)。我有一个同事专门从事NLP,他当时正忙于另一个项目,所以这个项目最终被交给了我,因为他很忙。我当时对NLP一无所知,所以我参加了斯坦福大学和Fast.ai的免费课程来提高我的知识。我真的很喜欢学习NLP,并开始了解为什么它如此重要,以及为什么人工智能(AI)能够理解语言是通往所谓的“通用AI”的一个重要步骤。这个经历绝对让我能够快速理解GPT-3的重要性,当它第一次发布时。
您能分享一下Seek AI的创立故事吗?
当OpenAI的GPT-3模型发布时,我立即认识到这是一个多么了不起的进步,并对涉及GPT-3编写代码的应用感到特别兴奋。毕竟,我每天都在编写代码,而看到AI也在编写代码——并且生成完美的代码——真是令人惊讶。我会将我对GPT-3的反应与2013年第一次了解VR时的反应相比,这也是我经历过的另一个令人惊讶的时刻。我最终决定我需要创建一个初创公司来押注这项技术。我当时还不知道我要建造什么,但我有一种直觉,如果我能更多地了解这些模型,一些有价值的东西就会出现。
一旦我真正了解了这些模型,我就意识到我可以解决我在每个地方工作时作为量化分析师或数据科学家遇到的一个痛点。这个痛点是商业人员没有合适的工具来回答自己的数据问题。作为一名数据科学家,我经常会因业务方面的同事对数据有疑问而被打断,这迫使我停止正在做的事情。这个过程看起来很古老,也很低效。我意识到,如果我专注于利用这项新技术来解决这个问题,它将是解决这个非常重要和普遍问题的开创性解决方案。
Seek AI使用生成式AI。您能向我们的读者解释一下这是什么吗?
“生成式AI”是一个非常热门的流行词,但与其他流行词不同,我认为这种热度是有道理的。这个术语指的是具有数百亿个参数的大型机器学习模型,例如Open AI的DALL-E和GPT-3。这些模型的创新之处在于它们可以理解自然语言并生成文本、图像、代码等。如果您曾经玩过DALL-E或Stable Diffusion,您将很快理解为什么这些模型如此热门;它们具有令人难以置信的人类般的能力,可以理解自然语言命令,并可以生成与最好的人类艺术家相媲美的艺术品。
代码生成是生成式AI最为小众但最重要的应用之一。数据变得越来越大,越来越复杂,因此对于人类来说,手动分析和组织数据变得越来越困难。然而,这些数据中包含了大量信息。这些信息不仅对组织有用,而且还可以在学术界带来令人难以置信的科学突破。构建AI以从数据中提取价值将会解锁大量有用的信息。
Seek AI正在构建一个允许用户使用自然语言与数据交互的界面。知识工作者可以通过电子邮件、Slack、短信和一系列客户关系管理(CRM)系统访问Seek AI的自然语言界面。
Seek AI还使用了哪些类型的机器学习?
虽然生成式AI是我们机器学习架构的一部分,但我们的架构还包括几个开源深度学习模型的分支。变换器模型(其中“生成式AI”是一种变体)构成了Seek使用的许多(但不是所有)模型。
为什么非技术用户能够快速访问数据如此重要?
如果数据不能产生投资回报率,那么数据又有什么用呢?如果业务用户无法访问数据,那么业务又如何从中获得投资回报率呢?这就是为什么为尽可能多的人提供访问权限而不损害准确性至关重要的原因。
当我还是一名数据科学家时,我经常会收到来自CEO的请求,要求我分析一些数据以帮助公司的产品或营销策略。这些项目可能需要几周甚至更长时间。作为一名CEO,我现在比当时作为数据科学家时更深入地理解这些项目的重要性。我经常希望自己能够直接获取数据,以便更快地做出决定。这就是我们在Seek解决的问题。
Seek AI如何使数据如此容易检索?
值得思考的是,数据实际上只能通过代码进行分析。虽然有一些平台是对代码的抽象(例如数据仪表盘),但在这些平台的底层,有数据分析师手动编写的代码,使数据能够呈现给业务用户。
大多数知识工作者不知道如何编码,不想编码,或者根本无法访问数据,即使他们想编码来分析数据。当他们需要数据时,他们要么需要在仪表盘中找到它,要么需要向数据团队询问如果找不到。随着数据集的增长,这种情况会更加频繁地发生。
因此,数据团队需要成为自然语言问题和数据本身的“翻译者”,他们使用代码来查询数据。消除这种“翻译者”中间人的角色是Seek正在做的事情的核心。
企业如何确保他们使用的数据是准确的?
管理数据准确性和可访问性之间的权衡是一个巨大的挑战。正如我在最近的一次采访中所说,一方面,可访问性允许不太懂技术的人开始与公司数据的知识库进行交互。另一方面,一个被污染的知识库(即坏数据)又有什么用呢?
最好的数据团队是那些能够以最优的方式管理这种权衡的团队,管理这种权衡的一个重要部分是仔细校准和验证非技术用户可以与之交互的任何工具。
Seek AI平台的一些用例示例是什么?
我们已经为B2B SaaS、金融科技、消费品和B2C电子商务等领域的客户和设计合作伙伴提供了价值。
例如,Battlefin是替代金融数据集的领先市场。他们认为快速、准确地回答客户的问题是他们与竞争对手之间的区别。该公司的CEO蒂姆·哈林顿(Tim Harrington)指出,“Seek AI在我们的2023年战略中发挥了至关重要的作用,因为它使我们能够快速、准确地回答客户的问题,并分析我们2400多个数据集。我估计我们使用Seek AI的投资回报率大约是10倍,如果没有这个平台,我们将需要花费更多的钱来实现同样的效率。”
您还想分享关于Seek AI的其他信息吗?
这可能是适合做一个无耻的宣传的地方。Seek目前正在为我们的平台提供免费试用,可以在seek.ai上访问。我们很高兴能够成为将生成式AI带给数据团队的先驱之一,我期待着与我们的客户一起踏上这段旅程。
感谢这次精彩的采访,希望了解更多的读者可以访问Seek AI。












