访谈

Snorkel AI 的 CEO 和联合创始人 Alex Ratner – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Alex Ratner 是 Snorkel AI 的 CEO 和联合创始人,Snorkel AI 是一家源自斯坦福 AI 实验室的公司。

Snorkel AI 使得 AI 开发变得快速和实用,通过将手动 AI 开发过程转化为程序化解决方案。Snorkel AI 允许企业使用其专有数据和知识以 10-100 倍的速度开发适用于其独特工作负载的 AI。

是什么最初吸引你学习计算机科学?

计算机科学有两个令人兴奋的方面。当你年轻时,你可以通过摆弄和构建来学习得尽可能快,而不需要等待老师的反馈。另外,你可以在不需要任何人的许可下构建很多东西!

我小时候开始学习编程,正是因为这些原因。我也喜欢它所需的精确性。我喜欢将复杂的过程和例行程序抽象化,然后以模块化的方式对其进行编码。

后来,作为一名成年人,我通过一份咨询工作重新回到计算机科学领域,在那里我被要求编写脚本来对专利语料库进行一些基本分析。我对人类知识的庞大数量感到着迷——任何人曾经认为有价值的东西都可以轻松获取,但由于难以对复杂的技术文本和多模式数据进行分析,因此这些知识实际上是无法访问的。

这让我重新踏入了计算机科学的领域,最后我又回到了斯坦福大学的研究生院,专注于 NLP,即使用机器学习和人工智能处理自然语言的领域。

您最初在斯坦福大学创建并领导了 Snorkel 开源项目。可以带我们了解一下早期的经历吗?

当时,我们和行业中的许多人一样,专注于开发新的算法和——即所有“花哨”的机器学习工作,这些工作是由社区中的人们进行研究和发表论文的。

然而,我们始终致力于将这些工作与现实世界的问题联系起来——主要是与斯坦福大学的医生和科学家合作。但每当我们提出新的模型或算法时,反应都是“当然,我们会尝试,但我们需要大量标记的训练数据,我们没有时间创建!”

我们意识到,一个未被提及的重大问题是标记和策划训练数据的过程——这就是 Snorkel 项目和“数据驱动 AI”的概念如何诞生的。

Snorkel 采用了数据驱动 AI 的方法。可以解释一下这意味着什么以及它与模型驱动 AI 开发有什么不同吗?

数据驱动 AI 意味着专注于构建更好的数据以构建更好的模型。

这与模型驱动 AI 相对立,但两者可以相互补充。在模型驱动 AI 中,数据科学家或研究人员假设数据是静态的,并将精力投入到调整模型架构和参数以获得更好的结果。

研究人员在模型驱动 AI 中仍然做着很好的工作,但现成的模型和自动机器学习技术已经非常先进,以至于模型选择已经变得商品化。当这种情况发生时,提高这些模型的最佳方法是为它们提供更多更好的数据。

数据驱动 AI 方法的核心原则是什么?

数据驱动 AI 的核心原则很简单:更好的数据构建更好的模型。

在我们的学术工作中,我们称之为“数据编程”。其理念是,如果你将足够多的输入和预期输出示例提供给一个强大的模型,模型将学会复制这些模式。

这带来了比你想象中更大的挑战。绝大多数数据没有标签——或者至少没有对你的应用程序有用的标签。手动标记这些数据需要单调、时间和人力。

拥有一个标记的数据集也不能保证质量。人类错误无处不在。每个错误示例在你的基础真相中都会降低最终模型的性能。没有参数调整可以掩盖这种现实。研究人员甚至在开源数据集中发现了错误标记的记录。

可以解释一下数据驱动 AI 中“程序化”是什么意思吗?

手动标记数据带来了严重的挑战。这样做需要大量的人力,并且这些人力有时可能很昂贵。例如,医疗文档只能由医生标记。

此外,手动标记冲刺通常是单次使用的项目。标记者根据严格的模式对数据进行标记。如果业务需求发生变化,需要不同的标签,标记者必须从头开始。

数据驱动 AI 的程序化方法可以减少这两个问题。Snorkel AI 的程序化标记系统结合了来自遗留模型、现有标签、外部知识库等多种信号,以开发大规模的概率标签。我们的主要信号来源是主题专家,他们与数据科学家合作构建标记函数。这些函数将他们的专业判断编码为可扩展的规则,使得对一个决策的投入可以影响数十或数百个数据点。

该框架还具有灵活性。与其从头开始,当业务需求发生变化时,用户可以添加、删除和调整标记函数,以便在几小时内应用新标签,而不是需要几天的时间。

这种数据驱动方法如何实现未标记数据的快速扩展?

我们的数据驱动 AI 方法通过放大每个选择的影响来实现未标记数据的快速扩展。一旦主题专家建立了一个小的初始基础真相,他们就开始与数据科学家合作进行快速迭代。他们定义几个标记函数,训练一个快速模型,分析标记函数的影响,然后根据需要添加、删除或调整标记函数。

每个循环都可以提高模型的性能,直到达到或超过项目的目标。这可以将几个月的数据标记工作减少到仅几个小时。在一个 Snorkel 研究项目中,我们的两名研究人员在一天内标记了 20,000 个文档——这可能需要手动标记者十周或更长时间才能完成。

Snorkel 提供了多种 AI 解决方案,包括 Snorkel Flow、Snorkel GenGlow 和 Snorkel Foundry。这些解决方案之间有什么区别?

Snorkel AI 套件使用户能够创建标记函数(例如,在文档中查找关键字或模式),以便在几分钟内以编程方式标记数百万个数据点,而不是手动标记一个数据点。

它压缩了公司将专有数据转化为生产就绪模型并开始从中提取价值所需的时间。Snorkel AI 允许企业通过高效地整合人类判断和主题专家知识来扩展人工在循环中的方法。

这导致了更透明和可解释的 AI,使企业能够管理偏见并提供负责任的结果。

具体来说,Snorkel AI 启用了 Fortune 500 企业:

  • 开发高质量的标记数据以训练模型或增强 RAG;
  • 使用微调进行 LLM 定制;
  • 将 LLM 蒸馏成更小、更便宜的专用模型;
  • 使用预训练构建特定于域和任务的 LLM。

您写过一些开创性的论文。在您看来,您最重要的论文是什么?

其中一篇关键论文是关于“数据编程”(以编程方式标记训练数据)和 Snorkel 的原始论文。

您对 Snorkel 的未来有什么展望?

我希望 Snorkel 能成为所有认真对待 AI 的大型企业的可靠合作伙伴。

Snorkel Flow 应该成为大型企业数据科学团队的必备工具——无论他们是否为其组织的自定义大型语言模型进行微调,构建图像分类模型,还是构建简单的可部署的逻辑回归模型。

无论企业需要什么类型的模型,它们都需要高质量的标记数据来训练模型。

感谢这次精彩的采访,希望了解更多的读者可以访问 Snorkel AI

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。