访谈
阿斯特罗诺默公司数据与人工智能高级副总裁史蒂文·希利恩 – 采访系列

史蒂文·希利恩是阿斯特罗诺默公司的数据与人工智能高级副总裁,他在那里利用自己在研究数学方面的广泛学术背景和在硅谷机器学习平台开发方面的15年经验。 在阿斯特罗诺默公司,他领导了为机器学习和人工智能团队创建的Apache Airflow功能的开发,并监督内部数据科学团队。 在他的领导下,阿斯特罗诺默公司推进了其现代数据管弦平台,显著增强了其数据管道功能,以支持通过机器学习处理各种数据源和任务。
您能否分享一些关于您在数据科学和人工智能方面的经历,以及它如何塑造您领导工程和分析团队的方法?
我在伯克利大学有研究数学的背景,然后我搬到硅谷,在一系列成功的初创公司工作。 我很高兴离开学术界的政治和官僚主义,但我发现自己几年后又怀念数学。 所以我转向开发机器学习和分析平台,这基本上是我从那时起一直做的事情。
我的纯数学训练使我更喜欢数据科学家所说的“简单性”——适合工作的工具,不多不少。 由于数学家倾向于喜欢优雅的解决方案而不是复杂的机器,我总是尝试在将机器学习应用于商业问题时强调简单性。 深度学习对于某些应用程序很好——例如,大型语言模型非常适合总结文档——但有时简单的回归模型更合适,也更容易解释。
过去二十年来,数据科学家和软件工程师的角色变化非常有趣。 我曾经同时担任这两个角色,所以我非常清楚软件开发生命周期(特别是自动化和测试)在机器学习项目中的重要性。
在人工智能和大型语言模型(LLM)中处理、处理和分析非结构化数据的最大挑战是什么?
在生成式人工智能的世界中,您的数据是最有价值的资产。 模型越来越多地被商品化,因此您的区别在于您获得的所有机构知识,这些知识被捕获在您的专有和策划的数据集中。
将正确的数据在正确的时间交付给正确的人,对数据管道提出了很高的要求——这适用于非结构化数据,就像结构化数据一样,或者更是如此。 您经常从多个不同来源、多种不同格式中获取数据。 您需要访问各种方法来解包数据并使其准备好用于模型推理或模型训练。 您还需要了解数据的来源以及它最终的去向,以便“展示您的工作”。
如果您只偶尔这样做以训练一个模型,那是可以的。 您不一定需要使其运作。 但是,如果您每天使用该模型来了解客户在在线论坛上的情绪,或者总结和路由发票,那么它就开始看起来像任何其他运营数据管道一样,这意味着您需要考虑可靠性和可复制性。 或者,如果您定期对模型进行微调,那么您需要担心监控准确性和成本。
好消息是数据工程师已经开发了一个很好的平台——Airflow,用于管理数据管道,这已经被世界上一些最先进的机器学习团队成功应用于管理模型部署和监控。 所以模型可能是新的,但管弦乐并不是。
您能否详细说明使用合成数据来微调较小模型以提高准确性的方法?这与训练较大模型相比如何?
这是一个强大的技术。 您可以将最好的大型语言模型视为某种方式来封装它们对世界的了解,并将其传递给较小的模型,方法是生成合成数据。 大型语言模型封装了从广泛的数据集训练中学习到的大量知识。 这些模型可以生成合成数据,捕捉它们学习到的模式、结构和信息。 然后可以使用此合成数据来训练较小的模型,有效地将较大模型的一些知识转移到较小的模型中。 此过程通常被称为“知识蒸馏”,有助于创建高效、较小的模型,在特定任务上仍然表现良好。 并且使用合成数据,您可以避免隐私问题,并填补训练数据中的小或不完整的空白。
这对训练更具领域特征的生成式人工智能模型可能很有帮助,甚至可以比训练“更大”的模型更有效,具有更大的控制力。
数据科学家已经使用合成数据一段时间了,插补也存在于混乱的数据集出现以来。 但是您总是需要非常小心,不要引入偏差或对数据分布做出错误的假设。 现在合成数据更容易、更强大,您需要更加小心。 错误可能会被放大。
生成数据的缺乏多样性可能会导致“模型崩溃”。 模型认为它做得很好,但那是因为它没有看到完整的图景。 更一般地说,训练数据中缺乏多样性是数据团队应该始终注意的事情。
在基础水平上,无论您使用合成数据还是有机数据,数据的血统和质量对于训练或微调任何模型都是至关重要的。 正如我们所知,模型的质量只有其训练数据的质量那么好。 虽然合成数据可以成为一种很好的工具,帮助代表敏感数据集而不暴露它,或者填补可能缺失的代表性数据集的空白,但您必须有一个纸质记录,显示数据来自哪里,并能够证明其质量水平。
阿斯特罗诺默公司的团队正在实施哪些创新技术来提高数据管道的效率和可靠性?
有很多! Astro的完全托管的Airflow基础设施和Astro Hypervisor支持动态扩展和通过高级健康指标进行主动监控。 这确保资源被有效利用,并且系统在任何规模下都可靠。 Astro提供强大的数据中心警报,具有可自定义的通知,可以通过各种渠道发送,例如Slack和PagerDuty。 这确保了及时干预,以防止问题升级。
数据验证测试、单元测试和数据质量检查在确保数据管道和最终为业务提供动力的数据的可靠性、准确性和效率方面发挥着至关重要的作用。 这些检查确保您在快速构建数据管道以满足截止日期的同时,主动捕获错误,改善开发时间,并减少后台中的意外错误。 在阿斯特罗诺默公司,我们构建了工具,如Astro CLI,帮助无缝地检查代码功能或识别数据管道中的集成问题。
您如何看待生成式人工智能治理的演变,以及应该采取什么措施来支持创建更多工具?
治理对于生成式人工智能应用程序的成功至关重要。 这一切都与透明度和可复制性有关。 您是否知道如何获得此结果,从哪里获得,以及由谁获得? Airflow本身已经为您提供了一种方法来查看个别数据管道正在执行什么。 其用户界面是其早期被广泛采用的原因之一,在阿斯特罗诺默公司,我们通过跨团队和部署的可见性增强了它。 我们还为客户提供了报告仪表板,提供了有关平台使用情况、性能和成本归因的全面见解,以便做出明智的决策。 此外,Astro API使团队能够以编程方式部署、自动化和管理其Airflow管道,减轻了手动过程的风险,并确保在管理多个Airflow环境时实现无缝操作。 线性功能集成到平台中。
这些都是朝着帮助管理数据治理的步骤, 我相信各大小企业都认识到数据治理对于确保人工智能应用中的信任至关重要。 这种认识和意识将在很大程度上推动对数据治理工具的需求,我预计随着生成式人工智能的普及,创建这些工具的速度将会加快。 但是它们需要成为更大的管弦乐栈的一部分,这就是为什么我们将其视为我们构建平台的基本组成部分。
您能否提供阿斯特罗诺默公司解决方案如何提高客户的运营效率和生产力的例子?
生成式人工智能流程涉及复杂且计算密集的任务,需要仔细优化和重复执行。 Astro,阿斯特罗诺默公司的托管Apache Airflow平台,提供了一个框架,以帮助简化这些任务并增强快速创新能力。
通过编排生成式人工智能任务,企业可以确保计算资源被有效利用,工作流被优化并实时调整。 这在需要频繁更新或重新训练生成式模型的环境中尤为重要,基于新的数据。
通过利用Airflow的工作流管理和阿斯特罗诺默公司的部署和扩展能力,团队可以花费更少的时间管理基础设施,并将注意力集中在数据转换和模型开发上,这可以加速生成式人工智能应用的部署并提高性能。
通过这种方式,阿斯特罗诺默公司的Astro平台帮助客户在广泛的用例中提高了生成式人工智能的运营效率,例如电子商务产品发现、客户流失风险分析、支持自动化、法律文件分类和总结、从客户评论中获取产品见解以及动态集群预配用于产品图像生成。
阿斯特罗诺默公司在提高人工智能和机器学习应用的性能和可扩展性方面扮演什么角色?
可扩展性是2024年企业在人工智能中面临的重大挑战。 当从原型转移到生产时,用户希望其生成式人工智能应用程序可靠且高性能,并且它们产生的输出是值得信赖的。 这需要以一种具有成本效益的方式完成,并且所有规模的企业都需要能够利用其潜力。 为此,通过使用阿斯特罗诺默公司,任务可以水平扩展以动态处理大量数据源。 Astro可以弹性扩展部署和它们所在的集群,并且具有专用机器类型的队列任务执行提供了更大的可靠性和计算资源的有效利用。 为了帮助解决成本效率问题,Astro提供了缩放至零和休眠功能,有助于控制成本并降低云支出。 我们还提供了对平台成本的完整透明度。 我自己的数据团队每天为客户生成报告,显示他们的使用情况。
您对人工智能和数据科学的未来趋势有什么看法,阿斯特罗诺默公司如何为这些趋势做准备?
可解释性人工智能是一个非常重要和有趣的发展领域。 能够窥视大型模型的内部工作原理几乎有些令人毛骨悚然。 我也很感兴趣地看到社区如何解决模型训练和调优的环境影响。 在阿斯特罗诺默公司,我们继续用所有最新的集成更新我们的注册表,以便数据和机器学习团队可以连接到最佳的模型服务和最有效的计算平台,而无需进行任何繁重的工作。
您如何看待高级人工智能工具(如LLM)与传统数据管理系统集成的未来发展?
我们已经看到Databricks和Snowflake最近宣布了如何在各自平台中纳入LLM的使用和开发。 其他DBMS和机器学习平台也会这样做。 很高兴看到数据工程师可以轻松访问如此强大的方法,直接从命令行或SQL提示符。
我特别感兴趣的是关系数据库如何集成机器学习。 我一直在等待机器学习方法被纳入SQL标准,但不知为何,这两个学科从未真正合作过。 也许这次会有所不同。
我对大型语言模型在未来能够帮助数据工程师的工作感到非常兴奋。 首先,LLM在代码生成方面已经非常成功,尽管早期为数据科学家提供AI驱动的建议的尝试成果参差不齐:例如,Hex很棒,而Snowflake到目前为止还不令人印象深刻。 但是,有巨大的潜力可以改变数据团队的工作性质,远远超过开发人员。 为什么? 对于软件工程师,提示是一个函数名或文档,但对于数据工程师,还有数据。 模型可以与之合作的上下文如此之多。
您会给希望在行业中产生影响的有志数据科学家和人工智能工程师什么建议?
通过实践来学习。 构建应用程序如此简单,并且可以用人工智能进行增强。 所以,构建一些很酷的东西,并将其发送给您钦佩的公司的朋友。 或者,将其发送给我,我保证会看一看!
诀窍是找到您热衷的东西,并找到一个好的相关数据来源。 我的一个朋友对异常棒球赛季进行了令人着迷的分析,可以追溯到19世纪,并揭露了一些值得拍成电影的故事。 而阿斯特罗诺默公司的工程师最近在一个周末聚集在一起,构建了一个自愈数据管道的平台。 我不敢想象几年前就能做到这一点,但是在短短几天的努力后,我们赢得了Cohere的黑客马拉松,并为我们的平台打下了一个重要新功能的基础。
感谢这次精彩的采访,希望了解更多的读者可以访问阿斯特罗诺默公司。












