访谈
Xavier Conort,FeatureByte联合创始人兼首席产品官 – 采访系列

Xavier Conort 是一位具有超过 25 年数据经验的远见卓识的数据科学家。他在保险行业开始了他的职业生涯,最初担任精算师,后来转向数据科学。他是 Kaggle 排名最高的竞争者,并且曾在 DataRobot 担任首席数据科学家,之后联合创立了 FeatureByte。
FeatureByte 致力于扩大企业 AI 的规模,通过根本性地简化和工业化 AI 数据。该特征工程和管理平台使数据科学家能够在几分钟内创建和共享最先进的特征和生产就绪的数据管道,而不是需要数周或数月。
您最初在保险行业担任精算师,后来转向数据科学,是什么原因导致了这一转变?
一个决定性的时刻是我赢得了 GE 飞行任务,一项由 GE 组织的比赛,参赛者需要预测美国国内航班的延误,奖金池为 25 万美元。我将这部分成功归功于保险行业中的一种宝贵实践:两阶段建模。这种方法有助于控制特征中的偏差,尤其是在可用的训练数据中,特征的表示不足。除了在 Kaggle 上的其他胜利外,这一成就让我相信,我的精算背景在数据科学领域给我带来了竞争优势。
在我的 Kaggle 之旅中,我还有幸与其他热情的数据科学家建立联系,包括 Jeremy Achin 和 Tom De Godoy,他们后来成为 DataRobot 的创始人。我们有一个共同的背景,即保险行业,并在 Kaggle 上取得了显著的成功。当他们最终推出了 DataRobot,一家专门从事自动机器学习(AutoML)的公司时,他们邀请我加入他们担任首席数据科学家。他们将保险行业的最佳实践与机器学习的力量相结合的愿景,激发了我创造一些创新和有影响力的东西的兴趣。
在 DataRobot,您在构建他们的数据科学路线图方面发挥了重要作用。您面临的最重要的数据挑战是什么?
我们面临的最重要的挑战是输入到我们的 AutoML 解决方案中的数据质量各异。这个问题经常导致我们团队与客户之间耗时的合作,或者如果没有得到适当的处理,在生产中会产生令人失望的结果。质量问题来自多个需要我们关注的来源。
主要挑战之一是使用商业智能工具进行数据准备和管理。虽然这些工具对于生成见解很有价值,但它们缺乏确保机器学习数据准备的点时正确性的能力。因此,训练数据中可能会发生泄漏,导致过拟合和模型性能不佳。
数据科学家和数据工程师之间的沟通不畅是另一个影响模型在生产中的准确性的挑战。训练和生产阶段之间的不一致性,源于这两个团队之间的不一致,可能会影响模型在现实世界环境中的性能。
您从这段经历中得到了什么启示?
我在 DataRobot 的经历凸显了数据准备在机器学习中的重要性。通过解决生成模型训练数据的挑战,例如点时正确性、专业知识差距、领域知识、工具限制和可扩展性,我们可以提高机器学习模型的准确性和可靠性。我得出结论,简化数据准备过程并整合创新技术将在解锁 AI 的全部潜力和兑现其承诺方面发挥重要作用。
我们也听说了您联合创始人 Razi Raziuddin 关于 FeatureByte 背景故事的介绍,您能否分享您对这些事件的看法?
当我与我的联合创始人 Razi Raziuddin 讨论我的观察和见解时,我们意识到我们对数据准备中机器学习的挑战有着共同的理解。在我们的讨论中,我与 Razi 分享了我对 MLOps 社区最近进展的见解。我观察到特征存储和特征平台的出现,这些平台被 AI 第一技术公司用来减少特征服务的延迟,鼓励特征重用或简化特征转化为训练数据,同时确保训练和服务的一致性。然而,很明显,仍然存在一个满足数据科学家需求的差距。Razi 与我分享了他对现代数据栈如何彻底改变商业智能和分析,但并没有被充分利用以支持 AI 的见解。
很明显,Razi 和我都有机会通过根本性地简化特征工程过程,并为数据科学家和机器学习工程师提供正确的工具和用户体验,从而对数据科学和机器学习产生重大影响,实现无缝的特征实验和特征服务。
您在从数据科学家转变为企业家的过程中面临的最大挑战是什么?
从数据科学家转变为企业家需要我从技术角度转变为更广泛的商业导向的思维方式。虽然我在理解痛点、创建路线图、执行计划、建立团队和管理预算方面有着坚实的基础,但我发现,打造出真正引起目标受众共鸣的信息是我的最大障碍之一。
作为一名数据科学家,我的主要重点始终是分析和解释数据以得出有价值的见解。然而,作为一名企业家,我需要将我的思维转向市场、客户和整体业务。
幸运的是,我能够通过利用像我的联合创始人 Razi 的经验来克服这个挑战。
我们听说了 Razi 关于特征工程为什么如此困难的看法,您认为是什么使其如此具有挑战性?
特征工程有两个主要挑战:
- 转换现有列:这涉及将数据转换为机器学习算法可以接受的格式。使用诸如 one-hot 编码、特征缩放和高级方法(如文本和图像转换)等技术。从现有特征创建新特征(如交互特征)可以显著提高模型性能。像 scikit-learn 和 Hugging Face 这样的流行库为此类特征工程提供了广泛的支持。自动机器学习解决方案也旨在简化此过程。
- 从历史数据中提取新列:历史数据在推荐系统、营销、欺诈检测、保险定价、信用评分、需求预测和传感器数据处理等问题领域至关重要。从这些数据中提取信息列是一个挑战。例如,自上次事件以来经过的时间、最近事件的聚合以及从事件序列中提取的嵌入。这种特征工程需要领域专业知识、实验、强大的编码和数据工程技能以及深厚的数据科学知识。需要考虑的因素包括时间泄漏、处理大型数据集以及高效的代码执行。
总体而言,特征工程需要专业知识、实验和在没有专门为此设计的工具的情况下构建复杂的特定数据管道。
您能否分享 FeatureByte 如何简化特征管道同时赋予数据科学专业人员权力?
FeatureByte 通过简化整个特征工程过程来赋予数据科学专业人员权力。使用直观的 Python SDK,数据科学家可以快速创建和提取来自大型事件表和项目表的特征。计算由 Snowflake、DataBricks 和 Spark 等数据平台的可扩展性高效处理。笔记本电脑促进实验,而特征共享和重用节省时间。审计确保特征准确性,而立即部署消除了管道管理的烦恼。
除了我们开源库提供的功能外,我们的企业解决方案提供了一个用于大规模管理和组织 AI 操作的综合框架,包括治理工作流和特征目录的用户界面。
您对 FeatureByte 未来的愿景是什么?
我们对 FeatureByte 的最终愿景是通过赋予用户解锁其数据资产的全部创造力和从中提取前所未有的价值来革新数据科学和机器学习领域。
我们特别兴奋地看到生成式 AI 和变换器的快速进展,这为我们的用户开启了一个全新的可能性世界。另外,我们致力于使特征工程民主化。生成式 AI 有潜力降低创造性特征工程的进入门槛,使其更容易被更广泛的受众接受。
总之,我们对 FeatureByte 未来的愿景围绕着持续创新、利用生成式 AI 的力量和使特征工程民主化。我们旨在成为数据专业人员的首选平台,使他们能够将原始数据转化为机器学习的可行输入,推动各个行业的突破和进步。
您对有志于成为 AI 企业家的建议是什么?
定义您的空间,保持专注,并欢迎新颖性。
通过定义您想要拥有的空间,您可以区分自己并在该领域建立强大的存在感。研究市场,了解潜在客户的需求和痛点,并努力提供一种独特的解决方案来有效地解决这些挑战。
定义您的长期愿景,并设定清晰的短期目标与该愿景保持一致。专注于打造坚实的基础,并在您选择的空间中提供价值。
最后,虽然保持专注很重要,但不要害怕在定义的空间内接受新颖和探索新想法。AI 领域不断演变,创新方法可以带来新的机会。
感谢这次精彩的采访,希望了解更多的读者可以访问 FeatureByte。












